使い方
URLを集める
- サイトのURLを1つ入れます。トップページでも、途中のページでも構いません。
- 「URLを集める」を押します。
- robots.txt を読み、そこに書かれた sitemap.xml を順にたどります。
- サイトマップインデックスだった場合は、その先の子サイトマップも読みます(3階層まで)。
robots.txt にサイトマップの記載が無い場合は、よくある置き場所を順に試します。試した場所と結果は画面に出るので、どこで見つかったのかが分かります。
sitemap.xml のURLが分かっている場合は、それを直接入れてください。robots.txt を探さずに、そのファイルから読み取ります。
絞り込む
取れたURLは、その場で絞り込めます。条件を変えると一覧・内訳・書き出しの内容がすぐ切り替わります。
- 含む文字列 / 除く文字列
- URLの一部と部分一致します。カンマで区切ると複数を指定できます。「含む」はいずれかに一致、「除く」はいずれかに一致したら外すという動きです。大文字小文字は区別しません。
- 更新日の範囲
- サイトマップの
lastmodで絞ります。lastmod が入っていないURLは、日付で絞ると外れます。 - 更新日が入っていないURLだけを見る
- lastmod が抜けているページを洗い出せます。サイトマップの整備状況の確認に使えます。
持ち出す
- 一覧をコピー:絞り込んだ全件をクリップボードへ入れます。
- テキストで保存:1行1URLのテキストファイルです。
- CSVで保存:URL・lastmod・changefreq・priority・取得元サイトマップの5列です。Excelで開いても文字化けしません。
画面に出るのは先頭2,000件までですが、保存とコピーは絞り込んだ全件が対象です。
次の作業へそのまま渡す
「このまま次の作業へ」から、絞り込んだ一覧を別のツールへ渡せます。貼り直す必要はありません。
- メタ情報を一括で点検する:各URLを実際に取得して、title・description・canonical・noindex・h1・リダイレクトを表にします。一度に300件までのため、それを超える場合は先頭300件だけを渡します。
- タイトルと説明文を点検する:検索結果での見え方を、ピクセル幅で確認します。
受け渡しはこの端末の中だけで行われます。サーバーにも他の端末にも渡りません。渡した内容は30分で無効になります。
読み取りの上限
- 1ファイルにつき8MBまで。超えた場合は打ち切り、その旨を表示します。
- たどるサイトマップは60件まで。
- URLは50,000件まで。
- 取得の回数には、同じ回線からの上限があります。上限に達した場合は、しばらく空けてからお試しください。
うまくいかないとき
- 「サイトマップが見つかりませんでした」と出る
- そのサイトに sitemap.xml が無いか、想定外の場所にあります。場所が分かっていれば、そのURLを直接入れてください。無い場合はサイトマップ生成ツールで巡回して作れます。
- 「robots.txt で取得が禁止されています」と出る
- そのサイトの robots.txt が、当ツールの取得を禁止しています。サイトの管理権限をお持ちであれば、robots.txt の設定をご確認ください。
- 件数が実際のページ数より少ない
- サイトマップに載っていないページは出てきません。サイトマップ自体が最新でない可能性があります。
.gzのサイトマップを読ませたい- 現時点では対応していません。非圧縮の
.xmlをご指定ください。