XMLサイトマップの検証について
サイトマップを検証するとはどういう意味ですか?
XMLサイトマップの検証とは、ファイルが整形式であり、サイトマッププロトコルに準拠していることを確認することです。具体的には、正しいXML構文、想定される名前空間、適切に構造化されたURLエントリ、仕様で定められた形式の日付などを確認します。
これは、記載されているページに対する評価ではなく、構造上のチェックです。サイトマップ内の100個のURLがすでに存在しなくても、サイトマップ自体は完全に検証を通過することがあります。一方で、記載されているすべてのページに問題がなくても、エスケープされていないアンパサンドが1つあるだけで検証に失敗する可能性があります。
XMLサイトマップの検証が重要なのは、失敗が気づかれないまま全面的に起こる可能性があるためです。形式が不正なファイルは一部だけ読み込まれるのではなく、拒否されます。そのため、クローラーを誘導していると思っていたサイトマップが、実際にはまったく機能していない可能性があります。
2026でもサイトマップの検証は重要ですか?
サイトマップをプログラムで生成しているサイト、つまり現在ではほとんどのサイトにとって、特に重要です。プラグイン、ビルド処理、カスタムスクリプトなどがファイルを生成し、問題が起きるまで誰も再確認しないからです。
一般的な原因はありふれたもので、見落としやすいものです。クエリパラメータを含むURL内のエスケープされていない文字、誤った形式の日付、サイズ制限を超えたファイル、またはドキュメントの先頭に紛れ込んだバイトオーダーマーク(BOM)などが挙げられます。
生成が自動化されているため、一度入り込んだ不具合はそのまま残りがちです。プラットフォームの変更後や移行後に検証を行えば、最も大きなコストにつながるこの問題のバージョンを見つけられます。
サイトマップの検証とAI検索の関係
AIクローラーは検索クローラーと同じようにサイトマップを検出に利用するため、ファイルが拒否されると、両者にとっての近道が同時に失われます。
最終更新日もここでは重要であり、特に形式が不正になっていることの多い項目です。パーサーが読み取れない日付は、実質的に送信していないのと同じ鮮度シグナルです。鮮度によって、どのソースが使用されるかがますます決まる分野では、これは大きな問題です。
大規模なサイトでは、壊れたサイトマップがあると、ディスカバリーは完全に内部リンクのたどり方に依存することになります。そして、リンクが不十分なページは読まれないままになります。
よくあるサイトマップのエラー
- エスケープされていない文字。特に、パラメータを含むURL内のアンパサンド。
- 必須のW3C形式に従っていない日付。
- XML名前空間の宣言がない、または正しくない。
- 1つのファイルに50,000件を超えるURLまたは非圧縮で50MBを超えるデータを含め、サイトマップインデックスで分割していない。
- 絶対URLが必要な箇所で相対URLを使用している。
- XML宣言の開始前にバイトオーダーマーク(BOM)や余分な空白文字がある。
サイトマップのベストプラクティス
- プラットフォーム、テンプレート、または生成スクリプトを変更した後は、必ず検証する。
- 200ステータスを返す、正規かつインデックス可能なURLのみを含めます。
- ビルドのたびにリセットせず、最終更新日を正確に保つ。
- robots.txtからサイトマップを参照し、Search Consoleに送信します。
- 送信済みとインデックス登録済みの数値を確認する。差が広がっている場合、通常はファイルの問題ではなくコンテンツの問題である。
XMLサイトマップバリデーターを使用する
サイトマップのアドレスを入力すると、XMLサイトマップバリデーターが取得して解析し、正しく構成されているかどうか、検出したエラーとそのエラーが発生している行を報告します。
合格とは、そのファイルが読み込まれることを意味します。ファイル内のURLが正しいことを意味するものではないため、別途確認する価値があります。特に移行後は、正しいサイトマップでも、現在は解決できないアドレスを一式すべて記載してしまう可能性があります。
次に行うこと