AIクローラーのブロックについて
どのクローラーを指していますか?
AI企業は独自の名称付きクローラーを運用しており、これらは既にご存じの検索クローラーとは別のものです。GPTBotとOAI-SearchBotはOpenAI、ClaudeBotはAnthropic、PerplexityBotはPerplexityに属し、Google-ExtendedはGeminiのトレーニングに関する制御を行います。また、CCBotは、多くのモデルの学習元となっているCommon Crawlにデータを提供します。
これらのクローラーはいずれも通常どおりrobots.txtに従うため、ユーザーエージェントを指定したルールによって、サイトを読み取れるかどうかが決まります。このチェッカーはrobots.txtを読み取り、これらのクローラーがブロックされているかどうかを報告します。
ブロックされていることが自動的に誤りとは限りません。それは意思決定であり、確認する目的は、その判断が意図したものだったかを確かめることです。
サイトが意図せずクローラーをブロックしてしまう理由
よくある原因は、包括的なルールです。スクレイパーを締め出すために作成された広範な拒否ルールを含む robots.txt によって、これらのクローラーまでブロックされてしまいますが、そうなったことを知らせるものはありません。
2つ目の原因は、継承です。多くのホスティングサービス、セキュリティプラグイン、CDN設定では、2023年から2024年にかけてAIクローラーのブロックがデフォルトで追加され、サイト運営者が選択していないにもかかわらず、その設定を取り込んでしまいました。
3つ目は、その当時としては正しい判断でした。懸念がトレーニングデータだったときに追加したブロックが、現在では引用のためにページが読み取られることも防いでいますが、これは別のトレードオフです。
考える価値のあるトレードオフ
これらのクローラーが行うことには、明確に異なる2つの種類があり、分けて考える価値があります。モデルのトレーニングのためにコンテンツを取得するものもあれば、現在尋ねられている質問に回答し、出典を引用するためにページを取得するものもあります。
2種類目をブロックすると、競合他社が表示される回答からあなたのサイトが外れることになります。1種類目をブロックするのは、コンテンツ自体が商品であるパブリッシャーにとっては妥当な判断です。
ユーザーエージェントがこの理由から個別に文書化されているため、引用元となるクローラーは許可し、コンテンツを消費するだけのクローラーは拒否できます。
2026年にこれは重要でしょうか?
調査のより大きな割合がアシスタント内で行われるようになるにつれて、その重要性は毎年増しています。取得できないページは引用されることがなく、発生していても、それを知らせてくれるランキングレポートはありません。
この非対称性があるからこそ、思い込みで判断せず、確認する価値があります。クローラーを許可しておけば、後から考えが変わってもコストはかかりません。一方、意図せず引き継がれたルールによって1年間存在を認識されないままでいると、その間に気づくこともなく、大きな損失につながります。
このツールがチェックする項目
robots.txtを取得し、主要なAIクローラーによるサイトの読み取りを妨げるルールを確認して、ブロックされているクローラーを報告します。
公開されているファイルを読み取るため、プラグインやCDNによって追加されたルールも、自分で記述したルールと同じように表示されます。意図していないブロックがある場合は、まずそこを確認してください。
次に行うこと
クロールアクセスはいくつかある関門の最初の1つです。
検索エンジン が同じファイルによってブロックされていないかを確認し、
robots.txt ファイル全体を見直して、読む価値のあるページを示す
llms.txt ファイルを公開していることを確認してください。