llms.txtの検証について
検証対象
llms.txtの形式はシンプルです。サイト名を記載したH1、任意の概要ブロック引用、その後に、名前、URL、説明で構成されたMarkdownリンクリストを本文とするH2セクションが続きます。
厳密に必須とされるものがほとんどないため、ファイルは完全に有効であっても、価値がほとんどない場合があります。見出しが1つとリンクだけの内容でも、構造上のテストにはすべて合格しますが、アシスタントに伝わる情報は何もありません。
そこで、このツールでは2つの問題を分けて扱います。エラーはフォーマットを壊すもの、提案はファイルを役立たないものにする要因です。
フォーマットを壊すもの
- H1見出しがない。H1は実際に必須となる唯一の行です。
- H1が複数あり、サイト名が曖昧になる。
- Markdownリンクではないリスト項目。
- 角括弧の間にテキストがないリンク。
- 相対パスは、ファイルがサイト外で読み込まれると曖昧になります。
これを用意する価値が生まれる要素
- 概要の一文。読者がリンクを読む前に、そのサイトがどのようなものか把握できます。
- セクション見出し。各リンクがサイト内のどの部分に属するかが分かります。
- 各リンクの説明。名前を繰り返すのではなく、そのページに何があるかを示します。
- 簡潔さ。数百ものリンクがあるファイルはサイトマップであり、キュレーションこそが目的だからです。
ここでは説明が大部分の役割を担います。単に一覧に載せるのではなく、特定の質問に対してページを選択可能にするのが説明です。
このツールがチェックする項目
ドメインを入力すると、/llms.txt を取得してファイルを読み取り、構造上のエラーと品質に関する提案を分けて報告するとともに、ファイルの内容の概要も表示します。
また、サーバーがファイルの代わりに通常のページを 200 ステータスで返すソフト 404 のケースも検出します。これはブラウザでは成功したように見えるため、最も一般的な誤検出の原因です。
各リンク先を個別に取得するのではなく、公開されているファイルの内容を読み取るため、記載されたページがその後移転していても、ここでは問題として検出されません。
次に行うこと