Tentang llms.txt
Apa itu llms.txt?
File llms.txt adalah dokumen markdown singkat di root situs Anda, di /llms.txt, yang mengarahkan model bahasa ke halaman-halaman yang layak dibaca dan menjelaskan dalam satu baris cakupan masing-masing halaman. File ini diusulkan oleh Jeremy Howard dari Answer.AI pada akhir 2024.
Masalah yang ditanganinya memang nyata. Model yang membaca halaman web modern akan menemukan navigasi, pemberitahuan cookie, widget postingan terkait, dan markup yang mengelilingi sejumlah kecil konten sebenarnya, sementara model tersebut memiliki jendela konteks yang terbatas. Daftar halaman bersih yang telah dikurasi beserta deskripsinya merupakan titik awal yang jauh lebih baik daripada perayapan seluruh situs.
Formatnya sengaja dibuat sederhana: judul, ringkasan opsional, lalu beberapa bagian berjudul yang berisi tautan beranotasi. Itulah keseluruhan spesifikasinya, dan generator llms.txt di atas menghasilkan struktur tersebut persis.
Seperti apa bentuk file tersebut
- H1 dengan nama situs atau proyek. Ini adalah satu-satunya baris yang wajib ada.
- Blok kutipan opsional yang merangkum situs dalam satu kalimat.
- Prosa opsional yang memberikan konteks apa pun yang perlu diketahui pembaca terlebih dahulu.
- Bagian H2, masing-masing berupa daftar tautan dalam format Markdown yang ditulis sebagai nama, URL, dan deskripsi singkat.
- Bagian opsional dengan judul "Optional", untuk tautan yang dapat dilewati ketika ruang terbatas.
File pendamping, llms-full.txt, berisi teks lengkap halaman-halaman tersebut secara langsung, bukan melalui tautan. File ini membutuhkan komitmen pemeliharaan yang lebih besar dan sebaiknya ditunda hingga versi singkatnya mulai memberikan manfaat bagi Anda.
Standar yang sedang dalam proses diadopsi
llms.txt masih baru dan berada pada tahap ketika para penerbit menjadi pihak yang lebih dahulu mengadopsinya. Situs dokumentasi menggunakannya sejak awal, dukungan telah tersedia di berbagai framework dan alat yang terus bertambah, dan jumlah situs yang menerbitkan file ini terus meningkat.
Penyedia AI belum membuat komitmen publik untuk membacanya, yang merupakan hal wajar untuk sebuah konvensi yang masih baru—hal yang sama juga berlaku pada peta situs XML dan data terstruktur sebelum keduanya menjadi hal yang rutin.
Itu menjadikannya langkah awal yang masuk akal. Penulisannya hanya memerlukan waktu satu sore, tidak memerlukan biaya untuk mempertahankannya, dan menyiapkannya sebelum dukungan ditetapkan lebih bermanfaat daripada menunggu hingga benar-benar yakin.
Ciri-ciri yang baik
Deskripsi melakukan tugasnya. “Harga” tidak memberi tahu model apa pun yang tidak dapat disimpulkannya dari URL, sedangkan “Tingkatan harga, apa saja yang termasuk dalam setiap tingkatan, dan bagaimana penggunaan dihitung” menjelaskan apa yang sebenarnya ada di halaman dan membuatnya dapat dipilih untuk pertanyaan tertentu.
Bersikaplah selektif juga. File yang mencantumkan empat ratus URL adalah sitemap dengan langkah tambahan, dan itu menggagalkan tujuannya, yaitu menunjukkan halaman mana yang penting. Dua puluh tautan yang dideskripsikan dengan baik lebih baik daripada seluruh situs.
Arahkan ke versi paling bersih dari setiap halaman. Jika Anda menerbitkan dokumentasi dalam bentuk yang memiliki banyak gaya dan bentuk markdown sederhana, tautkan ke versi yang sederhana.
Kesalahan umum
- Memasukkan seluruh sitemap, yang menghilangkan kurasi yang membuat file tersebut bernilai.
- Deskripsi yang hanya mengulang teks tautan, bukan menjelaskan halamannya.
- Jalur relatif, yang menjadi ambigu ketika file dibaca di tempat lain selain di situs Anda.
- Menulisnya sekali lalu tidak pernah meninjaunya kembali saat situs berubah.
- Menganggapnya sebagai pengganti konten halaman yang baik, padahal sebenarnya bukan.
Kaitannya dengan penelusuran berbasis AI
Menulisnya sendiri merupakan latihan yang bermanfaat, karena memaksa Anda menentukan dua puluh halaman mana yang benar-benar mewakili situs tersebut. Pertanyaan yang sama juga menentukan halaman mana yang akan dirujuk dalam jawaban AI.
Hasilnya paling optimal jika dilakukan bersama pekerjaan dasar lainnya: judul yang jelas, konten yang menjawab pertanyaan di paragraf pertama, data terstruktur, serta halaman yang cepat dan mudah diakses. Indeks yang dikurasi membantu sistem yang memang sudah ingin membaca situs Anda, sedangkan hal-hal lainnya membuat sistem tersebut tertarik untuk membacanya.
Lakukan keduanya dan keduanya akan saling memperkuat.
Menggunakan generator llms.txt
Masukkan nama situs, URL, dan ringkasan satu baris, lalu tambahkan bagian untuk setiap bagian situs serta tautan yang layak disertakan. Jalur relatif diperluas berdasarkan URL situs, sehingga Anda dapat mengetik /docs dan mendapatkan alamat lengkapnya.
Output dapat diedit sebelum disalin atau diunduh. Pada tahap inilah deskripsi biasanya mendapatkan sentuhan akhir. Simpan hasilnya sebagai llms.txt di root situs Anda agar dapat diakses di yourdomain.com/llms.txt.
Ke mana selanjutnya
File tersebut adalah indeks, jadi halaman-halaman di dalamnyalah yang penting. Periksa apakah halaman-halaman tersebut dapat diakses dengan pemeriksa
robots.txt, pastikan
Peta situs XML Anda lengkap dan terbaru, serta pastikan halaman-halaman itu sendiri menggunakan markup
schema yang tepat.