Tentang Keterbacaan LLM
Apa itu keterbacaan LLM?
Keterbacaan LLM adalah seberapa banyak bagian halaman Anda yang benar-benar dapat dibaca oleh asisten AI setelah halaman tersebut dirender. Bukan apa yang dilihat pengunjung dan bukan pula apa yang ada di file sumber Anda, melainkan teks yang tetap ada setelah halaman dimuat dan markup dihapus.
Ketiga hal tersebut berbeda jauh lebih besar daripada yang diperkirakan banyak orang. Halaman yang tampak kaya akan konten dapat hanya menghasilkan beberapa ratus kata yang dapat digunakan setelah navigasi, pemberitahuan cookie, widget postingan terkait, dan tag skrip tidak dihitung.
Pemeriksa ini memuat halaman Anda di browser nyata, dengan cara yang sama seperti audit kami, lalu melaporkan seberapa banyak konten yang dapat dibaca di dalamnya. Halaman yang dapat dibaca sistem secara menyeluruh dapat dikutip; halaman yang hanya dapat dibaca sedikit akan dilewati dan digantikan oleh halaman kompetitor yang dapat dibaca.
Mengapa versi yang dirender adalah yang diperhitungkan
Konten yang dirakit oleh JavaScript setelah pemuatan selesai mungkin tidak tersedia bagi sistem apa pun yang membaca halaman. Tidak semua crawler menjalankan skrip, dan crawler yang menjalankannya pun biasanya cepat menyerah, sehingga halaman yang teks utamanya muncul terlambat dapat terbaca seolah-olah hampir kosong.
Solusi yang andal adalah menyajikan konten yang bermakna dalam HTML awal melalui rendering di server atau pembuatan statis. Dengan begitu, skrip yang lambat hanya menurunkan kualitas pengalaman, bukan menghapus isi halaman.
Rasio sama pentingnya dengan jumlah. Halaman yang teks sebenarnya tersembunyi di balik lapisan markup presentasional akan lebih sulit diekstrak dengan baik, meskipun tampil sempurna bagi pengguna.
Ini adalah bagian yang paling tidak menarik dalam upaya agar konten dikutip, sekaligus salah satu yang paling menentukan, karena semua hal lainnya mengasumsikan bahwa bagian ini sudah terpenuhi. Struktur, heading, dan schema semuanya menganggap teks dapat diakses, dan inilah bagian yang paling mungkin rusak secara diam-diam saat desain ulang—halaman tersebut masih terlihat benar bagi siapa pun yang memeriksanya melalui browser.
**Yang biasanya tidak ada**
- Teks yang disisipkan oleh JavaScript setelah respons awal.
- Konten di balik tab, accordion, atau tombol “baca selengkapnya” yang tidak pernah terbuka.
- Apa pun yang berada di dalam iframe, karena iframe merupakan dokumen terpisah.
- Teks yang hanya ada di dalam gambar, tanpa padanan dalam bentuk teks.
- Halaman yang sebagian besar berupa antarmuka, dengan isi utama berupa paragraf.
Yang diperiksa alat ini
Halaman Anda dirender dalam browser tanpa kepala dan melaporkan konten yang dapat dibaca yang dihasilkan, sehingga Anda dapat melihat gambaran kasar tentang apa yang dapat digunakan oleh mesin yang membaca halaman tersebut.
Bandingkan hasilnya dengan apa yang Anda yakini ada di halaman. Perbedaan yang besar menunjukkan adanya konten yang bergantung pada skrip, atau halaman yang memiliki lebih sedikit substansi daripada yang disiratkan oleh tata letaknya.
Ke mana selanjutnya
Teks yang mudah dibaca adalah bahan mentah; struktur membuatnya dapat digunakan. Periksa apakah
tag heading memberikan kerangka yang masuk akal pada halaman, pastikan
jumlah kata sesuai dengan yang ingin Anda publikasikan, dan cari kesalahan
JavaScript yang mungkin menghambat konten untuk ditampilkan.