Llms.txt pertama kali digagas oleh Jeremy Howard pada September 2024 sebagai file Markdown di website root.
File ini dirancang khusus untuk menyediakan konteks ringkas serta daftar tautan terstruktur bagi LLM dan AI agent saat mengunjungi sebuah website.
Sesuai spesifikasi resminya, berkas llms.txt idealnya memuat judul H1, ringkasan satu paragraf dalam blockquote (blok kutipan), serta seksi H2 yang berisi daftar halaman penting beserta deskripsinya.
Beberapa Website Menggunakan llms.txt seperti robots.txt
Salah satu miskonsepsi paling krusial adalah adanya anggapan bahwa llms.txt berfungsi sebagai alat pengatur hak akses.
Sebanyak 6,59% berkas llms.txt memuat aturan kebijakan yang tidak pernah diatur dalam spesifikasi standar.
Aturan ini mencakup rate limit (batasan kecepatan) sebesar 3,05%, copyright notices (klausa hak cipta sebesar) 0,93%, hingga demands to be cited (tuntutan atribusi kutipan sebesar) 0,46%.
Para webmaster mengekspresikan aturan tersebut dalam berbagai format yang bermacam-macam:
- Paragraf prose (prosa) (38 ribu berkas).
- Sintaks baris robots.txt yang dimasukkan di bawah nama berkas yang salah (664 berkas).
- YAML permission blocks (154 berkas).
Kasus pada situs proform.com/llms.txt menjadi contoh nyata dari kekeliruan ini.
Berkas llms.txt situs tersebut mencantumkan bahwa CCBot crawler berada dalam status diblokir.
Di sisi lain, berkas robots.txt asli situs tersebut justru mengizinkan CCBot melalui menuliskan rule User-agent: * Allow: /.
Artinya, fungsi dari description of a policy (deskripsi kebijakan) di llms.txt telah berubah dari konfigurasi teknis yang sebenarnya.
Laporan Common Crawl menegaskan bahwa llms.txt bukanlah access-control mechanism (mekanisme kontrol akses), sehingga crawler tidak memiliki kewajiban untuk membaca atau mematuhi aturan di dalamnya.
Jika teman-teman ingin memblokir proses crawling oleh AI bot seperti CCBot, aturan tersebut wajib dikonfigurasikan melalui file robots.txt.
Kebanyakan File Terbuat dari Template
Sebanyak 68,27% dari seluruh file llms.txt dihasilkan secara otomatis oleh plugin atau template.
Template ini rata-rata berasal dari beberapa software (perangkat lunak) utama seperti:
- Wix menjadi penyumbang terbesar dengan menguasai 41,34% (241.448 file).
- Plugin SEO WordPress populer seperti AIOSEO (All in One SEO) menyumbang 73 ribu file, disusul Yoast (41 ribu file), GoDaddy Parking (15 ribu file), dan RankMath (12 ribu file).
Menariknya, sebesar 44,87% dari total file menyebutkan Model Context Protocol (MCP).
Hal ini terjadi terutama karena Wix menyisipkan baris perintah API (Application Programming Interface) secara otomatis yang mengarahkan AI agent untuk memanfaatkan endpoint layanan terstruktur daripada hanya melakukan scraping konten HTML.
Limitasi Analisis
Hasil analisis ini memiliki beberapa batasan metodologis yang perlu diperhatikan:
Cakupan Arsip Tunggal
Data ini diambil dari satu arsip pemindaian Common Crawl (Juli 2026, CC-MAIN-2026-30) pada populasi host yang berhasil diakses, sehingga tidak mengukur tren pertumbuhan historis maupun representasi web secara mutlak.
Pengecualian Tipe Konten
Sebanyak 519.484 respon yang dianalisis dengan tipe konten text/html dikecualikan dari perhitungan utama, meskipun ada kemungkinan sebagian di antaranya adalah berkas yang valid.
Pendekatan Pemindaian Keamanan
Kategori penyalahgunaan dan prompt injection dihitung menggunakan pencocokan leksikal terkurasi yang menghasilkan nilai lower bounds (ambang bawah) dengan presisi tinggi tetapi recall tidak diketahui.
Risiko False Positive
Dari seluruh file, hanya ditemukan 10 file dengan prompt injection tingkat tinggi.
Setelah diperiksa secara manual, hanya 4 file yang terbukti sebagai real prompt injection (termasuk perangkap bug bounty, joke, dan instruksi seperti pada website jrwren.dev).
Enam file sisanya merupakan false positive dari dokumen teknis atau artikel blog yang membahas cara kerja LLM.
Implikasi bagi Praktisi SEO
Temuan dari arsip analisis Common Crawl ini memberikan beberapa pelajaran strategis bagi praktisi SEO dan para webmaster, yaitu:
Jangan Jadikan llms.txt Tempat Memblokir Bot
Praktisi SEO tidak boleh mengandalkan llms.txt untuk mencegah scraping atau melarang scanning oleh AI.
Semua batasan akses tetap harus dikelola lewat robots.txt agar benar-benar dipatuhi oleh bot crawler.
Hindari Ketergantungan Penuh pada Plugin
Menggunakan plugin otomatis memang mempermudah pembuatan file ini, tetapi jika plugin hanya menghasilkan ratusan daftar link tanpa ringkasan konteks (seperti pada kasus AIOSEO), value dari file tersebut menjadi tidak optimal bagi LLM.
Cek Ulang Isi dan Konfigurasi File
Pastikan file llms.txt dibuat sesuai standar spesifikasi, yaitu menyajikan deskripsi ringkas yang jelas mengenai website serta mengarahkan AI agent ke halaman atau API penting (seperti MCP).
Jika teman-teman memiliki pertanyaan terkait, silakan tuliskan pada kolom komentar di bawah atau bisa gabung ke grup Telegram DailySEO ID di sini.
Teman-teman juga bisa ajukan topik selanjutnya untuk kami bahas! Jika ingin belajar SEO dari ahlinya, yuk belajar di course-nya DailySEO ID!
Referensi:
https://commoncrawl.org/blog/a-content-analysis-of-llms-txt-files-from-the-july-2026-crawl-archive