Materi
robots.txt dan noindex sering dikira sama padahal bekerja di tahap berbeda. robots.txt memberi tahu perayap URL mana yang boleh diambil, jadi ia mengatur perayapan. Google menyebut fungsinya terutama mencegah server kewalahan oleh permintaan, dan menegaskan robots.txt bukan cara menyembunyikan halaman dari Google. URL yang diblokir tetap bisa diindeks bila ditautkan dari tempat lain, hanya tanpa deskripsi, karena isinya tidak pernah dibaca.
Formatnya dibakukan di RFC 9309. Berkasnya harus bernama /robots.txt, huruf kecil, di jalur teratas situs, dan berkode UTF-8. Aturannya dikelompokkan per User-agent, lalu tiap baris Allow atau Disallow dicocokkan dengan jalur URL. Bila beberapa aturan cocok, yang dipakai adalah yang paling spesifik, yaitu yang cocok dengan oktet terbanyak; bila Allow dan Disallow setara, Allow yang dipakai. RFC yang sama menegaskan aturan ini bukan bentuk otorisasi akses: perayap yang tidak patuh tetap bisa mengambil isinya.
# https://perpusukamaju.example/robots.txt
User-agent: *
Disallow: /cari
Disallow: /admin/
Allow: /admin/pengumuman/
Sitemap: https://perpusukamaju.example/sitemap.xmlnoindex bekerja di tahap pengindeksan. Aturan ini dipasang sebagai <meta name="robots" content="noindex"> di head, atau sebagai header HTTP X-Robots-Tag: noindex untuk berkas non-HTML seperti PDF. Saat perayap membaca aturan itu, halaman dibuang dari hasil pencarian meskipun ditautkan situs lain. Syaratnya, halaman tidak boleh diblokir robots.txt: perayap yang dilarang masuk tidak pernah melihat noindex-nya. Menulis noindex di dalam robots.txt tidak didukung Google. Untuk isi yang benar-benar rahasia, lindungi dengan kata sandi.