Apa itu Generator Robots.txt?
Buat file robots.txt dengan format yang benar untuk mengontrol bagaimana crawler mesin pencari mengakses situs web Anda. Tambahkan aturan user-agent, atur jalur yang diizinkan/dilarang, tetapkan crawl delay, dan sertakan referensi sitemap — semuanya tanpa menulis file secara manual.
Tambah blok user-agent sebanyak yang dibutuhkan: satu untuk * (semua bot), lainnya khusus Googlebot, Bingbot, AhrefsBot, GPTBot, dan sebagainya. Setiap blok bisa berisi banyak Allow dan Disallow plus Crawl-delay dalam detik. URL Sitemap muncul sebagai baris terpisah di bagian akhir. Hasilnya adalah teks persis yang harus ditaruh di /robots.txt domain kamu.
Cara menggunakan
- Tambahkan aturan user-agent (misalnya Googlebot, Bingbot, atau * untuk semua) dan tentukan jalur mana yang diizinkan atau dilarang.
- Secara opsional atur nilai crawl delay dan tambahkan URL sitemap Anda.
- Salin atau unduh file robots.txt yang dihasilkan dan unggah ke root situs Anda.
Kapan menggunakan
- Memblokir crawler pelatihan AI (GPTBot, ClaudeBot, CCBot, Google-Extended) dari konten kamu.
- Menyembunyikan path admin, pencarian internal, staging, atau konten duplikat dari indeks mesin pencari.
- Migrasi situs dengan menunjuk sitemap baru, atau memblokir semuanya sementara saat rebuild.
Hasil
Buat aturan yang mengizinkan semua crawler di situs Anda tetapi memblokir jalur /admin/ dan /api/, dengan sitemap di https://example.com/sitemap.xml.
FAQ
- Apakah robots.txt benar-benar menghentikan bot, atau hanya permintaan?
- Ini protokol sukarela. Crawler tepercaya (Google, Bing, arsip besar) mematuhinya. Scraper, bot jahat, dan beberapa crawler AI di area abu-abu mengabaikannya. Untuk kontrol akses sungguhan, pakai autentikasi sisi server atau blokir berdasarkan IP dan user-agent di edge.
- Apa beda Disallow dan noindex?
- Disallow menghentikan crawling, Google tidak mengambil halaman. Noindex (meta tag atau header HTTP) menyuruh Google tidak menampilkan halaman di hasil meski merayapinya. Halaman yang di-Disallow membuat Google tidak melihat noindex, jadi URL itu masih bisa muncul di hasil.
- Di mana persisnya berkas robots.txt harus diunggah?
- Harus ada di akar domain dan disajikan di https://example.com/robots.txt. Subfolder atau subdomain membutuhkan berkas masing-masing. Di Next.js taruh di /public/robots.txt; di Vercel berkas statis di root proyek juga jalan.
- Bagaimana memblokir ChatGPT dan Claude agar tidak melatih dari situs saya?
- Tambahkan User-agent: GPTBot, User-agent: ClaudeBot, User-agent: CCBot, User-agent: anthropic-ai, dan User-agent: Google-Extended, masing-masing diikuti Disallow: /. Catatan: Google-Extended hanya mengeluarkanmu dari pelatihan; Googlebot biasa tetap mengindeks halaman.
- Apakah Google masih menghormati Crawl-delay?
- Tidak. Google mengabaikan Crawl-delay dan memakai pengaturan crawl rate di Search Console. Bing, Yandex, dan Yahoo masih menghormatinya. Nilai yang kamu pasang di sini tetap berada di berkas sebagai petunjuk untuk crawler tersebut; Google sekadar melewati baris itu.
Alat terkait
Generator Data Terstruktur
Buat markup JSON-LD schema untuk SEO
Halaman Web ke PDF
Simpan halaman web sebagai PDF
Generator Kebijakan Privasi
Buat kebijakan privasi untuk situs Anda
Generator Syarat Layanan
Buat dokumen syarat dan ketentuan layanan
Generator Persetujuan Cookie
Buat kode banner persetujuan cookie
Minifikasi CSS
Perkecil kode CSS untuk mengurangi ukuran file