Robots.txt जनरेटर क्या है?
सर्च इंजन क्रॉलर आपकी वेबसाइट को कैसे एक्सेस करें, इसे नियंत्रित करने के लिए सही फॉर्मेट में robots.txt फ़ाइलें जनरेट करें। यूज़र-एजेंट नियम जोड़ें, अनुमत/प्रतिबंधित पथ सेट करें, क्रॉल डिले निर्धारित करें, और साइटमैप रेफरेंस शामिल करें — बिना फ़ाइल मैनुअली लिखे।
जितने चाहें उतने user-agent ब्लॉक जोड़ें — एक * (सभी बॉट) के लिए और बाकी Googlebot, Bingbot, AhrefsBot, GPTBot वगैरह के लिए अलग। हर ब्लॉक में कई Allow और Disallow पाथ डाल सकते हैं और सेकेंड में Crawl-delay भी रख सकते हैं। Sitemap URL फ़ाइल के अंत में अलग-अलग लाइनों में आते हैं। आउटपुट वही टेक्स्ट है जिसे आप अपने डोमेन के /robots.txt पर डालेंगे।
उपयोग कैसे करें
- यूज़र-एजेंट नियम जोड़ें (जैसे Googlebot, Bingbot, या सभी के लिए *) और बताएँ कि कौन से पथ अनुमत या प्रतिबंधित हैं।
- वैकल्पिक रूप से क्रॉल डिले वैल्यू सेट करें और अपना साइटमैप URL जोड़ें।
- जनरेट की गई robots.txt फ़ाइल को कॉपी या डाउनलोड करें और अपनी साइट के रूट पर अपलोड करें।
कब उपयोग करें
- AI ट्रेनिंग crawler (GPTBot, ClaudeBot, CCBot, Google-Extended) को अपने कंटेंट से रोकना हो।
- ऐडमिन, साइट सर्च, स्टेजिंग, या डुप्लीकेट कंटेंट के पाथ सर्च इंजन इंडेक्स से बाहर रखने हों।
- साइट माइग्रेट करते समय crawler को नए sitemap पर ले जाना हो, या रिबिल्ड के दौरान अस्थायी रूप से पूरी साइट बंद करनी हो।
परिणाम
ऐसे नियम बनाएँ जो सभी क्रॉलर को आपकी साइट पर अनुमति दें लेकिन /admin/ और /api/ पथों को ब्लॉक करें, साइटमैप https://example.com/sitemap.xml पर।
अक्सर पूछे जाने वाले प्रश्न
- क्या robots.txt वाकई crawler को रोकता है, या यह सिर्फ़ अनुरोध है?
- यह स्वैच्छिक प्रोटोकॉल है। प्रतिष्ठित crawler (Google, Bing, बड़े आर्काइव) इसे मानते हैं। scraper, मालिशियस बॉट और कुछ ग्रे-ज़ोन AI crawler इसे नज़रअंदाज़ करते हैं। असली एक्सेस कंट्रोल के लिए सर्वर-साइड authentication या edge पर IP + user-agent से ब्लॉक लगाएँ।
- Disallow और noindex में क्या फ़र्क है?
- Disallow crawling रोकता है — Google पेज को डाउनलोड ही नहीं करता। noindex (meta टैग या HTTP header) Google को बताता है कि पेज सर्च रिज़ल्ट में न दिखाए, भले ही उसे क्रॉल करे। Disallow किए पेज पर noindex Google को दिखता ही नहीं, इसलिए वे URL रिज़ल्ट में फिर भी आ सकते हैं।
- robots.txt फ़ाइल कहाँ पर अपलोड होगी?
- यह डोमेन के रूट पर होनी चाहिए और https://example.com/robots.txt पर serve होनी चाहिए। हर subfolder या subdomain के लिए अपनी अलग फ़ाइल चाहिए। Next.js में /public/robots.txt में डालें; Vercel पर project root में static फ़ाइल भी काम कर जाती है।
- ChatGPT और Claude को मेरी साइट पर ट्रेनिंग से कैसे रोकूँ?
- User-agent: GPTBot, User-agent: ClaudeBot, User-agent: CCBot, User-agent: anthropic-ai और User-agent: Google-Extended जोड़ें, हर एक के नीचे Disallow: / लगाएँ। ध्यान दें कि Google-Extended सिर्फ़ ट्रेनिंग से बाहर करता है; normal Googlebot पेज को index करता रहेगा।
- क्या Google अब भी Crawl-delay मानता है?
- नहीं। Google Crawl-delay को नज़रअंदाज़ करता है और Search Console की crawl-rate सेटिंग देखता है। Bing, Yandex और Yahoo अब भी मानते हैं। यहाँ रखी हुई वैल्यू फ़ाइल में रहती है ताकि उन crawler के लिए संकेत बनी रहे; Google उस लाइन को छोड़ देता है।
संबंधित उपकरण
स्ट्रक्चर्ड डेटा जेनरेटर
SEO के लिए JSON-LD स्कीमा मार्कअप बनाएँ
वेबपेज से PDF
वेबपेज को PDF के रूप में सेव करें
प्राइवेसी पॉलिसी जनरेटर
अपनी वेबसाइट के लिए प्राइवेसी पॉलिसी बनाएं
सेवा की शर्तें जनरेटर
सेवा की शर्तों का दस्तावेज़ बनाएँ
कुकी सहमति जनरेटर
कुकी सहमति बैनर कोड बनाएं
CSS मिनिफायर
फ़ाइल का आकार कम करने के लिए CSS कोड को संक्षिप्त करें