प्रीसेट, अपने नियमों, AI क्रॉलर ब्लॉकिंग और साइटमैप लाइन के साथ वैध robots.txt बनाएँ।
robots.txt डोमेन के रूट पर रखी एक सादी टेक्स्ट फ़ाइल है, जो स्वचालित क्रॉलर को बताती है कि वे कौन से पाथ माँग सकते हैं। यह Robots Exclusion Protocol पर चलती है, जिसे RFC 9309 के रूप में मानकीकृत किया गया है, और इसकी बनावट सरल है: ऐसे समूह जो एक या अधिक User-agent पंक्तियों से शुरू होते हैं और उनके बाद Disallow तथा Allow नियम आते हैं, साथ ही अलग-अलग Sitemap पंक्तियाँ जो पूरी फ़ाइल पर लागू होती हैं। पाथ उपसर्ग से मिलाए जाते हैं, * किसी भी अक्षर-क्रम के लिए खड़ा होता है और $ URL के अंत को बाँधता है, इसलिए /*.pdf$ हर PDF को रोक देता है। खाली "Disallow:" यह कहने का मानक तरीका है कि "कुछ भी क्रॉल करो"।
यह जेनरेटर वह सिंटैक्स आपके लिए लिखता है और रास्ते में इनपुट साफ़ भी करता है: हर पाथ को शुरुआती स्लैश मिल जाता है अगर आप भूल गए हों, # से शुरू होने वाली पंक्तियाँ टिप्पणी के रूप में रख ली जाती हैं, खाली नियम-सूची मानक "सब कुछ अनुमति दें" समूह बन जाती है, और क्रॉल डिले तभी लिखा जाता है जब वह धनात्मक संख्या हो। AI क्रॉलर वाला विकल्प एक अलग समूह जोड़ता है जिसमें GPTBot, ChatGPT-User, OAI-SearchBot, CCBot, anthropic-ai, ClaudeBot, Claude-Web, Google-Extended, PerplexityBot, Applebot-Extended, Bytespider, Amazonbot, Meta-ExternalAgent और cohere-ai एक ही Disallow: / के नीचे सूचीबद्ध होते हैं — Googlebot को छुए बिना AI ट्रेनिंग और आंसर-इंजन क्रॉलिंग से बाहर निकलने का यही तरीका है। Sitemap पंक्ति को एक पूर्ण URL के रूप में जाँचा जाता है, क्योंकि सापेक्ष साइटमैप पाथ सर्च इंजन नज़रअंदाज़ कर देते हैं।
दो ईमानदार सीमाएँ दोहराने लायक हैं। पहली, robots.txt एक अनुरोध है, दीवार नहीं: भले क्रॉलर उसे मानते हैं, स्क्रैपर नज़रअंदाज़ कर देते हैं, और आप उसमें जो कुछ भी लिखते हैं वह सार्वजनिक रूप से पढ़ा जा सकता है — संवेदनशील पाथ छिपाने के लिए इसका इस्तेमाल कभी न करें। दूसरी, किसी URL को disallow करना क्रॉलिंग रोकता है, इंडेक्सिंग नहीं; रोका गया पेज, जिस पर दूसरी साइटें लिंक करती हों, बिना विवरण के भी नतीजों में आ सकता है, इसलिए जब आप उसे इंडेक्स से बाहर रखना चाहें तो पेज पर ही noindex मेटा टैग लगाएँ। फ़ाइल पूरी तरह आपके ब्राउज़र में बनती है और स्थानीय रूप से डाउनलोड होती है — आपकी साइट के बारे में यहाँ कुछ भी अपलोड नहीं होता।
User-agent: <क्रॉलर> / Disallow: <पाथ> / Allow: <पाथ> / Crawl-delay: <सेकंड> — हर समूह के लिए दोहराया जाता है, और Sitemap: <पूर्ण URL> अपनी अलग पंक्ति में।
डोमेन के रूट पर, ताकि वह https://yoursite.com/robots.txt पर मिले। क्रॉलर सिर्फ़ वहीं देखते हैं — सबफ़ोल्डर की फ़ाइल नज़रअंदाज़ हो जाती है, और हर सबडोमेन को अपनी फ़ाइल चाहिए।
नहीं। यह पेज को क्रॉल होने से रोकता है, लेकिन रोका गया URL बाहरी लिंक के ज़रिए फिर भी इंडेक्स हो सकता है। किसी पेज को नतीजों से बाहर रखने के लिए क्रॉलिंग की अनुमति दें और पेज पर noindex मेटा टैग जोड़ें।
कुछ करते हैं, कुछ नहीं। OpenAI, Google और Anthropic अपने user-agent दस्तावेज़ में बताते हैं और फ़ाइल का पालन करते हैं; कई स्क्रैपर उसे पूरी तरह नज़रअंदाज़ करते हैं। ब्लॉक करना एक स्पष्ट संकेत है, जबरदस्ती नहीं।
नहीं — Googlebot इस निर्देश को नज़रअंदाज़ करता है और अपनी दर खुद तय करता है, हालाँकि Bing और Yandex इसे पढ़ते हैं। Google को धीमा करना हो तो Search Console इस्तेमाल करें।
नहीं। CSS या JS फ़ाइलें ब्लॉक करने से सर्च इंजन आपके पेज वैसे रेंडर नहीं कर पाते जैसे उपयोगकर्ता देखते हैं, जिससे रैंकिंग को नुकसान हो सकता है, और साइटमैप का पहुँच में रहना ज़रूरी है।
नहीं। फ़ाइल आपके डिवाइस पर JavaScript से बनती है और सीधे आपके डाउनलोड फ़ोल्डर में सहेजी जाती है।
Vai.la किसी भी URL को क्लिक आंकड़ों, QR Code और आपके अपने बायोलिंक के साथ एक शॉर्ट लिंक में बदल देता है।
टूल्स का इस्तेमाल कैसे होता है या उनके परिणामों के आधार पर लिए गए निर्णयों के लिए Vai.la ज़िम्मेदार नहीं है।