ملف صغير بسطرين أو ثلاثة، لكن لو اتكتب غلط ممكن يمنع جوجل من أرشفة موقعك بالكامل من غير ما تلاحظ. robots.txt هو أول ملف تقريبًا بتزوره روبوتات محركات البحث لما توصل لموقعك، وبيحدد لهم إيه المسموح يزحفوه وإيه الممنوع. في هذا الدليل هنشرح كل حاجة عنه بأمان.
robots.txt هو ملف نصي بسيط بيتحط في جذر موقعك، وبيحتوي تعليمات لروبوتات محركات البحث (زي Googlebot) عن أي أجزاء من الموقع مسموح لها تزحفها وأي أجزاء ممنوعة. الملف مش بيمنع الصفحة من الوصول ليها المستخدمين العاديين — هو موجّه فقط للروبوتات الآلية، وبيعتمد على التزام طوعي منها (محركات البحث الكبرى زي جوجل بتحترمه، لكن مش كل الروبوتات ملتزمة بيه).
User-agent: يحدد أي روبوت تنطبق عليه القاعدة (* تعني كل الروبوتات). Disallow: يمنع الزحف لمسار معين. Allow: يسمح بالزحف صراحة (مفيد لاستثناء مجلد فرعي داخل مجلد ممنوع). Sitemap: يشير لرابط خريطة موقعك لتسهيل اكتشافها.
السطرين دول بيمنعوا زحف الموقع كامل — خطأ شائع جدًا خصوصًا لو نُسخ ملف robots.txt من بيئة تطوير (Staging) للموقع الحي بالغلط بدون تعديل. لو موقعك مش بيظهر في جوجل رغم إنك عملت كل حاجة صح، أول حاجة تتأكد منها هي محتوى ملف robots.txt بتاعك.
باستخدام مولّد robots.txt على فورا.tools:
ليس بالضرورة، robots.txt يمنع الزحف وليس بالضرورة الفهرسة. صفحة محظورة قد تظهر في نتائج البحث بدون وصف إذا كانت مرتبطة بروابط من صفحات أخرى.
في المجلد الجذري لموقعك مباشرة، ليكون متاحًا على الرابط yoursite.com/robots.txt بالضبط.
في غياب الملف، تفترض روبوتات محركات البحث عادة أن كل صفحات الموقع مسموح بزحفها، وهو السلوك الافتراضي الآمن.
نعم، يُفضّل إضافة سطر Sitemap يشير لرابط ملف sitemap.xml، لأن هذا يساعد محركات البحث تكتشف الخريطة بسهولة أكبر.
بعد إعداد robots.txt، تأكد من إنشاء خريطة موقع صحيحة وتقديمها في Google Search Console.