إنشاء وضبط ملف robots.txt في ووردبريس بدون منع الفهرسة

إنشاء وضبط ملف robots.txt في ووردبريس بدون منع الفهرسة

4.6
(70)
يُستخدم ملف robots.txt في ووردبريس لإخبار برامج الزحف بالمسارات التي يمكنها طلبها والمسارات التي لا تريد أن تزحف إليها. وقد يساعد ضبطه على تقليل زيارة الروابط التقنية أو المساحات غير المفيدة، لكن خطأ واحدًا مثل Disallow: / قد يمنع Googlebot من زحف الموقع كله. كما أن Robots ليس وسيلة مضمونة لإخفاء صفحة من نتائج البحث، ولا يحل محل noindex أو الحماية بكلمة مرور أو الرابط الأساسي Canonical.يشرح هذا الدليل من أكاديمية ويب مكان ملف Robots وطريقة قراءته وإنشائه وتعديله واختباره، مع أمثلة آمنة للمواقع والمدونات والمتاجر، وتوضيح قواعد User-agent وDisallow وAllow والرموز الخاصة. كما ستتعرف على الأخطاء التي تمنع الفهرسة، وطريقة إضافة Sitemap، ومتى يجب ترك الملف بسيطًا بدل نسخ أكواد طويلة لا تناسب بنية موقعك.

جدول المحتويات

ما هو ملف robots.txt؟

robots.txt ملف نصي يوجد في جذر النطاق، ويحتوي على قواعد تتحكم في وصول برامج الزحف إلى مسارات الموقع. يقرأ Googlebot الملف قبل طلب صفحات وموارد معينة، فإذا وجد قاعدة تمنع URL يتجنب زحفه. الهدف الأساسي هو إدارة حركة الزحف، وليس حماية البيانات أو ضمان إزالة الصفحات من فهرس جوجل.

مكان الملف الصحيح يكون مثل:

https://example.com/robots.txt

لا يوضع داخل مجلد القالب أو الإضافات، ولا يعمل ملف موجود على:

https://example.com/blog/robots.txt

للتحكم في النطاق الرئيسي، إلا إذا كان /blog/ مضيفًا أو نطاقًا مستقلًا وفق البنية. لكل بروتوكول ومضيف قواعده، ولذلك ملف الصب دومين يوجد على جذر الصب دومين نفسه:

https://academy.example.com/robots.txt

الإجابة السريعة: أفضل robots.txt لووردبريس

لا يوجد ملف واحد هو الأفضل لكل مواقع ووردبريس. بالنسبة إلى موقع عادي، يكفي غالبًا السماح بالزحف، ومنع لوحة الإدارة، والسماح بملف AJAX، وإضافة عنوان Sitemap. لا تمنع مجلدات wp-content أو القوالب أو الإضافات عشوائيًا؛ فقد يحتاج جوجل إلى CSS وJavaScript لفهم الصفحة وعرضها.

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/sitemap_index.xml

هذا مثال بداية وليس أمرًا للنسخ دون مراجعة. قد يستخدم موقعك خريطة ووردبريس الافتراضية wp-sitemap.xml أو مسارًا مختلفًا من إضافة السيو. كما قد تحتاج المتاجر والمواقع ذات البحث والفلاتر إلى قواعد أخرى بعد تحليل URLs.

كيف يعمل robots.txt مع Googlebot؟

عندما يريد Googlebot طلب رابط، يبحث عن ملف Robots الخاص بالمضيف ويقرأ مجموعات القواعد المناسبة لاسمه. إذا كان المسار مسموحًا، يمكنه الزحف إلى URL؛ وإذا كان ممنوعًا، يتجنب طلبه. المنع يؤثر في الزحف ولا يعني بالضرورة أن عنوان URL لن يظهر في النتائج إذا اكتشفه جوجل من روابط أخرى.

لا تستخدم الملف لحماية لوحة أو مستند سري؛ فالملف متاح للعامة ويعرض المسارات التي كتبتها. إذا كانت المعلومة حساسة، استخدم تسجيل الدخول أو كلمة مرور وصلاحيات خادم. كما أن بعض برامج الزحف غير الموثوقة قد تتجاهل القواعد.

الفرق بين الزحف والفهرسة

الزحف هو طلب الصفحة، والفهرسة هي تحليلها وإضافتها إلى قاعدة نتائج البحث. يمنع Robots الزحف عندما تطبق القاعدة، لكنه لا يرسل أمرًا مباشرًا بإزالة URL من الفهرس. قد يظهر رابط محظور دون وصف لأن جوجل عرف عنوانه من مكان آخر لكنه لم يقرأ محتواه.

الهدف الأداة المناسبة غالبًا
إدارة زحف مسار غير مهم robots.txt
منع صفحة عامة من نتائج البحث noindex مع السماح بالزحف
حماية معلومات خاصة تسجيل دخول أو كلمة مرور
دمج نسخ مكررة Canonical أو 301 حسب الحالة
حذف صفحة نهائيًا 404 أو 410
إخفاء مؤقت سريع من جوجل أداة الإزالة مع حل دائم

الفرق بين robots.txt وnoindex

يمنع noindex الصفحة من الظهور في نتائج البحث عندما يستطيع Googlebot زحفها ورؤية الوسم أو الترويسة. أما Robots فيمنع الزحف، وبالتالي قد يمنع جوجل من رؤية أمر noindex الموجود داخل الصفحة.

<meta name="robots" content="noindex, follow">

أو عبر ترويسة HTTP:

X-Robots-Tag: noindex

لا تضف الأمر التالي إلى Robots:

Noindex: /private-page/

فجوجل لا تدعم تحديد noindex بهذه الطريقة داخل الملف. وإذا أردت إزالة صفحة مفهرسة، لا تجمع منع Robots وnoindex في اللحظة نفسها؛ اسمح بالزحف حتى يقرأ جوجل أمر المنع.

الفرق بين robots.txt وCanonical

Canonical يحدد النسخة المفضلة من صفحات متشابهة، بينما Robots يتحكم في الزحف. لا تستخدم Disallow لاختيار النسخة الأساسية؛ فقد يمنع جوجل من قراءة محتوى الرابط وCanonical. استخدم وسمًا واضحًا وإشارات متسقة وروابط داخلية وخريطة وتحويلات مناسبة.

قواعد robots.txt الأساسية

User-agent

يحدد برنامج الزحف الذي تنطبق عليه المجموعة. النجمة تعني جميع الزواحف التي تدعم الملف:

User-agent: *

ويمكن تخصيص Googlebot:

User-agent: Googlebot

لا تخصص روبوتًا إلا عند وجود حاجة واضحة؛ فالملف الأبسط أسهل في الاختبار والصيانة.

Disallow

يمنع زحف مسار مطابق:

Disallow: /wp-admin/

أما Disallow: بلا مسار، فيعني عدم وجود منع داخل المجموعة:

User-agent: *
Disallow:

Allow

يسمح بمسار فرعي داخل مساحة ممنوعة، مثل AJAX في إدارة ووردبريس:

Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap

يعلن عنوان خريطة الموقع، ويُكتب URL كاملًا:

Sitemap: https://example.com/sitemap_index.xml

يمكن وضع أكثر من Sitemap، ولا يشترط أن تكون داخل مجموعة User-agent. وجودها يساعد على الاكتشاف لكنه لا يضمن الفهرسة.

التعليقات

يبدأ التعليق بعلامة #:

# منع لوحة إدارة ووردبريس
Disallow: /wp-admin/

استخدام النجمة وعلامة الدولار

تستخدم النجمة * لمطابقة سلسلة من الأحرف، وتستخدم $ للدلالة على نهاية URL. مثال لمنع روابط تنتهي بامتداد محدد يحتاج إلى مراجعة دقيقة قبل التطبيق:

Disallow: /*.pdf$

لا تستخدم الرموز الخاصة قبل اختبار عدة روابط مطلوبة وغير مطلوبة؛ فقد تكون القاعدة أوسع مما تتوقع. وتذكر أن معاملات URL يمكن أن تظهر بأشكال وترتيبات متعددة.

هل ووردبريس ينشئ robots.txt تلقائيًا؟

يمكن لووردبريس عرض ملف افتراضي ديناميكي عند زيارة /robots.txt حتى إذا لم يوجد ملف فعلي في جذر الخادم. قد تعدله إضافة سيو أو إعدادات النظام. إذا أنشأت ملفًا فعليًا، فقد يصبح هو النسخة المستخدمة حسب إعداد الخادم.

افتح الرابط من المتصفح وتأكد من المحتوى الفعلي. لا تفترض أن ما كتبته داخل إضافة هو النسخة التي تصل إلى Googlebot. بعد التعديل امسح كاش الخادم وCDN عند الحاجة.

طريقة إنشاء ملف robots.txt في ووردبريس

من خلال إضافة السيو

توفر بعض إضافات السيو محررًا للملف، لكن مكانه يختلف بين الإصدارات وقد لا يظهر في كل بيئة. قبل الحفظ، انسخ المحتوى القديم، وعدل قاعدة واحدة في كل مرة، ثم افتح رابط الملف للتأكد.

من مدير الملفات أو FTP

أنشئ ملفًا نصيًا باسم robots.txt وضعه في جذر تثبيت النطاق الذي يحتوي عادة على ملفات ووردبريس الرئيسية. استخدم ترميز UTF-8 ونصًا عاديًا، ولا تحوله إلى مستند غني أو تضف امتدادًا مخفيًا مثل .txt.txt.

عبر إعدادات الاستضافة أو الخادم

قد يولد CDN أو منصة استضافة الملف أو يعترض طلبه. إذا لم تظهر تعديلاتك، افحص قواعد الخادم والكاش وتواصل مع الاستضافة. لا تنشئ نسخًا متعددة في مجلدات مختلفة وتتوقع دمجها.

إضافة Sitemap إلى robots.txt

استخدم مسار الخريطة الذي يفتح فعلًا. في ووردبريس الأساسي قد يكون:

Sitemap: https://example.com/wp-sitemap.xml

وفي إضافات شائعة قد يكون:

Sitemap: https://example.com/sitemap_index.xml

لا تضف صفحة HTML بعنوان «خريطة الموقع» بدل XML، ولا تدرج خريطة من دومين مختلف إلا عند تطبيق متطلبات الاستضافة المشتركة المناسبة. أرسل الخريطة كذلك في Search Console لمتابعة القراءة والأخطاء.

أفضل ملف robots.txt لمدونة ووردبريس

المدونة الصغيرة المرتبة لا تحتاج عشرات قواعد المنع. مثال بسيط:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/sitemap_index.xml

تحكم في فهرسة التصنيفات والوسوم وصفحات الكاتب من إضافة السيو باستخدام Robots meta بحسب استراتيجية الموقع، بدل منع زحفها تلقائيًا. قد تحتاج جوجل إلى زيارة الأرشيف لاكتشاف الروابط أو رؤية noindex.

ملف robots.txt للمتاجر WooCommerce

ينتج المتجر روابط للسلة والحساب وإتمام الطلب والبحث والفلاتر والترتيب. بعض هذه الصفحات لا تناسب نتائج البحث، لكن الحل يختلف. صفحات الحساب والسلة تُدار عادة بـnoindex وإعدادات النظام، بينما قد تحتاج مساحات الفلاتر الضخمة إلى إدارة زحف مدروسة.

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

# أمثلة تحتاج تعديلًا حسب الروابط الفعلية
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/

Sitemap: https://example.com/sitemap_index.xml

إذا كانت مسارات موقعك بالعربية أو مختلفة، لن تعمل هذه الأمثلة. كذلك قد تحتاج Googlebot إلى زحف صفحات معينة لرؤية noindex. افحص الاستراتيجية قبل المنع، ولا تحظر ملفات المنتجات أو الصور التي تريد ظهورها.

هل تمنع صفحات البحث الداخلي؟

تنتج ووردبريس روابط بحث بمعامل ?s=، وقد تتولد منها مساحة كبيرة أو روابط مزعجة. استخدم noindex لنتائج البحث الداخلية، ويمكن التفكير في إدارة زحف أنماطها إذا أصبحت مشكلة حقيقية. مثال نظري:

Disallow: /*?s=

اختبر المعاملات وترتيبها، لأن القاعدة قد لا تطابق كل الأشكال أو قد تمنع URL له استخدام آخر. والأهم معالجة الروابط المزعجة وعدم نشر نتائج البحث في Sitemap.

إدارة روابط الفلاتر والترتيب

قد تنشئ الفلاتر آلاف التركيبات لمعلمات اللون والحجم والسعر والترتيب. لا توجد قاعدة Robots عامة تصلح لكل متجر. حدد الفلاتر التي لها قيمة بحث وتحتاج صفحات ثابتة، واجعل الباقي غير قابل للفهرسة أو الزحف وفق خطة متكاملة تشمل Canonical والروابط.

منع المعاملات في Robots قد يقلل الزحف لكنه يمنع رؤية Canonical داخلها. لذلك حلل سجلات الزحف وحجم المشكلة، ولا تستخدم المنع لمجرد وجود علامة استفهام في URL.

هل تمنع wp-content وwp-includes؟

لا يُنصح بمنع مجلدات الموارد كاملة بصورة عمياء. تحتوي wp-content على صور وCSS وJavaScript يحتاجها جوجل لرسم الصفحة، وقد يؤدي حظرها إلى رؤية نسخة ناقصة. وكذلك قد تعتمد وظائف القالب على موارد داخل مسارات النظام.

إذا أردت منع ملف تقني محدد، تأكد أنه غير ضروري للعرض ولا تريد ظهوره. الأفضل غالبًا ترك الموارد العامة قابلة للزحف، وحماية الملفات الحساسة عبر الخادم والصلاحيات بدل Robots.

هل تمنع مجلد uploads؟

لا تمنع /wp-content/uploads/ إذا كنت تريد ظهور الصور وفهم المحتوى. يحتوي المجلد على وسائط المقالات والمنتجات. إذا توجد ملفات خاصة، لا ترفعها إلى مساحة عامة وتعتمد على Robots؛ استخدم تخزينًا محميًا وصلاحيات.

منع الصور من بحث Google

يمكن استهداف Googlebot-Image لمنع صورة أو نمط صور من الزحف والظهور في بحث الصور:

User-agent: Googlebot-Image
Disallow: /images/private-example.jpg

ولمنع امتداد أو نمط:

User-agent: Googlebot-Image
Disallow: /images/archive-*.jpg

لا تستخدم ذلك لصور المقالات التي تعتمد عليها زياراتك، ولا تعتبر Robots حماية من تنزيل الصورة أو الوصول المباشر إليها.

منع ملفات PDF من نتائج البحث

إذا أردت منع PDF من الفهرسة، يكون X-Robots-Tag: noindex في استجابة الملف حلًا أوضح من منع الزحف، لأن Googlebot يحتاج إلى الوصول للترويسة. أما إذا منعت المسار في Robots، فقد يظل URL ظاهرًا إذا اكتُشف من روابط.

أخطر خطأ: Disallow للموقع كله

User-agent: *
Disallow: /

تمنع هذه القاعدة الزحف إلى جميع المسارات. قد تكون مفيدة مؤقتًا في بيئة اختبار غير عامة، لكن البيئة التجريبية يجب حمايتها بكلمة مرور بدل الاعتماد على Robots. عند إطلاق الموقع، قد يُنسى المنع فيستمر جوجل بعيدًا عن الصفحات.

إذا وجدت القاعدة على الموقع المنشور، أزلها، وتأكد من إعداد «رؤية محركات البحث» في ووردبريس، وامسح الكاش، واختبر روابط مهمة في Search Console، ثم أرسل Sitemap واطلب فهرسة عدد محدود من الصفحات الرئيسية.

خطأ منع CSS وJavaScript

تحتاج جوجل إلى عرض الصفحة لفهم المحتوى وتجربة الهاتف. إذا حظرت ملفات CSS وJS الضرورية، قد تظهر موارد محظورة في اختبار URL وتكون لقطة الشاشة ناقصة. اسمح بالموارد الأساسية، وأصلح المشكلات من مصدرها بدل منع الملفات لأن أسماءها تبدو تقنية.

خطأ استخدام Robots لإخفاء معلومات سرية

كل شخص يستطيع فتح الملف ومعرفة المسارات المكتوبة. كما أن الروبوتات الضارة لا تلتزم به. استخدم مصادقة وصلاحيات ووصولًا خاصًا، وأزل الملفات الحساسة من الجذر العام. Robots اتفاق طوعي للزواحف المحترمة وليس نظام أمان.

خطأ منع الصفحات مع وضع noindex

إذا منعت Googlebot من الزحف، لن يستطيع رؤية وسم noindex. لإزالة صفحة عامة من الفهرس، اسمح بالزحف وضع noindex، وانتظر إعادة الزيارة. بعد خروجها، قرر إن كنت تحتاج منع الزحف لأسباب أخرى، مع فهم أن الإشارات قد تتغير مستقبلًا.

خطأ نسخ ملف robots.txt من منافس

قد تختلف بنية الروابط والإضافات واللغات والخريطة. قاعدة تمنع فلترًا لدى متجر قد تمنع تصنيفًا مهمًا لديك. اقرأ كل سطر واسأل ما URLs التي يطابقها ولماذا. اختبر أمثلة مسموحة وممنوعة قبل النشر.

خطأ وضع أكثر من ملف لنطاق واحد

يستخدم الزاحف الملف على جذر المضيف. الملفات داخل المجلدات لا تُدمج. وإذا كان لديك subdomain، يحتاج ملفه الخاص. راجع كلًا من:

https://example.com/robots.txt
https://www.example.com/robots.txt
https://academy.example.com/robots.txt

وحّد التحويلات والمضيف المفضل، وتأكد أن كل نسخة تخدم الملف والقواعد المناسبة.

طريقة اختبار robots.txt

بعد التعديل، افتح الملف وتأكد أنه يعيد 200 ونصًا صحيحًا. استخدم أداة فحص URL لمعرفة هل يُسمح لجوجل بزحف صفحة محددة. اختبر صفحة مهمة، وصفحة يجب منعها، وملف CSS، وصورة، وURL بمعاملات عند وجود قواعد لها.

  1. انسخ الملف الحالي احتياطيًا.
  2. اكتب القاعدة الجديدة في بيئة آمنة.
  3. جهز قائمة URLs يجب السماح بها.
  4. جهز قائمة URLs يجب منعها.
  5. اختبر Googlebot العام والروبوت المتخصص عند الحاجة.
  6. انشر التعديل وامسح الكاش.
  7. افتح الملف من خارج لوحة التحكم.
  8. راقب Search Console وإحصاءات الزحف.

حل مشكلة محظور بواسطة robots.txt

إذا ظهر التقرير لصفحة يجب فهرستها، افتح الملف وحدد القاعدة المطابقة. قد تكون قاعدة للمسار كله أو wildcard واسعًا. أزلها أو أضف Allow أدق عند الحاجة، ثم اختبر الرابط المنشور.

راجع أيضًا ملفات الصب دومين أو CDN الذي يستضيف الموارد. قد تكون الصفحة مسموحة لكن CSS أو JavaScript محظورين. بعد الإصلاح لا تتوقع تحديث التقرير فورًا؛ يحتاج جوجل إلى إعادة قراءة الملف والزحف.

ظهور URL فقط دون وصف في جوجل

قد يظهر رابط محظور برسالة تشير إلى عدم توفر وصف بسبب Robots. هذا يحدث لأن جوجل اكتشف URL من روابط ولم يقرأ الصفحة. إذا تريد ظهوره طبيعيًا، اسمح بالزحف. وإذا تريد إزالته، استخدم noindex بعد السماح بالزحف أو حماية الوصول.

Robots.txt وميزانية الزحف

لا تحتاج المواقع الصغيرة غالبًا إلى هوس ميزانية الزحف. ركز على بنية روابط جيدة وخادم مستقر ومحتوى مفيد. تصبح إدارة المساحات غير المحدودة مهمة في المواقع الكبيرة التي تنتج فلاتر وتقويمات ومعاملات كثيرة.

لا تستخدم Robots لإخفاء كل صفحة ضعيفة بدل تحسين بنية الموقع. قلل إنشاء الروابط غير المفيدة، واضبط Canonical وnoindex، ونظف Sitemap. منع الزحف جزء من استراتيجية، لا بديل عن النظافة.

Robots.txt للمواقع متعددة اللغات

إذا كانت اللغات في مجلدات على المضيف نفسه، يطبق ملف الجذر عليها جميعًا، ويمكن استهداف مسارات محددة. وإذا كانت على نطاقات فرعية، لكل مضيف ملف. لا تمنع لغة لأنك لا تريد ترتيبها قبل مراجعة hreflang وCanonical والنية.

Robots.txt عند نقل الموقع

قبل الإطلاق، تأكد أن الموقع الجديد لا يحمل قواعد بيئة التجربة. اسمح لجوجل بزحف الروابط الجديدة، واترك القديمة متاحة لإعادة التوجيه. إذا منعت الموقع القديم، قد يتأخر اكتشاف 301. حدّث Sitemap وSearch Console، واختبر القوالب.

هل تستخدم Crawl-delay؟

لا يعتمد Googlebot على توجيه Crawl-delay داخل Robots. إذا كان جوجل يسبب ضغطًا حقيقيًا، افحص الخادم وإحصاءات الزحف واتبع أدوات وإرشادات جوجل المناسبة. قد تدعم زواحف أخرى التوجيه بطرق مختلفة، لذلك لا تفترض سلوكًا موحدًا.

هل تمنع روبوتات الذكاء الاصطناعي؟

هذا قرار منفصل عن فهرسة Google Search، ويعتمد على سياسة الموقع وشروط كل زاحف. يجب استخدام الاسم الرسمي المعلن لكل روبوت وفهم الأثر قبل المنع. لا تضف قوائم من الإنترنت دون التحقق، ولا تخلط بين Googlebot الخاص بالبحث وروبوتات خدمات أخرى.

مراجعة ملف robots.txt بعد تثبيت إضافة جديدة

قد تضيف إضافة سيو أو حماية أو متجر قواعد أو ملفًا افتراضيًا. افحص الملف بعد التثبيت والتحديث، وسجل التغييرات. إذا اختلف المحتوى عن لوحة الإضافة، ابحث عن ملف فعلي أو كاش أو إعداد خادم له أولوية.

قائمة مراجعة ملف Robots

  • الملف موجود في جذر المضيف.
  • يعيد 200 ونصًا عاديًا.
  • لا يوجد Disallow: / دون قصد.
  • لوحة الإدارة ممنوعة وAJAX مسموح عند الحاجة.
  • CSS وJavaScript والصور المهمة قابلة للزحف.
  • Sitemap صحيحة وتفتح.
  • القواعد تناسب المسارات الفعلية.
  • الرموز الخاصة تم اختبارها.
  • الصفحات المهمة مسموحة.
  • المعلومات الحساسة محمية فعليًا.
  • noindex لا يعتمد على مسار محظور.
  • كل subdomain له ملف مناسب.
  • تمت مراجعة Search Console بعد التعديل.

أمثلة robots.txt حسب نوع الموقع

موقع ووردبريس بسيط

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/wp-sitemap.xml

مدونة تستخدم إضافة سيو

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/sitemap_index.xml

موقع تحت التطوير

لا تعتمد على:

User-agent: *
Disallow: /

وحده. استخدم كلمة مرور أو تقييد وصول، لأن الملف لا يحمي السرية وقد تُكتشف روابط الموقع.

كيف يختار Googlebot القاعدة المطابقة؟

عند وجود أكثر من قاعدة تنطبق على URL، لا يعتمد التفسير على ترتيب السطور وحده بصورة بسيطة؛ إذ يبحث جوجل عن القاعدة الأكثر تحديدًا من حيث طول المسار المطابق. لذلك قد تتغلب قاعدة Allow أكثر تحديدًا على Disallow أوسع، أو العكس. لا تبنِ ملفًا معقدًا اعتمادًا على التخمين، واختبر الروابط الفعلية.

User-agent: *
Disallow: /folder/
Allow: /folder/public-page/

في المثال، يُمنع المجلد عمومًا ويُسمح بالمسار الأكثر تحديدًا. لكن وجود معاملات وشرطات ونهايات مختلفة قد يغير المطابقة، ولذلك جهز قائمة بكل الصيغ المهمة.

حساسية حالة الأحرف

مسارات URL قد تكون حساسة لحالة الأحرف على الخادم، و/Folder/ ليس بالضرورة /folder/. استخدم الشكل الفعلي للروابط، ولا تفترض أن القاعدة المكتوبة بحروف صغيرة تغطي كل النسخ. الأفضل منع تولد نسخ مختلفة من المصدر وتوحيدها بتحويلات عند الحاجة.

المعاملات وعلامة الاستفهام

الجزء الذي يلي ? يدخل ضمن URL الذي تُطابقه قواعد Google، لكن ترتيب المعاملات قد يتغير. قاعدة تستهدف ?sort= في بداية الاستعلام لن تغطي بالضرورة URL يبدأ بمعامل آخر. حل مشكلة المعاملات يحتاج فهم مصدرها والروابط التي تولدها، لا تجميع عشرات الأنماط بلا اختبار.

مجموعات User-agent المتعددة

يمكن تخصيص قواعد لروبوتات مختلفة، لكن يجب تنظيم المجموعات بوضوح. مثال يسمح للبحث العام ويمنع مجلد صور من Googlebot-Image:

User-agent: Googlebot-Image
Disallow: /private-images/

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

لا تكرر اسم الروبوت في مجموعات بعيدة وتتوقع أن كل الزواحف تدمجها بالطريقة نفسها. اجمع قواعد الروبوت معًا، وراجع المواصفات الرسمية. وإذا لم توجد حاجة للتمييز، استخدم مجموعة عامة واحدة لتقليل الأخطاء.

ماذا يحدث إذا كان robots.txt مفقودًا؟

إذا لم يوجد الملف وعاد 404، يستطيع Googlebot عادة زحف الموقع دون قيود Robots. غياب الملف ليس خطأ سيو في حد ذاته. لكن وجوده مفيد لإعلان الخريطة أو إدارة مسارات محددة. لا تنشئ ملفًا لمجرد ملء خانة إذا لم تعرف ماذا ستمنع.

ماذا يحدث إذا أعاد الملف خطأ خادم؟

يختلف التعامل مع الأخطاء المؤقتة عن 404. إذا فشل جوجل في جلب Robots بسبب خطأ خادم، قد يتوقف مؤقتًا عن زحف الموقع لحماية القواعد المحتملة. لذلك يجب أن يكون الملف خفيفًا ومتوافرًا وألا يعتمد على كود معقد أو قاعدة بيانات بطيئة.

راقب استجابة /robots.txt بعد تغيير CDN أو جدار الحماية، وتأكد من عدم إعادة صفحة HTML أو تحدي CAPTCHA بدل النص. افحص الترويسات:

curl -I https://example.com/robots.txt

Robots.txt والكاش وCDN

قد يحتفظ CDN بنسخة قديمة من الملف بعد التعديل. امسح المسار من الكاش، وحدد مدة تخزين معقولة، وتأكد أن كل نقاط الحضور تعيد المحتوى نفسه. لا تقدم ملفًا مختلفًا حسب الدولة أو الجهاز دون ضرورة، لأن ذلك يصعب التشخيص.

إذا كان WordPress يولد الملف ديناميكيًا بينما CDN يخزنه، قد تتأخر تغييرات إضافة السيو. بعد النشر افتح الرابط من نافذة خاصة واستخدم أمر curl، ولا تعتمد على معاينة المحرر داخل لوحة التحكم.

Robots.txt في WordPress Multisite

في الشبكات متعددة المواقع، تختلف البنية إذا كانت المواقع على نطاقات فرعية أو مجلدات. كل مضيف يمكن أن يملك ملف جذر خاصًا، بينما المواقع في مجلدات تشترك في ملف المضيف. يجب تصميم القواعد بحيث لا تمنع موقعًا آخر دون قصد.

إذا كانت الشبكة تستخدم تعيين نطاقات، افحص كل نطاق مستقلًا. وقد تغير الإضافات سلوك الملف للشبكة كلها. اختبر صفحة من كل موقع، وخريطة كل موقع، وموارد القالب المشترك.

ملف Robots للصب دومين

الصب دومين مضيف مستقل من منظور Robots. الملف الموجود على النطاق الرئيسي لا يتحكم تلقائيًا في academy.example.com. أنشئ أو راجع:

https://academy.example.com/robots.txt

وأضف Sitemap الخاصة بالصب دومين. إذا كان المشروع يستخدم نظامًا مختلفًا، لا تنقل قواعد ووردبريس الرئيسية دون مراجعة. وتأكد أن الصب دومين المنشور لا يحمل منع بيئة تجريبية.

حماية بيئة Staging بطريقة صحيحة

بيئة التجربة قد تحتوي على نسخة كاملة من الموقع، وإذا تركت عامة يمكن أن تُكتشف وتسبب تكرارًا أو تسريبًا. الحماية الأساسية تكون بكلمة مرور أو تقييد وصول على مستوى الخادم، مع noindex كطبقة إضافية عند الحاجة. Robots وحده يعلن المسارات ولا يمنع المستخدم.

عند الانتقال للإنتاج، تأكد من عدم نقل إعدادات noindex أو كلمة المرور أو Disallow: /. استخدم قائمة إطلاق تشمل الملف وإعدادات قراءة ووردبريس وCanonical وSitemap وSearch Console.

هل تمنع صفحات wp-json وواجهات API؟

قد تظهر واجهة REST في سجلات الزحف، لكن منعها ليس قاعدة افتراضية لكل موقع. تعتمد القوالب والإضافات والمحرر وبعض الميزات على API. إذا كانت هناك مسارات تولد عبئًا أو بيانات لا تريد زحفها، افحص الاستخدام أولًا، وفكر في الحماية والصلاحيات بدل Robots وحده.

لا تعتبر إخفاء المسار إجراءً أمنيًا؛ الواجهة معروفة ويمكن الوصول إليها مباشرة إذا كانت عامة. الأمن يعتمد على التحقق والصلاحيات وعدم كشف بيانات حساسة.

هل تمنع صفحات feed؟

توفر خلاصات RSS فائدة للقراء والتطبيقات وقد تساعد على اكتشاف المحتوى. منع زحفها لا يمنع الوصول إليها. إذا كانت تظهر في البحث أو تسبب تكرارًا، راجع Canonical والترويسات وإعدادات السيو، ولا تطبق منعًا عامًا دون معرفة دورها.

هل تمنع صفحات author وdate archives؟

القرار يتعلق بالفهرسة وجودة الأرشيف أكثر من Robots. موقع الكاتب الواحد قد يرى أرشيف المؤلف نسخة من المدونة، بينما موقع متعدد الكتاب يمكن أن يقدم صفحات مؤلفين مفيدة. استخدم إعدادات السيو وnoindex عند الحاجة، وحافظ على إمكانية الزحف إذا أردت أن يرى جوجل الوسم والروابط.

هل تمنع الوسوم والتصنيفات؟

التصنيف المنظم قد يكون صفحة هبوط مهمة، بينما الوسم الذي يحتوي على مقال واحد قد يكون ضعيفًا. لا تمنع النوعين تلقائيًا في Robots. حدد ما تريد فهرسته من إضافة السيو، وحسن الأرشيفات المفيدة بمقدمة وتنظيم وروابط، وأوقف إنشاء وسوم بلا خطة.

إدارة الروابط ذات معاملات التتبع

معاملات UTM لا تحتاج عادة إلى منع زحف شامل إذا كانت الروابط الأساسية وCanonical واضحة، لكن كثرتها داخل الموقع قد تنشئ نسخًا. لا تستخدم روابط UTM في التنقل الداخلي، واجعل Canonical إلى URL النظيف. راقب سجلات الزحف قبل إضافة قواعد.

Robots.txt والمحتوى المكرر

منع النسخة المكررة في Robots قد يحرم جوجل من رؤية Canonical ومقارنة المحتوى. في كثير من الحالات يكون 301 أو Canonical أو تنظيف الروابط أفضل. استخدم Robots عندما يكون الهدف إدارة مساحة زحف كبيرة ولا تحتاج إلى معالجة محتوى الرابط.

طريقة تدقيق robots.txt لموقع قائم

  1. احفظ نسخة من الملف الحالي وتاريخها.
  2. اجمع أهم قوالب وروابط الموقع.
  3. اجمع المسارات التي لا تريد زحفها.
  4. اربط كل قاعدة بسبب تجاري أو تقني واضح.
  5. اختبر صفحات ومقالات وتصنيفات وصورًا وموارد.
  6. راجع Sitemap وCanonical وnoindex بالتوازي.
  7. افحص استجابة الملف والكاش.
  8. راقب الفهرسة وإحصاءات الزحف بعد النشر.

إنشاء جدول مطابقة

URL هل يجب زحفه؟ القاعدة المطابقة النتيجة
مقال رئيسي نعم لا منع مسموح
لوحة الإدارة لا /wp-admin/ ممنوع
admin-ajax.php نعم Allow محدد مسموح
صورة مقال نعم لا منع uploads مسموح
نتيجة بحث داخلية حسب الخطة نمط المعامل تُختبر

تحليل سجلات الخادم للتأكد من أثر القواعد

في المواقع الكبيرة، توضح سجلات الخادم ما يطلبه Googlebot بالفعل. تحقق من هوية الروبوت بطريقة صحيحة، ثم حلل المسارات وأكواد الاستجابة والتكرار. قد تكتشف أن معظم الزحف يذهب إلى فلاتر أو صفحات تقويم، فتقرر معالجة مصدر الروابط وإضافة قاعدة مدروسة.

لا تستخدم السجلات لتبرير منع كل مسار يزوره جوجل؛ الزيارة قد تكون طبيعية لاكتشاف التحديثات والروابط. اربط حجم الزحف بقيمة الصفحات وأداء الخادم.

متى يكون الملف البسيط أفضل؟

إذا كان الموقع صغيرًا وروابطه نظيفة ولا ينتج مساحات لا نهائية، يكون الملف البسيط أقل عرضة للأخطاء. كل قاعدة إضافية تحتاج سببًا واختبارًا وصيانة. السيو الجيد لا يُقاس بطول Robots.

ابدأ بالسماح العام ومنع الإدارة وإضافة الخريطة، ثم أضف قاعدة فقط عندما ترى نمطًا حقيقيًا في الزحف أو بنية الموقع. لا تستبق مشكلات غير موجودة.

متى تحتاج إلى تعديل الملف فعلًا؟

  • وجود روابط ديناميكية لا نهائية.
  • زحف كثيف لمسارات تقنية غير مفيدة.
  • وجود بيئة أو مجلدات يجب عدم زحفها مع حماية مناسبة.
  • منع نوع وسائط محدد من بحث الصور.
  • الحاجة إلى إعلان Sitemap.
  • ظهور قاعدة قديمة تمنع صفحات مهمة.
  • تغيير بنية الموقع أو الصب دومين.

خطة استعادة الفهرسة بعد خطأ Robots

إذا منع الملف الموقع كله، أصلح القاعدة أولًا وتأكد أن الرابط يعيد النسخة الجديدة. راجع إعداد noindex في ووردبريس، لأن الموقع قد يجمع المنعين. اختبر الصفحة الرئيسية وأهم التصنيفات والمقالات والموارد في Search Console.

أرسل Sitemap، واطلب فهرسة عدد محدود من الصفحات المهمة، وأعد الروابط الداخلية. لا تطلب مئات URLs يدويًا. راقب إحصاءات الزحف وتقرير الفهرسة، وتوقع أن العودة تحتاج إعادة زحف ومعالجة.

خطة مراقبة بعد تعديل الملف

خلال أول ساعة

افتح الملف، وافحص كود الاستجابة والمحتوى والكاش، واختبر روابط أساسية وموارد. إذا ظهر خطأ، أعد النسخة الاحتياطية فورًا.

خلال أول أسبوع

راجع اختبار URL وإحصاءات الزحف وأخطاء الفهرسة. تأكد أن المسارات الممنوعة انخفض زحفها وأن الصفحات المهمة ما زالت متاحة.

خلال الأسابيع التالية

راقب الفهرسة والظهور وسجلات الخادم. لا تغير القواعد كل يوم؛ اجمع بيانات كافية، وحدّث التوثيق إذا كان التعديل ناجحًا.

خرافات شائعة عن robots.txt

كلما زادت القواعد تحسن السيو

خطأ؛ زيادة القواعد ترفع احتمال منع محتوى أو موارد مهمة. الجودة في الدقة لا الطول.

Robots يمنع أي شخص من فتح الصفحة

خطأ؛ المستخدم يستطيع زيارة الرابط، والروبوت غير الملتزم قد يتجاهل الملف. استخدم أمانًا حقيقيًا.

منع الصفحة يزيلها فورًا من جوجل

خطأ؛ قد يظل URL مفهرسًا دون محتوى. استخدم noindex أو إزالة وحلًا دائمًا حسب الحالة.

يجب منع مجلدات ووردبريس كلها

خطأ؛ بعض المجلدات تحتوي على موارد ضرورية للعرض والصور. امنع مسارات محددة عند الحاجة.

Sitemap داخل Robots تضمن الفهرسة

خطأ؛ الخريطة تساعد على اكتشاف الروابط ولا تضمن زحفها أو فهرستها.

نموذج توثيق قواعد الملف

احتفظ بجدول يتضمن القاعدة، والسبب، وصاحب القرار، وتاريخ الإضافة، وروابط الاختبار، والنتيجة المتوقعة. هذا مهم عند انتقال إدارة الموقع أو تحديث المتجر، حتى لا يحذف شخص قاعدة ضرورية أو يبقي قاعدة انتهى سببها.

قائمة إطلاق موقع ووردبريس جديد

  • إزالة كلمة مرور الموقع المنشور فقط بعد اكتماله.
  • إلغاء منع محركات البحث في إعدادات القراءة.
  • مراجعة Robots وعدم وجود منع عام.
  • فحص noindex على الصفحة الرئيسية والمقالات.
  • التأكد من Canonical وHTTPS.
  • إنشاء Sitemap وإضافتها إلى الملف.
  • إضافة الموقع إلى Search Console.
  • اختبار الهاتف والموارد.
  • فحص 404 والتحويلات.
  • حفظ نسخة من إعدادات الإطلاق.

تعديل robots.txt برمجيًا في ووردبريس

يمكن للمطور تعديل المخرجات الديناميكية للملف عبر مرشحات ووردبريس بدل إنشاء ملف فعلي، لكن هذا الأسلوب يحتاج توثيقًا لأنه قد يختفي عند تغيير القالب أو الإضافة. لا تضع الكود في قالب أب يتغير بالتحديث دون Child Theme أو إضافة مخصصة.

مثال تعليمي بسيط يحتاج اختبارًا في بيئتك:

add_filter( 'robots_txt', function( $output, $public ) {
    $output .= "\nSitemap: https://example.com/sitemap_index.xml\n";
    return $output;
}, 10, 2 );

لا تستخدم المثال إذا كانت إضافة السيو تضيف الخريطة بالفعل، حتى لا تكرر السطر. وبعد أي تعديل برمجي افتح الملف نفسه وافحص الكاش والاستجابة، لأن نجاح حفظ الكود لا يعني أن المسار يعرض المحتوى الجديد.

ماذا تفعل عند حدوث منع مفاجئ للموقع؟

إذا لاحظت انخفاض الزحف أو ظهور رسالة منع بعد تعديل Robots، أعد النسخة السابقة أولًا عندما لا تعرف سبب الخطأ، ثم افحص الاختلاف سطرًا بسطر. لا تضف قواعد Allow كثيرة لمحاولة إصلاح قاعدة واسعة؛ قد يكون حذف القاعدة الخاطئة أوضح وأقل خطورة.

  1. التقط صورة أو نسخة من الملف المتسبب في المشكلة.
  2. استرجع النسخة السليمة.
  3. امسح كاش CDN والخادم للمسار.
  4. تأكد أن الملف يعيد 200.
  5. اختبر الرئيسية ومقالًا وتصنيفًا وCSS وصورة.
  6. راجع إعداد رؤية محركات البحث وnoindex.
  7. راقب إعادة قراءة الملف وإحصاءات الزحف.

أمثلة على قواعد تبدو صحيحة لكنها خطرة

منع كل رابط يحتوي على علامة استفهام

Disallow: /*?

قد يمنع روابط معاينة أو صفحات ووظائف تحتاج إلى الزحف، ولا يميز بين معاملات التتبع والفلاتر المفيدة. افحص الأنماط وحدد المعامل الذي يسبب المساحة بدل قاعدة شاملة.

منع مجلد الإضافات

Disallow: /wp-content/plugins/

قد يحتوي المجلد على CSS وJavaScript مطلوبين لرسم الصفحة. لا تمنعه لمجرد أنه تقني. أصلح الملفات الزائدة عبر الأداء أو الحماية بدل حرمان Googlebot من الموارد الضرورية.

منع جميع ملفات JavaScript

Disallow: /*.js$

قاعدة واسعة قد تجعل الصفحات التي تعتمد على JavaScript غير مفهومة. اسمح بالعرض الكامل واستخدم تحسينات السرعة المناسبة بدل منع الموارد من الزحف.

فحص الملف بعد تغيير الاستضافة

عند النقل، قد يظهر ملف مختلف لأن الاستضافة القديمة كانت تولده ديناميكيًا والجديدة وجدت ملفًا فعليًا، أو لأن CDN ما زال يوجه إلى نسخة سابقة. افحص DNS والمضيف ونسخ www وبدون www، وقارن المحتوى وكود الاستجابة.

تأكد كذلك من عدم انتقال قواعد بيئة Staging إلى الموقع الجديد. اختبر Robots مع 301 وCanonical وSitemap ضمن قائمة النقل، لأن هذه الإشارات تعمل معًا في اكتشاف الروابط ومعالجتها.

متى تراجع الملف دوريًا؟

راجعه بعد تغيير القالب أو إضافة السيو أو الحماية أو CDN، وبعد إطلاق متجر أو لغة أو صب دومين، وبعد نقل الاستضافة، وعند ملاحظة تغير مفاجئ في الزحف أو الفهرسة. أما الموقع المستقر فيكفي توثيق القواعد ومراجعتها على فترات معقولة.

لا تعدل الملف لمجرد أن أداة تدقيق تقترح قاعدة عامة. اربط التعديل بمشكلة واضحة، واختبر الأثر، واحتفظ بتاريخ ونسخة احتياطية.

القرار النهائي قبل نشر أي قاعدة جديدة

قبل إضافة سطر إلى الملف، اكتب إجابة واضحة عن أربعة أسئلة: ما المسارات التي ستتأثر؟ ولماذا لا تريد زحفها؟ وهل تحتاج جوجل إلى دخولها لرؤية noindex أو Canonical أو روابط؟ وما الخطة إذا طابقت القاعدة URL مهمًا؟ إذا لم تستطع الإجابة، لا تنشر القاعدة بعد.

جهز ثلاثة أمثلة يجب منعها وثلاثة يجب السماح بها، واختبرها على نسخة القاعدة. راجع سطح المكتب والهاتف والموارد، لأن الصفحة قد تكون مسموحة لكن الملفات اللازمة لعرضها محظورة. ثم سجل اسم المسؤول وتاريخ التعديل والهدف والنتيجة المتوقعة.

بعد النشر، لا تعتبر فتح الملف دليلًا كافيًا على النجاح. افحص كود الاستجابة، واختبر URL منشورًا، وراجع سجل الزحف والتغطية خلال الأيام التالية. وإذا تغيرت بنية الموقع أو الإضافة التي تولد الروابط، أعد تقييم القاعدة؛ فما كان مناسبًا بالأمس قد يصبح واسعًا أو بلا فائدة.

القاعدة الجيدة تمنع مساحة محددة ثبت أنها غير مفيدة للزحف دون التأثير في المحتوى والموارد المهمة. أما القواعد العامة التي تُنسخ للاحتياط فقد تخلق مشكلة أكبر من المشكلة التي تحاول منعها. البساطة مع الاختبار والتوثيق هي أفضل سياسة لإدارة Robots في ووردبريس.

مصادر جوجل الرسمية

تعتمد الأمثلة السابقة على المبادئ المنشورة في وثائق Google Search Central. راجع المصادر عند تطبيق حالات متقدمة أو استهداف روبوت محدد، لأن الدعم والتفسير قد يختلفان بين محركات البحث وتتطور الوثائق بمرور الوقت.

الأسئلة الشائعة

ما هو ملف robots.txt في ووردبريس؟
هو ملف نصي في جذر النطاق يحدد المسارات التي يمكن لبرامج الزحف طلبها. يستخدم لإدارة الزحف وليس لحماية البيانات أو ضمان منع الصفحة من نتائج البحث.
أين يوجد ملف robots.txt؟
يوجد على جذر المضيف، مثل https://example.com/robots.txt. ولكل subdomain ملف مستقل على جذره.
ما أفضل ملف robots.txt لووردبريس؟
لا يوجد ملف واحد للجميع. غالبًا يكفي منع wp-admin والسماح بـadmin-ajax.php وإضافة Sitemap، ثم إضافة قواعد أخرى فقط بعد تحليل الروابط.
هل robots.txt يمنع الفهرسة؟
يمنع الزحف أساسًا، وقد يظل عنوان URL ظاهرًا إذا اكتشفه جوجل من روابط. لمنع صفحة عامة من النتائج استخدم noindex مع السماح بالزحف.
هل يمكن كتابة noindex داخل robots.txt؟
لا تدعم جوجل استخدام Noindex داخل ملف Robots. استخدم Robots meta في HTML أو ترويسة X-Robots-Tag.
هل يجب منع wp-content؟
لا تمنعه كاملًا؛ فهو يحتوي على صور وCSS وJavaScript قد يحتاجها جوجل لعرض الصفحة وفهمها.
كيف أضيف Sitemap إلى robots.txt؟
أضف سطرًا يحتوي على URL الكامل، مثل Sitemap: https://example.com/sitemap_index.xml، بعد التأكد من أن الخريطة تعمل.
كيف أحل محظور بواسطة robots.txt؟
حدد القاعدة التي تطابق الرابط، وعدّلها أو احذفها إذا كان المنع غير مقصود، ثم اختبر URL المنشور وراقب إعادة الزحف.
هل robots.txt يحمي الصفحات السرية؟
لا. الملف عام والزواحف غير الموثوقة قد تتجاهله. استخدم كلمة مرور وصلاحيات خادم لحماية المحتوى الخاص.
هل يحتاج الصب دومين إلى robots.txt خاص؟
نعم، لأن القواعد تطبق على المضيف الذي يستضيف الملف. ضع ملفًا على جذر الصب دومين وراجعه بصورة مستقلة.

الخلاصة

ضبط ملف robots.txt ووردبريس بصورة صحيحة يعتمد على فهم الفرق بين الزحف والفهرسة. استخدم الملف لإدارة وصول برامج الزحف إلى المسارات غير المهمة، ولا تستخدمه لإخفاء الأسرار أو اختيار Canonical أو تطبيق noindex. حافظ على القواعد بسيطة، واسمح بالموارد الضرورية، وأضف Sitemap الصحيحة.

قبل أي تعديل، خذ نسخة من الملف وحدد URLs التي يجب السماح بها ومنعها، ثم اختبر القواعد وراقب Search Console باستمرار بعد كل تغيير مهم. لا تنسخ ملفًا طويلًا من موقع آخر؛ فالأفضل لموقعك هو ما يتوافق مع بنيته وأهدافه. بهذه الطريقة من أكاديمية ويب تحصل على Robots واضح يساعد الزحف دون أن يتحول إلى سبب لاختفاء صفحاتك من جوجل.

How useful was this post?

Click on a star to rate it!

Average rating 4.6 / 5. Vote count: 70

No votes so far! Be the first to rate this post.

موضوعات ذات صلة

اترك تعليقاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *