ملف robots.txt: أهميته وطريقة التحكم في زحف محركات البحث
دليل مبسط لفهم ملف Robots.txt وإدارة الزحف والفهرسة في محركات البحث.
قد يبدو التحكم في وصول محركات البحث إلى موقعك مهمة تقنية بسيطة، لكن قاعدة واحدة غير دقيقة قد تمنع برامج الزحف من الوصول إلى صفحات مهمة، أو تستهلك موارد الزحف في عناوين URL لا تقدم قيمة حقيقية للزائر. لذلك يُعد فهم ملف robots.txt خطوة أساسية لكل من يدير موقعًا إلكترونيًا ويرغب في تحسين بنيته التقنية بصورة صحيحة.
ملف robots.txt هو ملف نصي عادي يوضَع في جذر الموقع، ويحتوي على تعليمات تساعد عناكب البحث في معرفة المسارات المسموح لها بالزحف إليها والمسارات التي لا يُراد الوصول إليها. وتوضح إرشادات Google الرسمية حول robots.txt أن الغرض الأساسي منه هو إدارة حركة الزحف، وليس ضمان حذف صفحة من نتائج البحث أو حماية المحتوى السري.
تزداد أهمية هذا الملف في المواقع الكبيرة والمتاجر الإلكترونية التي تضم صفحات بحث داخلية وفلاتر وحسابات عملاء ومسارات متعددة قد لا تحتاج محركات البحث إلى زيارتها باستمرار. ومع ذلك، لا توجد إعدادات موحدة تناسب جميع المواقع؛ فكل قاعدة يجب أن تعتمد على بنية موقعك ونظام إدارة المحتوى والصفحات التي تريد إتاحتها لمحركات البحث.
ستتعرف في هذا الدليل على طريقة إنشاء الملف وكتابة أوامره واختباره، والفرق بين منع الزحف ومنع الفهرسة، إلى جانب الأخطاء التي قد تؤثر في ظهور موقعك. ويساعدك فهم أساسيات تحسين محركات البحث على ربط هذه الإعدادات التقنية بالهدف الأوسع، وهو تسهيل اكتشاف المحتوى المهم وفهمه دون حشو أو قرارات عشوائية.
ما هو ملف robots.txt وما فائدته لموقعك؟
ملف robots.txt هو ملف نصي عادي يقدّم تعليمات إلى عناكب البحث حول الأجزاء التي يمكنها طلبها من الموقع، والمسارات التي يُفضّل عدم الزحف إليها. ويُستخدم أساسًا لتنظيم عملية الزحف وتقليل زيارة الصفحات أو الملفات غير الضرورية، وليس لإخفاء المحتوى من نتائج البحث أو حمايته من الوصول غير المصرح به.
قبل أن يبدأ محرّك بحث Google في استكشاف عدد من عناوين URL الخاصة بموقعك، تحاول برامج الزحف قراءة هذا الملف وفهم القواعد المكتوبة داخله. وبناءً على هذه القواعد، يحدد الزاحف المسارات المتاحة له والمسارات المحظورة، ما يمنح صاحب الموقع مستوى أفضل من التحكم في طريقة استهلاك موارد الزحف.
لكن وجود الملف لا يعني أن جميع الصفحات المحظورة ستُحذف تلقائيًا من فهرسة Google. فقد يظل عنوان URL ظاهرًا في نتائج البحث إذا اكتشفه المحرك من خلال رابط داخلي أو خارجي، حتى عندما يتعذر عليه قراءة محتوى الصفحة. ولهذا يجب التفريق بين إدارة الزحف ومنع الفهرسة، لأن لكل هدف طريقة تقنية مختلفة.
أين يوجد ملف robots.txt داخل الموقع؟
يتم وضع ملف robots.txt في جذر اسم النطاق، بحيث يمكن الوصول إليه بإضافة المسار /robots.txt بعد النطاق الرئيسي. ولا يؤدي وضعه داخل مجلد فرعي أو صفحة من صفحات الموقع إلى تطبيق القواعد على النطاق بالكامل، لأن محركات البحث تبحث عنه في موقع محدد ومعروف مسبقًا.
يجب أن يكون الملف متاحًا للقراءة العامة، ومكتوبًا بصيغة نصية سليمة. كما يجب أن تتوافق قواعده مع البروتوكول والنطاق الذي يعمل عليه الموقع؛ فالملف الموجود على النطاق الفرعي لا يتحكم تلقائيًا في النطاق الرئيسي، والنسخة المرتبطة ببروتوكول مختلف قد تُعامل بوصفها موقعًا مستقلًا.
في بعض أنظمة إدارة المحتوى قد يُنشأ الملف افتراضيًا بصورة ديناميكية، لذلك لا يعني عدم العثور عليه داخل مدير الملفات أنه غير موجود. الأفضل أولًا فتح مساره عبر المتصفح، ثم مراجعة طريقة إنشائه داخل ووردبريس أو الإضافة المسؤولة عن إعدادات تحسين محركات البحث.
ما الغرض من استخدام ملف robots.txt؟
الغرض الأساسي من استخدام الملف هو إدارة الوصول إلى المسارات التي لا تحتاج محركات البحث إلى زيارتها بصورة متكررة. قد يشمل ذلك صفحات البحث الداخلية، بعض مسارات التصفية، مناطق الإدارة أو نسخًا مؤقتة من الملفات، بشرط التأكد من أن منعها لن يحجب محتوى مهمًا أو موارد يحتاج إليها Google لفهم الصفحة وعرضها بصورة صحيحة.
يمكن أن يفيد الملف بصورة أكبر في المواقع الكبيرة والمتاجر الإلكترونية التي تنشئ أعدادًا ضخمة من عناوين URL نتيجة الفلاتر والمعلمات وصفحات الحسابات. أما المواقع الصغيرة، فلا ينبغي أن تتعامل مع ما يُعرف بميزانية الزحف باعتبارها مشكلة مؤكدة؛ ففي كثير من الحالات يكون تنظيم بنية الموقع والروابط الداخلية وجودة المحتوى أكثر أهمية.
ولا يُستخدم الملف لحماية لوحات التحكم أو بيانات العملاء أو الملفات السرية. فالروبوتات غير الموثوقة قد تتجاهل تعليماته، كما أن المسارات المكتوبة داخله يمكن لأي شخص الاطلاع عليها. لذلك يجب حماية المحتوى الحساس بواسطة تسجيل الدخول، وصلاحيات الوصول، وإعدادات الخادم، وليس بمجرد إضافة أمر منع داخل الملف.
كيف تتعامل محركات البحث مع ملفات robots.txt؟
عندما يصل برنامج زحف موثوق إلى موقعك، فإنه يطلب الملف ويحلل مجموعات القواعد الموجودة فيه قبل زيارة المسارات. تبدأ كل مجموعة عادةً بتحديد اسم برنامج الزحف من خلال أمر User-agent، ثم تأتي أوامر تحدد ما يُسمح بطلبه وما يُمنع الوصول إليه.
تطبّق Google قواعد الملف على مستوى مسارات عناوين URL، وتدعم أوامر أساسية مثل User-agent وDisallow وAllow، إلى جانب الإشارة إلى موقع ملف Sitemap. وإذا وُجد أكثر من أمر ينطبق على المسار نفسه، تعتمد النتيجة على مدى تحديد القاعدة وطريقة مطابقة المسار، وليس على ترتيب الكلمات بطريقة عشوائية.
لهذا السبب، يجب عدم نسخ ملف robots.txt من موقع آخر أو إنشاء قواعد عامة من دون فهم بنية موقعك. الأمر الذي يعمل لمتجر إلكتروني قد يمنع صفحات أساسية في موقع خدمي، وما يناسب موقعًا تجريبيًا قد يتسبب في اختفاء محتوى مهم إذا انتقل إلى الموقع الفعلي دون مراجعة.
أهمية ملف robots.txt في تحسين محركات البحث
تظهر أهمية ملف robots.txt في قدرته على تنظيم العلاقة بين موقعك وبرامج الزحف، من خلال توضيح المسارات التي يُسمح لمحركات البحث بزيارتها والمسارات التي لا تحتاج إلى استكشافها. وعند إعداد الملف بصورة صحيحة، يمكن تقليل الطلبات غير الضرورية ومساعدة عناكب البحث على التركيز بصورة أفضل على الصفحات المهمة.
لا يرفع الملف ترتيب الموقع بصورة مباشرة، ولا يضمن وصول صفحة معينة إلى المراكز الأولى في نتائج البحث. ومع ذلك، فإن أخطاء إعداده قد تؤثر سلبًا في قدرة Google على قراءة المحتوى أو الوصول إلى الموارد اللازمة لفهم الصفحة، وهو ما يجعل مراجعته جزءًا مهمًا من تحليل السيو التقني للموقع.
تزداد قيمة الملف عندما يحتوي الموقع على عدد كبير من عناوين URL الناتجة عن صفحات البحث الداخلي أو الفلاتر أو معلمات التتبع أو الحسابات الشخصية. ففي هذه الحالات، قد تتمكن من استخدام قواعد مدروسة للحد من الزحف إلى المسارات منخفضة القيمة، من دون التأثير في صفحات المنتجات أو الخدمات أو المقالات التي تستهدف الظهور في البحث.
كيف يساعد الملف في التحكم في زحف محركات البحث؟
تبدأ عملية الزحف عندما يكتشف محرّك بحث Google عنوان URL جديدًا من خلال رابط أو خريطة موقع أو مصدر خارجي. وقبل طلب بعض صفحات الموقع، يراجع برنامج الزحف القواعد الموجودة في ملف robots.txt لمعرفة ما إذا كان مسموحًا له بالدخول إلى المسار المطلوب.
تمنح هذه العملية صاحب الموقع وسيلة لتنظيم حركة الزحف، خاصةً عندما توجد مسارات لا تقدم محتوى مفيدًا لمحركات البحث. ويمكن على سبيل المثال منع الوصول إلى صفحات إدارية أو نتائج بحث داخلية أو ملفات مؤقتة، بشرط ألا تكون هذه المسارات ضرورية لعرض المحتوى الأساسي أو لفهم تصميم الصفحة.
لكن التحكم في الزحف لا يعني التحكم الكامل في فهرسة عنوان URL. فإذا كان الرابط المحظور معروفًا لمحركات البحث من خلال صفحات أخرى، فقد يظهر عنوانه في نتائج البحث من دون عرض وصف واضح لمحتواه، لأن محرك البحث لم يتمكن من الزحف إلى الصفحة وقراءة تفاصيلها.
تنظيم الوصول إلى صفحات موقعك الإلكتروني
يساعد التنظيم الجيد للملف على التمييز بين الصفحات التي تستحق أن تزورها محركات البحث بانتظام وبين المسارات التي تؤدي وظائف داخلية فقط. ويجب اتخاذ هذا القرار وفق وظيفة كل صفحة، وليس اعتمادًا على اسم المجلد وحده أو على ملف منسوخ من موقع إلكتروني آخر.
في المتاجر الإلكترونية، قد تتولد آلاف الصفحات بسبب خيارات اللون والمقاس والترتيب والتصفية. وقد تؤدي هذه العناوين إلى عرض محتوى متشابه عبر عدة روابط، لكن منعها جميعًا باستخدام ملف robots.txt ليس دائمًا الحل الأنسب؛ فقد تحتاج بعض الحالات إلى استخدام وسوم الفهرسة أو الروابط الأساسية Canonical أو تحسين بنية الموقع.
كذلك يجب تجنب منع ملفات CSS أو JavaScript أو الصور المهمة لمجرد تقليل عدد الملفات التي يزحف إليها Google. فقد يحتاج محرّك البحث إلى هذه الموارد لعرض الصفحة وفهم تجربة استخدامها، وخاصةً عند تقييم توافقها مع الجوال وطريقة تقديم المحتوى للمستخدم.
ولهذا يجب أن يسبق تعديل الملف تحديد واضح لما تريد تحقيقه: هل ترغب في تقليل الزحف إلى صفحات مكررة؟ أم معالجة مسارات لا قيمة لها؟ أم منع الوصول المؤقت إلى قسم معين؟ الإجابة الدقيقة تمنع استخدام أوامر واسعة قد تضر الموقع بدلًا من تحسينه.
هل يؤثر ملف robots.txt في فهرسة الصفحات وترتيبها؟
التأثير المباشر للملف يتعلق بالزحف، بينما تعتمد الفهرسة على قرار محرك البحث بإضافة الصفحة إلى قاعدة بياناته، ويعتمد الترتيب على مدى ملاءمة الصفحة وجودتها وسلطتها وعوامل أخرى متعددة. لذلك من الضروري فهم الفرق بين المراحل الثلاث وعدم التعامل معها باعتبارها عملية واحدة.
إذا منعت Google من الزحف إلى صفحة، فلن يتمكن محرك البحث غالبًا من قراءة محتواها أو رؤية وسم noindex الموجود بداخلها. لهذا قد يكون استخدام أمر المنع داخل الملف غير مناسب عندما يكون الهدف الحقيقي هو إزالة الصفحة من نتائج البحث.
أما إذا كانت الصفحة متاحة للزحف وتحمل توجيهًا صحيحًا بعدم الفهرسة، فيستطيع محرك البحث زيارة الصفحة وقراءة التوجيه واتخاذ القرار المناسب. وقد تختلف مدة تنفيذ التغيير وفق حالة الموقع وتكرار الزحف، لذلك لا ينبغي توقع اختفاء الصفحة فور تعديل الإعدادات.
يمكن متابعة حالة الملف والمشكلات المرتبطة به من خلال تقرير ملفات robots.txt في Google Search Console، إلى جانب مراجعة تقارير فهرسة الصفحات وفحص عناوين URL المهمة بعد أي تعديل تقني.
في النهاية، لا يمثل ملف robots.txt أداة مستقلة لتحسين الترتيب، لكنه جزء من منظومة أوسع تشمل بنية الموقع والروابط الداخلية وخريطة الموقع وجودة المحتوى وسرعة الصفحات. وكلما كانت تعليماته دقيقة ومحدودة بالهدف المطلوب، انخفض احتمال أن تمنع محركات البحث من الوصول إلى محتوى يستحق الظهور.
حدود الحظر باستخدام ملف robots.txt
يساعد ملف robots.txt على إدارة طلبات الزحف، لكنه لا يمنح صاحب الموقع سيطرة مطلقة على ظهور عناوين URL في نتائج البحث. وتبدأ كثير من المشكلات عندما يُستخدم الملف لغرض لم يُصمم من أجله، مثل حذف الصفحات من Google أو حماية البيانات الحساسة أو منع جميع برامج الإنترنت من الوصول إلى المحتوى.
تلتزم عناكب البحث الموثوقة عادةً بالقواعد المكتوبة داخل الملف، بينما تستطيع البرامج الضارة أو الروبوتات غير المتوافقة تجاهلها تمامًا. لذلك يجب النظر إلى هذه التعليمات باعتبارها توجيهات لإدارة الزحف، لا جدار حماية أو وسيلة لإخفاء الملفات الخاصة.
هل يمنع ملف robots.txt الوصول إلى الصفحات نهائيًا؟
لا يمنع الملف المستخدمين أو المتصفحات أو جميع برامج الزحف من فتح الصفحة. فإذا كان عنوان URL معروفًا، فقد يتمكن أي شخص من الوصول إليه مباشرةً ما لم تكن هناك آلية حماية أخرى مثل تسجيل الدخول أو تقييد الصلاحيات أو إعدادات الخادم.
كذلك لا يعني أمر Disallow أن الصفحة حُذفت من الموقع. هو يخبر برنامج زحف محددًا بعدم طلب المسار، بينما تظل الصفحة موجودة ومتاحة إذا لم تكن محمية بوسائل تقنية أخرى.
لهذا لا ينبغي وضع مسارات تحتوي على بيانات العملاء أو المستندات الداخلية أو النسخ الاحتياطية داخل الملف على أساس أنها أصبحت سرية. بل قد يؤدي ذلك إلى كشف أسماء المجلدات الحساسة، لأن محتويات ملف robots.txt متاحة للعامة ويمكن الاطلاع عليها من خلال المتصفح.
الفرق بين منع الزحف ومنع ظهور الصفحة في Google
منع الزحف يعني أن محرّك بحث Google لن يطلب محتوى الصفحة وفق القاعدة المحددة. أما منع الفهرسة فيعني مطالبة محرك البحث بعدم الاحتفاظ بالصفحة ضمن فهرسه أو عرضها في نتائج البحث. ورغم ارتباط العمليتين، فإن كل واحدة منهما تؤدي وظيفة مختلفة.
قد يكتشف Google عنوان URL محظورًا عبر رابط موجود في صفحة أخرى أو من خلال مصدر خارجي. وفي هذه الحالة يمكن أن يظهر العنوان داخل نتائج البحث دون مقتطف واضح، لأن محرّك البحث يعرف بوجود الصفحة لكنه لم يتمكن من قراءة محتواها.
إذا كان الهدف هو منع فهرسة صفحة متاحة للعامة، فقد يكون استخدام توجيه noindex داخل الصفحة أكثر ملاءمة. ويجب في هذه الحالة السماح لمحركات البحث بالزحف إليها حتى تتمكن من قراءة التوجيه. أما الجمع بين منع الزحف ووسم noindex فقد يمنع Google من رؤية الوسم أصلًا.
وعندما تكون الصفحة قد ظهرت بالفعل في نتائج البحث، لا يكفي تعديل ملف robots.txt دائمًا لإزالتها. يجب تحديد سبب ظهورها، ومراجعة حالة الفهرسة، ثم اختيار الإجراء المناسب مثل noindex أو الحذف أو إعادة التوجيه أو تقييد الوصول، بحسب وظيفة الصفحة.
لماذا لا يُستخدم ملف robots.txt لحماية المحتوى الحساس؟
ملف robots.txt عبارة عن ملف نصي عام، ولذلك لا يوفر تشفيرًا أو تحققًا من هوية المستخدم أو تحكمًا في الصلاحيات. كما أن كتابة مسار حساس بداخله قد تجذب الانتباه إلى مكانه بدلًا من إخفائه.
ينبغي حماية لوحات الإدارة والملفات الخاصة وبيانات العملاء باستخدام وسائل فعلية، مثل كلمات المرور القوية والمصادقة متعددة العوامل وتحديد أدوار المستخدمين ومنع الوصول من الخادم. وقد تحتاج بعض الملفات أيضًا إلى نقلها خارج المجلد المتاح للعامة.
وفي المواقع الإلكترونية التي تستقبل بيانات أو مدفوعات، يجب ألا يُستخدم الملف بديلًا عن إجراءات الأمان أو حماية الموقع من الاختراق. فإدارة الزحف وتحقيق الأمان هدفان مختلفان، ولكل منهما أدوات وإعدادات خاصة.
متى يكون الحظر باستخدام الملف مناسبًا؟
يكون الحظر مناسبًا عندما توجد مسارات لا يحتاج محرك البحث إلى طلبها، ولا يرغب صاحب الموقع في استهلاك موارد الزحف عليها. من أمثلة ذلك بعض صفحات الإدارة ونتائج البحث الداخلية والمسارات المؤقتة وعناوين URL الناتجة عن معلمات لا تقدم محتوى مستقلًا.
ومع ذلك، يجب فحص كل مسار قبل منعه. فقد يؤدي حظر مجلد كامل إلى منع صفحات أو ملفات مهمة دون قصد، خاصةً عندما يحتوي المجلد على موارد CSS أو JavaScript أو صور يحتاج إليها Google لعرض الصفحة وفهمها.
كما يجب تجنب استخدام قواعد واسعة لمجرد تقليل عدد الصفحات. فقد تكون معالجة بنية الروابط أو إعداد الوسوم الأساسية أو تحسين نظام إدارة المحتوى أكثر دقة من منع مسارات كاملة باستخدام ملف robots.txt.
ما الذي يحدث إذا تعذر على Google قراءة الملف؟
يعتمد سلوك محركات البحث على سبب تعذر الوصول إلى الملف ونوع استجابة الخادم. فقد تتعامل Google مؤقتًا بحذر إذا واجهت خطأ في الخادم، بينما يمكن أن تختلف النتيجة إذا كان الملف غير موجود أصلًا.
لذلك يجب التأكد من أن الملف يُفتح بصورة طبيعية، وأن الخادم يعرضه كملف نصي، وأنه لا يخضع لإعادة توجيه خاطئة أو حماية تمنع عناكب البحث من قراءته. كما ينبغي فحصه بعد نقل الموقع أو تغيير الاستضافة أو إعداد شبكة توصيل المحتوى.
وتساعد المراجعة الدورية على اكتشاف الحالات التي تظل فيها قواعد خاصة بالنسخة التجريبية داخل الموقع الفعلي. فهذا الخطأ قد يؤدي إلى منع الزحف عن الموقع بالكامل، خصوصًا إذا بقي الأمر Disallow: / بعد إطلاق الموقع.
ما محتويات ملف robots.txt وأهم أوامره؟
يتكوّن ملف robots.txt من مجموعات من القواعد، وتبدأ كل مجموعة عادةً بتحديد برنامج الزحف المقصود، ثم توضيح المسارات المسموح له بالوصول إليها أو المحظورة عليه. ويمكن أن يحتوي الملف أيضًا على عنوان خريطة الموقع لمساعدة محركات البحث في العثور على عناوين URL المهمة.
يجب كتابة الأوامر بصيغة واضحة داخل ملف نصي عادي، مع استخدام مسارات تبدأ من جذر الموقع. وقد يؤدي خطأ بسيط في أحد المسارات أو استخدام قاعدة واسعة إلى حظر عدد من الصفحات يفوق ما كان صاحب الموقع يقصده، لذلك ينبغي فهم وظيفة كل أمر قبل إضافته.
تحديد عناكب البحث باستخدام أمر User-agent
يحدد أمر User-agent برنامج الزحف الذي ستُطبّق عليه القواعد التالية. ويمكن تخصيص مجموعة من التعليمات لبرنامج معين، مثل Googlebot، أو استخدام علامة النجمة لتطبيق المجموعة على جميع برامج الزحف التي تلتزم ببروتوكول robots.txt.
مثال لتطبيق القواعد على جميع عناكب البحث:
User-agent: *
تعني علامة النجمة أن الأوامر الموجودة أسفلها موجهة إلى جميع برامج الزحف، ما لم توجد مجموعة أكثر تحديدًا لبرنامج معين. ولا يعني ذلك أن كل روبوت موجود على الإنترنت ملزم بتنفيذ التعليمات، لأن الروبوتات غير الموثوقة قد تتجاهلها.
مثال لتوجيه قواعد إلى Googlebot فقط:
User-agent: Googlebot
في هذه الحالة تُطبّق القواعد التابعة للمجموعة على برنامج الزحف الرئيسي التابع لمحرّك بحث Google، بينما تحتاج البرامج الأخرى إلى مجموعة منفصلة أو إلى قاعدة عامة.
منع الزحف إلى المسارات باستخدام أمر Disallow
يُستخدم أمر Disallow لتحديد صفحة أو مجلد لا تريد أن يزحف إليه برنامج البحث المذكور في سطر User-agent. ويُكتب المسار بالنسبة إلى جذر اسم النطاق، وليس باستخدام عنوان URL الكامل.
مثال على منع الزحف إلى مجلد خاص:
User-agent: *
Disallow: /private/
تطلب هذه القاعدة من برامج الزحف عدم زيارة العناوين الموجودة داخل المسار /private/. ومع ذلك، لا تحمي القاعدة المجلد من دخول المستخدمين، ولا تضمن إزالة عناوينه من نتائج البحث.
مثال على منع الزحف إلى صفحة واحدة:
User-agent: *
Disallow: /temporary-page.html
تستهدف القاعدة عنوانًا محددًا داخل الموقع. ويجب مراجعة المسار بدقة، لأن اختلاف الشرطة المائلة أو بنية عنوان URL قد يجعل الأمر لا يطابق الصفحة المقصودة.
تحذير مهم: استخدام الأمر التالي يمنع برامج الزحف المستهدفة من الوصول إلى جميع صفحات الموقع:
User-agent: *
Disallow: /
قد تكون هذه القاعدة مفيدة بصورة مؤقتة داخل موقع تجريبي، لكنها خطيرة عند بقائها في الموقع المنشور. ومن الأخطاء العملية الشائعة إطلاق النسخة النهائية مع استمرار هذا الحظر، ما يمنع Google من الزحف إلى المحتوى الأساسي.
السماح بالوصول باستخدام أمر Allow
يساعد أمر Allow على السماح بالزحف إلى مسار محدد داخل مجلد محظور بصورة أوسع. ويكون مفيدًا عندما تريد منع قسم كامل، مع استثناء ملف أو صفحة يحتاج إليها محرك البحث.
مثال على السماح بصفحة داخل مجلد محظور:
User-agent: *
Disallow: /private/
Allow: /private/public-page.html
تمنع القاعدة الأولى الزحف إلى المجلد، بينما تسمح القاعدة الثانية بالوصول إلى الصفحة المحددة داخله. وعند وجود أكثر من قاعدة تطابق عنوان URL نفسه، تنظر Google إلى القاعدة الأكثر تحديدًا وفق طول المسار المطابق.
لا ينبغي استخدام Allow بطريقة عشوائية أو إضافته إلى كل مجموعة من الأوامر. فهو مطلوب فقط عندما توجد قاعدة حظر عامة ويحتاج الموقع إلى استثناء مسار أكثر تحديدًا.
إضافة عنوان خريطة الموقع باستخدام أمر Sitemap
يمكن إضافة عنوان ملف Sitemap داخل robots.txt لمساعدة محركات البحث في اكتشاف خريطة الموقع. ويجب كتابة عنوان URL كاملًا، متضمنًا البروتوكول واسم النطاق والمسار الصحيح للملف، لأن Google لا يفترض تلقائيًا وجود نسخة بديلة بين HTTP وHTTPS أو بين النطاق الذي يبدأ بـwww والنطاق الذي لا يبدأ بها.
Sitemap: https://example.com/sitemap.xml
قد تستخدم مواقع ووردبريس عنوانًا مختلفًا، مثل ملف ينتهي باسم sitemap_index.xml، وفق الإضافة أو نظام إدارة المحتوى المستخدم. ولهذا يجب فتح رابط خريطة الموقع والتأكد من أنه يعمل قبل وضعه داخل الملف.
لا يحل أمر Sitemap محل إرسال الخريطة أو متابعتها من خلال Google Search Console، لكنه يوفر إشارة إضافية تساعد برامج البحث على العثور عليها. ويمكن فهم دورها بصورة أوسع من خلال دليل خريطة الموقع XML والفرق بينها وبين تعليمات التحكم في الزحف.
هل ترتيب الأوامر داخل الملف يغيّر النتيجة؟
يجب تنظيم الأوامر داخل مجموعات واضحة، بحيث يبدأ كل قسم باسم User-agent وتتبعه القواعد الخاصة به. لكن عند تعارض Allow وDisallow على عنوان URL واحد، لا تعتمد Google ببساطة على الأمر المكتوب أولًا؛ بل تطبّق القاعدة الأكثر تحديدًا، وإذا تساوى طول القاعدتين يُرجّح السماح بالزحف.
كما يمكن كتابة أكثر من سطر Disallow أو Allow داخل المجموعة نفسها، ولا حاجة إلى تكرار User-agent قبل كل مسار. ويساعد الفصل المنظم بين المجموعات على تقليل الأخطاء وتسهيل مراجعة الملف مستقبلًا.
مثال عملي على ملف robots.txt قابل للتخصيص
النموذج التعليمي:
User-agent: *
Disallow: /private/
Disallow: /internal-search/
Allow: /private/public-resource/
Sitemap: https://example.com/sitemap.xml
يطلب هذا النموذج من برامج الزحف تجنب مجلد خاص ومسار لنتائج البحث الداخلية، مع السماح بالوصول إلى مورد محدد داخل المجلد المحظور، ثم يوضح مكان خريطة الموقع.
هذا المثال ليس ملفًا جاهزًا للنسخ إلى أي موقع. يجب استبدال المسارات وعنوان الخريطة بما يتوافق مع بنية موقعك، والتحقق من أن الصفحات المستهدفة لا تشمل منتجات أو تصنيفات أو ملفات ضرورية لعرض المحتوى وفهمه.
كيفية إنشاء ملف robots.txt بطريقة صحيحة
تبدأ عملية إنشاء ملف robots.txt بفهم بنية الموقع قبل كتابة أي أمر. فالهدف ليس إضافة أكبر عدد ممكن من قواعد المنع، بل تحديد المسارات التي لا تحتاج محركات البحث إلى الزحف إليها، مع الحفاظ على وصولها إلى الصفحات والملفات المهمة.
ويختلف الإعداد المناسب من موقع إلى آخر حسب نظام إدارة المحتوى، وطبيعة الصفحات، وطريقة إنشاء عناوين URL. لذلك لا يُنصح باستخدام نموذج جاهز قبل التأكد من توافقه مع موقعك الإلكتروني، لأن قاعدة صحيحة في موقع قد تحجب محتوى أساسيًا في موقع آخر.
الإرشادات الأساسية قبل إنشاء الملف
قبل إنشاء الملف، احصر أقسام الموقع وحدد وظيفة كل مسار. ابدأ بالصفحات التي تريد ظهورها في نتائج البحث، مثل المقالات والخدمات والمنتجات والتصنيفات، ثم ميّز بينها وبين المسارات الإدارية أو الصفحات الداخلية التي لا تقدم محتوى مستقلًا للباحث.
راجع أيضًا عناوين URL الناتجة عن البحث الداخلي والفلاتر ومعلمات التتبع. وجود عدد كبير من هذه الروابط لا يعني ضرورة حظرها جميعًا؛ فقد يكون بعضها مفيدًا للزائر، بينما يحتاج بعضها الآخر إلى معالجة مختلفة باستخدام الوسوم الأساسية أو توجيهات الفهرسة.
ومن المهم معرفة ما إذا كان موقعك يحتوي بالفعل على ملف robots.txt. يمكنك التحقق من ذلك بفتح اسم النطاق وإضافة المسار /robots.txt. وإذا ظهر محتوى موجود، فراجعه قبل استبداله، لأن بعض أنظمة إدارة المحتوى أو إضافات SEO تنشئ الملف بصورة تلقائية.
احتفظ بنسخة من المحتوى الحالي قبل إجراء أي تعديل. هذه الخطوة البسيطة تساعدك على استعادة الإعداد السابق إذا أدى التغيير إلى منع الزحف إلى صفحات مهمة أو ظهور تحذيرات داخل Google Search Console.
طريقة كتابة قواعد ملف robots.txt
يجب إنشاء الملف بصيغة نصية عادية، من دون تنسيقات خاصة أو جداول أو أكواد HTML. ويُسمى الملف robots.txt بالحروف نفسها، حتى تتمكن محركات البحث من العثور عليه في المكان المتوقع.
تبدأ كل مجموعة من القواعد بتحديد برنامج الزحف عن طريق أمر User-agent، ثم تُكتب أسفله أوامر السماح والمنع المناسبة. ويمكن استخدام علامة النجمة لتطبيق التعليمات على جميع عناكب البحث الملتزمة بالبروتوكول.
مثال أساسي:
User-agent: *
Disallow: /private/
تعني هذه القاعدة أن برامج الزحف المستهدفة لا ينبغي أن تطلب الصفحات الموجودة داخل مجلد /private/. ولا تحتاج إلى كتابة اسم النطاق كاملًا، لأن المسار يُقرأ نسبةً إلى جذر الموقع.
إذا أردت منع صفحة محددة، فاكتب مسارها الكامل داخل الموقع بدلًا من حظر المجلد بالكامل. كلما كانت القاعدة أكثر تحديدًا، انخفض احتمال التأثير في صفحات أخرى لم تكن تقصد منعها.
مثال على منع صفحة واحدة:
User-agent: *
Disallow: /temporary-offer/
راجع الحروف والشرطات المائلة بعناية، لأن عناوين URL قد تتأثر بطريقة كتابة المسار. كما يجب تجنب استخدام مساحات غير ضرورية أو علامات غير مدعومة داخل الأوامر.
ضبط الأوامر وفق بنية صفحات الموقع
يعتمد ضبط الملف على الطريقة التي ينظم بها الموقع صفحاته. فإذا كانت صفحات الإدارة موجودة داخل مجلد واضح ولا يحتاج Google إلى الزحف إليه، يمكن منع هذا المسار مع السماح بأي ملف ضروري داخله عند الحاجة.
أما إذا كانت الصفحات المهمة وغير المهمة موجودة داخل المجلد نفسه، فقد يكون حظر المجلد بالكامل قرارًا غير آمن. في هذه الحالة، يجب استهداف المسارات بدقة أو معالجة المشكلة من داخل نظام إدارة المحتوى.
يجب كذلك فحص ملفات CSS وJavaScript والصور قبل منع أي مجلد يحتوي عليها. فمحركات البحث تستخدم هذه الملفات في عرض الصفحة وفهم تصميمها وتجربتها، وقد يؤدي منعها إلى صعوبة تقييم المحتوى أو توافقه مع الجوال.
وفي المتاجر الإلكترونية، لا تحظر صفحات المنتجات أو التصنيفات الأساسية لمجرد وجودها داخل مسارات طويلة. كما ينبغي مراجعة صفحات السلة وإتمام الطلب والحسابات والفلاتر كلٌّ على حدة، لأن لكل نوع منها وظيفة مختلفة.
بعد تحديد قواعد المنع، أضف عنوان خريطة الموقع إذا كانت متاحة. يساعد ذلك عناكب البحث على اكتشاف الصفحات التي تريد التركيز عليها، بينما يتولى ملف robots.txt توضيح تفضيلات الزحف إلى المسارات الأخرى.
مثال:
Sitemap: https://example.com/sitemap.xml
استبدل هذا العنوان بالرابط الفعلي لخريطة موقعك، وتأكد من أنه يعمل ولا يعرض خطأ أو يعيد التوجيه إلى صفحة غير صحيحة.
مثال عملي على ملف robots.txt قابل للتخصيص
يمكن استخدام المثال التالي لفهم طريقة تنظيم القواعد، لكنه لا يُعد إعدادًا جاهزًا لجميع المواقع:
User-agent: *
Disallow: /private/
Disallow: /internal-search/
Disallow: /temporary/
Allow: /private/public-file/
Sitemap: https://example.com/sitemap.xml
تخبر القواعد السابقة محركات البحث بعدم الزحف إلى ثلاثة مسارات، مع السماح بالوصول إلى ملف محدد داخل أحد المجلدات المحظورة، ثم توضح مكان خريطة الموقع.
قبل تطبيق المثال، استبدل جميع المسارات بما يناسب موقعك، وافتح كل مسار في المتصفح للتأكد من وظيفته. لا تستخدم أسماء افتراضية مثل /private/ إذا لم تكن موجودة بالفعل، ولا تضف أوامر لا تؤدي وظيفة واضحة.
ويجب الحذر الشديد من القاعدة التالية:
User-agent: *
Disallow: /
فهي تطلب من جميع برامج الزحف المستهدفة عدم الوصول إلى الموقع بالكامل. قد تُستخدم مؤقتًا في بعض البيئات التجريبية، لكن بقاءها بعد إطلاق الموقع يمكن أن يمنع Google من قراءة الصفحات الجديدة أو تحديث المحتوى الموجود.
حفظ الملف ورفعه إلى جذر الموقع
بعد الانتهاء من كتابة القواعد، احفظ الملف بترميز نصي مناسب، ومن الأفضل استخدام UTF-8. ثم ارفعه إلى المجلد الرئيسي الذي يحتوي على ملفات الموقع، وليس داخل مجلد فرعي مثل الصور أو القوالب.
يجب أن يكون الوصول إلى الملف ممكنًا من خلال المسار الرئيسي للنطاق، مثل إضافة /robots.txt بعد اسم الموقع. وإذا كان الموقع يعمل على نطاق فرعي، فيحتاج هذا النطاق عادةً إلى ملفه الخاص، لأن ملف النطاق الرئيسي لا يطبق قواعده تلقائيًا على جميع النطاقات الفرعية.
بعد الرفع، افتح الملف عبر المتصفح وتأكد من ظهور الأوامر بصيغة نصية واضحة. إذا ظهر خطأ 404 أو صفحة HTML أو طلب تسجيل دخول، فلن تتمكن محركات البحث من قراءته بالطريقة المطلوبة.
مراجعة الملف قبل اعتماده
اختبر عينة من الصفحات المهمة بعد إنشاء الملف. تأكد من السماح بالوصول إلى الصفحة الرئيسية وصفحات الخدمات والمقالات والمنتجات والتصنيفات التي تريد فهرستها، ثم راجع المسارات المحظورة للتأكد من أنها لا تحتوي على محتوى يستحق الظهور.
لا تعتمد على النظر إلى القواعد فقط؛ فقد يبدو المسار صحيحًا لكنه يطابق عددًا أكبر من عناوين URL مما تتوقع. ولذلك يجب اختبار العناوين الفعلية ومتابعة تقارير الزحف والفهرسة بعد نشر التعديلات.
وأخيرًا، وثّق سبب كل قاعدة داخل ملف العمل الخاص بالموقع. عندما يعرف الفريق لماذا تم منع مسار معين، يصبح تعديل الملف مستقبلًا أكثر أمانًا، خاصةً بعد إعادة التصميم أو تغيير نظام إدارة المحتوى أو إضافة أقسام جديدة.
كيفية إنشاء ملف robots.txt بطريقة صحيحة
تبدأ عملية إنشاء ملف robots.txt بفهم بنية الموقع قبل كتابة أي أمر. فالهدف ليس إضافة أكبر عدد ممكن من قواعد المنع، بل تحديد المسارات التي لا تحتاج محركات البحث إلى الزحف إليها، مع الحفاظ على وصولها إلى الصفحات والملفات المهمة.
ويختلف الإعداد المناسب من موقع إلى آخر حسب نظام إدارة المحتوى، وطبيعة الصفحات، وطريقة إنشاء عناوين URL. لذلك لا يُنصح باستخدام نموذج جاهز قبل التأكد من توافقه مع موقعك الإلكتروني، لأن قاعدة صحيحة في موقع قد تحجب محتوى أساسيًا في موقع آخر.
الإرشادات الأساسية قبل إنشاء الملف
قبل إنشاء الملف، احصر أقسام الموقع وحدد وظيفة كل مسار. ابدأ بالصفحات التي تريد ظهورها في نتائج البحث، مثل المقالات والخدمات والمنتجات والتصنيفات، ثم ميّز بينها وبين المسارات الإدارية أو الصفحات الداخلية التي لا تقدم محتوى مستقلًا للباحث.
راجع أيضًا عناوين URL الناتجة عن البحث الداخلي والفلاتر ومعلمات التتبع. وجود عدد كبير من هذه الروابط لا يعني ضرورة حظرها جميعًا؛ فقد يكون بعضها مفيدًا للزائر، بينما يحتاج بعضها الآخر إلى معالجة مختلفة باستخدام الوسوم الأساسية أو توجيهات الفهرسة.
ومن المهم معرفة ما إذا كان موقعك يحتوي بالفعل على ملف robots.txt. يمكنك التحقق من ذلك بفتح اسم النطاق وإضافة المسار /robots.txt. وإذا ظهر محتوى موجود، فراجعه قبل استبداله، لأن بعض أنظمة إدارة المحتوى أو إضافات SEO تنشئ الملف بصورة تلقائية.
احتفظ بنسخة من المحتوى الحالي قبل إجراء أي تعديل. هذه الخطوة البسيطة تساعدك على استعادة الإعداد السابق إذا أدى التغيير إلى منع الزحف إلى صفحات مهمة أو ظهور تحذيرات داخل Google Search Console.
طريقة كتابة قواعد ملف robots.txt
يجب إنشاء الملف بصيغة نصية عادية، من دون تنسيقات خاصة أو جداول أو أكواد HTML. ويُسمى الملف robots.txt بالحروف نفسها، حتى تتمكن محركات البحث من العثور عليه في المكان المتوقع.
تبدأ كل مجموعة من القواعد بتحديد برنامج الزحف عن طريق أمر User-agent، ثم تُكتب أسفله أوامر السماح والمنع المناسبة. ويمكن استخدام علامة النجمة لتطبيق التعليمات على جميع عناكب البحث الملتزمة بالبروتوكول.
مثال أساسي:
User-agent: *
Disallow: /private/
تعني هذه القاعدة أن برامج الزحف المستهدفة لا ينبغي أن تطلب الصفحات الموجودة داخل مجلد /private/. ولا تحتاج إلى كتابة اسم النطاق كاملًا، لأن المسار يُقرأ نسبةً إلى جذر الموقع.
إذا أردت منع صفحة محددة، فاكتب مسارها الكامل داخل الموقع بدلًا من حظر المجلد بالكامل. كلما كانت القاعدة أكثر تحديدًا، انخفض احتمال التأثير في صفحات أخرى لم تكن تقصد منعها.
مثال على منع صفحة واحدة:
User-agent: *
Disallow: /temporary-offer/
راجع الحروف والشرطات المائلة بعناية، لأن عناوين URL قد تتأثر بطريقة كتابة المسار. كما يجب تجنب استخدام مساحات غير ضرورية أو علامات غير مدعومة داخل الأوامر.
ضبط الأوامر وفق بنية صفحات الموقع
يعتمد ضبط الملف على الطريقة التي ينظم بها الموقع صفحاته. فإذا كانت صفحات الإدارة موجودة داخل مجلد واضح ولا يحتاج Google إلى الزحف إليه، يمكن منع هذا المسار مع السماح بأي ملف ضروري داخله عند الحاجة.
أما إذا كانت الصفحات المهمة وغير المهمة موجودة داخل المجلد نفسه، فقد يكون حظر المجلد بالكامل قرارًا غير آمن. في هذه الحالة، يجب استهداف المسارات بدقة أو معالجة المشكلة من داخل نظام إدارة المحتوى.
يجب كذلك فحص ملفات CSS وJavaScript والصور قبل منع أي مجلد يحتوي عليها. فمحركات البحث تستخدم هذه الملفات في عرض الصفحة وفهم تصميمها وتجربتها، وقد يؤدي منعها إلى صعوبة تقييم المحتوى أو توافقه مع الجوال.
وفي المتاجر الإلكترونية، لا تحظر صفحات المنتجات أو التصنيفات الأساسية لمجرد وجودها داخل مسارات طويلة. كما ينبغي مراجعة صفحات السلة وإتمام الطلب والحسابات والفلاتر كلٌّ على حدة، لأن لكل نوع منها وظيفة مختلفة.
بعد تحديد قواعد المنع، أضف عنوان خريطة الموقع إذا كانت متاحة. يساعد ذلك عناكب البحث على اكتشاف الصفحات التي تريد التركيز عليها، بينما يتولى ملف robots.txt توضيح تفضيلات الزحف إلى المسارات الأخرى.
مثال:
Sitemap: https://example.com/sitemap.xml
استبدل هذا العنوان بالرابط الفعلي لخريطة موقعك، وتأكد من أنه يعمل ولا يعرض خطأ أو يعيد التوجيه إلى صفحة غير صحيحة.
مثال عملي على ملف robots.txt قابل للتخصيص
يمكن استخدام المثال التالي لفهم طريقة تنظيم القواعد، لكنه لا يُعد إعدادًا جاهزًا لجميع المواقع:
User-agent: *
Disallow: /private/
Disallow: /internal-search/
Disallow: /temporary/
Allow: /private/public-file/
Sitemap: https://example.com/sitemap.xml
تخبر القواعد السابقة محركات البحث بعدم الزحف إلى ثلاثة مسارات، مع السماح بالوصول إلى ملف محدد داخل أحد المجلدات المحظورة، ثم توضح مكان خريطة الموقع.
قبل تطبيق المثال، استبدل جميع المسارات بما يناسب موقعك، وافتح كل مسار في المتصفح للتأكد من وظيفته. لا تستخدم أسماء افتراضية مثل /private/ إذا لم تكن موجودة بالفعل، ولا تضف أوامر لا تؤدي وظيفة واضحة.
ويجب الحذر الشديد من القاعدة التالية:
User-agent: *
Disallow: /
فهي تطلب من جميع برامج الزحف المستهدفة عدم الوصول إلى الموقع بالكامل. قد تُستخدم مؤقتًا في بعض البيئات التجريبية، لكن بقاءها بعد إطلاق الموقع يمكن أن يمنع Google من قراءة الصفحات الجديدة أو تحديث المحتوى الموجود.
حفظ الملف ورفعه إلى جذر الموقع
بعد الانتهاء من كتابة القواعد، احفظ الملف بترميز نصي مناسب، ومن الأفضل استخدام UTF-8. ثم ارفعه إلى المجلد الرئيسي الذي يحتوي على ملفات الموقع، وليس داخل مجلد فرعي مثل الصور أو القوالب.
يجب أن يكون الوصول إلى الملف ممكنًا من خلال المسار الرئيسي للنطاق، مثل إضافة /robots.txt بعد اسم الموقع. وإذا كان الموقع يعمل على نطاق فرعي، فيحتاج هذا النطاق عادةً إلى ملفه الخاص، لأن ملف النطاق الرئيسي لا يطبق قواعده تلقائيًا على جميع النطاقات الفرعية.
بعد الرفع، افتح الملف عبر المتصفح وتأكد من ظهور الأوامر بصيغة نصية واضحة. إذا ظهر خطأ 404 أو صفحة HTML أو طلب تسجيل دخول، فلن تتمكن محركات البحث من قراءته بالطريقة المطلوبة.
مراجعة الملف قبل اعتماده
اختبر عينة من الصفحات المهمة بعد إنشاء الملف. تأكد من السماح بالوصول إلى الصفحة الرئيسية وصفحات الخدمات والمقالات والمنتجات والتصنيفات التي تريد فهرستها، ثم راجع المسارات المحظورة للتأكد من أنها لا تحتوي على محتوى يستحق الظهور.
لا تعتمد على النظر إلى القواعد فقط؛ فقد يبدو المسار صحيحًا لكنه يطابق عددًا أكبر من عناوين URL مما تتوقع. ولذلك يجب اختبار العناوين الفعلية ومتابعة تقارير الزحف والفهرسة بعد نشر التعديلات.
وأخيرًا، وثّق سبب كل قاعدة داخل ملف العمل الخاص بالموقع. عندما يعرف الفريق لماذا تم منع مسار معين، يصبح تعديل الملف مستقبلًا أكثر أمانًا، خاصةً بعد إعادة التصميم أو تغيير نظام إدارة المحتوى أو إضافة أقسام جديدة.
كيفية إنشاء ملف robots.txt لمواقع ووردبريس
يتيح ووردبريس أكثر من طريقة لإنشاء ملف robots.txt أو تعديله، ويعتمد الاختيار المناسب على إعدادات الموقع والإضافات المستخدمة ومستوى الخبرة التقنية لدى المسؤول عنه. وفي بعض المواقع ينشئ نظام إدارة المحتوى ملفًا افتراضيًا بصورة ديناميكية، حتى إذا لم تجد ملفًا فعليًا داخل مجلدات الاستضافة.
قبل إجراء أي تعديل، افتح المسار الخاص بالملف عبر المتصفح للتعرف على القواعد الحالية. فقد تكون إحدى إضافات تحسين محركات البحث قد أنشأت التعليمات بالفعل، واستبدالها دون مراجعة قد يؤدي إلى حذف إعدادات مهمة أو إضافة أوامر متعارضة.
التحقق من ملف robots.txt الحالي في ووردبريس
يمكنك التحقق من وجود الملف بإضافة /robots.txt إلى اسم نطاق موقعك. إذا ظهر ملف نصي يحتوي على أوامر مثل User-agent وDisallow، فهذا يعني أن موقعك يقدم ملفًا يمكن لعناكب البحث قراءته.
قد يكون الملف الظاهر افتراضيًا منشأً بواسطة ووردبريس، وليس ملفًا محفوظًا داخل مدير الملفات. في هذه الحالة، يمكن تعديل محتواه من خلال إضافة SEO تدعم هذه الخاصية، أو إنشاء ملف نصي فعلي ورفعه إلى جذر الموقع ليحل محل النسخة الديناميكية.
راجع محتوى الملف قبل تعديله، وتأكد من عدم وجود أمر يمنع الزحف إلى الموقع بالكامل. كما يجب فحص رابط خريطة الموقع الموجود داخله والتأكد من توافقه مع الإضافة المستخدمة لإنشاء ملفات Sitemap.
إنشاء الملف باستخدام إضافات تحسين محركات البحث
توفر بعض إضافات SEO في ووردبريس أداة لإنشاء ملف robots.txt وتحريره من لوحة التحكم. وتُعد هذه الطريقة مناسبة للمستخدم الذي لا يرغب في التعامل مباشرةً مع ملفات الاستضافة، لكنها تتطلب فهم الأوامر قبل حفظ أي تغييرات.
بعد الدخول إلى إعدادات الإضافة، ابحث عن قسم الأدوات أو تحرير الملفات أو إعدادات الزحف. تختلف أسماء الخيارات ومواقعها باختلاف الإضافة وإصدارها، وقد لا تكون خاصية التحرير متاحة في جميع الإضافات.
لا تضف قائمة طويلة من أوامر المنع لمجرد أنها تظهر في نماذج جاهزة على الإنترنت. ابدأ بالقواعد الضرورية فقط، ثم اختبر تأثيرها في صفحات موقعك. وتساعد مراجعة إضافات ووردبريس واختيار الأدوات المناسبة على تجنب تثبيت إضافات متعددة تؤدي الوظيفة نفسها أو تنشئ إعدادات متعارضة.
تحرير ملف robots.txt من مدير ملفات الاستضافة
يمكن إنشاء الملف يدويًا من خلال مدير الملفات في لوحة الاستضافة. انتقل إلى المجلد الرئيسي للموقع، والذي يُسمى في كثير من الاستضافات public_html، ثم ابحث عن ملف باسم robots.txt.
إذا كان الملف موجودًا، احتفظ بنسخة احتياطية منه قبل التعديل. وإذا لم يكن موجودًا، أنشئ ملفًا نصيًا جديدًا بالاسم نفسه، مع التأكد من كتابته بحروف صغيرة وعدم إضافة امتداد آخر مثل .txt.txt.
اكتب القواعد المطلوبة داخل الملف، ثم احفظه وافتح مساره من المتصفح للتأكد من ظهوره بشكل صحيح. ويجب أن يعرض الخادم محتوى نصيًا مباشرًا، لا صفحة خطأ أو صفحة تسجيل دخول أو قالبًا من قوالب ووردبريس.
إنشاء الملف باستخدام FTP أو SFTP
يمكن للمستخدمين الأكثر خبرة إنشاء الملف على جهاز الكمبيوتر باستخدام محرر نصوص عادي، ثم رفعه إلى جذر الموقع عبر FTP أو SFTP. وتُفضل طريقة SFTP عندما تكون متاحة لأنها توفر اتصالًا أكثر أمانًا أثناء نقل الملفات.
بعد رفع الملف، تأكد من أن صلاحياته تسمح للخادم ومحركات البحث بقراءته دون منح صلاحيات تعديل غير ضرورية. كما ينبغي التحقق من عدم وجود نسخة أخرى في مجلد فرعي، لأن الملف الذي يطبق على النطاق يجب أن يكون موجودًا في الجذر.
إذا كان الموقع يعمل من خلال أكثر من نطاق فرعي، فقد يحتاج كل نطاق فرعي إلى إعداد مستقل. فالملف الخاص بالنطاق الرئيسي لا يتحكم تلقائيًا في صفحات متجر أو مدونة موجودة على نطاق فرعي منفصل.
مثال مناسب لملف robots.txt في ووردبريس
يمكن استخدام المثال التالي كنقطة تعليمية لفهم الإعداد الشائع في مواقع ووردبريس:
User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Sitemap: https://example.com/sitemap_index.xmlيطلب هذا المثال من محركات البحث عدم الزحف إلى مجلد إدارة ووردبريس، مع السماح بالوصول إلى ملف admin-ajax.php الذي قد تحتاج إليه بعض وظائف الموقع. كما يوضح مكان خريطة الموقع، ويجب استبدال النطاق التجريبي بعنوان موقعك الحقيقي.
قد يختلف رابط Sitemap من موقع إلى آخر. فبعض الإضافات تستخدم sitemap_index.xml، بينما تستخدم أنظمة أخرى عنوانًا مختلفًا. لذلك يجب فتح الرابط والتحقق منه بدل نسخه دون مراجعة.
ولا يعني هذا المثال أنه مناسب لكل موقع ووردبريس. قد يحتوي موقعك على متجر إلكتروني أو نظام عضويات أو صفحات مخصصة تحتاج إلى قواعد إضافية، وقد لا يحتاج إلى بعض الأوامر الموجودة في ملفات أخرى.
هل يجب حظر مجلدات ووردبريس الأخرى؟
لا توجد حاجة إلى حظر كل مجلد يحمل اسمًا تقنيًا داخل ووردبريس. فقد تحتوي مجلدات القوالب والإضافات والوسائط على ملفات CSS وJavaScript وصور يحتاج إليها محرّك بحث Google لعرض الصفحات وفهم تصميمها.
يمكن أن يؤدي حظر مجلد /wp-content/ بالكامل إلى منع الوصول إلى موارد أساسية، لذلك لا يُنصح باستخدام هذا الأمر بصورة عامة. وإذا وُجد ملف أو مسار معين لا يحتاج إلى الزحف، فمن الأفضل استهدافه بدقة بدل حظر المجلد بأكمله.
كذلك لا ينبغي منع صفحات التصنيفات أو الوسوم أو الأرشيف بصورة عشوائية من خلال الملف. قرار إبقائها في نتائج البحث أو استبعادها يرتبط بقيمة المحتوى وبنية الموقع واستراتيجية الفهرسة، وليس فقط بإعدادات الزحف.
ملف robots.txt في متاجر ووكومرس
ينشئ متجر ووكومرس صفحات وظيفية مثل السلة وإتمام الطلب وحساب العميل، إلى جانب عناوين URL قد تنتج عن البحث والتصفية والترتيب. وقد لا تحتاج بعض هذه المسارات إلى الظهور في نتائج البحث، لكن طريقة التعامل معها يجب أن تُحدد بعد تحليل بنية المتجر.
يجب الحفاظ على وصول محركات البحث إلى صفحات المنتجات والتصنيفات والصور والملفات التي يعتمد عليها عرض المتجر. وحظر أحد هذه المسارات عن طريق الخطأ قد يمنع Google من قراءة المنتجات أو فهم محتوى الصفحات بصورة صحيحة.
لا يمثل استخدام ملف robots.txt حلًا كاملًا لمشكلة الروابط الناتجة عن الفلاتر والمعلمات. فقد تحتاج بعض المتاجر إلى الجمع بين الروابط الأساسية وتوجيهات الفهرسة وتحسين الربط الداخلي وإدارة عناوين URL، إلى جانب ضبط قواعد الزحف عند الضرورة.
بعد تعديل الملف في متجر قائم، اختبر عينة من صفحات المنتجات والتصنيفات والسلة والحساب. كما يُنصح بمراجعة الإعداد بعد تركيب إضافة جديدة أو تغيير القالب، لأن هذه التغييرات قد تنشئ مسارات أو ملفات لم تكن موجودة عند إعداد القواعد السابقة.
رفع ملف robots.txt وتحديثه على موقعك
بعد الانتهاء من إنشاء ملف robots.txt ومراجعة قواعده، تأتي مرحلة رفعه إلى الموقع والتأكد من أن محركات البحث تستطيع الوصول إليه. ولا يكفي حفظ الملف داخل جهازك أو وضعه في أي مجلد داخل الاستضافة؛ إذ يجب أن يظهر في المكان المحدد الذي تبحث فيه برامج الزحف.
تحتاج هذه المرحلة إلى عناية خاصة، لأن رفع نسخة غير صحيحة أو استبدال الملف الحالي دون الاحتفاظ بنسخة احتياطية قد يؤدي إلى منع الزحف عن صفحات مهمة. ويُفضل إجراء التعديل في وقت يمكنك خلاله اختبار الموقع ومتابعة النتائج، بدل تنفيذ تغيير واسع ثم تركه دون مراجعة.
رفع الملف إلى المجلد الرئيسي للموقع
يجب وضع ملف robots.txt في جذر المضيف الذي تريد تطبيق القواعد عليه. فإذا كان الموقع يعمل على النطاق الرئيسي، يُرفع الملف إلى المجلد الذي يحتوي عادةً على ملفات تشغيل الموقع الأساسية، مثل public_html في كثير من لوحات الاستضافة.
لا تضع الملف داخل مجلد القالب أو الإضافات أو الصور أو أي مسار فرعي، لأن محركات البحث لن تتعامل معه بوصفه الملف الرئيسي للنطاق. ويجب أن يكون اسمه مكتوبًا بدقة على النحو التالي: robots.txt، من دون إضافة امتداد آخر أو تغيير في الأحرف.
إذا كان موقعك يستخدم نطاقات فرعية، مثل متجر أو مدونة تعمل على نطاق منفصل، فقد يحتاج كل نطاق فرعي إلى ملف خاص به. فالملف الموجود على النطاق الرئيسي لا يفرض قواعده تلقائيًا على المضيفات الأخرى.
وينطبق الأمر نفسه على اختلاف البروتوكول أو اسم المضيف؛ لذلك يجب التأكد من أنك تعدّل النسخة المرتبطة بعنوان الموقع الفعلي الذي تستخدمه محركات البحث، وليس نسخة قديمة أو نطاقًا تجريبيًا.
كيفية التأكد من ظهور الملف عبر المتصفح
بعد رفع الملف، افتح عنوانه المباشر من خلال إضافة /robots.txt إلى اسم النطاق. يجب أن تظهر القواعد كنص واضح داخل المتصفح، من دون تصميم الصفحة أو قوائم الموقع أو طلب تسجيل الدخول.
راجع الأوامر الظاهرة وقارنها بالنسخة التي رفعتها. فإذا ظهر محتوى مختلف، فقد يكون الموقع يستخدم ملفًا ديناميكيًا من نظام إدارة المحتوى، أو توجد ذاكرة تخزين مؤقت تعرض نسخة سابقة، أو تعمل إضافة SEO على توليد الملف بطريقة منفصلة.
تحقق كذلك من استجابة الخادم. ظهور خطأ أو إعادة توجيه غير مقصودة أو منع الوصول إلى الملف قد يؤثر في قدرة Google على معرفة تعليمات الزحف الخاصة بموقعك. ولا يكفي أن يفتح الملف لديك وأنت مسجل الدخول؛ يجب أن يكون متاحًا بصورة عامة لبرامج البحث.
إذا كنت تستخدم شبكة توصيل محتوى أو نظام تخزين مؤقت، امسح الذاكرة المؤقتة بعد التحديث ثم افتح الملف في نافذة خاصة. تساعد هذه الخطوة على التأكد من أن النسخة الجديدة أصبحت متاحة للزوار وعناكب البحث، وليست ظاهرة لك فقط بسبب إعدادات المتصفح.
إرسال تحديثات ملف robots.txt إلى Google
لا يتم رفع الملف إلى Google بصورة منفصلة؛ بل تعدّله داخل موقعك أولًا، ثم تكتشف برامج الزحف النسخة الجديدة عند زيارة عنوان الملف. وتوضح إرشادات Google لتحديث ملف robots.txt أن برامج الزحف تعيد فحص الملف تلقائيًا وتحدّث النسخة المخزنة لديها عند اكتشاف التغييرات. :contentReference[oaicite:0]{index=0}
يمكنك بعد ذلك فتح تقرير ملفات robots.txt داخل Google Search Console لمراجعة النسخة التي عثر عليها Google، ومعرفة آخر وقت تم فيه الزحف إلى الملف، والاطلاع على الأخطاء أو التحذيرات التي تم اكتشافها.
من المهم التأكد من أنك تستخدم حساب Search Console المرتبط بالموقع الصحيح. فإذا كانت لديك خصائص متعددة للنطاق أو للبروتوكولات المختلفة، راجع الخاصية التي تمثل النسخة الأساسية المستخدمة حاليًا.
لا تتوقع أن تتغير حالة جميع الصفحات فور تعديل الملف. فتحديث النسخة التي يحتفظ بها Google ومعاودة الزحف إلى عناوين URL المتأثرة قد يحتاجان إلى بعض الوقت، وفق حجم الموقع وأهمية الصفحات ومعدل زيارة برامج الزحف له.
متى تحتاج إلى طلب إعادة الزحف؟
في معظم الحالات، لا تحتاج إلى طلب إعادة الزحف إلى ملف robots.txt يدويًا، لأن Google يعيد فحصه بصورة متكررة. ومع ذلك، يتيح تقرير الملف في Search Console طلب إعادة الزحف عندما يكون التعديل مهمًا أو عندما تريد تسريع اكتشاف نسخة جديدة بعد إصلاح خطأ واضح. :contentReference[oaicite:1]{index=1}
قد يكون الطلب مفيدًا بعد إزالة قاعدة كانت تمنع الزحف إلى الموقع بالكامل، أو بعد تصحيح مسار أدى إلى حجب صفحات المنتجات أو الخدمات، أو عند نقل الموقع من بيئة تجريبية إلى النسخة المنشورة.
لكن طلب إعادة الزحف لا يضمن زيارة جميع الصفحات المتأثرة فورًا، ولا يعني إدراجها مباشرةً في نتائج البحث. فهو يساعد Google على إعادة قراءة قواعد الملف، بينما تظل عملية الزحف إلى الصفحات وفهرستها خاضعة لعوامل أخرى.
إذا كان التغيير يتعلق بصفحة واحدة مهمة بعد السماح بالوصول إليها، يمكن استخدام أداة فحص عنوان URL في Search Console لمراجعة حالتها وطلب فهرستها عند الحاجة. أما المواقع الكبيرة، فمن الأفضل دعم اكتشاف الصفحات المهمة بواسطة خريطة موقع محدثة وروابط داخلية واضحة.
متابعة حالة الملف بعد التحديث
بعد رفع النسخة الجديدة، لا تكتفِ بالتأكد من أن الملف يفتح في المتصفح. راجع تقرير robots.txt وتقارير فهرسة الصفحات، ثم اختبر مجموعة من عناوين URL المهمة لمعرفة ما إذا كانت القواعد تسمح بالزحف إليها.
ابدأ بالصفحة الرئيسية وصفحات الخدمات أو المنتجات والتصنيفات والمقالات الأساسية. بعد ذلك اختبر عددًا من المسارات التي قررت منعها، للتأكد من أن القاعدة تؤثر فيها فقط ولا تمتد إلى أقسام أخرى.
راقب كذلك التغيرات غير المتوقعة، مثل انخفاض عدد الصفحات التي يزحف إليها Google أو ظهور رسالة تفيد بأن الصفحة محظورة بواسطة robots.txt. لا يعني كل تحذير وجود مشكلة؛ فقد يكون الحظر مقصودًا، لكن يجب التأكد من أن عنوان URL لا يمثل محتوى تريد ظهوره في البحث.
في حال استمرار Google في عرض نسخة قديمة، راجع التخزين المؤقت وإعدادات الخادم وإضافات ووردبريس وشبكة توصيل المحتوى. قد تعرض بعض الإعدادات محتوى مختلفًا بحسب برنامج الزحف أو الموقع الجغرافي، وهو ما يحتاج إلى معالجة من الاستضافة أو المسؤول التقني.
تحديث الملف بعد نقل الموقع أو إعادة تصميمه
يجب مراجعة ملف robots.txt بعد أي تغيير كبير في الموقع، مثل الانتقال إلى استضافة جديدة أو تعديل اسم النطاق أو تغيير بنية الروابط أو إطلاق تصميم جديد. فقد تصبح بعض المسارات القديمة غير موجودة، أو تظهر مجلدات وصفحات جديدة تحتاج إلى قرار واضح بشأن الزحف.
ومن أخطر السيناريوهات بقاء قواعد الموقع التجريبي في النسخة المنشورة. فقد يستخدم فريق التطوير الأمر Disallow: / لمنع الزحف أثناء العمل، ثم ينسى إزالته عند الإطلاق، ما يؤدي إلى إغلاق الموقع أمام محركات البحث.
راجع أيضًا عنوان خريطة الموقع بعد النقل. فإذا تغير النطاق أو البروتوكول أو اسم ملف Sitemap، يجب تحديثه داخل الملف والتأكد من أن الرابط الجديد يعمل ويحتوي على عناوين الصفحات الصحيحة.
احتفظ بسجل مبسط يتضمن تاريخ التعديل والقواعد التي تغيرت وسبب كل تغيير. يساعد ذلك على معرفة مصدر المشكلة إذا ظهرت أخطاء لاحقًا، ويمنع أعضاء الفريق من حذف أو إضافة أوامر من دون فهم أثرها في الزحف إلى صفحات الموقع.
كيفية اختبار ملف robots.txt واكتشاف الأخطاء
لا يكتمل إعداد ملف robots.txt بمجرد كتابة الأوامر ورفعه إلى الموقع، لأن الخطأ قد يكون في مسار واحد فقط لكنه يؤثر في مجموعة كبيرة من الصفحات. لذلك يجب اختبار الملف قبل اعتماده، ثم متابعة حالة الزحف بعد نشر التعديلات للتأكد من أن محركات البحث تصل إلى المحتوى المهم دون عوائق.
تبدأ المراجعة بالتأكد من أن الملف متاح في جذر الموقع ويُعرض كنص عادي، ثم فحص كل قاعدة وفق عناوين URL حقيقية من موقعك. فالاعتماد على قراءة الأوامر وحدها قد لا يكشف المطابقات غير المقصودة أو المسارات التي تختلف عن الشكل المتوقع.
اختبار القواعد والمسارات قبل اعتمادها
ابدأ بإنشاء قائمة قصيرة من الصفحات الأساسية التي يجب السماح بالزحف إليها، مثل الصفحة الرئيسية وصفحات الخدمات والمنتجات والتصنيفات والمقالات. وبعد ذلك، أضف مجموعة من المسارات التي تريد منعها، مثل صفحات الإدارة أو نتائج البحث الداخلية أو المناطق المؤقتة.
قارن كل عنوان URL بالقواعد المكتوبة داخل الملف. فإذا كان لديك أمر يمنع مجلدًا كاملًا، فتحقق مما إذا كانت توجد داخله صفحة أو صورة أو ملف JavaScript يحتاج إليه الموقع. وقد تحتاج في هذه الحالة إلى تضييق قاعدة الحظر أو إضافة أمر Allow لمسار محدد.
على سبيل المثال، إذا احتوى الملف على القاعدة التالية:
User-agent: * Disallow: /search/يجب التأكد من أن جميع عناوين URL التي تبدأ بالمسار /search/ تمثل نتائج بحث داخلية فعلًا، وأن المجلد لا يحتوي على صفحة أساسية ترغب في ظهورها ضمن نتائج البحث.
ومن الأفضل اختبار الصفحات على نسخة تجريبية أولًا عند إجراء تغييرات واسعة، لكن يجب منع فهرسة النسخة التجريبية بوسائل مناسبة مع تقييد الوصول إليها، بدل الاعتماد على ملف robots.txt وحده بوصفه أداة حماية.
فتح ملف robots.txt مباشرة عبر المتصفح
افتح عنوان الملف من خلال كتابة اسم النطاق متبوعًا بالمسار /robots.txt. يجب أن يظهر المحتوى كنص واضح، وأن يتطابق مع آخر نسخة تم حفظها أو رفعها إلى الاستضافة.
إذا ظهر خطأ يفيد بأن الصفحة غير موجودة، فقد يكون الملف محفوظًا في مجلد غير صحيح. وإذا ظهر تصميم الموقع بدل النص، فقد يعالج نظام إدارة المحتوى الطلب بوصفه صفحة عادية، أو توجد قاعدة إعادة توجيه تمنع الوصول المباشر إلى الملف.
أما إذا ظهرت نسخة قديمة، فراجع التخزين المؤقت داخل الموقع والاستضافة وشبكة توصيل المحتوى. وبعد مسح الذاكرة المؤقتة، افتح الملف من نافذة خاصة أو متصفح آخر للتأكد من أن النسخة الجديدة متاحة بصورة عامة.
فحص عناوين URL المهمة بعد التعديل
بعد التأكد من ظهور الملف، اختبر عددًا من عناوين URL الفعلية بدل الاكتفاء بالمسارات النظرية. ركز أولًا على الصفحات التي تستقبل زيارات أو تحقق تحويلات، ثم انتقل إلى الصفحات الجديدة والأقسام التي تغيرت قواعدها.
تحقق من أن صفحات المنتجات والخدمات والتصنيفات والمقالات المهمة غير مشمولة بأي أمر منع. كما يجب التأكد من السماح بالوصول إلى الصور وملفات CSS وJavaScript الضرورية لعرض الصفحة وفهم محتواها.
إذا ظهر أن صفحة مهمة محظورة، لا تكتفِ بإزالة أقرب قاعدة تراها. راجع جميع مجموعات User-agent، فقد تكون هناك تعليمات مخصصة لـGooglebot وأخرى عامة تنطبق على عناكب البحث المختلفة.
الاطلاع على حالة ملف robots.txt وتقارير الزحف
يساعد Google Search Console على متابعة حالة الملف ومعرفة ما إذا تمكن محرّك بحث Google من قراءته، إضافة إلى مراجعة وقت آخر زحف وأي مشكلات تم اكتشافها. ويجب استخدام الخاصية التي تمثل النسخة الأساسية من موقعك، خاصةً إذا كانت لديك خصائص متعددة للنطاق أو البروتوكول.
راجع أيضًا تقارير فهرسة الصفحات وابحث عن الحالات التي توضح أن الزحف محظور بواسطة robots.txt. ليس كل ظهور لهذه الحالة خطأ؛ فقد تكون الصفحة محظورة عمدًا، لكن يجب التأكد من أنها ليست منتجًا أو خدمة أو مقالة تريد ظهورها في نتائج البحث.
يمكن استخدام فحص عنوان URL لمراجعة صفحة محددة، ومعرفة ما إذا كان Google يستطيع الوصول إليها وما إذا كانت هناك مشكلة أخرى تتعلق بالفهرسة. ويجب الفصل بين الحظر بواسطة الملف وبين الأسباب الأخرى، مثل وسم noindex أو إعادة التوجيه أو الخطأ في الخادم.
معالجة الأخطاء التي تمنع الوصول إلى الصفحات المهمة
عندما تكتشف أن صفحة مهمة محظورة، حدد القاعدة المسؤولة عن الحظر أولًا. قد تكون القاعدة تستهدف الصفحة مباشرة، أو تمنع مجلدًا رئيسيًا يحتوي عليها، أو تستخدم نمطًا واسعًا يطابق عددًا من المسارات دون قصد.
إذا كانت القاعدة أوسع من المطلوب، استبدلها بمسار أكثر تحديدًا. فبدلًا من منع قسم كامل، يمكنك حظر صفحة وظيفية أو مجموعة محددة من عناوين URL، مع الحفاظ على وصول محركات البحث إلى المحتوى الذي يستحق الفهرسة.
بعد تعديل القاعدة، احفظ النسخة الجديدة وامسح التخزين المؤقت، ثم افتح الملف واختبر عنوان URL مرة أخرى. لا تعتبر المشكلة منتهية بمجرد تغيير النص؛ فالتأكد من وصول النسخة الجديدة إلى Google جزء أساسي من عملية الإصلاح.
أخطاء الصياغة والمسارات التي يجب مراجعتها
تنتج بعض المشكلات من طريقة كتابة الملف، وليس من القرار نفسه. لذلك راجع اسم الأمر والنقطتين والمسافة والمسار، وتأكد من عدم استخدام عنوان URL كامل في موضع يحتاج إلى مسار يبدأ من جذر الموقع.
من الأخطاء التي يجب الانتباه إليها اختلاف الأحرف الكبيرة والصغيرة في المسارات، أو نسيان الشرطة المائلة، أو كتابة اسم الملف بصورة غير صحيحة. كما قد يؤدي استخدام علامات أو أنماط دون فهم طريقة مطابقتها إلى توسيع نطاق الحظر.
راجع كذلك المجموعات المكررة الخاصة ببرنامج الزحف نفسه، لأن Google قد يجمع القواعد المتوافقة بدل التعامل مع كل مجموعة باعتبارها منفصلة تمامًا. ويساعد تنظيم التعليمات داخل مجموعة واضحة على تقليل التعارض وتسهيل صيانة الملف.
ماذا تفعل بعد إصلاح الخطأ؟
بعد نشر الإصلاح، تابع الصفحات المتأثرة خلال الفترة التالية، ولا تتوقع تحديث حالة الزحف والفهرسة فورًا. يحتاج محرّك البحث إلى إعادة قراءة الملف ثم زيارة عناوين URL التي أصبحت متاحة وفق معدل الزحف الخاص بالموقع.
تأكد من وجود الصفحات المهمة داخل خريطة الموقع ومن ارتباطها بصفحات أخرى عبر روابط داخلية واضحة. فالسماح بالزحف لا يعني أن Google سيكتشف الصفحة تلقائيًا إذا كانت معزولة ولا توجد إشارات تساعد على الوصول إليها.
وأخيرًا، احتفظ بسجل يتضمن القاعدة التي سببت المشكلة وتاريخ تعديلها والصفحات المتأثرة. يفيد هذا السجل عند تحديث الموقع مستقبلًا، ويمنع تكرار الخطأ بعد تغيير القالب أو الإضافة أو بنية عناوين URL.
أفضل الممارسات لإعداد ملف robots.txt بفعالية
يعتمد نجاح ملف robots.txt على الدقة والبساطة أكثر من كثرة الأوامر. فكل قاعدة إضافية توسّع مساحة الاحتمالات والأخطاء، لذلك يجب أن يحتوي الملف على التعليمات التي تؤدي وظيفة واضحة فقط، مع حذف أي سطر قديم أو غير مرتبط بالبنية الحالية للموقع.
كما ينبغي التعامل مع الملف بوصفه جزءًا من منظومة تحسين محركات البحث، لا إعدادًا منفصلًا يمكن نسخه مرة واحدة ونسيانه. فالتغييرات التي تطرأ على الصفحات والقوالب والإضافات ونظام إدارة المحتوى قد تجعل بعض القواعد القديمة غير مناسبة بمرور الوقت.
استخدم قواعد محددة بدل الحظر الواسع
كلما كانت قاعدة المنع أكثر اتساعًا، زاد احتمال تأثيرها في صفحات لم تكن تقصد حظرها. لذلك يُفضل استهداف المسار المطلوب بدقة، بدل منع مجلد رئيسي يحتوي على أنواع متعددة من المحتوى والملفات.
على سبيل المثال، إذا كانت المشكلة مقتصرة على صفحات البحث الداخلي، فلا داعي إلى منع قسم كامل من الموقع قد يضم صفحات مهمة. حدّد النمط الذي تنشئه خاصية البحث أو الفلاتر، ثم اختبر مجموعة من عناوين URL قبل اعتماد القاعدة.
ويجب استخدام الأمر Disallow: / بحذر شديد، لأنه يمنع برامج الزحف المستهدفة من الوصول إلى الموقع بالكامل. لا ينبغي أن يوجد هذا الأمر في الموقع المنشور إلا في حالة مؤقتة ومدروسة، مع وجود خطة واضحة لإزالته قبل الإطلاق.
اسمح بالوصول إلى ملفات العرض المهمة
تحتاج محركات البحث إلى قراءة بعض ملفات CSS وJavaScript والصور حتى تتمكن من عرض الصفحة بطريقة قريبة من تجربة المستخدم. ولذلك قد يؤدي منع مجلدات القوالب أو الإضافات أو الوسائط بالكامل إلى صعوبة فهم المحتوى وتصميم الصفحة.
قبل حظر أي مجلد تقني، افحص الملفات الموجودة داخله وحدد ما إذا كانت الصفحة تعتمد عليها. فإذا كان المسار يحتوي على موارد تستخدم في القوائم أو النوافذ أو التصميم المتجاوب أو تحميل المحتوى، فمن الأفضل السماح بالوصول إليها.
وفي مواقع ووردبريس، لا يُنصح عادةً بمنع مجلد /wp-content/ بالكامل، لأنه قد يضم صورًا وملفات تنسيق وبرمجيات يحتاج إليها محرّك بحث Google عند عرض صفحات الموقع.
لا تستخدم الملف بدل توجيهات الفهرسة
إذا كان الهدف هو منع صفحة من الظهور في نتائج البحث، فلا تعتمد على ملف robots.txt وحده. فالملف يدير الزحف، لكنه لا يضمن إزالة عنوان URL من الفهرس، خاصةً إذا اكتشف Google الصفحة من خلال روابط داخلية أو خارجية.
قد يكون توجيه noindex مناسبًا لبعض الصفحات، بشرط السماح لمحركات البحث بالزحف إليها حتى تتمكن من قراءة التوجيه. أما حظر الصفحة داخل الملف مع إضافة noindex بداخلها، فقد يمنع محرّك البحث من الوصول إلى التوجيه نفسه.
وفي حالات أخرى، قد يكون الحل الصحيح هو حذف الصفحة أو إعادة توجيهها أو حمايتها بكلمة مرور أو ضبط الوسم الأساسي Canonical. يعتمد القرار على وظيفة الصفحة وما إذا كان المحتوى مكررًا أو منتهيًا أو خاصًا بالمستخدمين.
استخدم ملفًا مستقلًا لكل نطاق أو نطاق فرعي
تطبّق قواعد الملف على المضيف الذي يوجد عليه فقط. فإذا كان موقعك يعمل على نطاق رئيسي ومتجر على نطاق فرعي، فلن تتحكم تعليمات النطاق الرئيسي تلقائيًا في صفحات المتجر.
لذلك يجب فحص كل نطاق فرعي على حدة، والتأكد من وجود ملف مناسب لبنيته. وينطبق الأمر كذلك على المواقع التي تستخدم نطاقًا منفصلًا للمحتوى أو الدعم أو التطبيق أو النسخة المخصصة لدولة معينة.
كما ينبغي توحيد النسخة الأساسية من الموقع والتأكد من أن القواعد مرتبطة بالبروتوكول واسم النطاق الصحيحين، خاصةً بعد الانتقال من HTTP إلى HTTPS أو تغيير استخدام www.
أضف رابط خريطة الموقع الصحيح
يساعد إدراج عنوان خريطة الموقع XML داخل الملف على تعريف عناكب البحث بمكان الصفحات التي تريد اكتشافها. ويجب استخدام عنوان URL كامل ودقيق، مع التأكد من أن الخريطة تعمل وتحتوي على النسخ الأساسية من الصفحات.
لا تضف رابطًا قديمًا أو خاصًا بنطاق تجريبي، ولا تفترض أن جميع إضافات تحسين محركات البحث تستخدم المسار نفسه. افتح الخريطة من المتصفح، ثم راجع العناوين الموجودة داخلها قبل إضافتها إلى الملف.
وجود خريطة الموقع لا يلغي الحاجة إلى الروابط الداخلية، كما أن وضع رابطها داخل ملف robots.txt لا يعني فهرسة جميع الصفحات تلقائيًا. هي وسيلة للاكتشاف والتنظيم، بينما تظل جودة الصفحة وإتاحتها وقابليتها للفهرسة عوامل مستقلة.
حافظ على الملف بسيطًا ومنظمًا
من الأفضل جمع القواعد الخاصة ببرنامج الزحف نفسه داخل مجموعة واضحة، بدل توزيعها بصورة مربكة في أجزاء متعددة من الملف. ويساعد التنظيم الجيد على مراجعة الأوامر وفهمها عند تنفيذ تعديلات مستقبلية.
يمكن استخدام التعليقات القصيرة عند الحاجة لتوضيح سبب قاعدة معينة، خاصةً داخل المواقع التي يعمل عليها أكثر من شخص. لكن يجب ألا يتحول الملف إلى مستند طويل يضم ملاحظات غير ضرورية أو تعليمات قديمة.
احذف القواعد التي لم تعد مرتبطة بمسارات موجودة، وراجع أي أمر لم تعد تعرف سبب إضافته. فبقاء تعليمات قديمة بعد تغيير بنية الموقع قد يؤدي إلى حظر صفحات جديدة تستخدم المسار نفسه بطريقة مختلفة.
راجع الملف بعد أي تغيير تقني كبير
يجب فحص ملف robots.txt بعد نقل الموقع أو إعادة تصميمه أو تغيير القالب أو تثبيت نظام متجر أو تعديل بنية الروابط. فكل تغيير من هذه التغييرات قد ينشئ صفحات ومسارات جديدة أو يلغي مسارات كانت موجودة سابقًا.
كما ينبغي مراجعته عند تثبيت إضافة SEO جديدة أو الانتقال إلى إضافة أخرى، لأن بعض الأدوات تنشئ نسخة افتراضية من الملف أو تعدّل عنوان خريطة الموقع أو طريقة إدارة صفحات الأرشيف والبحث.
وفي أثناء الانتقال من موقع تجريبي إلى الموقع الفعلي، تأكد من إزالة أي قاعدة كانت تمنع الزحف أثناء التطوير. هذه المراجعة يجب أن تكون جزءًا أساسيًا من قائمة فحص الإطلاق، لا خطوة اختيارية بعد نشر الموقع.
راقب النتائج بدل الاعتماد على التوقعات
بعد تطبيق أي تعديل، راقب تقارير الزحف والفهرسة واختبر صفحات حقيقية من الموقع. لا تفترض أن القاعدة تعمل كما توقعت لمجرد أن صياغتها تبدو صحيحة، فقد يختلف المسار الفعلي أو تتداخل معه قاعدة أخرى أكثر تحديدًا.
تابع الصفحات المهمة أولًا، ثم راجع المسارات المحظورة للتأكد من أن المنع مقصود. وإذا ظهرت مشكلة، عدّل قاعدة واحدة في كل مرة قدر الإمكان، حتى تتمكن من معرفة التغيير الذي أدى إلى النتيجة.
يساعد الاحتفاظ بسجل للتعديلات على مقارنة حالة الموقع قبل كل تحديث وبعده. سجّل تاريخ التغيير والهدف منه والقواعد التي أُضيفت أو حُذفت، خاصةً في المواقع الكبيرة التي يديرها أكثر من فريق.
أخطاء شائعة عند إنشاء وتعديل ملف robots.txt
قد يؤدي خطأ صغير داخل ملف robots.txt إلى منع محركات البحث من الوصول إلى صفحات مهمة أو إلى تطبيق قواعد لا تحقق الهدف المطلوب. وغالبًا لا تظهر آثار المشكلة فورًا، بل تبدأ بعد أن يعيد Google قراءة الملف ويقلل الزحف إلى المسارات المتأثرة.
لذلك يجب التعامل مع كل تعديل باعتباره تغييرًا تقنيًا يحتاج إلى مراجعة واختبار ومتابعة، وليس مجرد سطر نصي يمكن إضافته دون تحليل بنية الموقع.
حظر الموقع بالكامل عن طريق الخطأ
يُعد استخدام الأمر Disallow: / من أخطر الأخطاء، لأنه يطلب من برامج الزحف المستهدفة عدم الوصول إلى جميع صفحات الموقع. وقد يحدث ذلك عند نقل نسخة تجريبية إلى النطاق الأساسي دون إزالة قواعد الحظر المستخدمة أثناء التطوير.
إذا اكتشفت هذه القاعدة في موقع منشور، فلا تحذفها بصورة عشوائية قبل التأكد من عدم وجود سبب تقني مؤقت. بعد إزالتها، افتح الملف من المتصفح، وراجع حالته داخل Google Search Console، ثم افحص عناوين الصفحات المهمة.
نسخ ملف robots.txt من موقع آخر دون تخصيصه
تختلف بنية عناوين URL والمجلدات والأنظمة المستخدمة من موقع إلى آخر. لذلك قد يحتوي ملف منسوخ على أوامر تمنع مسارات غير موجودة في موقعك، أو تحظر صفحات مهمة تحمل الأسماء نفسها ولكنها تؤدي وظيفة مختلفة.
قد يكون الملف المنسوخ مخصصًا لمتجر إلكتروني أو موقع إخباري أو نظام برمجة خاصة، بينما يستخدم موقعك ووردبريس أو بنية أبسط. يجب مراجعة كل أمر وربطه بمسار حقيقي وهدف واضح قبل اعتماده.
كتابة مسارات غير دقيقة
قد يؤدي اختلاف حرف واحد أو شرطة مائلة إلى تغيير نطاق القاعدة. كما أن الأحرف الكبيرة والصغيرة قد تمثل مسارات مختلفة بحسب إعدادات الخادم، لذلك يجب نسخ المسار الفعلي من عنوان URL ومراجعته بعناية.
تجنب كتابة اسم النطاق كاملًا داخل أوامر Disallow وAllow، لأن هذه الأوامر تعتمد عادةً على المسار الذي يبدأ من جذر الموقع. أما أمر Sitemap فيحتاج إلى عنوان URL كامل يتضمن البروتوكول واسم النطاق.
استخدام أوامر واسعة بدل استهداف الصفحة المطلوبة
قد يرغب صاحب الموقع في منع صفحة واحدة، لكنه يحظر المجلد الذي يحتوي عليها بالكامل. هذه الطريقة قد تمنع محركات البحث من الوصول إلى صفحات أو صور أو ملفات أخرى مهمة داخل المسار نفسه.
استخدم القاعدة الأكثر تحديدًا التي تحقق الهدف. وإذا كان الحظر يتعلق بعنوان URL واحد أو مجموعة واضحة من الصفحات، فلا توسع الأمر ليشمل قسمًا كاملًا دون حاجة.
منع ملفات CSS وJavaScript والصور المهمة
تحتاج محركات البحث إلى بعض موارد الموقع حتى تعرض الصفحة وتفهم طريقة تقديم المحتوى للمستخدم. وقد يؤدي حظر ملفات التصميم أو البرمجة إلى صعوبة تقييم تجربة الصفحة أو معرفة ما يظهر على أجهزة الجوال.
لا تحظر مجلدات القالب أو الإضافات أو الوسائط بالكامل لمجرد أنها تبدو تقنية. افحص الملفات التي تعتمد عليها الصفحات الأساسية، واسمح بالوصول إلى الموارد اللازمة لعرض المحتوى بصورة صحيحة.
الاعتقاد أن Disallow يمنع فهرسة الصفحة
يمنع أمر Disallow الزحف إلى المسار وفق القواعد المحددة، لكنه لا يضمن اختفاء عنوان URL من نتائج البحث. فقد يكتشف Google الصفحة من خلال رابط خارجي أو داخلي ويعرض عنوانها رغم عدم قدرته على قراءة المحتوى.
إذا كان الهدف هو منع الفهرسة، فيجب اختيار الطريقة المناسبة وفق حالة الصفحة، مثل noindex أو الحذف أو إعادة التوجيه أو تقييد الوصول. ولا ينبغي خلط هدف منع الزحف بهدف إزالة الصفحة من نتائج البحث.
منع الصفحة التي تحتوي على توجيه noindex
عندما تمنع محركات البحث من الزحف إلى صفحة، قد لا تتمكن من قراءة توجيه noindex الموجود داخلها. ونتيجة لذلك، قد يظل عنوان URL معروفًا أو ظاهرًا في نتائج البحث رغم وجود التوجيه داخل الصفحة.
يجب السماح بالزحف إلى الصفحة مدة كافية حتى يتمكن Google من قراءة توجيه عدم الفهرسة. وبعد تحديث الحالة، يمكن تقييم ما إذا كان هناك سبب آخر لتقييد الزحف إليها.
استخدام الملف لحماية البيانات الحساسة
ملف robots.txt متاح للعامة، ويمكن لأي مستخدم فتحه والاطلاع على المسارات المكتوبة داخله. لذلك فإن إضافة مجلدات النسخ الاحتياطية أو المستندات الخاصة إليه قد تكشف مكانها بدل حمايتها.
تحتاج البيانات الحساسة إلى كلمات مرور وصلاحيات وصول وإعدادات خادم مناسبة. ولا ينبغي الاعتماد على قواعد الزحف لحماية لوحات التحكم أو بيانات العملاء أو الملفات الداخلية.
تجاهل صفحات المتاجر الإلكترونية المهمة
قد يحظر بعض أصحاب المتاجر جميع الروابط التي تحتوي على معلمات أو فلاتر دون دراسة، فيتأثر الوصول إلى صفحات تصنيفات أو منتجات مهمة. كما قد يمتد الحظر إلى صور المنتجات أو الملفات المستخدمة في عرض خيارات الشراء.
ينبغي تحليل صفحات الفلاتر والبحث والسلة والحساب كل نوع على حدة. فبعض المشكلات تحتاج إلى إعداد Canonical أو noindex أو تحسين بنية الروابط، وليس إلى منع جميع العناوين باستخدام ملف robots.txt.
نسيان تحديث رابط خريطة الموقع
قد يظل الملف يشير إلى خريطة موقع قديمة بعد تغيير النطاق أو الانتقال إلى HTTPS أو استبدال إضافة SEO. وفي هذه الحالة، يتلقى محرّك البحث رابطًا لا يعمل أو يحتوي على عناوين غير محدثة.
افتح عنوان خريطة الموقع بعد كل تغيير، وتأكد من أنه يعرض الصفحات الأساسية بالنطاق الصحيح. ثم حدّث رابط Sitemap داخل الملف إذا تغير مساره.
عدم اختبار الملف بعد التعديل
قد يبدو الأمر صحيحًا عند قراءته، لكنه يطابق مسارات أكثر مما تتوقع. لذلك يجب اختبار صفحات مسموح بها وأخرى محظورة بعد كل تحديث، خاصةً الصفحات التي تحقق زيارات أو مبيعات أو طلبات تواصل.
راجع كذلك النسخة التي يقرأها Google داخل Search Console، لأن التخزين المؤقت أو إضافات ووردبريس قد تعرض نسخة مختلفة عن الملف الذي عدّلته داخل الاستضافة.
ترك إعدادات الموقع التجريبي بعد الإطلاق
تستخدم المواقع التجريبية أحيانًا قواعد تمنع الزحف إلى جميع الصفحات لتجنب ظهورها في نتائج البحث. لكن نقل الملفات إلى الموقع الأساسي دون مراجعة هذه القواعد قد يمنع Google من استكشاف النسخة المنشورة.
يجب أن تتضمن قائمة فحص الإطلاق مراجعة ملف robots.txt وإعدادات الخصوصية ووسوم noindex وخريطة الموقع. كما ينبغي إعادة الاختبار بعد إزالة الحظر للتأكد من أن الصفحات الأساسية أصبحت متاحة للزحف.
إجراء تعديلات متعددة دون توثيقها
عندما يتم تغيير عدة قواعد في الوقت نفسه، يصبح من الصعب معرفة الأمر الذي تسبب في المشكلة. وتزداد هذه الخطورة في المواقع التي يديرها أكثر من مطور أو متخصص SEO.
سجّل تاريخ كل تعديل والهدف منه والمسارات المتأثرة، واحتفظ بنسخة سابقة من الملف. وعند معالجة مشكلة، غيّر أقل عدد ممكن من القواعد ثم راقب النتيجة قبل تنفيذ تعديل جديد.
الأسئلة الشائعة حول ملف robots.txt
🎯 الخلاصة: تحكم في الزحف دون الإضرار بظهور موقعك
يمنحك ملف robots.txt وسيلة عملية لتنظيم وصول محركات البحث إلى أقسام موقعك، وتوجيه عناكب البحث بعيدًا عن المسارات التي لا تحتاج إلى الزحف المستمر. لكن فعالية الملف تعتمد على دقة الأوامر ومدى توافقها مع بنية صفحات الموقع.
فالقاعدة الصحيحة قد تقلل الزحف غير الضروري وتساعد Google على التركيز على الصفحات المهمة، بينما قد يؤدي أمر واسع أو مسار مكتوب بطريقة غير دقيقة إلى حجب منتجات أو خدمات أو مقالات وملفات يحتاج إليها محرك البحث لفهم الموقع.
تذكّر دائمًا أن الملف يتحكم أساسًا في عملية الزحف، ولا يمثل أداة أمان أو وسيلة مضمونة لمنع فهرسة الصفحات. لذلك يجب استخدامه إلى جانب خريطة موقع XML سليمة، وروابط داخلية واضحة، وتوجيهات فهرسة مناسبة، ومتابعة منتظمة من خلال Google Search Console.
ولا يُنصح بنسخ إعدادات جاهزة من موقع آخر؛ لأن كل موقع يمتلك بنية مختلفة واحتياجات خاصة. فالإعداد المناسب لمتجر إلكتروني كبير قد لا يناسب موقعًا تعريفيًا بسيطًا، والعكس صحيح.
نصيحة احترافية قبل اعتماد ملف robots.txt
راجع النقاط التالية بعد إنشاء الملف أو تعديله:
هل يظهر الملف عند إضافة /robots.txt بعد اسم نطاق موقعك؟
هل الصفحة الرئيسية وصفحات الخدمات والمنتجات والمقالات متاحة للزحف؟
هل توجد قاعدة Disallow: / تمنع الزحف إلى الموقع بالكامل دون قصد؟
هل تسمح القواعد بالوصول إلى ملفات CSS وJavaScript والصور المهمة؟
هل عنوان خريطة الموقع XML صحيح ويعمل دون أخطاء؟
هل اختبرت عناوين URL المهمة داخل Google Search Console بعد التعديل؟
هل تستخدم توجيه noindex بدل robots.txt عندما يكون الهدف منع الفهرسة؟
هل راجعت الملف بعد نقل الموقع أو تغيير القالب أو إضافة متجر إلكتروني؟
إذا لاحظت تراجعًا في وصول محركات البحث إلى صفحات موقعك، أو لم تكن متأكدًا من سلامة أوامر الزحف الحالية، يستطيع فريق Parmagito Digital Services مراجعة الإعدادات التقنية، وتحليل مشكلات الزحف والفهرسة، وفحص خريطة الموقع وبنية الروابط وفق طبيعة موقعك.
يمكنك التعرّف على خدمات السيو وفحص مشكلات الزحف والفهرسة للوصول إلى إعداد متوازن يحافظ على الصفحات المهمة ويقلل الأخطاء التي قد تؤثر في ظهور موقعك داخل نتائج البحث.
مع Parmagito Digital Services، لا نتعامل مع ملف robots.txt باعتباره مجموعة أوامر جاهزة للنسخ، بل جزءًا من منظومة السيو التقني التي تشمل الزحف والفهرسة وخريطة الموقع وبنية الروابط وتجربة الاستخدام، مع تطبيق إعدادات تناسب موقعك دون حجب المحتوى المهم.
Parmagito — زحف أكثر دقة، وظهور أقوى في نتائج البحث 🔍








