الويب يصنف البوتات حسب الغرض، وليس السلوك
كل نظام لاكتشاف البوتات تم بناؤه في السنوات الخمس عشرة الماضية يطرح سؤالا واحدا: هل تبدو هذه الترافيك مؤتمتة؟ ترتيب الـ header، وبصمات مستوى الاتصال السلكي، وحركة الفأرة، وتوقيت الجلسة. كل ذلك يحاول استنتاج شيء عن الـ client من شكل الـ request.
في 1 يوليو 2026، غيرت Cloudflare السؤال. أصبحت ترافيك البوتات تُصنف الآن إلى ثلاث فئات لا علاقة لها بما يبدو عليه الـ request على الشبكة. يغطي Search "زواحف الويب التي تفهرس محتواك لتتمكن من الإجابة عن الأسئلة حوله لاحقا". ويغطي Agent "النشاط المؤتمت الذي يعمل في الوقت الفعلي نيابة عن شخص ما". بينما يغطي Training "زواحف الويب التي تأخذ محتواك لتدريب نموذج أو ضبطه بدقة".
تخيل ثلاثة requests تصل إلى نفس الخادم. نفس الـ client، ونفس الـ headers، ونفس التوقيت، ومتطابقة تماما حتى مستوى البايت. بموجب هذا النموذج، يمكن أن تحصل على ثلاثة قرارات مختلفة، يتم تحديدها بالكامل بناء على ما تخطط لفعله بالصفحة بعد وصولها.
هذا ليس كاشفا أفضل. إنه مفهوم أولي مختلف.
الموعد النهائي في 15 سبتمبر أضيق نطاقا من حالة الذعر
الرواية المتداولة حول هذه القصة في منتديات المطورين هي أن Cloudflare تحظر وكلاء الذكاء الاصطناعي عبر خمس مساحة الويب في 15 سبتمبر.
سجل التغييرات يقول شيئا أصغر بكثير. تنطبق الإعدادات الافتراضية الجديدة على "النطاقات الجديدة التي تنضم إلى Cloudflare". وفي تلك النطاقات، "يتم حظر البوتات المصنفة كـ Training أو كـ Agent على الصفحات التي تعرض إعلانات، بينما يظل Search مسموحا به". وكل من يستخدم Cloudflare بالفعل يختار إعداده الخاص، ويمكنه فعل ذلك في أي وقت قبل هذا التاريخ.
إذن: النطاقات الجديدة فقط، والصفحات المدعومة بالإعلانات فقط، ولا تزال إحدى الفئات الثلاث تمر بشكل افتراضي. هذا تغيير حقيقي، لكنه ليس جدارا عبر الإنترنت.
لكن النطاق الضيق هو الجزء المثير للاهتمام. لم تنشر Cloudflare سياسة، بل نشرت إعدادا افتراضيا، والإعدادات الافتراضية هي الطريقة التي تصبح بها السياسة هي السائدة دون أن يصوت عليها أحد. الرقم الذي يستحق المتابعة ليس 15 سبتمبر. بل هو عدد تلك النطاقات التي لن تعدل هذا الإعداد بعد ذلك أبدا.
ما يعنيه هذا: إذا كنت تجمع البيانات، فإن السؤال المفيد لم يعد "هل يمكنني تجاوز حماية هذا الموقع" بل أصبح "ما هي الفئة التي يعتقد هذا الموقع أنني أنتمي إليها". لهذين السؤالين إجابات مختلفة، وواحد منهما فقط هو ما يمكنك اختباره.
لا يمكن قياس الغرض. يجب التصريح به.
إليك المشكلة الميكانيكية في تصنيف الترافيك حسب النية: النية ليست موجودة داخل حزمة البيانات.
يمكن قياس البصمة الرقمية (fingerprint). كما يمكن قياس حركة الماوس. لكن لا يمكن قياس "لماذا تجلب هذه الصفحة"، لذا يحتاج النظام إلى أن يصرّح العميل بذلك بوضوح، ويحتاج إلى سبب لتصديق الإجابة. هذه هي المهمة التي تؤديها Web Bot Auth. يوقّع الوكيل طلباته (requests) باستخدام مفتاح خاص، وينشر دليلاً للمفاتيح، وتقوم خوادم الـ edge بالتحقق من التوقيع بالاعتماد عليه، استناداً إلى RFC 9421 HTTP Message Signatures. تحدد وثائق Cloudflare معيار البوت المعتمد بأنه "التعريف الذاتي الصادق".
انظر الآن إلى ما يفرض هذا على نطاق واسع. المواصفة هي draft-meunier-webbotauth-httpsig-protocol-02، وآخر مراجعة لها كانت في 18 أغسطس 2026. الحالة المقصودة: مسار المعايير (Standards Track). الحالة الفعلية: "مسودة إنترنت نشطة (فردية)" وهي "غير معتمدة من IETF" و"لا تتمتع بأي صفة رسمية في عملية معايير IETF". للمسودة مؤلفان، أحدهما يعمل في Cloudflare والآخر في Google.
نعتقد أن التصميم سليم، ومن المهم ذكر ذلك قبل توجيه أي نقد. الهوية الموقّعة رقمياً تتفوق على سباق التسلح في صفحات التحقق لأي طرف ينوي الالتزام بالسلوك السليم. يمكن السماح لبرنامج الزحف الذي يعرّف عن نفسه، أو خنقه (throttled)، أو محاسبته عن قصد بدلاً من الاعتماد على التخمين، كما يحصل أصحاب المواقع على وسيلة تحكم لا تعطل الزوار الفعليين كأضرار جانبية. قارن ذلك بعقد كامل من حظر نطاقات IP والاعتماد على الأمل.
ما لا يستطيع هذا النظام فعله هو إيقاف أي شخص. فالنظام القائم على الغرض المعلن لا يصنف سوى حركة المرور التي تعلن عن نفسها. أما البقية فترجع تلقائياً إلى منظومة الكشف المتاحة مسبقاً، وتلك المنظومة تزداد دقة باستمرار: فقد أطلقت Cloudflare ميزة التقييم السلوكي على مستوى الجلسة بعد اثني عشر يوماً من إطلاق الفئات الجديدة.
وبالتالي لا يوجد تنافس بين الاثنين. الهوية تصنف الصادقين، والكشف يتعامل مع بقية الزيارات، والمسار الثاني هو المكان الذي ستستقر فيه حركة المرور الخاصة بك افتراضياً إذا لم تعلن عن أي شيء.
لا توجد خانة لجمع البيانات العامة
نأتي الآن إلى الجزء الذي ينبغي أن يثير قلق أي شخص يدير بنية تحتية لجمع البيانات (collection pipeline).
لنأخذ الأعمال التي نشرناها هذا العام على سبيل المثال. مؤشر لأسعار الأخشاب تم بناؤه من القوائم العامة. اكتشاف انتهاكات MAP عبر ستة متاجر إلكترونية، وهو ما يعني جلب صفحة المنتج نفسها من ست نقاط مراقبة مختلفة ومقارنة ما يعرضه كل منها. تصنيفات متاجر التطبيقات وتحليل مشاعر المراجعات. عمليات فحص مواضع الإعلانات التي يتم تشغيلها من البلد الذي تم شراء الحملة فيه بالفعل.
حاول تصنيف هذه الحالات ضمن Search أو Agent أو Training.
لا تنطبق فئة Search: فتعريف Cloudflare نفسه يشترط توقع الحصول على "حركة إحالة أو تعويض عادل آخر بالمقابل"، وعملية التحقق الليلي من الأسعار لا ترسل إحالات إلى أي أحد. كما لا تنطبق فئة Agent أيضاً، لأنه لا يوجد إنسان يجلس أمام شاشة بانتظار نتيجة عملية الجلب تلك. وفئة Training غير صحيحة بوضوح، نظراً لعدم استيعاب أي بيانات داخل نموذج.
هذا تصنيف كُتب لوصف حركة مرور الذكاء الاصطناعي التي ظهرت خلال السنوات الثلاث الماضية، ويُطبَّق الآن على مجال عمل يسبقها بعقد كامل من الزمن. استخبارات الأسعار، والبيانات البديلة، وتتبع نتائج SERP، وحماية العلامات التجارية، والتحقق من الإعلانات، ومراقبة الامتثال: كل هذا ليس جديداً، وليس مبنياً على وكلاء، ولا توجد خانة مخصصة لاختياره.
حركة المرور التي لا تملك خانة يتم تصنيفها بواسطة الجهة التي رسمت تلك الخانات. وغالباً ما تُوضع في أقرب خانة إليها.
ماذا يعني هذا لفرق البيانات
أربعة أمور تستحق التنفيذ بينما لا تزال القواعد غير صارمة بعد.
حدد الفئة التي يمكنك المطالبة بها بصدق. ليست الفئة التي تمكّنك من الدخول فحسب، بل تلك التي تستطيع الدفاع عنها كتابياً إذا سألك أحد الناشرين مباشرة. وإذا كانت الإجابة الصادقة هي "لا شيء مما سبق"، فأنت ضمن الفئة الأكثر عرضة للخسارة عندما تصبح هذه التصنيفات ثابتة، والأكثر استفادة من توضيح ذلك طالما أن النقاش لا يزال متاحاً.
اقرأ إعدادات الموقع المستهدف، وليس العناوين الرئيسية. أصبحت سياسة البوتات لكل موقع خاصية مستقلة به، قابلة للتعديل لكل مسار، وتتغير دون إشعار مسبق. التعامل مع عبارة "Cloudflare تحظر الوكلاء في سبتمبر" على أنها حقيقة تنطبق على الـ pipeline لديك سيدفعك لإعادة بناء أجزاء لم تكن معرضة للخطر أصلاً.
افترض أن اختبار الصفحات الإعلانية سيتوسع. ربطت Cloudflare خيارها الافتراضي بالصفحات التي تعرض إعلانات، وهو مؤشر تقريبي على أن "هذه الصفحة تحقق أرباحاً من انتباه المستخدمين". هذا الحد سيتغير، وليست Cloudflare الجهة الوحيدة التي تحدده. فقد أطلقت AWS WAF ميزة تحقيق الدخل من حركة مرور الذكاء الاصطناعي في 15 يونيو 2026، حيث ترد برمز 402 وشروط دفع قابلة للقراءة آلياً. وسلكت Akamai طريق الشراكات مع TollBit وSkyfire. أصبح ثلاثة من كبار مزودي خدمات الـ edge يبيعون واجهة التحكم ذاتها، وهو ما حللناه من جانب التسعير عند إطلاق نموذج الدفع مقابل الزحف.
حافظ على قدرة نظام الجمع لديك على العمل في كلا المسارين. المسار المحدد الهوية (التوقيع، والتصريح، ثم السماح بالمرور أو الفوترة) والمسار غير المحدد الهوية (التقييم استناداً إلى السلوك، كالمعتاد) سيتعايشان لسنوات طويلة. إن بناء الأنظمة بافتراض وجود مسار واحد فقط هو الخطأ المكلف هنا، في كلا الاتجاهين.
سيُعاد رسم هذه الخانات من جديد
توقع نتحمل مسؤوليته بثقة: ستظهر فئة رابعة خلال عام واحد.
تُكتب النسخة الأولى من أي تصنيف بواسطة الطرف الواقع تحت الضغط، بينما يغيب من يجري تصنيفهم عن المشهد حين يحدث ذلك. تصف مصطلحات Search وAgent وTraining ما تفعله شركات الذكاء الاصطناعي مع الناشرين. لكنها لا تصف شركة أبحاث سوقية، أو فريق امتثال، أو متجر تجزئة يتحقق من أسعار أرفف المنافسين، وهؤلاء الثلاثة يجلبون الصفحات العامة بطرق مهذبة منذ زمن يسبق اكتساب كلمة "agent" أي معنى في هذا السياق.
إن النزاع حول تسمية هذا الخيار الرابع، ومن يملك صلاحية تحديده، سيكون أكثر أهمية لقطاع البيانات من أي اختبار قياسي لرصد البوتات يُنشر هذا العام. هذا أمر يستحق الحضور من أجله.
لأن الخيار البديل بسيط للغاية. إن لم تتمكن حركة مرورك من تعريف نفسها، فسيقوم طرف آخر بتعريفها نيابة عنك.