← كل المقالات

مصائد الويب (Tarpits): من يقع في الفخ بالفعل

تقوم مواقع الويب بنشر مصائد (tarpits) تحتجز زواحف الذكاء الاصطناعي وتغذيها ببيانات عديمة الفائدة. لكن هذه المصائد لا تميز بين GPTBot وأداة تتبع الأسعار الخاصة بك.

المواقع تنصب الفخاخ لزواحف الذكاء الاصطناعي

انتشرت أداة تُدعى Nepenthes على نطاق واسع في أوائل عام 2025. تُنشئ هذه الأداة متاهات لا نهائية من صفحات الويب المزيفة، ترتبط كل منها بصفحات مزيفة أخرى، ومصممة لمحاصرة الزواحف في حلقة مفرغة لا يمكنها الهروب منها. أما النصوص الموجودة على تلك الصفحات، فهي كلام غير مفهوم ومُولد خوارزميًا، ومصمم لتلويث مجموعات بيانات تدريب الذكاء الاصطناعي بالبيانات غير المفيدة.

أداة Nepenthes ليست الوحيدة. فقد ظهرت مشاريع مثل Locaine وقائمة متزايدة من مصائد "tarpits" مفتوحة المصدر على GitHub، وكلها تشترك في الهدف نفسه: إذا لم تحترم شركات الذكاء الاصطناعي ملف robots.txt، فسيقاوم أصحاب المواقع باستخدام البيانات المسمومة.

هذا الدافع مبرر. فقد وجدت دراسة أكاديمية على arXiv أن حظر الذكاء الاصطناعي بين المواقع الموثوقة قفز من 23% في سبتمبر 2023 إلى ما يقرب من 60% بحلول مايو 2025. وأظهر تحليل BuzzStream أن 79% من أبرز المواقع الإخبارية تحظر الآن روبوتات تدريب الذكاء الاصطناعي عبر robots.txt. كما أفاد تقرير Cloudflare Radar بأن 75% من حركة مرور الويب المتعلقة بالذكاء الاصطناعي في منتصف عام 2025 كانت موجهة لأغراض التدريب، وليس للبحث أو الاستدلال (inference).

لكن مصائد tarpits لا تتحقق من هوية الزائر، ولا تسأل عن سبب تتبعك للبيانات، بل تحاصر أي نشاط يبدو مؤتمتًا.

من يقع في الفخ بالفعل

الأهداف المقصودة واضحة: GPTBot، وClaudeBot، وزواحف شركات الذكاء الاصطناعي التي تجمع بيانات الويب المفتوح لأغراض التدريب. المشكلة هي أن مصائد tarpits لا تستطيع التمييز بين زاحف OpenAI والسكربت الخاص بك لمراقبة الأسعار.

تكتشف مصائد tarpits أنماط الطلبات المؤتمتة. فإذا كان أداة الكشط الخاصة بك تتبع الروابط بصورة منهجية، أو تطلب الصفحات على فترات زمنية ثابتة، أو تتخطى تنفيذ JavaScript (وهي الطريقة التي تعمل بها معظم زواحف تدريب الذكاء الاصطناعي)، فستبدو كهدف مثالي. لا يهم الفخ أنك فريق تجارة إلكترونية مكون من 10 أشخاص تتابع أسعار المنافسين؛ فهو يرى حركة مرور تشبه نشاط الروبوتات ويبدأ في تقديم صفحات مزيفة.

هذا الأمر ليس نظريًا فحسب. فقد أظهرت أبحاث من Rutgers وWharton أن المواقع التي تحظر زواحف الذكاء الاصطناعي شهدت انخفاضًا بنسبة 23.1% في إجمالي حركة المرور، وتراجعًا بنسبة 13.9% في حركة مرور المستخدمين الحقيقيين. إن أسلوب الحظر العدواني لا يوقف زواحف الذكاء الاصطناعي فقط، بل يضر أيضًا بظهور الموقع نفسه.

وتذهب مصائد tarpits إلى أبعد من ذلك: فهي تستهلك قدرات المعالجة والتخزين والنطاق الترددي للزاحف، بينما تغذيه ببيانات تؤدي إلى إضعاف جودة أي نموذج أو قاعدة بيانات يقوم ببنائها.

تسلسل التصعيد

كان ملف robots.txt دائمًا بمثابة ميثاق شرف؛ وكان فعالًا عندما التزم الجميع بالقواعد. ولكن عندما بدأت شركات الذكاء الاصطناعي الكبرى في تجاهله (أو ابتكار تفسيرات ملتوية حول "الزحف لأغراض البحث" مقابل "الزحف لأغراض التدريب")، لجأ أصحاب المواقع إلى التصعيد.

يبدو هذا النمط على النحو التالي:

  1. الحظر عبر Robots.txt: الطلب المهذب
  2. تصفية User-Agent: حظر بصمات زواحف الذكاء الاصطناعي المعروفة
  3. الكشف السلوكي: رصد الزواحف غير المعروفة عبر أنماط الـ request الخاصة بها
  4. مصائد Tarpits: تدابير مضادة نشطة تهدر الموارد وتسمم البيانات

كل خطوة ترصد مزيدا من التهديدات. وكل خطوة تحظر أيضا مزيدا من الترافيك المشروع. بحلول الخطوة الرابعة، تصبح معامَلة كل وصول مؤتمت على أنه عدائي. وبالتالي، فإن الـ scraper الذي يجمع أسعار المنتجات المتاحة للعامة لصالح خدمة مقارنة يقع في نفس الفخاخ التي يقع فيها GPTBot الذي يجمع البيانات دون إذن.

ما يجب على فرق البيانات فعله الآن

إذا كنت تدير عمليات جمع بيانات بأي حجم، فإن الـ tarpits تغير قواعد اللعبة. هناك عدة أمور باتت أكثر أهمية من ذي قبل.

احترم robots.txt دائما. يبدو هذا أمرا أساسيا، لكنه بات شرطا لا غنى عنه اليوم. تستخدم المواقع robots.txt كمرشح أولي. تجاهله، وستضع نفسك في نفس فئة روبوتات تدريب الذكاء الاصطناعي التي تسببت في ظهور رد فعل الـ tarpit هذا برمته.

لا تبدُ كزاحف تدريب. تمتلك زواحف تدريب الذكاء الاصطناعي بصمات يمكن التنبؤ بها: فهي تتبع كل رابط، وتطلب الصفحات بالجملة، وتتجاوز تشغيل JavaScript، وتحافظ على فترات زمنية منتظمة. إذا كان الـ scraper الخاص بك يفعل الشيء نفسه، فسيقوم الكشف السلوكي برصده. نوّع توقيتك. حمّل ما تحتاجه فقط. قم بتنفيذ JavaScript عندما يتطلب الموقع ذلك. لقد كتبنا عن أسباب حظر الـ scrapers في لماذا يستمر الـ Web Scraper الخاص بك في التعطل.

تحقق من صحة البيانات الواردة. تقدم الـ tarpits بيانات غير صالحة لكنها تبدو مقنعة. إذا كنت لا تفحص الـ responses في خط معالجة البيانات، فقد ينتهي بك الأمر بتخزين نصوص مولدة بنماذج Markov كوصف حقيقي للمنتجات. اجعل التحقق من البيانات خطوة أساسية، وليس فكرة لاحقة.

استثمر في البنية التحتية الخاصة بالـ requests. أسلوب العمل القديم (تدوير عناوين IP، وإعادة المحاولة عند الفشل) لم يعد كافيا. تحلل أنظمة كشف البوتات الحديثة بصمات TLS، وسلوك المتصفح، وأنماط الجلسات. يساعد التوجيه الذكي للـ proxy، لكن التحول الحقيقي هو الانتقال من الكشف على مستوى IP إلى الكشف على مستوى السلوك. إذا كنت تقوم باستخراج البيانات من مواقع تعتمد بكثافة على JavaScript، فإن الجمع المعتمد على المتصفح يصبح بشكل متزايد هو النهج الموثوق الوحيد.

فجوة الوصول تزداد اتساعا

نعتقد أن الويب يتجه نحو انقسام واضح. من جهة: مواقع تستثمر بياناتها ماليا من خلال اتفاقيات وصول مدفوعة، وشراكات API، وزحف مرخص. ومن جهة أخرى: مواقع تعامل كل وصول مؤتمت على أنه تهديد وتنشر تدابير مضادة متزايدة العدوانية.

بالنسبة لفرق البيانات، يعني هذا أن تكاليف جمع البيانات ستستمر في الارتفاع. ليس لأن التكنولوجيا أصعب في البناء، بل لأن البيئة أصبحت أكثر عدائية. الفرق التي تستثمر في ممارسات scraping مسؤولة وشفافة ستحافظ على وصولها. أما الفرق التي تبدو كأنها روبوتات تدريب، فستقع في الفخاخ، وتتلقى بيانات مسمومة، وتُحظر تماما.

تقنيات Tarpits لن تختفي. السؤال الذي يواجه فريقك ليس ما إذا كان ينبغي القلق بشأنها، بل ما إذا كانت بنيتك التحتية قادرة على تمييز الفارق بين صفحة حقيقية وفخ قبل أن تصل تلك البيانات إلى قاعدة بياناتك.