WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
تقدم الورقة البحثية WebAggregator، وهو مسار لتخليق البيانات ينقل وكلاء البحث العميق من التركيز على الاسترجال إلى التركيز على التكوين من خلال مجموعة بيانات ضبط دقيق (SFT) منسقة تضم 10 آلاف عينة، مما يمكّن نموذجاً بحجم 32 مليار معلمة من التفوق على الأنظمة رفيعة المستوى في الاختبارات المعيارية، ويثبت أن الاستدلال التكويني، وليس الاسترجال، هو العائق الأساسي أمام الجيل القادم من وكلاء البحث.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة WebAggregator البحثية، باستخدام لغة بسيطة وتشبيهات إبداعية.
المشكلة الكبرى: "الباحث عن جوجل" مقابل "المحقق"
تخيل أنك توظف مساعد باحث.
- الطريقة القديمة (وكلاء الذكاء الاصطناعي الحاليون): تسألهم: "من فاز بجائزة عام 2024؟". يفتحون المتصفح فوراً، ويكتبون السؤال في جوجل، ويجدون قائمة، ثم يشيرون إلى الاسم الأول. هذا هو البحث عن المعلومات (Information Seeking). إنه سريع، لكنه يشبه الببغاء الذي يردد ما يسمعه. إذا كان الجواب يتطلب ربط ثلاث حقائق مختلفة من ثلاثة مواقع مختلفة لحل لغز، فإن الببغاء يصاب بالارتباك.
- الهدف الجديد (البحث العميق): تسأل: "من بين جميع الدول التي تزيد مساحتها عن 2 مليون كيلومتر مربع، أي منها شهد الاقتصاد الأكثر تقلبًا بين عامي 2010 و2020؟". للإجابة على هذا، لا يمكن للوكيل مجرد "إيجاد" الإجابة. بل يجب عليه:
- إيجاد قائمة بالدول الكبيرة.
- إيجاد بيانات اقتصادية لكل منها.
- إجراء عمليات حسابية معقدة لحساب "التقلب".
- مقارنة النتائج.
هذا هو الاستنتاج التركيبي (Compositional Reasoning). إنه يشبه المحقق الذي يجمع الأدلة لحل لغز، بدلاً من مجرد قراءة عنوان رئيسي.
تجادل الورقة بأن وكلاء الذكاء الاصطناين الحاليين بارعون في كونهم "باحثين عن جوجل"، لكنهم سيئون في كونهم "محققين". فهم يعتمدون أكثر من اللازم على إيجاد الرابط الصحيح، ولا يفكرون بعمق كافٍ فيما وجدوه.
الحل: WebAggregator (الـ "نادي الرياضي للتدريب")
لإصلاح ذلك، صمم الباحثون نظاماً يسمى WebAggregator. لا تنظر إليه كذكاء اصطناعي جديد، بل كـ معسكر تدريبي متخصص مصمم لتحويل "الباحث عن جوجل" إلى "محقق".
يعمل النظام في مرحلتين أساسيتين، مثل فريق مكون من شخصين يبتكران امتحاناً صعباً:
المستكشف الاستباقي (الجامع/المنقب):
تخيل روبوتاً أُرسل إلى مكتبة ضخمة ومعه كتاب واحد فقط. مهمته هي فتح هذا الكتاب، وإيجاد إشارة إلى كتاب آخر، ثم الذهاب إلى ذلك الكتاب، وإيجاد صورة، وتحميل ملف، والنقر على زر مخفي. إنه يجمع كومة ضخمة من المعلومات المبعثرة والفوضوية من جميع أنحاء الويب.- في الورقة البحثية: يزور هذا الوكيل مواقع ويب حقيقية، ويحمل ملفات، ويتنقل في صفحات معقدة لجمع البيانات الخام.
مقترح المنطق التركيبي (سيد الألغاز):
بمجرد أن يجمع "الجامع" كومة البيانات، ينظر "سيد الألغاز" إليها ويقول: "حسناً، بناءً على هذه الفوضى، دعونا نصيغ سؤالاً لا يمكن الإجابة عليه بمجرد النظر إلى صفحة واحدة".- يستخدمون مجموعة صارمة من القواعد (12 نوعاً من المنطق) لإجبار السؤال على أن يتطلب عمليات حسابية، وتصفية، ومقارنة، واستدلالاً زمنياً (التعامل مع الوقت).
- مثال: بدلاً من سؤال "ما هو الناتج المحلي الإجمالي للصين؟"، يسألون: "احسب الانحراف المعياري لنمو الناتج المحلي الإجمالي للصين مقارنة بمعدل التوسع الحضري خلال العقد الماضي".
النتيجة: مجموعة بيانات جديدة وذكاء اصطناعي أكثر ذكاءً
استخدم الفريق هذا النظام لإنشاء WebAggregatorQA، وهي مجموعة بيانات تحتوي على حوالي 10,000 سؤال شديد الصعوبة. ثم استخدموا هذه الأسئلة لتدريب نموذج ذكاء اصطناعي جديد (يسمى WebAggregator).
إليك ما حدث عند اختبار هذا النموذج الجديد:
"فخ الاسترجاع": اختبر الباحثون نماذج ذكاء اصطناعي رفيعة المستوى (مثل GPT-4.1 و Claude-3.7) على هذه الأسئلة الصعبة. وحتى عندما قدموا للنماذج جميع المواقع والمستندات الصحيحة اللازمة لحل المشكلة، ظلت تلك النماذج تفشل.
- التشبيه: الأمر يشبه إعطاء طالب كتاباً مدرسياً فيه الإجابة الصحيحة محددة بوضوح، ومع ذلك لا يستطيع حل المسألة الرياضية لأنه لا يفهم كيفية إجراء العملية الحسابية.
- النتيجة: العائق ليس في إيجاد المعلومات، بل في الاستنتاج بها.
التحول: عندما دربوا نماذجهم على مجموعة بيانات WebAggregator، تغير سلوك الوكلاء:
- قبل التدريب: كانوا ينقرون على الأزرار ويفتحون الروابط بجنون (استخدام عالٍ للأدوات، وتفكير منخفض).
- بعد التدريب: أصبحوا ينقرون على أزرار أقل ولكنهم يقضون وقتاً أطول في "التفكير" (الاستنتاج الداخلي) لربط النقاط ببعضها.
- الأداء: تفوق نموذج WebAggregator-32B الجديد على أفضل النماذج الموجودة في مهام الاستنتاج الصعبة هذه، مما يثبت أن التدريب على "العمل التحقيقي" يجعل الذكاء الاصطناعي أكثر ذكاءً.
الخلاصة
تخلص الورقة إلى أنه لكي يصبح الذكاء الاصطناعي حقاً وكيل "بحث عميق" قادراً على الاكتشاف العلمي، نحتاج إلى التوقف عن التركيز على مدى براعته في البحث في الويب. بدلاً من ذلك، نحتاج إلى التركيز على مدى براعته في ربط قطع المعلومات المبعثرة لتشكيل استنتاج منطقي.
باختصار: قامت الورقة ببناء "نادي رياضي" حيث يتدرب وكلاء الذكاء الاصطناعي على حل الألغاز المعقدة باستخدام بيانات حقيقية من الويب. والنتيجة هي وكيل أقل اندفاعاً في تصفح الويب وأكثر تفكيراً ومنطقية كباحث رصين.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.