← أحدث الأبحاث
🤖 AI

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

تقدم هذه الورقة DeepVerifier، وهو إطار عمل ذاتي التطور يعزز وكلاء البحث العميق من خلال توسيع نطاق الاستدلال عبر التحقق المتكرر وتكرير المخرجات باستخدام معايير مستمدة من تصنيف جديد للإخفاقات، محققاً مكاسب كبيرة في الدقة دون تدريب إضافي مع إصدار مجموعة بيانات مقابلة لدعم التقدم مفتوح المصدر.

المؤلفون الأصليون: Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

نُشر 2026-04-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعد باحث عبقري ولكنه مغرور أحياناً يُدعى "وكيل البحث العميق" (Deep Research Agent - DRA). هذا المساعد بارع في العثور على المعلومات، وقراءة مئات المواقع الإلكترونية، وكتابة التقارير. ومع ذلك، مثل أي بشر، قد يرتكب أخطاءً: فقد يقرأ الموقع الخطأ، أو يفهم السؤال بشكل خاطئ، أو يذكر حقيقة ليست صحيحة بكل ثقة.

عادةً، إذا ارتكب هذا المساعد خطأً، يتعين عليك إيقافه، وشرح ما حدث بشكل خاطئ، والأمل في أن يؤدي بشكل أفضل في المرة القادمة. ولكن ماذا لو استطاع المساعد التحقق من عمله بنفسه قبل أن تراه أنت، واكتشاف أخطائه وتصحيحها أثناء العمل؟

هذا هو بالضبط ما تقترحه هذه الورقة البحثية. لقد بنوا نظاماً يسمى DeepVerifier يعمل بمثابة "محرر ذاتي التصحيح" لوكلاء الذكاء الاصطناعي هؤلاء.

إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: فخ "الكل أو لا شيء"

عندما يحاول الذكاء الاصطناعي حل مشكلة صعبة (مثل "ابحث عن أول منشور لباحث معين")، فإنه غالباً ما يتوه في متاهة من الخطوات. إذا طلبت من ذكاء اصطناعي قياسي "التحقق مما إذا كانت هذه الإجابة صحيحة"، فإنه غالباً ما يفشل لأن التحقق من إجابة معقدة هو أمر صعب تماماً مثل حل المشكلة نفسها. الأمر يشبه مطالبة طالب بتقييم مقالته المكونة من 50 صفحة دون وجود نموذج إجابة؛ قد يغفل عن الأخطاء الدقيقة.

2. الحل: "نموذج التقييم" و"الختم المطاطي"

أدرك الباحثون أن التحقق من الإجابة أسهل في الواقع من إنشائها. هم يسمون هذا "عدم التماثل في التحقق" (asymmetry of verification).

ولجعل هذا يعمل، أنشأوا تصنيفاً للفشل (Failure Taxonomy). فكر في هذا كقائمة مرجعية ضخمة لكل طريقة يمكن للذكاء الاصطناعي أن يخطئ بها. لقد حللوا آلاف الأخطاء السابقة وصنفوها إلى 5 مجموعات رئيسية و13 مجموعة فرعية (مثل "استخدم المصدر الخاطئ"، "أخطأ في قراءة التعليمات"، أو "اخترع حقيقة ما").

يستخدم DeepVerifier هذه القائمة ليعمل كمحرر صارم:

  • المفكك (The Decomposer): بدلاً من طلب إعادة قراءة التقرير الفوضوي بالكامل من الذكاء الاصطناعي، يقوم هذا النموذج بتفكيك المشكلة إلى أسئلة صغيرة وبسيطة. بدلاً من "هل التقرير بأكمله صحيح؟"، يسأل: "هل قال المصدر X بالفعل Y؟" أو "هل هذا الرقم صحيح في أحدث تقرير؟".
  • المتحقق (The Verifier): يجيب على هذه الأسئلة الصغيرة باستخدام القائمة المرجعية.
  • القاضي (The Judge): يعطي درجة (من 1 إلى 4) وملاحظات محددة. إذا كانت الإجابة خاطئة، فهو لا يكتفي بقول "لا"، بل يقول: "لقد استخدمت المصدر الخطأ لهذه الحقيقة. عد وابحث عن الوثيقة الأصلية".

3. السحر: "التطور الذاتي" أثناء الاختبار

الجزء الأروع هو أن هذا يحدث أثناء عمل الذكاء الاصطناعي، دون الحاجة لإعادة تدريب "عقل" الذكاء الاصطناعي (وهو أمر مكلف وبطيء).

تخيل أن الذكاء الاصطناعي كتب إجابة. يقرأها DeepVerifier، ويجد خللاً، ويقول: "مهلاً، لقد فاتك هذا التفصيل". ثم يستخدم الذكاء الاصطناعي تلك الملاحظات لإعادة كتابة الإجابة. هم يفعلون ذلك في حلقة مفرغة (مثل جولة من التحرير).

  • الجولة 1: الذكاء الاصطناعي يكتب الإجابة.
  • الجولة 2: DeepVerifier يجد الأخطاء، والذكاء الاصطناعي يصلحها.
  • الجولة 3: DeepVerifier يجد أخطاءً أكثر دقة، والذكاء الاصطناعي يصلحها مجدداً.

تظهر الورقة أنه مع بضع جولات فقط من هذا "التحرير الذاتي"، يصبح الذكاء الاصطناعي أكثر ذكاءً بشكل ملحوظ. في الاختبارات الصعبة (مثل اختبار GAIA)، قفزت دقة الذكاء الاصطناعي بنسبة 8% إلى 11%. وهذه قفزة هائلة لذكاء اصطناعي لم يتم إعادة تدريبه، بل مُنح فقط طريقة أفضل للتحقق من عمله.

4. الهدية للمجتمع: "DeepVerifier-4K"

لم يحتفظ الباحثون بهذه الحيلة لأنفسهم فحياً. فقد أدركوا أنه لكي تصبح نماذج الذكاء الاصطناعي مفتوحة المصدر (المجانية) جيدة في هذا النوع من التحقق الذاتي، فإنها تحتاج إلى الممارسة.

لذلك، أنشأوا مجموعة بيانات تسمى DeepVerifier-4K. فكر في هذا كـ "دليل تدريبي" يحتوي على 4,646 مثالاً لـ:

  • ذكاء اصطناعي يرتكب خطأً.
  • "المحرر" (DeepVerifier) يشير بدقة إلى ما حدث بشكل خاطئ باستخدام القائمة المرجعية.
  • الذكاء الاصطناعي يصحح الخطأ.

استخدموا هذا الدليل لتعليم النماذج مفتوحة المصدر كيف تكون محرراً لنفسها. والنتيجة؟ أصبحت هذه النماذج المفتوحة أفضل بكثير في التفكير والتقاط أخطائها الخاصة، مما قلص الفجوة مع النماذج المغلقة والمكلفة.

الملخص

باختصار، تعلم هذه الورقة البحثية وكلاء الذكاء الاصطناعي التوقف والتفكير قبل تقديم عملهم. من خلال تفكيك المشكلات الكبيرة إلى حقائق صغيرة قابلة للتحقق واستخدام قائمة مرجعية صارمة للأخطاء الشائعة، يمكن للذكاء الاصطناعي تصحيح نفسه في الوقت الفعلي. إنه يشبه منح الذكاء الاصطناعي مرآة وكتاب قواعد، مما يسمح له بالتطور وتحسين إجاباته فوراً، دون الحاجة إلى معلم يعيد تدريبه من الصفر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →