← أحدث الأبحاث
💬 NLP

UR2^2: Unify RAG and Reasoning through Reinforcement Learning

يُعدُّ UR2^2 إطار عمل عام للتعلم التعزيزي يوحد بين التوليد المعزز بالاسترجاع (RAG) والاستدلال المعقد عبر استخدام منهج دراسي مدرك للصعوبة واستراتيجية وصول هجينة للمعرفة لتنسيق الاسترجاد والاستدلال ديناميكيًا عبر مجالات متنوعة.

المؤلفون الأصليون: Weitao Li, Boran Xiang, Xiaolong Wang, Zhinan Gou, Weizhi Ma, Yang Liu

نُشر 2026-04-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Weitao Li, Boran Xiang, Xiaolong Wang, Zhinan Gou, Weizhi Ma, Yang Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تخوض امتحاناً عالي المخاطر. لديك طريقتان لحل المشكلات: يمكنك الاعتماد على قدرتك الذهنية (منطقك الداخلي واستنتاجك)، أو يمكنك استخدام كتاب مدرسي (المعرفة الخارجية/RAG).

تعاني معظم نماذج الذكاء الاصطناعي من مشكلة "غولدي لوكس" (الاعتدال):

  1. الطالب الكسول: يستخدم الكتاب المدرسي لكل شيء، حتى في العمليات الحسابية البسيطة مثل 2+22+2، مما يضيع الوقت ويجعله يفقد قدرته على التفكير النقدي.
  2. الطالب الواثق بزيادة: يرفض النظر في الكتاب المدرسي حتى عندما يكون عالقاً بوضوح، مما يؤدي به إلى ذكر حقائق خاطئة بكل ثقة.

قام الباحثون في جامعة تسينغوا بتطوير UR2، وهو إطار عمل يعلم الذكاء الاصطناعي كيف يكون "الطالب المثالي". إليك كيف فعلوا ذلك باستخدام ثلاث استراتيجيات ذكية:

1. "الملخص الذكي" (طريقة التحديد)

تخيل لو أنك كلما فتحت كتاباً مدرسياً، واجهت 500 صفحة من النصوص الكثيفة والمبعثرة. ستشعر بالإرهاق!

بدلاً من إجبار الذكاء الاصطناكي على قراءة مقالات ويكيبيديا كاملة وفوضوية، يستخدم UR2 "مساعداً صغيراً" لقراءة المقالات أولاً. يقوم هذا المساعد بإنشاء "ورقة غش" — ملخص صغير ومركز للغاية يحتوي فقط على الحقائق التي يحتاجها الذكاء الاصطناعي. هذا يمنع الذكاء الاصطناعي من "الضياع في التفاصيل" غير ذات الصلة ويحافظ على تركيزه على المشكلة الفعلية.

2. "المنهج المدرسي المدرك للصعوبة" (طريقة الارتقاء بالمستوى)

لن تعلم طفلاً صغيراً التفاضل والتكامل، ولن تعطي طالب دكتوراه كتاب تلوين.

يستخدم UR2 جدولاً تدريبياً ذكياً:

  • للأسئلة السهلة: يُقال للذكاء الاصطناعي: "استخدم عقلك فقط". هذا يحافظ على قوة عضلات الاستنتاج الداخلي لديه.
  • للأسئلة الصعبة: يُقال للذكاء الاصطناعي: "لا بأس باستخدام الكتاب المدرسي الآن".

من خلال التدريب بهذه الطريقة، يتعلم الذكاء الاصطناعي بالضبط متى يفكر ومتى يبحث. فهو لا يصبح "محرك بحث لا يستطيع التفكير"، ولا "مفكراً لا يستطيع البحث".

3. "التدريب ذو الخطوتين" (المدرب والمحترف)

تدريب الذكاء الاصطناعي على القيام بالأمرين معاً يشبه محاولة تعلم ركوب الدراجة وفي الوقت نفسه تعلم التلاعب بالكرات في الهواء. إنه أمر يفوق القدرة!

يقسم UR2 التدريب إلى مرحلتين:

  • المرحلة الأولى (تعلم الأدوات): يتم توجيه الذكاء الاصطناعي خصيصاً حول كيفية استخدام أداة البحث. يحصل على "نقاط" لطرح أسئلة جيدة وواضحة، حتى لو لم يصل إلى الإجابة النهائية الصحيحة بعد. إنه مثل مدرب يعلم اللاعب كيفية أرجحة المضرب بشكل صحيح.
  • المرحلة الثانية (الفوز بالمباراة): بمجرد أن يعرف الذكاء الاصطناعي كيفية استخدام الأدوات، ينتقل التركيز إلى الحصول على الإجابة الصحيحة. الآن، تُمنح "النقاط" بناءً على الدقة.

النتيجة؟

اختبر الباحثون هذا النظام في الرياضيات، والطب، والمعرفة العامة. وكانت النتيجة "طالباً خارقاً". حتى نماذج الذكاء الاصطناعي الصغيرة والفعالة (مثل نسخة 7B) بدأت تؤدي بشكل يقارب العقول الضخمة والمكلفة مثل GPT-4o-mini.

باخت de: يعلم UR2 الذكاء الاصطناعي ليس فقط كيف يعرف المزيد، بل كيف يستخدم ما يعرفه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →