← أحدث الأبحاث
💬 NLP

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

تقدم الورقة البحثية نموذج DR Tulu، وهو نموذج بحث عميق مفتوح المصدر تم تدريبه عبر التعلم التعزيزي باستخدام معايير التقييم المتطورة (RLER) التي تطور معايير التقييم بالتزامن مع السياسة، مما يمكّنه من التفوق على الوكلاء المفتوحين الحاليين ومنافسة الأنظمة المملوكة في مهام البحث طويلة المدى مع كونه أكثر فعالية من حيث التكلفة بشكل كبير.

المؤلفون الأصليون: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca So
نُشر 2026-05-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: تعليم روبوت كيف يكون باحثاً

تخيل أنك تريد تعليم روبوت كتابة تقرير بحثي طويل ومفصل حول موضوع معقد، مثل "كيف تسبب الطفرات الجينية أمراضاً نادرة؟" أو "ما هو تاريخ الطاقة المتجددة؟".

معظم نماذج الذكاء الاصطناعي اليوم تشبه الطلاب الذين يدرسون فقط من أجل الاختبارات القصيرة. فهم بارعون في الإجابة على الأسئلة البسيطة مثل "ما هي عاصمة فرنسا؟"، لكنهم يعانون عندما يُطلب منهم كتابة تقرير مكون من 20 صفحة يتطلب البحث في مئات المواقع الإلكترونية، والتحقق من الحقائق، والاستشهاد بالمصادر.

قام مؤلفو هذه الورقة البحثية ببناء ذكاء اصطناعي جديد يسمى DR Tulu. إنه أول نموذج مفتوح المصدر تم تدريبه خصيصاً ليكون "باحثاً عميقاً". فهو لا يكتفي بالتخمين؛ بل يخطط، ويبحث في الويب، ويقرأ الأوراق البحثية، ويكتب تقريراً طويلاً وموثقاً جيداً.

المشكلة: كيف تُقيم تقريراً طويلاً؟

لتعليم الذكاء الاصطناعي كيف يؤدي بشكل أفضل، تستخدم عادةً طريقة تسمى التعلم التعزيزي (Reinforcement Learning). فكر في الأمر كتدريب كلب:

  1. يقوم الكلب (الذكاء الاصطناعي) بحركة معينة.
  2. إذا فعلها بشكل صحيح، يحصل على مكافأة (قطعة حلوى).
  3. إذا أخطأ، لا يحصل على مكافأة.

المشكلة في التقارير البحثية الطويلة هي أنه من الصعب معرفة شكل التقرير "الجيد".

  • المعايير الثابتة (الطريقة القديمة): تخيل معلماً يعطي الكلب قائمة مراجعة ثابتة: "يجب أن يحتوي على 5 فقرات. يجب أن يذكر عام 1990". إذا كتب الكلب تقريراً رائعاً عن عام 1991، سيفشل المعلم الكلب لأنه لم يتبع القائمة الجامدة. القائمة لا تعرف ما الذي وجده الكلب بالفعل.
  • مشكلة "الكتاب المغلق": إذا طلبت من ذكاء اصطناعي وضع قائمة المراجعة بناءً على ما يعرفه مسبقاً فقط، فقد يغفل عن حقائق جديدة اكتشفها للتو على الإنترنت.

الحل: "المعايير المتطورة" (المعلم الذكي)

تقدم الورقة البحثية طريقة جديدة تسمى RLER (التعلم التعزيزي باستخدام المعايير المتطورة).

تخيل معلماً ذكياً لا يستخدم قائمة مراجعة ثابتة، بل يراقب الطالب (الذكاء الاصطناعي) وهو يقوم ببحثه في الوقت الفعلي.

  1. الطالب يبحث: يذهب الطالب، يجد حقائق جديدة، ويكتب مسودة.
  2. المعلم يتكيف: ينظر المعلم الذكي إلى ما وجده الطالب: "أوه، لم أكن أعرف بوجود هذه الحقيقة! يجب أن أضيف قاعدة جديدة لقائمة المراجعة الخاصة بي: (يجب شرح هذه الحقيقة الجديدة)".
  3. حلقة التغذية الراجعة: يقوم المعلم بتحديث قائمة المراجعة أثناء تعلم الطالب. إذا حاول الطالب الغش (مثل نسخ النص دون قراءته)، سيضيف المعلم فوراً قاعدة: "لا يُسمى الغش مسموحاً".

من الناحية التقنية، تسمي الورقة البحثية هذه المعايير "المعايير المتطورة" (Evolving Rubrics). وهي معايير تقييم تتغير وتصبح أكثر ذكاءً مع استكشاف الذكاء الاصطناعي لمزيد من المعلومات. وهذا يسمح للذكاء الاصطناعي بالتعلم من اكتشافاته الخاصة بدلاً من أن يظل عالقاً في مجموعة ثابتة من القواعد.

النتيجة: باحث خارق بميزانية محدودة

درب المؤلفون DR Tulu باستخدام طريقة "المعلم الذكي" هذه. وإليك ما حدث:

  • إنه أكثر ذكاءً: تفوق DR Tulu على نماذج البحث مفتوحة المصدر الأخرى بفارق هائل. لقد كتب تقارير أفضل، ووجد حقائق أكثر دقة، واستشهد بالمصادر بشكل صحيح.
  • ينافس العمالقة: قدم أداءً يضاهي (وأحياناً يتفوق على) الأنظمة المملوكة للشركات الكبرى مثل OpenAI وGoogle.
  • إنه رخيص: هذا هو الفوز الأكبر. الأنظمة المكلفة تكلف حوالي 1.80 دولار لكل سؤال. أما DR Tulu فيكلف حوالي 0.002 دولار لكل سؤال. أي أنه أرخص بنحو 1,000 مرة.

اختبار "المرض الجيني"

لإثبات نجاح الطريقة، أعطى الفريق DR Tulu مهمة صعبة للغاية: تحليل الطفرات الجينية لمعرفة ما إذا كان يمكن علاجها بأدوية معينة. وهذه مهمة تُخصص عادةً للخبراء الطبيين البشريين.

  • نجح DR Tulu في البحث عبر قواعد البيانات الطبية، وإيجاد الأوراق البحثية ذات الصلة، وتلخيص تقرير شامل.
  • تمكن من منافسة أكثر أنظمة الذكاء الاصطناعي تكلفة وانغلاقاً في هذه المهمة.
  • فشلت نماذج أخرى مفتوحة المصدر لأنها لم تستطع إيجاد الاستشهادات الصحيحة أو التحقق من الحقائق.

الأدوات: "dr-agent-lib"

أصدرت الورقة البحثية أيضاً "صندوق أدوات" يسمى dr-agent-lib.

  • فكر في هذا كأنه سكين سويسري متعدد الاستخدامات لباحثي الذكاء الاصطناعي.
  • يتيح للذكاء الاصطناعي استخدام أدوات مختلفة: بحث Google، وقراءة صفحات ويب محددة، والبحث في الأوراق الأكاديمية.
  • والأهم من ذلك، يتعلم الذكاء الاصطناعي اختيار الأداة المناسبة للمهمة. إذا كان السؤال يتعلق بالعلم، فإنه يستخدم أداة "البحث عن الأوراق البحثية". وإذا كان عن الأخبار العامة، فإنه يستخدم "بحث الويب". هو لا يستخدم أداة واحدة بشكل أعمى.

الملخص

تقدم الورقة البحثية DR Tulu، وهو ذكاء اصطناعي مفتوح المصدر يتعلم كيفية إجراء بحث عميق وطويل المدى. يستخدم طريقة تدريب خاصة (المعايير المتطورة) حيث يتم تحديث "قواعد التقييم" الخاصة بالذكاء الاصطناعي في الوقت الفعلي بناءً على ما يكتشفه الذكاء الاصطناعي. وهذا يجعل الذكاء الاصطناعي أكثر ذكاءً، ودقة، وأرخص بكثير من أدوات البحث الحالية الأكثر تطوراً. وقد شارك المؤلفون الكود، والبيانات، والنموذج ليكون متاحاً للجميع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →