OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis
يقدم OpenResearcher خط إنتاج مفتوح بالكامل، وقابل لإعادة الإنتاج، ويعمل دون اتصال بالإنترنت، يقوم بتوليف أكثر من 97,000 مسار بحث عميق طويل الأمد من مجموعة مستندات تضم 15 مليون مستند، مما يمكّن نموذجًا بـ 30 مليار معلمة و3 مليارات معلمة نشطة (30B-A3B) من تحقيق تحسن في الدقة قدره 34 نقطة في اختبار BrowseComp-Plus مع توفير بيئة محكومة لتحليل استراتيجيات تصميم الوكيل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تريد تعليم روبوت كيف يصبح محققاً عالمياً. للقيام بذلك، عليك أن تظهر له آلاف الأمثلة حول كيفية حل الألغاز المعقدة: كيف يطرح الأسئلة الصحيحة، وكيف يزور مكتبات مختلفة، وكيف يقرأ صفحات محددة، وكيف يجد الدليل الصغير الذي يحل القضية.
المشكلة؟ في العالم الحقيقي، القيام بذلك مكلف، وفوضوي، ومستحيل التكرار. إذا أرسلت روبوتاً إلى الإنترنت الفعلي ليتدرب، فسيتعين عليك دفع رسوم مقابل كل عملية بحث، وقد تتغير المواقع الإلكترونية أو تختفي، ولا يمكنك التأكد مما إذا كان الروبوت قد وجد الإجابة لأنه ذكي أم لأنه حالفه الحظ فحسب.
إليك "OpenResearcher".
فكر في "OpenResearcher" كـ "محاكي تدريب للمحققين" ضخم ومتكامل ومستقل. بدلاً من إرسال الروبوت إلى العالم الحقيقي الفوضوي والمكلف، قام الباحثون ببناء نسخة طبق الأصل مثالية، تعمل دون اتصال بالإنترنت، من الإنترنت داخل حاسوبهم.
إليك كيف فعلوا ذلك، مقسماً إلى خطوات بسيطة:
1. بناء "مكتبة كل شيء" (المتن غير المتصل بالإنترنت - The Offline Corpus)
تخيل أنك تريد تدريب محقق، لكن ليس لديك مكتبة. لذا، تذهب وتشتري 10,000 كتاب محدد تحتوي على الإجابات لأسئلة التدريب الخاصة بك، ثم تذهب إلى مستودع ضخم وتجلب 15 مليون كتاب آخر عشوائي لملء الرفوف.
- العالم الحقيقي: سيتعين عليك دفع رسوم في كل مرة تطلب فيها من أمين المكتبة كتاباً.
- OpenResearcher: قاموا ببناء مكتبة محلية تضم 15 مليون وثيقة. وبمجرد بنائها، تصبح مجانية للاستخدام للأبد. لا رسوم، ولا حاجة لاتصال بالإنترنت.
2. "المعلم" و"الطالب"
- المعلم (GPT-OSS-120B): هذا ذكاء اصطناعي فائق الذكاء يعمل كأنه محقق خبير. هو يعرف كيف يحل الأسئلة الصعبة.
- الطالب (نموذج الـ 30B): هذا هو الذكاء الاصطناعي الأصغر الذي يريدون تدريبه. إنه يشبه المحقق المبتدئ.
ترك الباحثون المعلم يحل الأسئلة باستخدام مكتبته غير المتصلة بالإنترنت. المعلم لا يخمن فحسب؛ بل يجب عليه اتباع مجموعة صارمة من القواعد:
- البحث: اطلب من أمين المكتبة قائمة بالكتب.
- الفتح: اذهب واقرأ الكتاب كاملاً (ليس مجرد الملخص).
- الإيجاد: استخدم (Ctrl+F) للعثور على الجملة الدقيقة داخل الكتاب التي تثبت الإجابة.
يكتب المعلم مسار تفكيره بالكامل: "بحثت عن (X)، وجدت (Y)، فتحت الكتاب، انتقلت إلى الصفحة 5، وجدت الكلمة (Z)، والآن أعرف أن الإجابة هي (A)."
3. "مونتاج التدريب" (The Training Montage)
سجل الباحثون 97,000 قصة من قصص هؤلاء المحققين. بعضها كان قصيراً وسهلاً (5 خطوات)، بينما كان بعضها الآخر طويلاً وصعباً للغاية (أكثر من 100 خطوة!).
- التشبيه: الأمر يشبه تسجيل 97,000 ساعة من طاهٍ ماهر وهو يطبخ، من تقطيع البصل وصولاً إلى تقديم الطبق النهائي.
- ثم قاموا بتغذية هذه التسجيلات لـ الطالب (المحقق المبتدئ). درس الطالب هذه التسجيلات ليتعلم كيف يفكر، وليس فقط ما هي الإجابة.
4. النتائج: من مبتدئ إلى محترف
بعد دراسة هذه التسجيلات، أصبح الطالب مذهلاً.
- قبل التدريب: كان الطالب مثل شخص يخمن الإجابات، حيث يحصل على حوالي 20% فقط من الإجابات الصحيحة.
- بعد التدريب: حصل الطالب على 54.8% من الإجابات الصحيحة في اختبارات صعبة جداً.
- السحر: تم تدريب الطالب فقط على المحاكي غير المتصل بالإنترنت، ومع ذلك تفوق في أدائه على العديد من الأنظمة المملوكة والمكلفة التي تعتمد على الإنترنت الحقيقي.
لماذا يعد هذا أمراً هاماً؟ (لحظات الاستنتاج المذهلة)
اكتشفت الورقة البحثية أيضاً بعض الأسرار المثيرة حول كيفية عمل هؤلاء المحققين من الذكاء الاصطناعي:
- فخ "البحث مقابل القراءة": إذا سمحت للذكاء الاصطناعي بـ "البحث" فقط (النظر في عناوين الكتب وملخصاتها)، فإنه سيفشل. الأمر يشبه محاولة حل لغز جريمة قتل من خلال قراءة ملخصات الكتب الموجودة على الغلاف الخلفي فقط. يجب أن تسمح للذكاء الاصطناعي بـ "فتح" الكتاب و"إيجاد" النص المحدد.
- إيجاد الدليل ليس كافياً: مجرد عثور الذكاء الاصطناعي على الكتاب الصحيح (الوثيقة الذهبية) لا يعني أنه حصل على الإجابة الصحيحة. لا يزال عليه قراءة الصفحة وفهم المنطق. أحياناً يجد الذكاء الاصطناعي الإجابة ولكنه يسيء تفسير الجدول أو الجملة.
- المزيد من الخطوات = نتائج أفضل (إلى حد ما): أفضل المحققين استغرقوا وقتاً طويلاً. لم يتسرعوا. بحثوا، وفتحوا، وقرأوا، وبحثوا مرة أخرى. أظهر التدريب أن السماح للذكاء الاصطناعي باتخاذ أكثر من 100 خطوة كان ضرورياً في كثير من الأحيان لحل أصعب الألغاز.
الخلاصة
OpenResearcher هو تغيير لقواعد اللعبة لأنه يجعل البحث العميق متاحاً للجميع.
- قبل ذلك: كانت الشركات الغنية فقط التي تمتلك ملايين الدولارات تستطيع تدريب الذكاء الاصطناعي ليكون باحثاً عميقاً لأنها كانت تستطيع تحمل تكاليف رسوم البحث في الإنترنت الحقيقي.
- الآن: يمكن لأي شخص تحميل هذه "المكتبة غير المتصلة بالإنترنت"، وتشغيل المحاكاة، وتدريب محقق الذكاء الاصطناعي الخاص به مجاناً. إنه يشبه منح الجميع مكتبة خاصة لا نهائية ومحققاً ماهراً للتعلم منه، دون الحاجة أبداً لمغادرة منازلهم.
إنه يثبت أنك لست بحاجة إلى اتصال حي ومكلف بالإنترنت لتعليم الذكاء الاصطناعي كيفية التفكير بعمق؛ أنت فقط بحاجة إلى خريطة جيدة، ومكتبة كبيرة، ومعلم ذكي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.