OpenDeepThink: Parallel Reasoning via Bradley--Terry Aggregation
يُعد OpenDeepThink إطار عمل للحوسبة في وقت الاختبار قائم على المجموعات السكانية، يعمل على تعزيز قدرات الاستنتاج لدى النماذج اللغوية الكبيرة عبر تجميع مقارنات "برادلي-تيري" الثنائية لاختيار الحلول المرشحة وطفراتها وتطويرها، مما يحقق مكاسب أداء كبيرة في الاختبارات المعيارية الموضوعية مثل Codeforces دون الحاجة إلى إعادة ضبط النموذج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول حل لغز صعب للغاية، مثل مسألة رياضية معقدة أو تحدٍ برمجي شائك. عادةً، عندما تطلب من الذكاء الاصطناعي حل مسألة ما، يحاول الذكاء الاصطناعي التفكير في المسألة عبر خط مستقيم واحد طويل. وإذا ارتكب خطأً صغيراً في البداية، فإن الإجابة بأكملها تنهار، ويضطر للبدء من الصفر.
تقدم الورقة البحثية طريقة جديدة تسمى OpenDeepThink. بدلاً من مطالبة الذكاء الاصطناعي بالتفكير في خط واحد، تطلب منه OpenDeepThink أن يفكر في هيئة حشد.
إليك كيف يعمل ذلك، مقسماً إلى خطوات بسيطة باستخدام التشبيهات:
1. "حفلة العصف الذهني" (أخذ العينات المتوازي - Parallel Sampling)
بدلاً من طلب إجابة واحدة من الذكاء الاصطناعي، تطلب منه OpenDeepThink توليد 20 إجابة مختلفة في نفس الوقت.
- التشبيه: تخيل أنك معلم تسأل 20 طالباً لحل مسألة رياضية. أنت لا تنتظر الطالب الأذكى فحسب؛ بل تترك الجميع يكتبون حلولهم فوراً. سيكون بعضهم عبقرياً، وبعضهم جيداً، وبعضهم الآخر سيكون خاطئاً تماماً.
2. "البطولة" (المقارنة الثنائية - Pairwise Comparison)
الآن لديك 20 حلاً، ولكن كيف تختار الأفضل بينها؟ عادةً، قد تسأل الذكاء الاصطناعي: "هل هذه الإجابة جيدة؟". لكن الورقة تقول إن الذكاء الاصطناعي سيء في تقييم عمله بمفرده (فهو يميل إلى الثقة المفرطة أو الانحياز).
- الحل: بدلاً من سؤال "هل هذا جيد؟"، يُطلب من الذكاء الاصطناعي مقارنة إجابتين جنباً إلى جنب: "بين الحل (أ) والحل (ب)، أيهما أفضل، ولماذا؟".
- التشبيه: فكر في الأمر كبطولة رياضية. من الصعب القول من هو "أفضل لاعب في العالم" بمجرد النظر إليه. ولكن إذا وضعت اللاعب (أ) ضد اللاعب (ب) في مباراة، فمن السهل جداً رؤية من سيفوز. هنا يعمل الذكاء الاصطناعي كحكم، يشاهد أزواج الحلول وهي تتواجه ويعلن الفائز لكل زوج.
3. "لوحة النتائج" (تجميع برادلي-تيري - Bradley–Terry Aggregation)
بعد أن يقارن الذكاء الاصطناعي بين العديد من الأزواج، فإنه لا يكتفي بعدّ الانتصارات فقط. بل يستخدم صيغة رياضية خاصة (تسمى برادلي-تيري) لإنشاء تصنيف عالمي.
- التشبيه: تخيل جدول دوري كرة القدم. إذا فاز الفريق (أ) على الفريق (ب)، وفاز الفريق (ب) على الفريق (ج)، فإن الرياضيات تعرف أن الفريق (أ) من المرجح أن يكون أقوى من الفريق (ج)، حتى لو لم يلعبا ضد بعضهما البعض بعد. هذا يخلق "لوحة صدارة" موثوقة للحلول العشرين.
4. "التطور" (الطفرة والاختيار - Mutation and Selection)
هنا يحدث السحر. النظام لا يكتفي باختيار الفائز والتوقف؛ بل يطور الحلول عبر عدة جولات (أجيال).
- الـ 25% الأدنى (الخاسرون): يتم التخلص من أسوأ الحلول.
- الـ 25% الأعلى (النخبة): يتم الحفاظ على أفضل الحلول بأمان، ولكن تتاح لها أيضاً فرصة للتحسن.
- الـ 75% الوسطى (المُعدِّلون): يأخذ الذكاء الاصطناعي "الانتقادات" (الأسباب التي جعلت حلاً يتفوق على آخر) ويستخدمها لإعادة كتابة الحلول.
- التشبيه: تخيل مدرباً يتحدث إلى اللاعبين. بدلاً من مجرد قول "لقد أبليتم بلاءً حسناً"، يقول المدرب: "لقد خسرت لأن سرعتك في الجري كانت بطيئة جداً". ثم يستخدم اللاعبون هذا التعليق المحدد لتغيير استراتيجيتهم. قد يعيد الذكاء الاصطناعي كتابة الحل بالكامل إذا كان التعليق يشير إلى الحاجة لنهج جديد تماماً.
5. "المواجهة النهائية"
بعد بضع جولات من حلقة "البطولة والتدريب" هذه، يقوم النظام بإجراء مقارنة نهائية مفصلة للغاية بين أفضل الحلهای المتبقية لاختيار الإجابة الأفضل والوحيدة لتقديمها.
لماذا يعد هذا أمراً هاماً؟
- لا حاجة لـ "ورقة غش": عادةً، لمعرفة ما إذا كان الذكاء الاصطناعي مصيباً، تحتاج إلى إنسان أو برنامج كمبيوتر للتحقق من الإجابة (مُحقِّق). OpenDeepThink لا يحتاج إلى ذلك؛ فهو يجد الإجابة الأفضل بمجرد جعل الذكاء الاصطناعي يقارن نفسه بنفسه.
- أفضل في المسائل الصعبة: اختبرت الورقة البحثية هذه الطريقة على مسائل برمجية صعبة للغاية (مثل تلك الموجودة في البرمجة التنافسية). وجدوا أن هذه الطريقة جعلت ذكاءً اصطناعياً رفيع المستوى (Gemini 3.1 Pro) يؤدي كما لو كان خبيراً بمستوى أعلى بكثير، مما رفع "تصنيفه المهاري" بأكثر من 400 نقطة.
- يعرف حدوده: تعمل هذه الطريقة بشكل رائع في المواضيع التي لها إجابات واضحة (صواب/خطأ) مثل الرياضيات أو البرمجة. ومع ذلك، في المواضيع الذاتية (مثل كتابة مقال أو مناقشة التاريخ)، قد تسوء النتائج أحياناً. وذلك لأن مقارنة "الآراء" أصعب من مقارنة "الحقائق". فإذا لم يستطع الحكم (الذكاء الاصطناعي) التمييز بين الرأي الجيد والرأي السيئ، فإن النظام بأكائه سيصاب بالارتباك.
التكلفة
المقايضة هي السرعة والتكلفة. نظرًا لأن الذكاء الاصطناعي يجب أن يولد 20 إجابة، ويقارن بينها في أزواج، ويعيد كتابتها عدة مرات، فإن الأمر يتطلب الكثير من قوة الحوسبة والوقت (حوالي 27 دقيقة لكل مسألة في اختبارهم). الأمر يشبه توظيف فريق كامل من الخبراء ولجنة من الحكام لحل مسألة واحدة، بدلاً من مجرد سؤال شخص واحد.
باخت-اختصار: يحول OpenDeepThink التفكير في الذكاء الاصطناعي من "عدو سريع منفرد" إلى "بطولة فريق". من خلال جعل الذكاء الاصطناعي يتنافس ضد نفسه ويتعلم من أخطائه من خلال المقارنة، فإنه يحل المسائل الصعبة بشكل أفضل بكثير مما يمكنه فعله بمفرده.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.