← أحدث الأبحاث
🤖 machine learning

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

تقدم هذه الورقة CalibForge، وهو نظام ذاتي يقوم بتخليق مهام تدريب نهائية فعالة باستخدام معايرة الحلّال التنافسي لتحديد "منطقة قابلة للتعلم" تكون فيها المهام قابلة للحل ولكنها صعبة في الوقت ذاته، مما يؤدي إلى مكاسب كبيرة في الأداء عبر معايير قياسية متعددة للوكلاء مقارنة بطرق تنسيق البيانات التقليدية.

المؤلفون الأصليون: Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

نُشر 2026-08-07
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية إصلاح الأشياء في ورشة عمل رقمية. تعطي الروبوت صندوق أدوات وقائمة من المهام، ولكن هناك عقبة: إذا كانت المهمة سهلة للغاية، سيشعر الروبوت بالملل ولن يتعلم شيئاً؛ وإذا كانت صعبة للغاية، فسيستسلم فوراً ولن يتعلم شيئاً أيضاً. نقطة التوازن المثالية للتعلم هي تحدي "غولديلوكس" (المنطقة الذهبية) — شيء يمكن للروبوت حله إذا فكر بعمق، ولكنه سيفشل فيه إذا كان غير منتبه أو مشتتاً. هذا هو جوهر لغز تدريب وكلاء الذكاء الاصطناعي: كيف تبتكر مكتبة ضخمة من المهام المضبوطة بدقة لتناسب هذه المنطقة التعليمية؟

لفترة طويلة، حاول الباحثون بناء مكتبات المهام هذه من خلال التأكد فقط من أن المهام يمكن تنفيذها (قابلة للتنفيذ) وأن لها إجابة صحيحة أو خاطئة واضحة. ولكن مجرد إمكانية حل المهمة لا يعني أنها معلم جيد. قد تكون المهمة بسيطة جداً لدرجة أن أي روبوت يحلها فوراً، أو معطلة تماماً لدرجة أنه لا يمكن لأي روبوت حلها أبداً. السؤال الكبير هو: كيف نجد المهام التي تتطلب جهداً كافياً لجعل الروبوت أكثر ذكاءً؟

هنا يأتي دور نظام جديد يسمى CalibForge. فكر في CalibForge ليس كمولد للمهام، بل كـ "سيد لعبة" (Game Master) مشاكس يلعب ألعاباً "خصومية" مع الروبوت. فبدلاً من مجرد التحقق مما إذا كانت المهمة تعمل، يقوم CalibForge بتوظيف فريق من روبوتات "الحل" المختلفة (بعضها ذكي جداً وبعضها أقل ذكاءً) لمحاولة تنفيذ المهمة. إذا نجح الروبوت الذكي في حلها وفشل الروبوت الغبي، فإن المهمة مثالية — إنها في منطقة التعلم! إذا نجح الجميع في حلها، فالمهمة سهلة للغاية، لذا يجعلها CalibForge أكثر صعوبة. وإذا فشل الجميع، فالمهمة معطلة، لذا يقوم CalibForge بإصلاحها. ومن خلال تعديل المهام باستمرار بناءً على رد فعل هذه الروبوتات المختلفة، يبني CalibForge مكتبة ضخمة مكونة من 5,431 تحدياً مضبوطاً بدقة. وعندما يتم تدريب روبوتات جديدة على هذه المكتبة، تصبح أفضل بكثير في حل المشكلات الحاسوبية الواقعية، مما يثبت أن منطقة "غولديلوكس" هي السر وراء نجاح عملية التعلم.

المشكلة: سهلة جداً، صعبة جداً، أم مناسبة تماماً؟

في عالم الذكاء الاصطناعي، وتحديداً بالنسبة لـ "الوكلاء الطرفيين" (الروبوتات التي تكتب الأوامر في طرفية الحاسوب لإصلاح الكود أو إدارة الخوادم)، كان الباحثون يبنون مكتبات ضخمة من مسائل التدريب. والهدف هو تدريب هؤلاء الوكلاء للتعامل مع مهام هندسية معقدة وواقعية. ومع ذلك، هناك خلل في كيفية صنع هذه المشكلات عادةً.

معظم الأنظمة تتحقق فقط من شيئين:

  1. هل يمكن القيام بذلك؟ (هل بيئة الحاسوب مهيأة بشكل صحيح؟)
  2. هل هناك إجابة صحيحة؟ (هل المهمة لها اختبار واضح للنجاح أو الفشل؟)

لكن هذا يشبه إعطاء طالب اختباراً في الرياضيات حيث تكون كل الأسئلة إما "ما هو 2+2؟" (سهلة جداً) أو "حل هذه المعادلة التي لم تُخترع بعد" (مستحيلة). كلاهما لا يساعد الطالب على التعلم. تجادل الورقة البحثية بأننا بحاجة إلى مهام تكون قابلة للتعلم بالنسبة للحلّال (solver-relative learnable). وهذا يعني أن المهمة يجب أن تكون قابلة للحل بواسطة وكيل متمكن، ولكن ليست قابلة للحل بواسطة وكيل أضعف. يجب أن تقع المهمة على الحافة تماماً لقدرة الوكيل، مما يجبره على بذل أقصى طاقته للنجاح.

الحل: سيد اللعبة الخصمي

ابتكر المؤلفون CalibForge، وهو نظام مستقل يعمل كـ "سيد لعبة" لا يكل. هو لا يكتفي بكتابة المهام فح، بل يعايرها باستخدام عملية تسمى المعايرة الخصومية للحلّال (Adversarial Solver Calibration).

إليك كيف يحدث السحر، خطوة بخطوة:

  1. الإشارة: يبدأ CalibForge بفكرة غامضة، مثل "إصلاح قاعدة بيانات معطلة" أو "استعادة بيانات مفقودة".
  2. المسودة: يقوم "وكيل مؤلف" (ذكاء اصطناعي ذكي) بكتابة مهمة كاملة، بما في ذلك التعليمات، وبيئة حاسوب افتراضية، واختبار لمعرفة ما إذا تم إنجاز العمل.
  3. اختبار الضغط: قبل اعتماد المهمة، يرسلها CalibForge إلى لجنة من "وكلاء الحل" لتجربة المهمة.
  4. حلقة المعايرة: هذا هو السر؛ يستخدم CalibForge استراتيجيتين محددتين لتحديد ما إذا كانت المهمة جيدة بما يكفي:
    • المعايرة متعددة الحلّالين: يرسل المهمة إلى مجموعة من نماذج الذكاء الاصطناعي المختلفة. إذا نجح الجميع في حلها، فالمهمة سهلة للغاية، لذا يجعلها CalibForge أكثر صعوبة. وإذا فشل الجميع، فالمهمة معطلة، لذا يقوم CalibForge بإصلاحها. يتم الاحتفاظ بالمهمة فقط إذا حدث اختلاف في النتائج: أي أن حلاً واحداً على الأقل نجح بينما فشل حل آخر على الأقل. هذا يثبت أن المهمة تقع في "منطقة التعلم".
    • المعايرة التباينية: يرسل المهمة إلى "حلّال قوي" (ذكاء اصطناعي شديد الذكاء) و"حلّال ضعيف" (ذكاء اصطناعي أقل قدرة). يتم الاحتفاظ بالمهمة فقط إذا نجح الحلّال القوي وفشل الحلّال الضعيف. هذا يضمن أن المهمة صعبة بما يكفي لتحدي الذكي، ولكن ليست صعبة لدرجة الاستحالة.

إذا لم تستوفِ المهمة هذه المعايير الصارمة، فإن CalibForge لا يكتفي برميها، بل ينظر في سبب فشل أو نجاح الحلّالين، ثم يعود لإعادة كتابة التعليمات، أو البيئة، أو الاختبارات. ويكرر هذه الحلقة حتى 50 مرة حتى تصبح المهمة معايرة بدقة.

النتائج: مكتبة من التحديات المثالية

باستخدام هذه الطريقة، بنى CalibForge مجموعة بيانات مكونة من 5,431 مهمة طرفية معايرة بدقة عالية. ثم قام الباحثون بتدريب نموذجين مختلفين من الذكاء الاصطناعي (نموذج بـ 30 مليار بارامتر ونموذج بـ 35 مليار بارامتر) على هذه البيانات.

كانت النتائج مبهرة. فالنماذج التي تدربت على مهام CalibForge تفوقت بشكل كبير على النماذج المدربة على مجموعات البيانات الحالية الأخرى:

  • في اختبار Terminal-Bench 2.0 (اختبار قياسي لوكلاء الطرفية)، سجلت النماذج 32.58% و 47.57%، متفوقة على أفضل النتائج السابقة بفارق كبير.
  • لم تقتصر التحسينات على بيانات التدريب فحسب، بل عند اختبار النماذج على تحديات هندسة برمجيات واقعية مختلفة (SWE-bench Pro و Doc2Repo)، أظهرت النماذج مكاسب هائلة، حيث تحسنت بنسبة 27.68 و 30.04 نقطة مئوية على التوالي مقارنة بنسخها الأساسية.

لماذا يهم هذا؟

تشير الورقة البحثية إلى أن المفتاح لبناء وكلاء ذكاء اصطناعي أفضل ليس مجرد إعطائهم المزيد من البيانات، بل إعطائهم النوع الصحيح من البيانات. من خلال استخدام سلوك الحلّالين المختلفين كحلقة تغذية راجعة، يضمن CalibForge أن كل مهمة في المكتبة هي فرصة حقيقية للتعلم.

يوضح المؤلفون صراحةً أن مجرد إضافة المزيد من ملاحظات الحلّال أو استخدام حلّال واحد للتحقق من المهام ليس كافياً. "تأثير غولديلوكس" — حيث تكون المهمة صعبة للبعض وسهلة لآخرين — هو ما يدفع عملية التعلم. يحول هذا النهج عملية إنشاء المهام من طريقة "اكتب وانتظر" الثابتة إلى نظام ديناميكي ذاتي التصحيح يبحث بنشاط عن المستوى المثالي للصعوبة.

باخت-صار، يثبت CalibForge أنه إذا كنت تريد تدريب روبوت فائق الذكاء، فلا ينبغي أن تعطيه مجرد كومة من الواجبات المنزلية، بل يجب أن تعطيه كومة من الواجبات المنزلية المضبوطة بدقة لتجعله يفكر، ويجاهد، وينجح في النهاية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →