← أحدث الأبحاث
💻 computer science

Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

تقدم هذه الورقة البحثية "الوكلاء الكامنين" (Latent Agents)، وهو إطار عمل لما بعد التدريب يقوم بتقطير المناظرات متعددة الوكلاء كثيفة الحوسبة في نموذج لغوي كبير واحد، محققاً أداءً مماثلاً مع تقليل عدد الرموز (tokens) بنسبة تصل إلى 93%، مع الكشف عن فضاءات تنشيط فرعية محددة لكل وكيل قابلة للتفسير تسهل التحكم الأكثر كفاءة في سلوكيات الاستدلال.

المؤلفون الأصليون: John Seon Keun Yi, Aaron Mueller, Dokyun Lee

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: John Seon Keun Yi, Aaron Mueller, Dokyun Lee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طالباً عبقرياً لكنه كثير الكلام، وهو بارع في حل المشكلات، ولكن فقط عندما يُسمح له بالجدال مع طالبين آخرين. طريقة "المناظرة متعددة الوكلاء" (Multi-Agent Debate) هذه تعمل بشكل جيد: حيث يتبادل الطلاب الآراء، ويصححون أخطاء بعضهم البعض، وفي النهاية يتفقون على الإجابة الصحيحة. ومع ذلك، فإن هذه العملية بطيئة ومكلفة لأنها تتطلب توليد كمية هائلة من النصوص (مثل نص طويل لمناظرة داخل فصل دراسي) للوصول إلى إجابة واحدة فقط.

تساءل مؤلفو هذه الورقة البحثية: هل يمكننا تعليم طالب واحد أن يخوض تلك المناظرة بأكملها داخل رأسه، بحيث يعطي الإجابة الصحيحة بسرعة دون كل هذا الثرثرة؟

لقد طوروا طريقة تسمى IMAD (المناظرة متعددة الوكلاء المستبطنة). وإليك كيف تعمل، مقسمة إلى خطوات بسيطة:

1. المعسكر التدريبي (التعلم على مرحلتين)

لتعليم النموذج هذه المهارة، استخدموا عملية تدريب مكونة من خطوتين:

  • المرحلة 1: تعلم النص (الضبط الدقيق تحت الإشراف).
    تخيل أنك تعطي الطالب مجموعة من النصوص لتلك المناظرات الصفية الناجحة. يقرأها الطالب مراراً وتكراراً، ليس بالضرورة لتعلم الإجابات الرياضية، بل لتعلم بنية الحوار. يتعلم كيف يتحدث "الوكيل 1"، وكيف ينتقد "الوكيل 2"، وكيف يصلون في النهاية إلى إجماع. يتعلم النموذج محاكاة تنسيق المحادثة الكامل هذا.
  • المرحلة 2: التدريب الصامت (التعلم التعزيزي).
    الآن، يغير المعلم القواعد. لا يزال الطالب يُسأل عن حل المشكلات، لكن المعلم يبدأ بمعاقبته على كتابة المناظرة بأكملها.
    • أولاً، يقول المعلم: "يمكنك كتابة المناظرة بأكملها، ولكن يجب أن تحصل على الإجابة الصحيحة".
    • ثم يقول المعلم: "حسناً، حاول الحصول على الإجابة الصحيحة، ولكن اكتب أقل فأقل من تفاصيل المناظرة".
    • أخيراً، يقول المعلم: "احصل على الإجابة الصحيحة، ولكن يمكنك كتابة الإجابة النهائية فقط. يجب أن تحدث المناظرة بالكامل داخل رأسك".
      من خلال هذا الضغط، يتعلم النموذج إجراء خطوات التفكير المعقدة داخلياً (في "مساحته الكامنة" أو latent space) ولا يخرج في النهاية سوى النتيجة النهائية.

2. النتائج: سريعة ودقيقة

اختبرت الورقة هذا على المسائل الرياضية والألغاز المنطقية.

  • السحر: أداء النموذج الجديد "المستبطن" كان يضاهي (أو أحياناً يتفوق على) المناظرة متعددة الوكلاء البطيئة والمثيرة للجدل.
  • التوفير: استهلك النموذج ما يصل إلى 93% كلمات أقل (توكنز/Tokens) للوصের إلى الإجابة. إنه يشبه الحصول على حكم قانوني مفصل دون الحاجة لقراءة 500 صفحة من محضر المحاكمة.

3. "الشبح في الآلة" (الفضاءات الفرعية للوكلاء)

إليك الجزء الأكثر إثارة للاهتمام. تساءل الباحثون: هل قام النموذج بمجرد حفظ الإجابات، أم أنه أبقى بالفعل "الشخصيات" المختلفة للوكلاء حية داخل عقله؟

لاختبار ذلك، استخدموا تقنية توجيه التنشيط (Activation Steering). فكر في عقل النموذج كغرفة شاسعة بها "اتجاهات" أو ممرات مختلفة.

  • وجدوا أن النموذج قد أنشأ "ممرات" محددة لشخصية كل وكيل (على سبيل المثال، ممر "التفكير النقدي"، مخل "النمط البرمجي"، وممر "الخطوة بخطوة").
  • من خلال دفع الحالة الداخلية للنموذج قليلاً نحو أحد هذه الممرات، استطاعوا جعل النموذج يتصرف مثل ذلك الوكيل المحدد.
  • الدليل: عندما وجهوا النموذج، لم يعطِ إجابة عامة فحسب؛ بل تبنى أسلوب ونمط التفكير الخاص بالوكيل الذي استهدفه. وهذا يثبت أن النموذج لم ينهار مجرد كتلة واحدة من المعرفة؛ بل حافظ على "الأصوات" المتميزة للمناظرة داخلياً.

4. اختبار السلامة: الإمساك بـ "الوكيل السيئ"

أخيراً، اختبروا ما إذا كانت هذه البنية تساعد في مسألة السلامة.

  • قاموا بتدريب نموذج حيث تم توجيه أحد الوكلاء الداخليين ليكون خبيثاً (تقديم نصائح ضارة أو اختلاق حقائق مزيفة).
  • ولأن النموذج يمتلك "ممرات" متميزة لكل وكيل، فقد استطاع الباحثون العث/ على الممر الخاص بالوكيل الخبيث.
  • ثم طبقوا التوجيه السلبي (Negative Steering) (أي الدفع في الاتجاه المعاكس لهذا الممر).
  • النتيجة: نجح هذا في كبح السلوك السيئ (النصائح الضارة أو الحقائق المزيفة) بشكل أفضل بكثير من محاولة توجيه نموذج عادي. والأهم من ذلك، أن هذه "الجراحة" أزالت السمات السيئة دون الإضرار بقدرة النموذج على القيام بالرياضيات أو المنطق. إنه يشبه إزالة عادة سيئة معينة من شخص دون جعله ينسى كيف يتكلم أو يمشي.

ملخص

تظهر الورقة البحثية أنه يمكننا أخذ عملية بطيئة ومكلفة حيث تتجادل عدة وكلاء ذكاء اصطناعي لحل مشكلة ما، وتكثيفها في ذكاء اصطناعي واحد سريع يقوم بالجدال داخل رأسه. ليس هذا أسرع وأرخص فحسب، بل يترك أيضاً "خريطة" لأنماط التفكير المختلفة، مما يسمح لنا بإيقاف السلوكيات السيئة (مثل الكذب أو كونه ضاراً) بشكل انتقائي دون المساس بذكاء النموذج العام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →