← أحدث الأبحاث
💬 NLP

CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

يُعد CANTANTE إطار عمل مبتكرًا يعمل على تحسين الأنظمة متعددة الوكلاء القائمة على النماذج اللغوية الكبيرة من خلال حل مشكلة تخصيص الائتمان عبر العزو التبايني للمكافآت على مستوى النظام إلى الوكلاء الأفراد، محققًا أداءً رائدًا في تحسين الأوامر البرمجية عبر معايير متنوعة مع تقليل تكاليف الاستدلال.

المؤلفون الأصليون: Tom Zehle

نُشر 2026-05-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tom Zehle

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فريقًا من ثلاثة خبراء يعملون معًا لحل لغز صعب: المخطط (Planner) الذي يرسم الخطوات، والمبرمج (Coder) الذي يكتب الحل، والمتحقق (Validator) الذي يتأكد من صحته. هذا ما يسميه المؤلفون "نظام متعدد الوكلاء" (Multi-Agent System).

المشكلة التي حددها المؤلفون، بقيادة توم زيله (Tom Zehle)، هي كالتالي: عندما يفشل الفريق، تحصل على درجة واحدة للمجموعة بأكملها (مثلًا: "حصلت على C"). لكنك لا تعرف من الذي أخطأ. هل قدم المخطط تعليمات سيئة؟ هل ارتكب المبرمج خطأً مطبعيًا؟ أم أن المتحقق غفل عن خطأ ما؟

في التعلم الآلي التقليدي، يحصل الفريق بأك mẽ على نفس الدرجة، ويحاول الجميع تغيير سلوكهم بناءً على تلك الدرجة الواحدة. هذا يشبه إخبار مدرب فريق كرة قدم: "لقد خسرتم المباراة"، ثم يطلب من حارس المرمى، والمهاجم، والحكم جميعًا تغيير استراتيجياتهم بناءً على تلك الجملة الواحدة. هذا أمر غير فعال ومربك.

الحل: CANTANTE

يقدم المؤلفون إطار عمل جديدًا يسمى CANTANTE. فكر في CANTANTE كـ محلل رياضي فائق الذكاء يشاهد الفريق وهو يلعب نفس اللعبة عدة مرات باستراتيجيات مختلفة قليلاً، ثم يحلل بدقة من ساهم في الفوز أو الخسارة.

إليك كيف يعمل، باستخدام تشبيه بسيط:

1. لعبة "ماذا لو" (الإسناد التبايني - Contrastive Attribution)

بدلاً من تقييم الفريق مرة واحدة فقط، يقوم CANTANTE بتشغيل الفريق عبر نفس اللغز ثلاث أو أربع مرات متتالية.

  • الجولة (أ): يستخدم المخطط نبرة صارمة، ويستخدم المبرمج أسلوبًا سريعًا.
  • الجولة (ب): يستخدم المخطط نبرة ودودة، ويستخدم المبرمج نفس الأسلوب السريع.
  • الجولة (ج): يستخدم المخطط نبرة صارمة، ويستخدم المبرمج أسلوبًا بطيئًا.

بعد إجراء هذه الجولات، يحصل الفريق على درجة لكل جولة. الآن، يتدخل المُسند (Attributor) (المحلل). إنه ينظر إلى الاختلافات:

  • "في الجولة (أ) والجولة (ب)، كان المبرمج هو نفسه، لكن المخطط تغير. ارتفعت الدرجة. إذًا، نبرة المخطط الجديدة كانت مفيدة!"
  • "في الجولة (أ) والجولة (ج)، كان المخطط هو نفسه، لكن المبرمج تغير. انخفضت الدرجة. إذًا، أسلوب المبرمج الجديد كان ضارًا."

يُسمى هذا الإسناد التبايني (Contrastive Attribution). فهو يعزل مساهمة كل شخص من خلال مقارنتهم ببعضهم البعض، بدلاً من مجرد النظر إلى الدرجة النهائية.

2. "درجة ائتمان" لكل وكيل

بمجرد أن يحدد المحلل من الذي ساعد الفريق ومن الذي أضر به، فإنه يعطي كل وكيل درجة ائتمان (Credit Score) محددة (تتراوح من -1 إلى +1).

  • إذا حصل المخطط على +0.8، فإن النظام يعرف أنه يجب تعديل تعليمات المخطط لتكون أكثر تشابهًا مع تلك النسخة الناجحة.
  • إذا حصل المبرمج على -0.5، فإن النظام يعرف أنه يجب توجيه المبرمج بعيدًا عن ذلك الأسلوب المحدد.

الأمر الجوهري هنا هو أن الورقة البحثية تدعي أن هذا أفضل من مجرد نسخ الدرجة العامة. في الطريقة القديمة، إذا فشل الفريق، فقد يُلام المخطط حتى لو قام المخطط بعمل رائع وكان المبرمج هو السبب. CANTANTE يعالج هذا بقوله: "المخطط قام بعمل جيد؛ المبرمج هو من يحتاج للتغيير".

3. النتائج: فرق أذكى، وهدر أقل

اختبر المؤلفون هذا على ثلاثة أنواع مختلفة تمامًا من "الألغاز":

  1. البرمجة (MBPP): كتابة برامج الكمبيوتر.
  2. الرياضيات (GSM8K): حل المسائل اللفظية.
  3. البحث (HotpotQA): الإجابة على أسئلة معقدة تتطلب البحث عن معلومات في أما-كن متعددة.

النتائج:

  • درجات أفضل: تفوق CANTANTE باستمرار على الطرق الأخرى. في مهمة البرمجة، حسن الدقة بنسبة تقارب 19% مقارنة بالطريقة التالية الأفضل. وفي مهمة الرياضيات، تحسن بنسبة 12.5%.
  • أقل تكلفة في التشغيل: من المثير للدهشة أن الفرق التي تم تحسينها بواسطة CANTANTE لم تكن بحاجة إلى "التفكير" لفترة أطول أو استخدام قوة حوسبة أكبر للحصول على الإجابة الصحيحة. في الواقع، في مهام البرمجة والرياضيات، استخدموا موارد (Tokens) أقل من الفرق غير المحسنة.
  • الاستقرار: لم تكن الطريقة مجرد ضربة حظ لمرة واحدة؛ بل عملت باستمرار عبر بدايات عشوائية مختلفة.

لماذا هذا مهم (وفقًا للورقة البحثية)

تجادل الورقة بأن بناء هذه الفرق من الذكاء الاصطناعي لا ينبغي أن يكون لعبة "التخمين والتحقق" حيث يقوم البشر بتعديل الأوامر (Prompts) يدويًا. بدلاً من ذلك، يجب أن يكون علمًا لـ إسناد الائتمان (Credit Assignment).

تمامًا كما لا يصرخ المدرب في وجه الفريق بأكمله عندما يخطئ لاعب واحد في تسديدة، يضمن CANTANTE أن نظام الذكاء الاصطناعي يتعلم بالضبط أي جزء من الفريق يحتاج إلى التحسن. إنه يحول "الصندوق الأسود" للنظام متعدد الوكلاء إلى آلة شفافة حيث يعرف كل وكيل بالضبط كيف يتحسن.

باخت-صار: CANTANTE هو وسيلة تسمح لفرق الذكاء الاصطناعي بالتعلم من أخطائها من خلال السؤال: "من الذي تسبب تحديدًا في هذه النتيجة؟" بدلاً من مجرد القول: "لقد فشلنا، حاولوا بجهد أكبر". وهذا يؤدي إلى أنظمة ذكاء اصطناعي أذكى، وأكثر كفاءة، وأكثر دقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →