← أحدث الأبحاث
🤖 machine learning

Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use

تقدم الورقة البحثية إطار CARL، وهو إطار للتعلم التعزيزي المدرك للكفاءة يقوم بتعيين الائتمان على مستوى القطعة لقرارات استخدام الأدوات من خلال تفكيك عمليات التدحرج للنموذج عند الحدود الطبيعية، مما يمكّن النماذج اللغوية الكبيرة من التعلم ذاتياً متى تعتمد على المعرفة البارامترية مقابل الأدوات الخارجية ويحسن الدقة بشكل كبير مع تقليل استدعاءات الأدوات غير الضرورية، لا سيما في النماذج الأصغر حجماً.

المؤلفون الأصليون: Abhijit Kumar, Zoey Wu, Mohit Suley

نُشر 2026-05-28
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Abhijit Kumar, Zoey Wu, Mohit Suley

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث "Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use" (المعروفة بـ CARL)، مقسمة إلى مفاهيم بسيطة باستخدام تشبيهات من الحياة اليومية.

المشكلة الكبرى: الطالب "الواثق بزيادة"

تخيل طالباً عبقرياً (الذكاء الاصطناعي) لديه الكثير من المعلومات من ذاكرته. أحياناً، يحتاج إلى آلة حاسبة أو محرك بحث لحل مسألة رياضية صعبة أو لإيجاد حقيقة محددة.

المشكلة هي أن هذا الطالب لا يعرف متى يستخدم هذه الأدوات.

  • إذا سألته "ما هو 2 + 2؟"، قد يخرج الآلة الحاسبة على أي حال، مما يضيع الوقت.
  • إذا سألته "ما هي عاصمة دولة لم أسمع بها من قبل؟"، فقد يحاول التخمين من ذاكرته ويخطئ، بدلاً من البحث عنها.

طرق تدريب الذكاء الاصطناعي الحالية تشبه معلماً لا يعطي درجة إلا في نهاية الامتحان فقط.

  • السيناريو (أ): يخمن الطالب الإجابة، ويصيب، فيحصل على درجة "امتياز". المعلم لا يعرف ما إذا كان الطالب قد خمن أم أنه كان يعرف الإجابة حقاً.
  • السيناريو (ب): يستخدم الطالب آلة حاسبة لمسألة رياضية بسيطة، ويصيب، فيحصل على درجة "امتياز". المعلم لا يدرك أن الطالب أضاع وقتاً في سؤال سهل.
  • السيناريو (ج): يستخدم الطالب آلة حاسبة لمسألة صعبة، ويخطئ، فيحصل على درجة "رسوب". المعلم لا يعرف ما إذا كان الطالب استخدم الآلة الحاسبة بشكل سيء، أم أن الآلة أعطت معلومات خاطئة، أم أن الطالب ببساً لم يكن يعرف الرياضيات.

لأن المعلم لا يرى إلا الدرجة النهائية، يتعلم الطالب استخدام الأدوات طوال الوقت (لمجرد الأمان) أو أبداً (لأنه قد يفسد الأمر). هم لا يتعلمون أبداً تحديد الحد الفاصل بين ما يعرفونه وما يحتاجون فيه إلى مساعدة.

الحل: CARL (المدرب الذكي)

تقدم الورقة نظام CARL (التعلم التعزيزي المدرك للكفاءة - Competence-Aware Reinforcement Learning). بدلاً من انتظار الدرجة النهائية، يعمل CARL كمدرب ذكي يراقب خطوات الطالب في الوقت الفعلي.

1. تقسيم الامتحان إلى "كتل"

يقسم المدرب عملية تفكير الطالب إلى ثلاث "كتل" (مقاطع) متميزة حيث تتغير حالة المحادثة بوضوح:

  1. الطلب (الاستدعاء - Invoke): يقرر الطالب استخدام أداة ويكتب استعلام البحث.
  2. القراءة (الاستيعاب - Assimilate): يقرأ الطالب إجابة الأداة ويلخصها.
  3. الإجابة (الالتزام - Commit): يكتب الطالب الإجابة النهائية.

2. نظام "الائتمان" (Credit System)

بدلاً من إعطاء درجة واحدة للامتحان بأكمله، يعطي المدرب "درجة ائتمان" صغيرة لكل كتلة بناءً على مدى مساهمتها في النتيجة النهائية.

  • طلب جيد: إذا طرح الطالب سؤالاً رائعاً أدى إلى الإجابة الصحيحة، تحصل تلك الكتلة على ائتمان إيجابي.
  • طلب سيء: إذا طرح الطالب سؤالاً مربكاً أدى إلى طريق مسدود، يحصل على ائتمان سلبي (حتى لو تمكن من إصلاح الأمر لاحقاً).
  • طلب غير ضروري: إذا طلب المساعدة في سؤال كان يعرف إجابته بالفعل، يقول له المدرب: "لم تكن بحاجة لذلك!" ويعطيه درجة صفر أو سالبة لإضاعة الوقت.

هذا هو الابتكار الرئيسي للورقة: تخصيص الائتمان على مستوى المقطع (Segment-Level Credit Assignment). فهو يعزل بالضبط أي جزء من العملية ساعد وأي جزء أضر، حتى لو كانت الإجابة النهائية صحيحة.

كيف يعمل الأمر (المدرب "الناقد")

للقيام بذلك، يتم تدريب نموذج "ناقد" (Critic) خاص. فكر في الناقد كمدرب شاهد آلاف الجولات التدريبية.

  • الإحماء: قبل بدء التدريب الفعلي، يشاهد الناقد الطالب وهو يجيب على الأسئلة بدون أدوات ومع فرض استخدام الأدوات. يتعلم الناقد أن يلاحظ: "أوه، الطالب يعرف الإجابة لهذا السؤال، لكنه جاهل في ذاك".
  • التدريب الحقيقي: بينما يتدرب الطالب، يتنبأ الناقد: "إذا استمر الطالب في هذا المسار، ما هي احتمالات حصوله على الإجابة الصحيحة؟"
    • إذا طرح الطالب سؤالاً جيداً، فإن توقعات النجاح لدى الناقد ترتفع. يحصل الطالب على الائتمان.
    • إذا طرح الطالب سؤالاً سيئاً، فإن التوقعات تنخفض. يُعاقب الطالب.
    • إذا طرح الطالب سؤالاً لم يكن بحاجة إليه، تظل التوقعات ثابتة. يتعلم الطالب: "لا داعي للسؤال".

النتائج: أذكى، أسرع، وأكثر صدقاً

اختبرت الورقة هذا النظام على نماذج بـ 7 مليارات و3 مليارات معلمة (فكر في هذه النماذج كطلاب "أذكياء" و"أذكياء جداً").

  1. تعلموا التوقف عن التخمين: أصبحت النماذج أفضل بكثير في معرفة متى لا يعرفون الإجابة. توقفوا عن التخمين بثقة وبدأوا في طلب المساعدة عند الحاجة الفعلية.
  2. توقفوا عن إضاعة الوقت: في الأسئلة السهلة، توقف النماذج عن استخدام الآلة الحاسبة أو محرك البحث. لقد وفروا الكثير من الوقت (الرموز/Tokens) والمال (تكاليف واجهة برمجة التطبيقات/API).
  3. دقة أفضل: لأنهم توقفوا عن إضاعة الوقت في الأسئلة السهلة وركزوا أدواتهم على الأسئلة الصعبة، حققوا إجابات صحيحة أكثر بشكل عام.
  4. مفاجأة "النماذج الصغيرة": وجدت الورقة أن النماذج الأصغر استفادت بشكل أكبر. النموذج الأصغر (3B) تحسن أداؤه بمقدار 1.4 مرة أكثر من النموذج الأكبر (7B).
    • تشبيه: الطالب الأصغر لديه مخزن ذاكرة أصغر. معرفة متى بالضبط يفتح كتاب المكتبة (الأداة) هي قوة خارقة بالنسبة له. أما الطالب الأكبر، فلديه بالفعل الكثير في رأسه ولا يحتاج للمكتبة كثيراً، لذا فإن التحسن يكون أقل دراماتيكية.

الملخص

تعلم هذه الورقة نماذج الذكاء الاصطناعي أن تكون متواضعة. بدلاً من استخدام الأدوات بشكل أعمى أو التخمين، تعلموا التعرف على حدود معرفتهم.

  • الطريقة القديمة: "سأستخدم محرك البحث لكل شيء للاحتياط فقط".
  • الطريقة الجديدة (CARL): "أعرف هذه الإجابة، لذا سأقولها فقط. ولكن بالنسبة لهذا السؤال الآخر، أنا بالتأكيد بحاجة للبحث عنه".

هذا يجعل الذكاء الاصطناعي أسرع، وأرخص في التشغيل، وأكثر دقة، خاصة للنماذج الأصغر والأكثر كفاءة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →