Learning CLI Agents with Structured Action Credit under Selective Observation
تتناول هذه الورقة تحديات الملاحظة الانتقائية وتخصيص مكافأة الندرة في تعلم وكلاء واجهة السطر البرمجي (CLI) من خلال تقديم آلية الاستدلال -Reveal، وطريقة التعلم المعزز لتخصيص ميزة الإجراء ()، ومجموعة بيانات ShellOps للتقييم القابل للتحقق.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك توظف مساعداً ذكياً جداً ولكنه يعاني من ضعف في الرؤية لإدارة مكتبة ضخمة وفوضوية. يمكن لهذا المساعد قراءة الكتب، وتحريك الرفوف، وكتابة ملاحظات جديدة، لكنه لا يستطيع إلا رؤية زاوية صغيرة جداً من المكتبة في أي لحظة معينة. وعلاوة على ذلك، أنت لا تخبره إلا إذا حل اللغز بأكمله في النهاية، ولا تخبره إذا اختار الكتاب الصحيح في الخطوة الأولى أو كتب الملاحظة الصحيحة في الخطوة الثانية.
هذا هو التحدي الذي تعالجه هذه الورقة البحثية: تعليم "وكلاء واجهة السطر البرمجي" (CLI Agents) - وهي برامج حاسوبية تتحدث إلى الحاسوب عبر سطر الأوامر - كيفية العمل في أنظمة ملفات معقدة حيث لا يمكنهم رؤية كل شيء، وحيث لا يتلقون سوى إشارة "عمل جيد" أو "فشل" في النهاية فقط.
يقترح المؤلفون طريقة جديدة لتدريب هؤلاء الوكلاء باستخدام حيلتين رئيسيتين: σ-Reveal و A3.
المشكلتان الكبيرتان
- مشكلة "العصابة على العينين" (الملاحظة الانتقائية):
المكتبة (نظام ملفات الحاسوب) تحتوي على آلاف الملفات. لا يمكن للوكيل قراءتها جميعاً في وقت واحد لأن ذاكرته محدودة (سعة الرموز/Tokens). إذا أظهرت له المكتبة بأكملها، فسيصاب بالتشتت. وإذا لم تظهر له شيئاً، فسيكون مجرد تخمين.
- حل الورقة البحثية (σ-Reveal): فكر في هذا الأمر كأنه أمين مكتبة ذكي ينظر إلى سؤال الوكيل المحدد ويستخرج فقط الكتب والمجلدات ذات الصلة ليعرضها على الوكيل قبل أن يبدأ العمل. بدلاً من إلقاء المكتبة بأكملها على المكتب، يقول أمين المكتبة: "إليك الملفات الخمسة التي تحتاجها فعلياً لحل المهمة. تجاهل البقية". هذا يساعد الوكيل على التركيز على الأدلة الصحيحة دون أن يضيع.
- مشكلة "الصندوق الأسود" للمكافأة (تحديد المسؤولية عن الإنجاز):
يتخذ الوكيل خطوات عديدة (أدوار) لحل مهمة ما. وفي النهاية، تقول له: "نجاح!" أو "فشل!". ولكن أي خطوة محددة هي التي صنعت الفارق؟ هل وجد الملف الصحيح في الخطوة 2؟ أم أنه كتب الأمر الخاطئ في الخطوة 4؟
- حل الورقة البحثية (A3): هذه طريقة جديدة لمنح الائتمان/التقدير لأفعال الوكيل. بدلاً من مجرد قول "عمل جيد بشكل عام"، يقوم A3 بتفكيك الدرجة إلى ثلاث طبقات:
- درجة الحلقة (Episode Score): هل كانت هذه المحاولة بأكملها أفضل من المحاولات الأخرى لنفس المهمة؟
- درجة الدور (Turn Score): هل بدا هذا الأمر تحديداً مثل الأوامر التي نجحت في المحاولات الناجحة الأخرى؟ (تستخدم الورقة "بصمة" خاصة تسمى AST لمقارنة بنية الأوامر، مثل مقارنة هيكل الجملة بدلاً من مجرد كلماتها).
- درجة الشجرة (Tree Score): هل أدى هذا المسار المحدد من الأفعال إلى نتيجة أفضل من المسارات التي سلكها وكلاء آخرون؟
- تشبيه: تخيل مدرباً يراقب فريق كرة قدم. بدلاً من مجرد قول "لقد فزنا"، يقول المدرب: "تمريرة رائعة في الدقيقة العاشرة (درجة الدور)، تلك الحركة كانت تماماً مثل الحركة التي سجلت هدفاً الأسبوع الماضي (درجة البنية)، وكان اختيار الهجوم من جهة اليسار هو الاستراتيجية الصحيحة مقارنة بالهجوم من جهة اليمين (درجة الشجرة)". هذا يساعد الوكيل على تعلم ما يجب تكراره بالضبط.
الملعب الجديد: ShellOps
لاختبار ذلك، بنى المؤلفون ميداناً تدريبياً جديداً يسمى ShellOps.
- فكر في هذا الأمر كأنه صالة ألعاب رياضية لوكلاء الحاسوب.
- يحتوي على أكثر من 1,600 مهمة تتراوح من "ابحث عن هذا الملف" البسيطة إلى "عدل هذه الملفات العشرين وقدم لي ملخصاً" المعقدة.
- تم تصميمه ليكون قابلاً للتحقق: يمكن للحاسوب التحقق تلقائياً مما إذا كان الوكيل قد فعل الشيء الصحيح بالفعل (على سبيل المثال، هل تم تعديل الملف بشكل صحيح؟)، بدلاً من مجرد التخمين ما إذا كانت الإجابة تبدو جيدة.
ماذا حدث عندما جربوا ذلك؟
اختبر المؤلفون طريقتهم الجديدة (A3 + σ-Reveal) مقابل أفضل الوكلاء الآخرين باستخدام نموذج بـ 14 مليار معلمة (عقل متوسط الحجم ولكنه قوي).
- النتائج: تفوقت طريقتهم بشكل كبير على الطرق الأخرى.
- في المهام الأكثر صعوبة (مهام "الهجين" التي تتطلب البحث عن المعلومات وتعديل الملفات معاً)، حقق وكيلهم حوالي 24.6% من الصحة، بينما حققت الطريقة التالية الأفضل بنسبة 11.3% فقط.
- كما كانت أرخص وأسرع في التدريب. تتطلب بعض الطرق الأخرى وجود "قاضٍ" ثانٍ (ذكاء اصطناعي آخر) لتقييم كل خطوة، وهو أمر بطيء ومكلف. أما طريقتهم، فتقوم بالتقييم رياضياً باستخدام بنية الكود نفسه، مما يحافظ على التكاليف منخفضة.
الخلاصة
تدعي الورقة أنه من خلال منح الوكلاء رؤية مركزة للملفات التي يحتاجونها (σ-Reveal) وتقرير تقييم مفصل حول أي الأفعال كانت جيدة (A3)، يمكننا تعليمهم كيف يكونون أفضل بكثير في التنقل وإصلاح أنظمة ملفات الحاسوب.
لم يدّعوا أن هذا يعمل للتشخيص الطبي، أو السيارات ذاتية القيادة، أو الكتابة الإبداعية. لقد ركزوا تحديداً على مهام سطر الأوامر: البحث عن السجلات (logs)، تعديل الكود، تجميع البيانات من جداول البيانات، وإصلاح مدخلات قواعد البيانات. في ذلك العالم المحدد، جعلت طريقتهم المتمثلة في "أمين المكتبة الذكي" و"المدرب المفصل" الوكلاء أكثر ذكاءً وموثوقية بشكل ملحوظ.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.