PANDO: Efficient Multimodal AI Agents via Online Skill Distillation
يقدم PANDO إطار عمل فعال لتقطير المهارات عبر الإنترنت يُمكّن الوكلاء الويب متعددي الوسائط من تحسين الأداء وتقليل استهلاك الرموز (tokens) من خلال الحفاظ على مكتبة مهارات مهيكلة وتوظيف تقنيات مثل انعكاس التقدم والتحفيز المدرك للتخزين المؤقت، محققاً معدل نجاح بنسبة 58.3% في VisualWebArena بتكاليف استدلال أقل بكثير مقارنة بالطرق الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحث PANDO، مترجم إلى لغة بسيطة باستخدام التشبيهات.
المشكلة الكبرى: فخ "الدفع مقابل النقرة"
تخيل أنك توظف مساعداً ذكياً جداً، ولكنه مكلف، لمساعدتك في التسوق عبر الإنترنت. في كل مرة ينظر فيها إلى صفحة ويب، أو يفكر فيما يجب فعله، أو يضغط على زر، يتعين عليك دفع رسوم صغيرة له (تسمى "توكن" أو وحدة رمزية).
حالياً، تحاول معظم وكلاء الذكاء الاصطناعي (AI Agents) التحسن في أداء وظائفهم من خلال إنفاق المزيد من المال. إذا فشلوا، يحاولون مرة أخرى. إذا تعثروا، يطلبون رأياً ثانياً. يقومون بتنفيذ المهمة نفسها عشر مرات ويختارون أفضل نتيجة. هذا ينجح، لكنه يشبه دفع أجرة سيارة أجرة للذهاب إلى البقالة، ثم دفع أجرة سيارة ثانية للعودة للتأكد مما إذا كنت قد نسيت محفظتك، ثم سيارة ثالثة للتأكد من السعر. هذا ينجز المهمة، لكنه مكلف للغاية وبطيء.
تساءل مؤلفو هذه الورقة: هل يمكننا صنع وكيل يصبح أرخص وأسرع كلما عمل أكثر، بدلاً من مجرد إنفاق المزيد من المال في كل مرة؟
الحل: PANDO (وكيل "شجرة الحور العملاقة")
بنى الباحثون وكيلاً يسمى PANDO. وقد أطلقوا عليه هذا الاسم تيمناً بـ "باندو" (Pando)، وهي مجموعة أشجار حور في يوتا.
- التشبيه: تبدو "باندو" كأنها 47,000 شجرة منفصلة، لكنها في الواقع جميعها متصلة بـ نظام جذري واحد تحت الأرض. عندما تنمو شجرة واحدة، فإنها تشارك العناصر الغذائية مع الأشجار الأخرى. وعندما تموت شجرة، يتذكر النظام الجذوري ذلك ويحافظ على حياة الغابة بأكملها.
- نسخة الذكاء الاصطناعي: "باندو" هو وكيل ذكاء اصطنا جنبي لديه "جذر ذاكرة مشترك" (مكتبة مهارات). بدلاً من معاملة كل مهمة جديدة كمشكلة جديدة تماماً، فإنه يتذكر ما تعلمه من المهام السابقة ويستخدم تلك الدروس لحل المهام الجديدة.
كيف يعمل PANDO (دورة الـ 4 خطوات)
لا يقوم PANDO بمجرد التخمين والتحقق، بل يتبع دورة: التخطيط ← التنفيذ ← التأمل ← التعلم.
- التخطيط: "العقل" (ذكاء اصطناعي ذكي ومكلف) يقسم المهمة الكبيرة (مثل "ابحث عن أرخص جيتار بسعر أقل من 500 دولار") إلى خطوات صغيرة.
- التنفيذ: "اليدان" (ذكاء اصطناعي أرخص وأسرع) تقومان بالفعل بالضغط على الأزرار.
- التأمل: "المدير" يتحقق مما إذا كانت الخطوات قد نجحت. هل تغيرت قائمة المنتجات بعد تطبيق فلتر السعر؟ إذا لم يحدث ذلك، فما السبب؟
- التعلم (الجزء السحري): هنا يصبح PANDO أكثر ذكاءً.
- مكتبة المهارات: إذا نجح الوكيل في العثور على جيتار رخيص، فإنه يكتب "الوصفة": "للعثور على الأشياء الرخيصة، اضغط على 'ترتيب حسب السعر' ثم 'من الأقل إلى الأعلى'". يحفظ هذا كـ قاعدة أو روتين.
- إعادة استخدام المهارات: في المرة القادمة التي يحتاج فيها الوكيل إلى العثور على المنتج "الأغلى"، فإنه لا يحتاج إلى التفكير بعمق. ببساطة ينظر إلى مكتبته، ويرى القاعدة، ويحول المفتاح إلى "من الأعلى إلى الأقل".
- الخفض (التنظيف): إذا توقفت قاعدة ما عن العمل (على سبيل المثال، تغير تصميم موقع ما)، فإن الوكيل يحددها كـ "معطلة" ويتوقف عن استخدامها. هذا يمنع الوكيل من الوقوع في حلقات مفرغة من محاولة استخدام تعليمات قديمة ومعطلة.
لماذا يعد هذا تغييراً لقواعد اللعبة؟
اختبرت الورقة البحثية PANDO في 910 مهام ويب مختلفة (تسوق، إعلانات مبوبة، ريديت). وإليك ما حدث:
- معدل النجاح: نجح PANDO بنسبة 58.3% من المرات. وهذا أفضل من أفضل الوكلاء الحاليين (الذين كانت نسبتهم حوالي 54%).
- التكلفة: هذا هو الفوز الكبير. استخدم PANDO أقل بنسبة 58% من الرموز (Tokens) (المال) مقارنة بأفضل وكيل آخر.
- تأثير "الغداء المجاني":
- في البداية: يكون PANDO بطيئاً قليلاً لأنه يتعلم القواعد.
- لاحقاً: مع بناء مكتبة مهاراته، يصبح أسرع وأرخص. بحلول نهاية الاختبار، كان يحل المهام بخطوات أقل ومال أقل مما بدأ به.
- التشبيه: تخيل طالباً يؤدي اختبار رياضيات.
- الوكلاء القدامى: في كل مرة يرى فيها مسألة جديدة، يعيد استنتاج الصيغة الرياضية من الصفر. هذا يستغرق وقتاً طويلاً جداً.
- PANDO: في المرة الأولى التي يرى فيها مسألة، يحلها ويكتب الصيغة في ورقة ملاحظات. في الـ 99 مرة التالية، ينظر فقط إلى ورقة الملاحظات. ينهي الاختبار بشكل أسرع وبجهد ذهني أقل.
"التكاليف الخفية" التي يتجنبها PANDO
تشير الورقة إلى أن الوكلاء الآخرين يخفون تكاليفهم بطريقتين:
- الاكتشاف المسبق للتقييم: بعض الوكلاء يقضون أسابيع في "التدريب" أو "اكتشاف" الأدوات قبل بدء الاختبار حتى. أما PANDO فيتعلم أثناء الاختبار، لذا لا توجد تكاليف مسبقة مخفية.
- توسيع نطاق التشغيل: بعض الوكلاء يحاولون تنفيذ المهمة 10 مرات ويختارون الفائز. أما PANDO فيحاول مرة واحدة، لكنه يستخدم ذاكرته لجعل تلك المحاولة الواحدة ذات قيمة.
الخلاصة
يثبت PANDO أنك لست بحاجة لإنفاق المزيد من المال على الذكاء الاصطناعي لجعله أفضل. من خلال منحه ذاكرة منظمة (مكتبة مهارات) وطريقة لتنظيف الذكريات السيئة (الخفض)، يصبح الوكيل أكثر كفاءة كلما عمل أكثر.
إنه الفرق بين عامل ينسى كل شيء كل يوم ويحتاج إلى إعادة تدريب باستمرار، وبين عامل يحتفظ بدفتر ملاحظات حول "كيفية القيام بالأشياء" ويصبح أسرع في كل يوم يمر.
الخلاصة الرئيسية: PANDO لا يصبح أكثر ذكاءً فحسب؛ بل يصبح أرخص في التشغيل مع اكتسابه للخبرة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.