MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction
تقدم الورقة البحثية MIND-Skill، وهو إطار عمل متعدد الوكلاء يقوم تلقائياً بتوليد مهارات نماذج لغوية كبيرة عالية الجودة وقابلة لإعادة الاستخدام من خلال دورة استقراء واستنتاج مُحسّنة عبر خسائر نصية (إعادة البناء، والنتيجة، والمعايير) لضمان المتانة والقدرة على التعميم في المهام المعقدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً آلياً (روبوت) عبقرياً ولكنه أخرق قليلاً. أنت تعلمه كيفية القيام بمهمة محددة، مثل "إرسال استرداد مالي لصديق عبر تطبيق Venmo"، من خلال عرضه فيديو لك وأنت تقوم بذلك بإتقان. يشاهد الروبوت الفيديو، لكن بده لا يكتفي بمجرد تقليد حركاتك بدقة، بل يحاول كتابة "كتيب قواعد" لنفسه لكي يتمكن من أداء مهام مشابهة في المستقبل.
المشكلة تكمن في أنه إذا كتب الروبوت كتيب قواعد سيئاً، فقد يعلق فيه. قد يحفظ اسم صديقك الخاص حرفياً (أصبح شديد التحديد) أو يكتب تعليمات غامضة جداً لدرجة أنها تصبح غير مفيدة (أصبحت شديدة التجريد).
نظام MIND-Skill هو نظام جديد مصمم لمساعدة وكلاء الذكاء الاصطناعي هؤلاء على كتابة "كتيبات قواعد" مثالية وعالية الجودة تلقائياً. وهو يفعل ذلك باستخدام لعبة "المعلم والتلميذ" الذكية التي تضمن أن القواعد تعمل بالفعل.
إليك كيف يعمل، مقسماً إلى أجزاء بسيطة:
1. الشخصيتان: المعلم والتلميذ
يستخدم النظام وكيلين من الذكاء الاصطناعي يعملان معاً:
- المعلم (وكيل الاستقراء - Induction Agent): يشاهد هذا الوكيل فيديو ناجحاً لمهمة ما أثناء تنفيذها. مهمته هي كتابة كتيب قواعد عام (مهارة) يشرح كيفية أداء المهمة، دون ذكر أسماء أو أرقام محددة.
- التلميذ (وكيل الاستنتاج - Deduction Agent): هذا هو الاختبار. يُعطى التلميذ فقط كتيب القواعد الذي كتبه المعلم ووصف المهمة الأصلي. ثم يحاول أداء المهمة من الصفر باستخدام تلك التعليمات فقط.
2. اختبار "إعادة البناء" (Reconstruction Test)
هذه هي الخدعة السحرية. النظام لا يكتفي بالسؤال: "هل حصل التلميذ على الإجابة الصحيحة؟" بل يسأل: "هل اتبع التلميذ نفس المنطق الموجود في الفيديو الأصلي؟"
- إذا كتب المعلم كتيب قواعد يقول "اضغط على الزر الأحمر"، بينما أظهر الفيديو الأصلي الضغط على زر أزرق، فسوف يفشل التلميذ. هنا يكتشف النظام ذلك.
- إذا كان كتيب القواعد الذي كتبه المعلم غامضاً جداً (مثل: "افعل الشيء المطلوب")، فسيصاب التلميذ بالارتباك ويفشل.
- إذا كان كتيب القواعد الذي كتبه المعلم محدداً جداً (مثل: "اضغط على الزر الخاص بالمستخدم رقم 123")، فإن النظام يدرك أن هذا لن يصلح لأي شخص آخر.
يقوم النظام بمقارنة أداء التلميذ بالفيديو الأصلي. إذا تطابقا، فإن كتيب القواعد جيد. وإذا لم يتطابقا، يدرك النظام أن كتيب القواعد معيب.
3. "التقارير المدرسية" الثلاثة
للتأكد من أن كتيب القواعد مثالي، يعطي النظام للمعلم ثلاثة تقارير مدرسية محددة (تسمى "الخسائر" أو Losses) بعد كل محاولة:
- تقرير "هل اتبعت الخطوات؟" (خسارة إعادة البناء): هل اتبع التلميذ نفس الاستراتيجية المتبعة في الفيديو الأصلي؟ (على سبيل المثال: هل قاما كلاهما بفحص البريد الإلكتروني أولاً، ثم الضغط على إرسال؟)
- تقرير "هل أنجزت المهمة؟" (خسارة النتيجة): هل أكمل التلميذ المهمة بالفعل بنجاح في العالم الحقيقي؟
- تقرير "هل هذا دليل إرشادي جيد؟" (خسارة المعايير): هل كتيب القواعد مكتوب بشكل جيد؟ هل هو واضح؟ هل يتجنب نسخ التفاصيل المحددة (مثل الأسماء أو المعرفات) التي لا ينبغي وجودها؟ هذا يضمن أن يكون كتيب القواعد أداة مفيدة، وليس مجرد نسخة طبق الأصل من حدث معين.
4. حلقة التحسين
يقوم النظام بتشغيل هذه اللعبة مراراً وتكراراً.
- يكتب المعلم مسودة.
- يحاول التلميذ تنفيذها.
- يقوم النظام بتقييم المسودة باستخدام التقارير المدرسية الثلاثة.
- يخبر النظام المعلم بالضبط ما كان خاطئاً (مثلاً: "لقد ضمنت اسماً محدداً، قم بإزالته" أو "لقया تخطيت فحص الأمان").
- يعيد المعلم كتابة كتيب القواعد بناءً على هذه الملاحظات.
يحدث هذا تلقائياً، حيث يتم صقل كتيب القواعد حتى يصبح خالياً من العيوب.
لماذا هذا مميز؟
حاولت معظم الطرق السابقة كتابة كتيبات القواعد عن طريق الطلب من ذكاء اصطنا_ي متطور أن يقوم فقط بـ "تلخيص" فيديو. لكن الذكاء الاصطناعي غالباً ما يرتكب أخطاءً—إما بكونه شديد الغموض أو شديد التحديد.
MIND-Skill مختلف لأنه يختبر كتيب القواعد فوراً. الأمر يشبه شيف (طباخ) يكتب وصفة، ثم يسلمها فوراً لمساعده ليطبخ الطبخة. إذا أحرق المساعد الطعام أو استخدم مكونات خاطئة، سيعرف الشيف أن الوصفة كانت سيئة وسيقوم بإصلاحها قبل أن يجربها أي شخص آخر.
النتائج
اختبرت الورقة البحثية هذا النظام في عالمين صعبين:
- AppWorld: محاكاة لاستخدام تطبيقات حقيقية (مثل إرسال الأموال، حجز التذاكر، إدارة الملفات).
- BFCL-v3: اختبار لاستدعاء وظائف الكمبيوتر بشكل صحيح.
أظهرت النتائج أن الوكلاء الذين يستخدمون كتيبات قواعد MIND-Skill كانوا أفضل بكثير في حل مهام جديدة لم يروها من قبل مقارنة بالوكلاء الذين يستخدمون كتيبات قواعد من طرق أخرى. وحتى عندما لم يكن "المعلم" هو النموذج الأكثر ذكاءً المتاح، فإن عملية الاختبار جعلت كتيبات القواعد النهائية جيدة جداً لدرجة أنها أدت بنفس كفاءة تلك التي صنعتها النماذج الأكثر ذكاءً.
باختصار: يحول MIND-Skill وكلاء الذكاء الاصطناعي إلى معلمين يطورون أنفسهم، يكتبون أدلة تعليماتهم المثالية من خلال الاختبار المستمر لما إذا كانت تلك الأدلة تعمل بالفعل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.