Toward Scalable Terminal Task Synthesis via Skill Graphs
تقدم هذه الورقة SkillSynth، وهو إطار عمل مؤتمت يستفيد من رسم بياني للمهارات يتوسطه السيناريو لتخليق نماذج متنوعة وقابلة للتحكم لمهام طرفية، مما يعالج ندرة البيانات ويعزز تدريب الوكلاء الطرفيين المستقلين.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تريد تعليم روبوت كيفية استخدام واجهة أوامر الكمبيوتر (الشاشة النصية حيث تكتب الأوامر) للقيام بمهام معقدة، مثل تنظيم الملفات أو إصلاح أخطاء البرمجيات. المشكلة هي أن تعليم الروبوت يتطلب إظهار آلاف الأمثلة له حول كيفية أداء هذه المهام. لكن العثور على آلاف الأمثلة الجيدة والمختلفة أو كتابتها يدوياً أمر بطيء ومكلف للغاية.
قام مؤلفو هذه الورقة البحثية، فريق Hunyuan في Tencent، ببناء نظام يسمى SkillSynth لحل هذه المشكلة. فكر في SkillSynth كأنه "مولد وصفات فائق الكفاءة" لتدريب الروبوتات.
إليك كيف يعمل، مقسماً إلى خطوات بسيطة:
1. المشكلة: الكثير من الوصفات المتشابهة
حاولت الطرق السابقة إنشاء أمثلة تدريبية إما عن طريق:
- التخمين: سؤال ذكاء اصطناوي ذكي لابتكار مهام جديدة (والتي غالباً ما بدت غير حقيقية أو لا تتوافق مع الواقع).
- السرقة: أخذ أكواد برمجية حقيقية من الإنترنت وتعطيلها عمداً لإنشاء مهمة "إصلاح" (وهذا علم الروبوت فقط كيفية إصلاح البرمجيات، وليس كيفية القيام بأشياء أخرى).
أدت كلتا الطريقتين إلى جعل الروبوتات ترى نفس أنواع المشكلات مراراً وتكراراً. إنه يشبه تعليم طاهٍ الطبخ عبر إعطائه فقط وصفات المعكرونة (سباغيتي)؛ قد يصبح ماهراً في صنع المعكرونة، لكنه لن يعرف كيف يصنع سلطة أو يخبز كعكة.
2. الحل: "مخطط المهارات" (الخريطة)
بدلاً من مجرد التخمين، يبني SkillSynth خريطة ضخمة (تسمى Skill Graph).
- المواقع (السيناريوهات): تخيل حالات مختلفة يمكن أن يكون عليها الكمبيوتر، مثل "مجلد فارغ" أو "ملف فيديو جاهز". هذه هي "المواقع" على الخريطة.
- الطرق (المهارات): هذه هي الإجراءات التي يمكن للروبوت اتخاذها للانتقال من موقع إلى آخر، مثل "حذف ملف" أو "تحويل فيديو".
قام الفريق بجمع آلاف من هذه "الطرق" من مصادر واقعية (مثل GitHub وقاعدة بيانات تسمى ClawHub). ثم قاموا بربط هذه الطرق بحيث إذا أنهى المستخدم إجراءً ما، فإنه ينتقل إلى موقع يجعل الإجراء التالي منطقياً.
3. العملية: رسم مسار
بمجرد بناء الخريطة، لا يكتفي SkillSynth باختيار طريق واحد، بل يرسم مساراً عبر الخريطة.
- يختار نقطة بداية.
- يختار طريقاً (مهارة) ليسلكه.
- يهبط في موقع جديد، يختار طريقاً آخر، ويستمر في التقدم.
التشبيه: تخيل أنك تخطط لرحلة برية. بدلاً من القيادة من المنزل إلى البقالة فقط (مهارة واحدة)، تخطط لرحلة تتكون من: المنزل ← محطة الوقود ← طريق سياحي ← المخبز ← البقالة. هذا المسار يمثل مهمة معقدة متعددة الخطوات.
النظام ذكي بشأن هذا الأمر: فهو يحاول تجنب اتخاذ نفس الطرق الشائعة التي استخدمها من قبل. وهذا يضمن أن يرى الروبوت مسارات جديدة ومختلفة، مما يجعل التدريب أكثر ثراءً.
4. خط التجميع: "الحامل" متعدد الوكلاء (Multi-Agent Harness)
بمجرد رسم مسار على الخريطة، يحتاج النظام إلى تحويل ذلك المسار المجرد إلى "لعبة" حقيقية قابلة للعب من قبل الروبوت. يستخدمون فريقاً من وكلاء الذكاء الاصطناعي (حامل/Harness) للقيام بذلك:
- المخطط (The Planner): ينظر إلى المسار ويكتب مجموعة واضحة من التعليمات (مثلاً: "حول هذا الفيديو الخام إلى ملف GIF").
- الباني (The Constructor): يبني البيئة الفعلية (الملفات، المجلدات، الحالة الابتدائية) ليكون لدى الروبوت شيء يعمل عليه.
- الحكام (The Referees): يتم إجراء فحصين مختلفين:
- فحص الأوراكل (The Oracle Check): هل يوجد حل مثالي بالفعل؟ (هل يمكن حل المهمة أصلاً؟)
- فحص المعايير (The Rubric Check): هل التعليمات واضحة؟ وهل الاختبار عادل؟ (هل جعلنا التعليمات صعبة جداً أو سهلة جداً بالخطأ؟)
إذا فشلت المهمة في هذه الفحوصات، يقوم النظام بإصلاحها تلقائياً ويحاول مرة أخرى، تماماً مثل خط مراقبة الجودة في المصنع.
5. النتائج
قام الفريق بتشغيل هذا النظام وأنتج 3,560 مهمة موثقة وعالية الجودة في دورة تشغيل آلية واحدة.
- التنوع: غطت المهام مجموعة هائلة من السيناريوهات والمهارات، وهي أكثر بكثير من الطرق السابقة.
- الصعوبة: كانت المهام صعبة حقاً. حتى الذكاء الاصطناعي المتطور جداً (Claude Opus 4.6) واجه صعوبة في العديد منها، حيث تطلبت المهمة في المتوسط 37 خطوة لحلها.
- الأداء: عندما قاموا بتدريب روبوتاتهم الخاصة (باستخدام نماذج مثل Qwen3) على هذه المهام الجديدة، أصبحت الروبوتات أفضل بكثير في حل مهام الـ Terminal مقارنة بالروبوتات التي تدربت على بيانات أقدم وأقل تنوعاً.
الخلا ملخص
SkillSynth هو وسيلة لتوليد مكتبة ضخمة ومتنوعة من "مهام الكمبيوتر" ليتدرب عليها الروبوت. ومن خلال رسم خريطة لكيفية اتصال مهارات الكمبيوتر المختلفة ببعضها البعض، يمكنهم إنشاء تحديات جديدة وواقعية لا حصر لها. هذا يساعد في تدريب وكلاء الذكاء الاصطناعي ليكونوا أكثر تعددًا في الاستخدام وقدرة، ليس فقط في إصلاح البرمجيات، ولكن في التعامل مع مجموعة واسعة من مهام الكمبيوتر في العالم الحقيقي.
ملاحظة: تنص الورقة البحثية صراحةً على أن هذه المهام المُخلّقة قد استُخدمت بالفعل لتدريب Hy3 Preview (منتج من Tencent)، مما حسن من قدرته على العمل كوكيل في بيئات الـ Terminal. ولا يدعي المؤلفون وجود تطبيقات طبية أو سريرية أو غيرها من التطبيقات المستقبلية المحددة بخلاف هذا التحسين العام في أتمتة الـ Terminal.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.