Uni-Skill: Building Self-Evolving Skill Repository for Generalizable Robotic Manipulation
يقدم Uni-Skill إطار عمل ذاتي التطور يتغلب على قيود مكتبات المهارات الثابتة من خلال الجمع بين مستودع مهارات هرمي وموسوم تلقائياً (SkillFolder) ووحدة تخطيط تكيفية لتمكين التلاعب الروبوتي القابل للتعميم بأسلوب التعلم من أمثلة قليلة أو بدون أمثلة مسبقة دون تدخل يدوي.
تخيل أن لديك مساعداً آلياً (روبوت)، وتريد منه القيام بمهمة جديدة، مثل "تنظيف المكتب الفوضوي".
الطريقة القديمة (المشكلة): معظم الروبوتات اليوم تشبه الطهاة الذين لا يعرفون سوى طبخ أطباق من كتاب وصفات مطبوع وثابت. إذا طلبت منهم صنع طبق غير موجود في الكتاب (مثل "مسح الطاولة بإسفنجة")، فإنهم يتجمدون. لا يمكنهم الارتجال. وحتى لو حاولت تعليمهم وصفة جديدة في تلك اللحظة، فإنهم يحتاجون إلى إنسان يقف بجانبهم، يمسك بأيديهم ويعلمهم بدقة كيفية تحريك أذرعهم في كل خطوة. هذا الأمر بطيء، ومكلف، ويقيد الروبوت بما علمه إياه البشر مسبقاً بشكل صريح.
الطريقة الجديدة (Uni-Skill): تقدم الورقة البحثية تقنية Uni-Skill، وهي تشبه منح الروبوت أميناً ذكياً جداً للمكتبة ومكتبة ضخمة ذاتية التحديث لمقاطع الفيديو التعليمية.
إليك كيف يعمل ذلك، مقسماً إلى ثلاثة أجزاء بسيطة:
1. العقل "المدرك للمهارات" (المحقق)
عندما تعطيه أمراً، لا يقوم Uni-Skill بتنفيذه بشكل أعمى. أولاً، يعمل كالمحقق الذي يفحص صندوق أدواته الخاص.
السؤال: "هل لدي الأدوات المناسبة لتنظيف هذا المكتب؟"
الإدراك: قد يقول: "أنا أعرف كيف ألتقط الأشياء وأضعها، لكن ليس لدي مهارة محددة لـ 'المسح' بعد".
الحل: بدلاً من الاستسلام، يبتكر وصفاً للمهارة المفقودة: "حسناً، أحتاج إلى مهارة جديدة تسمى 'مسح الطاولة' تتضمن الإمساك بقطعة قماش والتحرك بها في دوائر". إنه يكتب وصف الوظيفة للمهمة الجديدة بنفسه.
2. "مجلد المهارات - SkillFolder" (المكتبة الضخمة)
هذا هو الجزء السحري. لا يحتاج الروبوت إلى إنسان ليعلمه المهارة الجديدة. بدلاً من ذلك، يذهب إلى SkillFolder.
ما هو؟ تخيل مكتبة ضخمة تحتوي على أكثر من 10,000 ساعة من مقاطع الفيديو غير المنظمة والفوضوية لروبوتات (وبشر) وهم يقومون بكل أنواع الأشياء.
التنظيم: في السابق، كانت هذه المكتبة فوضى عارمة. يقوم Uni-Skill بتنظيمها مثل نظام أرشفة هرمي (مستوحى من كيفية تجميع القواميس للكلمات). فهو يصنف الفيديوهات ليس فقط حسب "التنظيف"، بل حسب التفاصيل الدقيقة مثل "المسح بإسفنجة"، أو "المسح بقطعة قماش"، أو "مسح طاولة".
البحث: عندما يحتاج الروبوت لتعلم "مسح الطاولة"، فإنه يبحث في هذه المكتبة. يجد فيديو لشخص يمسح طاولة. هو لا يشاهد الفيديو فحسب، بل يستخلص جوهر الحركة.
3. المتعلم "بعدد قليل من الأمثلة - Few-Shot" (المُحاكي)
بمجرد أن يجد الروبوت فيديو ذا صلة في مكتبته، فإنه لا يحتاج لمشاهدة الفيديو كاملاً أو وجود إنسان يوجهه.
التشبيه: فكر في الأمر كتعلم ركوب الدراجة. لا تحتاج إلى مدرب يمسك بيدك مع كل حركة بدال. أنت فقط تحتاج لرؤية مثال واحد جيد لشخص يركب الدراجة، وتفهم التوازن والمسار، ثم تجرب ذلك بنفسك.
التنفيذ: ينظر الروبوت إلى فيديو "مسح الطاولة" الذي وجده. يتعلم النمط (التحرك في دوائر) والقيود (إبقاء قطعة القماش ملامسة للسطح). ثم يستخدم هذا "المخطط الذهني" ليعرف بالضبط كيف يحرك ذراعه في مطبخك الخاص، حتى لو كانت طاولتك ذات شكل أو لون مختلفين.
لماذا يعد هذا أمراً هاماً؟
لا مزيد من "التجمد": إذا طلبت من الروبوت القيام بشيء لم يره من قبل، فإنه لا يتوقف عن العمل. بل يفحص مكتبته، ويجد مثالاً مشابهاً، ويستنتج الطريقة بنفسه.
التعلم "بدون سابق إنذار - Zero-Shot": يمكنه القيام بمهام جديدة دون أن تضطر لإظهار عرض توضيحي له في تلك اللحظة تحديداً. إنه يتعلم من مكتبته الضخمة الموجودة مسبقاً.
نتائج واقعية: اختبر الباحثون هذا في عمليات محاكاة ومع ذراع روبوت حقيقية. عندما طُلب منه القيام بمهام صعبة وجديدة (مثل طي قطعة قماش أو إغلاق درج من نوع معين)، كان نجاح Uni-Skill أعلى بنسبة 31% إلى 34% من أفضل الأساليب الحالية.
باختصار: يحول Uni-Skill الروبوت من آلة جامدة تتبع نصاً ثابتاً إلى متدرب فضولي وقابل للتكيف. يمكنه النظر إلى مشكلة جديدة، وإدراك ما ينقصه، والبحث عن مثال مشابه في مكتبة الفيديو الضخمة الخاصة به، ثم اكتشاف كيفية أداء المهمة بمفرده. إنه الفرق بين روبوت يمكنه فقط عزف مقطوعة "تشوبستيكس" على البيانو، وروبوت يمكنه الاستماع إلى أغنية مرة واحدة ثم يرتجل نسخته الخاصة منها.
إليك ملخص تقني مفصل لورقة البحث بعنوان "Uni-Skill: بناء مستودع مهارات ذاتي التطور للتحكم الروبوتي القابل للتعميم."
1. بيان المشكلة
تواجه أنظمة التحكم الروبوتي الحالية قيودًا كبيرة في التعميم على المهام الجديدة طويلة المدى:
مكتبات مهارات ثابتة: تعتمد الأساليب القائمة على المهارات الحالية على مجموعات محددة مسبقًا من المهارات (واجهات برمجة التطبيقات - APIs). إذا كانت المهارة المطلوبة (مثل "طي قطعة قماش") غير موجودة في المكتبة، فإن النظام يفشل.
التدخل اليدوي: يتطلب توسيع هذه المكتبات عادةً توصيفًا يدويًا للعروض التوضيحية أو تحديد نقاط المسار لكل مهمة جديدة، وهو أمر غير فعال ولا يمكن توسيعه.
فجوة البيانات غير المهيكلة: رغم وجود كميات هائلة من فيديوهات الروبوتات غير المهيكلة، إلا أنها تفتقر إلى الروابط الدلالية والتعليقات التوضيحية اللازمة لاستخدامها مباشرة كعروض توضيحية للمهارات.
نقص القدرة على التكيف: لا تستطيع الأطر الحالية تحديد "فجوات المهارات" أو تطوير قدراتها ذاتيًا لسد الفجوة بين التعليمات عالية المستوى والتنفيذ منخفض المستوى دون إشراف بشري.
2. المنهجية: إطار عمل Uni-Skill
يقترح المؤلفون Uni-Skill، وهو إطار عمل موحد يدمج التخطيط المدرك للمهارات والتطور التلقائي للمهارات. وهو ينقل النموذج من مجموعات المهارات الثابتة إلى مستودع معزز ذاتيًا ومتطور.
أ. وحدة التخطيط المدرك للمهارات (Skill-Aware Planning)
تمكن هذه الوحدة النظام من التعامل مع التعليمات التي تتجاوز قدراته الحالية.
مميز الكفاية (Sufficiency Discriminator - E): يقيم ما إذا كانت مكتبة المهارات الأساسية الحالية (Lbase) كافية لتنفيذ تعليمات متعددة الوسائط (It,Ot).
مولد المهارات (Skill Generator - G): إذا حدد المميز وجود فجوة، يقوم النظام ذاتيًا بتخليق أوصاف لمهارات تكميلية جديدة (Lext).
المخطط (Planner - P): يولد كود سياسة قابل للتنفيذ بناءً على المكتبة المدمجة (Lbase∪Lext).
التنفيذ: يستخدم نموذج رؤية-لغة (VLM) تم تدريبه على 106 ألف عينة من الأكواد البرمجية وقت التشغيل لأداء هذه المهام، مما يسمح بمخرجات برمجية تتوافق مع واجهات برمجة تطبيقات الروبوت.
ب. وحدة التطور التلقائي للمهارات (Automatic Skill Evolution)
تقوم هذه الوحدة بترسيخ أوصاف المهارات المولدة حديثًا في أفعال قابلة للتنفيذ باستخدام بيانات فيديو واسعة النطاق وغير مهيكلة، مما يلغي الحاجة إلى العروض التوضيحية وقت النشر.
خط أنابيب التعليق التوضيحي التلقائي للمهارات:
يستخدم نموذج رؤية-لغة (Gemini-2.0-Flash) لمعالجة فيديوهات الروبوت الخام (مثل مجموعة بيانات DROID).
المستخرج (Extractor): يولد خطط عمل إجرائية من الإطارات الرئيسية.
الموصف (Descriptor): يحول الخطط إلى أوصاف مهارات موجهة نحو المهام، مع التحقق من عدم التكرار مع المهارات الموجودة.
المحاذي (Aligner): يستخدم استراتيجية "Number-It" لمحاذاة أوصاف المهارات زمنيًا مع مقاطع الفيديو المحددة.
النتيجة: تحويل 350 ساعة من الفيديو غير المهيكل إلى أكثر من 10,000 أثر مهارة معلق عليها توضيحيًا.
SkillFolder (المستودع الهرمي):
مستوحى من VerbNet وعلاقة ImageNet/WordNet، بنى المؤلفون تصنيفًا هرميًا مكونًا من 4 طبقات:
الطبقة 1 (N1): فئات VerbNet المجردة (مثل طريقة المسح - wipe-manner).
الطبقة 2 (N2): نماذج أفعال متميزة (مثل فرك، مسح، شطف).
الطبقة 3 (N3): أوصاف المهارات المتوافقة مع التفاعلات المتمحورة حول الأشياء (مثل مسح_الطاولة).
الطبقة 4 (N4): شرائح فيديو دقيقة ومثبتة بصريًا (أمثلة).
يسمح هذا الهيكل باسترجاع فعال للأمثلة ذات الصلة دلاليًا للمهارات الجديدة.
تنفيذ المهارات بلقطات قليلة (Few-Shot Skill Implementation):
عندما يُطلب مهارة جديدة، يسترجع النظام الأمثلة ذات الصلة من SkillFolder.
القيود الدلالية: يستخرج القيود عالية المستوى (نقاط التلامس، نقاط المسار) من الأمثلة باستخدام نماذج VLM.
المسار المكاني: يسقط وضعيات 6-DoF من الأمثلة على المشهد المستهدف لتوليد نقاط مسار ثنائية الأبعاد، والتي يتم رفعها بعد ذلك إلى ثلاثية الأبعاد باستخدام معلومات العمق.
نقل الاتجاه (Orientation Transfer): يستخدم الأطر المحلية لنقل أنماط الدوران من الأمثلة المصدرية إلى المشهد المستهدف، مما يضمن تنفيذًا ممكنًا فيزيائيًا.
3. المساهمات الرئيسية
إطار عمل متطور ذاتيًا: Uni-Skill هو أول إطار عمل يكتشف فجوات المهارات ذاتيًا، ويولد أوصاف مهارات جديدة، وينفذها باستخدام مستودع مهيكل ومعزز ذاتيًا دون تدخل يدوي.
مجموعة بيانات SkillFolder: مستودع هرمي مبتكر مستوحى من VerbNet يحتوي على 106 فئة من VerbNet، و1,659 صياغة مهارة فريدة، وأكثر من 10,000 أثر مهارة معلق عليها تلقائيًا مشتقة من فيديوهات غير مهيكلة.
التعميم الصفري (Zero-Shot Generalization): يحقق النظام أداءً رائدًا في المهام الجديدة من خلال الاستفادة من الأمثلة المسترجعة للاستدلال بلقطات قليلة، مما يلغي الاعتماد على العروض التوضيحية وقت النشر.
التخطيط الموحد القائم على الكود: يدمج التخطيط وتوليد المهارات في خط أنابيب واحد يعتمد على VLM ينتج كودًا قابلًا للتنفيذ، مما يسد الفجوة بين التفكير عالي المستوى والتحكم منخفض المستوى.
4. النتائج التجريبية
أُجريت التجارب في كل من المحاكاة (RLBench) والبيئات الواقعية (روبوت Franka Emika).
المحاكاة (RLBench):
المهام خارج التوزيع (Out-of-Distribution): في 10 مهام تتطلب مهارات خارج المجموعة الأساسية، حقق Uni-Skill معدل نجاح بنسبة 41%، متفوقًا بشكل كبير على MOKA (10%) وCaP (1%).
التحسن: تفوق Uni-Skill على طريقة الملقن البصري الرائدة MOKA بنسبة 31.0% في المهام الصفرية.
المهام طويلة المدى: أظهر تحسنًا بنسبة 20.0% في المهام المعقدة طويلة المدى.
النشر في العالم الحقيقي:
في 8 مهام متنوعة من العالم الحقيقي (بما في ذلك "طي قطعة قماش" و"تحريك الكتل")، حقق Uni-Skill متوسط معدل نجاح بنسبة 73%، مقارنة بـ 39% لـ MOKA و0% لـ CaP (الذي فشل في المهارات غير المرئية).
تحديدًا في مهمة "طي قطعة قماش"، حقق Uni-Skill نسبة نجاح 70% مقابل 20% لـ MOKA.
دراسات الاستئصال (Ablation Studies):
أدى تعطيل آلية تحديث المهارة إلى فشل النظام في معظم المهام الجديدة.
وُجد أن كل من القيود الدلالية ومراجع المسار المكاني حاسمة؛ حيث أدى حذف القيود الدلالية إلى إضعاف المهام الحساسة للتلامس (مثل الدوران - Revolute)، بينما أدى حذف مراجع المسار إلى إضعاف المهام المكانية الدقيقة (مثل نزع القابس - Unplug).
5. الأهمية
تحول في النموذج: ينقل تعلم الروبوتات من "الاختيار اليدوي للمهارات" إلى "الاكتساب والتطور التلقائي" من البيانات غير المهيكلة.
القابلية للتوسع: يثبت أن فيديوهات الروبوتات الضخمة والمشوشة يمكن تحويلها إلى موارد تدريب مهيكلة وعالية الجودة باستخدام نماذج VLM، مما يقلل بشكل كبير من تكلفة اكتساب المهارات.
التعميم: يثبت أن الروبوتات يمكنها التعامل مع تعليمات وبيئات جديدة تمامًا من خلال تركيب واسترجاع المهارات ديناميكيًا، وهي خطوة حاسمة نحو مساعدين روبوتيين عامين حقًا.
المتانة: يتضمن النظام آليات تصحيح ذاتي لأنماط الفشل (التخطيط، التجذير، التنفيذ)، مما يعزز الموثوقية في السيناريوهات الواقعية.