SI-Diff: A Framework for Learning Search and High-Precision Insertion with a Force-Domain Diffusion Policy
تقدم هذه الورقة SI-Diff، وهو إطار عمل موحد لسياسة الانتشار في مجال القوة يدمج آلية جديدة للضبط بالنمط وسياسة معلم بحث، ليتعلم في آن واحد البحث القوي والإدخال عالي الدقة، مما يحسن بشكل كبير من تحمل عدم المحاذاة وقابلية النقل في حالة الصفر مقارنة بالنماذج المرجعية الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول إدخال مفتاح في قفل، لكنك ترتدي قفازات سميكة ولا تستطيع رؤية فتحة المفتاح بوضوح. عليك أن تتحسس طريقك باللمس. إذا كان المفتاح بعيداً عن المركز قليلاً، فقد تضغط عليه مباشرة للأسفل وتتعثر. ولكن إذا كنت تعرف مكان الفتحة بالضبط، يمكنك تمريره بسلاسة تامة. ولكن ماذا لو كنت بحاجة إلى جعل روبوت يقوم بذلك، والروبوت لا يعرف مكان الفتحة بالضبط؟
تقدم هذه الورقة البحثية SI-Diff، وهو "عقل" جديد للروبوتات يحل هذه المشكلة تماماً. فهو يعلّم الروبوت كيف يقوم بشيئين مختلفين تماماً باستخدام نفس مجموعة التعليمات: البحث عن الفتحة عندما يكون تائهاً، وتنزيل الجسم بداخلها بمجرد العثور عليها.
إليك كيف يعمل ذلك، مقسماً إلى تشبيهات بسيطة:
1. المشكلة: حركتان مختلفتان
عادةً ما يتم تعليم الروبوتات القيام بهذه المهام بشكل منفصل.
- البحث: إذا كان الروبوت تائهاً، فإنه يحتاج إلى التمايل والمسح في المنطقة (مثل شخص يتحسس مكان مفتاح الضوء في الظلام).
- الإدخال: بمجرد العثور على الفتحة، يحتاج إلى أن يكون دقيقاً للغاية، يتمايل بقدر ضئيل جداً فقط ليزلق الجسم للداخل دون أن يعلق (مثل عملية لضم الخيط في الإبرة).
معظم الروبوتات تضطر إلى تبديل "الأنماط" أو تحميل برمجيات مختلفة للقيام بهذين الأمرين. أراد المؤلفون بناء عقل روبوت واحد يمكنه القيام بكليهما دون تغيير التروس، تماماً مثل عامل بشري يمكنه التحسس بحثاً عن فتحة ثم إدخال وتد فيها دون التفكير في تغيير أدواته.
2. الحل: سياسة "الانتشار" (Diffusion Policy)
استخدم الفريق نوعاً من الذكاء الاصطناعي يسمى سياسة الانتشار (Diffusion Policy).
- التشبيه: فكر في "الانتشار" كأنه نحات يبدأ بكتلة من الطين العشوائي والمشوش، ثم يبدأ ببطء في إزالة التشويش حتى يظهر تمثال مثالي.
- في الروبوت: يبدأ الروبوت بتخمين عشوائي لكيفية تحريك ذراعه. يقوم الذكاء الاصطناعي بـ "إزالة التشويش" عن هذا التخمين، وتدقيق الخطوات خطوة بخطوة بناءً على ما تخبره به مستشعرات الروبوت (اللمس والقوة)، حتى يجد الحركة المثالية سواء للبحث أو للإدخال.
3. السر الخفي: مفتاح "النمط"
التحدي الأكبر كان تعليم الذكاء الاصطناعي معرفة أي حركة يجب أن يقوم بها (البحث أم الإدخال) دون تغيير الكود.
- التشبيه: تخيل مشغل موسيقى يمكنه تشغيل كل من "أغنية البحث" و"أغنية الإدخال". عادةً، ستحتاج إلى مشغلين مختلفين. يستخدم SI-Diff "تنبيه النمط" (Mode Prompt)، وهو يشبه زر "تبديل المسارات".
- كيف يعمل: يتم إخبار الروبوت: "أنت الآن في نمط البحث" أو "أنت الآن في نمط الإدخال". هذا التعليمة الصغيرة تخبر الذكاء الاصطناعي أن ينظر إلى نفس بيانات المستشعرات ولكن يفسرها بشكل مختلف. في نمط البحث، يبحث عن الأنماط التي تعني "استمر في البحث". وفي نمط الإدخال، يبحث عن الأنماط التي تعني "تمايل بلطف لتناسب الفتحة".
4. المعلم: التعلم من دليل ذكي
تتعلم الروبوتات بشكل أفضل من خلال مراقبة الخبراء. أنشأ المؤلفون "سياسة معلم" (مجموعة من القواعد) لتوليد بيانات التدريب.
- معلم البحث: بدلاً من مجرد رسم لولب مثالي (والذي قد يخطئ الفتحة)، فإن هذا المعلم يتسم ببعض الفوضوية. فهو يجرب ثمانية أنماط بحث مختلفة بسرعات واتجاهات عشوائية. إنه يشبه معلماً لا يكتفي بإظهار طريقة واحدة للعثور على شيء مفقود، بل يريك طرقاً عديدة لمسح الأرضية حتى تتعلم كيف تتكيف.
- معلم الإدخال: هذا المعلم يعرف كيف يخرج وتداً عالقاً من مكان ضيق، وهي خدعة يستخدمها البشر بالفطرة.
يشاهد الروبوت آلاف المحاولات "الناجحة" من قبل المعلم ويتعلم تقليد "شعور النجاح".
5. النتائج: من "ربما" إلى "بالتأكيد"
اختبر الفريق الروبوت الخاص بهم ضد أفضل الأساليب الحالية (مثل نظام يسمى TacDiffusion).
- الطريقة القديمة: إذا كان الوتر بعيداً عن المركز بأكثر من 2 مليمتر (حوالي سمك بطاقة الائتمان)، فإن الروبوت عادة ما يفشل؛ فقد كان صلباً للغاية.
- SI-Diff: استطاع هذا النظام الجديد التعامل مع عدم المحاذاة حتى 5 مليمترات. لقد كان أكثر تسامحاً مع الأخطاء.
- سحر "الصفر محاولة" (Zero-Shot Magic): على الرغم من أنه تم تدريب الروبوت فقط على كتلة مربعة، إلا أنه نجح في إدخال أشكال غير مرئية مثل الأسطوانات، والمثلثات، وحتى موصل USB. لقد تعلم مفهوم البحث والإدخال، وليس فقط الشكل المحدد للكتلة.
الملخص
SI-Diff هو نظام تحكم للروبوتات يستخدم نموذج ذكاء اصطناعي واحد للقيام بكل من البحث عن فتحة وتنزيل جسم داخلها. من خلال استخدام "مفتاح النمط" والتعلم من مجموعة متنوعة من نماذج "المعلم"، يجعله هذا النظام أكثر قوة، مما يسمح للروبوتات بالتعامل مع أخطاء أكبر والعمل مع أشكال لم يسبق لها رؤيتها من قبل، وكل ذلك دون الحاجة إلى تبديل البرمجيات أو إعادة برمجة نفسها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.