← أحدث الأبحاث
🤖 machine learning

Habilis-ββ: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model

تقدم الورقة البحثية Habilis-β\beta، وهو نموذج رؤية-لغة-فعل (Vision-Language-Action) سريع الحركة وطويل الأمد يعمل على الأجهزة، والذي يحقق أداءً فائقاً في التشغيل المستمر ونتائج رائدة في تصنيفات RoboTwin 2.0 من خلال الاستفادة من "مستوى الإنتاجية-الموثوقية" (Productivity-Reliability Plane) للتقييم، ودمج التدريب المسبق الخالي من اللغة، والتدريب اللاحق للمهام الدوري، وتقنيات تشكيل الحركة المتقدمة.

المؤلفون الأصليون: Tommoro Robotics, :, Jesoon Kang, Taegeon Park, Jisu An, Soo Min Kimm, Jaejoon Kim, Jinu Pahk, Byungju Kim, Junseok Lee, Namheon Baek, Sungwan Ha, Hojun Baek, Eduardo Ayerve Cruz, Wontae Kim, Junghyeo
نُشر 2026-02-24
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Tommoro Robotics, :, Jesoon Kang, Taegeon Park, Jisu An, Soo Min Kimm, Jaejoon Kim, Jinu Pahk, Byungju Kim, Junseok Lee, Namheon Baek, Sungwan Ha, Hojun Baek, Eduardo Ayerve Cruz, Wontae Kim, Junghyeon Choi, Yousuk Lee, Joonmo Han, Sunghyun Cho, Sunghyun Kwon, Soyoung Lee, Jun Ki Lee, Seung-Joon Yi, Byoung-Tak Zhang, Theo Taeyeong Kim

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتوظيف مساعد آلي جديد للعمل في مستودع مزدحم. أنت لا تريد مجرد روبوت يمكنه التقاط صندوق مرة واحدة إذا قمت بإعداده بشكل مثالي. بل تريد روبوتاً يمكنه العمل لمدة ثمان ساعات متواصلة، يتحرك بسرعة عندما يكون الوضع آمناً، ويتباطأ عندما يكون الأمر دقيقاً، ولا يحتاج أبداً لتدخلك لإصلاحه كل خمس دقائق.

إن معظم أدمغة الروبوتات الحالية (التي تسمى نماذج الرؤية واللغة والعمل - Vision-Language-Action models) تشبه الطلاب المترددين للغاية. فهم يتحركون ببطء شديد، ويتدققون في كل شيء، وإذا ارتكبوا خطأً صغيراً، يتجمدون وينتظرون معلماً بشرياً لإعادة ضبط المشهد. هم رائعون في أداء اختبار واحد، لكنهم سيئون جداً في أداء نوبة عمل كاملة.

يقدم هذا البحث Habilis-β، وهو دماغ روبوت جديد مصمم ليكون عاملاً خبيراً، مجتهداً وسريع الإيقاع. إليك كيف يعمل، مشروحاً من خلال تشبيهات بسيطة:

1. المشكلة: "الاختبار المثالي" مقابل "نوبة العمل الحقيقية"

يتم تقييم الروبوتات الحالية مثل الطلاب الذين يؤدونون امتحاناً واحداً. إذا نجحوا، يحصلون على درجة امتياز. لكن في العالم الحقيقي، لا تؤدي الروبوتات امتحاناً واحداً؛ بل تؤدي آلاف الاختبارات الواحدة تلو الأخرى.

  • المشكلة: إذا تحرك الروبوت ببطء شديد، فلن ينجز شيئاً (إنتاجية منخفضة). وإذا تحرك بسرعة كبيرة دون تفكير، فسيصطدم ويحتاج إلى إنسان لإعادة ضبطه (موثوقية منخفضة).
  • المقياس الجديد: ابتكر المؤلفون "مستوى الإنتاجية والموثوقية". فكر فيه كأنه بطاقة أداء تحتوي على رقمين:
    • TPH (المهام لكل ساعة): كم صندوقاً نقلت؟ (السرعة)
    • MTBI (متوسط الوقت بين التدخلات): كم استغرقت من الوقت قبل أن تضطر لاستدعاء إنسان للمساعدة؟ (الموثوقية)
    • الهدف: أنت تريد سرعة عالية وَ وقتاً طويلاً بين طلبات المساعدة.

2. الحل: كيف يتعلم Habilis-β

يتعلم Habilis-β عبر ثلاث مراحل محددة، مثل طالب ينتقل من مرحلة الروضة إلى مرحلة الحرفي الماهر.

المرحلة 1: مرحلة "اللعب" (تعلم الحركة)

قبل تعلم مهام محددة، يتم إعطاء الروبوت بيانات "لعب" غير منظمة.

  • التشبيه: تخيل طفلاً يلعب بالمكعبات، يسقطها، يلتقطها، ويرصها عشوائياً دون أن يخبره معلم بما يجب فعله.
  • لماذا يساعد ذلك: يتعلم الروبوت فيزياء تحريك الأشياء. يتعلم كيف يتعافى إذا أسقط مكعباً أو كيف يمسك شيئاً بشكل غريب. هذا يمنحه "شعوراً داخلياً" بكيفية تصرف الأشياء، بحيث لا يصاب بالذعر عندما تسوء الأمور قليلاً.

المرحلة 2: مرحلة "التكرار" (تعلم التحمل)

معظم الروبوتات تُدرب على فيديوهات "النجاح ثم التوقف". أما Habilis-β فيُدرب على بيانات دورية.

  • التشبيه: بدلاً من مشاهدة فيديو لشخص يصنع شطيرة واحدة ثم يتوقف، يشاهد Habilis-β فيديو لشخص يصنع الشطائر لمدة 10 ساعات متواصلة. يرى الخبز وهو يجف، والطاولة وهي تصبح فوضوية، والشخص وهو يتعب.
  • لما لماذا يساعد ذلك: يتعلم كيفية التعامل مع الانحراف (Drift). في العالم الحقيقي، لا تكون الأشياء موضوعة بدقة في كل مرة. هذا التدريب يعلم الروبوت الاستمرار في العمل حتى لو كان وضع البداية بعيداً قليلاً عن الدقة، مما يمنعه من الحاجة إلى إعادة ضبط بشرية.

المرحلة 3: مرحلة "تشكيل السرعة" (ESPADA)

هذا هو السر وراء السرعة. يستخدم الروبوت تقنية تسمى ESPADA (التقليل المكاني الواعي).

  • التشبيه: تخيل فيديو لشخص يمشي عبر غرفة.
    • المشي عبر غرفة فارغة: يتعلم الروبوت تسريع هذا الجزء. لا يحتاج لرؤية كل خطوة؛ يحتاج فقط لمعرفة "أنا ذاهب إلى هناك".
    • التقاط بيضة هشة: يبطئ الروبوت إلى الحركة البطيئة. يحتاج لرؤية كل حركة صغيرة ليكون دقيقاً.
  • لماذا يساعد ذلك: يمنع الروبوت من أن يكون بطيئاً ومملاً عندما يكون من الآمن أن يكون سريعاً. يقوم بضغط الأجزاء "المملة" من الحركة بحيث يمكن للروبوت الانطلاق عبر الغرفة والتركيز فقط على الأجزاء الصعبة.

3. الأجهزة: الدماغ "المدمج في الجهاز"

تعتمد العديد من الروبوتات على السحابة (الإنترنت) للتفكير. إذا تأخر الإنترنت، يتأخر الروبوت.

  • التشبيل: Habilis-β يشبه هاتفاً ذكياً بمعالج قوي يقوم بكل العمليات الحسابية داخل جيبك مباشرة. لا يحتاج لسؤال Siri أو Google عن المساعدة.
  • لماذا يساعد ذلك: لأنه يفكر محلياً، يمكنه الاستجابة فوراً. يمكنه اتخاذ القرارات في أجزاء من الثانية، مما يسمح له بتصحيح الأخطاء قبل أن تتحول إلى كوارث.

4. "مقبض التحكم" (CFG)

أخيراً، يحتوي النظام على مقبض للتشغيل يسمى التوجيه الخالي من التصنيف (CFG).

  • التشبيه: فكر في هذا كأنه مقبض لرفع أو خفض صوت التعليمات.
    • صوت منخفض: يعتمد الروبوت أكثر على "شعوره الداخلي" (بيانات اللعب) للحفاظ على حركة سلسة.
    • صوت مرتفع: يتبع الروبوت تعليمات الإنسان بدقة شديدة، حتى لو كان ذلك يعني التحرك بشكل أكثر عدوانية.
  • لماذا يساعد ذلك: يمكنك ضبط الروبوت حسب المهمة. إذا كنت بحاجة لأن يكون دقيقاً للغاية، ارفع المقبض. إذا كنت بحاجة لأن يكون سريعاً ومرناً، اخفضه.

النتائج: "الخبير المتمرس"

عند اختباره مقابل أفضل الروبوتات الأخرى (مثل π0.5\pi_{0.5} و GR00T):

  • في المحاكاة: أنجز Habilis-β 572 مهمة في الساعة، بينما أنجزت الروبوتات الأخرى حوالي 120 مهمة فقط. كما استمر لفترة أطول بكثير دون الحاجة لتدخل بشري لإصلاحه.
  • في العالم الحقيقي: في مهمة لوجستية على روبوت بشري حقيقي، أنجز Habilis-β 124 مهمة في الساعة (مقارنة بـ 19 للآخرين) وعمل لمدة 137 ثانية قبل أن يحتاج للمساعدة (مقارنة بـ 46 ثانية للآخرين).

الملخص

H-abilis-β هو دماغ روبوت يتوقف عن التصرف كطالب متوتر يؤدي اختباراً واحداً، ويبدأ في التصرف كـ عامل متمرس. يتعلم من خلال اللعب، ويتعلم من خلال العمل في نوبات طويلة، ويسرع عندما يكون ذلك آمناً، ويفكر بسرعة كافية لتدارك أخطائه. لقد صُمم ليكون ليس فقط "ذكياً"، بل منتجاً وموثوقاً في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →