← أحدث الأبحاث
💻 computer science

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

تقدم هذه الورقة البحثية OneTwoVLA، وهو نموذج موحد للرؤية واللغة والعمل يتنقل تكيفياً بين الاستدلال الصريح وتوليد العمل المباشر، معززاً بمسار توليد بيانات قابل للتوسع لتحقيق أداء فائق في التخطيط طويل المدى، والتعافي من الأخطاء، ومهام المناولة الماهرة المعقدة.

المؤلفون الأصليون: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

نُشر 2026-03-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً كيفية طهي وجبة معقدة، مثل "الهوت بوت" (Hotpot) أو تحضير كوكتيل.

في الماضي، حاولنا تعليم الروبوتات باستخدام نهج "الرأس المزدوج":

  1. الدماغ (النظام الثاني - System Two): ذكاء اصطاز فائق الذكاء يقرأ الوصفة ويخطط للخطوات. يفكر: "أولاً، قطع البصل. ثم، اغلي الماء".
  2. اليدان (النظام الأول - System One): ذراع روبوتية تتبع الأوامر فحسب. هي لا تعرف "لماذا" تفعل ما تفعله؛ هي فقط تتحرك عندما يُطلب منها ذلك.

المشكلة: هذا الإعداد غير متناسق. قد يقول الدماغ: "أمسك الكوب الأزرق"، لكن اليدين قد لا تعرفان أي كوب هو الأزرق، أو قد يكون الدماغ بطيئاً جداً في الاستجابة إذا سقط الكوب. إنهما يشبهان شخصين يحاولان قيادة سيارة، أحدهما ينظر إلى الخريطة والآخر يمسك بعجلة القيادة، لكنهما لا يستطيعان التواصل مع بعضهما البعض في الوقت الفلي الحقيقي.

مرحباً بـ OneTwoVLA: الروبوت الذي "يفكر أثناء العمل"

يقدم البحث نموذج OneTwoVLA، وهو نموذج روبوتي موحد يدمج "الدماغ" و"اليدين" في عقل واحد متكامل. فكر في الأمر ليس كشخصين منفصلين، بل كـ شخص واحد يمكنه التبديل بين "الطيار الآلي" و"التفكير العميق" فوراً.

إليك كيف يعمل ذلك، باستخدام تشبيه بسيط:

1. المفتاح التكيفي (نظام "إشارة المرور")

معظم الروبوتات إما تفكر دائماً (مما يجعلها بطيئة) أو لا تفكر أبداً (مما يجعلها خرقاء). OneTwoVLA ذكي في تحديد متى يتوقف ليفكر.

  • وضع القيادة (الأداء): عندما يقوم الروبوت بشيء روتيني، مثل صب العصير في كوب، فإنه يبقى في "وضع القيادة". يتحرك بسرعة وانسيابية، تماماً مثل مشيك في ممر مألوف دون التوقف للتفكير في كل خطوة.
  • وضع التفكير (الاستنتاج): ولكن في اللحظة التي يحدث فيها شيء صعب — مثل كون كوب العصير زلقاً، أو عندما يحتاج الروبوت لتقرير أي عصير سيصب — فإنه ينتقل فوراً إلى "وضع التفكير". يتوقف لجزء من الثانية، ويقول لنفسه: "مهلاً، الكوب مائل. أحتاج لتعديل قبضتي"، أو "الإنسان طلب فودكا بالليمون، وليس بالبرتقال. أحتاج لاستبدال الزجاجة".

إنه يشبه طاهياً ماهراً يقطع الخضروات تلقائياً (الأداء)، لكنه يتوقف لتذوق الصلصة وضبط التوابل عندما لا يكون الطعم مثالياً (الاستنتاج).

2. "معسكر التدريب" (البيانات الاصطناعية)

لتعليم هذا الروبوت أن يكون بهذا الذكاء، لم يكتفِ الباحثون بعرض فيديوهات لروبوتات تعمل، بل أنشأوا معسكراً تدريبياً افتراضياً.

تخيل أنك تريد تعليم روبوت التعرف على 10,000 جسم مختلف في المطبخ. تصوير روبوت حقيقي يقوم بذلك سيستغرق سنوات وسيكلف ثروة. بدلاً من ذلك، استخدم الباحثون الذكاء الاصطناعي لـ توليد صور واقعية ولكن وهمية لطاولات تحتوي على أشياء عشوائية (مثل "مطبخ افتراضي"). ثم استخدموا ذكاءً اصطناعياً آخر لكتابة "أفكار" لهذه المشاهد الوهمية، لتعليم الروبوت كيفية الاستنتاج حول أشياء لم يلمسها فعلياً من قبل.

  • بيانات الروبوت الحقيقية: يتعلم الروبوت الشعور الفيزيائي بالحركة.
  • البيانات الاصطناعية: يتعلم الروبوت منطق العالم (مثلاً: "إذا كنت أحتاج لمشروب بارد، يجب أن أبحث في الثلاجة").

من خلال مزج هذين النوعين، يصبح الروبوت "عاماً" — يمكنه التعامل مع مهام لم يسبق له رؤيتها، مثل العثور على أداة معينة في غرفة فوضوية أو فهم طلب بشري غامض ("أنا عطشان، اصنع لي شيئاً صحياً").

3. القوى الخارقة في العالم الحقيقي

يظهر البحث أن OneTwoVLA أفضل بكثير في أربع مهام محددة:

  • التخطيط طويل المدى: يمكنه تحضير كوكتيل مكون من 5 خطوات دون أن ينسى الخطوة الأولى بحلول وصوله للخطوة الخامسة. إنه يحتفظ بـ "قائمة ذهنية" في رأسه.
  • التعافي من الأخطاء: إذا أسقط ملعقة، فإنه لا يستمر في الحركة فحسب. بل يتوقف، ويدرك: "أوه لا، لقد أسقطتها"، ثم يجد طريقة لالتقاطها مجدداً.
  • التحدث مع البشر: إذا قلت له: "انتظر، أنا لا أريد عصير البرتقال"، سيفهم الروبوت فوراً، ويتوقف عن فعله الحالي، ويسأل: "حسناً، أي نكهة تريد؟" بدلاً من الصب الأعمى للشيء الخاطئ.
  • العث find الأشياء المخفية: إذا طلبت منه "الشيء المستخدم لفتح الزجاجات" وكان هناك العديد من الأشياء على الطاولة، يمكنه استنتاج أي منها هو فتاحة الزجاجات بناءً على شكلها والغرض منها، حتى لو لم يرَ تلك الفتاحة المحددة من قبل.

الخلاصة

OneTwoV2L هو طفرة لأنه يتوقف عن معاملة "التفكير" و"الأداء" كوظيفتين منفصلتين. إنه يخلق روبوتاً مرناً بما يكفي ليتحرك بسرعة ولكن حكيماً بما يكفي ليتوقف ويفكر عندما تصبح الأمور معقدة. إنه الفرق بين روبوت يتبع نصاً بشكل أعمى، وروبوت يفهم حقاً ما يفعله.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →