← أحدث الأبحاث
🤖 AI

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

تقدم هذه الورقة البحثية إطار عمل "الاستنتاج البصري اللغوي المتداخل" (IVLR)، وهو إطار سياسات يولد مسارات صريحة تتناوب بين الأهداف الفرعية النصية والإطارات الرئيسية البصرية لتمكين التلاعب الروبوتي طويل المدى والقوي من خلال الجمع بين التماسك المنطقي والتجذر الهندسي، محققاً معدلات نجاح هي الأفضل في فئتها على معايير الاختبار الصعبة.

المؤلفون الأصليون: Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding

نُشر 2026-05-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية تنظيف مطبخ فوضوي. المهمة ليست مجرد "التقط الملعقة"، بل هي قصة طويلة: "أولاً، انقل الطبق المتسخ إلى الحوض، ثم أمسك الإسفنجة، وافرك الطاولة، وأخيرًا ضع الإسفنجة مكانها".

عقول الروبوتات الحالية (التي تسمى سياسات الرؤية واللغة والأفعال - Vision-Language-Action policies) تشبه الممثلين الذين يجيدون قول السطر التالي من الحوار مباشرة، لكنهم سيئون جدًا في تذكر السيناريو بأكمله. هم ينظرون إلى الحوض، يرون طبقًا، فيمسكون به. لكن إذا كانت المهمة تتطلب منهم الإمساك بكوب قبل الطبق، فقد يصابون بالارتباك، أو يمسكون الشيء الخطأ، أو ينسون السبب الذي جاءوا من أجله في المقام الأول. إنهم "قصيرو النظر" (myopic)—يرون فقط الخطوة التالية المباشرة.

تقدم هذه الورقة البحثية طريقة جديدة لتفكير الروبوت، تسمى IVLR (الاستنتاج المتداخل بين الرؤية واللغة). وإليك كيف تعمل، باستخدام تشبيهات بسيطة:

1. المشكلة: "الممثل فاقد الذاكرة"

فكر في الروبوت القياسي كممثل يُعطى سيناريو، ولكن عليه حفظه سطرًا بسطر أثناء الأداء. إذا كانت المسرحية قصيرة، فسيكون بخير. ولكن إذا كانت المسرحية طويلة (مهمة ذات أفق طويل)، فسينسى الحبكة.

  • الخطط القائمة على النص فقط تشبه سيناريو يقول "التقط الكوب". هي تخبر الروبوت ماذا يفعل، ولكن ليس أين بالضبط أو كيف يجب أن يبدو المشهد. إنها مثل وصفة طعام بدون صور.
  • الخطط القائمة على الرؤية فقط تشبه شريط فيلم للمستقبل. هي تظهر للروبوت كيف سيبدو المشهد، ولكن بدون كلمات، قد لا يفهم الروبوت لماذا يتواجد الكوب هناك أو ما هو الترتيب الذي حدثت به الأمور.

2. الحل: "المخرج صاحب لوحة القصص المصورة"

يمنح المؤلفون الروبوت لوحة قصص مصورة (Storyboard). قبل أن يحرك الروبوت عضلة واحدة، يتوقف ويقوم بإنشاء "فيلم" كامل للمهمة بأكملها في مخيلته. هذه اللوحة تسمى IVLR-Trace.

هذا الأثر (Trace) مميز لأنه يمزج بين شيئين معًا، بالتناوب مثل القصص المصورة:

  • لوحات نصية: "التقط الكوب الأبيض". (المنطق/الترتيب السببي).
  • لوحات صورية: صورة للكوب الأبيض وهو موضوع تمامًا حيث يجب أن يكون. (الهدف البصري).

يقوم الروبوت بتوليد لوحة القصص المصورة هذه بالكامل مرة واحدة في البداية. الأمر يشبه مخرجًا يقول: "حسنًا، إليكم الفيلم بأكمله. المشهد 1: التقط الكوب. المشهد 2: ضعه على الطبق. المشهد 3: التقط الكوب الأصفر..."

3. كيف يستخدمها الروبوت: "نظام تحديد المواقع (GPS) مع خريطة"

بمجرد صنع لوحة القصص المصورة، لا يتبع الروبوت الصور بشكل أعمى كشخصية في لعبة فيديو. بدلاً من ذلك، يحتفظ بلوحة القصص في "ذاكرة مؤقتة" (cache) أثناء عمله.

  • الحلقة: في كل لحظة، ينظر الروبوت إلى العالم الحقيقي (ما يراه الآن) ويتحقق منه مقابل لوحة القصص المصورة (ما خطط لرؤيته).
  • التشبيه: تخيل أنك تقود سيارتك للذهاب إلى حفلة. لديك خريطة (لوحة القصص) تظهر الطريق والوجهة. ولكن لديك أيضًا عينان (كاميرا حية). إذا اتخذت منعطفًا خاطئًا، ستخبرك عيناك: "مهلًا، هذا ليس الشارع الموجود في الخريطة!" ثم تقوم بتصحيح مسارك.
  • يقوم الروبوت بهذا باستمرار. إنه يستخدم لوحة القصص لتذكر ترتيب الأحداث والهدف البصري، ولكنه يستخدم عينيه الحيّتين للتأكد من أنه لن يصطدم بكرسي لم يكن موجودًا عندما وضع الخطة.

4. كيف علموا الروبوت (الاستعراف الزائف)

الروبوتات الحقيقية لا تأتي مع لوحات قصص مصورة؛ بل تأتي فقط مع فيديوهات لأشخاص يقومون بمهام. اضطر المؤلفون لتعليم الروبوت كيفية صنع لوحات القص المصورة الخاصة به.

  • أخذوا فيديوهات لروبوتات تقوم بمهام واستخدموا ذكاءً اصطناعيًا ذكيًا لتقطيع الفيديو إلى "مشاهد" (مراحل).
  • ثم استخدموا ذكاءً اصطناعيًا آخر لكتابة وصف لكل مشهد (مثل: "القبضة تتحرك نحو الكوب") واختيار "إطار رئيسي" (صورة تمثيلية لتلك اللحظة).
  • غدوا هذه اللوحات المصنوعة للروبوت كبيانات تدريب. الأمر يشبه إعطاء طالب كتابًا مدرسيًا مع إجابات مكتملة، ليتعلم كيف يحل المشكلات بنفسه لاحقًا.

5. النتائج: لماذا يهم هذا؟

اختبر المؤلفون هذا في محاكاة حاسوبية حيث كان على الروبوتات القيام بمهام طويلة متعددة الخطوات (مثل تكديس المكعبات أو تحريك الأكواب).

  • بدون لوحة القصص المصورة: فشل الروبوت كثيرًا، خاصة في المهام الطويلة (بنسبة نجاح حوالي 37% فقط). لقد فقد مساره في منتصف القصة.
  • باستخدام النص فقط أو الصور فقط: كان أداؤه أفضل، لكن ليس جيدًا جدًا (حوالي 60-68%).
  • باستخدام "لوحة القص المصورة" الكاملة (النص + الصور): نجح الروبوت بنسبة 92.4% في أصعب المهام.

النتيجة الرئيسية هي أن كلاهما ضروري. أنت بحاجة إلى النص لتذكر الترتيب (السببية) وإلى الصور لتذكر الموقع (الهندسة). أحدهما دون الآخر ليس كافيًا.

6. العيوب (المحددات)

الورقة صريحة بشأن السلبيات:

  • وقت التفكير: يجب على الروبوت أن "يفكر" لمدة 10 ثوانٍ تقريبًا قبل أن يبدأ في التحرك لإنشاء لوحة القص المصورة. هذا جيد للمهام البطيئة والحذرة، ولكنه بطيء جدًا لروبوت يحتاج لتفادي كرة متحركة بسرعة.
  • الخطط القديمة: إذا تغير العالم بعد أن وضع الروبوت خطته (على سبيل المثال، إذا قام شخص ما بتحريك الكوب أثناء تفكير الروبوت)، تصبح لوحة القص المصورة خاطئة. قد يحاول الروبوت اتباع خطة لعالم لم يعد موجودًا.
  • المحاكاة فقط: تم اختبار هذا في محاكاة حاسوبية، وليس على روبوت حقيقي في مطبخ حقيقي.

الملخص

تقترح هذه الورقة أنه بدلًا من إجبار الروبوت على تخمين الخطوة التالية بناءً على ما يراه الآن فقط، يجب أن نتركه يكتب "قصة مصورة" للمهمة بأكملها أولاً. من خلال دمج الكلمات (الخطة) والصور (الهدف) في "أثر" واحد، يمكن للروبوت تذكر الصورة الكبيرة مع الاستمرار في التفاعل مع العالم المباشر. إنه تحول من "رد الفعل" إلى "التخطيط ورد الفعل".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →