← أحدث الأبحاث
💻 computer science

CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting

يُعد CrossTracer إطار عمل هرمياً يُمكّن من الملاحة الروبوتية عبر الأنظمة المتعددة من خلال الجمع بين مقترح مسار يعتمد على نموذج (VLA) ومهايئ متبقٍ مشروط بالهيئة يتم تدريبه عبر خوارزمية (CE-RRT*) مؤتمتة لتوليد خطط ملاحة في فضاء البكسل قابلة للتنفيذ فيزيائياً تتفوق بشكل كبير على النماذج المرجعية الحالية.

المؤلفون الأصليون: Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

نُشر 2026-08-10
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيف يمشي عبر غرفة مزدحمة وفوضوية. قد تقول له: "اذهب وأحضر الكوب الأحمر الموجود على الطاولة". يمكن لعقل روبوت فائق الذكاء (يُسمى نموذج الرؤية واللغة والعمل - Vision-Language-Action model) أن يفهم هذه الجملة تمامًا. فهو يعرف ما هو "الكوب الأحمر"، وأين توجد "الطاولات" عادةً، وماذا يعني "الإحضار". لكن الجزء الصعب هنا هو أن عقل الروبوت هذا لا يعرف ما إذا كان الروبوت عبارة عن ماشٍ مهتز بـساقين، أو عربة سلسة بأربع عجلات، أو آلة تشبه الكلب تقفز وتتحرك. بالنسبة للعقل الذكي، تبدو الخطوة الصغيرة فوق رصيف وكأنها مسار بسيط. لكن بالنسبة لروبوت بعجلات، هذا الرصيف هو جدار؛ أما بالنسبة لروبوت ذي أرجل، فهو قفزة ممتعة. إذا حاول الروبوت اتباع مسار لا يناسب جسده، فسيصطدم. تعالج هذه الورقة البحثية هذه المشكلة تحديدًا: كيف نأخذ فكرة ذكية عامة لمسار ما ونقوم بتعديلها لتناسب بالفعل الروبوت المحدد الذي يحاول السير فيه؟

أدرك الباحثون وراء هذه الورقة، "CrossTracer"، أن أفضل طريقة لإصلاح ذلك ليست إجبار العقل الذكي على تعلم جسد كل روبوت في آن واحد. بدلاً من ذلك، بنوا فريقًا مكونًا من خطوتين. أولاً، "مقترح مسار الرؤية واللغة" (لنسمه "الحالم" - The Dreamer) ينظر إلى الغرفة والهدف ويرسم مسارًا مثاليًا تقريبيًا على ورقة. هذا المسار مثالي لـ "فكرة" الرحلة، لكنه لا يهتم بما إذا كان الروبوت يمتلك عجلات أو أرجل. ثم، عضو الفريق الثاني، "مُحول CE" (المُسمى "مدقق الواقع" - The Reality Checker)، ينظر إلى ذلك الرسم التقريبي وجسد الروبوت المحدد. ويقول: "مهلًا، لقد نسي الحالم أن العجلات لا يمكنها تسلق السلالم"، ثم يرسم أسهمًا حمراء صغيرة ليدفع المسار بعيدًا عن السلالم وإلى الأرض المسطحة. ويطلقون على هذه الدفعات اسم "بقايا المسار" (trace residuals).

ولتعليم "مدقق الواقع" كيفية القيام بذلك دون الحاجة إلى بشر يرسمون آلاف المسارات المثالية يدويًا، ابتكر الفريق حيلة تدريبية ذكية تسمى "CE-RRT*". تخيل روبوتًا افتراضيًا يمكنه رؤية الغرفة بأكملها فورًا ويعرف بالضبط أي الأرضيات آمنة للعجلات وأيها آمنة للأرجل. يقوم هذا الروبوت الافتراضي بإجراء بحث حاسوبي سريع لإيجاد المسار الأكثر أمانًا لكل نوع من أنواع الروبوتات، ويستخدم تلك المسارات المولدة حاسوبيًا كـ "إجابات صحيحة" لتعليم مدقق الواقع. إنه يشبه امتلاك محاكي فائق السرعة يقوم بالعمل الشاق المتمثل في فهم الفيزياء، حتى يتمكن الذكاء الاصطناعي من التعلم من أخطائه دون الاصطدام بروبوت حقيقي.

عندما اختبروا هذا النظام، كانت النتائج مبهرة للغاية. في اختبار قياسي يسمى "NaviTrace benchmark"، سجل "CrossTracer" 45.68 نقطة. وقد تفوق على أقوى نموذج ذكاء اصطناعي عام تمت مقارنته به (Gemini-2.5-Pro) بفارق كبير — حوالي 10 نقاط، أي تحسن بنسبة 28%. تشير الورقة إلى أن هذه القفزة الهائلة تأتي من قدرة "مدقق الواقع" على إصلاح أخطاء "الحالم". فعندما أزالوا "مدقق الواقع" وتركوا "الحالم" يرسم المسار وحده، انخفضت الدرجة بشكل حاد إلى 22.56، مما يثبت أن خطوة "الدفع" ضرورية.

لم يتوقفوا عند الاختبارات الحاسوبية فحسب، بل جربوا الأمر أيضًا على روبوتات حقيقية في العالم الحقيقي. وضعوا النظام على كل من روبوت بعجلات وروبوت ذي أرجل. وأظهرت النتائج أن "CrossTracer" ساعد الروبوتات على الوصول إلى أهدافها بشكل أكثر تكرارًا وسرعة. بالنسبة للروبوت ذي العجلات، ارتفع معدل النجاح من 40% إلى 65%، وبالنسبة للروبوت ذي الأرجل، قفز من 45% إلى 70%. تشير الورقة إلى أن هذه الطريقة تجعل الروبوتات أكثر موثوقية، مما يساعدها على تجنب الاصطدامات وإيجاد طرق أكثر سلاسة تناسب أجسامها المحددة. وبينما لا يزال النظام يعتمد على قدرة الكمبيوتر على "رؤية" الأرض بشكل صحيح (إذا أخطأ الكمبيوتر في تحديد سجادة على أنها جدار، فقد يرتبك الروبوت)، فإن هذا النهج يشير إلى أن فصل "ما يجب فعله" عن "كيفية القيام به" هو وسيلة قوية لجعل الروبوتات أكثر ذكاءً وأمانًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →