Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation
تُثبت هذه الورقة أن الوكلاء المتجسدين ذوي القدرة على التعلم الصفري، والذين يستخدمون تحكماً وكيلياً عام الأغراض مع واجهات دنيا، يمكنهم مضاهاة السياسات ذات النطاق الصناعي في الملاحة القائمة على الرؤية واللغة، محققين نسبة نجاح تصل إلى 78% مع تسليط الضوء على أن اختيار النموذج هو المحرك الأساسي للأداء فوق أدوات البرمجيات المحددة.
تخيل عالماً لا يكتفي فيه جهاز التحميص الخاص بك بتحميص الخبز فحسب، بل يمكنه أيضاً أن يقرر أي شريحة سيقوم بتحميصها، ويتأكد مما إذا كان المطبخ نظيفاً، ويجد طريقة لإيصال الخبز إلى الطاولة دون أن يتسبب في حرق المنزل. هذا هو حلم الذكاء الاصطناعي المتجسد (Embodied AI): منح الحواسيب جسداً مادياً (مثل الروبوت) والقدرة الذهنية للتنقل في العالم الحقيقي بمفردهم. لفترة طويلة، حاول العلماء تعليم هذه الروبوتات إما عن طريق "تدريبها" مثل الكلاب (بتكرار المهمة نفسها آلاف المرات حتى يتقنوها) أو من خلال إعطائها "سيناريو" صارماً (قائمة من القواعد التي كتبها البشر مثل "إذا رأيت باباً، افتحه"). ولكن ماذا لو أعطينا حاسوباً فائق الذكاء كاميرا وبعض الأزرار الأساسية، وقلنا له "اذهب وابحث عن المطبخ"، وتركناه يكتشف الباقي بنفسه؟ هذا هو السؤال الكبير الذي تطرحه هذه الورقة البحثية: هل يمكن لذكاء اصطناعي عام، لا يمتلك أي تدريب خاص على الروبوتات، أن يتولى القيادة ويقود نفسه عبر المنزل؟
قرر الباحثون وراء هذه الدراسة اختبار هذه الفكرة باستخدام روبوت رقمي في منزل محاكى. لقد جردوا الروبوت من جميع الأدوات المتطورة المستخدمة عادةً في الملاحة—لا خرائط، لا نظام تحديد مواقع (GPS)، لا مسارات مبرمجة مسبقاً، ولا تدريب خاص بـ "عقل الروبوت". بدلاً من ذلك، سلموا الذكاء الاصطناعي كاميرا واحدة ترى فقط ما هو موجود مباشرة أمامها (مثل إنسان ينظر من خلال ثقب الباب) وأربعة أوامر بسيطة: تحرك للأمام، اتجه يساراً، اتجه يميناً، وتوقف. ثم طلبوا من الذكاء الاصطناعي اتباع تعليمات صوتية معقدة، مثل "امشِ بجانب المسبح، واذهب بين البار والكراسي، وتوقف عند الزاوية". كان الهدف هو معرفة ما إذا كان بإمكان الذكاء الاصطناعي أن يعمل كـ "وكيل" حقيقي—أي صانع قرار يلاحظ، ويفكر، ويتصرف، ويصحح أخطاءه دون أن تمسك يد بشرية بيده.
كانت النتائج مثيرة للحماس بشكل مفاجئ، لكنها كانت متواضعة أيضاً. وجد الفريق أن هؤلاء "الوكلاء ذوي القدرة على التنفيذ الفوري" (Zero-shot agents) (بمعنى أنهم لم يروا روبوتاً من قبل) استطاعوا في الواقع التنقل بشكل جيد للغاية. باستخدام نموذج ذكاء اصطناعي قوي يسمى fable-5، نجح الروبوت في الوصول إلى هدفه بنسبة 78% في الاختبار القياسي، على الرغم من عدم امتلاكه لخرائط أو تدريب خاص. وهذا أمر مذهل لأن أداءه يضاهي أداء الروبوتات الصناعية باهظة الثمن التي تم تدريبها على ملايين الأمثلة. وهذا يشير إلى أن "العقل" نفسه هو من يقوم بمعظم العمل الشاق، وليس البرمجيات الخاصة المبنية حوله.
ومع ذلك، تضع الورقة البحثية خطاً واضحاً في الرمال. فبينما يبدع الذكاء الاصطناعي في الرحلات القصيرة، يبدأ في التعثر عندما تصبح الرحلة أطول. إذا كانت المهمة تتطلب المشي عبر غرف عديدة أو تذكر أين كان قبل خمس دقائق، تنخفض نسبة النجاح بشكل حاد لتصبح بين 26% و39%. يصاب الذكاء الاصطناعي بالارتباك لأنه يتعين عليه تذكر كل شيء رآه، وتصبح "ذاكرته" مزدحمة للغاية. علاوة على ذلك، عندما جرب الباحثون هذا على كلب روبوتي حقيقي، كان الذكاء الاصطناعي قادراً على التفكير ببراعة، لكنه استمر في الاصطدام بالجدرب لأنه لم يفهم كيف يشغل جسده حيزاً من الفراغ. كان يعرف أين يذهب، لكنه لم يكن يعرف كيف يمر عبر الباب.
في النهاية، تشير الورقة البحثية إلى أننا نقف على أعتاب عصر جديد. نحن لسنا بحاجة بالضرورة لبناء عقل روبوت جديد وخاص لكل مهمة؛ قد نحتاج فقط إلى ترك ذكائنا الاصطناعي الحالي فائق الذكاء يتولى التحكم، بشرط أن نمنحه الأدوات المناسبة لإدارة ذاكرته وفهم أجساده المادية. إنها خطوة نحو اليوم الذي لا يكتفي فيه الروبوت الخاص بك بتنفيذ الأوامر، بل يبدأ فعلياً في خوض مغامرته الخاصة.
ملخص تقني: الوكلاء المتجسدون يتولون التحكم
بيان المشكلة
تتطلب الوكلاء المتجسدون المستقلون حلقة اتخاذ قرار مستدامة تتضمن الإدراك، والعمل، والتحقق، والتصحيح الذاتي عبر تفاعلات ممتدة. تندرج النهج الحالية عمومًا تحت فئتين: السياسات المدربة (حيث يتم استيعاب قدرة الملاحة داخل أوزان النموذج، مثل NaVid) وسير العمل صفري الاستباق (حيث يتم توجيه نموذج عام مجمد بواسطة سقالات من تأليف البشر، مثل NavGPT). في كلا النموذجين، تُدار حلقة التفاعل بواسطة كود خارجي أو مسارات ثابتة، مما يحد من قدرة الوكيل على إدارة حالته ديناميكيًا، أو التعافي من الأخطاء، أو اتخاذ قرار بإنهاء المهمة.
يستقصي هذا البحث نموذجًا ثالثًا: التحكم المتجسد الوكيلي (agentic embodied control)، حيث يمسك وكيل عام بحلقة التفاعل نفسها. السؤال البحثي الجوهري هو ما إذا كان بإمكان نموذج، مجهز فقط بواجهة دنيا (كاميرا RGB أحادية العدسة وأفعال منفصلة)، أن يحافظ على التحكم عالي المستوى في الملاحة دون تدريب خاص بالملاحة، أو خرائط، أو ذاكرة صريحة.
المنهجية
يقترح المؤلفون مسبار واجهة دنيا لاختبار التحكم الوكيلي. يقومون باستبدال السقالات الخاصة بالملاحة في الأنظمة صفرية الاستباق الحالية بهيكل وكيل هندسة برمجيات عام الأغراض.
الواجهة: يتلقى الوكيل فقط إطارًا واحدًا لـ RGB بمقاس 512×512 مواجهًا للأمام (observe()) ومجموعة من أربع بدائيات لبيئة Habitat (step()): للأمام (0.25 متر)، يسارًا (15 درجة)، يمينًا (15 درجة)، وتوقف.
القيود: لا يملك الوكيل إمكانية الوصول إلى العمق، أو قياس المسافات (odometry)، أو الوضعية (pose)، أو الخرائط، أو التغذية الراجعة للتصادم. يجب عليه استنتاج المعالم، والتقدم، وشروط التوقف فقط من خلال تاريخ الملاحظات البصرية ونتائج الأفعال.
الإعداد: تستخدم الدراسة مجموعة rand100 من الجزء غير المرئي (val-unseen) لبيئة R2R-CE (بيئة الغرفة عبر الغرفة المستمرة). يتم تقييم الوكلاء عبر ثلاثة هياكل برمجية مختلفة صُممت أصلاً لهندسة البرمجيات (mini-swe-agent، وClaude Agent SDK، وCodex CLI) ونماذج رؤية-لغة (VLMs) رائدة متنوعة.
التصميم التجريبي: يجري المؤلفون دراسات استئصال (ablation studies) عبر ثلاثة محاور:
النموذج: تغيير نموذج الرؤية-اللغة الأساسي مع تثبيت الهيكل والواجهة.
الهيكل (Harness): مقارنة أطر عمل الوكلاء المختلفة (مفتوحة المصدر مقابل SDKs الموردة) مع نفس النموذج.
الواجهة: مقارنة واجهة البدائيات الدنيا مقابل إعداد هجين حيث يتم تقديم متنبئ نقاط المسار المدرب كأداة اختيارية بدلاً من مسار تحكم مفروض.
المساهمات الرئيسية
إثبات التحكم المتجسد الوكيلي: يجسد البحث التحكم الوكيلي في الملاحة باستخدام هياكل هندسة برمجيات غير معدلة. على الرغم من عدم تلقي أي تدريب أو سقالات خاصة بالملاحة، تحقق هذه الوكلاء أداءً تنافسيًا في المعايير القياسية صفرية الاستباق.
تحديد موقع القدرة: من خلال تدخلات أحادية المحور، يعزل المؤلفون مصدر القدرة. وجدوا أن اختيار النموذج هو المحرك الرئيسي للنجاح (بمدى يتراوح بين 5-72% في معدل النجاح)، بينما كانت الاختلافات في الهيكل وصفية إلى حد كبير. علاوة على ذلك، أظهروا أن وحدة نقاط المسار المدربة، عندما تُفرض كمسار تحكم إجباري، يمكن أن تقيد النماذج القوية ولكنها تنقذ النماذج الضعيفة؛ ومع ذلك، عندما تُعرض كـ أداة اختيارية، فإنها تسمح لأقوى الوكلاء بتركيب التحكم الخشن والدقيق، مما يحسن الأداء والسرعة والكفاءة.
توصيف الحدود: تحدد الدراسة الفجوة بين التحكم الوكيلي قصير الأمد والاستقلالية المستدامة. وتوضح أنه بينما تنتقل القدرة على الاستدلال إلى الأجهزة الفيزيائية، فإن غياب الوعي بالجسم (مثل اكتشاف التصادم، والخلوص الكينماتيكي) والذاكرة المكانية المستمرة يمنع التشغيل الموثوق على الآفاق الطويلة.
النتائج
الأداء: تحت الواجهة الدنيا الصارمة، تحقق النماذج الرائدة معدلات نجاح عالية في R2R-CE.
Opus-5 (الجهد الافتراضي): معدل نجاح (SR) بنسبة 70.7 ± 3.5%.
Fable-5 (الجهد الافتراضي): معدل نجاح بنسبة 68.3 ± 1.5%.
Fable-5 (الجهد الأقصى): معدل نجاح بنسبة 78%.
الواجهة الهجينة (Fable-5): عندما أُعطيت الخيار لاستخدام أداة نقاط المسار المدربة، وصل Fable-5 إلى 76.7 ± 0.6% SR باستخدام نصف خطوات البيئة وأقل من 25% من وقت الجدار مقارنة بتشغيل البدائيات بالجهد الأقصى.
المقارنة: هذه النتائج تنافس سير العمل الهندسي صفري الاستباق (مثل AgenticNav بنسبة 55% SR) والسياسات المدربة واسعة النطاق الصناعية الحديثة (مثل Qwen-RobotNav بنسبة 66–72% SR)، رغم أن الواجهة الدنيا تفتقر إلى السقالات المكثفة (الخرائط، الذاكرة، البحث) المستخدمة في تلك الأنظمة.
تحليل الفشل: الإخفاقات لغوية ومكانية في المقام الأول وليست إدراكية. تشمل أنماط الفشل الشائعة ربط المراجع الغامضة بنماذج كائنات خاطئة، والتوقف بناءً على قرب الكائن بدلاً من نقطة النهاية المحددة، و"البحث الجامح" حيث يفشل الوكيل في التعافي من فرع خاطئ. أحد النتائج الحاسمة هي التشخيص الذاتي دون التصحيح الذاتي: غالبًا ما تحدد الوكلاء شكًا في استدلالها، لكنها تمضي قدمًا للالتزام بالفعل الخاطئ على أي حال.
النشر الفيزيائي: عند النشر على روبوت رباعي الأرجل من نوع Unitree Go2، انتقلت قدرات الاستدلال والإدراك لدى الوكيل بشكل جيد (مثل التعامل مع المنطق الشرطي وفك غموض الكائنات). ومع ذلك، حدثت حالات فشل بسبب نقص الوعي بالجسم (مثل الدوران قبل أن يتجاوز جسم الروبوت الباب) وغياب الخريطة المكانية المستمرة، مما أدى إلى أخطاء في العد وهلوسات عبر المسارات الطويلة.
الأهمية والادعاءات
يزعم البحث أن التحكم الوكيلي تنافسي بالفعل في الملاحة صفرية الاستباق، مما يتحدى ضرورة السقالات الثقيلة المخصصة للمهام في المهام قصيرة الأمد. تشير النتائج إلى أن القدرة على اتخاذ القرار المتجسد تكمن بشكل متزايد داخل النموذج العام نفسه.
يجادل المؤلفون بأن مستقبل الوكلاء المتجسدين المستقلين يكمن في دورة تعزيز ذاتي (bootstrapping cycle):
السقالات الحالية (الخرائط، وحدات نقاط المسار، الهياكل الهندسية) تولد مسارات ناجحة.
تُستخدم هذه المسارات لتدريب نماذج أفضل عبر الضبط الدقيق الخاضع للإشراف أو التعلم المعزز.
بدورها، تتطلب النماذ الأقوى سقالات أقل، مما يؤدي في النهاية إلى تبسيط بنية النظام.
ومع ذلك، يخلص البحث بتواضع إلى أنه بينما يمكن للأنظمة الوكيلية إنتاج قرارات كفؤة، إلا أنها ليست بعد وكلاء متجسدين مستقلين قادرين على التشغيل المستدام والمفتوح. يتطلب الانتقال حل "فجوة التجسد": تطوير هياكل ذات إدارة سياق محدودة وحالة مستمرة، وتدريب النماذج على استيعاب الوعي بالجسم والذاكرة المكانية. يعمل العمل الحالي كمسبار تشخيصي، يثبت أن النموذج يمكنه توجيه الحلقة، ولكن النظام المحيط يجب أن يتطور لدعم الاستقلالية المستدامة.