← أحدث الأبحاث
💻 computer science

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

تقدم هذه الورقة COIN، وهو معيار مرجعي شامل يتكون من 50 مهمة تفاعلية، ومجموعة بيانات واسعة النطاق يتم التحكم فيها عن بُعد، ومقاييس تقييم منهجية للكشف عن القيود الحرجة للوكلاء المجسدين الحاليين في أداء الاستنتاج طويل الأمد المعتمد على السببية بسبب الفجوات بين الفهم البصري والتنفيذ الحركي.

المؤلفون الأصليون: Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

نُشر 2026-04-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً كيف يصنع لك كوباً من القهوة.

في الأيام الخوالي، كان الباحثون يختبرون الروبوتات بمهام بسيطة مثل "ارفع الكوب" أو "حرك الكوب إلى الطاولة". كان الأمر يشبه تعليم طفل صغير كيفية تكويم المكعبات. ولكن في العالم الحقيقي، صنع القهوة لا يقتصر فقط على تحريك الأشياء؛ بل يتعلق بـ استنتاج الأمور أثناء القيام بها.

رب Maybe آلة القهوة مغلقة، لذا عليك إيجاد المفتاح. ربما المفتاح داخل درج عالق، لذا عليك هزّه لفتحه. ربما الكوب مخفي خلف محمصة الخبز، لذا عليك تحريك المحمصة أولاً. في كل مرة يحاول فيها الروبوت القيام بشيء ما، يتعلم شيئاً جديداً، وعليه تغيير خطته فوراً.

تقدم هذه الورقة البحثية اختباراً جديداً يسمى COIN (سلسلة التفاعل - Chain of Interaction) لمعرفة ما إذا كانت الروبوتات قادرة حقاً على القيام بهذا النوع من "التفكير أثناء العمل".

إليك تفصيل الورقة البحثية باستخدام تشبيهات بسيء:

1. المشكلة: الروبوتات ذات "عقل ذو مسار واحد"

الروبوتات الحالية تشبه نظام الـ GPS الذي يعطيك الاتجاهات لكنه لا يعرف ماذا يفعل إذا واجهت طريقاً مسدوداً.

  • الطريقة القديمة: تقول للروبوت "افتح الباب". يحاول الروبوت فتح الباب. إذا كان الباب مغلقاً، سيستمر الروبوت في محاولة دفع المقبض حتى يكسره، أو يستسلم ببساطة. هو لا يفكر: "انتظر، ربما أحتاج إلى مفتاح أولاً".
  • الواقع: الحياة الواقعية فوضوية. أنت بحاجة للنظر، واللمس، والفشل، والتعلم، وتجربة زاوية أخرى. وهذا ما يسمى الاستدلال التفاعلي (Interactive Reasoning).

2. الحل: معيار COIN

بنى المؤلفون لعبة فيديو ضخمة (محاكاة) لاختبار الروبوتات في هذه المهارة المحددة. يسمونها COIN. اعتبرها بمثابة دورة "تعليم قيادة" للروبوتات، ولكن بدلاً من مجرد القيادة في خط مستقيم، تحتوي الدورة على:

  • COIN-Primitive (الأساسيات): 20 مهارة بسيطة مثل "افتح باباً"، "ارفع كوباً"، أو "اضغط على زر". هذا يشبه تعلم كيفية الإمساك بعجلة القيادة.
  • COIN-Composition (المزيج): مهام تجمع بين مهارتين بسيطتين، مثل "افتح الباب ثم ارفع الكوب". هذا يشبه القيادة عبر دوار مروري.
  • CO_IN-50 (العالم الحقيقي): 50 سيناريو معقداً حيث يتعين على الروبوت حل لغز. على سبيل المثال: "أحضر التفاحة". لكن التفاحة داخل خزانة، والخزانة مغلقة، والمفتاح موجود في درج محجوب بصندوق ثقيل. يجب على الروبوت تحريك الصندوق، فتح الدرج، إيجاد المفتاح، فتح الخزانة، ثم إحضار التفاحة.

3. السلاح السري "منخفض التكلفة"

لتعليم الروبوتات هذه المهارات، تحتاج إلى بشر يظهرون لها كيف يتم ذلك. عادةً، يتطلب هذا بدلات روبوتية باهظة الثمن وتكلف ملايين الدولارات.

  • الابتكار: بنى المؤلفون نظاماً باستخدام هاتف ذكي رخيص (يكلف أقل من 20 دولاراً في سوق المستعمل) وتطبيق واقع معزز (AR).
  • التشبيه: تخيل أنك ترتدي سماعة واقع افتراضي حيث تتحكم حركات يدك في ذراع روبوت. لقد اكتشفوا كيفية القيام بذلك باستخدام هاتف فقط. تلوح بهاتفك في الأرجاء، ويقوم الروبوت بتقليدك. استخدموا هذا لتسجيل 1,000 عرض بشري لهذه المهام. إنه يشبه تصوير برنامج طبخ حيث يوضح الشيف للروبوت بالضبط كيفية تقطيع البصل، لكنهم فعلوا ذلك باستخدام هاتف بدلاً من كاميرا استوديو.

4. النتائج: الروبوتات لا تزال تتعلم المشي

اختبر المؤلفون أذكى روبوتات الذكاء الاصطنا_المتاحة اليوم (مثل تلك التي تنتجها Google وNVIDIA وFigure AI) في اختبار COIN الجديد هذا.

  • النتيجة: فشلت الروبوتات فشلاً ذريعاً.
    • البشر: عندما قام البشر بالاختبار (باستخدام وحدة التحكم بالهاتف)، نجحوا حوالي 40% من المرات في المحاكاة (و100% في الواقع).
    • الروبوتات: نجحت أفضل روبوتات الذكاء الاصطنا أقل من 3% من المرات.
  • لماذا؟
    • الفجوة بين "الخطة والعمل": "عقل" الروبوت (الجزء الذي يخطط) ذكي، لكن "يداه" (الجزء الذي يتحرك) خرقتان. العقل يقول "افتح الدرج"، لكن اليدين تصطدمان به فقط.
    • عدم القدرة على التكيف: إذا حاول الروبوت فتح باب وكان عالقاً، فهو لا يعرف كيف يحاول من زاوية مختلفة. هو فقط يستمر في تكرار نفس الحركة الفاشلة مراراً وتكراراً.
    • مشكلة "الصندوق الأسود": الروبوت يرى العالم، لكنه لا يفهم فيزيائية الأشياء. هو لا يعرف أن صندوقاً ثقيلاً سيسقط إذا دفعته بقوة كبيرة.

5. الخلاصة

هذه الورقة البحثية هي بمثابة صرخة تنبيه. إنها تقول: "لقد صنعنا روبوتات يمكنها التحدث والتعرف على الصور، لكنها سيئة جداً في معرفة كيفية التفاعل مع العالم المادي عندما لا تسير الأمور تماماً كما هو مخطط لها".

الاستعارة:
تخيل أن الروبوت هو أمين مكتبة ذكي جداً قرأ كل الكتب في العالم.

  • الاختبارات القديمة: يمكن لأمين المكتبة العثور على كتاب إذا أعطيته العنوان ورقم الرف بدقة.
  • اختبار COIN: تطلب من أمين المكتبة "أحضر لي كتاباً عن الطبخ". لكن قسم الطبخ مغلق، والمفتاح مفقود، والرفوف فوضوية. يصاب أمين المكتبة بالارتباك، يوقع كومة من الكتب، ثم يستسلم.

المستقبل:
يقترح المؤلفون أنه لإصلاح هذا، نحتاج إلى روبوتات يمكنها:

  1. التحرك بسلاسة أكبر (أيدي أقل تشنجاً).
  2. التفكير في حلقات (جرب -> افشل -> فكر -> حاول مرة أخرى).
  3. ربط عقلها ويديها بشكل أفضل بحيث تتطابق الخطة مع الفعل المادي.

باخت-اختصار، COIN هو المقياس الجديد لمعرفة ما إذا كان الروبوت "متجسداً" حقاً (قادراً على العيش في عالمنا) أم أنه مجرد كمبيوتر متطور يتظاهر بأنه روبوت. في الوقت الحالي، هم في الغالب يتظاهرون فقط.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →