← أحدث الأبحاث
💻 computer science

ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs

تقدم هذه الورقة ReactHuman، وهو أول معيار قائم على الفيزياء يقيم النماذج اللغوية الكبيرة متعددة الوسائط والمجسدة في قدرتها على اتخاذ قرارات تفاعلية فورية وحرجة تتعلق بالسلامة في بيئات منزلية محاكات، مما يكشف أن النماذج الحالية تعاني من صعوبات في الفيزياء الحدسية والسلامة رغم التوسع في حجمها.

المؤلفون الأصليون: Yizhan Li, Jianxin You, Mengyang Xiong, Yinhuan Chen, Zicheng Zhao, Dekun Wu, Dongqing Zhang, Bang Liu

نُشر 2026-09-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yizhan Li, Jianxin You, Mengyang Xiong, Yinhuan Chen, Zicheng Zhao, Dekun Wu, Dongqing Zhang, Bang Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل مطبخاً تنزلق فيه مقلاة ثقيلة من فوق الطاولة، أو ردهة تبدأ فيها خزانة طويلة في السقوط. في جزء من الثانية، يعالج الدماغ البشري الخطر البصري، ويتنبأ بمكان سقوط الجسم، ويأمر الجسم إما بالإمساك به أو الابتعاد عن طريقه. هذا التفاعل في أجزاء من الثانية ليس مجرد رد فعل؛ بل هو مزيج معقد من فهم ماهية الجسم، ومعرفة مدى ثقله، وحساب مكانه بدقة. وبينما يعمل العلماء على بناء روبوتات يمكنها العيش والعمل بجانبنا في منازلنا، فإنهم يواجهون سؤالاً حاسماً: هل يمكن للذكاء الاصطناعي أن يتعلم التفاعل بنفس هذه السرعة والأمان؟ إن الاختبارات الحالية لهذه الأنظمة الذكية غالباً ما تطلب منها الإجابة على أسئلة حول مقاطع فيديو أو التخطيط لمهام طويلة الأمد مثل تنظيف غرفة، لكن هذه الأساليب لا تختبر ما إذا كان بإمكان الآلة اتخاذ قرار ينقذ الحياة في اللحظة التي يظهر فيها خطر ما.

تقدم دراسة جديدة اختباراً صارماً يسمى "ReactHuman"، صُمم لمعرفة ما إذا كان الذكاء الاصطناعي يمكنه التصرف كبشر كفء عند مواجهة أخطار جسدية مفاجئة. فقد بنى الباحثون عالماً محاكياً حيث يقف روبوت رقمي في غرفة ويراقب سلسلة من الأحداث الخطيرة، مثل سكين ساقط، أو رف منزلق، أو كرة تتدحرج نحوه. يقوم النظام بإيقاف المحاكاة قبل وقوع الكارثة مباشرة، حيث يعرض للروبوت بضع ثوانٍ من الحدث من زوايا كاميرا متعددة. يجب على الذكاء الاصطناعي، الذي يعمل كدماغ الروبوت، أن يقرر ما يجب فعله ويصدر أمراً محدداً: المشي إلى مكان جديد، أو مد اليد للإمساك بالجسم، أو البقاء ساكناً. وخلافاً للاختبارات السابقة حيث قد تختار الحواسب ببساطة الإجابة الصحيحة من قائمة، يجبر هذا النظام الروبوت على تنفيذ الفعل فعلياً في محاكاة فيزيائية. فإذا قرر الروبوت الإمساك بجسم ساقط، تعمل المحاكاة لترى ما إذا كانت يده ستلتقي بالجسم في الوقت المناسب. وإذا قرر تفادي الجسم، تتحقق المحاكاة مما إذا كان الروبوت قد ابتعد عن الطريق بنجاح.

أنشأ الباحثون أكثر من ألف مشهد فريد تغطي سبعة عشر نوعاً مختلفاً من الأحداث المفاجئة، تتراوح من السقوط البسيط إلى التفاعلات المتسلسلة المعقدة حيث يصطدم جسم ساقط بجسم آخر. حتى أنهم ضمنوا "أجساماً مخادعة" تبدو كشيء ما ولكنها تتصرف كشيء آخر، مثل سندان من الفوم يبدو ثقيلاً ولكنه خفيف، أو تفاحة فولاذية تبدو كفاكهة ولكنها ثقيلة وخطيرة. يختبر هذا الإعداد ما إذا كان الروبوت يعتمد على كيفية ظهور الأشياء أو على كيفية حركتها الفعلية. قام الفريق بتقييم سبعة نماذج مختلفة من الذكاء الاصطناعي المتقدم في هذه المهمة. وكانت النتائج صادمة: فشلت النماذج في التفاعل بشكل صحيح في حوالي مرة من كل ثلاث مرات. وعندما كان الإجراء الصحيح هو الابتعاد عن الخطر، كانت الروبوتات غالباً ما تتجمد في مكانها أو تحاول الإمساك بالجسم، مما يؤدي إلى نتائج غير آمنة.

ولعل الأمر الأكثر كشفاً هو أن الروبوتات لم تبدُ وكأنها تتعلم من أخطائها مع زيادة حجمها أو تعقيدها. فالنماذج الأكبر والأكثر قوة لم تكن أكثر أماناً أو دقة بشكل ملحوظ من النماذج الأصغر. وبدلاً من تحليل المشهد المحدد أمامها، بدا أن كل نموذج يمتلك "شخصية" ثابتة: فبعضها يفضل دائماً الهروب، بينما يحاول البعض الآخر دائماً الإمساك بالأشياء، بغض النظر عما إذا كان ذلك هو التصرف الصحيح. كما واجهت الروبوتات صعوبة في تقدير السرعة؛ فقد تمكنت من معرفة ما إذا كان شيء ما يتحرك، لكنها لم تستطع تحديد ما إذا كان يتحرك ببطء أو بسرعة، وغالباً ما كانت تعامل خطراً يتحرك ببطء كما لو لم يكن تهديداً على الإطلاق. وعندما كانت الروبوتات تختار الإجراء الصحيح، كانت تفشل في كثير من الأحيان في تنفيذه بشكل صحيح، حيث تمد يدها للإمساك بجسم ما ولكنها تتوقف على بعد متر من المكان الذي يجب أن تصل إليه.

تخلص الدراسة إلى أنه بينما تتحسن أنظمة الذكاء الاصطناعي هذه في فهم العالم، إلا أنها لا تزال بعيدة عن القدرة على التفاعل بأمان مع المخاطر الجسدية المفاجئة. وتسلط الأبحاث الضوء على أن مجرد جعل النماذج أكبر لا يحل مشكلة السلامة. لبناء روبوتات يمكنها حقاً العيش في منازلنا، سيتعين على المطورين تعليمها الثقة فيما تراه يحدث في اللحظة الراهنة بدلاً من الاعتماد على مظهر الجسم، وتعليمها كيفية تقدير السرعة والمسافة بنفس الدقة الغريزية التي يمتلكها البشر. وحتى ذلك الحين، تظل الفجوة بين آلة يمكنها وصف جسم ساقط وآلة يمكنها الإمساك به بأمان واسعة جداً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →