ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs
本文介绍了 ReactHuman,这是首个以物理为基础的基准测试,旨在评估具身多模态大语言模型在模拟家庭环境中进行即时、安全关键型反应式决策的能力,并揭示了尽管模型规模在扩大,但当前模型在直觉物理和安全性方面仍表现挣扎。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,在厨房里,一个沉重的平底锅从柜台上滑落;或者在走廊里,一个高大的衣柜开始倾倒。在短短的一瞬间,人类的大脑会处理视觉上的危险,预测物体落下的位置,并指挥身体做出反应——要么去接住它,要么躲开。这种瞬间的反应不仅仅是反射,它是一种复杂的融合,包含了对物体性质的理解、对其重量的认知,以及对其运动轨迹的精确计算。随着科学家致力于构建能够与我们在家中共同生活和工作的机器人,他们面临着一个关键问题:人工智能能否学会以同样的速度和安全性进行反应?目前的测试通常要求这些智能系统回答有关视频的问题,或规划如打扫房间之类的长期任务,但这些方法并未测试机器是否能在危险出现的瞬间做出救命的决策。
一项新研究引入了一项名为 ReactHuman 的严格测试,旨在观察人工智能在面对突发物理危险时,是否能像胜任的人类一样行动。研究人员构建了一个模拟世界,其中一个数字机器人站在房间里,观察一系列危险事件的发生,例如掉落的刀具、滑动的搁板或向其弹来的球。系统会在灾难发生前的瞬间暂停模拟,从多个摄像角度向机器人展示该事件发生前的几秒钟情况。作为机器人“大脑”的人工智能必须随后决定该做什么,并发出一个具体的指令:走到一个新位置、伸手抓取物体,或者保持不动。与以往计算机可能只是从列表中选择正确答案的测试不同,该系统迫使机器人必须在物理模拟中实际执行该动作。如果机器人决定接住掉落的物体,模拟程序会运行以检查它的手是否确实及时碰到了物体。如果它决定躲避,模拟程序则会检查机器人是否成功移开了位置。
研究人员创建了超过一千个独特的场景,涵盖了十七种不同类型的突发事件,范围从简单的坠落到复杂的连锁反应(即一个掉落的物品撞到了另一个物体)。他们甚至加入了“欺骗性”物体,即看起来像某种东西但行为却像另一种东西,例如一个看起来很重但实际上很轻的泡沫铁砧,或者一个看起来像水果但实际上又重又危险的钢制苹果。这种设置测试了机器人是依赖于物体的外观,还是依赖于物体的实际运动方式。团队对七种不同的先进人工智能模型进行了这项任务的评估。结果令人警醒:这些模型大约有三分之一的概率无法做出正确反应。当正确的动作应该是远离危险时,机器人经常原地不动或试图去抓取物体,从而导致不安全的结果。
或许最能说明问题的是,随着模型变得更大或更复杂,机器人似乎并没有从错误中学习。那些规模最大、功能最强大的模型在安全性或准确性上并没有比小型模型显著提高。这些模型似乎并没有在分析眼前的特定场景,而是每种模型都拥有一种“固定的性格”:有些总是倾向于逃跑,而有些则无论是否正确都总是试图去抓取东西。此外,机器人在判断速度方面也表现挣扎。它们能识别出物体正在移动,但无法分辨移动得是快还是慢,经常将缓慢移动的隐患视为完全没有威胁。当机器人选择正确动作时,它们也经常无法正确执行,比如伸手去抓物体,却停在了距离目标一米远的地方。性的位置。
研究结论指出,尽管这些人工智能系统在理解世界方面正在进步,但在能够对突发物理危险做出安全反应方面仍相去甚远。研究强调,仅仅扩大模型规模并不能解决安全性问题。要构建能够真正融入我们家庭生活的机器人,开发者需要教会它们信任眼下所见之物,而不是依赖于物体的外观,并学会像人类那样具备直觉般的精准度来判断速度和距离。在此之前,一个能够描述掉落物体的机器与一个能够安全接住它的机器之间,仍然存在着巨大的鸿沟。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。