Mind the Gap: The Divergence Between Human and LLM-Generated Tasks
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你置身于一个堆满随机物品的房间里:一把椅子、一个篮球、一个衣架和一个枕头。如果我问你:“你可以用这些东西做什么来消磨时间?”你可能会列出一系列点子。也许你会玩转篮球,或者用枕头搭一个堡垒,又或者尝试把衣架平衡在鼻尖上。
现在,想象一下向一个超级聪明的机器人(像 GPT-4o 这样的 AI)提出完全相同的问题。你可能会预期它会提出类似的想法,甚至更好的点子。但一项名为**“关注差距”(Mind the Gap)**的研究发现,机器人的想法其实与你截然不同,而且其中的原因非常引人入胜。
以下是研究人员发现的过程,通过简单的语言进行了解释。
驱动人类创意的两个引擎
研究人员认为,当人类构思任务时,我们受两个主要引擎的驱动:
- 我们的内在指南针(价值观): 这可以看作是你人格的 GPS。有些人热爱变化和新体验(比如尝试一项新运动),而另一些人则偏好安全和传统。研究发现,你的“指南针”直接引导了你创造什么样的游戏。如果你热爱新奇感,你就会发明更古怪、更有趣的游戏。
- 我们的身体与世界(具身性): 人类拥有身体。我们知道枕头是柔软的,可以被扔出去;我们也知道椅子是硬的,可以用来坐。我们理解物体是如何运作的,是因为我们触摸并使用过它们。我们的想法植根于这种物理现实之中。
实验:人类 vs. 机器人
研究人员设计了一个游戏,让 176 名真实人类和一名 AI(GPT-4o)使用一系列房间物品来发明任务。
- 人类: 他们首先被询问了关于其性格和思维方式的问题。然后,他们构思了任务。
- 机器人: 研究人员给了机器人两种类型的指令。第一种是仅提供基础提示词。第二种是给机器人一个特定人类的“画像”,包括其性格价值观和思维风格,希望机器人能模仿那个人。
重大发现:“目标的奇异谷”
即使在给予机器人人类性格画像的情况下,它也无法像人类一样思考。这就是“差距”出现的地方:
1. “抽象”与“现实”的差距
- 人类发明的任务是物理性的和社会性的。他们想玩捉迷藏、枕头大战,或者与朋友聊天。他们使用了他们的身体。
- 机器人发明的任务是抽象且精神性的。它喜欢建议诸如“写一首诗”、“创作音乐”或“解开谜题”之类的事情。它几乎完全忽略了像“挂衣服”或“玩接球”之类的体力活动。
- 类比: 如果人类像是热爱用真实食材烹饪的厨师,那么机器人就像是一个只会写出优美食谱、却从未真正接触过炉灶或品尝过食物的厨师。
2. “社交”的差距
- 当人类处于“社交”情境中(想象房间里还有另一个人)时,他们会立即想到一起玩的游戏。
- 机器人即使被告知有人在场,也很少建议社交互动。它更倾向于独自进行的脑力任务。
3. “有趣”的悖论
这里有一个转折:当其他人对这些任务进行评分时,他们认为机器人的任务比人类的任务更有趣、更有新意。
- 为什么? 因为机器人不受物理定律或社交尴尬的限制。它可以构思出极其疯狂、富有创造力的组合,而人类可能会觉得这些组合太荒诞或难以实现。
- 代价: 机器人的“有趣”就像电影剧本——它在纸面上看起来很精彩,但缺乏实际进行这项活动的混乱且真实的物理体验。
这为什么重要?
该研究得出结论,人类和 AI 之间存在着根本性的差异:
- 人类受内在感受(我们珍视什么)和物理经验(我们的身体能做什么)的驱动。
- AI受文本模式的驱动。它知道哪些词汇会放在一起,但它并不“感受”游戏的价值,也不“了解”枕头有多重。
即使你告诉 AI,“我是一个热爱变化和体育活动的人”,它也无法真正“成为”那个人。它只能模仿那个人的“语言”,而无法模仿其背后的“动机”。
核心结论
论文指出,要构建真正像人类一样的 AI,我们不能仅仅给它更多的数据或更好的提示词。我们需要教会它理解为什么我们要去做某些事(我们的内在价值观),以及我们的身体是如何与世界互动的。在此之前,AI 将始终是一个出色的讲故事者,它能完美地描述一场游戏,但永远不会真正想要去玩这场游戏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。