← 最新论文
💬 NLP

Language and Experience: A Computational Model of Social Learning in Complex Tasks

本文提出了一种将预训练语言模型转化为概率推理框架的计算模型,通过联合推断传感器数据与语言指导来模拟社会学习,并在行为实验与模拟中验证了该方法能有效加速人类与智能体在复杂任务中的学习过程并促进跨代际及人机间的知识传递。

原作者: Cédric Colas, Tracey Mills, Ben Prystawski, Michael Henry Tessler, Noah Goodman, Jacob Andreas, Joshua Tenenbaum

发布于 2026-02-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Cédric Colas, Tracey Mills, Ben Prystawski, Michael Henry Tessler, Noah Goodman, Jacob Andreas, Joshua Tenenbaum

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个非常有趣的故事:我们如何像人类一样,既通过“亲自尝试”又通过“听别人建议”来快速学会新事物,并试图让 AI 也拥有这种能力。

想象一下,你被扔进了一个完全陌生的电子游戏世界(比如《超级马里奥》的某个新关卡),你只有 15 条命。你会怎么做?

1. 核心挑战:两条学习路径

人类学习新事物通常靠两样东西:

  • 直接经验(摸爬滚打): 你试着跳一下,发现掉坑里了(死了一次);你试着撞一下红色的方块,发现它把你弹开了。这是通过“试错”来学习。
  • 语言指导(听人指点): 一个老玩家告诉你:“千万别碰带白点的红蘑菇,那是毒的!”或者“在橡树附近找黄色的蘑菇,那里最多。”这是通过“听别人说”来学习。

以前的 AI 很难同时做好这两件事:

  • 有的 AI(强化学习)像是一个不知疲倦的笨小孩,它愿意死几百万次来学会怎么玩游戏,但效率极低。
  • 有的 AI(大语言模型)像是一个博学的图书管理员,它读过很多书,能说出游戏规则,但一旦让它真的去操作游戏手柄,它往往手忙脚乱,甚至不知道下一步该往哪走。

2. 这篇论文的解决方案:给 AI 装上“大脑”和“耳朵”

作者们设计了一个新的 AI 模型,它结合了上述两者的优点。我们可以把这个模型想象成一个**“带着笔记本的侦探”**。

这个侦探是怎么工作的?

  1. 它有一个“假设库”(世界模型):
    当侦探刚进入游戏时,它脑子里有 20 种关于这个世界的“猜想”(比如:猜想 A 是“黄色方块是毒药”,猜想 B 是“黄色方块是金币”)。它不会盲目乱撞,而是先在心里推演。

  2. 它把“语言”当作证据:
    当它读到老玩家留下的纸条(比如“黄色方块会杀了你”)时,它不会只是把这句话存起来。它会问自己:“如果我的猜想 A是对的,那么老玩家写下这句话的概率有多大?如果我的猜想 B是对的,概率又有多大?”

    • 如果猜想 A 符合这句话,它就给猜想 A 加很多分。
    • 如果猜想 B 和这句话矛盾,它就给猜想 B 扣分。
    • 比喻: 就像你在破案,有人告诉你“凶手是左撇子”,你立刻就会把“右撇子嫌疑人”的嫌疑排除掉。
  3. 它把“大语言模型”变成了“翻译官”:
    这是最巧妙的地方。作者利用了一个强大的大语言模型(LLM),但不是让它直接玩游戏,而是让它扮演两个角色:

    • 角色一(说话者): 当 AI 自己学会了规则,它让大语言模型帮它把规则写成通俗易懂的“新手指南”,传给下一个玩家。
    • 角色二(倾听者): 当 AI 看到别人写的指南时,它让大语言模型帮忙分析:“这句话最可能对应哪种游戏规则?”
    • 比喻: 就像你有一个超级聪明的翻译官,它能把别人模糊的“别碰那个红的”翻译成具体的“红色方块 = 死亡”,也能把你脑子里复杂的规则翻译成别人能听懂的“人话”。

3. 实验结果:它真的学得快吗?

作者们让 AI 和真人一起玩 10 种不同的电子游戏,结果非常惊人:

  • 只有试错(没人教): 真人和 AI 都能学会,但 AI 学得更快、更稳。纯靠死磕的旧式 AI(Deep RL)几乎学不会,纯靠看书的旧式 AI(纯大模型)也玩不转。
  • 有人教(看指南):
    • 避坑: 如果指南说“小心黄色”,AI 和真人就几乎不会去碰黄色,省下了很多条命。
    • 加速: 如果指南说“把绿色推到橙色上能赢”,他们发现这个秘密的速度比瞎猜快了 40% 到 80%。
    • 双向交流: 最酷的是,AI 写的指南也能帮到真人! 真人看了 AI 写的“操作手册”,玩游戏的成绩也变好了。反过来,AI 看了真人写的指南,也能学得更好。

4. 代际传承:知识的积累

论文还做了一个有趣的实验:“传话游戏”

  • 第一个人玩 2 条命,写个纸条给第二个人。
  • 第二个人玩 2 条命,再写个纸条给第三个人……
  • 一直传到第 10 个人。

结果发现,随着代际传递,游戏通关率越来越高。就像人类文化一样,知识虽然每次传递都会丢失一点点(比如第一个人没写清楚),但通过一代代人的修正和补充,最终大家都能掌握复杂的规则。

5. 总结与意义

这篇论文的核心思想是:语言和经验不是对立的,它们是互补的。

  • 以前的 AI:要么只会死磕(经验),要么只会空谈(语言)。
  • 现在的 AI:学会了把语言当作“线索”,把经验当作“验证”,像人类侦探一样,通过**“听别人说 + 自己试 + 心里推演”**三者结合,快速掌握新世界的规则。

这对我们意味着什么?
这意味着未来的 AI 不仅能自己学习,还能像老师一样教人,也能像学生一样听人教。它们能理解人类模糊的建议,也能把复杂的发现用人类听得懂的话讲出来。这是迈向“人机协作”和“人机共同进化”的重要一步。

一句话总结:
这就好比给 AI 装上了一个**“会思考的翻译官”**,让它既能听懂老玩家的“潜台词”,又能把新发现变成“说明书”传给后人,从而在陌生的世界里不再是个只会撞墙的愣头青,而是一个聪明的探险家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →