← 最新论文
💬 NLP

AI Assistants Overassist

本文介绍了 Int-Bench,这是一个基于模拟的基准测试,揭示了当前的 LLM 助手与人类相比,往往倾向于过于频繁且过早地介入并提供完整的解决方案,从而优先考虑短期任务成功,而非深度学习所必需的认知参与。

原作者: Verona Teo, Raghav Jain, Tobias Gerstenberg, Max Kleiman-Weiner

发布于 2026-07-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Verona Teo, Raghav Jain, Tobias Gerstenberg, Max Kleiman-Weiner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在学习骑自行车。你的父母就在旁边,扶着车座。如果他们放手太快,你可能会摇晃并摔倒。但如果他们抓得太紧,或者直接接过车把为你转向,你就永远无法真正学会如何控制平衡。这就是老师、家长和教练们几个世纪以来一直在纠结的“辅助困境”:什么时候该介入,什么时候最好让学习者自己去经历一些挫折?在科学领域,我们称之为“支架式教学”(scaffolding)——建立一个临时的支持结构,让学生能够达到更高的思维水平,随后再将其撤去,让他们能够独立站立。

今天,我们有了一种新型教师:人工智能。这些人工智能助手就像是速度极快、知识极其渊博的导师,几乎可以瞬间解决任何问题。但这里有一个大问题:它们是在教我们如何思考,还是仅仅在替我们思考?如果人工智能介入得太早,或者过快地给出答案,它今天可能会帮我们得到正确答案,但实际上可能会阻碍我们在明天学会如何解决问题。科学家们担心,这些数字导师可能会“过度帮助”,使我们成为自身学习旅程中的乘客,而不是驾驶员。

这正是来自斯坦福大学、加州大学圣迭戈分校和华盛顿大学的一个研究团队想要探究的。他们构建了一个名为 INT-BENCH 的数字游乐场,用来观察当一个“学生”(另一个人工智能)试图解决谜题时,AI 教师的行为表现。他们设置了一个游戏,让教师 AI 逐步观察学生的思考过程,并必须做出决定:我应该说话吗?什么时候说?以及我应该告诉他们多少?

他们在三个不同的领域测试了这一点:修复损坏的计算机代码、解决数学问题以及破解脑筋急转弯。结果有点令人惊讶。这些 AI 教师就像是那些忍不住想要修理一切的过度热情的父母。它们的干预频繁得多,而且介入得早得多,甚至比人类教师还要频繁。事实上,即使学生已经在正确的轨道上并且即将靠自己的力量得出答案时,AI 教师也经常会介入!

它们并没有提供温和的提示或微小的线索——比如“检查一下你的括号”或“想想这个数字的形状”——而是倾向于把整个解决方案直接摊在桌面上。这就像是,它们不是在教你如何蹬踏板,而是直接抓起自行车并把它骑到了终点线。虽然这让学生立即得到了正确答案,但并没有帮助他们学会这项技能。当研究人员稍后给学生一个全新的、类似的题目来解决时,那些曾被 AI “帮助”过的学生,表现并不比那些被留在一旁自行的学生更好。AI 的帮助过于针对第一个问题,以至于无法教会学生如何举一反三。

研究人员还让真实的人类扮演了同样游戏中的教师角色。人类要耐心得多。他们会在介入前等待更长时间,而且当他们介入时,会提供引导学生思考而非直接给出答案的提示。他们更有可能说:“你走错路了,试着看看这个线索,”而不是说:“答案是 42。”

这项研究表明,虽然当前的人工智能助手在快速获得结果方面表现出色,但它们目前在培养深度、长期学习方面表现得很糟糕。它们似乎是为“短期成功”——快速完成任务——而优化的,而不是为了“长期成长”——帮助用户成为更好的问题解决者。作者警告说,如果我们过度依赖这些过度热心的 AI 导师,我们可能会慢慢失去独自通过困难并解决问题的能力。这提醒我们,有时候,老师能做的最有帮助的事情就是保持沉默,让学生承担起最繁重的思考工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →