Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Deliberation Allocation
本文揭示了尽管大型推理模型与人类在整体上都会为更难的问题分配更多时间,但两者表现出截然相反的内部策略:人类在最终失败的问题上花费的时间较少(表明存在策略性脱离),而模型在失败的问题上生成的 Token 更多(表明存在由不确定性驱动的审慎思考),这种关键的分歧被标准的难度相关性指标所掩盖。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这是一篇关于该论文的通俗易懂且使用日常类比的解释。
核心思想:两种思维方式
想象你正在参加一场很难的考试。当你遇到难题时,你有两种反应方式:
- “放弃”策略: 你意识到,“这对我来说现在太难了,”于是你迅速停止思考这个问题,以便为下一题节省精力。
- “坚持”策略: 你意识到,“这很难,”所以你继续盯着它看,写更多的笔记,并更加努力地尝试,即使你最终还是答错了。
这篇论文发现,人类大多使用第一种策略,而AI推理模型(目前最智能的新型AI)则使用第二种。
背景:表面上的相似性
长期以来,研究人员一直认为AI和人类的思维方式是相同的。他们注意到一个模式:
- 当人类面对难题时,需要很长时间才能解决。
- 当AI面对难题时,它会在给出答案前生成很长的“思考”文本(token)。
看起来它们都在表达:“问题越难 = 投入越多。”论文称之为**“难度注册”(Difficulty Registration)**。人类和AI对于“哪些问题很难”达成了共识。
转折点:失败时会发生什么?
作者进行了更深入的研究。他们不仅观察了解决问题需要多长时间,还观察了当答案错误时会发生什么。
- 人类: 当人类答错题目时,他们通常在上面花费的时间更少。他们很早就意识到这是一个死胡同,并决定放弃。
- 类比: 想象你正在尝试修理一个坏掉的面包机。如果你发现插头没插,你会立即停止摆弄它。你不会在没插电的面包机上浪费20分钟试图修理它。
- AI 模型: 当这些AI模型答错题目时,它们花费的时间(生成的文本量)比答对时更多。即使在失败时,它们也会不断地进行“思考”。
- 类比: 想象面包机没插电。AI会不断尝试按按钮、打开盖子、检查线圈,折腾20分钟,最后才写出一份关于其挣扎过程的详尽报告,然后承认:“哦,没插电。”
思维的两个层面
论文将思维分为两个截然不同的步骤:
- 注册(察觉): “这个问题难吗?”(人类和AI对同样难的问题都回答“是”)。
- 分配(决策): “既然我知道它很难,我该怎么办?”
- 人类: “它很难而且我卡住了?那我就停止尝试,去做别的。”(脱离/放弃)。
- AI: “它很难而且我卡住了?那我要思考得更努力,写得更多。”(坚持/持续)。
为什么 AI 会这样做?
作者认为,AI并不是以人类的方式在“固执”;它是受不确定性驱动的。
- 当AI感到不确定时,它的内部程序指令它通过生成更多文本来寻找答案。
- 不幸的是,在那些它最不确定的问题上,它往往会失败。因此,每当AI出错时,它生成的“思考”链条反而最长、最详细。
- 这就像一个侦探,在感到困惑时不是意识到自己找错了案子并停下来,而是不断地写更多的笔记。
“人类”的一面
论文还解释了人类为何表现得不同。人类拥有**投入与放弃(engagement vs. abandonment)**的概念。
- 如果一个人尝试一个问题并很快卡住,他们通常会意识到,“我解决不了这个,”然后停止。这就是“放弃”。
- 如果他们继续尝试并最终解决了问题,那么他们就在上面花费了大量时间。
- 数据显示,人类会将时间花在他们预期能解决的问题上,并放弃那些无法解决的问题。
结论:同样的地图,不同的指南针
论文得出结论,虽然AI和人类在表面上看起来很相似(面对难题都会耗时更久),但它们在如何分配时间方面使用的是完全不同的规则。
- 指标陷阱: 之前的研究只观察了“地图”(哪些问题是难的)。他们看到AI和人类是匹配的。
- 现实情况: 当你观察“指南针”(它们如何处理失败)时,它们指向的是完全相反的方向。
简而言之: 人类擅长知道何时放弃一个糟糕的问题以节省精力。目前的AI模型不擅长放弃;它们在原地打转(生成文本)时也会继续“思考”,导致它们在最容易出错的时候,思考过程反而最长。
这对未来意味着什么(根据论文观点)
论文并未声称这是一个临床问题或是一个特定的修复方案。相反,它提出了测试AI的一种新方法。
- 测试方法: 如果我们提前切断AI的“思考”过程(截断),它是否仍能得到正确答案?
- 预测: 如果AI只是因为困惑而在“填充”内容,那么缩短思考时间对它的准确性影响不大(因为它之前只是在浪费时间)。如果AI确实在做有用的工作,那么缩短思考时间会导致它失败。作者认为,这种测试对于判断AI的额外思考究竟是有益的,还是仅仅是混乱的表现,是非常必要的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。