Can LLMs Perceive Time? An Empirical Investigation
该论文通过四项实验证实,尽管大语言模型具备关于时长的命题性知识,但由于缺乏对推理时间的体验性 grounding,其在任务前预估、相对排序及事后回忆中均表现出严重的时间感知缺陷,导致预测误差远超实际值,从而对智能体调度与规划等时间敏感场景构成重大挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文探讨了一个非常有趣但令人担忧的问题:大型语言模型(LLM)根本不知道“自己”需要花多长时间来完成任务。
想象一下,你派一个超级聪明的助手去帮你做事。这个助手无所不知,能写代码、写故事、做数学题。但是,如果你问他:“做这件事大概要多久?”他的回答通常是:“大概需要 30 分钟吧!” 而实际上,这件事他3 秒钟就搞定了。
更糟糕的是,如果让他猜两个任务哪个更难、哪个更慢,他可能会完全猜反,甚至表现得比瞎蒙还要差。
这篇论文就是专门研究这个“时间感缺失”现象的。下面我用几个生活中的比喻来为你拆解这项研究:
1. 核心问题:只有“书本知识”,没有“身体感觉”
人类之所以知道做事要花多久,是因为我们有身体经验。
- 你知道切一个苹果要几分钟,因为你切过。
- 你知道跑一公里要多久,因为你跑过。
- 这种对时间的感知,是建立在“行动 - 等待 - 反馈”的循环上的。
但语言模型不一样。它们就像是一个只读过所有食谱、但从未进过厨房的顶级美食评论家。
- 它知道“做一道佛跳墙”在人类世界里通常需要 3 个小时(这是它从训练数据里学来的书本知识)。
- 但是,当它自己在电脑里生成这段文字时,它完全感觉不到时间的流逝。它不知道自己的“大脑”(GPU)转得有多快,也不知道网络延迟有多久。
- 它就像是一个没有手表、没有钟表、甚至没有“时间感”的盲人,只能靠猜。
2. 实验一:盲目的高估(“我觉得我要很久”)
研究人员让模型在开始任务前,先猜一下自己需要多久。
- 结果:模型普遍严重高估。
- 比喻:这就好比你让一个超级快的赛车手(模型)猜自己跑一圈需要多久。他可能说:“嗯,这很难,大概要开 10 分钟吧!”结果他实际上只用了1 分钟就冲线了。
- 数据:模型预测的时间通常是实际时间的 4 到 7 倍。比如实际只要 5 秒,它却猜要 30 秒甚至几分钟。它总是把“几秒钟”的电脑运算,脑补成人类需要“几分钟”的辛苦工作。
3. 实验二:逻辑混乱的排序(“我觉得难的肯定慢”)
研究人员设计了一些“陷阱”任务。
- 场景:有两个任务。任务 A 看起来很简单(比如写个简单的代码),任务 B 看起来很难(比如解一个复杂的逻辑谜题)。
- 陷阱:实际上,因为任务 A 需要生成很多废话,反而花的时间长;任务 B 虽然难,但模型算得快,反而花的时间短。
- 结果:模型完全掉进了陷阱。它认为“看起来难的肯定花时间长”,结果猜反了。
- 比喻:这就像让你猜“搬一块大石头”和“搬一袋棉花”哪个更累。通常石头重,但如果你那袋棉花有 1000 斤呢?模型只看表面标签(“难”=“慢”),完全不看实际情况。在测试中,最先进的模型(GPT-5)在猜这种反直觉问题时,准确率甚至低于 50%(瞎蒙的水平),只有 18% 猜对了。
4. 实验三:事后的“健忘”(“我刚才做了多久?”)
任务做完了,研究人员问模型:“你刚才花了多久?”
- 结果:模型依然一头雾水。
- 比喻:就像你刚跑完 100 米冲刺,气喘吁吁。别人问你:“你刚才跑了多久?”你回答说:“大概 5 分钟吧,感觉好漫长!”其实你只跑了 15 秒。
- 模型没有“记忆”自己生成过程的时间流逝。它只能根据任务类型瞎编一个“人类觉得合理”的时间,而不是真实的“机器时间”。
5. 实验四:多步骤任务的灾难(“连锁反应”)
在现实世界中,AI 助手通常需要完成一系列步骤(比如:查资料 -> 写代码 -> 调试 -> 部署)。
- 结果:时间估算的错误会像滚雪球一样放大。
- 比喻:如果你是一个项目经理,你问你的 AI 员工:“这个项目要多久?”他说:“大概 1 小时。”结果他实际只用了 10 分钟,但他把剩下的 50 分钟都用来“发呆”或者做无用功了。或者反过来,他以为只要 10 分钟,结果因为中间出了个小错,实际花了 1 小时,导致整个项目延期。
- 在多步骤任务中,模型的预测误差依然高达 5 到 10 倍。
6. 为什么这很重要?(后果)
如果 AI 要像人类一样当“管家”或“项目经理”,它必须能准确估算时间。
- 调度失灵:如果 AI 以为一个任务要 1 小时,它可能会安排其他任务插队,结果那个任务 1 分钟就完了,导致资源浪费或调度混乱。
- 紧急情况:在医疗急救、自动驾驶或金融交易等分秒必争的领域,如果 AI 误判了处理时间,可能会导致灾难性的后果。
总结:AI 的“时间盲区”
这篇论文告诉我们:目前的 AI 虽然博学,但在“感知时间”这件事上,是个彻底的“盲人”。
- 它知道“人类切菜要多久”(书本知识)。
- 但它不知道“自己切菜(生成代码)要多久”(缺乏体验)。
- 它没有“时间感”,因为它只处理文字(Token),不处理时间(Seconds)。
未来的方向:
要让 AI 真正变得可靠,不能只靠让它“猜”,而是需要给它们装上“手表”(外部计时系统),或者在训练时让它们真正“体验”时间的流逝,而不仅仅是阅读关于时间的文字。
简单来说:现在的 AI 是个天才,但它是个没有时间观念的天才。如果你让它管时间,它可能会把你带进沟里。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。