Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding
本文介绍了 TIDE,这是一个用于评估大语言模型在随时间演进的文档理解方面表现的新型专家验证基准,揭示了当前模型在版本解析方面存在显著困难,并且往往优先考虑自信的参数化知识而非具有权威性的、特定时间的文本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图为一个游戏寻找正确的规则,但那本规则书是一个每天都在变化的生命体。在人工智能的世界里,处理知识通常有两种主要方式。第一种就像一本巨大的百科全书:如果一个事实发生了变化,旧的事实会被直接抹去并被新的取代。如果你询问一个更名的国家首都,百科全书只会显示它的新名字。第二种方式则要复杂得多,它就像一叠法律合同或是一款带有补丁的游戏。在这里,旧规则不会消失;它对于其生效期间仍然是完全正确的,而新规则会在稍后接管。如果你问:“2015年的限速是多少?”你需要的是2015年的规则,而不是2025年的。如果计算机搞错了这一点,这不仅仅是一个愚蠢的错误;这可能意味着告诉某人缴纳错误的税款,或者遵循早已被取消的医疗指南。这就是“版本解析”(version resolution)的挑战:弄清楚在特定日期究竟是哪个版本的规则在掌权。
一组研究人员构建了一个名为 TIDE(演变文档中的时序信息漂移)的新测试,旨在观察当今最智能的 AI 计算机是否能处理这种复杂的“时空旅行”逻辑。他们并没有凭空捏造问题,而是挖掘了来自孟加拉国政府的 644 份真实官方文件,涵盖了从 1969 年到 2025 年的海关法、税法和法规。这些文件非常杂乱,混合了英语和孟加拉语,并且包含一个由修正案交织而成的网络——其中一个规则取消了另一个,而后者又被第三个规则取消。研究人员基于这些文件创建了 3,050 个问题,要求 AI 扮演一名“时空旅行律师”。他们测试了九种目前最强大的 AI 模型,并为它们提供了三种寻找答案的方式:仅依靠训练期间记忆的内容(类似于闭卷考试)、阅读提供给它们的准确文档,或者搜索数据库以找到正确的页面。
结果令人警醒。即使是最好的 AI 模型,在被给予了完美的参考文档时,也仅能答对约 68.5% 的问题。这意味着,即使答案就在它们的“眼前”,它们仍然在超过三分之一的情况下出错。研究发现,当这些模型明确知道该去哪里寻找文本时,它们在定位正确文本方面表现得相当出色,但在意识到自己正在阅读的文本实际上是针对特定日期“错误版本”时,表现却很糟糕。例如,如果你给 AI 一份写着“税率为 10%”的文件,但问题询问的是税率为 5% 时期的情形,AI 往往会自信地忽略该文档,转而坚持其记忆或错误的文本。事实上,当研究人员尝试用一个自信但错误的陈述来误导 AI 时,这些模型非常擅长察觉到问题所在(检测错误的成功率约为 79%),但它们在精准指出究竟“哪里错了”方面却表现得很差(识别特定错误的成功率仅为 19% 左右)。这意味着它们经常能感觉到问题,却会自信地归咎于错误的细节。
论文指出,仅仅给 AI 更多的阅读文本或更好的搜索工具并不能解决这个问题。这些模型在处理需要拼凑时间线(例如按顺序排列事件,或计算“三年后”规则是什么)的任务时最为吃力。它们倾向于假设规则只会变得更加严格或向一个方向改变,却忽略了法律经常会被废除或恢复到旧版本这一事实。虽然研究人员展示了拥有正确的文档会有所帮助,但这并不能保证成功。研究结论认为,“版本解析”仍然是 AI 面临的一个重大且尚未解决的障碍。在这些模型能够真正理解法律文档中的时间流逝之前,将它们信任于税务申报或海关清关等现实任务中可能存在风险,因为在这些领域,弄错日期可能会导致严重的财务或法律麻烦。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。