← 最新论文
💬 NLP

TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning

本文介绍了 TimeSage-MT,这是一个包含八个真实世界领域、共计 240 个任务的多轮对话基准测试,旨在评估智能体时间序列推理能力,揭示了当前大语言模型在记忆、不确定性处理和决策制定方面的显著性能差距,并为未来的发展奠定了基础。

原作者: Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位新的金融分析师、气象预报员或医院数据专家。你不仅仅希望他们盯着一张电子表格并猜一个数字。你希望他们能坐下来与你交流,提出澄清性的问题,检查自己的工作,在收到新信息时改变主意,并最终根据证据给出一个可靠的计划。

这篇论文介绍了 TimeSage-MT,这是一个旨在测试 AI 智能体(聪明的计算机程序)是否真的能够进行这种现实世界的、多步骤时间序列分析的“期末考试”。

以下是其内容的简明解读:

1. 问题所在:“一锤子买卖”陷阱

目前大多数 AI 测试都像是突击测验:“这是股票价格图表。明天会是多少?”AI 进行猜测,得到一个分数,测试就结束了。

  • 现实情况: 现实生活不是突击测验。一个真正的分析师会说:“等等,数据看起来有点异常。让我检查一下是否有错误。噢,有一个节假日效应。让我们调整一下。那么,考虑到这一点,我们应该买入还是卖出?”
  • 差距: 现有的 AI 模型擅长处理这种“突击测验”,但当对话变得冗长、复杂或需要记住五分钟前说过的话时,它们往往会失败。它们可能会产生数字幻觉,或者忘记刚刚看过的资料。

2. 解决方案:“TimeSage-MT”考试

作者构建了一个庞大的、真实的测试套件,称为 TimeSage-MT。可以把它想象成一个模拟游戏,AI 必须在其中扮演数据侦探的角色。

  • 设置: 它包含 240 个不同的场景,横跨 8 个真实世界领域(如金融、医疗、能源和零售)。
  • 对话形式: 每一场场景都不是一个问题,而是一个 多轮对话(类似于聊天),长度从 3 到 20 条消息不等。
  • 难度等级:
    • 第 1 级(开放式探索): “嘿,这些数据看起来怎么样?”(基础剖析)。
    • 第 2 级(多技能组合): “找出那些奇怪的峰值,然后预测下周的情况。”(任务链)。
    • 第 3 级(落地综合): “结合预测结果和异常检测,写一份报告。”(整合所有内容)。
    • 第 4 级(完整决策): “基于以上所有情况,我们应该关闭电网还是保持运行?”(做出高风险决策)。

3. 他们是如何构建它的(“工厂”)

创建一个答案 100% 正确的测试是非常困难的。如果让 AI 来编写测试题,它可能会编造答案。

  • 工厂: 作者构建了一个“可复现的流水线”。他们采用真实数据,使用严格的计算机代码来计算真实答案(即“金标准”),然后利用 AI 生成围绕这些答案的对话
  • 安全网: 他们拥有一个“质量控制”团队(包括人类和自动化手段),负责检查每一个测试,以确保 AI 没有在问题中意外泄露答案,也没有捏造事实。

4. “TimeSage”智能体

为了展示该测试如何运作,他们构建了自己的 AI 智能体,名为 TimeSage

  • 工具箱: TimeSage 不仅仅是靠直觉猜测,它拥有一个包含 226 个特定工具(技能)的库,用于进行时间序列数学运算。这就像是给机械师一套完整的扳手,而不是只要求他们用手去“修理汽车”。
  • 流程: TimeSage 规划其步骤,检查其工作,并且只有在拥有基于代码的证据时才会发言。

5. 结果:发生了什么?

他们针对这个考试测试了世界上最智能的 AI 模型(如 GPT-5、Claude 等)。以下是他们的发现:

  • “代码”优势: 当允许 AI 编写并运行 Python 代码来进行数学运算时,它的表现大幅提升。当它试图仅凭记忆“猜测”数字时,表现得非常糟糕。
  • “记忆”衰减: 随着对话变得越来越长(从第 1 级移动到第 4 级),AI 的性能出现了剧烈下降。它们在最初的几轮对话中表现良好,但随着聊天的进行,开始遗忘早期的事实或捏造数字。
  • “决策”差距: AI 在描述数据方面做得还可以,但在做出决策方面表现很差。当涉及不确定性时,它很难说出:“因为发生了 X,所以我们应该做 Y。”
  • “工具”权衡: 给 AI 一个结构化的“TimeSage”系统(带有严格规则和规划器)有助于提高其数字准确性,但有时会降低其编写自然、灵活报告的能力。这是一种在成为严谨的计算器与灵活的对话者之间的权衡。

6. 核心启示

论文得出结论:尽管 AI 正在变得越来越聪明,但在处理时间序列数据的可靠、长周期推理方面仍然面临困难。

  • 它无法始终记住上下文。
  • 它无法始终处理不确定性(例如,是说“我不确定”还是编造一个数字)。
  • 它在将数据转化为现实世界决策方面仍然存在困难。

TimeSage-MT 现在是一个公开的排行榜,任何人都可以用它来测试自己的 AI 智能体,看看它们是否真的能够胜任一份真实的工作,而不只是应付一场突击测验。它迫使开发者不再仅仅关注最终答案,而是开始关注 AI 是如何得出那个答案的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →