← 最新论文
💬 NLP

Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance

本文介绍了 Earnings25,这是一个包含完整的收益电话会议及行业平衡片段、具有对齐文本和结构化元数据的 500 小时综合基准测试集,旨在评估并为英语语言财经收益电话会议在现实条件下的自动语音识别系统建立可复现的基准。

原作者: Denglin Jiang, Haoran Zhou, Anshul Wadhawan, Brendan Fahy, Vinay Ramesh, David Weisberg, Dmitriy Derkachevskiy, Helen Sheehan, Srivas Prasad, Michele Franceschini

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Denglin Jiang, Haoran Zhou, Anshul Wadhawan, Brendan Fahy, Vinay Ramesh, David Weisberg, Dmitriy Derkachevskiy, Helen Sheehan, Srivas Prasad, Michele Franceschini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人理解人类的对话。你可能会先让它听一些从书中读出的清晰、缓慢的故事。但现实生活是混乱的。人们会互相插话,使用俚语,带着不同的口音,并抛出那些在故事书中并不存在的复杂词汇。这就是**自动语音识别(ASR)**的世界——这项技术将说话声转化为文本。虽然这些机器人在听取清晰的声音方面已经做得相当不错,但当对话变得混乱、具有技术性或充满专业术语时,它们往往会跌跌撞撞。科学家们面临的一个大问题是:*我们如何知道一个机器人是真的准备好应对现实世界了,还是仅仅擅长朗读剧本?*为了回答这个问题,我们需要一场“期末考试”,它不仅仅是对记忆力的测试,更是对在嘈杂、复杂的环境中生存能力的测试。

这正是来自彭博(Bloomberg)的一个团队介入的地方,他们提出了一个全新的、规模宏大的挑战,名为 Earnings25。把金融业绩电话会议想象成企业演讲的“奥林匹克”。这些是长达一小时的电话会议,公司高管和金融分析师在其中讨论金钱、股票和未来计划。这是一个完美的难度风暴:人们说话很快,使用大量的金融俚语,互相插话,并在阅读准备好的剧本与回答即兴且棘手的提问之间进行切换。作者意识到,现有的测试就像是在安静健身房的跑步机上练习马拉松;它们没有捕捉到山坡、风力和人群。因此,他们构建了一个全新的、极其详细的基准测试,以观察当前的语音识别机器人能否处理金融世界中真实而混乱的情况。

伟大的金融聆听挑战

该论文介绍了一个名为 Earnings25 的庞大新数据集,旨在成为语音识别 AI 的终极压力测试。作者并没有随手抓取一些随机的电话录音;他们构建了两个截然不同的“竞技场”,以通过不同的方式测试机器人。

第一个竞技场是 testset-full,这是一个由 2025 年第四季度标普 500 指数成分股公司完整的、未经编辑的业绩电话会议组成的巨型集合,共计 498 小时。想象一下,在不间断的情况下听近 500 小时的连续金融会议。这个集合保留了对话的完整、自然的流动,包括现实生活中出现的尴尬沉默、重叠的声音以及冗长且曲折的故事。这就像是给机器人看一整季复杂的电视剧,而不是仅仅看几个片段。

第二个竞技场是 testset-segmented,这是一个由 290 个特定音频块组成的、经过精心策划的 46 小时集合。在这里,研究人员玩了一场聪明的“公平游戏”。在现实世界中,某些行业(如银行或石油公司)说话的频率远高于其他行业(如小众制造业)。如果你只听最常见的行业,你可能会认为机器人表现出色,但当它听到罕见话题时,它可能会表现得一败涂地。为了解决这个问题,团队从 2000 多场电话会议中精准挑选了每个行业恰好一个片段,确保每一个类型的业务——从“3D 打印机”到“风力涡轮机”——都拥有平等的发言权。这些片段时长约为 5 到 10 分钟,非常适合测试机器人如何在不被海量内容压垮的情况下,处理特定的、棘手的词汇。

秘诀:元数据与“谁说了什么”

让 Earnings25 真正与众不同之处不仅在于音频,还在于随之而来的“小抄”。大多数旧的数据集只给你声音和文本。而 Earnings25 给你的不仅是声音和文本,还有一个关于谁在何时、为何说话的详细地图。

研究人员为每位发言者标注了他们的角色:是正在宣读开场白中枯燥规则的操作员?是正在进行圆滑演讲的 CEO?还是正在提出棘手、即兴问题的分析师?他们还标注了行业和电话会议的结构。这使得科学家们可以提出这样的问题:“当 CEO 讲话时,机器人是否更容易产生困惑,还是在分析师插话时更容易出错?”或者“它在生物技术行业的失败率是否比在银行业更高?”这把一个简单的“它答对了多少个词?”的测试,变成了一场关于机器人究竟在哪里以及为什么挣扎的深度调查。

结果:机器人很棒,但并不完美

团队让两个流行的语音识别系统——WhisperParakeet-TDT——接受了严苛的考验。他们没有给机器人针对这些特定数据的特殊训练;他们只是要求机器人倾听并转录,模拟现实场景中机器人必须即兴发挥的情况。

结果显示,虽然这些机器人令人印象深刻,但仍有很长的路要走。在庞大的 498 小时集合上,表现最好的模型(Parakeet-TDT)大约有 10.8% 的单词错误率。在较小的、行业平衡的集合上,错误率略微上升至 11.1%。这个微小的跳跃实际上意义重大。它表明,当你强迫机器人去聆听那些罕见且困难的行业(即“长尾”业务)时,它会更容易出错。

论文强调了一个引人注目的发现:总分可能会产生误导。如果你只看平均错误率,你可能会认为机器人表现得很棒,因为它在银行等常见行业表现优异。但当你观察特定且复杂的领域,如生物技术制药时,错误率会飙升至 15% 以上。这就像一个学生因为搞定了简单的数学题而在数学测试中拿了 A,却在高级微积分部分不及格。这种“平均”成绩掩盖了他们在最难部分依然挣扎的事实。

这为什么重要

作者谨慎地表示,他们并不是在声称自己“解决了”这个问题。相反,他们提供的是一个可复现的基准测试——一种让所有人衡量进步的标准方式。在 Earnings25 出现之前,很难判断一个新的语音 AI 到底是真正变强了,还是仅仅在测试数据上运气好。现在,研究人员拥有了一个拥有丰富细节的清晰、公平的竞技场,可以了解其模型究竟在哪里失败。

论文也指出了其自身的局限性。Earnings25 专注于英语电话会议,且主要来自美国本土公司。虽然这使得测试受控且高质量,但它尚未涵盖全球口音和语言的多样性。作者建议,下一步应将这一“金融聆听挑战”扩展到更多国家和语言。

简而言之,Earnings25 是一个巨大且组织严密的金融混乱图书馆。它不仅告诉我们机器人是否能“听见”,它还告诉我们机器人是否能“理解”那个混乱、充满术语、多人交谈且高风险的商业世界。目前来看,机器人正在倾听,但它们仍在学习如何跟上对话的节奏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →