← 最新论文
🤖 AI

EMRB: A Multi-Level Benchmark for Evaluating LLM Reasoning over Raw Electromagnetic Signals

本文介绍了 EMRB,这是一个包含五个难度等级、共 200 个问题的多级基准测试,旨在评估大语言模型通过编写并执行代码来分析原始电磁 I/Q 数据的能力,揭示了其在复杂系统设计任务中存在的显著性能差距,并提出了能够大幅提高推理准确性的 ReconPilot 框架。

原作者: Mingxu Zhang, Ying Sun, Yuhan Li, Yang Ji, Dazhong Shen, Ke Zhang, Shan Huang

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingxu Zhang, Ying Sun, Yuhan Li, Yang Ji, Dazhong Shen, Ke Zhang, Shan Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在我们周围无形的空气中,一场持续不断的无线电波风暴正承载着我们的对话、音乐和数据。对于人类的耳朵而言,这是寂静;但对于无线电接收机来说,这是一股混乱的原始电信号波动。从事这些信号工作的工程师们看到的并非整齐的图表或带有标签的方框,而是一种复杂的、无结构的波形,必须在变得有用之前对其进行测量、清洗和理解。几十年来,理清这些噪声的任务一直需要专门的人类专业知识和定制开发的软件。现在,新一代被称为“大语言模型”的人工智能正在接受测试,以观察它们是否能够执行同样的工作。这些模型以编写代码和回答问题而闻名,但它们从未被要求在没有任何帮助的情况下,观察一段原始且未经处理的无线电信号并弄清楚其中发生了什么。

一组研究人员创建了一项新测试来回答这个问题,将无线电波分析视为人工智能的一项严苛挑战。他们构建了一个名为 EMRB 的基准测试,向计算机程序展示一段无线电活动的原始录音,并要求它们编写自己的代码来测量特定的细节,例如信号强度或其携带的信息类型。该测试旨在确保公平与精确,使用的是由计算机生成的具有已知答案的信号,因此研究人员可以准确检查人工智能的表现。结果揭示了当前能力的清晰图景:虽然最先进的模型可以处理简单的测量,但当任务要求它们同时追踪多个信号或根据发现的内容设计一个新系统时,它们会表现得非常吃力。

研究人员评估了十四种不同的人工智能模型,涵盖了从广泛使用的开源程序到强大的专有系统。他们给每个模型提供了两百个问题,这些问题分为五个难度递增的等级。最简单的等级要求模型寻找基本事实,如单个信号的频率或功率。随着等级难度增加,模型必须选择正确的数学工具来分离重叠信号、计算复杂的通信指标,并最终设计一个能够在无干扰环境下运行的完整系统。这些模型不允许仅仅进行猜测;它们必须编写并运行 Python 代码,从原始数据文件中提取数值,然后解释这些数值以回答问题。

模型的表现差异很大,得分从大约 24% 到接近 79% 不等。表现最强的模型(包括当今最先进的模型)能够高精度地解决较简单的题目,在基础测量上的得分通常超过 85%。然而,随着任务变得更加复杂,得分大幅下降。当模型被要求分析一个包含多个混合信号的拥挤频谱时,它们的表现降至 50% 左右。最困难的挑战——即要求基于分析结果设计一个新的通信系统——对当前的这一代模型来说几乎是不可能完成的任务,最佳得分仅达到约 40%。

研究发现,失败的主要原因并非缺乏关于无线电波公式或物理学的知识。相反,模型之所以失败,是因为它们在进行长链条推理时无法追踪不同的信号。当一个模型需要在单次录音中识别五个不同的信号时,它经常会迷失方向,将一个信号的细节与另一个信号混淆。这导致错误不断累积,即使初始步骤是正确的,也会导致错误的结论。研究人员还发现,模型并不会因为单纯地“更努力地尝试”或“运行更多代码”而获益;最高效的模型能以较少的尝试达到高分,而其他模型则会在无效的计算上浪费时间。

为了帮助模型成功,研究人员提出了一种名为 ReconPilot 的新方法,它将分析过程分为三个截然不同的步骤。首先,一个固定的自动化脚本扫描原始信号,创建一个关于活动发生位置的简单地图,而不试图识别信号的具体内容。第二,人工智能利用这张地图来集中注意力,并编写代码来解决特定问题。第三,模型审查自己的工作,以检查一致性,然后再提交答案。这种结构化的方法显著提高了结果。对于某些模型而言,新方法将其整体得分提升了 17 个百分点以上,这证明了通过提供一个清晰的起点和一种检查工作的方式,可以补偿人工智能在推理方面的弱点。

尽管有了这些改进,研究结论仍然认为,当前的人工智能尚未准备好在最复杂的任务中取代人类工程师。这些模型可以可靠地测量简单的信号,但它们尚不能被信任去设计新系统,或管理存在多信号干扰的拥挤无线电环境。研究人员强调,他们的测试使用的是由计算机生成的合成信号,因此结果尚不能证明这些模型在面对具有硬件缺陷或意外噪声的现实世界无线电录音时会如何表现。然而,该基准测试提供了一种衡量进步的清晰且客观的方式,表明虽然人工智能在理解原始数据方面正在进步,但在理清电磁频谱的完整复杂性方面,仍有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →