← 最新论文
🤖 AI

A Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving Accuracy

本文表明,将数值时间序列数据转换为二维视觉图表以供视觉语言模型使用,可以在显著降低 AI 推理能耗和上下文窗口需求的同时,实现比传统基于文本的大语言模型及统计基准更高的异常检测准确率。

原作者: Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人通过观察一长串数字来识别汽车的爆胎。这个机器人是一个“大语言模型”(LLM),一种通常阅读文字和句子的智能类型。但问题在于,当你给它输入原始数字时,它必须把每一个数字都当作一个独立的“单词”来阅读。一个包含 381 个数字的列表可能会变成 50,000 个微小的“标记”(token,即机器人理解的基本数据单位)。这就像是通过逐个读取每个像素的颜色代码来描述一场美丽的日落。这个过程极其缓慢,消耗大量的电力,并且经常让机器人感到困惑,因为这些数字无法讲述一个清晰的故事。

现在,想象一下,与其阅读数字列表,你直接给机器人展示一张数据的“照片”——一个简单的折线图。突然间,机器人一眼就能看到全局。它可以瞬间发现一个峰值或一个凹陷,就像人类一样。这就是“视觉语言模型”(VLM)的力量。它们是能够同时“看”图像并“读”文本的 AI 系统。科学家们正在探讨的核心问题是:将数字转化为图像是否值得投入额外的精力?展示一张图表是否能让 AI 更节能、更聪明,还是仅仅是一种花哨的技巧?这篇论文深入探讨了这个问题,特别关注了如何监控像手机网络这样复杂的系统,在这些系统中,能源成本和速度至关重要。


一图胜千言(也省下大量能源)

在电信网络领域,故障总是层出不穷。基站可能会突然停止工作,或者数据传输速度可能会骤降。为了捕捉这些问题,工程师们会监测“KPI”(关键绩效指标)——基本上就是一组追踪网络运行状况的数字。传统上,他们将这些数字输入 AI 模型以寻找故障点。但正如本文作者发现的那样,向标准的基于文本的 AI 输入原始数字就像是在试图用消防水龙头喝水:既混乱又浪费,有时甚至根本行不通。

问题所在:“标记”(Token)爆炸
当标准 AI 阅读数字列表时,它会将数字分解成被称为“标记”的微小块。作者发现,仅来自 8 个不同网络指标的适度数据窗口,就会膨胀到 46,101 至 59,803 个标记之间。对于 AI 来说,这是巨大的数据量。由于 AI 使用的能量与它必须阅读的标记数量成正比,这种方法极其昂贵。这就像是因为你坚持要把一颗沙粒包装在一百万个独立的盒子里,结果不得不派出一辆卡车来运送这一粒沙子。

此外,当指标达到 24 个时,数字列表会变得非常长,以至于超出了大多数当前 AI 模型的内存限制。这太多的数据无法一次性放入机器人的大脑中,迫使工程师不得不截断数据,从而可能错过问题的关键。

解决方案:将数字转化为艺术
作者尝试了一种不同的方法:他们不再向 AI 输入原始数字,而是开始向其展示图片。他们将相同的数据转化为二维折线图(视觉图表)。这样一来,AI 不再需要阅读 50,000 个标记,而只需观察代表图像的几千个“视觉标记”。

结果令人惊喜。通过转向使用图片,团队实现了 AI 处理数据量的巨大缩减:

  • 根据所使用的特定 AI 模型,所需的标记数量减少了 3.6 到 10.4 倍
  • 这转化为了每次检查时消耗能量减少了 1.8 到 2.5 倍

换句话说,对于一个每 15 分钟监测 200 个基站的电信网络,这种转变每天可以节省约 7.2 兆焦耳 (MJ) 的能量。这大约相当于一个普通美国家庭一天的用电量,仅仅通过改变向计算机展示数据的方式就实现了节省。

这不仅是为了节能,更是为了更聪明
这里是最令人惊讶的部分:节省能量并不意味着 AI 变笨了。事实上,它变得更强了。

  • 当 AI 观察图片时,它识别网络问题的精确度提高了 220.7%,相比于阅读文本的情况。
  • 它比传统的专门数学工具(如 LSTM 和 ARIMA)的表现提升了 144% 以上
  • 在公开测试中,其中一个模型(Pixtral-12B)在使用图像而非文本进行问题查找时,其效率提升了 20.6 倍

为什么会这样?作者认为,当数据是一串数字时,AI 必须自己动手“连点成线”。但当数据是一张图片时,问题的“形状”(比如突然的飙升或缓慢的下降)就直接呈现在它面前。AI 可以瞬间识别出模式,就像你可以直接看到汽车轮胎瘪了一样,而不需要去测量橡胶上每一英寸的空气压力。

细节说明:他们是如何测试的
研究人员并非凭空猜测,而是进行了严密的测量。他们使用了来自真实 4G/5G 网络和公共云数据的三种不同类型的先进 AI 模型(Llama-3.2-90B、Qwen2.5-VL-72B 和 Pixtral-12B)进行测试。他们利用专门的工具来精确测量计算机芯片在回答每一个问题时消耗了多少电量。

他们还测试了降低图片分辨率是否能进一步节省能量。他们发现,即使将图像缩小到 75 DPI(每英寸点数),依然可以保持同样的准确度,这额外节省了 24% 的能量。这对于“边缘计算”来说是个好消息,因为边缘计算运行在靠近基站的更小、更低功率的计算机上,这些机器对散热和功耗有着严格的限制。

总结
这篇论文证明了对于某些类型的数据——特别是随时间变化的数字流——将它们转化为图片是一个游戏规则的改变者。这不仅仅是一个酷炫的视觉技巧,更是一个实际的工程解决方案。通过使用视觉语言模型,我们可以构建出更快、更省电、且比我们多年来使用的基于文本的系统更擅长发现错误的 AI 系统。

对于技术的未来,特别是在能源珍贵且空间有限的基站等场所,这表明,与计算机交流的最佳方式可能不再是文字或数字,而是一张简单、清晰的图片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →