← 最新论文
🤖 machine learning

INAR-VL: Input-Aware Routing for Edge-Cloud Vision-Language Inference

INAR-VL 是一个轻量级边缘 - 云端路由系统,它根据输入复杂度动态选择本地或基于云端的视觉 - 语言模型,在保持接近云端精度的同时显著降低延迟和能耗。

原作者: Ahmed Šabanović, Paul Joe Maliakel, Ivona Brandić

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Šabanović, Paul Joe Maliakel, Ivona Brandić

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个智能助手,它能“看”懂图片并“读”懂文字来回答你的问题。这被称为视觉 - 语言模型(VLM)。本文介绍了一个名为INAR-VL的新系统,它就像这些助手的智能交通控制器,决定是在你的设备上(即“边缘端”)直接回答问题,还是将其发送到云端的超级计算机。

以下是用日常类比讲述的问题与解决方案的简单故事。

问题:“快但笨”与“慢但聪明”的两难困境

把你的手机或机器人的摄像头想象成一家本地修理店

  • 本地修理店(边缘端): 它就在你旁边。获取诊断结果的速度极快,运行成本(燃料)也很低。然而,那里的技师只有一套基础工具。如果你带去的只是简单问题(比如“这个轮胎瘪了吗?”),他们能瞬间修好。但如果你带去的是复杂的发动机故障或一张模糊的微小部件照片,他们可能会猜错,因为他们的工具不够强大。
  • 大师级车库(云端): 这是一个位于数英里之外、拥有尖端技术的大型设施。它拥有 imaginable 的所有工具和最好的技师。它能解决任何问题,甚至是最棘手的问题。但是,你必须把车开过去(通过互联网发送数据),这需要时间和汽油(能量)。如果路况不好(网速慢),你可能要永远等下去。

关键难点: 并非每个问题都需要大师级车库。把简单的“轮胎瘪了吗?”这类问题发给大师级车库,是浪费时间和汽油。但把复杂的“为什么这个发动机发出奇怪的声音?”这类问题交给本地修理店,可能会导致错误的答案。

当今的大多数系统就像一位固执的经理,无论问题是什么,都只说“我们只用本地修理店”或“我们只用大师级车库”。这导致要么回答缓慢,要么答案错误。

解决方案:INAR-VL(智能调度员)

作者构建了INAR-VL,这是一个智能调度员,它在回答每个问题之前审视问题,以决定最佳路径。

它是如何工作的:

  1. 快速扫描: 在将问题发送到任何地方之前,INAR-VL 会进行闪电般的快速检查(仅需几分之一秒)。它查看两件事:
    • 照片: 是模糊的吗?是暗的吗?是简单的图片还是复杂的图表?
    • 问题: 是简单的“这是什么?”还是复杂的“解释这张图表背后的推理”?
  2. 决策:
    • 如果照片清晰且问题简单,调度员会说:“在本地处理这个!” 本地修理店(边缘端)会瞬间给出答案。
    • 如果照片模糊或问题需要深度思考,调度员会说:“把这个发给大师级车库!” 云端接手以确保准确性。

“互补”团队:
该系统不仅仅拥有一个本地修理店和一个大师级车库。它拥有一支由不同专家组成的小团队。有些专家更擅长阅读文本(OCR),而另一些则更擅长逻辑推理。INAR-VL 为工作挑选合适的专家,而不仅仅是合适的地点。

结果:兼得两者之长

研究人员在数千个问题上测试了这个系统。结果如下:

  • 速度: 通过将简单问题保留在本地,与将所有内容发送到云端相比,系统的平均速度提高了 24%
  • 能耗:节省了 26% 的能源,因为它没有浪费电力来回发送数据来处理简单任务。
  • 准确性: 它没有牺牲质量。它保持了97% 的准确性,这相当于你将所有内容都发送给超级计算机所获得的准确性。
  • 分配比例: 大约**36%的请求在本地处理(节省了时间和能源),而较难的64%**被发送到云端(确保它们被正确回答)。

核心结论

INAR-VL 就像 AI 的智能交通灯。它不是强迫每辆车都走漫长的公路(云端),也不是强迫每辆车都留在社区(边缘端),而是根据目的地和交通状况进行判断。它将轻松的行程送往本地道路,并将高速公路留给重型运输。

结果如何?你得到的答案几乎和超级计算机一样聪明,但运行速度更快、成本更低,尤其是在你的互联网连接不完美时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →