← 最新论文
🤖 AI

Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

本研究评估了将渲染后的代码图像作为仓库级编码智能体的一种 Token 压缩策略,发现虽然该策略能有效降低提示词成本并保持修复准确性,但其益处是具有条件的,且受限于底层模型的能力以及修复工作流的具体阶段。

原作者: Weijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Weijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机就像是速度极快、极其聪明的图书管理员,能够在一秒钟内阅读数百万本书。这些“AI智能体”正在接受训练,以修复大规模软件项目中的错误代码,扮演着互联网数字机械师的角色。但问题在于:如果你一次性把整个图书馆交给它们,它们会被搞得应接不暇。它们需要逐行阅读文本,而处理的文本越多,消耗的时间和金钱就越多。最近,科学家们发现了一个窍门:与其给图书管理员一整面墙的文字,不如给他们拍一张代码的照片。这就像是将一本长篇小说变成一张单一且密集的图片。这种“视觉压缩”节省了空间,但它真的能帮助图书管理员修好书,还是仅仅让图片变得模糊到无法阅读?

这个问题正是香港科技大学和字节跳动研究人员的一项新研究的核心。他们想知道,将代码转化为图像,对于试图修复软件的AI智能体来说,究竟是一个神奇的捷径,还是一个在真正面对繁重工作时会撞墙的巧妙花招。他们不仅仅是要求AI去“看”一张图片;他们还让AI置身于一个真实的场景中,必须在一个混乱的数字仓库里搜寻、找到损坏的部分、进行修复,并证明其有效。他们的研究结果表明,虽然拍摄代码的照片可以节省大量资金,但它并不会让AI变得更聪明,而且有时如果你把照片压缩得太厉害,AI就会感到困惑。

实验:从文本到像素

为了测试这一点,研究人员利用一个名为 SWE-bench Verified 的著名基准测试搭建了一个数字障碍赛道。你可以把它想象成一个巨大的、现实世界的视频游戏关卡,AI必须在真实的软件项目中修复实际的漏洞(bug)。AI智能体必须完成三个主要任务:

  1. 搜索(Search): 在庞大的代码库中找到正确的文件(就像在大海里捞针)。
  2. 编辑(Edit): 修改代码以修复漏洞。
  3. 验证(Verify): 运行测试以确保修复确实奏效,并且没有破坏其他任何东西。

研究人员比较了向AI提供“线索”的两种方式:

  • 文本方式: AI逐行阅读代码,就像人类读书一样。
  • 视觉方式: 代码被转化为一张图像(渲染出的截图),AI通过观察图片来理解代码。

他们通过不同的“压缩”程度进行了测试。想象一下拍摄一张页面的照片,你可以让照片变得更小(压缩)以节省空间。研究人员尝试不断缩小照片(压缩率分别为 1、3、5 和 7),以观察在AI停止理解代码之前,能节省多少空间。

结果:收益与挣扎并存的复杂局面

这项研究揭示了一个引人入胜且略显复杂的局面。以下是他们的发现:

1. 省钱神器(但并非万能钥匙)
将代码转化为图像确实能节省资金。研究人员发现,使用视觉表示形式能持续减少AI需要阅读的“Token”(数据单位)。在某些情况下,与阅读原始文本相比,这节省了高达 2.8 倍 的数据量。然而,这种节省并不是线性的。你可能会认为,如果将图像压缩 7 倍,就能节省 7 倍的钱。但事实并非如此。这种节省会很快触及一个“底线”。对于小块的代码,无论你如何尝试压缩,图像大小几乎不会缩小,因为图像仍需保持足够大才能被辨识。这就像试图缩小一枚邮票:最终,如果你把它缩得太小,邮票就会变得无法辨认。

2. 精度的陷阱
最重要的发现是,省钱并不会让AI变得更聪明。 无论AI是阅读文本还是观察图片,其修复漏洞的能力(准确度)基本保持不变。

  • 当AI需要从头开始完成整个工作(搜索、阅读、修复)时,视觉方法与文本方法同样有效,但成本更低。
  • 然而,如果研究人员强迫AI进行过度压缩(激进压缩),AI就开始出错。图片变得过于模糊或拥挤,导致AI无法看到修复代码所需的细节。

3. “搜索”与“修复”的问题
研究人员将AI的工作分解为两个截然不同的阶段,以观察视觉窍门究竟在哪里发挥作用:

  • 定位器(搜索者): 这部分AI负责寻找漏洞所在的位置。在这里,视觉图像非常有帮助。由于AI需要阅读大量的原始代码来寻找大海里的那根针,将这些代码转化为紧凑的图像节省了大量数据。
  • 编辑器(修复者): 一旦找到了漏洞,AI就必须实际修改代码并运行测试。在这里,视觉窍门并没有太大帮助。研究人员发现,即使AI确切知道漏洞在哪里,最难的部分仍然是修复过程中的“试错”。AI必须编辑、测试、失败、再次编辑、再次测试。这个过程充满了反复的对话和测试,而这些环节并不太能从压缩初始代码图像中获益。事实上,对于这些“修复”步骤,成本主要由测试和编辑产生,而非阅读过程。

结论:一个有用的工具,但并非万灵药

那么,编码智能体能否通过渲染后的代码来解决仓库级别的议题?可以,但有条件。

研究表明,将代码转化为图像是降低成本的一种可行策略,特别是当AI花费大量时间仅仅是在阅读和搜索海量文本时。这就像是给图书管理员看一份书籍目录的照片,而不是整本书,以此来寻找页码。这更快,也更便宜。

然而,它不是一个让AI变得无限强大的神奇解决方案。

  • 它并不能提升AI的基础智能;如果一个AI不擅长修复漏洞,那么即使它看到的是图片,它依然不擅长修复漏洞。
  • 它存在极限。如果你试图通过过度压缩图像来节省更多成本,AI就会感到困惑,准确度也会下降。
  • 它在“搜索”阶段帮助最大。一旦AI知道了问题所在,真正的难点在于修复过程(编辑和测试),而视觉压缩在这些环节中并无显著帮助。

简而言之,研究人员得出结论:视觉化代码是一个优秀的“条件性”工具。它是一种在处理阅读代码这类枯燥、繁重的任务时,聪明地节省成本的方法,但它无法取代一个能够进行实际维修工作的、聪明且细心的编辑。AI编程的未来不仅在于如何缩小输入规模,更在于知道何时该使用图片,以及何时该坚持使用文本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →