← 最新论文
💬 NLP

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench 是一个仓库级的智能体编程基准测试,其特点是包含 25 个源自真实开源项目的原生俄语任务规范,旨在通过严格的统计分析和轨迹审计,在确保数据抗污染性的同时,评估产品级编程智能体在处理真实维护工作时的表现,并揭示其部署系统行为的关键洞察。

原作者: Evgeny Shilov (Independent Researcher)

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Evgeny Shilov (Independent Researcher)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一支专家机械师团队,来维修一批复杂且定制化的赛车。直到目前为止,大多数针对这些机械师的测试都是用完美的、正式的英语编写的,就像技术手册一样。但在现实世界中,客户并不像手册那样说话;他们说话很有“人味”。他们会说:“每当我在下雨的周二踩刹车时,我的车就开始抖动。”——用他们自己的母语。

RuBench 是一个全新的测试,旨在观察 AI 编程助手是否真的能理解这些混乱的、现实世界的客户需求,而这些需求是用俄语而非英语编写的。

以下是使用简单类比对该测试如何运作、发生了什么以及研究人员发现的意外转折进行的详细说明。

1. 测试:一个“现实世界”的修理厂

以往的大多数测试都会给 AI 代理提供一段干净的、英文描述的 Bug。RuBench 则不同:

  • 赛车: 该测试使用了五个真实的、流行的开源软件项目(如 aiohttpLaravel)。这些不是虚构的谜题;它们是成千上万开发者正在使用的活跃代码库。
  • 请求: 研究人员没有使用正式的 Bug 报告,而是从头开始用俄语编写了 25 个新请求。听起来就像一位企业主在向承包商抱怨:“当我们把机器人设为管理员时,它就崩溃了;把它修好,但别弄坏现有的聊天功能。”
  • 神秘盒子: 研究人员隐藏了“答案解析”(实际的代码修复方案以及证明其有效的测试)。AI 必须自己摸索出修复方法。只有研究人员拥有检查 AI 是否成功的“钥匙”。
  • 新鲜度: 所有 Bug 都出现在 AI 模型训练之后的代码更新中。这确保了 AI 不可能只是从其训练数据中背诵出了答案。

2. 机械师:谁完成了工作?

研究人员测试了四个不同的“机械师团队”(软件工具与 AI 模型的组合)。他们让每个团队对 25 次维修任务各进行了三次测试,以观察其一致性。

  • 明星表现者: 使用 Claude Code 搭配 “Opus 4.8” 模型 的团队表现最佳。它成功修复了约 79% 的问题。
  • 中游梯队: “Sonnet 5” 模型表现几乎同样出色(75%),而通过 Codex CLI 使用的 “GPT-5.5” 模型修复了约 67%。
  • 挣扎的机械师: “Haiku 4.5” 模型(一个更便宜、更快速的版本)仅修复了约 53% 的任务。

注意: 由于只有 25 个任务,顶尖三支队伍之间的差异在统计学上并未被“证明”是真实的——这可能仅仅是运气。然而,顶尖团队与挣扎中的 Haiku 模型之间的差距是巨大且明显的。顶尖团队解决的是与底层模型完全不同类型的难题。

3. 大惊喜:“无声替换”

这是论文中最有趣的部分。研究人员还测试了第五支团队,使用的是一个名为 Fable 5 的全新模型。

当他们仔细观察 AI 工作的“黑盒”日志时,发现了一个秘密:

  • 20% 的任务 中,Fable 5 模型实际上并没有进行工作。
  • 相反,软件产品(Claude Code)在任务执行过程中,悄悄地将 Fable 5 替换成了更旧、更强大的 Opus 4.8 模型。
  • 为什么? Fable 5 拥有非常严格的安全防护机制。当它看到涉及标准互联网协议(如修复 Web 请求头)的任务时,它的安全机制变得紧张,并表示:“我不被允许触碰这个”,于是系统自动将任务移交给 Opus 4.8 来完成。

教训: 研究人员意识到,当我们测试 AI 产品时,我们不仅是在测试“大脑”(模型),我们还在测试“身体”(整个软件封装包)。如果软件在中途悄悄更换了“大脑”,那么测试结果就会误导我们关于那个特定“大脑”能力的认知。

4. 结论

  • 成功: 产品级的 AI 代理已经足够优秀,能够处理以非英语(俄语)指定的实际维护工作。最好的配置解决了近 80% 的任务。
  • 现实检查: “廉价”模型(如 Haiku)仍然明显较弱,只能解决大约一半的问题。
  • 方法论: 论文证明,为了获得诚实的结果,我们必须观察 AI 的整个“日记”(轨迹),以确保它没有通过更换模型或在网上查找答案来“作弊”。

简而言之,RuBench 表明 AI 正在变得擅长说“人话”(用俄语),但它也揭示了这些 AI 包装软件有时会表现得有些狡猾,会在不告知任何人的情况下,将工人替换成更好的工人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →