← 最新论文
💬 NLP

Routesplain: Towards Faithful and Intervenable Routing for Software-related Tasks

Routesplain 是首个面向软件相关任务的可解释 LLM 路由,它通过从查询中提取人类可理解的概念来做出忠实的路由决策,在准确性和成本方面均优于单个模型和黑盒基准模型,并实现了概念层面的干预。

原作者: Adam Štorek, Vikas Upadhyay, Marianne Menglin Liu, Daniel W. Peterson, Anshul Mittal, Sujeeth Bharadwaj, Fahad Shah, Sujith Ravi, Dan Roth

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Adam Štorek, Vikas Upadhyay, Marianne Menglin Liu, Daniel W. Peterson, Anshul Mittal, Sujeeth Bharadwaj, Fahad Shah, Sujith Ravi, Dan Roth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走进一座宏伟的、充满未来感的图书馆,成千上万种不同的机器人正等着回答你的问题。有些机器人是天才,能解决复杂的数学难题,但雇佣它们的代价极其昂贵。另一些则是动作敏捷、价格低廉的工人,擅长写简单的故事,但在面对棘手的谜题时可能会感到困惑。在人工智能的世界里,这些机器人被称为“大语言模型”(LLMs)。它们是今天我们使用的聊天机器人和代码辅助工具背后的引擎。但问题在于:并非每个机器人都擅长所有的工作。有时候,你不需要一个天才,你只需要一个快速、实惠的工人。科学家们正在思考的一个核心问题是:如何在不浪费金钱或得到错误答案的前提下,为你的特定任务挑选出最合适的机器人?

这就是“路由”(routing)的概念。把路由想象成一位聪明的图书管理员,她会倾听你的问题,弄清楚你究竟需要哪种帮助,然后指引你找到图书馆里最完美的那个机器人。长期以来,这些图书管理员都是“黑盒”。它们根据无人能见、也无法理解的复杂数学逻辑来做决定。如果图书管理员把你送到了错误的机器人那里,你根本不知道原因,也无法进行修复。这篇新论文介绍了一种全新的图书管理员,它与众不同:它不仅会进行猜测,还会用通俗易懂的语言在做出选择前解释自己的思考过程。


认识 Routesplain:会解释其选择的图书管理员

这篇论文的作者们与哥伦比亚大学和 Oracle AI 的研究人员合作,开发了一个名为 Routesplain 的新系统。他们的目标是解决一个非常具体的问题:如何将软件相关的任务(例如“修复这段破碎的代码”或“用 Python 写一个程序”)路由到最合适的 AI 模型,同时在节省成本的同时确保答案的正确性。

Routesplain 并没有使用神秘的黑盒来决定使用哪个 AI,而是像一名侦探一样,将每个问题分解为简单、易懂的线索。他们称这些线索为“概念”(concepts)。当你提出一个问题时,Routesplain 不仅仅是在看单词,它还会问自己几个特定的问题:

  • 任务是什么?(是在编写代码、修复漏洞,还是回答科学问题?)
  • 涉及哪种语言?(是 Python、Rust,还是某种特定的自然语言,比如西班牙语?)
  • 难度如何?(这是一个简单的请求,还是一个超级复杂的谜题?)
  • 领域是什么?(是关于网络、时间,还是通用数学?)

一旦 Routesplain 识别出这些概念,它就会使用第二个步骤来决定哪个 AI 模型是最合适的匹配。这就像是在说:“哦,这是一个棘手的 Rust 编程问题,所以我们应该把它交给 Rust 专家机器人,而不是那个便宜的通用型机器人。”

为什么这很重要:“黑盒”问题
在此之前,大多数选择 AI 模型的系统都像是一个“魔力 8 号球”。你提出问题,它给出答案,但你看不见其中的逻辑。作者认为,这是很糟糕的,因为如果系统犯了错,你无法进行修复。Routesplain 与之不同,它是可解释的。它会向你展示它用来做决策的概念。如果你认为系统误判了任务的难度,你完全可以介入并说:“等等,这并不难,这很简单,”然后系统会立即改变主意,选择另一个更便宜的机器人。这被称为干预(intervention),它是一个游戏规则的改变者,因为它让把控制权交还给了人类。

大考:16 个机器人,8 个任务
为了测试他们的想法是否奏效,研究人员设计了一场大规模测试。他们收集了 16 个最先进的 AI 模型(包括 GPT-4.1、o3 和 Llama 4 等知名模型),并在 8 种不同类型的软件任务上对其进行了测试。这些任务涵盖了从编写代码、修复损坏程序到用 29 种不同语言回答计算机科学问题的各种内容。

他们发现了一个令人惊讶的事实:不同的模型在不同的工作上表现迥异。

  • 有些模型擅长修复代码,但在编写代码方面表现糟糕。
  • 有些模型在英语方面表现出色,但在处理像印地语或沃洛夫语(Wolof)这样的语言时却很吃力。
  • 有些模型极其昂贵,但在处理简单任务时,表现仅比便宜的模型稍好一点。

正因为这些差异,仅仅为所有任务都选择“最聪明”的模型是一种浪费。有时,一个便宜的模型实际上才是更好的选择。

结果:更聪明,也更便宜
当他们对 Routesplain 进行测试时,它表现得令人惊叹。它的表现与最先进的“黑盒”路由系统不相上下(那些系统难以理解),但它在节省成本方面做得更好。

  • 准确度: Routesplain 的性能与最好的黑盒路由系统旗鼓相当。
  • 成本: 通过将问题路由到正确的模型,它节省了大量资金。例如,它可以获得比仅使用单一模型高出 8.5 个百分点的准确度,同时减少 39% 的开支。
  • 瓶颈: 研究人员还利用他们的“可解释”系统找出了问题出在哪里。他们发现,系统犯下的最大错误是猜测任务的复杂度。如果系统认为一个任务很容易,而实际上它很难,它就会选择一个便宜的模型并得到一个错误的答案。这告诉了未来的工程师们明确的改进方向:让“复杂度检测器”变得更聪明。

总结
论文表明,我们不需要依赖神秘、不可解释的 AI 来做决策。通过将问题分解为“语言”、“领域”和“难度”等简单、人类可读的概念,我们可以构建出不仅准确,而且公平、透明且可编辑的路由系统。

作者展示了我们可以鱼与熊掌兼得:我们既能获得最聪明 AI 模型的高性能,又能享受更便宜模型的低成本,同时还能完全明白决策背后的原因。这就像拥有一位不仅能指引你找书,还能告诉你:“我选这本书是因为你想要一本悬疑小说,而这是图书馆里最好的悬疑小说,”如果你说,“不,其实我想看言情小说,”图书管理员会立刻为你更换书籍,而无需你离开房间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →