← 最新论文
💬 NLP

Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents

该论文通过大规模实验发现不同推理范式在不同任务上表现差异显著,因此提出了一种基于轻量级路由器的“先选后解”方法,通过为每个任务动态选择最优推理范式,显著提升了 LLM 代理的平均性能并弥补了与理想选择之间的差距。

原作者: Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin, Li Kang, Xiufeng Song, Rui Li, Songtao Huang, Ao Yu, Yuchen Fan, Yanxu Chen, Kaixin Xu, Xiaohong Liu, Yiran Qin, Philip Torr, Chen Zhang, Zh
发布于 2026-04-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin, Li Kang, Xiufeng Song, Rui Li, Songtao Huang, Ao Yu, Yuchen Fan, Yanxu Chen, Kaixin Xu, Xiaohong Liu, Yiran Qin, Philip Torr, Chen Zhang, Zhenfei Yin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)这个“超级大脑”做一场**“最佳工作模式”的大体检**。

想象一下,你有一个非常聪明但性格多变的助手(大语言模型)。当你给他布置任务时,你可以用不同的“管理方式”来指挥他:

  • 直接派(Direct): “别废话,直接给我答案。”
  • 思考派(CoT): “先一步步把思考过程写下来,再给答案。”
  • 行动派(ReAct): “边想边做,遇到不懂的去查资料、用工具。”
  • 规划派(Plan-Execute): “先列个详细计划,再按步骤执行。”
  • 反思派(Reflection): “做完后自己检查一遍,错了就改。”
  • 代码派(ReCode): “别光动嘴,写个程序跑一下算出结果。”

过去,大家总觉得某种方式(比如“思考派”)是万能的,越复杂越好。但这篇论文通过大规模实验发现了一个惊人的事实:没有一种“管理方式”是放之四海而皆准的。

🌟 核心发现:尺有所短,寸有所长

作者让四个最顶尖的模型(GPT-5, Gemini, Qwen 等)在十个不同的考试(比如写代码、做数学题、查资料、回答常识)中,分别用这六种方式答题,跑了近 1.8 万次。结果发现:

  1. 有的任务,越复杂越容易翻车:

    • 比如写代码(HumanEval 测试),如果让模型先“一步步思考”(CoT),它反而容易把代码写错,准确率比“直接给答案”低了 15 个百分点。就像让一个熟练的厨师在切菜前先写一万字的操作说明书,反而手忙脚乱切到了手。
    • 比如查资料(GAIA 测试),如果只让模型“直接回答”,它只能靠记忆瞎编;但如果用“行动派”(ReAct),让它去网上搜索,准确率直接飙升了 44 个百分点。这就像去图书馆找书,直接问管理员(行动派)比靠脑子硬想(直接派)靠谱得多。
  2. “全能冠军”不存在:

    • 在数学题上,代码派是王者;在常识问答上,直接派就够用;在需要查资料的复杂问题上,行动派无敌。
    • 如果你强行只用一种方式(比如只用“行动派”)去解决所有问题,就像拿着锤子去修所有东西,修电脑时可能把屏幕砸了,修钟表时又够不着螺丝。

🚀 解决方案:智能调度员(Select-then-Solve)

既然没有一种方法能通吃,那怎么办?作者提出了一个聪明的办法:“先选后做”(Select-then-Solve)

想象一下,你有一个超级智能的调度员(Router)

  • 当任务来了,调度员先快速看一眼题目。
  • 如果是写代码,调度员说:“别想太多,直接上代码模式!”
  • 如果是查新闻,调度员说:“快,启动搜索模式!”
  • 如果是简单的常识题,调度员说:“直接回答,别浪费算力。”

这个调度员有多强?

  • 它不需要模型自己变聪明,它只是一个轻量级的“小助手”(基于文本特征判断)。
  • 实验证明,用了这个调度员后,模型的平均成绩从 47.6% 提升到了 53.1%
  • 更重要的是,它比“永远只用最好的那一种固定模式”还要高出 2.8%
  • 它甚至能帮模型找回 37% 的“理论最高分”差距(Oracle Gap)。

⚠️ 一个有趣的反面教材:模型自己选行吗?

作者还测试了让模型**“自己选”**(Self-routing),即让模型自己决定:“哎呀,这道题我觉得该用搜索模式。”

  • 结果很惨: 只有最强的 GPT-5 稍微能选对一点,其他稍微弱一点的模型(如 Qwen)完全选错了。它们倾向于无脑使用复杂的工具模式,哪怕题目很简单,它们也要去“搜索”或“写代码”,结果反而把简单题搞砸了。
  • 这说明:“知道怎么做”和“知道什么时候该用什么方法”是两回事。 让模型自己选,就像让一个刚学会开车的新手自己决定什么时候该开赛车、什么时候该开拖拉机,大概率会翻车。

💡 总结与启示

这篇论文告诉我们一个朴素的道理:大模型的未来,不在于把模型本身造得越来越“全能”,而在于学会“因材施教”。

  • 以前: 我们试图给所有任务都套上最复杂的“思考框架”,结果既费钱(消耗大量算力)又容易出错。
  • 以后: 我们应该给模型配一个聪明的“调度员”。这个调度员能一眼看出任务类型,然后按需分配:简单的直接做,难的用工具,复杂的写代码。

一句话总结:
最好的 AI 代理,不是那个脑子里塞满了各种复杂思考框架的“全能选手”,而是那个知道什么时候该“大显身手”,什么时候该“低调直接”的聪明管家

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →