← 最新论文
🤖 machine learning

Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation

本文通过将任务建模为一个成本感知型多目标多臂老虎机问题,提出了具有预算遗憾(budgeted regret)和误差概率理论保证的新颖在线选择与帕累托识别算法,并通过实验验证了其有效性,从而解决了在有限预算下评估大语言模型配置的挑战。

原作者: Bo Xue, Zhi Hong, Jiayi Li, Yuanyu Wan, Ji Cheng, Shuang Qiu

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Bo Xue, Zhi Hong, Jiayi Li, Yuanyu Wan, Ji Cheng, Shuang Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名飞船船长,但你的燃料箱非常小,而且你的地图上充满了迷雾。你需要找到前往遥远星球的最佳路线,但你不知道哪条路径最快、哪条最安全、哪条最省燃料。在人工智能的世界里,这正是工程师们在尝试调优“大语言模型”(LLMs)时会遇到的情况——这些模型是能写故事、解数学题并与我们聊天的超级智能计算机大脑。这些模型拥有数千个不同的设置,比如大脑的大小、思考的方式以及说话的速度。测试每一个设置就像试图飞向银河系中的每一颗恒星一样;这太费钱,太耗时,而且会消耗掉过多的计算机资源。

为了解决这个问题,科学家们使用了一个聪明的技巧,叫做“多臂老虎机问题”(bandit problem)。把它想象成赌场里一排老虎机。你不知道哪台机器的赔率最高,所以你必须拉动一些摇杆来猜测。但这里的转折在于:有些机器玩一次只需一分钱,而有些则要花一美元。如果你只是为了追求大奖而一直玩那些昂贵的机器,你还没找到最好的那台,就已经破产了。你还必须权衡多个目标:也许你想要一台既赔率最高又速度最快的机器。这篇论文探讨的正是一个这样的谜题:当每一次测试成本都不同时,你该如何找到最佳的 AI 设置,并且要同时平衡速度、准确性和成本?

这篇论文的作者 Bo Xue 及其团队决定将寻找完美 AI 设置的过程,视为一场有着严格预算的高风险“猜最佳路线”游戏。他们意识到,以往的方法遗漏了两个重要的线索:它们通常忽略了有些测试的成本远高于其他测试,而且它们通常只寻找一个“最佳”答案,而不是寻找一组具有不同优势且互为权衡的“足够好”的答案。因此,他们构建了两种更聪明地玩这场预算游戏的策略。

首先,他们创建了一种用于即时决策的策略,称为 CoHV-UCB。想象一下,你正带着有限的零花钱在森林中穿行。每当你停下来品尝一颗浆果时,它都会花费你不同金额的现金。有些浆果很便宜但味道一般;有些则很贵但极其美味。这个算法就像一个超级聪明的觅食者。它不仅仅看浆果有多好吃,还会计算一个“性价比”得分。它会问:“如果我把最后几枚硬币花在这颗昂贵的浆果上,它能否提供比便宜的那颗更好的‘单价美味度’?”论文从数学上证明了这种方法是非常高效的。它表明,“遗憾值”(regret)——即因为没有每次都选最完美的浆果而错失的美好滋味——增长得非常缓慢,仅随着你预算的对数增长。用通俗的话说,即使你有一个巨大的预算,这种方法也能确保你不会把钱浪费在错误的浆果上,并且它能精确到小数点后最后一位。

其次,他们构建了一种寻找“帕累托集”(Pareto Set)的策略,这是一种高级说法,意指“所有最佳权衡方案的集合”。想象一下你在买车。你不可能拥有一辆既最快、最安全又最便宜的车。你可能必须在快速且昂贵的跑车和安全且缓慢的家庭面包车之间做出选择。所谓的“帕雷托集”,就是指那些你无法在不增加成本的情况下获得更快速度,或在不降低速度的情况下获得更高安全性时,所列出的汽车清单。作者的新算法 CoPSI 就像一个快速排除劣质车的侦探。它观察目前为止测试过的车辆,识别出哪些车明显不如其他车辆,并停止测试它们,从而将预算留给那些仍在竞争中的棘手车辆。论文显示,这种方法在寻找正确的权衡列表方面表现得极其出色。如果你给予足够的预算,它出错的概率会下降得极快,以至于几乎不可能出错。这就像如果你有足够的钱去测试每一辆车,你几乎肯定能找到那份完美的选项清单。

团队不仅在纸面上提出了这些想法,还在现实世界中使用真正的“大语言模型”对其进行了测试。他们设计了实验,要求在不同的模型、提示词(prompts)和设置之间进行选择,并使用了来自数学和推理测试的真实数据。结果显而易见:他们的新方法击败了旧有的方式。当使用“性价比”策略时,他们在找到最佳 AI 设置的同时,节省了大量的资金(Token)。当使用“权衡查找器”时,相比于随机测试或忽略成本,他们能更好地识别出一组最佳选项。

简而言之,这篇论文为我们玩这场 AI 调优游戏提供了新的规则手册。它告诉我们,如果我们想在不破费的情况下找到最佳 AI 设置,我们就不能再把每一次测试都当作成本相同来对待。我们需要聪明地规划预算,平衡测试成本与我们想要实现的多个目标。作者通过研究表明,通过这样做,我们可以让 AI 开发变得更快、更便宜、更有效,确保我们不会在那些没有回报的实验上浪费宝贵的资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →