SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution
本文介绍了 SkillTV-Bench,这是一个用于评估大语言模型(LLM)智能体中技能感知轨迹验证能力的全面基准测试,以及 SkillTV-Evolve,一种通过优化可复用评判技能来显著提高验证准确率和轨迹选择成功率的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机不仅仅是在与你聊天,而是能真正“做事”的世界。它们可以打开文件、编写代码、浏览网页,甚至控制机器人来解决复杂的、多步骤的问题。这些被称为“AI智能体”(AI Agents)。但棘手之处在于:当一个AI智能体尝试修复一个损坏的网站或规划一次旅行时,它不会只给你一个最终答案。它会经历一段漫长的旅程,进行数百次微小的移动、调用工具,并在过程中不断检查自己的工作。
核心问题在于:我们如何知道这个AI是否真的做得很好?在过去,我们只看最终结果。如果网站看起来修好了,我们就说“做得好!”但如果AI是通过走捷径才达成的,或者它修错了地方并在此过程中弄坏了其他东西呢?我们需要一种方法来观察整个旅程,而不仅仅是终点线。这就是“评委”(Judges)登场的地方——经过专门训练、用于审查智能体工作的特殊AI系统。但目前的评委正面临困境。它们经常被华丽的最终答案所迷惑,从而忽略了过程中发生的隐藏错误,尤其是当智能体正在使用特殊的“技能”(例如一套预设程序的技巧工具箱)来完成任务时。
这篇论文介绍了一种测试和训练这些评委的新方法。研究人员创建了一个巨大的游乐场,叫做 SkillTV-Bench,它就像一场大规模的电视马拉松,包含681集不同的AI智能体尝试解决现实世界任务的“剧集”,涵盖了从网络安全到烹饪的11个不同领域。转折点在于,评委们不仅仅是在“看视频”;它们还被赋予了智能体的“技能手册”,并可以访问智能体创建的实际文件和日志。这让它们能够准确看到智能体本该做什么,并检查其是否遵守了规则。
团队发现,即使是目前最聪明的评委也会被难住。它们经常对那些表面看起来不错但实际上任务失败的智能体给出“通过”的评价。为了解决这个问题,作者构建了一个名为 SkillTV-Evolve 的系统。把它想象成评委的“教练”。评委不再只是凭直觉猜测,而是被赋予了一个动态清单(称为“JudgeSkill”),这个清单明确告诉它要观察什么、去哪里观察,以及什么样的证据能证明智能体成功或失败。如果评委犯了错,系统会自动重写清单,以防止下次再犯同样的错误。
结果令人印象深刻。通过使用这种进化的清单,评委的准确率提升了近15个百分点。但真正的魔力发生在他们利用这个更优秀的评委从一组AI智能体中挑选出最佳尝试时。想象一下,一个AI尝试解一个谜题10次,并产生了10个不同的尝试。一个糟糕的评委可能会选出一个“伪成功”,但这个新的、具备技能感知能力的评委却能识别出那唯一一次“真成功”。有了这个更好的评委,在观察10次尝试时,团队能够成功选出有效方案的概率为45.5%,而使用单次尝试或较弱的评委时,该概率仅为22.9%。
简而言之,这篇论文表明,要信任AI智能体,我们需要能够通过查看整个相册(而非仅仅看最后一张照片),并利用智能体自身的说明书来识破伪装的评委。通过给这些评委一个能从错误中学习的更好“规则手册”,我们可以让AI在执行复杂的现实世界任务时变得更加可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。