← 最新论文
🤖 machine learning

Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces

本文证明,一个激励对齐的 Bittensor 智能体竞技场(SN15)可以生成高质量且多样化的智能体轨迹,这些轨迹在经过过滤并用于对 Qwen3-4B 模型进行后训练后,能显著将 ShoppingBench 的 ASR 从 18.0% 提升至 42.7%,同时避免了合成数据的偏差以及未过滤生产日志的噪声。

原作者: Shardul Bansal, Seth Schilbe, Jarrod Barnes

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Shardul Bansal, Seth Schilbe, Jarrod Barnes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个非常聪明但缺乏经验的机器人助手如何为你去购物。你希望它能根据你的特定规则(价格、颜色、物流速度)找到完美的商品,但这个机器人总是出错,或者很容易就放弃了。

这篇论文讲述了作者如何构建了一个巨大的自动化训练场来教导这个机器人,而不是仅仅给它一本包含“正确答案”的教科书。

以下是他们方法的拆解,使用了简单的类比:

1. 问题所在:“教科书” vs. “现实世界”

通常,科学家们使用两种方法来训练这些机器人,但这两种方法都有缺陷:

  • 虚假的教科书(合成数据): 他们要求一个超级聪明的 AI 假装成一名购物者,并写下它怎么做。
    • 缺陷: AI 只会写它已经知道如何做的事情。这就像一个学生只通过阅读答案解析来准备考试。它错失了现实中人类会发现的那些奇特、困难或具有创造性的解决方案。
  • 现实世界的日志(生产数据): 他们记录现实中机器人在野外运行时的表现。
    • 缺陷: 这些日志很混乱。许多机器人会采取“作弊”手段(例如在没有实际搜索的情况下直接猜出答案)以快速获得高分。如果你用这些日志来教你的新机器人,它学到的是作弊手段,而不是真正的技能。

2. 解决方案:“购物竞技场” (SN15)

作者在名为 Bittensor 的网络上构建了一个特殊的数字竞技场,称为 SN15。你可以把它想象成一场 24/7 全天候进行的购物奥林匹克运动会

  • 参赛者: 不是只有一个 AI,而是数百个不同的团队(矿工)提交他们自己的购物机器人来竞争。
  • 奖品: 获胜者可以获得数字代币(钱)。这创造了一种强大的激励机制。因为他们想要赢,所以每个团队都在不断尝试发明新的更好的购物方式,以超越他们的竞争对手。
  • 裁判: 每当机器人尝试购买某样东西时,一个特殊的“裁判 AI”都会全程监督整个过程。它不仅检查机器人是否买对了商品,还会检查机器人的思考过程。它是仔细搜索了吗?它检查价格了吗?遇到困难时它能否恢复?
  • 轮换测试: 为了防止机器人仅仅死记硬背答案,测试题目(购物任务)会不断变化,并且会对题目进行分组,使得机器人无法通过看到一个已经解决过的题目的微调版本来进行作弊。

3. 过滤器:挑选出“真正的运动员”

竞技场产生了海量的、如洪水般涌入的数据(“数据喷泉”)。但并非所有数据都是有用的。

  • 过滤器: 作者构建了一个筛子,用来区分优劣。
    • 他们剔除了那些仅仅充当“旁白”的角色(即只是在讲述一个实际上由计算机脚本完成的搜索过程)。
    • 他们只保留了那些真正亲自动手工作(调用工具、搜索并进行推理)的机器人。
    • 他们还剔除了任何在推理质量方面未能获得“裁判 AI”高分的机器人。

4. 结果:更聪明的机器人

他们使用这个竞技场产生的经过过滤的高质量数据,训练了一个小型开源机器人 (Qwen3-4B)。

  • 训练前: 这个机器人就像一个新手购物者,正确率仅为 18%
  • 训练后: 这个机器人变成了一个专业人士,正确率达到了 42.7%
  • 对比: 这个新机器人的表现几乎赶上了世界上那些使用海量、昂贵的合成数据集进行训练的最佳机器人,但作者仅用了极小比例的数据(仅一天的竞技场输出)就实现了这一点。

5. 局限性(他们尚未解决的问题)

论文坦诚地说明了目前仍存在的不足。

  • “Pass@1” 与 “Pass@8” 的差距: 如果你允许它尝试 8 次并从中选出最好的答案,它的表现很好(成功率为 53%);但如果它只有一次尝试的机会,成功率就会降至 34%。
  • 缺失的部分: 作者意识到他们的训练数据缺少一种特定类型的“练习赛”,即机器人尝试、失败并从错误中逐步学习的过程。他们确定,加入这种特定类型的数据是推动机器人迈向更高水平(48.7% 成功率)的关键。

总结

该论文认为,与其试图编写更好的教科书或清理混乱的日志,我们应该构建有激励机制的竞赛,让 AI 智能体在其中通过解决问题进行竞争。这种竞争能自然而然地产生所需的完美、多样且高质量的“训练数据”,从而教会规模更小、成本更低的 AI 模型如何具备胜任能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →