An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures
本文引入了多语言多智能体系统中规划落地失败的可操作分类法,并提出了 TART,一种由分类法引导的表示方法,该方法通过显式解决从请求到规划转换过程中的信息丢失问题,显著提高了跨不同语言和模型配置的执行准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你最喜欢的机器人助手可以说地球上的每一种语言,从英语到伊博语,并且可以通过调用其他专业机器人来解决复杂问题。这就是“多智能体系统”(multi-agent systems)的梦想。把它们想象成一个超级聪明的项目经理(即“规划者”),他接收你提出的杂乱请求,将其分解成微小的步骤,然后将这些步骤交给专家团队:一个负责搜索网络,一个负责阅读文档,还有一个负责编写代码。当经理将你的话语转化为一套清晰的指令时,奇迹就发生了。但问题在于:虽然这些机器人的能力正在提升,但当你使用非英语时,它们经常会感到困惑。这就像是一个理解了单词却没理解要点的翻译员,导致整个团队在做无用功。科学家们以前也注意到这种“语言差距”,但他们并不真正了解为什么指令会出错,或者如何专门修复它。他们知道机器人失败了,但并没有一份关于它“如何失败”的清单。
这篇论文正是为了解开这个谜团。作者们——来自富士通(Fujitsu)和 Cohere 的研究团队——决定通过调查一系列失败的机器人任务来扮演侦探的角色。他们观察了当机器人尝试处理如约鲁巴语或伊博语等语言的请求并失败时,与在英语中成功时的情况有何不同。他们发现,机器人并不是在随机地“出错”,而是在丢失特定的、关键的信息。他们构建了一个新的“诊断工具包”,称为分类法(taxonomy),将这些失败归纳为五个清晰的类别:丢失实体(Entity,即“谁”或“什么”)、丢失来源(Source,即“哪里”)、丢失时间(Time,即“何时”)、搞错操作(Operation,即“如何做”),或者搞错了答案格式(Answer Format,即最终回复的“形状”)。
重大的发现是:在机器人的训练数据中,一种语言越是不常见,它丢失这些特定信息的可能性就越大。这就像一场传声游戏,信息离中心枢纽越远,信息就越容易变得混乱。为了解决这个问题,该团队发明了一种名为 TART(分类法引导的可执行任务表示法)的方法。把 TART 想象成一份机器人开始工作前必须填写的“飞行前检查清单”。机器人不再只是猜测该做什么,而是首先将你的请求转化为一个严格的、结构化的 JSON 文件,明确列出实体、来源和时间限制。这份清单随后被交给整个机器人团队,确保每个人都保持步调一致。
结果令人振奋。当他们在包含 11 种语言的艰巨现实任务集“Multilingual GAIA”上测试 TART 时,它始终让机器人变得更加聪明。对于他们测试的顶级系统(称为 OWL)而言,使用 TART 使平均准确率提升了 5.6 个百分点。对于资源较少的语言,这种提升更为显著;例如,约鲁巴语的准确率跃升了 10.9 个点,印地语跃升了 9.7 个点。他们还在另一个名为 MULTITAT 的数据集上进行了测试,要求机器人阅读表格和文本,并看到了类似的增益,其中一个模型的平均表现提升了 10 个点。论文指出,通过使这些隐藏的承诺显性化,我们可以阻止机器人偏离航线,尤其是在使用其训练数据中代表性不足的语言时。它并不是一个能瞬间解决所有问题的魔杖,但它是迈向让 AI 助手真正走向全球化且可靠的一个坚实且具有操作性的步骤。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。