Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
本文通过纠正五个关键混淆变量,引入了一个用于衡量工具使用型智能体跨语言策略保留能力的严谨框架,揭示了前沿模型通过将非英语任务路由至英语来结构化地保留了 71–73% 的动作策略,而较小的模型则表现出崩溃现象,且观察到的失败可能是由痕迹提取正则表达式而非模型本身的局限性所人为制造的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
数字助手的隐形旅程
想象你拥有一个超级聪明的数字助手,就像一个住在电脑里的个人机器人。它的工作是通过一系列步骤来解决问题:它可能会查找信息、进行数学计算,或者翻译一个句子,最后才给你一个最终答案。这就是现代“AI智能体”(AI agents)的工作方式;它们不仅仅是猜测答案,而是构建一条通往答案的路径。
长期以来,科学家们通过用不同的语言(比如英语和印地语)向这些助手提问来进行测试。如果助手在两种语言下都能给出正确答案,大家就会感到很满意。这就像是在评价一名学生时,只看他们数学考试是否得到了正确的数字,而不去看他们是如何解题的。但如果这个学生在做英语题时是用画图的方式,而在做印地语题时却是写一篇长文呢?他们得到了同样的成绩,但使用的解题方法却完全不同。
这篇论文提出了一个重大问题:当一个AI智能体切换语言时,它是否会改变其“路线”或完成任务所采取的步骤?事实证明,步骤非常重要。路线决定了计算机要花费多少钱、运行速度有多快,以及如果出错会发生什么。如果AI在印地语中的路径与英语不同,它可能会产生更高的成本,或者以一种安全规则未能捕捉到的方式导致失败。因此,研究人员决定不再仅仅观察最终答案,而是开始观察整个旅程。
伟大的语言绕道
研究人员着手调查这些AI智能体是真的精通双语,还是仅仅在装模作样。他们选取了八个不同的AI模型,并在41种不同的语言中给它们布置了相同的任务。他们并没有只检查最终结果,而是记录了AI采取的每一个步骤——即“轨迹”(trace)——就像GPS追踪汽车的行驶路径一样。他们想知道:如果我用英语要求AI“查找天气并计算费用”,然后再用印地语要求完全相同的事情,它会采取完全相同的步骤吗?
答案是一个坚定的“不”,但结果并非如你所预期的那样。AI不仅仅是走了一条稍微不同的路,它是在进行一次大规模的绕道。研究人员发现,当语言改变时,AI的行为也会发生显著变化。事实上,当观察最先进的模型时,它们在切换语言后仅保留了原始逐步计划中的约 71% 到 73%。这意味着,大约有 27% 到 29% 的时间里,AI仅仅因为语言的不同而做了完全不同的事情。
“英语枢纽”的秘密
为什么会发生这种情况?团队发现了AI智能体养成的一个隐藏习惯。事实证明,即使你用印地语、泰米尔语或任何其他语言向AI提问,它通常会在其“大脑”中先偷偷地将整个问题翻译成英语。然后,它用英语解决问题,最后再将答案翻译回来。
研究人员将此称为“英语枢纽”(English pivot)。为了证明这一点,他们尝试强制让AI停止这种行为。他们告诉AI:“请用你正在使用的语言思考,不要翻译成英语!”但AI并没有听从指令。在测试的两个模型中,AI遵循“用任务语言思考”这一指令的比例还不到 1%。由于AI几乎从未真正做到言行一致,研究人员无法测试用另一种语言思考是否会改变其步骤。然而,这一结果确立了一个更强大的事实:“英语枢纽”不仅仅是一个可以通过简单提示词就能关闭的偏好;它是一种根深蒂固的行为,模型在面对直接指令时实际上会忽略它。这就像一位旅行者,无论去到哪个国家,都坚持要在和任何人交谈前先找翻译,无论导游如何叮嘱。这种习惯如此强烈,以至于它成为了AI步骤随语言变化而改变的主要原因。
捷径陷阱
论文还揭示了一个差点误导所有人的有趣错误。在衡量这些AI智能体的表现时,一些研究人员使用了一个简单的计算机程序来读取AI的步骤。其中一个程序非常严苛,如果AI写的是像“我将使用计算器”这样的句子,而不是特定的代码格式,该程序就会认为AI失败了。
因此,一个能力非常出色的AI模型看起来失败了 76% 的时间。但当研究人员将计算机程序修改得更具灵活性后,该AI的“成功率”竟然跃升了 26倍!这教会了研究人员,有时看起来像是语言问题的问题,实际上只是我们读取AI“手写字迹”的方式出了问题。
大小决定规则
最后,团队研究了更大的AI模型是否在处理此类问题上表现更好。他们发现了一个奇怪的规则:最大、最强大的模型表现得非常相似,都保持着 71–73% 的一致性。但较小的模型则显得一团糟。有些小模型看起来表现很好,但事实证明它们只是因为采取了非常短且简单的路径,从而通过偶然性获得了高匹配度。一旦研究人员修正了这种运气成分,这些小模型的表现就不再那么令人印象深刻了。看来,只有那些非常庞大、强大的模型才建立了一套一致的行为模式,而较小的模型仍在摸索之中。
这为何重要
这项研究改变了我们测试AI的方式。它表明,得到正确答案是不够的。如果一个AI仅仅因为你使用了不同的语言,就采取了不同的、更昂贵或更具风险的路径,那这就是一个问题。研究人员表明,这些智能体并不是真正精通语言的操作,它们仍然依赖于一个隐藏的英语支柱。在我们解决这个问题之前,一个AI在英语中可能是可靠的,但在其他语言中却可能不可靠——这并不是因为它“笨”,而是因为它正沿着一条不同的、未被监测的道路前往同一个目的地。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。