Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization
本文介绍了 Omni-Persona,这是首个用于全模态个性化(omnimodal personalization)的综合基准测试,它通过一种新颖的校准准确度(Calibrated Accuracy)指标统一了文本、图像和音频的评估,揭示了当前模型在接地能力(grounding abilities)方面的关键缺陷,以及现有后训练方法(如 SFT 和 RLVR)的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的数字助手,它能同时看到照片、听到声音并阅读文本。这就是“全模态”(omnimodal)AI的世界,即一个单一的大脑试图通过眼睛、耳朵和语言同时理解世界。但有一个棘手的部分:让这个助手真正具有“个性化”。你希望它能从人群中认出你的脸,能从陌生人中辨别出你的声音,并记住你最喜欢的各种故事。然而,现实生活是混乱的。有时你问:“那个人是谁?”而那个人甚至根本不在记忆库里。一个真正聪明的助手不应该只是瞎猜;它应该知道何时说:“我不知道。”
长期以来,研究人员主要在图片和文字上测试这些助手,忽略了声音部分。而且,他们大多在完美、洁净的房间里进行测试,那里保证答案就在现场。这篇论文介绍了一种新的、更严苛的测试,叫做 Omni-Persona。把它想象成一次针对“个性化AI”的“压力测试”。它不仅仅是在问:“它答对了吗?”(这就像检查一个学生是否背下了教科书),它还在问:“它知道什么时候不该回答吗?”它检查AI是否能够处理现实世界的噪音——即当你询问的人完全不在记忆库中时的情况。
研究人员构建了一个巨大的游乐场,包含大约 750个不同的场景,以观察当前的AI模型如何处理这些情况。他们创建了一个名为 Persona Modality Graph(人格模态图)的系统,这就像一个巨大的连接网络。记忆中的每一个人都是一个节点,带有三条线索:一张照片、一段语音和一份文字简介。当你提问时,AI必须在网络中找到正确的线索并拉出正确的线头。该测试包括四种主要的挑战类型:将脸部与脸部匹配、将声音与声音匹配、将文字线索与文字简介匹配,以及最难的一种——利用文字线索根据声音或照片找到一个人。至关重要的是,大约有一半的问题是“陷阱题”,即你所询问的人根本不在记忆库中。目标是看AI能否自信地表达“我无法做出判断”,而不是编造一个故事。
团队将几个著名的AI模型投入到了这场考验中,其中包括来自大型科技公司的模型和一些开源模型。他们发现了一些令人惊讶的事情。首先,AI模型识别脸部的能力远高于识别声音的能力。这就像它们有着敏锐的眼睛但耳朵却很模糊;它们能轻松识别人脸,但在面对声音(即使声音是唯一的线索)时却经常感到困惑。其次,仅仅通过扩大AI的规模(增加更多的“脑力”或参数)并不总能让它在个性化方面变得更聪明。事实上,一些规模最大的模型在“知道何时保持沉默”方面表现最差,在答案不存在时经常产生“幻觉”(即编造事实)。
研究人员还测试了两种让模型变得更好的训练方法。第一种方法叫做 SFT(监督微调),就像给AI一叠写有正确答案的闪卡。研究人员尝试给了它1,000张和10,000张卡片,但AI在处理这些棘手的“缺失人员”问题时并没有变得更好。这似乎表明,仅仅通过记忆更多的例子并不能教会AI如何处理不确定性。
第二种方法是 RLVR(带有可验证奖励的强化学习),这更像是一款电子游戏。AI尝试回答问题,如果答对了就得分,如果猜错了就扣分。研究人员发现,这种方法让AI在人确实存在时能更好地找到正确答案。然而,这产生了一个副作用:AI变得过于渴望玩这个游戏。即使在不知道答案的情况下,它也会为了得分而进行猜测。这使得它在“校准准确度”(calibrated accuracy)——一个形容“既要答对,又要知道何时停止”的专业术语——方面的得分变差。论文指出,虽然这种游戏化的训练有助于AI寻找事物,但它需要一套更好的规则手册来教它何时说“我不知道”。
最后,作者得出结论,我们距离完美的个性化AI还有很长的路要走。目前的模型在面对摆在面前的事物时表现出色,但在面对信息缺失的混乱现实时却显得力不从心。它们在应该谦逊的时候表现得过于自信。这篇论文并没有提供某种“魔法解药”,但它提供了一张非常清晰的地图,展示了AI在哪里失败了,表明下一步的目标不仅是制造更大的模型,而是教会它们“知之为知之,不知为不知”的艺术。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。