A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models
本文提出了一种可扩展的、基于共识的框架,该框架通过聚合大语言模型对匿名响应的相互排名来生成相对智能指数,从而为在存在多个有效答案的情景下评估响应质量提供了一种模型驱动的替代方案,以取代传统的静态基准测试。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
AI 大味觉测试
想象一个计算机已经学会了像人类一样交谈、写作和解决问题的世界。这就是大型语言模型(LLM)的领域,它们是许多我们今天使用的聊天机器人和工具背后的超级智能数字大脑。长期以来,科学家们一直使用严格的“标准答案”来测试这些大脑,比如只有一个正确数字的数学测试。但生活并不总是像数学题那样。有时候,一个问题会有很多个好的答案,而哪个才是“最好的”,取决于它给人的感觉有多清晰、多有帮助或多有创意。这就是棘手之处:当写出完美答案的方式有五种不同时,你该如何给一篇论文评分?
为了解决这个问题,研究人员开始使用 AI 来为 AI 评分。这就像是请一组评委来决定他们的朋友中谁讲的笑话最有趣。但问题在于:如果评委都是在同一所学校上学的同班同学,他们可能会都喜欢同一种风格的笑话,即使那并不是最有趣的。这篇论文深入探讨了正是这样一个问题。它在问:如果我们让一群不同的 AI 模型在不知道彼此身份的情况下进行盲测,互相评价对方的答案,我们能否找到一种关于它们“偏好”的模式?它并不声称找到了“真理”,而是绘制了一张关于这些数字大脑如何就“什么听起来不错”达成共识的地图。
数字世界的盲味觉测试
想象你正在参加一场盛大的、高科技的百乐餐(potluck dinner)。大家带来的不是食物,而是五台不同的超级智能机器人(我们称之为“厨师”),它们为同一道菜带来了各自最拿手的食谱。目标不是看谁做出了“正确”的饭菜——因为也许有一种完美的炖菜有十种做法——而是看其他机器人认为哪份饭菜看起来和吃起来最棒。
这正是 Mohtashim Khan 在这篇论文中所做的工作。他没有要求人类去品尝答案,而是设置了一个“盲味觉测试”,让“厨师”们互相评价彼此。
设定:一场身份保密游戏
实验涉及了五款顶尖的 AI 模型:Claude、ChatGPT、Gemini、Grok 和 Mistral。研究人员给了它们 25 个不同的挑战,涵盖了从解决棘手的数学谜题、编写代码,到回答安全问题和常识性知识问答。
这里有一个神奇的技巧:当机器人在进行评审时,它们并不知道答案是谁写的。答案被剥离了名称并进行了打乱,仅被标记为“答案 1”、“答案 2”等等。每个机器人必须根据答案看起来多么清晰、多么有帮助,将所有答案从优到劣进行排序。它们完全独立地进行,互不交流,也看不到其他机器人的看法。
评分:相对智能指数
评审结束后,研究人员统计了票数。他创建了一个名为**相对智能指数(Relative Intelligence Index, RII)**的新分数。请记住,这并不是衡量是否“聪明”的分数,而是一个受欢迎程度的得分。高 RII 意味着一个机器人的答案经常被同类选为“最佳”。低 RII 则意味着它的答案经常被排在较低的位置。
他们发现了什么?
结果有点像一场不同的队伍在不同日子里都能获胜的体育联赛。
- 稳定的赢家: Claude 和 Grok 经常名列前茅。Claude 在数学和编程方面表现尤为强劲,而 Grok 则在逻辑谜题和创造性思维方面表现出色。
- 稳健的选手: Gemini 和 Mistral 并不总是能赢得“最佳答案”奖,但它们非常稳定。它们的得分不会随着测试课题的变化而剧烈波动。
- 速度与质量的权衡: 研究还记录了每个机器人制作答案所需的时间。有趣的是,那些思考时间最长的机器人(如 Gemini 和 Claude)往往是其他机器人最喜欢的。反应最快的机器人(如 Mistral)虽然很快,但并不总是能获得最高票数。
重要的“但是”
论文非常谨慎地说明了这个分数不是什么。它不是衡量谁真正“正确”或谁对人类最有帮助的指标。它仅仅是衡量机器人之间对彼此风格的喜爱程度。有可能所有的机器人都在类似的书籍和网站上接受过训练,所以它们可能只是因为拥有相同的“味蕾”,而不是因为其中一个客观上更好,才达成一致。
总结
这个框架表明,当不存在单一正确答案时,我们可以使用一种“共识”方法来观察哪些 AI 输出在其他 AI 看来是最精炼且连贯的。虽然它不能取代人类的判断,但它提供了一种可扩展的方法,用于在答案具有主观性时比较模型。研究发现,虽然某些模型通常更受同类青睐,但结果会根据主题和具体的测试运行情况而发生变化。这是一种看待 AI 性能的新方式,侧重于“模型如何看待彼此”,而不仅仅是“它们是否得到了正确答案”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。