(Towards) Scalable Reliable Automated Evaluation with Large Language Models
本文介绍了一种可扩展且与领域无关的框架,该框架利用多个大语言模型之间的两两比较以及 Elo 等级分系统,来生成具有可调节置信阈值的可靠、专家级大语言模型输出评估,从而显著减少了对人工干预的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位规模宏大、混乱不堪的图书馆编辑,每天都有成千上万本新书由一群聪明的机器人编写而成。这些被称为“大语言模型”(LLM)的机器人可以快速创作故事、回答问题并总结复杂的观点。但问题在于,你如何知道哪台机器人的故事写得最好?在过去,你需要一个人类图书管理员团队来阅读每一页、进行比较,并为谁写得更好而争论不休。这既耗时又昂贵,而且不同的管理员对“好”的定义可能并不一致。这正是人工智能领域的科学家们试图解决的问题:创造一种评估机器人写作质量的方法,使其既快速又公平,且不需要人类去阅读每一个字。为了实现这一点,他们使用了几个巧妙的技巧。首先,他们让机器人互相评审,就像一个评论家小组一样。其次,他们使用了一种借鉴自国际象棋的评分系统,称为 Elo 等级分(Elo rating),该系统根据选手在面对面比赛中的胜负情况进行排名。最后,他们观察这些机器人评委与人类专家的意见是否一致,以此来验证系统的有效性。
这篇论文介绍了一种评估 AI 机器人生成的文本质量的新型可扩展方法。作者并没有要求单个机器人给出评分(因为这可能会产生偏见或不一致性),而是建立了一个大规模的锦标赛。他们选取了许多不同的文本输出——例如科学研究的摘要——并让多个不同的 AI 模型进行“面对面”的对决。在每场比赛中,两个文本会被展示给一个 AI 评委,它必须根据特定的规则判定哪一个更好。为了确保评委不会仅仅因为某个文本出现在最后或者某个文本更冗长就做出选择,该系统通过翻转文本顺序,并使用多个不同的 AI 模型来进行投票以决定胜者。
在所有比赛结束后,结果会被输入到一个 Elo 等级分系统中。你可以把它想象成国际象棋的排行榜:如果一段文本战胜了一个强劲对手,它就会获得很多分数;如果输了,它就会失去分数。随着时间的推移,这会产生一个清晰的、从“最好”到“最差”的排名列表。作者通过测试验证了这一点:他们让 AI 模型根据科学摘要生成“能力画像”(即研究人员擅长领域的总结)。随后,他们将 AI 生成的排名与 20 位人类专家的排名进行了对比。结果表明,当多个 AI 模型共同投票时,它们的排名与人类专家的排名惊人地一致。事实上,使用简单的“多数票制”(即 AI 只需要达到 50% 的共识即可宣布胜者)比要求“完全一致”的效果更好,因为后者往往会导致过多的“平局”且无法产生明确的胜者。这项研究表明,这种方法可以显著减少人类承担繁重工作的需求,为筛选海量 AI 生成内容提供了一种可靠的自动化方式。然而,作者也指出,这个过程在计算上仍然非常昂贵,需要进行大量的比较,并且在使用多种不同的 AI 模型来平衡彼此的特性和偏见时效果最佳。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。