RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty
该论文提出了 RankLLM,这是一个通过双向分数传播来量化问题难度和模型能力的创新框架,旨在实现对大语言模型进行细粒度、稳定且高效的评估,其性能超越了包括 IRT 在内的现有基准和基线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图评判 30 位不同厨师的技艺。你的菜单上有 35,000 道不同的菜肴,范围从“烤一片面包”到“创作一场 10 道菜的分子美食盛宴”。
旧方法(传统基准测试):
目前,大多数人通过简单统计这些厨师做对了多少道菜来评判他们。如果厨师 A 做对了 80% 的菜,而厨师 B 也做对了 80%,他们就被视为同等水平。
- 问题所在: 这是不公平的。如果厨师 A 只做了烤面包且做对了,而厨师 B 制作了一场复杂的 10 道菜盛宴且做对了,他们却被同等对待。旧的方法并不关心这道菜到底有多“难”;它只是在计数“正确”的答案。
新方法(EIP 论文):
该论文的作者 Ziqian Zhang 及其团队提出了一种名为 EIP(经验交互传播,Empirical Interaction Propagation) 的新系统。把 EIP 想象成一个智能的、自我修正的评分系统,它能同时计算出两件事:
- 每道菜实际有多难。
- 每位厨师真正的技艺有多高。
它是如何运作的:“难度”的“乒乓博弈”
想象一场在**厨师(模型)与菜肴(问题)**之间进行的巨大乒乓球赛。
- 设置: 你有一个图谱,将每一位厨师与他们尝试过的每一道菜连接起来。
- 规则:
- 如果一位厨师解决了一道难的菜,他的“技能得分”会获得巨大的提升。
- 如果一位厨师搞砸了一道易的菜,这是一个明显的警示信号,说明这道菜可能实际上很棘手(或者厨师遇到了困难)。
- 如果一道菜几乎被所有人解决,那么它的“难度得分”就会下降。
- 如果一道菜让即使是最优秀的厨师也束手无策,那么它的“难度得分”就会上升。
- 神奇循环: 系统运行一个循环(就像涟漪效应一样)。它会问:“谁解决了这道难题?他们一定很厉害。”然后它会问:“谁没能完成这道简单的菜?那道菜一定比我们想象的要难。”它在这些分数之间来回传递,直到数值稳定下来,形成一个稳定的、公平的排名。
他们的发现(结果)
研究人员在 30 个不同的 AI 模型(从微型到庞大的模型)以及 35,550 个问题上测试了这一方法。以下是他们的发现:
- 符合人类直觉: 当他们询问人类哪些问题更难时,EIP 的判断与人类一致的比例高达 90%。其他方法(如用于教育领域的标准数学模型)的准确性要低得多。
- 发现隐藏的天赋: EIP 发现,一些较小的 AI 模型在解决难题方面实际上比大型模型更出色,即便大型模型的“正确答案”总数更高。旧的方法忽略了这一点;EIP 因为这些小模型挑战了高难度任务而给予了它们更高的排名。
- 速度极快: 使用旧方法计算这些排名需要数小时甚至数天。而 EIP 在一台普通的笔记本电脑上仅需 0.006 秒。这就像是从马车切换到了火箭。
- 稳定性强: 即使你从比赛中移除了一半的厨师,菜肴和剩余厨师的排名也会保持几乎完全不变。它不会因为谁在场内而感到困惑。
- “群体”效应: 该系统在拥有大小、中、型模型混合的情况下效果最好。如果你只使用微型模型,它们可能会认为一切都是不可能完成的任务。如果你只使用巨型模型,它们可能会认为一切都太容易了。将它们混合在一起,才能呈现出最真实的景象。
核心结论
该论文认为,我们不能再把所有问题都视为同等对待。仅仅因为一个 AI 做对了一个问题,并不代表它聪明,如果那个问题非常简单的话。EIP 是一个工具,它通过权衡问题的难度与模型的技能,为人工智能创造了一个更加公平且更详尽的排行榜。
这不仅仅关乎谁拿到的分数最多,更关乎谁征服了最陡峭的山峰。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。