Anticipatory Evaluation of Language Models
本文介绍了 PRECOG,一个包含任务描述和性能指标的语料库,旨在证明大语言模型可以仅根据任务描述和实验配置来预测评估结果,从而为克服当前人工智能研究中的评估瓶颈提供一条途径。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位正在策划一道复杂新菜肴的大厨。通常,为了知道这道菜是否会大受欢迎,你必须买齐所有食材、切好、煮熟、品尝,然后再询问你的宾客反馈。这个过程既昂贵又耗时,而且需要大量的尝试与错误。
这篇论文介绍了一个“神奇的试吃员”,它声称甚至在你在购买任何一种食材之前,就能准确告诉你你的菜肴会被评定为多少分。
以下是研究人员所做工作的拆解,使用了简单的类比:
问题:“试吃”瓶颈
在人工智能领域,研究人员不断构建新的“测试”(基准测试)来观察他们的计算机模型有多聪明。但构建这些测试是一项艰苦的工作。你必须编写问题、收集数据并在其上运行 AI。通常,研究人员花费数月时间构建一个测试,却发现它太简单了(AI 拿到了 100% 分数,从而没学到任何东西)或者太难了(AI 只得了 0%,导致测试毫无意义)。
论文称之为“评估瓶颈”。你必须在知道这项工作是否值得之前,先完成这项工作。
解决方案:“水晶球”(PRECOG)
研究人员问道:我们能否仅通过阅读“食谱”来预测分数?
他们创建了一个庞大的库,叫做 PRECOG。你可以把这个库想象成一个巨大的“食谱卡片”收藏库(即 AI 测试的描述),并配有这些测试最终获得的“分数”。
- 输入: 他们并没有向 AI 输入实际的测试题目,而只是向它输入了测试的文本描述。例如:“这是一个针对大学生的数学测试。每个问题有 20 个多项选择选项。AI 必须在不使用计算器的情况下进行回答。”
- 输出: AI 尝试猜测分数(例如:“我预测这个 AI 将获得 62% 的正确率”)。
他们是如何构建这个库的
他们并没有编造虚假的测试。他们从一个名为 arXiv 的数据库中抓取了数千篇真实的科学论文。
- 他们从论文中提取了“食谱”(任务描述)。
- 他们从论文中提取了“分数”(结果)。
- 他们确保隐藏了测试的名称,以免 AI 通过直接背诵答案来作弊;它必须真正理解描述中的“难度”。
他们最终得到了大约 2,300 对描述与分数的配对,涵盖了从阅读理解到逻辑推理的所有内容。
结果:并不完美,但表现出色
他们测试了这个“神奇的试吃员”(一个非常先进的 AI 模型,称为 GPT-5)以观察它是否能猜中分数。
- 它比瞎猜要好: 如果你只是对所有情况都按平均分进行猜测,你的误差会大约在 23 分左右。而该 AI 的平均误差仅为 14.6 分。
- 信心很重要: 当 AI 说“我对这个预测非常有信心”时,它的表现甚至更准确,误差能控制在 10 分以内。
- 它胜过了人类: 他们邀请了人类专家(了解 AI 的教授和学生)根据同样的描述来猜测分数。人类的误差大约在 19.6 分,而 AI 的误差仅为 13.6 分。AI 在猜测难度方面比专家更胜一筹。
- 它适用于新事物: 他们在 AI 训练之后发表的新论文上进行了测试。AI 依然表现良好,证明它并非仅仅通过背诵旧答案来作弊。
这为什么重要(根据论文所述)
论文指出,这个工具可以成为研究人员的“规划助手”。
- 在研究人员投入资金和时间构建大规模数据集之前,他们可以询问 AI:“如果我把选项从 4 个增加到 20 个,测试会变得太难吗?”
- AI 可能会说:“基于类似的描述,这会导致分数显著下降。也许尝试 10 个选项会更好。”
- 这有助于研究人员决定哪些想法值得追求,哪些想法可能是在浪费时间,而这一切都发生在他们编写第一行代码或标注第一个数据点之前。
核心结论
论文并不声称这能取代实际的测试。你仍然需要运行真实的测试才能得到真实的答案。但它声称,阅读“食谱”现在是一种获取“草稿版”结果的强大方式,有助于研究人员在开始之前,避免构建过于简单或过于困难的测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。