← 最新论文
💬 NLP

Models Know Models Best: Evaluation via Model-Preferred Formats

本文提出了一种动态格式对齐策略,该策略利用基于模型偏好信号训练的轻量级分类器,自动在基于符号和完形填空式的评估格式之间进行选择,从而解决性能差异问题,并显著提高各种大语言模型基准测试中的零样本准确率。

原作者: Joonhak Lee, Sungmok Jung, Jongyeon Park, Jaejin Lee

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Joonhak Lee, Sungmok Jung, Jongyeon Park, Jaejin Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在参加一场证明你有多聪明的测试。现在,想象这场测试有两种不同的风格:

  1. “选择题”风格: 你读到一个问题,然后你必须选出一个与答案相匹配的字母(A、B、C 或 D)。
  2. “填空题”风格: 你读到一个突然中断的句子,然后你必须用正确的词来完成这个句子。

长期以来,研究人员一直认为这两种风格只是询问同一个问题的不同方式。但这一篇名为**《模型最了解模型》(Models Know Models Best)**的论文发现了一个令人惊讶的事实:大语言模型(LLMs)并不平等地喜欢这两种风格。 事实上,你选择的风格可以让一个模型看起来像个天才,或者像个彻头彻尾的失败者,即使问题本身是完全一样的。

以下是作者发现的内容,使用了简单的类比。

1. “工具不对症”的问题

研究人员在 8 种不同类型的题目上测试了 22 个不同的 AI 模型。他们发现了一个明显的模式:

  • “符号”风格(挑选 A、B、C、D): 这最适用于需要比较选项的问题。这就像是在看一份菜单,你必须从一堆菜品列表中选出符合你饮食习惯的那一个。模型必须并排观察所有选项以做出选择。
  • “完形填空”风格(填空式): 这最适用于需要延续故事的问题。这就像是完成小说中的一个句子。模型被训练去预测在自然流向中下一个出现的词是什么。

问题在于: 当研究人员强迫一个“讲故事”的模型为一个本质上关于完成句子的题目去从列表中挑选字母(符号风格)时,模型的得分大幅下降。这就像是要求一名马拉松运动员去解数学方程;他们擅长跑步,但测试格式与他们的长处不匹配。

2. 人类无法猜出最佳格式

作者首先尝试通过让人们观察一个问题并决定:“嘿,这个看起来像个故事,所以我们用填空题风格吧”来解决这个问题。

结果: 效果并不好。人类很难猜出 AI 会更喜欢哪种格式。有时一个问题在人类看来是一个故事,但 AI 实际上更喜欢多项选择列表。依赖人类的直觉往往会让 AI 的表现变得更差。

3. 解决方案:“问问模型想要什么”

既然人类无法猜中正确的格式,作者便询问了模型本身。

他们构建了一个微型、轻量级的“交通警察”(分类器)。这个交通警察观察一个特定的问题,并询问 AI:“如果我把这个问题作为一个多项选择列表给你,你的信心度是多少?如果我把它作为一个填空题给你,你的信心度又是多少?”

基于 AI 自身的内部信心信号,这个交通警察会决定使用哪种格式来处理特定的问题。

  • 如果问题是关于比较选项的: 交通警察会说:“使用多项选择(符号)格式。”
  • 如果问题是关于完成句子的: 交通警察会说:“使用填空(完形填空)格式。”

4. 结果:释放隐藏的潜力

当他们使用这种“模型偏好”策略时,结果是戏剧性的。

  • 对于“故事类”问题: AI 的表现显著提升。这就像是终于给跑者换上了合适的鞋子。
  • 对于“比较类”问题: 表现保持在高水平或略有提升。
  • 核心结论: 论文表明,许多 AI 模型实际上比我们想象的要聪明得多,但我们经常是用错误的“尺子”在测试它们。通过将“尺子”切换到与特定任务相匹配的状态,我们可以看到它们的真实能力。

总结

论文认为,我们不应该只选择一种测试格式并将其应用于所有情况。相反,我们应该让 AI 告诉我们它对每个特定问题的格式偏好。通过这样做,我们不再让模型感到束手无策,而是开始观察它们真正的智慧。

简而言之: 论文证明了提问的方式与问题本身同样重要,而弄清楚正确的提问方式的最佳方法,就是倾听模型自身的偏好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →