Evaluating Ill-Defined Tasks in Large Language Models
该论文通过分析复杂指令遵循和自然语言转 Mermaid 序列图两个案例,揭示了当前大语言模型评估在应对定义模糊任务时存在的基准不可靠、指标不具诊断性及结果不稳定等根本缺陷,并呼吁构建更稳健、可解释的评估体系。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一份**“大语言模型(LLM)体检报告”**,但它指出了一个令人尴尬的问题:我们现在的体检方法(评估基准),对于很多复杂的、没有标准答案的任务来说,不仅不准,甚至有点“瞎指挥”。
作者来自 IBM 研究院,他们把这篇论文放在 ICLR 2026 的一个名为“我不相信这更好(I Can't Believe It's Not Better)”的工作坊上,意思就是:“别被那些看似漂亮的分数骗了,现有的评估方法其实很糟糕,我们需要更好的。”
下面我用几个生活中的比喻,把这篇论文的核心内容讲给你听:
1. 核心问题:什么是“定义不清的任务”?
想象一下,你让一个厨师做菜:
- 定义清晰的任务:就像说“做一道宫保鸡丁,放 200 克鸡肉,3 个辣椒”。这道菜做得对不对,有标准答案(咸淡、颜色、食材)。
- 定义不清的任务:就像说“做一道‘让人心情愉悦’的菜”。什么是“愉悦”?是甜一点?还是摆盘好看?每个人标准不同,甚至同一道菜,今天吃觉得好,明天吃觉得一般。
现在的 AI(大语言模型)在处理这种“让人心情愉悦”的任务时,我们怎么给它打分?这就是这篇论文要解决的问题。
2. 现在的“体检”哪里出了问题?
作者发现,现在的评估方法主要有三个大毛病:
毛病一:考题太假,像“死记硬背”
现在的很多考题(基准测试)太像学校里的填空题了。
- 比喻:就像为了考“写作能力”,题目是“写一段话,里面必须包含字母'i'不超过两次”。
- 后果:AI 根本不在乎它写的是不是好故事,它只要机械地数数,把字母'i'删掉就能拿高分。这就像学生为了考高分,只背了“不要写错别字”的公式,却完全没学会怎么写作文。
- 论文发现:有些 AI 模型在“复杂指令遵循”的测试中得分很高,但如果让它真正去理解复杂的指令,它可能一塌糊涂。
毛病二:只有一个总分,像“只给个平均分”
现在的评估通常只给一个总分(比如 85 分)。
- 比喻:就像你去医院体检,医生只告诉你“总分 60 分,不及格”,但没告诉你你是心脏不好、视力下降还是腿脚不便。
- 后果:开发者看到分数低了,根本不知道该怎么改。是训练数据不够?还是提示词(Prompt)写得不好?还是模型逻辑有问题?因为所有问题都混在一个分数里,大家只能盲目地“刷分”,而不是真正提升能力。
毛病三:裁判也是 AI,而且裁判心情不好
现在很多测试是用另一个 AI 来当裁判(LLM-as-a-Judge)。
- 比喻:就像让一个 AI 去给另一个 AI 的作文打分。但这个裁判 AI 今天心情好,给 90 分;明天换个提示词,或者换个随机种子,可能就给 70 分了。
- 后果:分数忽高忽低,不稳定。而且裁判 AI 自己也有偏见,它可能更喜欢某种风格的回答,而不是真正符合要求的回答。
3. 两个真实的“翻车”案例
作者举了两个具体的例子来证明上面的观点:
案例一:听指挥做事(Complex Instruction Following)
- 场景:让 AI 同时遵守很多条规则(比如:写个故事,字数要 500 字,不能出现“的”字,要用第三人称,还要包含一段对话)。
- 现状:现有的测试要么太简单(只检查有没有“的”字),要么太依赖 AI 裁判(裁判自己都没搞清楚规则)。
- 结论:现在的测试太容易被“骗”了。AI 只要表面功夫做得好(比如格式对),就能拿高分,哪怕它根本没听懂你的核心要求。
案例二:画流程图(Natural Language to Mermaid Diagrams)
- 场景:你给 AI 一段文字描述(比如“用户登录系统”),让它画出一个标准的流程图。
- 现状:以前大家只看“画得像不像”(总分)。
- 新发现:作者把评分拆开了,分成“语法对不对”、“逻辑通不通”、“步骤全不全”、“错误处理对不对”四个维度。
- 惊喜:他们发现,通过调整提示词,AI 的“逻辑分”从 67 分涨到了 80 分,但“总分”反而下降了!
- 为什么? 因为 AI 为了把逻辑理顺,牺牲了“步骤完整性”。
- 启示:如果只看总分,你会觉得 AI 退步了;但拆开看,你发现它在“逻辑”上进步了。这就是**“拆解式评估”**的好处,它能告诉你具体哪里好、哪里坏,而不是给你一个模糊的结论。
4. 作者的建议:我们要怎么改?
作者呼吁大家别再只盯着那个“总分”看了,要像**“做手术”**一样精准:
把“硬指标”和“软指标”分开:
- 如果是检查格式、字数、有没有错别字,用代码规则去检查(这是绝对的,不会错)。
- 如果是检查逻辑通不通、内容好不好,再请AI 裁判来打分。
- 比喻:先让机器检查“菜切得齐不齐”,再让人(或 AI)来尝“味道好不好”。
给裁判立规矩:
- 如果用 AI 当裁判,要记录它用了什么提示词、什么版本、温度参数是多少。要报告裁判之间的“一致性”,不能今天一个样,明天一个样。
多给点“诊断报告”:
- 不要只给一个分数。要告诉开发者:你的模型在“逻辑”上很强,但在“遵守字数限制”上很弱。这样开发者才知道该往哪个方向努力。
总结
这篇论文的核心思想就是:现在的 AI 评估太粗糙了,像是在用一把尺子去量“心情”。
对于那种没有标准答案的复杂任务,我们不能只看一个总分。我们需要把任务拆解开来,用规则去检查硬伤,用透明的裁判去评估软技能,并且给出具体的诊断报告。只有这样,我们才能知道 AI 到底哪里强、哪里弱,才能真正把 AI 变得更好,而不是只是在排行榜上刷个虚假的高分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。