Evaluating Multiple LLM Generations with Validated Task Coverage
本文介绍了 VTC-Bench 和验证任务覆盖度(VTC)指标,用于将多个大语言模型生成结果作为一个集合进行评估,并证明了针对单输出质量进行优化的配置并不一定能实现不同且有用结果的多样性最大化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大型语言模型通常通过一个简单的问题来评判:它能否得到正确答案?当用户要求解决数学问题、编写一行代码或进行医学诊断时,标准的测试标准是模型是否产生了一个正确的响应。这种方法将机器视为正在参加期末考试的学生,其中只有最高分才重要。然而,在许多现实世界的场景中,单一的答案是不够的。一位设计新药的科学家可能需要看到十种不同的化学结构,且这些结构都有效,以便他们选择最容易制造的一种。一位修复安全漏洞的软件工程师可能希望看到几种不同的代码补丁方式,以观察哪种最安全。在这些场景中,机器的价值不在于其产生一个完美输出的能力,而在于其生成一组丰富且独特的有用选项的能力。研究人员面临的挑战在于如何衡量这种能力。传统的测试通常计算模型答对了几次,或者仅仅从列表中挑选出最好的答案并忽略其余部分。当目标是拥有一个可供选择的、多样化的有效可能性集合时,这种做法完全忽略了重点。
日本理化学研究所(RIKEN)计算科学研究中心的团队开发了一种看待这一问题的新方法。他们创建了一个专门的测试场,称之为基准测试(benchmark),旨在专门观察人工智能在处理单一任务时生成多种有用答案的能力如何。他们的这种方法不是问“它答对了吗?”,而是问“它找到了多少个不同且真正有用的答案?”他们利用五种非常不同的现实世界问题构建了这个测试,范围涵盖了从设计化学分子到修复软件漏洞以及搜索医学证据。对于每个问题,他们都明确定义了什么才算作“有用的”结果,以及如何判断两个结果是否真的不同。例如,在分子设计中,两个答案在表面上可能看起来不同,但如果它们共享相同的核心化学结构,则被视为同一种有用的结果。研究人员随后让各种模型运行这些任务,要求它们多次尝试,并统计它们累积了多少个独特的有效解决方案。
这项研究的结果揭示了一个关于这些机器运作方式的惊人真相。研究人员发现,那些擅长产生单个高质量答案的模型,并不一定是那些能产生最佳多样化答案集合的模型。事实上,哪个模型是“最好”的排名会根据允许的尝试次数而改变。一个在仅尝试一次时处于领先地位的模型,在尝试二十次时可能会落后;而另一个起步较慢的模型,最终可能会挖掘出更广泛的有用解决方案。这表明,运行这些模型的设置比此前认为的更为重要。研究人员发现,增加“温度”(temperature)——一种使模型的输出更加随机和多变的设置——通常会导致产生更广泛的有用集合,尽管这有时会降低单个答案的质量。相反,“思考”(thinking)这一特征——它鼓励模型在回答前进行逐步推理——虽然提高了单个答案的质量,但并不总能帮助模型找到更多截然不同的解决方案。
或许最重要的一点是,研究表明,仅仅观察答案在表面上的差异性,不足以判断它们是否真正有用。一种常见的判断多样性的方法是检查答案中的单词或字符是否互不相同。研究人员发现,这种表面层面的检查是预测模型是否真正找到了新的、有效的解决方案的糟糕指标。一个模型可能会产生十个看起来非常不同的答案,但它们都代表了同一个潜在的解决方案,从而无法提供用户实际需要的多样性。通过使用一种能够根据任务的具体规则来检查答案的实际内容和含义的系统,研究人员得以衡量结果的真实“覆盖率”。他们发现,这种更深层次的衡量标准往往会对哪些模型和设置表现最好得出不同的结论。
该团队在五个领域测试了四种不同的语言大模型:设计分子、修复软件仓库、寻找代码漏洞、诊断医学病例以及搜索支持复杂问题的证据。他们使用不同的设置运行每个模型,例如改变随机程度以及启用或禁用“思考”过程。然后,随着尝试次数的增加,他们测量了每个模型产生的不同且有效的输出数量。数据表明,对于大多数任务,在开始阶段表现最好的模型,并不是在多次尝试后表现最好的模型。例如,在设计分子的任务中,一个模型在尝试一次后处于领先地位,但到尝试二十次时,另一个模型已经发现了显著更多的独特化学结构。这一模式在所有领域都成立,表明生成单个答案的最佳策略通常与生成一组答案的最佳策略不同。
研究还探讨了明确告诉模型避免重复是否会有所帮助。在某些情况下,研究人员曾试图通过要求模型生成与其刚刚说过内容不同的新想法来强制实现多样性。研究人员发现,这种方法并不能可靠地奏效。虽然它在搜索证据等特定任务中有帮助,但在修复软件等其他任务中,它实际上减少了有用解决方案的数量。这表明,仅仅要求多样性并不能保证模型会找到新的、有效的领域。相反,配置模型的方式,特别是控制其随机性的设置,对于决定它能否探索广泛的有用可能性起着更关键的作用。
这些发现改变了我们看待评估人工智能的方式。多年来,关注点一直在于获得单个最佳答案。但随着这些机器被用于更复杂的任务,拥有多种选择变得至关重要,旧的衡量成功的方法已不再适用。研究人员的工作证明,一个有限的候选答案集本身就是一个具有意义的研究对象。它不仅仅是通往一个获胜者的多次尝试的集合;它是一个可以被映射和衡量的可能性景观。通过使用他们称之为“验证任务覆盖率”(validated task coverage)的新方法,他们展示了我们可以直接评估模型探索这一景观的能力。结果表明,为了充分利用这些工具,我们可能需要停止寻找单一的最佳答案,转而开始重视它们所能提供的选项的广度。
这项研究的影响超出了仅仅挑选正确模型本身。它表明,我们与这些系统的交互方式可能需要发生变化。如果用户需要多种解决方案,他们可能需要调整设置以鼓励更多探索,即使这意味着必须接受单个答案可能略逊一筹的事实。该研究提供了一种具体的方法来测试和比较这些不同的方法,超越了“创造力”或“多样性”等模糊概念,转向一个清晰、可衡量的有用结果计数。研究人员向公众开放了他们的工具和数据,允许他人针对这一新标准测试新的模型和设置。这为更细致地理解这些机器的能力打开了大门,将焦点从单一的成功点转向了其能力的完整范围。
最后,这篇论文提供了一种微小但意义重大的视角转变。它认为,人工智能的价值不仅在于其能够做对,还在于其能够以多种不同的方式发挥作用。通过构建一个衡量独特且有效结果累积的测试,研究人员为审视这些强大工具提供了一个新的视角。他们表明,通往最佳答案集合的路径并不总是与通往最佳单个答案的路径一致,并且我们选择的设置可以对收到的解决方案的多样性产生深远影响。这项工作并不声称已经解决了评估人工智能的所有问题,但它提供了一种清晰、可重复的方法,去询问一个长期以来被忽视的问题:这台机器究竟能找到多少有用的东西?
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。