Diverse LLMs or Diverse Question Interpretations? That is the Ensembling Question
本文表明,对于大语言模型的二值问答任务,在采用多数投票时,对单一模型生成的多样化问题解释进行集成,其效果始终优于对多个不同模型进行集成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解开一个棘手的谜题,比如“雨量计的大小重要吗?”你可以向一位非常聪明的朋友提问,也可以向一整群朋友提问。这篇论文提出的核心问题是:是让一位朋友用三种不同的方式思考这个谜题更好,还是让三位不同的朋友用完全相同的方式思考这个谜题更好?
作者们是来自英特尔实验室的研究人员,他们利用大型语言模型(LLMs)——即 ChatGPT 等工具背后的 AI 大脑——来寻找答案。他们将此称为“集成问题”。
两种策略
该论文比较了两种利用“多样性”(即拥有不同视角)来获得更好答案的方法:
1. “多位朋友”方法(模型多样性)
想象你有三位不同的朋友:爱丽丝、鲍勃和查理。他们拥有不同的性格和思维方式。你向他们所有人提出完全相同的问题:“雨量计的大小重要吗?”
- 目标: 你希望如果爱丽丝答错了,鲍勃或查理可能会答对。
- 结果: 论文发现,这通常只能给你一个平均答案。如果爱丽丝很出色,鲍勃尚可,而查理很差劲,那么群体投票的结果通常落在中间位置。这并不会神奇地让群体比最好的那个个体朋友更聪明。
2. “一位朋友,三顶帽子”方法(问题解释多样性)
想象你只问一位朋友(假设是一位非常聪明的 AI,名叫 GPT-3.5)。但在他们回答之前,你要求他们戴上三顶不同的“帽子”或透过三副不同的透镜来审视这个问题。
- 帽子 1(科学家): “这如何影响测量降雨的准确性?”
- 帽子 2(工程师): “这如何影响雨量计的成本和设计?”
- 帽子 3(环保主义者): “这如何改变我们对降雨影响自然的理解?”
这位朋友针对每顶帽子分别回答一次问题。然后,你对这三个答案进行投票。 - 目标: 通过迫使 AI 从不同角度审视问题,你能够揭示单一、直白的解读可能忽略的细微差别。
- 结果: 这种方法始终胜出。“一位朋友,三顶帽子”的方法产生的答案,优于向三位不同的朋友提出相同问题。
为什么“一位朋友”的方法会胜出?
论文指出,询问三个不同模型(即“多位朋友”方法)的问题在于,它们往往犯同样的错误。尽管它们是不同的模型,但它们是在相似的数据上训练的,并且拥有相似的“盲点”。如果它们都以同样的方式误解了问题,那么对它们的答案进行投票也无济于事。
然而,当你要求一个模型以不同的方式解释问题时,你是在迫使它跳出固有的思维模式。你实际上是在说:“不要仅仅回答问题;要思考这个问题可能意味着什么。”这会生成更多样化的答案,更有可能覆盖正确的范围。
“投票”机制
为了确定最终答案,研究人员使用了简单的多数投票。
- 如果“科学家”说“是”,“工程师”说“是”,而“环保主义者”说“否”,那么最终答案就是“是”。
- 论文发现,当输入来自对同一问题的不同解释而非不同模型时,这种投票系统的效果要好得多。
核心结论
该论文得出结论:对于回答简单的“是/否”问题,让一个 AI 的大脑拓展思维,用多种方式思考一个问题,比聚集一群不同的 AI 仅用一种方式思考这个问题更好。
这就像在黑暗的房间里寻找一把丢失的钥匙:
- 模型多样性就像雇佣三个人来搜索房间,但他们都因为被告知要那样做,而都在完全相同的角落里寻找。
- 问题解释多样性就像雇佣一个人来搜索房间,但你告诉他:先把它当作玩具寻找,然后当作工具寻找,最后当作珠宝寻找。这迫使他们更彻底地扫描整个房间,从而更有可能找到钥匙。
研究人员在三个不同的问题集(涉及常识、策略和医学科学)上测试了这一点,发现“一位朋友,三顶帽子”的方法始终胜过“多位朋友”的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。