Diversity is the Strength of the AI Crowd
本文表明,若要实现人工智能预测集成准确率的最大化,需要策略性地结合具有互补误差的多样化模型,而非仅仅聚合来自相似高性能大语言模型的多个预测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图预测一系列抛硬币的结果,但你不是在抛硬币,而是在询问一群非常聪明、但各具特色的计算机(AI 模型)来猜测未来某个事件是否会发生。
这篇论文提出了一个简单的问题:如果你只有有限次数的“猜测”机会,你应该让一个最聪明的计算机猜五次,还是让五个不同的计算机各猜一次?
以下是研究人员发现的内容,使用了日常类比进行说明。
旧方法:“超级专家”
长期以来,标准做法是寻找目前最聪明的 AI 模型,并针对同一个问题反复询问它。其逻辑是:“如果这个模型是最优秀的,那么让它多猜几次一定会更好。”
研究人员称之为**“无差别采样”(indiscriminate sampling)**。这就像让你最好的朋友就同一个话题写五篇不同的文章。即使他们试图写得有所不同,他们使用的也是同一个大脑、同一套记忆和同一种风格。他们的答案会非常相似。
新发现:“多元化团队”
论文认为这种方法是错误的。相反,最好的结果来自于构建一个多元化的团队。
把这想象成一支运动队。如果你有五名非常擅长投篮的球员,但他们都站在同一个位置,以同样的方式投篮,那么你并没有覆盖整个球场。你需要一种组合:一名擅长投篮的球员,一名擅长防守的球员,以及一名擅长传球的球员。即使那个“传球手”不是最顶尖的射手,他们的独特技能也会让整个团队变得更强大。
核心发现
1. 聪明的模型思维趋同
研究人员测试了几种顶尖的 AI 模型(如 GPT-5、Gemini 3 Pro 等)。他们发现,这些“超级聪明”的模型在思考方式上其实非常相似。当被问及同一个问题时,它们往往会给出非常相似的答案。
- 类比: 如果你问五胞胎同一个谜题,他们很可能会给出相同的答案。问他们五次并不会提供新的信息;这只是把同一个答案重复了五遍。
2. “离群值”才是最有价值球员(MVP)
他们在测试组中的一个模型——被称为 Grok 4 的模型很有趣。它本身并不是最准确的模型(实际上它是排名第三),但它的思考方式与其他人非常不同。它的答案与其他模型的关联性较低。
- 类比: 想象一个拼图。你有四个完美契合的碎片,但留下了一个缺口。你找到了第五块碎片,它看起来与其他的完全不同,但它能完美地填补那个缺口。尽管第五块碎片看起来比其他碎片“奇怪”,但它是完成拼图最有价值的碎片。
3. 多样性胜过原始准确度
当研究人员组合这些模型时,获胜的团队并不是将同一个最强模型重复使用五次,而是一个混合体:
- 一个经过定制微调的模型(“专家型”)。
- 两个顶尖模型(“全才型”)。
- Grok 4(“多元思考型”)。
尽管 Grok 4 单独表现时并非最准确,但它是最难被取代的。如果你把 Grok 4 从团队中移除,团队的表现会显著下降。如果你拿掉其中一个“顶尖”模型,团队几乎感觉不到变化。
核心教训
论文得出结论:一个“AI 群体”的力量并不来自于让同一个聪明人猜测一百万次。它来自于询问不同的聪明人,让他们犯下不同类型的错误。
- 错误做法: 让同一个模型猜 5 次。(就像让一个人写 5 个不同的故事;它们听起来都会一样)。
- 解决方案: 让 5 个不同的模型各猜 1 次。(就像让一位诗人、一位科学家、一位喜剧演员和一位历史学家来讲故事;他们不同的视角会创造出一个更加丰富且准确的画面)。
简而言之: 为了获得最好的预测结果,不要只是把“最好的”模型堆叠在一起。要混入那些思考方式不同的模型,即使它们在排行榜上并不是绝对的第一。多样性才是秘诀。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。