The Embedder's Dilemma: LLMs Are Better, but at What Cost?
本文表明,尽管大语言模型与专门的嵌入模型在 37 项任务中的总体性能相当,但嵌入模型在成本和速度方面具有压倒性优势,这暗示了一种分工模式,即由嵌入模型处理相似性和分类任务,而将大语言模型保留用于推理密集型的检索任务。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一大堆草垛中寻找一根特定的针。在人工智能的世界里,这根“针”就是一条信息,而这个“草垛”则是庞大的文本数据库。多年来,实现这一目标的标准方法是使用一种名为**嵌入模型(embedding model)**的专业工具。你可以把这些模型想象成超级快速的图书管理员,他们并不阅读书籍,而是根据每本书的整体“氛围”,瞬间为其分配一个独特的“颜色代码”(即向量)。当你提出问题时,他们会找到具有匹配颜色代码的文档。这种方式极其快速且廉价,但有点像通过封面来判断一本书——它可能会错过其内部深层、复杂的含义。
最近,一种被称为**大语言模型(LLM)*的新型 AI 工具变得异常流行。这些是能够写故事、解数学题并进行对话的“天才”模型。因为它们如此聪明,人们开始思考:“既然我们已经有了能真正阅读*整个草垛并理解故事的‘天才’,为什么还要使用那个快速、简单的图书管理员呢?”核心问题变成了:我们能否用这些昂贵且缓慢的“天才”来取代我们的快速、廉价的图书管理员,从而获得更好的结果?这篇论文正是深入探讨了这一困境,测试了使用“天才”方法是否真的值得支付那高昂的价格标签,或者说,“图书管理员”是否在大多数工作中仍然是更好的选择。
研究人员在十个最顶尖的大语言模型与二十六个最优秀的专业嵌入模型之间进行了一场大规模对决。他们让这些模型经历了 37 场不同的挑战,从按主题对电子邮件进行分类,到在大量文档中寻找正确答案。结果令人震惊:在总分上,这两类 AI 基本上是不相上下的。最聪明的 LLM(Gemini 3.1 Pro)得分 77.6,而最好的嵌入模型(Octen-8B)得分 77.2。这 0.4 分的微小差距小到几乎可以忽略不计,仅仅是统计误差。
然而,这场平局掩盖了一个巨大的秘密:成本。为了获得那 0.4 分的微弱优势,运行 LLM 进行测试花费了 154 美元,而运行嵌入模型仅花费了 0.11 美元。这意味着,为了完成同样的工作,LLM 的使用成本是嵌入模型的 1,431 倍。这就像是雇佣了一支诺贝尔奖级别的科学家团队来分拣一堆邮件,而用一台分拣机配合一名实习生只需花一分钱。论文还发现,LLMs 速度慢得多,在相同的计算机硬件上,处理文本的速度比嵌入模型慢了 2.5 到 736 倍。
研究还发现,这些“天才”LLMs 并不总是真正的天才;它们只是擅长特定的事情。当任务需要深度推理时——例如理解一份复杂的法律合同,或寻找需要连接不同文档间逻辑链条的答案——LLMs 会脱颖而出。但在处理诸如对电子邮件进行分类、对相似主题进行分组或检查两个句子意思是否相同时,专门的嵌入模型实际上表现得更好或同样出色。事实上,论文发现 LLMs 经常在“过度思考”。当研究人员告诉 LLMs 停止使用它们的“思考”模式(该模式会生成大量的额外文本来解决问题)时,这些模型在某些任务上的表现反而变好了,并且节省了大量的资金,这证明了额外的推理并非总是必要的。
那么,最终的结论是什么?论文建议我们不应该仅仅为了换用最新潮的工具而更换工具。相反,我们应该采用一种混合方法。先使用快速、廉价的嵌入模型作为第一步,快速缩小草垛的范围,找到最可能的候选对象。然后,如果问题非常难,需要深度思考,再请出昂贵的 LLM 来阅读这少数几个候选对象并给出最终答案。这样一来,你就拥有了兼具两者的优点:既有图书管理员的速度和低成本,又有天才的深度推理能力,而且只在真正需要时才动用。论文总结道,对于大多数日常任务,专门的嵌入模型仍然是冠军,而昂贵的 LLMs 则是我们只在面对最难谜题时才会使用的奢侈品。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。