Position: Avoid Overstretching LLMs for every Enterprise Task
本文主张企业应避免在所有任务上过度依赖大语言模型,转而提倡采用模块化架构,即让大语言模型严格充当结构化提取的接口,而由专用知识库和符号化程序负责计算与存储,以确保可靠性、可扩展性和透明度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和富有创意的类比对这篇论文的解释。
核心理念:别再让“超级大脑”包揽一切
想象你经营着一家规模宏大、风险极高的工厂。你拥有一位才华横溢、无所不知的天才(即大型语言模型或LLM),他能写诗、讲笑话,还能解开复杂的谜题。
目前,许多公司正试图强迫这位天才运营整家工厂。他们要求这位天才:
- 记住员工手册中的每一条规则。
- 根据波动的原材料成本,精确计算每个小部件的价格。
- 核对某张发票是否与特定合同匹配。
- 决定谁有资格获得贷款。
这篇论文的作者说:“别再这样做了。”
他们认为,让一位通用型天才去从事这些具体、重复且基于规则工厂工作,是低效、昂贵且危险的。相反,他们提出了一种组织工厂的新方式。
问题所在:“瑞士军刀”与“专用工具”之争
论文指出,将大型语言模型视为“单体引擎”(即一个包揽万事的单一巨型大脑),在企业任务中是一个错误。
类比:
把大型语言模型想象成一位能烹饪世间万物的主厨。
- 当前的做法: 你不仅让主厨烹饪美食,还让他数清一袋米里确切有多少粒米,检查储藏室里每个罐头的保质期,并整理税务报表。
- 结果: 主厨会疲惫不堪,犯错(比如数错米粒),雇佣成本高昂,而且你很难轻易查明他犯错的原因,因为他的大脑是一个“黑箱”。
论文提出的解决方案:
不要让主厨去数数和整理文件。只让他与员工沟通。
- 雇佣一位专业助理(即小型语言模型或SLM),他的唯一工作就是倾听客户需求并准确记录(例如:“客户需要 500 个 A 型小部件”)。
- 将这张便条发送给数据库(即知识库),其中存储着确切的价格和库存信息。
- 将这张便条发送给计算器(即符号程序),由它来进行计算。
- 主厨仅在离线状态下用于训练助理或编写规则,而不是每一秒都去运营工厂。
三层工厂架构(提出的架构)
论文建议将人工智能系统拆分为三个截然不同、相互独立的层级:
1. 接口层(“翻译官”)
- 是什么: 一个小型、廉价、专用的 AI(SLM)。
- 工作: 它将杂乱无章、非结构化的输入(例如一封写着“我需要为坏掉的烤面包机退款”的邮件)转化为清晰、结构化的事实列表(例如:
操作:退款,物品:烤面包机,原因:损坏)。 - 为什么: 它速度快、成本低,且只需把一件事做好。
2. 知识层(“图书馆”)
- 是什么: 传统数据库或知识图谱。
- 工作: 它存储事实。它知道退款政策、烤面包机的价格以及客户的历史记录。
- 为什么: 事实经常变化。如果你更新数据库,新规则会立即生效。如果你试图通过重新训练来“教”AI 新规则,那需要数天时间,而且它可能会忘记旧规则。
3. 计算层(“计算器”)
- 是什么: 标准的计算机代码和逻辑规则。
- 工作: 它进行数学运算并检查规则。“如果烤面包机损坏且在保修期内,则批准退款。”
- 为什么: 计算机在数学和逻辑方面是完美的。它们不会像 AI 有时那样“产生幻觉”(即凭空捏造)。
为什么这样更好(“是什么”背后的“为什么”)
论文运用了一些复杂的数学来证明三个主要观点,我们可以将其简单翻译如下:
1. “记忆”问题
- 主张: AI 模型拥有的“大脑空间”(参数)是有限的。它无法记住一家大型公司的每一条规则、政策和事实。
- 类比: 你无法把整个国会图书馆塞进一个人的脑子里。如果你试图这样做,他会遗忘或混淆内容。
- 解决方案: 将图书馆(知识库)保持独立。AI 只在需要时查阅书籍。
2. “数学”问题
- 主张: AI 擅长猜测句子中的下一个词,但不擅长进行精确的、逐步的逻辑推理或复杂的数学运算。
- 类比: 让 AI 做长除法,就像让一位诗人去造桥。他们或许能写出一首关于桥的优美诗歌,但桥会坍塌。
- 解决方案: 让 AI 撰写请求,但让计算器(代码)去造桥。
3. “问责”问题
- 主张: 如果巨型 AI 犯了错,很难知道原因。它是忘记了规则?还是猜错了?
- 类比: 如果一台巨型机器人撞毁了,你必须把整个机器人拆散才能找到那个坏掉的齿轮。
- 解决方案: 在新系统中,如果“翻译官”犯了错,你就修复翻译官;如果“计算器”犯了错,你就修复代码。你无需重新训练整个系统。
何时应该使用这种方法?
论文提供了一份清晰的指南,说明何时使用这种“专业团队”方法,何时直接使用“主厨”(大型 LLM)。
| 使用专业团队(SLM + 数据库 + 代码) | 使用主厨(大型 LLM) |
|---|---|
| 高吞吐量: 你每天有成千上万的请求。 | 低吞吐量: 你只有少数独特、怪异的问题。 |
| 严格规则: 你需要 100% 的准确性(例如银行、合规)。 | 创意工作: 你需要头脑风暴或开放式想法。 |
| 事实变更: 规则经常变化(例如新法律、新价格)。 | 无事实依据: 答案取决于观点或创意,而非事实。 |
| 审计需求: 你需要证明决策确切的原因。 | 探索阶段: 你只是在测试想法。 |
“离线”秘密武器
论文还提到,那位昂贵的大型“主厨”(前沿 LLM)仍然有工作要做,但这是一份离线工作。
- 它不再每一秒都运营工厂,而是坐在安静的房间里。
- 它帮助编写“计算器”的规则。
- 它帮助设计“翻译官”的表单。
- 一旦规则编写完毕,主厨就回去休息,而由廉价、快速、专业的团队来主持大局。
总结
这篇论文认为,对于商业任务,别再试图将整个世界的所有知识和逻辑塞进一个巨大的 AI 大脑中。
相反,要组建一个团队:
- 一个小型 AI负责倾听和翻译。
- 一个数据库负责存储事实。
- 一个计算器负责执行逻辑。
这使得系统更便宜、更快、更准确,也更容易获得信任。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。