Reliable AI Needs to Externalize Implicit Knowledge: A Human-AI Collaboration Perspective
本立场论文主张,实现可靠的人工智能需要开发“知识对象”以将隐性知识外化并结构化,从而使人能够验证当前无法核查的关键推理模式,并为随时间提升人工智能的可信度开辟一条可扩展的路径。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和日常类比对该论文的解读。
核心问题:“黑盒”厨师
想象你雇佣了一位天才厨师(即人工智能)来烹制一顿复杂的菜肴。这位厨师品尝过来自世界各地数百万家餐厅的菜肴。他们确切地知道如何搭配风味、何时加盐,以及如何挽救烧焦的酱汁。
然而,这里有个陷阱。这位厨师是通过观察数百万人烹饪而学会这些技能的,而不是通过阅读正式的食谱。
- 显性知识(食谱): 这是厨师可以指出的内容。“食谱上写着加两杯面粉。”厨师可以向你展示书中的那一页。这很容易核查。
- 隐性知识(厨师的直觉): 这是厨师感觉到的内容。“加一撮盐,因为酱汁尝起来太酸了,”或者“别用这把刀,因为手柄摸起来太滑了。”厨师从未将这些写下来。这只是他们通过观察他人而习得的一种模式。
论文的核心主张:
目前,人工智能在利用这种“直觉”(隐性知识)来智能行事方面表现出色。但由于它从未被记录下来,我们无法核查它是否正确。 厨师可能在使用一项精湛的技巧,也可能是在模仿一家糟糕餐厅的坏习惯。由于那种直觉的“食谱”根本不存在,我们无法区分这两者。
这就造成了一个危险的鸿沟:人工智能能力很强,但我们无法信任它,因为我们看不见它如何决定要做什么。
为什么现有的解决方案行不通
该论文审视了人们试图解决人工智能可靠性问题的四种方法,并解释了它们为何无法解决这一特定问题:
- 查阅事实(RAG): 想象厨师被允许在烹饪时打开一本食谱。这有助于处理事实(例如“煎蛋卷里放几个鸡蛋”),但无助于直觉(例如“如何判断锅是否足够热”)。厨师仍然依赖其无形的直觉。
- 让厨师自我检查: 想象你问厨师:“你确定这个味道对吗?”厨师可能会说:“是的,我有 99% 的把握!”但如果厨师从一开始就学坏了习惯,他们会自信地宣称这个坏习惯是好的。他们无法发现自己的盲点。
- 训练厨师: 想象给厨师一套新的规则去遵循。这会改变他们的行为,但这些规则被锁定在他们的大脑(模型的参数)中。你无法窥探内部,看看是哪条规则让他们做出了某种行为。
- 给厨师一个笔记本(记忆): 想象厨师写下今天做了什么以便明天记住。但如果他们记下了一个错误,他们就会永远重复这个错误。笔记本无法告诉你这条笔记是“真”还是“假”。
共同的缺陷: 所有这些方法都将“直觉”困在人工智能内部。人类无法看见它、核查它或批准它。
解决方案:“知识对象”(KOs)
作者提出了一种新工具,称为知识对象(KO)。
把 KO 想象成厨师直觉的一张透明的“食谱卡”。
当人工智能利用其直觉解决问题时,它必须停下来,写下一张结构化的卡片,内容如下:
- 主张: “我对数据库使用了单例模式。”
- 推理: “我在高流量场景中看到其他 12 位专家都这样做了。”
- 限制: “这仅适用于 Java 应用程序,不适用于批处理。”
- 验证者: “爱丽丝(一位高级工程师)在 1 月 15 日检查过此内容,并回复‘批准’。”
这如何改变一切:
人工智能不再仅仅给你一个答案,而是给你答案加上展示其得出该答案过程的“食谱卡”。
- 让不可见变为可见: 你现在可以看到推理过程,而不仅仅是结果。
- 允许人类检查: 人类专家(如爱丽丝)可以查看卡片,并说:“是的,这是一个好的模式,”或者“不,这是一个危险的模式。”
- 节省时间(“累积”效应):
- 没有 KO: 每当一位新开发者向人工智能提问时,他们必须花费 30 分钟来核查人工智能是否正确。
- 有 KO: 爱丽丝只需检查一次。她在卡片上盖上“已验证”的印章。现在,接下来的 1000 位开发者看到卡片,看到爱丽丝的印章,并立即信任该答案。工作只做一次,但效益永久持续。
“代码助手”示例
论文使用了一个软件示例来解释这一点:
- 场景: 人工智能帮助程序员决定如何连接数据库。
- 旧方法: 人工智能说:“使用单例模式。”程序员必须猜测这是否安全,或者是否会导致系统崩溃。
- KO 方法: 人工智能说:“使用单例模式,”并展示一张卡片:“警告:如果超过 100 人同时使用,这会导致崩溃。已由高级工程师爱丽丝针对标准 Web 应用程序验证。未针对批处理作业验证。”
- 结果: 程序员确切地知道何时使用它,何时避免使用它。他们无需猜测。
总结
该论文认为,我们不能仅依赖人工智能,因为它的“大脑”包含太多隐藏的、未经验证的直觉。为了使人工智能可靠,我们需要强制其写下推理过程,采用人类可以核查的格式。
通过将隐藏的直觉转化为知识对象,我们将一次性的猜测转变为永久且可信的资产。它将人工智能从一个我们必须恐惧的“黑盒”,转变为一个协作伙伴,其中人类的判断被记录、共享,并随时间推移不断积累。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。