Evo-DKD: Dual-Knowledge Decoding for Autonomous Ontology Evolution in Large Language Models
Evo-DKD 是一个新颖的框架,它通过利用大语言模型中的双解码器机制来同时生成结构化编辑和自然语言解释,并经由动态门控系统进行协调以及在闭环推理回路中进行验证,从而实现自主本体演化,并在精度和下游任务性能方面超越了单流基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座巨大且混乱的图书馆,书本在不断地被编写,但其编目系统却还停留在石器时代。在这座图书馆中,“本体论”(ontologies)就像是一套严密的分类系统——它规定了事物之间如何关联(例如,规定“狗”是一种“哺乳动物”,而“哺乳动物”需要“食物”)。保持这套目录的更新对人类来说是一场噩梦,因为世界变化太快;事实每秒都在涌现,而手动更新分类系统既缓慢又枯燥。
于是,“大语言模型”(LLMs)登场了。可以将它们想象成超级聪明、求知欲极强的读者,它们几乎读遍了图书馆里的所有内容。它们能瞬间理解新的故事和事实。然而,问题在于:虽然它们擅长聊天和写故事,但却不擅长遵循严格的分类规则。如果要求它们更新目录,它们可能会捏造事实(这个问题被称为“幻觉”),或者将信息写成杂乱的段落,而不是整洁的结构化条目。科学家们正在探讨的一个核心问题是:我们能否教会这些超级读者不仅能“知道”事物,还能完美地“组织”它们,而无需人类在一旁手把手地指导?
这就是名为 Evo-DKD 的新思路。这项研究背后的研究人员 Vishal Raman、Vijai Aravindh R 和 Abhijith Ragav 提出了一种巧妙的方法,让这些 AI 模型像是一个由两名专家组成的协作团队。与其让一个大脑承担所有工作,不如模拟一个“双解码器”(dual-decoder)系统。想象一个建筑施工队,其中一名工人是严谨的建筑师,只使用蓝图和测量数据进行交流(即“结构化解码器”);而另一名则是健谈的工头,用通俗易懂的英语解释为什么要这样建造(即“非结构化解码器”)。
在这种设定下,“建筑师”会提议添加一条新事实(例如“Ozempic 有助于减轻体重”),而“工头”会立即写下一句话来解释其原因(“医生推荐 Ozempic 是因为……”)。一个特殊的“门控机制”——可以把它想象成交通灯或裁判——决定何时听从建筑师,何时听从工头。最棒的部分在于,工头的解释被用来复核建筑师的蓝图。如果解释讲不通,新事实就会被拒绝。这创造了一个“闭环”,即 AI 自我检查工作、更新数据库,然后利用这些新知识更好地回答未来的问题。
研究人员使用了一个较小的 AI 模型(TinyLlama-1.1B)进行了测试,因为他们无法使用大规模的超级计算机。他们并没有构建两个独立的物理大脑,而是利用一种巧妙的提示词(prompt)技巧,在单一的文本流中模拟这个双解码器团队。他们在三个不同的领域测试了这种方法:医疗保健(医学事实)、语义搜索(弄清楚人们搜索时的真实意图)以及文化遗产(历史与文物)。
结果令人鼓舞,尽管作者也谨慎地指出这目前仍是一种模拟。当他们将这个“双解码器”团队与仅使用蓝图说话的模型或仅使用段落说话的模型进行对比时,这个团队胜出了。在测试中,双解码器方法在“宽松准确度”(意味着即使措辞略有不同也能获取正确事实)上达到了 0.97 的得分,在“精确准确度”上达到了 0.93 的得分。它还产生了更好的解释,在语义相似性测试(BERTScore)中得分 0.88,在评判者评分中得分 0.76。
例如,在医疗场景中,当 AI 被告知“Ozempic 有助于管理体重减轻”时,系统并不仅仅是盲目地将其加入数据库。它生成了结构化事实 (Ozempic, manages, weight),同时写道:“医生推荐 Ozempic 是为了帮助糖尿病患者控制体重减轻。”当他们使用这个新知识测试搜索引擎时,该系统终于能够回答关于糖尿病患者减重药物的问题,而在此之前,它对此一无所知。
然而,论文也明确指出了其局限性。这还不是解决一切问题的魔杖。该系统依赖于 AI 内部的知识,因此如果 AI 本身不知道某个事实,它就无法正确地创造出它。此外,由于“验证”步骤是由 AI 自身完成而非人类完成,这意味着它还不能百分之百保证真理性。研究人员建议,未来可以将此技术与外部搜索引擎或人工审核相结合,以使其更加安全。但就目前而言,Evo-DKD 提供了一条引人入胜的路径:教导 AI 用两种声音(一种严谨,一种健谈)进行自我对话,从而构建一个更智能、能自我更新的人类知识库。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。