← 最新论文
💻 computer science

Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination

本文介绍了 G-Frame,这是一个由博弈论驱动的多智能体框架,它通过合成专门的训练数据,创造了 OmniChem——一个在科学领域达到 GPT-4o mini 级性能,并利用结构化、公理化推理显著减少幻觉的 7B 参数语言模型。

原作者: Runzhe Liu, Biquan Bie, Zihao Wang, Yuchao Ma, Yexin Liu, Xinghai Li, Harry Yang, Wenbo Yang, Jinzhe Cao, Shengyang Tao

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Runzhe Liu, Biquan Bie, Zihao Wang, Yuchao Ma, Yexin Liu, Xinghai Li, Harry Yang, Wenbo Yang, Jinzhe Cao, Shengyang Tao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明、反应极快的机器人助手,它能阅读数百万本书籍并在几秒钟内写出故事。但有一个陷阱:这个机器人有点爱做白日梦。当你问它一个棘手的科学问题时,它经常编造一些听起来非常完美、但实际上完全错误的事实。这被称为“幻觉”(hallucination),如果你试图设计新的药物或材料,这是一个巨大的问题。

你正在阅读的论文介绍了一个名为 G-Frame 的巧妙新系统,旨在解决这个“做白日梦”的问题。不要把 G-Frame 看作是一个单一的机器人,而要把它看作是一个像高风险游戏节目评审团一样协同工作的专业化智能体团队

问题所在:爱做白日梦的机器人

标准的 AI 模型就像是那些擅长记忆句子“看起来”是什么样,但完全不理解逻辑或物理严苛规则的学生。如果你要求一个轻量级(较小、较快)的 AI 模型设计一种化学反应,它可能会发明一个看起来真实但实际上根本无法存在的分子。论文指出,仅仅通过增大 AI 的规模或提供更多数据并不是解决问题的全部;AI 需要学会遵循“游戏规则”(公理化推理),而不是仅仅猜测下一个词是什么。

解决方案:游戏化团队

研究人员构建了 G-Frame,它使用两种主要的博弈策略来迫使 AI 停止做白日梦,开始进行逻辑思考:

  1. 团队游戏(“拆解”策略):
    想象一下,一个复杂的化学问题就像一座巨大且可怕的山。如果单个机器人试图独自攀登,可能会迷失方向并滑落。G-Frame 将这座大山分解成一个个微小、易于处理的步骤。它为处理任务的特定部分分配了不同的“智能体”(小机器人助手)。一个智能体负责清洗数据,另一个检查逻辑,第三个则充当严格的监督员。它们将工作传递下去,互相检查对方的作业。这防止了 AI 因为感到压力过大而在沉默中胡编乱造事实。

  2. 贝叶斯游戏(“聪明赌徒”策略):
    这部分就像一名根据新牌不断更新策略的扑克玩家。系统不仅仅是在猜测;它先做一个“先验”猜测(基于已知知识的最佳猜测),然后检查结果。如果结果看起来很奇怪,它就会更新自己的“信念”并再次尝试。它不断重复这个循环,不断优化决策,直到找到最符合化学严苛规则的逻辑答案。

结果:遇见 OmniChem

利用这种游戏化框架,团队训练了一个名为 OmniChem 的新型 70 亿参数 AI 模型。他们并没有只是喂给它随机的书籍;他们利用 G-Frame 生成了一个庞大的库,其中包含 363,045 条思维链(逐步推理指南)和 199,589 个问答对,专门针对化学领域。

结果令人印象深刻:

  • 性能表现: 在自定义化学测试和 ChemBench 基准测试中,OmniChem 的表现与著名的 GPT-4o mini 不相上下。
  • 更少的幻觉: 与其基础版本相比,OmniChem 将其“做白日梦”(幻觉)现象大幅降低了 79.46%
  • 现实世界技能: 该模型不仅擅长考试。它成功设计了一种吸收深红光的分子(用于生物成像),弄清楚了仅用两步即可合成常用麻醉剂利多卡因的方法,甚至还写了一份关于创造深蓝色材料的详细研究报告,其质量达到了顶级 AI 模型(如 GeminiGPT-o3)所写报告的 90%

这意味着什么

论文表明,通过将 AI 训练视为一种具有严格规则和团队协作的结构化游戏,我们可以教会更小、更快的模型成为可靠的科学家。它们不需要成为庞大、昂贵的超级计算机也能完成出色工作;它们只需要拥有正确的“游戏计划”。

研究人员甚至分享了他们的代码和数据,以便他人可以在自己的科学领域尝试这种“团队游戏”方法。这是一个非常有前景的新方法,旨在让 AI 成为发现过程中的可靠伙伴,而不仅仅是一个富有创造力的讲故事的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →