Solving Zebra Puzzles Using Constraint-Guided Multi-Agent Systems
本文介绍了 ZPS,这是一个约束引导的多智能体系统,它将大语言模型与现成的定理证明器相结合,用于生成并优化用于解决复杂斑马谜题(Zebra puzzles)的 SMT 代码,展示了其相对于独立大语言模型在准确率上的显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解决一个非常棘手的逻辑谜题,比如著名的“斑马谜题”(Zebra Puzzle)——你需要根据一些令人困惑的句子,弄清楚谁住在哪个房子里、房子的颜色是什么、他们养了什么宠物,以及他们从事什么运动。
这篇论文是关于如何教计算机(具体来说是大型语言模型,即 LLM)更好地解决这类谜题,而不仅仅是靠它自己。以下是他们实现这一目标的简单解释:
问题所在:计算机会感到困惑
把 LLM 想象成一个非常聪明、博学多才的学生,他擅长写论文,但有时在处理严格的数学规则时会感到吃力。当你要求它解决逻辑谜题时,它会尝试根据模式来猜测答案。
- 问题在于: 逻辑谜题需要完美的精确度。如果学生误解了一个微小的线索(例如“养鱼的人住在猫的左边”),整个答案就会崩塌。
- 结果: 单独行动时,这个计算机学生大约只能答对 24% 的题目。这就像一个掌握了词汇量但计算总出错的学生。
解决方案:专家团队
作者构建了一个名为 ZPS(斑马谜题求解器) 的系统。他们没有让一个计算机承担所有工作,而是创建了一个由三个智能体(专门的 AI 工作人员)组成的团队,他们像建筑施工队一样协同工作:
建筑师(分解智能体/Decomposition Agent):
- 角色: 这个智能体阅读混乱、令人困惑的谜题线索,并将其拆解成细小、易于处理的蓝图。它将混乱的局面整理成一份清晰的规则清单。
- 类比: 想象一位工头,他将一堆杂乱无章的指令分类整理成整齐、贴好标签的箱子,以便工人知道该做什么。
翻译官(求解智能体/Solver Agent):
- 角色: 这个智能体获取整理好的规则,并将它们转化为一种严格的、计算机可读的语言,称为 SMT-LIB。这是一种逻辑机器能完美理解的语言,没有任何歧义空间。
- 类比: 这就像一位翻译,将模糊的故事转化为精确的数学方程。
法官(定理证明器/Theorem Prover):
- 角色: 这不是 AI;它是一个标准的、现成的逻辑引擎(类似于逻辑领域的超级快速计算器)。它接收来自翻译官的严格方程,并检查这些方程是否有效。
- 类比: 这是一位严厉的数学老师,负责检查作业。如果答案错了,老师不会只说“不对”,还会指出逻辑在哪里失效了。
秘诀:反馈循环
神奇之处在于这些智能体通过一个循环进行对话:
- 建筑师拆解谜题。
- 翻译官编写规则代码。
- 法官尝试求解。
- 如果法官发现错误(例如:“这段代码有语法错误”或“此解法与线索 #3 矛盾”),它会将工作发回给翻译官。
- 翻译官修复错误并再次尝试。
- 他们不断重复这个过程,直到法官说:“完美。”
把它想象成一位雕塑家在从大理石块中凿刻的过程。如果他们碰到了裂纹(错误),他们会调整凿子(翻译方式)并再次尝试。他们不是在瞎猜,而是根据即时的、硬性的事实来完善作品。
结果:巨大的提升
作者在 114 个不同的谜题上测试了这个团队方法,并使用了三种不同的 AI 模型(GPT-4, GPT-3.5 和 Llama3)。
- 使用团队前: GPT-4 在独自求解时大约只能答对 24% 的谜题。
- 使用团队后: 在逻辑引擎和反馈循环的帮助下,GPT-4 正确解决了 63% 的谜题。
- 增益: 这是 166% 的提升。这就像一个原本只能拿 D 的学生,因为有了导师和严格的评分员的帮助,突然拿到了 A+。
他们是如何检查工作的
为了确保他们的计算机评分系统是公平的,他们聘请了一组人类学生来为样本谜题评分。他们将人类的评分与计算机的评分进行了对比。
- 发现: 计算机评分员几乎总是与人类保持一致(超过 85% 的时间)。这证明了他们的自动化系统是可靠的,不需要人类去检查每一个答案。
总结
这篇论文表明,虽然 AI 擅长理解语言,但它需要严格逻辑方面的辅助。通过将“聪明”的 AI(理解线索)与“严格”的逻辑机器(检查数学)结合起来,并让它们相互纠错,他们创造了一个比 AI 单独行动能更好地解决复杂逻辑谜题的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。