← 最新论文
🤖 AI

ReasonEdit: Editing Vision-Language Models using Human Reasoning

该论文介绍了 ReasonEdit,这是首个视觉语言模型编辑器,它利用存储在码本中并通过拓扑平衡的多模态嵌入方法进行检索的人类推理解释,从而在编辑重推理任务方面实现了最先进的性能。

原作者: Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代计算机在同时进行视觉识别与文本阅读方面已变得异常出色。这些被称为视觉语言模型的系统,能够观察照片并回答相关问题,或用文字描述场景。它们被用于协助医生诊断皮肤病、辅助学生完成家庭作业,以及引导机器人穿行于世界之中。然而,像任何智能系统一样,它们有时也会犯错。当错误发生时,传统的修复方式是从头开始重新训练整个系统,这一过程既缓慢又昂贵,且往往会导致计算机遗忘原本掌握良好的其他知识。科学家们一直在寻找一种无需如此高昂代价即可进行微小、精准修正的方法,这一研究领域被称为模型编辑。目前的挑战在于,虽然这些系统可以被教导去纠正简单的事实,但在涉及复杂推理时却表现挣扎——即当答案取决于连接多个视觉线索和逻辑步骤时。

一个研究小组开发了一种名为 ReasonEdit 的新方法来解决这一特定问题。这种新方法并非仅仅告诉计算机正确答案,而是要求人类用户解释为什么该答案是正确的。当用户发现错误时,他们会提供一段推理链,将思考过程分解为简单的、事实性的陈述。例如,如果计算机错误地识别了一种乐器,用户可能会解释说,该乐器具有圆形的琴身和长长的琴颈,而这些特征定义了某种特定类型的弦乐器。随后,系统会将这些解释与视觉证据(例如显示乐器琴颈的图像裁剪部分)一起存储起来。通过保存纠错背后的逻辑而非仅仅是纠错本身,系统学会了识别错误背后的潜在模式。

研究人员在四种不同的先进计算机模型上使用数千个视觉问题测试了这种方法。他们发现,当系统被允许在未来的任务中检索这些存储的推理步骤时,它能比以往的方法更准确地纠正错误。更重要的是,系统学会了泛化。它可以将同样的逻辑应用于看起来不同但共享相同推理结构的图像。如果系统学到了某种类型的木材既坚硬又具有韧性,那么即使该物体出现在全新的环境中,它也能在另一张完全不同的图片中正确识别出那种木材。这种基于推理而非仅仅基于视觉相似性的知识迁移能力,使系统能够处理以往此类编辑技术无法触及的复杂任务。

这一成功的关键在于研究人员组织信息的方式。他们发现,仅仅存储推理文本是不够的;系统需要理解这些文本如何与图像的具体部分相关联。为了实现这一点,他们开发了一种新的方法,用于映射单词与图像碎片之间的关系。他们将图像与描述之间的联系视为一个网络,确保系统能够快速找到正确的信息,而不会被看似相似但无关的图像或单词所干扰。这种精心的组织意味着,当计算机面临新问题时,它可以调取出所需的精确推理步骤,就像学生回想起特定的课程,而不是仅仅根据模糊的记忆进行猜测。

研究还表明,这种方法高效到足以进行实时使用。随着用户提供反馈和纠正,系统可以在不减速或不需要大量新计算能力的情况下持续进行自我更新。即使人类提供的推理略有瑕疵或包含额外信息,该方法依然表现稳健,这表明系统能够过滤掉噪声并专注于核心事实。研究人员证明,通过将人类推理视为宝贵的引导,他们可以创造出一个不仅能修复自身错误,还能学会避免未来类似错误的系统。这种方法标志着在使人工智能更具适应性和可靠性方面迈出了重要一步,特别是在理解答案背后的“为什么”与答案本身同样重要的领域。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →