← 最新论文
🤖 AI

Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models

本文介绍了“深度交互”(Deep Interaction),这是一种高效的人机交互方法,允许用户直接编辑大语言模型中错误的推理步骤,并将修正后的思维链(Chain-of-Thought)蒸馏为提示词,与基准方法相比,其纠错成功率提高了 25%,且 Token 消耗减少了 40%。

原作者: Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个聪明但有点固执的机器人如何解决一个棘手的谜题。这个机器人是一个大语言模型(LLM),它是某种人工智能,读过了互联网上几乎所有的内容,并且可以写故事、解数学题,甚至模仿人类。为了帮助这些机器人更好地思考,科学家们发明了一种叫做“思维链”(Chain-of-Thought, CoT)的技术。把 CoT 想象成要求机器人“大声展示它的工作过程”,就像学生在写数学作业时写下每一步推导,而不是直接猜出答案一样。这使得机器人在处理复杂任务时变得更加聪明。

然而,这里有一个陷ula:有时,机器人在其十步计划中的第三步犯了错误。在旧的方法中,你必须与机器人聊天,对它说:“嘿,你第三步错了,”然后寄希望于它能听进去。但通常情况下,机器人只会说:“你是对的,我犯了个错误,”然后紧接着在下一步又犯下完全相同的错误,或者它会变得困惑并忘记剩下的计划。这就像是在试图纠正一个走错路的朋友,你在后面大喊大叫;他们可能听到了,但却一直在原地转圈。对于想要将 AI 用于严肃工作(如解决科学问题或检查安全逻辑)的人来说,这非常令人沮丧。

这就是深度交互(Deep Interaction)这一新概念出现的地方。深度交互不再仅仅是通过聊天来纠正机器人的错误,而是提出了一种方法,让你能像编辑文档一样直接编辑机器人的“思考过程”。想象一下机器人正在写一个故事,你可以高亮显示一个错误的句子,删除它,然后在那里输入正确的句子。系统会获取你编辑后的版本,对其进行清理,然后要求机器人从那个修正后的点继续写下去。研究人员发现,这种“直接编辑”的方法比旧的“聊天并寄希望于结果”的方法更快、更准确。在针对困难科学和数学问题的测试中,这种新方法将纠错成功率提高了 25% 以上(相对于基准方法的相对增幅),并且对于最终被成功解答的问题,其Token 使用量减少了约 40%(与基准方法相比)。

“仅仅聊天”的问题

当这些 AI 模型犯错时,通常的修复方式是进行对话。你告诉 AI,“那一步错了,”然后让它重试。但论文表明,这往往会失败。AI 可能会承认自己错了,但随后它会陷入循环,重复同样的错误,或者偏离到一个同样错误的新路径上。这就像一个 GPS 一直在说“正在重新计算路线”,但却把你送回了同一个交通拥堵点。作者认为,这是因为 AI 试图记住整个对话历史,导致过程变得混乱,或者是因为它只是在记忆其训练数据中的模式,而不是真正理解逻辑。

解决方案:编辑“思想”

作者提出了深度交互,这是一个将 AI 的推理步骤视为草稿文档的系统。其运作方式如下(用简单术语描述):

  1. 草稿: AI 生成一个带有思维链(即其逐步推理过程)的解决方案。
  2. 编辑: 如果你发现了错误,你不要只是在聊天框里输入消息。相反,你直接编辑 AI 推理过程中的文本。你可以删除一个错误的步骤,修改一个数字,或者修复一个逻辑漏洞,就像使用文字处理器中的“修订”功能一样。
  3. 清理: 系统足够聪明,能够识别你的更改。它会高亮显示你的编辑内容,删除你删除的部分,并清理任何混乱的残留文本。它还会遮蔽特定的数字,以防止 AI 仅仅是死记硬背旧的错误数字。
  4. 重启: 系统将你编辑后的版本作为新的指令反馈给 AI:“这是目前修正后的路径;请从这里继续。”

研究发现

研究人员在一些非常难的问题上测试了这种方法,包括来自高中和大学水平的数学、物理、化学和生物问题。他们将这种“深度交互”方法与标准的“基于聊天”的纠错方法进行了对比。

  • 更高的成功率: 新方法比仅仅聊天提高了 25% 以上的纠错成功率。例如,在一组困难的科学问题中,标准聊天法在尝试几次后大约有 72% 的概率得到正确答案,而深度交互法在尝试后能达到约 86% 的正确率。
  • 更快且更便宜: 因为 AI 不需要重新阅读一段冗长且混乱的对话历史,所以对于那些最终被正确解答的问题,它使用的 Token(AI 处理文本的单位)减少了约 40%。这使得过程更加高效。
  • 适用于不同模型: 他们在几种不同的 AI 模型上进行了测试,从较小的模型到非常大的模型。在每种情况下,直接编辑推理步骤的能力都比仅仅通过交谈让模型表现得更好。

为什么这很重要

论文指出,对于需要精确性的复杂任务(如解数学方程或分析安全场景),仅仅与 AI 交谈是不够的。我们需要一种能够直接“引导”其思考的方法。通过允许人类编辑推理步骤,我们可以引导 AI 远离错误,而不至于陷入“你是对的,我犯了个错误”之后又重复同样错误的循环中。

作者指出,这种方法依赖于人类能够识别错误。如果人类不知道哪里错了,他们就无法修复。此外,如果人类给出了错误的修正,AI 可能会跟随这条错误的路径。但是,对于了解相关领域的用户(如学生、教师或专家)来说,这种“深度交互”提供了一种全新的协作方式,将一次令人沮胆的对话变成了一次高效的编辑过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →