← 最新论文
💬 NLP

SeDT: Sentence-Transformer Decision-Transformer Conditioning for Multi-Turn Conversation Reliability

本文介绍了 SeDT,这是一种无需训练的推理时方法,它利用基于句子变换器得出的相关性分数,使决策变换器模型能够针对多轮对话进行条件化,通过动态凸显关键约束有效缓解“对话迷失”现象,从而在多种大语言模型上显著提升性能与可靠性。

原作者: Ramakrishna Vamsi Setti, Jagadeesh Rachapudi, Sachin Chaudhary, Praful Hambarde, Amit Shukla

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ramakrishna Vamsi Setti, Jagadeesh Rachapudi, Sachin Chaudhary, Praful Hambarde, Amit Shukla

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《SeDT:用于多轮对话可靠性的句子 - 变换器决策 - 变换器条件化》的通俗解读,辅以生动的类比。

问题:对话中的“迷失”效应

想象你正在雇佣一位非常聪明但略显分心的厨师来烹饪一道复杂的菜肴。

  • 场景 A(单轮): 你递给厨师一张完美的食谱卡片,上面一次性列出了所有食材、每一步骤以及所有特殊的饮食限制。厨师做出一道完美的菜肴。
  • 场景 B(多轮): 你走进厨房说:“做一道意面。”厨师开始切菜。随后你又走进来说:“哦,顺便说一句,不要大蒜。”厨师点点头。你第三次走进来说:“其实,要辣一点的。”厨师再次点头。最后你说:“而且只用有机番茄。”

当厨师最终端出菜肴时,他可能会忘记中间对话中提到的“不要大蒜”这一规则,或者搞不清哪条指令最重要。

论文将这种现象称为“对话中的迷失”。研究发现,当大语言模型(LLMs)分多轮逐步接收指令时,其性能可能下降近40%

关键在于,论文发现模型并非丧失了“烹饪能力”(其“天赋”仅略有下降)。相反,它们变得不可靠。有时它们能正确完成;有时它们会胡乱猜测或忘记关键规则。这就像一位厨师 80% 的时候是天才,但 20% 的时候却搞得一团糟,而此前他们始终如一地表现出色。

为什么会发生这种情况?
论文认为问题出在结构上。当对话被保存时,它看起来像是一个扁平的文本列表。对人工智能而言,你所说的每一句话都承载着完全相同的“权重”。它不知道你说的第三件事(“不要大蒜!”)是一个关键约束,而你说的第一件事(“做意面”)只是一个总体想法。人工智能将对话的中间部分视为背景噪音。

解决方案:SeDT(“高亮笔”方法)

作者提出了一种新方法,称为SeDT(句子 - 变换器决策 - 变换器)。他们并没有重新训练人工智能或改变其“大脑”。相反,他们改变了在人工智能给出最终答案之前,向它呈现对话的方式。

他们借鉴了离线强化学习(一个机器人从过去数据中学习的领域)中的一个概念,称为**“剩余回报”(Return-to-Go, RTG)**。

类比:藏宝图
想象对话是一场寻宝游戏。

  • 旧方法: 你给人工智能一份线索列表:“从橡树开始”、“走 10 步”、“在岩石附近挖掘”。人工智能只是按顺序阅读它们。
  • SeDT 方法: 在人工智能开始挖掘之前,你给它一张带分数的地图。在每个线索旁边,你写下一个数字,表示前方还有多少“宝藏”(相关性)。
    • 线索 1:“从橡树开始”(分数:低,因为真正的线索还在后面)。
    • 线索 2:“走 10 步”(分数:中等)。
    • 线索 3:“在岩石附近挖掘”(分数:,因为这是关键约束!)。

通过添加这些数字,人工智能突然“知道”对话的哪些部分最重要。它学会特别关注高分线索,并忽略无关紧要的内容。

SeDT 的工作原理(三种信号)

为了计算对话中每一部分的这些“分数”,SeDT 使用三种不同的“感官”来判断重要性:

  1. 语义感官(“含义”检查): 它使用一种智能工具(句子变换器)来理解文本的含义。这句话是否真的有助于解决最终问题?如果你要求一个 Python 函数,而有一句话是“让我们谈谈天气”,这句话得分很低。而“函数必须处理负数”这句话得分很高。
  2. 词汇感官(“关键词”检查): 它寻找匹配的词语。如果目标是“编写一个函数”,而上一轮对话提到“函数参数”,这就匹配了。这能捕捉到深层含义工具可能遗漏的特定技术术语。
  3. 位置感官(“中间”提升): 这是最巧妙的部分。人工智能模型天生会忽略长文本的中间部分(它们关注开头和结尾)。SeDT 为对话的中间轮次添加了一个特殊的“额外分数”。这迫使人工智能关注在聊天中间揭示的关键约束,防止它们丢失。

结果:更可靠的厨师

作者在三个不同的任务(编写代码、解决数学问题和进行 API 调用)中,针对三个不同的人工智能模型(分别来自 OpenAI、Google 和 Meta)测试了这种方法。

  • 结果: 在每一次测试中,SeDT 的表现都优于标准方法。
  • 提升幅度: 在某些情况下,性能提升了近38%
  • 可靠性: “不可靠性”(最佳表现与最差表现之间的差距)显著降低。人工智能再次变得稳定一致。

他们还添加了一个自我修正机制。如果人工智能发现对话非常“薄弱”(整体分数较低),它会触发第二次检查。一个“验证器”会审视答案并问道:“我们是否涵盖了所有重要的高分线索?”如果新答案比旧答案更好地涵盖了重要线索,它就替换答案;否则,保留原始答案。这确保了人工智能永远不会意外地使情况变得更糟。

为什么这很重要

论文声称,“对话中的迷失”问题并非因为人工智能太笨而无法理解;而是因为人工智能正在查看一个扁平的、未加权的文本列表。

通过简单地用相关性分数标注历史(告诉人工智能“这部分很重要,那部分不重要”),他们可以在无需重新训练模型、无需新数据、也无需更改模型代码的情况下,挽回大部分丢失的性能。

简而言之: 你不需要教人工智能如何更好地倾听。你只需要递给它一支高亮笔,并指出对话中哪些部分实际上很重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →