← 最新论文
💻 computer science

DD-GEPA: Prompt Optimization for Dialogue Disentanglement Focusing on Task Instruction and Utterance Representation

本文介绍了 DD-GEPA,这是一个自动提示词优化框架,它通过使用 GEPA 方法系统地改进任务指令和话语表示,来增强大语言模型在对话解耦方面的性能。

原作者: Naoki Takada, Tatsunori Mori

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Naoki Takada, Tatsunori Mori

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个像 Slack 或 WhatsApp 这样的即时通讯应用中繁忙的群聊。多个人同时在讨论完全不同的事情:一个人在询问如何修复电脑错误,另一个人在筹划派对,第三个人在分享一个有趣的表情包。因为每个人都在同时打字,这些对话会“缠绕”在一起,变成一段冗长且混乱的文本流。

问题:解开乱麻
论文称之为“对话解缠”(Dialogue Disentanglement)。这项任务的工作是将那段混乱的流文本重新分类成独立的、连贯的对话。你可以把它想象成一位图书管理员,试图将不同家庭混杂在一起的信件重新分拣到正确的信封中。

长期以来,计算机在这方面表现很差。它们会产生混淆,误以为关于派对的评论是在回复电脑错误。

新工具:“聪明”的图书管理员
作者使用了一个大语言模型(LLM)——一种能够像人类一样阅读和写作的高级人工智能——来充当这位图书管理员。他们希望这个 AI 能自然地理解谁在和谁说话。然而,如果只是简单地要求 AI “把这些消息分类”,它的表现并不理想。这就像是给一位新来的图书管理员一堆乱七八糟的邮件,然后对它说:“去搞定它吧”,而没有给出任何具体的规则。

解决方案:DD-GEPA(自动教练)
论文介绍了一种名为 DD-GEPA 的新方法。与其让人们花费数周时间去猜测给 AI 最好的规则集,这种方法让 AI 通过自我教学 来掌握最佳规则。

以下是其工作原理,我们使用烹饪作为类比:

  1. 食谱(提示词/Prompt): 要让 AI 对消息进行分类,你必须给它一个“提示词”。这个提示词就像一份食谱,它由三个主要部分组成:

    • 任务指令: “我们要制作什么菜?”(例如:“将这些消息分成组。”)
    • 食材清单(话语表示/Utterance Representation): “我们如何呈现数据?”(例如:“这里有消息内容、时间以及发言人的姓名。”)
    • 摆盘说明(输出指令/Output Instruction): “最终的成品应该长什么样?”(例如:“以特定的 JSON 格式给出答案。”)
  2. 试错: 在过去,人类必须反复手动调整这三个部分的食谱,以观察哪种效果最好。这个过程既缓慢又具有随机性。

  3. 自动教练(GEPA): 作者使用了一个名为 GEPA 的系统。想象一下,有一个严格但乐于助人的教练站在 AI 身边。

    • 教练给 AI 一批混合在一起的测试消息。
    • AI 使用它当前的“食谱”尝试进行分类。
    • 如果 AI 犯了错,教练不仅仅是说“错了”,教练还会分析它为什么失败,并建议对食谱进行具体的修改。
    • 也许教练会说:“你漏掉了这个连接,是因为食材列表不够清晰。让我们重写‘食材清单’这一部分。”
    • 或者,“你得到了正确答案,但格式写错了。让我们修正一下‘摆盘说明’。”
  4. 结果: 系统会自动重复这个过程。它调整指令、测试指令、从错误中学习,然后再次调整。最终,它找到了一个“完美的食谱”,AI 遵循该食谱进行对话分类,准确率极高。

他们的发现

  • 优于人类直觉: 计算机自己找到的食谱(DD-GEPA)比人类专家亲手编写的最佳食谱更擅长分类对话。
  • “开源”挑战: 作者在一个较小的、免费使用的 AI 模型(约 300 亿参数)上进行了测试。即使是使用这个较小的模型,经过自动教练优化后的食谱也显著提升了其表现。然而,它仍然无法完全超越一个被给予了人类编写食谱的庞大、昂贵的专有 AI 模型(如 GPT-5)。
  • 局限性: 系统遇到了瓶颈。在达到一定程度后,AI 无法再找到更多的改进空间。作者怀疑这是因为测试数据不够难,无法迫使 AI 学习更复杂的规则,或者是因为“教练”看到的错误类型不够多样,导致无法进一步学习。

总结
这篇论文表明,与其让人类费力地为 AI 编写完美的指令来解开聊天日志,我们可以让 AI 优化它自己的指令。通过将指令分解为三个部分,并根据错误进行自动优化,即使是较小的、更易获取的 AI 模型,也能获得更智能的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →