← 最新论文
💻 computer science

GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

本文提出了GrowLoop,这是一种自我演进对话评估系统,它利用最少的人工种子标注和迭代式大语言模型驱动的评分标准优化,持续适应不断发展的模型和变化的场景,从而克服静态基准在评估拟人化程度方面的局限性。

原作者: Yihang Lin, Yunze Gao, Zeyang Lin, Dongbo Li, Kun Peng, Chenglong Song, Yue Liu

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihang Lin, Yunze Gao, Zeyang Lin, Dongbo Li, Kun Peng, Chenglong Song, Yue Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何成为一位优秀的对话者。你希望它听起来自然、富有同理心,且充满人性。但问题在于:“像人”是一种感觉,而非数学公式。

如果你问一个人:“那个回复是否友善?”他们可能会回答“是”。再问另一个人,他们可能会说“不”。并没有唯一的“正确答案”,而且随着机器人变得更聪明、人类期望发生转变,关于什么算作“友善”的规则也在不断变化。

这正是阿里巴巴集团的 GrowLoop 论文试图解决的问题。他们构建了一个系统,该系统不仅仅是在“测试”机器人,而是随着机器人的进步,自学如何给机器人评分

以下是其工作原理的简单拆解:

1. 问题:“隐性知识”陷阱

将“像人”想象成骑自行车。你知道怎么做,也能判断别人是否骑得好。但如果你试图写一本手册,精确地解释如何保持平衡,你会很吃力。你拥有“隐性知识”——你知道的比你所能表达的更多。

现有的 AI 测试就像试图用一份僵化的检查清单(如“踩踏速度”和“车把角度”)来给骑行者评分。它们忽略了平衡的真实感觉。此外,随着机器人变得更好,测试也需要变得更难,但旧测试保持不变,从而变得无用。

2. 解决方案:“自进化”系统

GrowLoop 就像一个有生命、会呼吸的评分系统,与 AI 共同成长。它有两个主要部分,彼此互助,就像舞伴编舞者

  • 编舞者(评分标准): 这是规则手册。它定义了什么是“好”(例如,“要有同理心”,“不要提供医疗建议”)。
  • 舞伴(案例): 这些是用于测试 AI 的实际对话。

在过去,人类编写规则手册和测试题,它们一旦定稿便凝固在时间里。而在 GrowLoop 中,系统从少量人类示例中学习规则,然后编写自己的新测试题,以找出 AI 仍在失败的地方。

3. 它是如何学习的:“启发式学习”循环

想象你通过展示几篇范文(人类种子)来教一名学生(AI)。

  1. 系统阅读样本: 它观察人类是如何给这些范文评分的,并试图猜测人类使用的隐藏规则
  2. 编写规则手册: 它起草一份规则手册(评分标准)。
  3. 自我测试: 它使用这份规则手册再次给样本评分。
  4. “启发式”修正: 如果系统的评分与人类的评分不一致,它不会盲目猜测。它会问:“我为什么错了?我对‘同理心’的定义是否太模糊?”然后,它重写自己的规则手册,以修复这一特定的盲点。

它重复这一过程,直到系统的评分与人类的评分几乎完美匹配。

4. 处理分歧:“共识”与“分歧”区域

有时,人类会对什么是“好”产生分歧。

  • 区域 A(共识): 所有人都同意 AI 很粗鲁。系统必须与此保持一致。
  • 区域 B(分歧): 一个人认为 AI 太简短,另一个人认为它完美无缺。论文指出这没关系。系统不需要在此处强行得出一个唯一的“正确”答案。它只需要表明其判断是合理的,并且落在人类意见的范围内即可。

这就像才艺秀中的评委。如果评委们都同意歌手跑调了,歌手就失败了。如果评委们意见不一(有人喜欢这种风格,有人讨厌),歌手并不会仅仅因为没有获得一致投票而失败;他们只需要展示自己拥有合理的风格即可。

5. “双循环”进化

这是神奇的部分。系统有两个相互促进的循环:

  • 循环 1(规则驱动案例): 系统利用其新的规则手册生成新的、更难的测试题,专门针对 AI 的弱点。
  • 循环 2(案例驱动规则): 当 AI 接受这些新的、高难度的测试时,它可能会以规则手册未曾预料的方式失败。系统看到这种新的失败,向人类请求一个关于这种新失败的快速“种子”示例,并更新规则手册以纳入这条新规则。

类比: 想象一款电子游戏。

  • 旧方式: 游戏有固定的关卡。一旦你通关,游戏就“解决”了。
  • GrowLoop 方式: 一旦你通关一个关卡,游戏就会自动设计一个更难的关卡,专门针对你刚刚掌握的动作。如果你发现了一个漏洞(一种新的获胜方式),游戏会更新规则以修补该漏洞。游戏永远不会停止变得更具挑战性或更有趣。

6. 结果

该论文在开放式对话(如与朋友聊天)中测试了这种方法。

  • 更优的评分: GrowLoop 与人类评委的一致性远高于其他方法(如标准 AI 评委或人类编写的检查清单)。
  • 发现隐藏缺陷: 它发现了人类遗漏的错误。例如,在一个案例中,人类认为 AI 的回复没问题,但 GrowLoop 的规则手册将其标记为危险,因为 AI 表现得像医生(这是它不应该做的)。
  • 适应性: 它成功地区分了“好”模型和“坏”模型,并能确切地告诉你为什么一个模型很弱(例如,“擅长事实,但不擅长同理心”)。

总结

GrowLoop 是一个自我改进的评分系统。人类不再需要不断编写新的测试和规则,而是系统观察人类如何给少量示例评分,学习成为人类的“不成文规则”,编写自己的测试,并在 AI 进步或世界变化时更新自己的规则。它将 AI 的评估从静态考试转变为一个鲜活、不断成长的对话

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →