← 最新论文
🤖 machine learning

Feedback-to-Rubrics: Can We Learn Expert Criteria from Inline Comments?

本文提出并评估了一种从累积的行内注释中自动推断可复用自然语言评分标准的方法,证明这些提炼出的标准能够在真实场景和受控环境中有效支持注释预测、评分标准理解以及自动工件修订。

原作者: Kotaro Yoshida, So Kuroki, Yuki Imajuku, Taishi Nakamura, Ryunosuke Iwai, Haruki Goda, Takuya Akiba

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Kotaro Yoshida, So Kuroki, Yuki Imajuku, Taishi Nakamura, Ryunosuke Iwai, Haruki Goda, Takuya Akiba

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一家出版社的初级编辑。你面前有一叠手稿,但你并不确切知道资深编辑们究竟在寻找什么。你见过他们在旧稿上用红笔做的标记(行内批注),却从未有人告诉你这些标记背后的规则。你知道他们会圈出一句话并写下“太模糊”,但你不知道这究竟意味着“提供更多数据”、“解释逻辑”还是“引用来源”。

这篇题为《从反馈到评分标准》(Feedback-to-Rubrics)的论文,旨在让计算机仅通过观察那一堆红笔标记,就能推断出这些隐藏的规则。

以下是他们所做工作的分解,使用了简单的类比:

1. 问题所在:“隐性”的秘诀

通常,当专家(如资深编辑或科学家)评审工作时,他们脑海中有一套关于何为好坏的清单。但他们很少将这份清单写下来。这是一种“隐性”知识——就像一位厨师知道汤需要加更多盐,但若不先尝一口,就无法确切解释为什么加多少

大语言模型(LLMs)擅长写作,却不擅长猜测这些隐藏的、未成文的规则。如果你要求人工智能“让这变得更好”,它可能会改错地方,因为它不了解专家偏好的具体“风味”。

2. 解决方案:将“划痕”转化为“食谱”

作者提出了一种学习这些规则的新方法。与其让人类去编写规则手册(这很难,因为他们不知道如何解释自己的直觉),不如直接查看专家已在数千份草稿上留下的行内批注

将行内批注想象成地图上的划痕

  • 旧方法: 试图通过观察整张地图来猜测宝藏的位置。
  • 本文的方法: 查看每一个划痕,推断出制图者正在寻找何种宝藏,然后绘制一张新的、清晰的“藏宝图”(即评分标准),明确说明该去哪里寻找。

3. 机器如何学习:“猜测、检查与修正”循环

该方法的工作原理,就像学生通过做练习题并核对答案来备考一样。

  1. 初步猜测: 计算机查看一堆旧草稿及其上的批注。它尝试根据所见内容编写一份粗略的“规则手册”(评分标准)。
  2. 模拟: 随后,计算机假装成一位专家。它拿一份草稿,阅读自己的规则手册,并尝试在上面写下批注。
  3. 现实检验: 它将自身的批注与人类专家实际撰写的批注进行比较。
    • 计算机是否遗漏了人类指出的某个要点?
    • 计算机是否抱怨了人类忽略的某些内容?
  4. 修正(关键步骤): 这是最重要的一步。计算机不仅仅是说“我错了”。它会仔细查看其规则手册中究竟是哪一条规则导致了错误。
    • 类比: 想象你正在学习烘焙蛋糕。你尝了一口,发现太咸了。与其只说“蛋糕坏了”,你意识到:“啊,我写的规则是‘加一撮盐’,但我实际需要的是‘每杯面粉加一撮盐’。”
    • 计算机据此更新其规则手册,使其更加具体,增加边界和示例,以免下次再犯同样的错误。

他们反复进行这一过程(迭代),不断打磨规则手册,直到它完美模仿专家的风格。

4. 他们的发现(结果)

作者在九种不同类型的写作中测试了该方法,从研究计划书到医疗聊天记录。他们发现了三点主要结果:

  • 更优质的批注: 当他们利用计算机学习到的规则手册来生成反馈时,其反馈比计算机没有规则手册或仅查找类似过往批注时要准确和有用得多。
  • 更清晰的规则手册: 最终的规则手册不再仅仅是“要清晰”这样模糊的点子列表。它变成了一份详细、具体的指南(例如,“如果研究问题过于宽泛,请指出需要明确具体的范围”)。它实际上捕捉到了专家的“秘诀”。
  • 更优质的修订: 当他们将这份学习到的规则手册交给人工智能,并要求其修改一份糟糕的草稿时,人工智能在改进文本以符合人类专家期望方面,表现要好得多。

5. 核心结论

这篇论文表明,你无需要求专家编写关于如何评审事物的手册。你只需将他们的过往笔记(批注)喂给计算机,让它反复玩“猜规则”和“修正错误”的游戏,它最终将学会一套可复用的、成文的准则,从而捕捉到他们的专业知识。

他们没有做的事情:

  • 他们未将此方法应用于医疗诊断或临床治疗。
  • 他们并未声称这将完全取代人类编辑。
  • 他们并未表示这适用于任何类型的数据,仅适用于带有行内批注的文本草稿。

简而言之:他们教会了计算机在人类反馈的字里行间进行解读,并将那些杂乱的笔记转化为一份清晰、可用的操作手册。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →