← 最新论文
🤖 AI

SAGE: Scalable AI Governance & Evaluation

SAGE 是一个可扩展的 AI 治理框架,它通过政策、先例与 LLM 代理判官之间的双向校准循环,将高质量的人类判断转化为可操作性,并利用高性价比的蒸馏技术,实现了 LinkedIn 搜索中符合政策对齐的模型评估,最终使日活跃用户数提升了 0.25%。

原作者: Benjamin Le, Xueying Lu, Nick Stern, Wenqiong Liu, Igor Lapchuk, Xiang Li, Baofen Zheng, Kevin Rosenberg, Jiewen Huang, Zhe Zhang, Abraham Cabangbang, Satej Milind Wagle, Jianqiang Shen, Raghavan Muth
发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Benjamin Le, Xueying Lu, Nick Stern, Wenqiong Liu, Igor Lapchuk, Xiang Li, Baofen Zheng, Kevin Rosenberg, Jiewen Huang, Zhe Zhang, Abraham Cabangbang, Satej Milind Wagle, Jianqiang Shen, Raghavan Muthuregunathan, Abhinav Gupta, Mathew Teoh, Andrew Kirk, Thomas Kwan, Jingwei Wu, Wenjing Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家大型报纸(LinkedIn)的总编辑,这家报纸每天发布数百万篇文章(职位和个人资料)。你的目标是确保当读者搜索特定内容,例如“入门级数据分析师”时,他们得到的是那篇完美的文章,而不仅仅是随机出现的、恰好包含这些关键词的文章。

问题在于:你的文章太多,读者也太多了。你无法让一名人类编辑去阅读每一个搜索结果以检查其质量。如果你尝试使用简单的数学方法(比如统计点击量),你可能会被那些虽然热门但并不相关的文章所误导。

这就是 SAGE 的故事——这是 LinkedIn 开发的一套新系统,旨在解决这个问题。把 SAGE 想象成一个**“超级编辑”**,它学会了像人类专家一样思考,但拥有机器般的速度。

以下是它的工作原理,分为几个简单的步骤:

1. 问题所在:“人类与机器人”的差距

通常,当公司构建搜索引擎时,他们依赖两件事:

  • 人类编辑: 他们擅长判断质量,但速度慢且成本高。他们无法阅读数百万个结果。
  • 参与度指标: 他们统计点击和浏览量。但这就像是通过票房来评价一部电影;如果人们是误点,一部烂片依然可能很受欢迎。这并不能告诉你这部电影是否真正优秀。

LinkedIn 需要一种既能获得人类的质量判断力,又能拥有机器的速度的方法。

2. 解决方案:“SAGE”框架

SAGE 代表可扩展 AI 管理与评估(Scalable AI Governance & Evaluation)。它是一个由三个部分组成的团队,共同制定一套完美的“规则手册”来评判搜索结果。

A 部分:政策(规则手册)

这是一套用纯英文编写的规则集。它不再仅仅说“匹配关键词”,而是规定:“如果用户搜索的是入门级职位,那么结果中不得要求 10 年的工作经验。”它明确定义了什么是“好”。

B 部分:先例(样本答案)

想象一位老师给学生展示几篇带有完美评分和解释的范文。SAGE 使用了一组由人类专家精心挑选的“金标准”示例。这些示例向 AI 展示了如何将规则手册应用于复杂的实际情况。

C 部分:替代法官(学生)

这是一个充当法官的 AI(大语言模型)。它阅读搜索结果,并根据规则手册和样本答案进行对比。

3. 核心秘诀:“双向训练”

在过去,你只需告诉 AI 规则并寄希望于它能理解。SAGE 使用的是双向校准循环

  • 人类到 AI: 人类教导 AI 规则并展示示例。
  • AI 到人类: AI 甚至可以反过来批评人类!
    • 如果 AI 发现人类专家犯了错误(例如忽略了长篇职位描述中的隐藏细节),它会标记出来。
    • 如果 AI 因为规则模糊而感到困惑,它会告诉人类:“嘿,你们的规则手册没有涵盖这个特定案例。”

这创造了一个循环,使得规则手册示例AI 法官 共同变得更加聪明。它们互相修正错误,直到达成几乎完全一致(与人类专家的达成率约为 77%,这在这一领域被认为是“实质性的”)。

4. 速度技巧:“蒸馏”(从老师到学生)

“老师”AI(那个从人类那里学习的 AI)非常聪明,但运行起来既慢又昂贵。它就像一位天才教授,需要花几个小时来批改一篇论文。而 LinkedIn 需要每秒钟评判数百万份论文。

因此,他们使用了**“蒸馏”**技术(Teacher to Student)。

  • 想象一下,老师(天才教授)向学生(高效的实习生)解释其思考过程。
  • 学生学习模仿老师的逻辑,但变得更小、更快。
  • 结果: 学生法官的成本比老师低 92 倍,速度也更快,但它得到正确答案的频率仍然几乎与人类专家持平。

5. 它如何改变了 LinkedIn

在构建好这个快速、智能的学生法官后,他们将其用于三种强大的方式:

  1. 安全网(离线测试): 在发布新的搜索功能之前,他们会让该功能通过学生法官的测试。如果 AI 说:“这个新功能显示的结果很差,”他们可以立即停止。他们不必等待真实用户来投诉。这把他们的测试时间从 2 周缩短到了 3 天。
  2. 实时守门员(在线服务): 他们进一步压缩了 AI,使其足够微小,以便能够实时运行。现在,每次你进行搜索时,一个微型版本的 AI 都会即时检查结果,以确保它们符合规则。
  3. 预警系统: 他们利用 AI 24/7 全天候监控系统。有时,某个搜索更新根据点击量来看似乎没问题,但 AI 会察觉到质量正在下降。它捕捉到了人类指标所忽略的问题,防止了糟糕的用户体验。

总结

通过使用这个系统,LinkedIn 不仅仅让搜索变得“更快”,还让它变得更聪明、更可靠

该论文声称,通过使用 SAGE 来执行高质量规则,他们观察到 LinkedIn 的日活跃用户数增加了 0.25%。在拥有数亿用户的平台世界里,这小小的百分比代表了庞大的用户基数,他们找到了想要的东西,留在了网站上,并持续回来。

简而言之: SAGE 将“决定什么是好的搜索结果”这一混乱且主观的工作,转化为了一个清晰、自动化且具备自我学习能力的规模化流程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →