SAGE: Scalable AI Governance & Evaluation
SAGE 是一个可扩展的 AI 治理框架,它通过政策、先例与 LLM 代理判官之间的双向校准循环,将高质量的人类判断转化为可操作性,并利用高性价比的蒸馏技术,实现了 LinkedIn 搜索中符合政策对齐的模型评估,最终使日活跃用户数提升了 0.25%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一家大型报纸(LinkedIn)的总编辑,这家报纸每天发布数百万篇文章(职位和个人资料)。你的目标是确保当读者搜索特定内容,例如“入门级数据分析师”时,他们得到的是那篇完美的文章,而不仅仅是随机出现的、恰好包含这些关键词的文章。
问题在于:你的文章太多,读者也太多了。你无法让一名人类编辑去阅读每一个搜索结果以检查其质量。如果你尝试使用简单的数学方法(比如统计点击量),你可能会被那些虽然热门但并不相关的文章所误导。
这就是 SAGE 的故事——这是 LinkedIn 开发的一套新系统,旨在解决这个问题。把 SAGE 想象成一个**“超级编辑”**,它学会了像人类专家一样思考,但拥有机器般的速度。
以下是它的工作原理,分为几个简单的步骤:
1. 问题所在:“人类与机器人”的差距
通常,当公司构建搜索引擎时,他们依赖两件事:
- 人类编辑: 他们擅长判断质量,但速度慢且成本高。他们无法阅读数百万个结果。
- 参与度指标: 他们统计点击和浏览量。但这就像是通过票房来评价一部电影;如果人们是误点,一部烂片依然可能很受欢迎。这并不能告诉你这部电影是否真正优秀。
LinkedIn 需要一种既能获得人类的质量判断力,又能拥有机器的速度的方法。
2. 解决方案:“SAGE”框架
SAGE 代表可扩展 AI 管理与评估(Scalable AI Governance & Evaluation)。它是一个由三个部分组成的团队,共同制定一套完美的“规则手册”来评判搜索结果。
A 部分:政策(规则手册)
这是一套用纯英文编写的规则集。它不再仅仅说“匹配关键词”,而是规定:“如果用户搜索的是入门级职位,那么结果中不得要求 10 年的工作经验。”它明确定义了什么是“好”。
B 部分:先例(样本答案)
想象一位老师给学生展示几篇带有完美评分和解释的范文。SAGE 使用了一组由人类专家精心挑选的“金标准”示例。这些示例向 AI 展示了如何将规则手册应用于复杂的实际情况。
C 部分:替代法官(学生)
这是一个充当法官的 AI(大语言模型)。它阅读搜索结果,并根据规则手册和样本答案进行对比。
3. 核心秘诀:“双向训练”
在过去,你只需告诉 AI 规则并寄希望于它能理解。SAGE 使用的是双向校准循环。
- 人类到 AI: 人类教导 AI 规则并展示示例。
- AI 到人类: AI 甚至可以反过来批评人类!
- 如果 AI 发现人类专家犯了错误(例如忽略了长篇职位描述中的隐藏细节),它会标记出来。
- 如果 AI 因为规则模糊而感到困惑,它会告诉人类:“嘿,你们的规则手册没有涵盖这个特定案例。”
这创造了一个循环,使得规则手册、示例和 AI 法官 共同变得更加聪明。它们互相修正错误,直到达成几乎完全一致(与人类专家的达成率约为 77%,这在这一领域被认为是“实质性的”)。
4. 速度技巧:“蒸馏”(从老师到学生)
“老师”AI(那个从人类那里学习的 AI)非常聪明,但运行起来既慢又昂贵。它就像一位天才教授,需要花几个小时来批改一篇论文。而 LinkedIn 需要每秒钟评判数百万份论文。
因此,他们使用了**“蒸馏”**技术(Teacher to Student)。
- 想象一下,老师(天才教授)向学生(高效的实习生)解释其思考过程。
- 学生学习模仿老师的逻辑,但变得更小、更快。
- 结果: 学生法官的成本比老师低 92 倍,速度也更快,但它得到正确答案的频率仍然几乎与人类专家持平。
5. 它如何改变了 LinkedIn
在构建好这个快速、智能的学生法官后,他们将其用于三种强大的方式:
- 安全网(离线测试): 在发布新的搜索功能之前,他们会让该功能通过学生法官的测试。如果 AI 说:“这个新功能显示的结果很差,”他们可以立即停止。他们不必等待真实用户来投诉。这把他们的测试时间从 2 周缩短到了 3 天。
- 实时守门员(在线服务): 他们进一步压缩了 AI,使其足够微小,以便能够实时运行。现在,每次你进行搜索时,一个微型版本的 AI 都会即时检查结果,以确保它们符合规则。
- 预警系统: 他们利用 AI 24/7 全天候监控系统。有时,某个搜索更新根据点击量来看似乎没问题,但 AI 会察觉到质量正在下降。它捕捉到了人类指标所忽略的问题,防止了糟糕的用户体验。
总结
通过使用这个系统,LinkedIn 不仅仅让搜索变得“更快”,还让它变得更聪明、更可靠。
该论文声称,通过使用 SAGE 来执行高质量规则,他们观察到 LinkedIn 的日活跃用户数增加了 0.25%。在拥有数亿用户的平台世界里,这小小的百分比代表了庞大的用户基数,他们找到了想要的东西,留在了网站上,并持续回来。
简而言之: SAGE 将“决定什么是好的搜索结果”这一混乱且主观的工作,转化为了一个清晰、自动化且具备自我学习能力的规模化流程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。