Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems
本文介绍了 Litmus,这是一个零标签系统,它通过直接从源代码和针对性询问中提取意图,自动推导出具有合理依据且低冗余的 AI 流水线评估指标,从而在无需人工标签的情况下,在有效性和覆盖率方面超越了现有基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚刚建造了一台复杂的、多步骤的机器来解决一个难题——比如一个负责分类银行账户的金融机器人,或者一个在科学论文中寻找答案的研究助手。你启动了它,它开始运转了。但你如何知道它做得是否“好”呢?
通常,人们试图通过观察机器产出的最终产品来衡量其成功。这就像是在评价一名厨师时,只看最后端出的菜肴味道如何,却不去检查他是否使用了新鲜食材、烤箱温度是否合适,或者副厨是否正确地切好了洋葱。如果菜的味道不好,你并不知道“为什么”。是食材的问题?烹饪时间的问题?还是食谱的问题?
这就是 Litmus 这篇论文试图解决的问题。
问题所在:猜测规则
目前,当公司构建 AI 系统时,他们通常只是挑选一堆标准的“计分卡”(指标)来衡量性能。他们可能会问:“答案正确吗?”或者“速度有多快?”但他们往往忘记了首先要问最重要的几个问题:
- 这个机器的特定部分原本应该做什么?
- 它可能以怎样一种“看起来并不像失败”的方式发生失败?
- 哪些失败对业务真正重要?
如果没有这些答案,计分卡就像是一名在询问病人的症状或病史之前,就试图诊断病人的医生。他们可能会测量错误的对象,或者用错误的方式进行测量。
解决方案:Litmus(“审讯者”)
作者创建了一个名为 Litmus 的系统。不要把 Litmus 看作一把尺子,而要把它看作一名侦探或一位好奇的建筑师。
Litmus 不去猜测该测量什么,它做两件事:
- 阅读蓝图(代码): Litmus 查看 AI 系统的实际源代码。它绘制出机器中每一个房间、每一根管道和每一个开关的地图。它理解“房间 A”是用于检索数据的,“房间 B”是用于 AI 思考的,而“房间 C”是用于检查工作的。
- 提出正确的问题: 由于代码无法告诉你“意图”(即人类为什么要这样设计),Litums 扮演着采访构建者的侦探角色。它会提出澄清性的问题,例如:
- 如果 AI 找不到答案,它应该说“我不知道”(这是一种成功),还是说“错误”(这是一种失败)?
- 如果机器经常走备选路线,这是否可以接受,还是意味着某些东西坏了?
- 我们更担心的是速度还是准确性?
奇妙之处:将答案转化为规则
一旦 Litmus 获取了答案,它就会将这些答案视为硬事实。它利用这些事实为机器中的每一个特定“房间”设计一套定制的计分卡。
- 无需标签: 大多数其他系统需要数千个“金标准”示例(标注数据)来学习什么是“好的”输出。Litmus 不需要这些。它根据代码和人类的目标来构建规则。
- 零冗余: 它避免了创建 10 个都在测量同一件事的计分卡。它创建的是一套精简、高效的指标组合。
- 有据可查: Litmus 创建的每一个指标都附带一份“收据”。它可以指向特定的代码行和特定的回答,以此证明为什么该指标的存在是合理的。
结果:更好的计分卡
作者在三个现实世界的 AI 系统上测试了 Litmus:
- 金融会计: 正确分组银行账户。
- 科学研究: 基于科学论文回答问题。
- 风险评估: 识别审计中的高风险领域。
他们将 Litmus 与其他仅观察最终输出的自动化系统进行了对比。结果显示,Litmus 在以下方面表现更好:
- 覆盖率: 它捕捉到了更多类型的潜在失败,因为它观察了过程中的每一个阶段,而不仅仅是最终结果。
- 有效性: 尽管它在设计规则时没有使用任何人工标注的数据,但它的评分与人类对质量的判断高度一致。
- 效率: 它不会在重复测量同一件事上浪费时间。
核心启示
论文认为,在我们询问**“应该计算哪个指标?”之前,我们应该首先问:“必须测量什么,以及为什么要测量?”**
Litmus 改变了游戏规则——它从“自动计算分数”转变为“自动设计正确的计分卡”。它确保当我们监控 AI 系统时,我们是在根据系统的构建方式以及人类实际的需求,去测量真正重要的东西。
简而言之: Litmus 是一个能够阅读你的 AI 代码、采访你的团队,然后编写一份定制的、万无一失的说明书,来指导如何衡量该 AI 成功程度的系统,且无需任何预先标注的示例。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。