Towards Value-Constrained Credit Assignment in Fully Delegated AI Cooperatives
本文提出了一种用于全委托人工智能合作组织中价值约束型信用分配的框架,该框架利用遍历学习基质通过个体价值剖面来过滤模型更新,并基于在线边际贡献进行奖励分配,从而提供比传统联邦学习方法更精细的归因。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个规模宏大、高科技的协作式厨房,数十位厨师(AI 智能体)正齐心协力创造出一道世界级的食谱(AI 模型)。在这个厨房里,每一位厨师都代表着一个有着非常具体且不可逾越的规则、关于其愿意烹饪什么的特定个人。
- 厨师 A 说:“我绝不烹饪任何涉及军事武器的菜肴。”
- 厨师 B 说:“我拒绝烹饪任何歧视特定群体的食物。”
- 厨师 C 说:“我不碰任何被用于保险风险评分的食谱。”
在传统的厨房里,每个人都会把他们的食材扔进一个巨大的锅里,由主厨将其混合在一起。如果厨师 A 的“禁武器”规则被忽视了,因为厨师 B 加入了一种无意中让菜肴变得不符合厨师 A 安全标准的辛辣酱料,那么厨师 A 也会和大家一样获得报酬。这是不公平且危险的。
这篇论文提出了一种运行这个厨房的新方法,称为价值约束型信用分配(Value-Constrained Credit Assignment)。以下是它的运作方式,分步骤说明:
1. “价值过滤器”(守门员)
在任何厨师将食材加入主锅之前,他们必须先通过个人的安全扫描仪(“价值过滤器”)。
- 如果厨师 A 的食材通过了他们的扫描仪(即它是安全的且符合其价值观),它就会获得一个“绿灯”。
- 如果失败了(违反了他们的规则),扫描仪会将它变成“红灯”并予以拦截。
- 神奇之处在于: 只有获得“绿灯”的食材才被允许继续向下传递。这确保了没有人会被迫参与制作他们从道德上反对的菜肴。
2. “追踪路径”(遍历学习)
大多数现代 AI 厨房使用一种方法,即所有人将混合后的食材发送到一个中央搅拌机,然后由搅拌机来猜测每样东西是谁贡献的。这篇论文建议使用另一种方法,称为遍历学习(Traversal Learning, TL)。
想象一下,我们使用的不是搅拌机,而是一个传送带系统。
- 食材在传送带上从厨师 A 移动到厨师 B,再到厨师 C。
- 因为传送带是可见且可追踪的,我们可以精确地看到哪种食材来自哪位厨师,以及它去了哪里。
- 这比“黑盒”搅拌机的方法要清晰得多。它让我们能够追踪每一份贡献的精确路径,从而轻松看出谁帮助了食谱的改进,以及谁没有贡献。
3. “试味”(信用分配)
一旦“绿灯”食材进入传送带,厨房会进行快速的试味(验证)。
- 他们会问:“如果我们现在只加入厨师 A 批准的食材,这道菜的味道会变好吗?”
- 如果答案是肯定的,厨师 A 就会获得一个“信用点”。
- 如果答案是否定的(或者由于其食材早前被过滤器拦截),他们将获得零分。
- 这意味着厨师们仅因那些既符合其道德准则又确实对团队有益的食材而获得奖励。
4. “薪酬结算”(收益清算)
在一天结束时,厨房售出这道菜并赚取利润。钱是如何分配的?
- 它不是平均分配的。
- 它根据每个厨师获得的信用点进行分配。
- 如果厨师 A 有 10 个获批且有益的食材,而厨师 B 只有 2 个,那么厨师 A 会获得更大的一块饼。
- 论文建议使用一种公式,即贡献越多,获得的报酬越多,同时也可以进行调整,以更重地奖励那些“超级贡献者”。
为什么这很特别?
作者认为,这个系统同时解决了两个问题:
- 尊重: 它尊重了不同的人拥有不同道德边界这一事实(多元主义)。你不需要为了成为团队的一员而妥协你的价值观。
- 公平: 它根据人们实际做了什么来支付报酬,而不是仅仅根据他们拥有多少数据。如果你的数据因为违反了你自己的规则而被拦截,你不会受到惩罚;你只是不对那部分内容获得报酬。
简而言之: 这篇论文提出了一种系统,让 AI 智能体像一群只烹饪自己能接受之物的厨师一样协作。他们根据自己的获批烹饪内容对最终餐点的实际改进程度来获取报酬,并使用一个清晰、可追踪的传送带系统,以确保每个人都能获得公平的份额。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。