← 最新论文
💻 computer science

Operationalizing Ethics for AI Agents: How Developers Encode Values into Repository Context Files

本愿景论文探讨了开发者如何通过将行为规则编码至仓库上下文文件(例如 AGENTS.md)中以指导 AI 智能体,从而将伦理原则付诸实践,并提出了一项研究议程,以研究这些新兴的开发者撰写的指令在多样性、治理及遵循度方面的情况。

原作者: Christoph Treude, Sebastian Baltes, Marc Cheong

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Christoph Treude, Sebastian Baltes, Marc Cheong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在聘请一位非常聪明、速度极快的机器人助手来帮你建造一座房子。你希望这个机器人不仅高效,而且善良、公正且安全。在过去,你可能会为人类工人撰写一本冗长而严肃的规则手册,希望他们能阅读并记住要做一个好人。但机器人阅读规则手册的方式与人类不同。

本文认为,开发者们现在正在尝试一种新颖而巧妙的技巧:他们正在将具体的操作手册直接写入机器人的工作空间

以下是用简单类比对本文内容的拆解:

1. 问题:“要善良”太过模糊

想象一下,你告诉你的机器人助手:“请保持道德。”这就像告诉一个孩子:“要乖。”这是一个美好的想法,但它并没有告诉机器人如何做到善良。如果它发现错误,是否应该停止?它是否应该礼貌地说话?它是否应该检查自己是否对不同的人不公平?本文指出,虽然我们在大型会议上经常讨论"AI 伦理”,但很难将这些宏大的理念转化为机器可以遵循的实际指令。

2. 解决方案:"AGENTS.md"文件

作者们发现,开发者们开始在代码项目中创建特殊的文件,称为AGENTS.md(或类似的上下文文件)。把这些文件想象成贴在机器人工作区域的厨房台面上的**“家庭守则”**。

开发者不再仅仅说“要公平”,而是编写具体、可执行的指令,例如:

  • 关于公平性:“在测试姓名时,请使用混合名称,如‘约翰·史密斯’、‘何塞·加西亚’和‘李明’,以确保系统不会因姓名不同而区别对待人们。”
  • 关于语气:“不要进行道德说教或发表未经请求的意见。只需完成工作。”
  • 关于包容性:“使用简单的英语,以便非母语者能够理解。”
  • 关于可持续性:“减少数据和电池消耗,以帮助保护环境。”

3. 他们的发现(“初步调查”)

研究人员查看了其中一些文件(就像窥探了几栋不同的房子),发现开发者们已经在这样做。他们不仅仅是在撰写抽象的哲学论述,而是在将价值观转化为机器可读的规则

  • 公平性变成了具体的测试脚本。
  • 问责制变成了保留人类对变更拥有控制权的规则。
  • 包容性变成了关于使用哪些词汇的规则。

这就像开发者在说:“我不仅仅是希望我的机器人公平;我正在为机器人编程,让它在工作完成前运行公平性检查。”

4. 重大问题(研究路线图)

本文并不声称已经找到了所有答案。相反,它提出了一条新的研究路径,提出了诸如以下的问题:

  • 机器人真的会听从吗? 如果我们写下这些规则,机器人会遵循它们,还是仅仅忽略它们?
  • 谁来决定规则? 如果两位开发者对“公平”的含义意见不一,他们如何在文件中就此进行争论?
  • 规则会改变吗? 如果机器人犯了错误,开发者是否会更新“家庭守则”以防止此类事件再次发生?

核心结论

本文是一篇“愿景”类文章。它在说:“看,开发者们已经在尝试通过将具体指令写入代码文件来教授 AI 伦理。”

作者希望我们研究这一做法。他们相信,如果我们想了解 AI 在现实世界中是如何被治理的,我们就不应仅仅关注宏大的法律或抽象的理论。相反,我们应该关注这些微小的、日常的操作文件,开发者们正是在这些文件中努力将“做一个好人”转化为让机器人“行善”的具体行动。

简而言之:我们正在从告诉 AI“做一个好人”,转变为给 AI 一份具体的“好人”任务清单,让它在工作时逐项勾选。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →