← 最新论文
🤖 AI

Align AI to Dynamic Human-AI Workflows

本文主张将人工智能对齐从静态的、模仿式的路径转向一种动态的、交互式的框架,即人类与人工智能行为共同演进,并借鉴跨学科见解来应对新的协调挑战,并为互补性对齐勾勒出研究议程。

原作者: Valerie Chen, Cleotilde Gonzalez, Anita Williams Woolley, Michael Lee, Tongshuang Wu, Vincent Conitzer, Aarti Singh

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Valerie Chen, Cleotilde Gonzalez, Anita Williams Woolley, Michael Lee, Tongshuang Wu, Vincent Conitzer, Aarti Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

心智与机器之舞

想象一个世界,计算机不再仅仅像听话的机器人那样执行命令,而是真正像队友一样与我们协作。这就是人工智能(AI)对齐的前沿领域。简单来说,“对齐”是指教导 AI 去做人类真正想要做的事,而不仅仅是去做我们告诉它做的事。长期以来,科学家们一直试图通过向 AI 展示人类行为的例子并说“模仿这个”来对齐 AI。这就像是通过展示一张坐着的狗的照片来教狗坐下。但现实生活不是一张照片;它是一部混乱且不断变化的电影。我们之所以关注这一点,是因为随着 AI 变得越来越聪明,开始帮助我们编写代码、驾驶汽车或管理医院,我们需要确保它不仅是在模仿我们,而且能真正帮助我们在工作中随着时间的推移变得更好。如果 AI 和人类无法找到如何信任彼此以及平滑切换角色的方法,整个团队可能会崩溃。

论文的核心思想:从快照到电影

本文认为,目前训练 AI 的方式就像是拍摄了一张舞蹈的单张冻结照片,并试图仅凭这一张静止图像就教会机器人跳舞。作者们是来自卡内基梅隆大学和加州大学欧文分校的研究团队,他们建议我们应该停止观察“快照”,转而开始观看整部“电影”。

旧方法的缺陷
目前,大多数 AI 对齐工作就像是在玩一场“猜猜偏好”的游戏。你向 AI 展示两个答案,询问人类更喜欢哪一个,然后 AI 试图在下次预测人类想要什么。论文指出,这种方式过于静态。它假设人类的偏好永远不会改变。但在现实生活中,我们对工具的信任是不断变化的。

想象一下一名使用 AI 编程助手的开发人员。起初,开发者可能会完全信任 AI,让它快速编写代码。但如果 AI 犯了几个错误,开发者就会变得紧张,开始检查每一行代码。如果 AI 随后证明自己很可靠,开发者又会放松下来,让 AI 接管更多控制权。论文将这种现象称为动态工作流。旧的方法之所以会错过这一点,是因为它们只关注一个时间点,忽略了人类与 AI 互动的历史。它们将人类视为“好”与“坏”答案的静态标注者,而不是一个思维不断变化的合作伙伴。

新提议:一场动态之舞
作者提出了看待对齐的一种新方式:交互式与互补式对齐。目标不应仅仅是让 AI 表现得像人类,而应该是让“人机团队”随着时间的推移更好地协作。

想象一支爵士乐队。在旧模型中,AI 是一名试图完美复制人类所写乐谱的音乐家。在新模型中,AI 是一个爵士搭档。有时人类进行独奏,AI 倾听并提供支持;有时 AI 领衔一段复杂的乐句,人类则退后一步倾听。他们不断地调整以适应彼此。论文表明,最好的 AI 不是那个能完美模仿我们的 AI,而是那个知道何时上前、何时退后,以及如何帮助我们应对不确定性的 AI。

研究内容与发现
为了研究如何构建这种类型的 AI,研究人员不仅进行了计算机模拟,还举办了一场研讨会,邀请了来自两个截然不同领域的 70 位专家:机器学习(编码者)和社会科学(心理学家、组织专家和认知科学家)。他们想看看当算法的逻辑与人类团队协作的复杂现实相碰撞时,会发生什么。

以下是他们从这场跨学科对话中发现的内容:

  1. 信任是活的: 在人类团队中,信任不是一个“开”或“关”的开关。它是一种会随着瞬间发生的事件而增长、萎缩和变化的某种关系。如果一名队友犯了错但承认并修复了它,信任实际上可以变得更强。但如果他们撒谎或表现出隐藏的动机,信任会瞬间消失。论文建议 AI 需要理解这种起伏,而不仅仅是一个关于“你有多喜欢我”的单一评分。
  2. “谁知道什么”的问题: 优秀的团队拥有一种关于“谁擅长什么”的共享地图。这被称为“交互记忆”。如果一名团队成员需要修理漏水的管道,他们知道该找管道工,而不是会计。论文认为,AI 系统需要帮助建立这种共享地图。它们需要知道何时说:“我不确定,你来处理这个,”或者“我可以做这部分,你专注于那个。”
  3. AI 的特殊性: 论文警告说,人机团队与人类团队不同。AI 速度极快且拥有完美的记忆,但它没有名声或面孔。人类很难判断 AI 是在“撒谎”还是仅仅由于困惑。因为 AI 缺乏我们用来判断人类的社交线索,所以人类很难信任它,从而导致要么过度依赖(信任过度),要么利用不足(在 AI 正确时忽略它)。

障碍
作者谨慎地表示,他们尚未解决所有问题。他们确定了阻碍构建这些动态团队的三个主要障碍:

  • 理论差距: 我们缺乏关于人类与 AI 如何进行长期互动的足够理论。我们了解很多关于人类如何合作的知识,但 AI 是一个全新的、奇特的伙伴。
  • 现实世界差距: 测试这些想法很难,因为大多数现实世界的数据(例如人们在工作中如何实际使用 AI)都锁在私有公司内部。研究人员被迫在实验室进行测试,这并不总能匹配真实生活。
  • 测量差距: 我们还没有好的尺子来衡量随时间推移的“良好团队协作”。我们可以测量任务是否完成,但很难衡量人类和 AI 是否在任务完成后学会了更好地信任彼此。

未来走向
论文最后指出,AI 的未来不在于制造更聪明、表现得像我们的机器人。而在于创造能够适应我们、理解我们变化的情绪和信任水平,并帮助我们协调独特技能的系统。他们呼吁这样一个未来:计算机科学家和社会科学家共同协作,设计出不仅能回答问题,还能帮助我们应对现实工作中复杂多变的协作之舞的 AI。

作者们在暗示这种转变是必要的,但也承认这是一个巨大的挑战。他们并不是声称今天已经有了最终答案;相反,他们是在为未来的旅程绘制地图,敦促业界停止观察静态的快照,开始拍摄人类与 AI 协作的完整电影。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →