← 最新论文
🤖 AI

Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence

本文介绍了 Safactory,这是一个新颖的统一框架,它集成了并行仿真、可信数据管理和自主进化平台,以系统性地解决在训练下一代可信自主智能体过程中面临的长视野决策与风险发现挑战。

原作者: Xinquan Chen, Zhenyun Yin, Shan He, Bin Huang, Shanzhe Lei, Pengcheng Shi, Kun Cai, Bei Chen, Bangwei Liu, Zeyu Kang, Chao Huang, Yang Zhang, Wenjie Li, Ruijun Ge, Yajie Wang, Tianshun Fang, Tianyang
发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinquan Chen, Zhenyun Yin, Shan He, Bin Huang, Shanzhe Lei, Pengcheng Shi, Kun Cai, Bei Chen, Bangwei Liu, Zeyu Kang, Chao Huang, Yang Zhang, Wenjie Li, Ruijun Ge, Yajie Wang, Tianshun Fang, Tianyang Xu, Yiwen Cong, Meng Jin, Gaolei Li, Xuansheng Wu, Linhan Liu, Zijing He, An Li, Yan Teng, Xin Tan, Dongrui Liu, Jing Shao, ChaoChao Lu, Ji He, Jie Li, Chunfeng Song, Jinya Xu, Fan Song, Shujie Wang, Jianmin Qian, Jie Hou, Xuhong Wang, Yingchun Wang, Hui Wang, Xia Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但经验尚浅的机器人助手如何执行复杂任务,比如管理电脑、操作手机,甚至玩电子游戏。过去,我们主要通过向这些机器人提问简单问题并检查其回答是否安全来训练它们。但现在,这些机器人正演变为自主智能体——它们不再仅仅对话,而是会行动。它们会点击按钮、打开文件,并在漫长的步骤链条中做出决策。

问题在于,当机器人在单次对话中犯错时,那只是一句错误的回答。但当机器人在现实世界中行动时犯错(例如删除了错误的文件或点击了恶意链接),后果可能是真实且破坏性的。

Safactory 是由上海人工智能实验室构建的一个新型“工厂”,旨在解决这一问题。请将其视为一个完整的、自动运行的生态系统,而非单一工具,其设计目的是训练这些机器人变得安全、可靠且值得信赖。

以下是 Safactory 的工作原理,将其拆解为工厂内部的三个主要“车间”:

1. 并行仿真平台(“大规模试验场”)

想象你要测试一辆新车。你不会只在晴天开一次就完事;你会在雨天、夜间、结冰路面上驾驶它,甚至可能在模拟器中让它撞几次,以观察会发生什么。

现有系统就像只开车一次。Safactory 则不同。它创建了一个大规模并行试验场,让成千上万个机器人智能体能够在虚拟环境(如模拟的电脑桌面、模拟的安卓手机或模拟的 Minecraft 世界)中同时运行相同的任务。

  • “时间旅行”功能:如果机器人犯错,Safactory 不会简单地重启整个流程。它具备一种“智能体版 Git"的功能。它可以像游戏存档一样,在任意时间点保存机器人的状态。如果机器人差点删除了文件,系统可以“倒带”到那个确切时刻,尝试另一条路径,看看机器人是否能学会避开危险。
  • 目标:发现那些仅在交互进行 20 或 30 步后才会显现的隐藏风险,而简单的测试往往会遗漏这些风险。

2. 可信数据平台(“智能图书管理员”)

每次机器人运行测试时,都会产生海量数据:它看到了什么、点击了什么、思考了什么,以及是否成功或失败。通常,这些数据只是被丢进文件夹后就被遗忘了。

Safactory 将这些数据视为黄金。它使用一种名为DataElf的特殊"AI 图书管理员”。

  • “意图”魔法:你无需编写复杂代码来组织这些数据。你只需用 plain English(普通英语)告诉 DataElf:“找出所有机器人差点点击钓鱼链接的时刻,并给我一份总结。”
  • “黑盒”安全:DataElf 可以在安全的“黑盒”内查看敏感数据(如密码或私人文件)。它能够分析数据以发现风险,而无需真正查看或泄露任何私人信息。
  • 结果:它将杂乱的日志转化为整洁、有序的“经验书”,供机器人日后学习其错误。

3. 自主进化平台(“持续训练健身房”)

一旦机器人经过测试且数据已整理完毕,它们就需要变得更好。这就是进化平台发挥作用的地方。

  • 循环机制:该平台创建了一个持续循环,而非训练一次后就停止。机器人进行练习,系统记录结果,“图书管理员”挑选出最佳课程,机器人随即立即再次训练。
  • “教师”系统:它采用了一种名为在线策略蒸馏(On-Policy Distillation)的技术。想象一位大师级教师正在观察学生机器人。如果学生犹豫不决或做出冒险举动,教师会实时温和地引导其走向更安全的选项,帮助机器人更快、更稳定地学习。
  • 目标:构建一个系统,使机器人每天都能自动变得更安全、更聪明,而无需人类工程师手动修复每一个漏洞。

动力室:DeepLink 计算

运行所有这些数千次模拟和训练会话需要巨大的计算能力。Safactory 构建于DeepLink之上,这是一个国产(中国)软硬件生态系统。你可以将其视为工厂的发电厂和物流网络,确保即使硬件与标准的西方芯片不同,工厂也能平稳、高效且安全地运行。

宏观图景

该论文认为,安全并非在发布机器人之前完成的一份检查清单。它是一个持续的过程

  • 旧方式:测试机器人一次 \rightarrow 修复漏洞 \rightarrow 发布。
  • Safactory 方式:在大规模仿真中测试机器人 \rightarrow 记录每一个错误 \rightarrow 将错误转化为课程 \rightarrow 再次训练机器人 \rightarrow 无限循环。

Safactory 是实现这种“无限循环”的基础设施,确保随着 AI 智能体变得更加强大和自主,它们依然可控、可审计,并对现实世界保持安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →