← 最新论文
🤖 machine learning

Interactive Training 2: Auditable Control Plane for Live Model Training

本文介绍了 Interactive Training 2,这是一个开源控制平面,它通过共享协议和定制化的 Aim 工作空间,实现了对实时模型训练的可审计、实时的引导,允许人类和自动化智能体在多种工作流中安全地修改训练参数。

原作者: Wentao Zhang, Xuanhe Pan, Han Zhou, Yang Lu, Yuntian Deng

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Wentao Zhang, Xuanhe Pan, Han Zhou, Yang Lu, Yuntian Deng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一位大师级厨师烹饪一道复杂的菜肴。你可以看到锅里正冒着泡,闻到香料的味道,并注意到酱汁变得太稠了。在过去,如果你想告诉厨师调低火力或加一撮盐,你必须跑进厨房,拿取特定的工具,并用只有那位特定厨师才能听懂的语言传达指令。如果你想与正在烹饪另一道菜的不同厨师交流,你需要一套全新的工具和一种全新的语言。这就是过去训练人工智能模型的方式:研究人员可以观察“烹饪”过程,但要在过程中更改食谱既混乱,又需要为每一次实验编写定制代码,而且很难进行追踪。

现在,想象一下如果每个厨房都有一个通用的、神奇的对讲系统。你可以走到它面前,说“多加点盐”或“调低火力”,厨师就会听到你的话,检查现在这样做是否安全,然后在锅里的时机恰当时执行这一改变。最棒的部分是?系统会准确记录下是谁在什么时候提出了什么要求,以及厨师是否执行了。这就是“交互式训练”(Interactive Training)的世界,在这个领域中,研究人员试图在 AI 模型学习的过程中对其进行引导,而不仅仅是旁观。核心问题在于:我们如何让这种引导变得简单、安全且可记录,从而适用于任何 AI 厨师,而不只是那些使用特定品牌炉灶的厨师?

这篇论文介绍了 Interactive Training 2,这是一个新的“控制平面”,充当了那个通用的 AI 训练对讲系统。作者构建了一个开源系统,让研究人员、计算机脚本甚至 AI 智能体(如智能机器人)能够通过一种单一的、共享的语言与训练模型进行对话。研究人员不再需要为每次实验编写新代码,只需告诉系统:“这是我可以调节的旋钮(比如学习速率)和我可以按下的按钮(比如保存检查点)。”

以下是它的实际工作原理:研究人员(或智能 AI 智能体)查看显示模型表现的实时仪表盘。如果模型遇到困难,他们可以通过系统发送请求,例如“将学习率降低到 0.00002”。训练模型不会立即发生变化;相反,它会等待直到其烹饪过程中的一个安全时刻——作者称之为“控制点”——再进行更改。随后,它会检查该请求是否有效,应用该请求,并将整个故事记录在一本数字日志中。这本日志将请求与结果、新的评分以及保存的模型版本联系起来,创造了一条清晰、可审计的轨迹,记录了谁在何时做了什么。

团队在五种不同类型的 AI 任务上测试了这个系统,包括教导模型理解人类情感(情感分析)和玩游戏(强化学习)。他们证明了同一个系统可以处理从简单的学习率调整到复杂的模型数据处理方式的变化。在这些测试中,他们使用了一个 AI 智能体来充当“厨师助手”,该助手会观察结果,决定下一步要做什么,并发送请求。系统成功记录了每一步,从最初的计划到最终的结果,证明了你可以在不破坏代码或丢失历史记录的情况下,实时引导一个活生生的 AI 模型。

这篇论文并不声称已经解决了所有的 AI 训练问题,也不声称是一个能保证完美结果的灵丹妙药。相反,它提供了一个可复用的基础。它指出,通过将“引导”与“烹饪”分离,我们可以让训练变得更加灵活且更易于研究。作者展示了这种方法在不同框架下的适用性,并证明了它允许人类和自动化智能体在实时改进 AI 模型的同时进行协作,并始终保留整个过程的完美记录。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →