FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
该论文介绍了 FACET,这是一个通过将智能体技能重构为连贯场景,并利用共享且可执行的容器状态来锚定指令、解法及验证器,从而确保终端任务合成的一致性与可解性的框架,进而实现终端智能体规模化且有效的训练。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
要理解这里所描述的工作,人们必须首先了解现代人工智能是如何学习在现实世界中行动的。多年来,这些系统主要是在文本上进行训练,学习预测句子中的下一个词或总结文档。但人工智能的下一个前沿不仅仅是阅读或写作,而是“做”。这意味着构建能够操作计算机命令行、安装软件、管理文件并从自身错误中恢复的系统。为了教会机器这样做,研究人员需要一种练习方式。他们需要一个庞大的练习库,其中计算机被赋予一个目标,尝试解决它,并根据屏幕上实际发生的情况(而不仅仅是它声称要做什么)立即被告知是成功还是失败。挑战在于创造足够多的这类练习。手工制作太慢,而自动生成往往会导致产生损坏的、无法解决的或与给定指令不一致的谜题。
一个研究小组开发了一种新方法来解决这个问题,创建了一个能够从头开始生成数千个复杂的、可运行的计算机任务的系统。他们将这个框架称为 FACET。该系统并非简单地要求计算机发明一个任务描述,而是首先收集大量的现有计算机技能——例如,关于如何组织文件、运行特定程序或分析数据的指令库。研究人员随后将这些独立的技能编织成一个连贯的故事。他们构想一个需要完成特定多步骤目标的用户的场景,例如从原始数据准备一份报告或设置一台安全的服务器。系统重构这一场景,确保每一步都逻辑严密地衔接上一步,并且所有的必要工具和文件都已到位。
这一过程最关键的部分发生在任务被写下来之前。系统构建了任务将要发生的实际计算机环境。它创建文件夹、安装软件并设置文件,完全按照实际需求进行。只有在数字工作空间完全构建并经过验证后,系统才会生成给用户的指令、正确的解决方案以及检查工作的测试。这种顺序至关重要。通过将任务锚定在一个真实的、可运行的环境中,系统确保了指令与文件相匹配,解决方案与指令相匹配,且测试与结果相匹配。如果环境构建失败,系统会修复特定的错误,而不是丢弃整个构思。这种方法防止了常见的指令要求一个不存在的文件,或者测试检查一个解决方案无法产生的结果的问题。
研究人员通过使用该方法创建了六千多个不同的任务来测试这种方法。随后,他们利用成功解决这些任务的尝试,来训练新一代的计算机智能体。结果非常明确:当这些智能体在由该系统产生的数据上进行训练时,它们解决复杂计算机问题的能力显著提高。这种提升在不同规模的计算机模型中都是一致的,从较小、较快的版本到更大、更强大的版本均有体现。该系统证明,通过仔细重构场景并首先构建环境,他们可以创建一个高质量、可靠的训练场。这种方法使智能体不仅能从问题的文本中学习,还能从它们试图改变的计算机状态的现实中学习。
研究还揭示了为什么以往许多训练这些智能体的尝试未能取得成功。当任务在没有这种细致、逐步锚定的情况下生成时,指令、解决方案和测试往往会发生脱节。指令可能要求做一件事,解决方案可能做另一件事,而测试可能检查第三件事,从而让智能体感到困惑或使评估变得毫无意义。研究人员发现,他们的方法通过将所有这些部分都与同一个工作环境绑定在一起,产生了难度更高且更真实的任务。虽然与较简单的任务相比,智能体完美解决这些困难任务的数量较少,但它们所解决的任务是真正的成功。该系统成功捕捉到了现实世界计算机工作的复杂性,即单个缺失的文件或微小的配置错误就可能导致整个流程失败。
这项工作为教授人工智能指明了一条新路径。与其依赖大量的简单合成数据,重点转向创建规模更小、质量更高、且每个元素都经过验证能协同工作的数据集。研究人员表明,通过保留原始技能的意图并确保环境真实且一致,他们可以生成更有效的训练数据。接受此类数据训练的智能体不仅仅是在背诵答案;它们学会了如何应对计算机系统中错综复杂且相互关联的现实。研究结果表明,构建更好智能体的关键在于它们接受练习的质量,确保它们所解决的问题与它们所要操作的世界一样真实且一致。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。