Training Skills Like Parameters via Self-Supervised Semantic Diffusion
本文提出了一种新颖的、无监督的自进化智能体框架,该框架通过自监督语义扩散过程训练外部文本技能库,使大语言模型能够在无需访问权重或外部人类监督的情况下,自主掌握如剧本创作等复杂的专业领域。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一名才华横溢但缺乏经验的学徒如何编写引人入胜的电影剧本。你拥有一个包含数千部获奖剧本的图书馆,但你不能直接重写学徒的大脑来让他记住所有内容。在人工智能的世界里,这些“学徒”就是大语言模型(LLM)——它们是能够聊天、写作和解决问题的超级聪明的计算机。然而,在面对像编写短剧这类高度专业化且具有创造性的任务时,它们听起来往往比人类专家要平庸一些。通常,为了解决这个问题,我们会尝试进行“微调”,这就像是对它的脑部进行开心脏手术,以改变其内部的布线。但这种做法成本高昂,需要访问模型的秘密代码(许多顶尖公司并不提供),而且一旦手术完成,模型就会永远固定在那个特定的版本上。如果明年出了更好的模型,你必须从头开始。
因此,科学家们一直在寻找另一种方法:与其改变大脑,为什么不给学徒一套“小抄”或一本“规则书”,让它在需要帮助时随时查阅呢?这被称为外部化学习。问题在于,编写这些小抄通常需要人类专家坐下来解释他们的秘诀,这既缓慢又昂нечно,而且专家往往不想分享他们的秘密,因为担心被模仿。这篇论文提出了一个大胆的问题:我们能否仅利用现有的电影和剧本,教会一个 AI 为自己编写这些小抄,而不需要人类来给它的作业评分或解释规则?
研究这些短剧剧本的研究人员表示,答案是肯定的。他们构建了一个系统,让一个 AI 智能体通过玩一场“破坏与重建”的游戏来学习像专业人士一样写作。可以这样想:想象一下,你拿走一个完美、详细的电影剧本,然后通过一台碎纸机将其处理掉,直到最后只剩下一句关于情节的混乱总结。接着,你将这个总结交给 AI,并对它说:“根据这个重建完整的电影剧本。”但转折点在于:AI 不仅仅是在瞎猜;它拥有一个可以查阅的“规则卡记忆库”。在 AI 尝试重建剧本后,系统会将它那混乱的重建版本与原始的、完美的真人剧本进行对比。这里没有人类老师说“做得好”或“做得不好”,系统会自动发现其中的差异——比如哪里对话太长了,或者哪里角色的动作不够多——并写出一份报告,说明哪里出了问题。
这份报告随后被用于更新 AI 的记忆库。如果 AI 遵循了一条导致糟糕剧本的规则,那么这条规则就会被修改或丢弃。如果 AI 错过了一条能让剧本变得更好的规则,则会创建一张新的规则卡。这个过程周而复始,就像一个自我修正的循环。AI 并没有改变自己的大脑;它只是不断精炼其外部的“如何做”卡片库。研究人员在大量的专业短剧集上测试了这一方法。他们发现,经过训练后,AI 编写的剧本在质量上更接近人类水平。具体来说,AI 学会了编写更真实的动作场面(而不是描述摄像机无法看到的景象)、创造更具悬念的悬念情节,以及利用道具推动故事发展,而不是仅仅让角色盯着道具看。
真正酷的一点是,AI 学到的这些“小抄”并不与特定的计算机模型绑定。研究人员将在一个类型的 AI 上训练好的记忆库交给另一个完全不同的 AI 模型,结果发现它同样表现出色。这就像是你写了一本完美的电影编剧指南,它能帮助两个拥有完全不同大脑的不同学生都成为优秀的作家。这项研究表明,这种方法允许 AI 从高质量的人类范例中自学复杂技能,而无需昂贵的人类教师或更改 AI 的核心代码。虽然该系统目前还不完美——它有时会在何时该阅读哪条规则方面遇到困难——但它展示了一条充满前景的路径,让 AI 通过自学最优秀的人类作品,实现持续的学习与进步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。