Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
本文通过揭示朴素的预训练往往因目标不匹配而失败,挑战了通过预训练 Q 函数进行在线强化学习微调的传统观点,并提出了通过策略集成进行初始化(IPE)的方法,该方法利用多样化的策略采样来实现比随机初始化和传统预训练都显著更好的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人完成一项复杂的任务,比如堆叠积木或组装玩具。在人工智能的世界里,有一种流行的策略叫做“预训练加微调”。你可以把预训练想象成送一名学生去图书馆阅读数千本关于如何建造事物的书籍,他们学习其中的理论和规则。然后,微调就像是将同一名学生送到一个真实的作坊里去实践、犯错并从实践中学习。
在这个被称为强化学习(RL)的特定科学领域,这个“学生”是一个被称为**策略(policy)**的计算机程序。它是决定采取什么行动的大脑。但这个学生还需要一个 Q函数(Q-function)。你可以把 Q 函数看作是一个非常严格的教练或计分员。它观察一种情况和一个潜在的动作,然后给出一个分数:“如果你这样做,你会获得高奖励;如果你那样做,你会失败。” 策略通过倾听这位教练的指导来决定哪些动作是好的。通常,当我们拥有大量来自图书馆的数据(离线数据)时,我们会同时训练学生和教练。这看起来很合逻辑:如果学生已经通过阅读变得聪明了,那么教练也应该通过阅读同样的书籍变得同样聪明。但这真的是事实吗?这正是这篇论文所提出的核心问题。
斯坦福大学的研究人员决定测试一个普遍的信念:“如果我们有一个在离线数据上经过预训练的聪明机器人策略,我们是否也应该在让机器人进行现实世界练习之前,先用同样的数据对其 Q 函数教练进行预训练?”
令人惊讶的是,答案是不。论文发现,通过在相同的离线数据上进行预训练来给教练一个领先优势,实际上并不能帮助机器人学得更快或做得更好。事实上,这有时甚至会让情况变得更糟。作者们发现了一个根本性的错位:在旧书上训练出的教练,学会了根据旧机器人的行为来评判动作。但当机器人开始在现实世界中练习(在线微调)时,它需要的是一个能够根据新、更强的机器人最终会做出的动作来评判动作的教练。这两个目标是不同的。预训练的教练被困在了过去,它仍以旧的、水平较低的自我为标准来评判机器人,而不是以其未来的、超强水平的潜力为标准。
为了解决这个问题,作者提出了一种巧妙的新方法,称为基于策略集成的初始化(Initialization via Policy Ensemble, IPE)。与其只训练一个机器人和一个教练,不如在同样的图书馆数据上训练一整支由略有不同的机器人组成的队伍(集成)。尽管它们都学习了相同的书籍,但它们各自会犯些许不同的错误,并尝试些许不同的动作。研究人员随后利用这些不同机器人的数据来训练教练。这给了教练一个更广阔的视野,让它了解各种可能性,从而帮助它学会正确地评判动作,而不是仅仅复制过去。当他们在具有挑战性的机器人控制任务上进行测试时,IPE 方法使机器人的最终性能比以往那种单纯进行天真预训练的方法平均提升了 26%。
所以,主要的启示是:虽然看起来应该同时训练所有内容,但有时教练需要看到更多样化的尝试,才能真正理解比赛。通过使用一支多样化的“学生”队伍来训练“教练”,机器人能够更快地成为冠军。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。