← 最新论文
🤖 machine learning

Discovering Reinforcement Learning Interfaces with Large Language Models

本文介绍了 LIMEN,这是一个由大语言模型引导的进化框架,能够从原始模拟器状态和轨迹级成功指标自动合成完整的强化学习任务接口(包括观测映射和奖励函数),证明了联合优化这些组件对于跨不同领域的成功至关重要。

原作者: Akshat Singh Jaswal, Ashish Baghel, Paras Chopra

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Akshat Singh Jaswal, Ashish Baghel, Paras Chopra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何行走、拿起杯子或解决迷宫问题。在强化学习(RL)的世界里,机器人并非仅仅“自学”;它需要一位老师来告诉它两件非常具体的事情:

  1. 看什么:它应该观察地板的颜色?距离墙壁的远近?还是自己膝盖的角度?(这就是观测)。
  2. 如何感到满意:当它迈出一步时,它会得到一颗金星?一个微小的分数?还是什么都没有?(这就是奖励)。

通常,人类专家必须花费数周甚至数月的时间,手动设计这些“看什么”和“如何感到满意”的规则。如果设计有误,机器人就永远无法学会。

本文介绍了一个名为LIMEN(基于 MDP 引导进化的学习接口)的新系统。可以将 LIMEN 想象为一位富有创造力的建筑师和一位严格的教练携手合作,由大型语言模型(LLM)驱动,自动为机器人设计完美的老师。

以下是其工作原理,分解为简单的概念:

1. 问题所在:“盲目”的机器人

想象你把一个机器人放进迷宫。

  • 旧方法:你告诉机器人,“观察摄像头的原始像素”(这就像一团模糊、混乱的色彩),并且“只有在到达出口时才得分”。机器人是盲目且困惑的。它可能永远学不会。
  • 新方法(LIMEN):LIMEN 请求人工智能(LLM)编写一个充当过滤器的计算机程序。该程序说:“忽略那些模糊的色彩。相反,只观察距离最近墙壁的距离和门的角度。”它还编写了一条新规则:“每靠近门一步就获得少量分数,进入门时获得大量分数。”

2. 方法:通过试错进行进化

LIMEN 并非只猜测一次。它使用了一个类似于自然进化的过程,但进化的不是动物,而是计算机代码

  • 生成:LLM 编写出一堆不同的“老师”程序(有的说“看地板”,有的说“看天花板”)。
  • 测试:机器人尝试利用每位老师进行学习。
  • 反馈:如果机器人失败,系统会告诉 LLM:“那位老师很糟糕,因为机器人看不见门。”如果机器人表现尚可,系统会说:“干得好,但试着让‘分数’系统更具鼓励性。”
  • 变异:LLM 选取最好的老师并对其进行微调(变异),使其变得更好。它重复这个循环 30 次,逐步完善出完美的规则集。

3. 重大发现:两者缺一不可

论文中最令人惊讶的发现是,你不能只解决问题的一部分。你必须同时修复“看什么”和“如何感到满意”这两个方面。

作者在两类任务中测试了这一点:

  • 迷宫(网格世界):在这里,机器人失败是因为它无法看见物体之间的关系(例如“钥匙在门旁边”)。如果你只修复了“分数”系统,却保留了混乱的“视觉”,机器人仍然会失败。它需要一个更好的“镜头”来观察世界。
  • 机械臂(连续控制):在这里,机器人可以完美地看见一切,但它失败是因为“分数”太稀疏(它只在最后获得分数)。它需要一个更好的“教练”在过程中给予反馈。

类比

  • 如果你只给学生提供更好的乐谱(观测),却不对其演奏给予反馈(奖励),他们可能无法进步。
  • 如果你给他们一位伟大的老师,对每个音符都进行点评(奖励),但乐谱却是乱涂乱画的胡言乱语(观测),他们仍然无法学会。
  • LIMEN 认识到,要取得成功,你必须同时重写乐谱聘请完美的老师。

4. 结果

团队在五个不同的任务上测试了 LIMEN,从简单的迷宫到复杂的机器人平衡动作。

  • 结果:当 LIMEN 共同设计视觉和奖励系统时,机器人学习解决任务的成功率极高(在迷宫任务中高达 99%)。
  • 半途而废的失败:当他们尝试只进化视觉或只进化奖励时,机器人在至少一项任务上遭遇了灾难性的失败。

总结

简而言之,这篇论文表明,我们可以停止手动为机器人设计规则。相反,我们可以利用人工智能自动编写代码,告诉机器人看什么以及如何获得奖励。通过共同进化这两者,系统发现了聪明、类人的策略(例如“观察距离目标的远近”或“保持直立给予奖励”),使学习过程更快、更可靠。

这就像为人工智能自动化了“游戏设计师”的工作,确保游戏可玩且公平,从而使人工智能玩家能够真正获胜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →