← 最新论文
🤖 machine learning

Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)

本文介绍了一种用于 LeHome Challenge 2026 的获奖双臂服装折叠系统,该系统通过利用自监督强化学习循环来增强视觉-语言-动作策略,其中策略自身对成功和进度的预测驱动了优势估计和失败检测,并辅以包括流匹配、分布式训练以及鲁棒的仿真到现实迁移在内的全面工程优化,从而实现了顶尖排名。

原作者: Ilia Larchenko

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ilia Larchenko

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人正试图折叠一件凌乱的 T 恤或一条裤子。这对我们来说很简单,但对于机器人而言,一块布料就像一条混乱、滑溜且每次被触碰都会改变形状的“滑溜蛇”。这篇论文描述了作者 Ilia Larchenko 如何构建了一个“机器人大脑”,并凭借此在模拟赛中获得第一名,在现实世界竞赛中获得第二名。

以下是他如何实现这一目标的完整故事,通过简单的概念进行了拆解。

1. 问题所在:机器中的“幽灵”

机器人需要使用两只手臂来折叠四种类型的衣物(长袖/短袖上衣、长裤/短裤)。

  • 难点: 机器人并不知道自己手里拿的是什么。它必须先观察衬衫,搞清楚“这是一件 T 恤还是一条裤子?”,然后才能开始折叠。
  • 奖励机制: 只有当衬衫在最后被完美折叠时,机器人才会得到一个“金星”(奖励)。如果中途出错,它将一无所获。这就像是学习骑自行车,但只有当你到达终点线且从未摔倒时,才会得到一块饼干。

2. 解决方案:一个“自我教学”的循环

作者并没有仅仅通过模仿人类演示来学习(那就像是通过看视频来学习游泳),而是构建了一个通过实践、失败并不断尝试的系统。他称之为**“飞轮”(Flywheel)**。

可以将其想象成一个工厂里的三人团队:

  1. 训练员(The Trainer): 负责研究数据并更新机器人大脑的老师。
  2. 奔跑者(The Runners): 一群在视频游戏(模拟器)中的机器人,它们每天尝试折叠衣物数千次。
  3. 人类助手(The Human Helper): 当机器人卡住时,人类介入进行修复,让机器人重新尝试。

这三者并不直接交流,而是通过一个共享的数字信箱(HuggingFace Hub)投递笔记。训练员阅读笔记,学习,并将新的“大脑更新”投回信箱。奔跑者领取更新并再次尝试。

3. 核心秘诀:机器人是自己的计分员

通常在机器人技术中,需要一个大脑来决定“做什么”,以及另一个独立的大脑来预测“做得如何”。作者将两者合二为一。

  • 神奇的技巧: 决定“抓取袖口”的同一个神经网络,同时也预测“我有 80% 的概率成功”以及“我已经完成了 40%”。
  • 为什么有效: 因为机器人能实时了解自己的得分,所以它能学得更快。如果它预测自己会失败,它就知道该尝试不同的动作。这就像一个学生不仅在参加考试,还能立即为自己的答案评分,以查看哪里出了错。

4. 从错误中学习(“重放”策略)

作者意识到,仅仅是练习是不够的。你需要练习那些“难点”。

  • 硬挖掘(Hard Mining): 当机器人失败时,系统会保存那个精确的瞬间(就像视频游戏中的“存档点”)。然后,它会加载这个失败的状态并再次尝试,但这次会加入额外的“噪声”(如光照或布料纹理的随机变化)来增加难度。
  • 人类触碰(The Human Touch): 当机器人真正陷入困境时,人类接管控制权仅几秒钟来修复衣服,然后将控制权交还。机器人从这些微小的修正中学习。这被称为 DAgger(一个关于“向人类修正学习”的专业术语)。

5. “神奇眼镜”(推理优化)

即使拥有聪明的大脑,如果机器人移动得太快或太慢,也会变得笨拙。作者发现,通过在机器人“思考”的最后一刻进行微调,性能大幅提升。

  • 类比: 想象你在做一道选择题。你不是直接选出脑子里跳出的第一个答案,而是快速在脑中生成三个不同的答案,根据你的直觉(分数)检查哪个感觉“最好”,然后选出那一个。
  • 汤普森采样(Thompson Sampling): 作者使用了一种数学博弈方法(类似于老虎机),自动为每种类型的衣服确定最佳设置(例如:“对于短裤,动作慢一点;对于长裤,抓取紧一点”),而无需手动测试每一种组合。

6. 现实世界的挑战:从视频游戏到现实

最难的部分是从计算机模拟转向现实房间里的真实机器人。

  • 物理学的“恐怖谷”: 在模拟器中,衣服看起来很完美。但在现实中,光照不同,摄像头稍微歪了,机器人的手臂也有一些“间隙”(反向间隙/回程误差)。
  • 解决方法: 作者并没有试图让机器人变得完美。相反,他让训练数据变得“混乱”。他教机器人如何在黑暗中、在阳光下、在摄像头倾斜的情况下、以及在机器人以不同速度移动的情况下折叠衣服。
  • 结果: 通过训练机器人在混乱中保持舒适,它在面对现实世界时不会惊慌。这就像是在风暴海洋中训练冲浪者,这样在平静的海滩上就会显得轻而易举。

7. 最终成果

  • 模拟环境: 机器人的折叠成功率达到了 79.6%,击败了其他 61 支队伍。
  • 现实世界: 它在最终比赛中获得第二名,在真实的机器人上成功折叠了真实的衣物。

核心启示

作者承认这并不是一个受控变量的完美科学实验。这是一种“把厨房水槽倒进去”的方法——将所有有用的工具(强化学习、人类反馈、重度数据增强和智能预测)全部投入其中,直到奏效。

主要的启示是:对于要处理像衣服这样杂乱、不可预测之物的机器人,它们需要能够预测自身的成功从人类的修正中学习,并且要在混乱多变的各种环境中接受训练,这样当现实情况与视频游戏不符时,它们才不会感到困惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →