闭环打通:SO-101 SimStudio Lab 01 抓取放置(ROCm)
📖 本文为精简版(~3 分钟)。想深入完整工程细节(设计决策、算法 / reward、诊断、复现命令),请移步 技术详解版 → 从「能录」到「能训、能评」 第一篇把 SO-101、MuJoCo 与 LeRobot 接到 AMD ROCm 上,解决的是:在仿真里遥操作并采专家轨迹。 v0.1.3(tag release-v0.1.3)把链路再往前推一步——Lab 01 抓取放置:仿真示范 → ACT / SmolVLA 训练 → MuJoCo 闭环评估,并给出可下载的 Hub 参考资产。 示范可以用 键盘 / Joy-Con / Leader 任一遥操作(同一套 LeRobot v3.0 录制管线)。Lab 01 公开参考数据用 Leader 采集;你本地完全可以用键盘或 Joy-Con 走同一套 lab 脚本。 模仿学习在做什么 模仿学习(Imitation Learning / 行为克隆)的目标不是手写抓取规则,而是让策略从专家示范里学会「看见什么 → 做什么」。人(或遥操作者)完成若干次成功抓取放置;策略在观测(关节角、相机画面等)上拟合专家动作,再在仿真里闭环 rollout,用成功率检验是否真的学会了任务。 和强化学习不同:这里不依赖奖励函数,数据质量与覆盖面直接决定上限。Lab 01 把这条工业界常用的入门路径拆成三步: 阶段 作用 1. 数据抓取 遥操作采专家轨迹 → LeRobot v3.0 数据集(状态 + 图像 + 动作) 2. Policy 训练 行为克隆:最小化预测动作与示范动作的差距(ACT / SmolVLA) 3. Eval 策略接管机械臂,在 MuJoCo 里闭环跑任务,统计成功/失败 teleop demos → dataset → train (BC) → closed-loop eval Lab 01 一条线 阶段 做什么 录制 labs/lab01_pnp/record.cmd(或换你的 teleop 配置) 训练 train.cmd(SmolVLA)/ train_act.cmd(ACT) 评估 统一 eval.cmd + lab 内 YAML(全范围 / demo / 固定位姿) Hub 数据集 + ACT / SmolVLA 参考权重(可改成自己的 HF 账号) 旋钮集中在 _env.sh,用 LAB01_* 覆盖;详细约定见仓库 labs/README.md。 ...