📖 本文为精简版(~3 分钟)。想深入完整工程细节(设计决策、算法 / reward、诊断、复现命令),请移步 技术详解版 →
从「能录」到「能训、能评」
第一篇把 SO-101、MuJoCo 与 LeRobot 接到 AMD ROCm 上,解决的是:在仿真里遥操作并采专家轨迹。
v0.1.3(tag release-v0.1.3)把链路再往前推一步——Lab 01 抓取放置:仿真示范 → ACT / SmolVLA 训练 → MuJoCo 闭环评估,并给出可下载的 Hub 参考资产。
示范可以用 键盘 / Joy-Con / Leader 任一遥操作(同一套 LeRobot v3.0 录制管线)。Lab 01 公开参考数据用 Leader 采集;你本地完全可以用键盘或 Joy-Con 走同一套 lab 脚本。
模仿学习在做什么
模仿学习(Imitation Learning / 行为克隆)的目标不是手写抓取规则,而是让策略从专家示范里学会「看见什么 → 做什么」。人(或遥操作者)完成若干次成功抓取放置;策略在观测(关节角、相机画面等)上拟合专家动作,再在仿真里闭环 rollout,用成功率检验是否真的学会了任务。
和强化学习不同:这里不依赖奖励函数,数据质量与覆盖面直接决定上限。Lab 01 把这条工业界常用的入门路径拆成三步:
| 阶段 | 作用 |
|---|---|
| 1. 数据抓取 | 遥操作采专家轨迹 → LeRobot v3.0 数据集(状态 + 图像 + 动作) |
| 2. Policy 训练 | 行为克隆:最小化预测动作与示范动作的差距(ACT / SmolVLA) |
| 3. Eval | 策略接管机械臂,在 MuJoCo 里闭环跑任务,统计成功/失败 |
teleop demos → dataset → train (BC) → closed-loop eval
Lab 01 一条线
| 阶段 | 做什么 |
|---|---|
| 录制 | labs/lab01_pnp/record.cmd(或换你的 teleop 配置) |
| 训练 | train.cmd(SmolVLA)/ train_act.cmd(ACT) |
| 评估 | 统一 eval.cmd + lab 内 YAML(全范围 / demo / 固定位姿) |
| Hub | 数据集 + ACT / SmolVLA 参考权重(可改成自己的 HF 账号) |
旋钮集中在 _env.sh,用 LAB01_* 覆盖;详细约定见仓库 labs/README.md。
参考结果(同一 50 集数据)
在 MI300X 50K 检查点、全范围随机方块上(详见详解版):
| 策略 | 成功率(示意) |
|---|---|
| ACT | 32/50(64%) |
| SmolVLA | 11/50(22%) |
固定位姿 demo 下 ACT 更高、SmolVLA 仍不稳定——说明「会训」≠「课堂演示一定稳」。成功标准与失败模式写在 lab runbook §6。
Eval 实拍(ACT 固定位姿)
MuJoCo GUI 闭环评估片段(裁剪并约 1.5× 加速;完整 mp4 见 assets/videos/):
ACT pick-and-place eval in MuJoCo

从哪里开始
git clone --recursive https://github.com/rocPAI-Forge/so101-simstudio.git
cd so101-simstudio
git checkout release-v0.1.3
make rocm-sync && source .venv-rocm/bin/activate
# 读 runbook,或直接拉 Hub 数据/权重做 eval(见 Lab 01 §7)
./labs/lab01_pnp/eval.cmd
- 代码 / Release: rocPAI-Forge/so101-simstudio · v0.1.3
- Lab runbook: labs/lab01_pnp/lab01_pnp.md
- 技术详解: README-details.md
📖 想了解更多?完整工程细节见 技术详解版。