📖 本文为精简版(~3 分钟)。想深入完整工程细节(设计决策、算法 / reward、诊断、复现命令),请移步 技术详解版 →

从「能录」到「能训、能评」

第一篇把 SO-101、MuJoCo 与 LeRobot 接到 AMD ROCm 上,解决的是:在仿真里遥操作并采专家轨迹。

v0.1.3(tag release-v0.1.3)把链路再往前推一步——Lab 01 抓取放置:仿真示范 → ACT / SmolVLA 训练 → MuJoCo 闭环评估,并给出可下载的 Hub 参考资产。

示范可以用 键盘 / Joy-Con / Leader 任一遥操作(同一套 LeRobot v3.0 录制管线)。Lab 01 公开参考数据用 Leader 采集;你本地完全可以用键盘或 Joy-Con 走同一套 lab 脚本。

模仿学习在做什么

模仿学习(Imitation Learning / 行为克隆)的目标不是手写抓取规则,而是让策略从专家示范里学会「看见什么 → 做什么」。人(或遥操作者)完成若干次成功抓取放置;策略在观测(关节角、相机画面等)上拟合专家动作,再在仿真里闭环 rollout,用成功率检验是否真的学会了任务。

和强化学习不同:这里不依赖奖励函数,数据质量与覆盖面直接决定上限。Lab 01 把这条工业界常用的入门路径拆成三步:

阶段作用
1. 数据抓取遥操作采专家轨迹 → LeRobot v3.0 数据集(状态 + 图像 + 动作)
2. Policy 训练行为克隆:最小化预测动作与示范动作的差距(ACT / SmolVLA)
3. Eval策略接管机械臂,在 MuJoCo 里闭环跑任务,统计成功/失败
teleop demos  →  dataset  →  train (BC)  →  closed-loop eval

Lab 01 一条线

阶段做什么
录制labs/lab01_pnp/record.cmd(或换你的 teleop 配置)
训练train.cmd(SmolVLA)/ train_act.cmd(ACT)
评估统一 eval.cmd + lab 内 YAML(全范围 / demo / 固定位姿)
Hub数据集 + ACT / SmolVLA 参考权重(可改成自己的 HF 账号)

旋钮集中在 _env.sh,用 LAB01_* 覆盖;详细约定见仓库 labs/README.md。

参考结果(同一 50 集数据)

在 MI300X 50K 检查点、全范围随机方块上(详见详解版):

策略成功率(示意)
ACT32/50(64%)
SmolVLA11/50(22%)

固定位姿 demo 下 ACT 更高、SmolVLA 仍不稳定——说明「会训」≠「课堂演示一定稳」。成功标准与失败模式写在 lab runbook §6。

Eval 实拍(ACT 固定位姿)

MuJoCo GUI 闭环评估片段(裁剪并约 1.5× 加速;完整 mp4 见 assets/videos/):

ACT pick-and-place eval in MuJoCo

ACT 50K 训练损失(MI300X)

从哪里开始

git clone --recursive https://github.com/rocPAI-Forge/so101-simstudio.git
cd so101-simstudio
git checkout release-v0.1.3
make rocm-sync && source .venv-rocm/bin/activate

# 读 runbook,或直接拉 Hub 数据/权重做 eval(见 Lab 01 §7)
./labs/lab01_pnp/eval.cmd

📖 想了解更多?完整工程细节见 技术详解版。