闭环打通:SO-101 SimStudio Lab 01 抓取放置(ROCm)

📖 本文为精简版(~3 分钟)。想深入完整工程细节(设计决策、算法 / reward、诊断、复现命令),请移步 技术详解版 → 从「能录」到「能训、能评」 第一篇把 SO-101、MuJoCo 与 LeRobot 接到 AMD ROCm 上,解决的是:在仿真里遥操作并采专家轨迹。 v0.1.3(tag release-v0.1.3)把链路再往前推一步——Lab 01 抓取放置:仿真示范 → ACT / SmolVLA 训练 → MuJoCo 闭环评估,并给出可下载的 Hub 参考资产。 示范可以用 键盘 / Joy-Con / Leader 任一遥操作(同一套 LeRobot v3.0 录制管线)。Lab 01 公开参考数据用 Leader 采集;你本地完全可以用键盘或 Joy-Con 走同一套 lab 脚本。 模仿学习在做什么 模仿学习(Imitation Learning / 行为克隆)的目标不是手写抓取规则,而是让策略从专家示范里学会「看见什么 → 做什么」。人(或遥操作者)完成若干次成功抓取放置;策略在观测(关节角、相机画面等)上拟合专家动作,再在仿真里闭环 rollout,用成功率检验是否真的学会了任务。 和强化学习不同:这里不依赖奖励函数,数据质量与覆盖面直接决定上限。Lab 01 把这条工业界常用的入门路径拆成三步: 阶段 作用 1. 数据抓取 遥操作采专家轨迹 → LeRobot v3.0 数据集(状态 + 图像 + 动作) 2. Policy 训练 行为克隆:最小化预测动作与示范动作的差距(ACT / SmolVLA) 3. Eval 策略接管机械臂,在 MuJoCo 里闭环跑任务,统计成功/失败 teleop demos → dataset → train (BC) → closed-loop eval Lab 01 一条线 阶段 做什么 录制 labs/lab01_pnp/record.cmd(或换你的 teleop 配置) 训练 train.cmd(SmolVLA)/ train_act.cmd(ACT) 评估 统一 eval.cmd + lab 内 YAML(全范围 / demo / 固定位姿) Hub 数据集 + ACT / SmolVLA 参考权重(可改成自己的 HF 账号) 旋钮集中在 _env.sh,用 LAB01_* 覆盖;详细约定见仓库 labs/README.md。 ...

2026年8月15日 · 1 分钟 · rocPAI-Lab

给 VLA 喂饭:在 AMD ROCm 上用 OpenArm 生成抓取专家轨迹

📖 本文为精简版(~3 分钟)。想深入完整工程细节(设计决策、算法 / reward、诊断、复现命令),请移步 技术详解版 → 概要 VLA(Vision-Language-Action)模型很能吃数据,而真机采集又贵又慢。我们换个思路:在 AMD Instinct MI300X + ROCm 平台上,用 openarm_mp_labs 把 OpenArm 的「抓-放」动作变成一台 sim 内的专家轨迹数据引擎——给定物体和抓取位姿,自动 解出一条平滑、物理可行、亚毫米精度的示范轨迹,可批量复现。 两个关键结果: 用 Cartesian 路点 + mink IK,把抓取拆成 approach→descend→close→lift→transport→place→retreat→home, 末端 IK 误差 0.4–0.9 mm,cube/ginger 物理仿真抬升 112–120 mm。 抓取位姿既能是标定 top-down,也能直接吃 GraspGenX 的 6-DOF 抓取(在 AMD ROCm 上、 为 OpenArm 夹爪生成)——多物体 × 多抓取 = 给 VLA 的多样化示范。 cube 抓-放回放:从简单方块起步 实践环境 硬件:AMD Instinct MI300X 平台:ROCm 7.2——容器内实测 torch 2.7.1+rocm7.2、hip 7.2.26015 主项目:openarm_mp_labs(轨迹生成 + MuJoCo 回放) 依赖:openarm_control(IK)、 openarm_mujoco(模型)、 GraspGenX(6-DOF 抓取)、 Scan2Sim(真实扫描件转 sim 资产) 轨迹生成 + MuJoCo 是 CPU 计算;GPU/ROCm 的价值在 GraspGenX 抓取合成与下游 VLA 训练。 ...

2026年6月30日 · 2 分钟 · rocPAI-Lab: Alex He, David Li, Andy Luo