rocPAI-Forge

在 AMD ROCm 上锻造物理智能 — Forging Physical AI on AMD ROCm。这里沉淀我们的技术全景、工程实践与路线规划。

rocPAI — Forging Physical AI on AMD ROCm

让 Physical AI 看懂动态世界:在 AMD ROCm 上用单目视频构建 4DGS

Physical AI 的动态世界表示 Physical AI 的核心问题,不只是生成像素,而是让系统感知、重建并持续查询一个正在变化的真实世界。传统 4DGS 通常从同步、标定的多视角视频开始;本文探索一条更低采集门槛的路径:从单目视频出发,通过 4D 视频生成模型补充同步多视角观测,构建可查询的 4DGS 动态世界表示。 这条管线在 rocPAI-Forge 的 Physical AI 方向中承担的是“动态视觉层”: 单目视频 → 生成式多视角 → 4DGS 动态世界表示 → 机器人观测 / 仿真 / 策略训练 → 真机验证 4DGS 不是最终控制器,也不是完整物理仿真器。它表达的是世界在空间和时间上如何呈现;碰撞、摩擦、接触动力学和关节控制仍需要 MuJoCo、Isaac Sim 或其他物理与机器人系统。 我们跑通了什么 把一段人物视频变成可以自由改变视角的动态场景,需要的不只是一个生成模型。传统 4DGS 通常依赖同步、标定的多视角视频;Phi Media Lab 与 rocPAI-Lab 探索了一条更低采集门槛的路径:从单目视频出发,在 AMD Instinct MI300X + ROCm 上用 4D 视频生成模型补充同步多视角观测,再完成 4D Gaussian 重建,最后由 AMD Radeon 节点完成 Vulkan 渲染、VA-API H.264 编码与 WebRTC 交付。 这不是把生成视角当成真实摄像头阵列,而是用模型预测的多视角观测替代一部分采集硬件:以更低的采集、同步和标定门槛,换取额外的生成计算与几何一致性验证成本。 一次端到端实验完成了: 一段单目人物视频的 121 帧区间 → 24 路、2,904 张 704×1280 多视角观测 初始化 499,972 个动态 Gaussian,完成 30,000 次参数更新 导出可独立部署的 AssetBundle 在 Radeon 上输出 1280×720 动态画面,并由 Chrome 通过 WebRTC 接收 这不是跨平台 benchmark,而是我们验证过的具体软硬件组合和执行路径。 ...

2026年9月10日 · 2 分钟 · Phi Media Lab × rocPAI-Lab

闭环打通:SO-101 SimStudio Lab 01 抓取放置(ROCm)

📖 本文为精简版(~3 分钟)。想深入完整工程细节(设计决策、算法 / reward、诊断、复现命令),请移步 技术详解版 → 从「能录」到「能训、能评」 第一篇把 SO-101、MuJoCo 与 LeRobot 接到 AMD ROCm 上,解决的是:在仿真里遥操作并采专家轨迹。 v0.1.3(tag release-v0.1.3)把链路再往前推一步——Lab 01 抓取放置:仿真示范 → ACT / SmolVLA 训练 → MuJoCo 闭环评估,并给出可下载的 Hub 参考资产。 示范可以用 键盘 / Joy-Con / Leader 任一遥操作(同一套 LeRobot v3.0 录制管线)。Lab 01 公开参考数据用 Leader 采集;你本地完全可以用键盘或 Joy-Con 走同一套 lab 脚本。 模仿学习在做什么 模仿学习(Imitation Learning / 行为克隆)的目标不是手写抓取规则,而是让策略从专家示范里学会「看见什么 → 做什么」。人(或遥操作者)完成若干次成功抓取放置;策略在观测(关节角、相机画面等)上拟合专家动作,再在仿真里闭环 rollout,用成功率检验是否真的学会了任务。 和强化学习不同:这里不依赖奖励函数,数据质量与覆盖面直接决定上限。Lab 01 把这条工业界常用的入门路径拆成三步: 阶段 作用 1. 数据抓取 遥操作采专家轨迹 → LeRobot v3.0 数据集(状态 + 图像 + 动作) 2. Policy 训练 行为克隆:最小化预测动作与示范动作的差距(ACT / SmolVLA) 3. Eval 策略接管机械臂,在 MuJoCo 里闭环跑任务,统计成功/失败 teleop demos → dataset → train (BC) → closed-loop eval Lab 01 一条线 阶段 做什么 录制 labs/lab01_pnp/record.cmd(或换你的 teleop 配置) 训练 train.cmd(SmolVLA)/ train_act.cmd(ACT) 评估 统一 eval.cmd + lab 内 YAML(全范围 / demo / 固定位姿) Hub 数据集 + ACT / SmolVLA 参考权重(可改成自己的 HF 账号) 旋钮集中在 _env.sh,用 LAB01_* 覆盖;详细约定见仓库 labs/README.md。 ...

2026年8月15日 · 1 分钟 · rocPAI-Lab

SO-101 SimStudio:在 AMD ROCm 上打开机器人物理 AI 之门

SO-101 SimStudio 项目介绍 / Project intro 📖 本文为精简版(~3 分钟)。想深入完整工程细节(设计决策、算法 / reward、诊断、复现命令),请移步 技术详解版 → 为什么做这个项目 我和很多朋友一样,是从 SO-101 和 LeRobot 开始物理 AI 和机器人之旅的——这是一套非常好的入门路径:开源硬件、社区活跃、数据集格式清晰,让你很快能「动起来」。 同时我也是 AMD ROCm 开发者。仿真对机器人物理 AI 开发同样关键:在真机昂贵、试错成本高的阶段,MuJoCo 这样的物理引擎让你能在 sim 里练遥操作、录示范、验证 pipeline。但 LeRobot 生态里,面向 ROCm 平台、开箱即用的 SO-101 仿真采集工具还不多。 SO-101 SimStudio 把这几块技术整合在一起:SO-101 机械臂、MuJoCo 物理仿真、LeRobot v3.0 数据集格式,以及 ROCm-first 的环境与文档。目标是让物理 AI 开发者能在 AMD ROCm 环境下,从仿真开始学习机器人物理 AI——只需要一台 AMD Ryzen AI 笔记本或 mini PC,就能打开这扇门。 项目会持续迭代(真机 follower、行为克隆训练等已在 ROADMAP)。本文介绍 首个稳定 release(v0.1.2) 的定位与能力。 v0.1.2 能做什么 能力 说明 三种遥操作 键盘(速度控制)、Joy-Con(柱坐标 reach/swing)、Leader 臂(Feetech STS3215 位置映射) 双录制 GUI --view_mode mujoco(GLFW 3D,低延迟)或 rerun(多相机流,Wayland 友好) LeRobot v3.0 录制、回放、校验、Rerun 可视化;不改 LeRobot 上游,通过插件注册接入 MuJoCo 仿真 SO-101 6-DOF 臂 + simple_pick 桌面抓取场景 + 三路相机 ROCm 环境 make rocm-sync 一键装依赖;Ubuntu 24.04 + ROCm 7.2.x 为当前支持矩阵 三种遥操作(Demo 实拍) v0.1.2 支持三种 teleop,同一套 LeRobot v3.0 录制 pipeline。以下片段来自项目 demo 视频(SO101-SimStudio-Demo01.mp4): ...

2026年7月16日 · 2 分钟 · rocPAI-Lab

当机械臂自己发明了一种抓法:OpenArm 抓取强化学习实践

总览回放 / Overview replay 📖 本文为精简版(~3 分钟)。想深入完整工程细节(设计决策、算法 / reward、诊断、复现命令),请移步 技术详解版 → UniLab 与联合发布 UniLab 是面向机器人强化学习的异构训练基础设施: CPU 侧并行物理仿真(MuJoCo / Motrix)与 GPU 侧策略学习通过统一 runtime 与共享内存 衔接,而不是把物理、rollout 采集与学习全部绑死在 GPU 仿真路径上。任务、奖励与后端切换由 Hydra owner YAML 表达;训练入口统一为 uv run train / uv run eval,覆盖 PPO、SAC、TD3、 APPO 等算法。 我们同期联合发布了系统论文 UniLab: A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms (arXiv:2605.30313)。论文的核心观点是:高效训练的关键 不在于「物理必须在 GPU 上跑」,而在于仿真吞吐、策略更新与运行时同步能否形成高效的端到端 闭环——GPU 仿真是有效路径,但不是唯一路径。在代表性机器人控制任务上,UniLab 在相同硬件 配置下将端到端训练效率提升 3–10×,同时减少对 NVIDIA CUDA 软件栈的依赖,并原生支持 AMD ROCm、Intel XPU 与 Apple macOS。 ...

2026年7月6日 · 2 分钟 · rocPAI-Lab: Alex He, David Li, Andy Luo

给 VLA 喂饭:在 AMD ROCm 上用 OpenArm 生成抓取专家轨迹

📖 本文为精简版(~3 分钟)。想深入完整工程细节(设计决策、算法 / reward、诊断、复现命令),请移步 技术详解版 → 概要 VLA(Vision-Language-Action)模型很能吃数据,而真机采集又贵又慢。我们换个思路:在 AMD Instinct MI300X + ROCm 平台上,用 openarm_mp_labs 把 OpenArm 的「抓-放」动作变成一台 sim 内的专家轨迹数据引擎——给定物体和抓取位姿,自动 解出一条平滑、物理可行、亚毫米精度的示范轨迹,可批量复现。 两个关键结果: 用 Cartesian 路点 + mink IK,把抓取拆成 approach→descend→close→lift→transport→place→retreat→home, 末端 IK 误差 0.4–0.9 mm,cube/ginger 物理仿真抬升 112–120 mm。 抓取位姿既能是标定 top-down,也能直接吃 GraspGenX 的 6-DOF 抓取(在 AMD ROCm 上、 为 OpenArm 夹爪生成)——多物体 × 多抓取 = 给 VLA 的多样化示范。 cube 抓-放回放:从简单方块起步 实践环境 硬件:AMD Instinct MI300X 平台:ROCm 7.2——容器内实测 torch 2.7.1+rocm7.2、hip 7.2.26015 主项目:openarm_mp_labs(轨迹生成 + MuJoCo 回放) 依赖:openarm_control(IK)、 openarm_mujoco(模型)、 GraspGenX(6-DOF 抓取)、 Scan2Sim(真实扫描件转 sim 资产) 轨迹生成 + MuJoCo 是 CPU 计算;GPU/ROCm 的价值在 GraspGenX 抓取合成与下游 VLA 训练。 ...

2026年6月30日 · 2 分钟 · rocPAI-Lab: Alex He, David Li, Andy Luo