让 Physical AI 看懂动态世界:在 AMD ROCm 上用单目视频构建 4DGS

Physical AI 的动态世界表示 Physical AI 的核心问题,不只是生成像素,而是让系统感知、重建并持续查询一个正在变化的真实世界。传统 4DGS 通常从同步、标定的多视角视频开始;本文探索一条更低采集门槛的路径:从单目视频出发,通过 4D 视频生成模型补充同步多视角观测,构建可查询的 4DGS 动态世界表示。 这条管线在 rocPAI-Forge 的 Physical AI 方向中承担的是“动态视觉层”: 单目视频 → 生成式多视角 → 4DGS 动态世界表示 → 机器人观测 / 仿真 / 策略训练 → 真机验证 4DGS 不是最终控制器,也不是完整物理仿真器。它表达的是世界在空间和时间上如何呈现;碰撞、摩擦、接触动力学和关节控制仍需要 MuJoCo、Isaac Sim 或其他物理与机器人系统。 我们跑通了什么 把一段人物视频变成可以自由改变视角的动态场景,需要的不只是一个生成模型。传统 4DGS 通常依赖同步、标定的多视角视频;Phi Media Lab 与 rocPAI-Lab 探索了一条更低采集门槛的路径:从单目视频出发,在 AMD Instinct MI300X + ROCm 上用 4D 视频生成模型补充同步多视角观测,再完成 4D Gaussian 重建,最后由 AMD Radeon 节点完成 Vulkan 渲染、VA-API H.264 编码与 WebRTC 交付。 这不是把生成视角当成真实摄像头阵列,而是用模型预测的多视角观测替代一部分采集硬件:以更低的采集、同步和标定门槛,换取额外的生成计算与几何一致性验证成本。 一次端到端实验完成了: 一段单目人物视频的 121 帧区间 → 24 路、2,904 张 704×1280 多视角观测 初始化 499,972 个动态 Gaussian,完成 30,000 次参数更新 导出可独立部署的 AssetBundle 在 Radeon 上输出 1280×720 动态画面,并由 Chrome 通过 WebRTC 接收 这不是跨平台 benchmark,而是我们验证过的具体软硬件组合和执行路径。 ...

2026年9月10日 · 2 分钟 · Phi Media Lab × rocPAI-Lab