<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Physical AI on rocPAI-Forge</title><link>https://rocpai-forge.github.io/zh/tags/physical-ai/</link><description>Recent content in Physical AI on rocPAI-Forge</description><generator>Hugo</generator><language>zh</language><lastBuildDate>Thu, 10 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://rocpai-forge.github.io/zh/tags/physical-ai/index.xml" rel="self" type="application/rss+xml"/><item><title>让 Physical AI 看懂动态世界：在 AMD ROCm 上用单目视频构建 4DGS</title><link>https://rocpai-forge.github.io/zh/posts/amd-4dgs-series-01/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://rocpai-forge.github.io/zh/posts/amd-4dgs-series-01/</guid><description>&lt;h2 id="physical-ai-的动态世界表示">Physical AI 的动态世界表示&lt;/h2>
&lt;p>Physical AI 的核心问题，不只是生成像素，而是让系统感知、重建并持续查询一个正在变化的真实世界。传统 4DGS 通常从同步、标定的多视角视频开始；本文探索一条更低采集门槛的路径：从单目视频出发，通过 4D 视频生成模型补充同步多视角观测，构建可查询的 4DGS 动态世界表示。&lt;/p>
&lt;p>这条管线在 rocPAI-Forge 的 Physical AI 方向中承担的是“动态视觉层”：&lt;/p>
&lt;div class="highlight">&lt;pre tabindex="0" class="chroma">&lt;code class="language-text" data-lang="text">&lt;span class="line">&lt;span class="cl">单目视频 → 生成式多视角 → 4DGS 动态世界表示
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> → 机器人观测 / 仿真 / 策略训练 → 真机验证
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/div>&lt;p>4DGS 不是最终控制器，也不是完整物理仿真器。它表达的是世界在空间和时间上如何呈现；碰撞、摩擦、接触动力学和关节控制仍需要 MuJoCo、Isaac Sim 或其他物理与机器人系统。&lt;/p>
&lt;h2 id="我们跑通了什么">我们跑通了什么&lt;/h2>
&lt;p>把一段人物视频变成可以自由改变视角的动态场景，需要的不只是一个生成模型。传统 4DGS 通常依赖同步、标定的多视角视频；Phi Media Lab 与 rocPAI-Lab 探索了一条更低采集门槛的路径：从&lt;strong>单目视频&lt;/strong>出发，在 &lt;strong>AMD Instinct MI300X + ROCm&lt;/strong> 上用 4D 视频生成模型补充同步多视角观测，再完成 4D Gaussian 重建，最后由 &lt;strong>AMD Radeon&lt;/strong> 节点完成 Vulkan 渲染、VA-API H.264 编码与 WebRTC 交付。&lt;/p>
&lt;p>这不是把生成视角当成真实摄像头阵列，而是用模型预测的多视角观测替代一部分采集硬件：以更低的采集、同步和标定门槛，换取额外的生成计算与几何一致性验证成本。&lt;/p>
&lt;p>一次端到端实验完成了：&lt;/p>
&lt;ul>
&lt;li>一段单目人物视频的 121 帧区间 → 24 路、2,904 张 &lt;code>704×1280&lt;/code> 多视角观测&lt;/li>
&lt;li>初始化 499,972 个动态 Gaussian，完成 30,000 次参数更新&lt;/li>
&lt;li>导出可独立部署的 AssetBundle&lt;/li>
&lt;li>在 Radeon 上输出 &lt;code>1280×720&lt;/code> 动态画面，并由 Chrome 通过 WebRTC 接收&lt;/li>
&lt;/ul>
&lt;p>这不是跨平台 benchmark，而是我们验证过的具体软硬件组合和执行路径。&lt;/p></description></item></channel></rss>