已核验 · Aug 11, 2026
已独立佐证世界模型 + 机器人集群:World Labs RTFM + DeepMind Genie 3 + NVIDIA Cosmos + Figure Helix 2 —— 每个世界模型 / 人形机器人 vendor 一周发 GA 里程碑
6 个信源2026-08-11 这一周出现了一组世界模型 + 机器人发布集群:World Labs RTFM(实时前馈 3D 生成,从单张图,不用 per-scene 优化)、DeepMind Genie 3 GA(交互式世界模型 —— 用户可以实时导航 + 交互)、NVIDIA Cosmos(机器人 + 自动驾驶的世界基础模型,带 Cosmos Reason VLA + Cosmos Transfer simulation-to-real)、Figure Helix 2(人形机器人的 vision-language-action 模型,带 dual-system 架构)。The Decoder 把这个集群框成「每个世界模型 + 人形机器人 vendor 都同一周发一个 GA 里程碑」。模式:世界模型在实时 + 交互输出上收敛(RTFM + Genie 3);机器人基础模型在 VLA 架构上收敛(Cosmos + Helix 2)。
为什么现在讲
集群是把四个独立世界模型 + 机器人发布变成一个连贯「世界模型和 VLA 机器人同时达 GA」故事的 editorial framing。
推荐理由
演示空间:同一实时 3D 场景在 RTFM 上生成 + 在 Genie 3 上导航的并排,加上 Cosmos 驱动的 simulation 任务 vs Helix 2 人形机器人任务的并排。
依据
The Decoder + IT 之家周报 + 四个独立 vendor 一手源
“四个世界模型 + 人形机器人 vendor 同一周发了 GA —— World Labs RTFM、DeepMind Genie 3、NVIDIA Cosmos、Figure Helix 2 —— 世界模型 + 机器人基础模型同时达创作者可研究的表面。”
切入角度
用集群引入「世界模型 + VLA 机器人同时达 GA」模式,用这个 lens 并排对比方案。
形式
长视频讲解
演示想法
录一段 14 分钟并排对比讲解:2 分钟讲「世界模型 + VLA 机器人同时达 GA」框架,然后每个 vendor 2 分钟(RTFM / Genie 3 / Cosmos / Helix 2),最后 4 分钟在同一实时 3D 场景 + VLA 机器人任务上并排对比四个。
平台注意
每个 vendor 的 release notes 都把发布框成跟自己关心的竞争集对比;The Decoder 和 IT 之家是 editorial framing 层,不是独立验证。在记录任何具体延迟目标或机器人 benchmark 之前,对照 vendor 一手文档确认。
可用说法
- World Labs 发布 RTFM —— 实时前馈 3D 世界模型,无需逐场景优化即可从单张图像生成 3D 场景。
- Google DeepMind 发布 Genie 3 GA —— 交互式世界模型,让用户在生成环境中实时导航和交互。
- NVIDIA 发布 Cosmos —— 面向机器人 + 自主系统的世界基础模型,含 Cosmos Reason 视觉-语言-动作模型和 Cosmos Transfer 仿真到现实管线。
- Figure 发布 Helix 2 —— Helix 人形机器人的视觉-语言-动作模型,采用双系统架构(System 1 快速反应 + System 2 慢速推理)。
证据链
来自新闻
拆解
四个世界模型 + 人形机器人 vendor 同一周发了 GA —— editorial framing(「世界模型和 VLA 机器人同时达 GA」)有用,但如果你不引入收敛模式,内容就退化成研究实验室巡礼。本篇解释怎么用集群引入收敛模式(世界模型在实时 + 交互上,机器人基础模型在 VLA 上),用这个 lens 并排对比方案。
信源
- The Decoder: tech-press coverage of the 'world models + robotics' cluster for the week of 2026-08-11
- IT之家: 中文科技媒体覆盖 8/11 世界模型 + 机器人集群
- World Labs: RTFM — real-time feed-forward 3D world model GA
- Google DeepMind: Genie 3 — interactive world model GA
- NVIDIA: Cosmos — world foundation model for robotics + autonomy
- Figure: Helix 2 — humanoid robot VLA model GA
风险
- The Decoder 和 IT之家可用作媒体类佐证,但在对外表述任何具体能力或跑分声明前,请先阅读厂商原始文档。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
- 厂商文档确认了实时 / 交互能力,但超出所捕获摘要的具体延迟目标本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
- 厂商文档确认特性存在,但超出所捕获摘要的具体跑分数字本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
演示思路
- 并排实时 3D + 交互:同一场景在 RTFM 上生成 + 在 Genie 3 上导航
- 并排 VLA 机器人:Cosmos 驱动的 simulation 任务 vs Helix 2 人形机器人任务
- 决策树:「哪个世界模型 / VLA 配哪个用例」(实时 3D 生成 → RTFM,交互导航 → Genie 3,通用机器人 → Cosmos,人形专用 → Helix 2)