已核验 · Aug 11, 2026
已独立佐证视频生成集群:Runway Gen-4.5 + Veo 3.5 + Sora 2 + Pika 2.2 —— 每个视频模型同一周发更长连贯/原生音频里程碑
6 个信源2026-08-08 这一周出现了一组视频生成模型发布集群:Runway Gen-4.5(5+ 秒动作连贯性 + 跨场景角色/物体一致性)、Google DeepMind Veo 3.5(Vertex AI 上 4K + 原生音频 + camera-motion API)、OpenAI Sora 2(60+ 秒镜头 + 原生音频 + Storyboard 编辑器)、Pika 2.2(Pikaframes 关键帧到关键帧插值 + Pika Additions 内补绘 API)。The Decoder 把这个集群框成「每个视频模型同一周发一个更长连贯/原生音频里程碑」。模式:视频生成在两个轴上收敛 —— 更长的时间连贯性和原生音频生成。
为什么现在讲
集群是把四个独立视频模型发布变成一个连贯「视频生成收敛在连贯性 + 音频」故事的 editorial framing —— 对创作者最有用。
推荐理由
演示空间:同一 30 秒 storyboard 在四个模型上的并排生成,量动作连贯性和音频保真度。
依据
The Decoder + IT 之家周报 + 四个独立 vendor 一手源
“四个视频生成模型同一周发了 —— Runway Gen-4.5、Veo 3.5、Sora 2、Pika 2.2 —— 每个都发了更长连贯镜头或原生音频里程碑。”
切入角度
用集群引入「视频生成收敛在连贯性 + 音频」模式 —— 每个 vendor 同一周发了更长连贯镜头 + 原生音频 —— 用这个 lens 并排对比模型。
形式
长视频讲解
演示想法
录一段 14 分钟并排对比讲解:2 分钟讲「连贯性 + 音频」框架,然后每个模型 2 分钟(Runway / Veo / Sora / Pika),最后 4 分钟在同一 30 秒 storyboard 上并排对比四个。
平台注意
每个 vendor 的 release notes 都把发布框成跟自己关心的竞争集对比;The Decoder 和 IT 之家是 editorial framing 层,不是独立验证。动作连贯性和角色一致性声明是 vendor 自陈,以创作者侧 demo 为准。
可用说法
- Runway Gen-4.5 视频生成模型达到 GA —— 5 秒以上镜头的运动连贯性提升、跨场景的角色 / 物体一致性、Act-Two 动作捕捉升级。
- Google DeepMind Veo 3.5 在 Vertex AI 上 GA —— 4K 分辨率支持、原生音频生成(对白口型同步、环境音)、镜头运动 API。
- OpenAI Sora 2 —— 60 秒以上镜头的角色 / 场景一致性、原生音频生成、Sora Storyboard 编辑器。
- Pika 2.2 —— Pikaframes 关键帧到关键帧插值(指定起始和结束帧)、场景一致性提升、用于局部重绘的 Pika Additions API。
证据链
来自新闻
拆解
四个视频模型同一周发了 —— editorial framing(「每个视频模型发一个更长连贯/原生音频里程碑」)有用,但如果你不引入收敛模式,内容就退化成 spec sheet。本篇解释怎么用集群引入「视频生成收敛在连贯性 + 音频」模式,用这个 lens 并排对比模型,同时让逐模型差异保持诚实(Runway 动作连贯性 + Act-Two、Veo 3.5 4K + Vertex AI 集成 + camera-motion API、Sora 2 60+ 秒长镜头 + Storyboard 编辑器、Pika 2.2 Pikaframes 关键帧插值 + Additions API)。
信源
- The Decoder: tech-press coverage of the 'video generation' cluster for the week of 2026-08-08
- IT之家: 中文科技媒体覆盖 8/8 视频生成集群
- Runway: Gen-4.5 video generation model GA
- Google DeepMind: Veo 3.5 video generation GA on Vertex AI
- OpenAI: Sora 2 — longer shots + audio GA
- Pika: Pika 2.2 — Pikaframes keyframe interpolation GA
风险
- The Decoder 和 IT之家可用作媒体类佐证,但在对外表述任何具体能力或定价声明前,请先阅读厂商原始文档。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
- 厂商文档确认特性存在,但超出所捕获摘要的具体定价本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
- 厂商文档将运动连贯性描述为发布说明层面的特性;创作者侧的演示才是正确的验证方式。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
演示思路
- 并排 30 秒 storyboard:同一 prompt 在四个模型上,量动作连贯性和音频保真度
- 决策树:「哪个模型配哪个用例」(动作捕捉驱动 → Runway Act-Two,Vertex AI 上 4K + 原生音频 → Veo 3.5,60+ 秒镜头 → Sora 2,关键帧导演式 → Pika Pikaframes)
- 连贯性 vs 音频矩阵:把每个模型画在时间连贯性 vs 原生音频保真度上