返回今日选题

已核验 · Aug 11, 2026

已独立佐证

原生音频视频生成:Veo 3.5 + Sora 2 —— 去掉单独音频 pipeline 的属性

3 个信源

Veo 3.5(原生音频生成带唇同步对白 + 环境音)和 Sora 2(原生音频 + 60+ 秒角色/场景一致性)同一周都发了原生音频。两者合起来定义「原生音频视频模型」面,去掉创作者工作流里的单独音频 pipeline 步骤 —— 不用先生成视频、导出、再跑一个单独的音频模型,创作者可以发带同步音频的单镜头片段。两者并不等价:Veo 3.5 在 Vertex AI 上发,带显式 camera-motion API;Sora 2 带 Storyboard 编辑器用于镜头规划。

为什么现在讲

两个同一周发了 —— 创作者现在能依赖单个模型做视频 + 音频,显著简化工作流。

推荐理由

演示空间:同一 30 秒脚本场景带对白在 Veo 3.5 vs Sora 2 上生成,量唇同步准确度和环境音保真度。

依据

两个独立 vendor 一手源 + The Decoder 周报

Veo 3.5 和 Sora 2 本周一起发 —— 两者合起来去掉创作者视频工作流里的单独音频 pipeline 步骤:一个模型处理视频 + 同步音频。

切入角度

把两个框成「原生音频视频模型」面 —— Veo 3.5 和 Sora 2 去掉创作者视频工作流里的单独音频 pipeline 步骤。

形式

长视频讲解

演示想法

录一段 10 分钟讲解:3 分钟讲「原生音频视频」框架,3 分钟讲 Veo 3.5(原生音频 + camera-motion API),3 分钟讲 Sora 2(原生音频 + Storyboard 编辑器),1 分钟讲工作流简化。

平台注意

具体唇同步准确度和环境音保真度(超出本次捕获范围)未抽取;以创作者侧 demo 为准。逐档定价未抽取。

可用说法

  • Google DeepMind Veo 3.5 在 Vertex AI 上 GA —— 4K 分辨率支持、原生音频生成(对白口型同步、环境音)、镜头运动 API。
  • OpenAI Sora 2 —— 60 秒以上镜头的角色 / 场景一致性、原生音频生成、Sora Storyboard 编辑器。

证据链

拆解

Veo 3.5 和 Sora 2 都发了原生音频生成,但对工作流集成下注不同 —— Veo 3.5 在 Vertex AI 上 + camera-motion API,Sora 2 在 Storyboard 编辑器上做镜头规划。本篇用工作流集成对比作为挑模型的 lens,而不是把两者压缩成「都是原生音频,挑一个」。

风险

  • The Decoder 和 IT之家可用作媒体类佐证,但在对外表述任何具体能力或定价声明前,请先阅读厂商原始文档。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
  • 厂商文档确认特性存在,但超出所捕获摘要的具体定价本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。

演示思路

  • 并排 30 秒脚本场景带对白在 Veo 3.5 vs Sora 2 上,量唇同步准确度和环境音保真度
  • 工作流简化故事:「用单镜头原生音频生成替代视频导出 + 单独音频模型」,量省下时间和质量 delta
  • 工作流矩阵:把 Veo 3.5 vs Sora 2 画在工作流集成(Vertex AI vs Storyboard 编辑器)、input 面(camera-motion API vs script)上