已核验 · Aug 5, 2026
已独立佐证Preparedness v2 + Frontier Safety v3:前沿 lab 用来衡量能力和风险的双评估框架
3 个信源OpenAI Preparedness Framework v2(风险类别、分数阈值、缓解义务、跨职能审查委员会)+ Google DeepMind Frontier Safety Framework v3(能力评估、早期预警、缓解部署义务)定义前沿 lab 随模型发布公布的双评估框架。两者结构不同(Preparedness 是按风险分类带阈值;Frontier Safety 是按能力评估带早期预警),但目标收敛 —— 生产一份结构化 artifact,lab 用它来决策某个能力是部署、缓解、还是暂停。
为什么现在讲
两个框架同一周更新 —— 双评估框架模式是 2026 余下时间读前沿 lab 安全沟通的 lens。
推荐理由
演示空间:Preparedness v2 vs Frontier Safety v3 并排 —— 每个衡量什么,每个缓解义务长什么样,在哪里收敛在哪里分化。
依据
OpenAI Preparedness 文档 + Google DeepMind safety 页 + The Decoder 周报
“OpenAI Preparedness v2 和 Google DeepMind Frontier Safety v3 本周一起发 —— 两者合起来定义前沿 lab 怎么衡量能力和风险;创作者应该读框架结构,不只是头条版本号。”
切入角度
用双重更新引入「评估框架」框架 —— Preparedness v2 + Frontier Safety v3 合起来定义前沿 lab 怎么衡量能力和风险 —— 用这个 lens 讨论创作者应该读每个框架的什么。
形式
长视频讲解
演示想法
录一段 10 分钟讲解:3 分钟讲「为什么双评估框架重要」(每个 lab 有自己的结构;创作者应该读结构),3 分钟讲 Preparedness v2(按风险分类带阈值),3 分钟讲 Frontier Safety v3(按能力评估带早期预警),1 分钟讲收敛。
平台注意
具体风险类别、分数阈值、评估任务、早期预警阈值(超出本次捕获范围)未抽取;不要给出具体数字或类别名。
可用说法
- OpenAI 将 Preparedness Framework 更新到 v2 —— 风险类别、分数阈值、缓解义务和跨职能审查委员会。
- Google DeepMind 发布 Frontier Safety Framework v3 —— 能力评估、早期预警指标、缓解部署义务。
证据链
来自新闻
拆解
Preparedness v2 和 Frontier Safety v3 都是「评估框架」,但结构不同(Preparedness 按风险分类带阈值;Frontier Safety 按能力评估带早期预警),缓解义务也不同。本篇用双重更新展示两者在哪里收敛(部署 / 缓解 / 暂停决策),在哪里分化(结构、命名、阈值语义) —— 不声称其中一个是另一个应该遵循的标准。
信源
风险
- 文档确认框架版本存在,但超出所捕获摘要的具体阈值、类别和任务本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
- The Decoder 和 IT之家可用作媒体类佐证,但在对外表述任何具体安全声明前,请先阅读实验室原始文档。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
演示思路
- 并排框架走查:Preparedness v2 vs Frontier Safety v3 —— 每个衡量什么,每个缓解长什么样
- 收敛 / 分化矩阵:两者在哪里收敛(部署 / 缓解 / 暂停决策),在哪里分化(结构、命名、阈值语义)
- 读法指南:创作者怎么读每个框架的结构 —— 当前沿 lab 发模型时