已核验 · Aug 14, 2026
已独立佐证OpenAI + Cerebras:GPT-5.6 Sol Ultrafast mode 上 OpenAI API —— 750 t/s,比 Fable 5 快 11 倍
2 个信源2026-08-13 Cerebras 和 OpenAI 在 OpenAI API 上推出 GPT-5.6 Sol「Ultrafast Mode」,由 Cerebras Wafer-Scale Engine 硬件(每片 wafer 大小芯片 44 GB SRAM)驱动。Cerebras 报 up to 750 output tokens/sec,比 Fable 5 快 11 倍,比 Opus 4.8 Fast mode 快 5 倍,GDP-Val 端到端加速 5.6 倍质量无降。发布完成全部 2,500 个 Humanity's Last Exam 题用 11 小时 11 分钟,而 Claude Fable 5 用 78 小时 27 分钟(快约 7 倍,准确度相当)。Limited preview,只对选定客户开放;抓取摘要未提定价。创作者 takeaway:GPT-5.6 Sol on Cerebras 是 OpenAI API 面的速度赌注 —— 速度真实(Cerebras 把片上 SRAM 当差异化),但 limited-preview 访问和未公开定价让它成为「盯着这个 tier」的故事,而不是「今天就迁移」的故事。
为什么现在讲
故事是「OpenAI + Cerebras 合作推 Ultrafast tier」的编辑框架 —— 有用是因为在观察速度 vs 成本前沿的创作者现在有一个 Cerebras 托管的 OpenAI API tier 当对照点。
推荐理由
Demo 潜力:4 分钟讲解 —— Cerebras Wafer-Scale Engine 差异化是什么、报的速度数字对时间敏感的创作者工作流意味着什么、limited-preview 访问对迁移时序意味着什么。
依据
Cerebras 博客 + HN 首页报道
“OpenAI 刚 ship 一个由 Cerebras 驱动的 Ultrafast tier —— 750 output tokens per second,比 Fable 5 快 11 倍 —— 差异化是每片 wafer 44 GB 片上 SRAM。”
切入角度
框成 OpenAI API 面里的速度赌注 —— 用 Cerebras 片上 SRAM 当差异化,框 limited-preview 状态为「盯着这个 tier」框定,而不是「今天迁移」框定。
形式
口播短视频
演示想法
4 分钟:1 分钟「Cerebras 片上 SRAM 对 token 吞吐意味着什么」,1 分钟「报的速度数字(750 t/s、比 Fable 5 快 11 倍、GDP-Val 5.6x)」,1 分钟「Humanity's Last Exam 11h 11m vs 78h 27m —— 7 倍端到端加速看起来怎样」,1 分钟「limited-preview 状态和迁移前该盯着什么」。
平台注意
抓取摘要未提 Cerebras 博客定价。框成「limited preview,只对选定客户」,不引用具体 per-token 价。Cerebras 页面自己注明性能对比基于第三方 benchmark 或内部测试;实际速度 vs GPU 系统可能因工作负载、配置、日期和被测模型而变。
可用说法
- Cerebras 与 OpenAI 于 2026-08-13 在 OpenAI API 上推出 GPT-5.6 Sol「Ultrafast Mode」,由 Cerebras Wafer-Scale Engine 硬件驱动(每片晶圆级芯片 44 GB SRAM)。Cerebras 报告输出速度最高 750 token/秒,比 Fable 5 快 11 倍,GDP-Val 端到端加速 5.6 倍且无质量损失。限量预览,仅面向部分客户。
证据链
拆解
GPT-5.6 Sol Ultrafast mode 在 OpenAI API 上是 Cerebras 托管的速度赌注 tier —— 「速度赌注」有用但容易被错读成 general-availability 迁移目标。风险:这 mode 是 limited preview,只对选定客户,抓取摘要未提定价。这篇 explainer 用 Cerebras 片上 SRAM 当差异化,框 limited-preview 状态为「盯着这个 tier」框定,而不是「今天迁移」框定。
信源
风险
- 将该发布表述为「限量预览,Cerebras 托管的 OpenAI API 档位」,并将定价标记为不可公开引用。对外表述任何按 token 成本前,请从 Cerebras 或 OpenAI 重新提取定价。
演示思路
- 片上 vs 片外 framing 卡:「每片 wafer 44 GB SRAM」vs GPU HBM(典型每设备 80 GB,片外)—— 对 token 吞吐上限意味着什么。
- 工作流对比:同一个 agent 任务在标准 OpenAI API tier vs Ultrafast tier 上(如果可访问)—— 测延迟和稳定性。
- 观察清单卡:「考虑 Ultrafast 迁移前该检查什么」(定价、GA 时间线、跨模型负载的吞吐稳定性)。