返回今日选题

已核验 · Aug 14, 2026

已独立佐证

OpenAI + Cerebras:GPT-5.6 Sol Ultrafast mode 上 OpenAI API —— 750 t/s,比 Fable 5 快 11 倍

2 个信源

2026-08-13 Cerebras 和 OpenAI 在 OpenAI API 上推出 GPT-5.6 Sol「Ultrafast Mode」,由 Cerebras Wafer-Scale Engine 硬件(每片 wafer 大小芯片 44 GB SRAM)驱动。Cerebras 报 up to 750 output tokens/sec,比 Fable 5 快 11 倍,比 Opus 4.8 Fast mode 快 5 倍,GDP-Val 端到端加速 5.6 倍质量无降。发布完成全部 2,500 个 Humanity's Last Exam 题用 11 小时 11 分钟,而 Claude Fable 5 用 78 小时 27 分钟(快约 7 倍,准确度相当)。Limited preview,只对选定客户开放;抓取摘要未提定价。创作者 takeaway:GPT-5.6 Sol on Cerebras 是 OpenAI API 面的速度赌注 —— 速度真实(Cerebras 把片上 SRAM 当差异化),但 limited-preview 访问和未公开定价让它成为「盯着这个 tier」的故事,而不是「今天就迁移」的故事。

为什么现在讲

故事是「OpenAI + Cerebras 合作推 Ultrafast tier」的编辑框架 —— 有用是因为在观察速度 vs 成本前沿的创作者现在有一个 Cerebras 托管的 OpenAI API tier 当对照点。

推荐理由

Demo 潜力:4 分钟讲解 —— Cerebras Wafer-Scale Engine 差异化是什么、报的速度数字对时间敏感的创作者工作流意味着什么、limited-preview 访问对迁移时序意味着什么。

依据

Cerebras 博客 + HN 首页报道

OpenAI 刚 ship 一个由 Cerebras 驱动的 Ultrafast tier —— 750 output tokens per second,比 Fable 5 快 11 倍 —— 差异化是每片 wafer 44 GB 片上 SRAM。

切入角度

框成 OpenAI API 面里的速度赌注 —— 用 Cerebras 片上 SRAM 当差异化,框 limited-preview 状态为「盯着这个 tier」框定,而不是「今天迁移」框定。

形式

口播短视频

演示想法

4 分钟:1 分钟「Cerebras 片上 SRAM 对 token 吞吐意味着什么」,1 分钟「报的速度数字(750 t/s、比 Fable 5 快 11 倍、GDP-Val 5.6x)」,1 分钟「Humanity's Last Exam 11h 11m vs 78h 27m —— 7 倍端到端加速看起来怎样」,1 分钟「limited-preview 状态和迁移前该盯着什么」。

平台注意

抓取摘要未提 Cerebras 博客定价。框成「limited preview,只对选定客户」,不引用具体 per-token 价。Cerebras 页面自己注明性能对比基于第三方 benchmark 或内部测试;实际速度 vs GPU 系统可能因工作负载、配置、日期和被测模型而变。

可用说法

  • Cerebras 与 OpenAI 于 2026-08-13 在 OpenAI API 上推出 GPT-5.6 Sol「Ultrafast Mode」,由 Cerebras Wafer-Scale Engine 硬件驱动(每片晶圆级芯片 44 GB SRAM)。Cerebras 报告输出速度最高 750 token/秒,比 Fable 5 快 11 倍,GDP-Val 端到端加速 5.6 倍且无质量损失。限量预览,仅面向部分客户。

证据链

拆解

GPT-5.6 Sol Ultrafast mode 在 OpenAI API 上是 Cerebras 托管的速度赌注 tier —— 「速度赌注」有用但容易被错读成 general-availability 迁移目标。风险:这 mode 是 limited preview,只对选定客户,抓取摘要未提定价。这篇 explainer 用 Cerebras 片上 SRAM 当差异化,框 limited-preview 状态为「盯着这个 tier」框定,而不是「今天迁移」框定。

风险

  • 将该发布表述为「限量预览,Cerebras 托管的 OpenAI API 档位」,并将定价标记为不可公开引用。对外表述任何按 token 成本前,请从 Cerebras 或 OpenAI 重新提取定价。

演示思路

  • 片上 vs 片外 framing 卡:「每片 wafer 44 GB SRAM」vs GPU HBM(典型每设备 80 GB,片外)—— 对 token 吞吐上限意味着什么。
  • 工作流对比:同一个 agent 任务在标准 OpenAI API tier vs Ultrafast tier 上(如果可访问)—— 测延迟和稳定性。
  • 观察清单卡:「考虑 Ultrafast 迁移前该检查什么」(定价、GA 时间线、跨模型负载的吞吐稳定性)。