已核验 · Aug 5, 2026
已独立佐证推理硬件集群:Blackwell + Groq LPU v3 + Cerebras WSE + Apple MLX 1.0 + Inferentia3 + TPU v6 —— 每个 vendor 都发货 Blackwell-era 答案
8 个信源2026-08-04 这一周出现了一组推理硬件 / 框架发布集群:NVIDIA Blackwell B200(FP4/FP8 + NVLink Switch + DGX SuperPOD)、Groq LPU 推理引擎 v3(无论 batch 大小都确定性 token 流延迟)、Cerebras WSE(晶圆级单芯片推理 + cloud SDK)、Apple MLX 1.0 + MLX-LM(Apple Silicon 设备端 LLM 推理,统一内存)、AWS Inferentia3 + Neuron SDK v3(Neuron-compatible 实例生产推理)、Google TPU v6 Trillium(Vertex AI 托管推理)。The Decoder 把这个集群框成「每个推理 vendor 都发货一个 Blackwell-era 答案」—— GPU 代际成了竞争定位单位,每个 vendor 都挑了一条路。
为什么现在讲
集群是把六个独立推理发布变成一个连贯「推理现在是一个 buyer-side 市场」故事的 editorial framing —— 并排对比对创作者最有用。
推荐理由
演示空间:同一推理任务(token 流延迟、吞吐、成本)在 Blackwell、Groq LPU、Cerebras WSE、Apple MLX、Inferentia3、TPU v6 上的并排对比。
依据
The Decoder + IT 之家周报 + 六个独立 vendor 一手源
“六个推理 vendor 同一周发了 Blackwell-era 答案 —— NVIDIA Blackwell、Groq LPU v3、Cerebras WSE、Apple MLX 1.0、AWS Inferentia3、Google TPU v6 —— 每个 vendor 在 cost、latency、model coverage、设备端支持上都挑了不同的路。”
切入角度
用集群引入「推理现在是一个 buyer-side 市场」模式 —— 每个 vendor 在 cost / latency / model coverage / 设备端上都挑了一条路 —— 用这个 lens 并排对比 vendor 方案。
形式
长视频讲解
演示想法
录一段 16 分钟并排对比讲解:2 分钟开场讲「推理 buyer-side 市场」框架,然后每个 vendor 2 分钟(Blackwell / Groq / Cerebras / Apple MLX / Inferentia3 / TPU v6),最后 4 分钟在同一 token 流延迟 / 吞吐 / 成本测量上并排对比六个。
平台注意
每个 vendor 都把发布框成跟自己关心的竞争集对比;The Decoder 和 IT 之家是 editorial framing 层,不是独立验证。在记录任何具体吞吐或定价声明前,对照 vendor 一手文档确认。
可用说法
- NVIDIA Blackwell 世代(B200 数据手册)记录了 FP4/FP8 推理吞吐、NVLink Switch 互联扩展,以及面向生产推理的 DGX SuperPOD 参考架构。
- Groq LPU 推理引擎 v3 把确定性的 token 流延迟作为头号产品特性,不受 batch 大小影响。
- Cerebras WSE 晶圆级推理随云 SDK 交付,通过单芯片推理避免跨 GPU 的模型并行。
- Apple MLX 1.0 框架 GA + MLX-LM Python 包,面向 Apple Silicon 上的端侧 LLM 推理,GPU 与 CPU 共享统一内存。
- AWS Inferentia3 GA + Neuron SDK v3,支持 PyTorch / JAX / TensorFlow、分布式推理,以及用于自定义模型编译的 Neuron Compiler。
- Google Cloud TPU v6(Trillium)在云上 GA,集成 Vertex AI 托管推理,支持按 pod 的扩展拓扑。
证据链
来自新闻
拆解
六个推理 vendor 同一周发了 Blackwell-era 答案 —— editorial framing(「每个推理 vendor 都发货 Blackwell-era 答案」)有用,但如果你不引入 buyer-side 模式,内容就退化成 spec sheet。本篇解释怎么用集群引入「推理现在是一个 buyer-side 市场」模式(每个 vendor 在 cost / latency / model coverage / 设备端上都挑了一条路),用这个 lens 并排对比 vendor 方案。
信源
- The Decoder: tech-press coverage of the 'inference hardware' cluster for the week of 2026-08-04
- IT之家: 中文科技媒体覆盖 8/4 推理硬件集群
- NVIDIA: Blackwell B200 GPU datasheet and inference benchmarks
- Groq: LPU inference engine v3 — deterministic token-stream latency
- Cerebras: WSE wafer-scale inference + cloud SDK
- Apple: MLX 1.0 framework + MLX-LM for on-device inference
- AWS: Inferentia3 + Neuron SDK v3 GA for production inference
- Google Cloud: TPU v6 (Trillium) GA on Cloud + Vertex AI integration
风险
- The Decoder 和 IT之家可用作媒体类佐证,但在对外表述任何具体吞吐或定价声明前,请先阅读厂商原始文档。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
- 厂商文档确认产品 / 功能存在,但精确吞吐和定价本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
- MLX 文档明确将该框架定位为面向统一内存的 Apple Silicon。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
- 文档确认了框架支持,但具体模型覆盖范围本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
演示思路
- 六个 vendor 同 token 流延迟测量并排 —— 同一模型、同一 prompt,画 time-to-first-token 和 token 间延迟
- 决策树:「哪个推理 vendor 配哪个用例」(低延迟流式 → Groq LPU,单芯片大模型 → Cerebras WSE,设备端 / 隐私 → Apple MLX,AWS 原生 → Inferentia3,Google Cloud → TPU v6,裸 GPU → Blackwell)
- 成本计算器:chat 工作负载下六个 vendor per-1K-token 成本对比