返回今日选题

已核验 · Aug 5, 2026

已独立佐证

推理硬件集群:Blackwell + Groq LPU v3 + Cerebras WSE + Apple MLX 1.0 + Inferentia3 + TPU v6 —— 每个 vendor 都发货 Blackwell-era 答案

8 个信源

2026-08-04 这一周出现了一组推理硬件 / 框架发布集群:NVIDIA Blackwell B200(FP4/FP8 + NVLink Switch + DGX SuperPOD)、Groq LPU 推理引擎 v3(无论 batch 大小都确定性 token 流延迟)、Cerebras WSE(晶圆级单芯片推理 + cloud SDK)、Apple MLX 1.0 + MLX-LM(Apple Silicon 设备端 LLM 推理,统一内存)、AWS Inferentia3 + Neuron SDK v3(Neuron-compatible 实例生产推理)、Google TPU v6 Trillium(Vertex AI 托管推理)。The Decoder 把这个集群框成「每个推理 vendor 都发货一个 Blackwell-era 答案」—— GPU 代际成了竞争定位单位,每个 vendor 都挑了一条路。

为什么现在讲

集群是把六个独立推理发布变成一个连贯「推理现在是一个 buyer-side 市场」故事的 editorial framing —— 并排对比对创作者最有用。

推荐理由

演示空间:同一推理任务(token 流延迟、吞吐、成本)在 Blackwell、Groq LPU、Cerebras WSE、Apple MLX、Inferentia3、TPU v6 上的并排对比。

依据

The Decoder + IT 之家周报 + 六个独立 vendor 一手源

六个推理 vendor 同一周发了 Blackwell-era 答案 —— NVIDIA Blackwell、Groq LPU v3、Cerebras WSE、Apple MLX 1.0、AWS Inferentia3、Google TPU v6 —— 每个 vendor 在 cost、latency、model coverage、设备端支持上都挑了不同的路。

切入角度

用集群引入「推理现在是一个 buyer-side 市场」模式 —— 每个 vendor 在 cost / latency / model coverage / 设备端上都挑了一条路 —— 用这个 lens 并排对比 vendor 方案。

形式

长视频讲解

演示想法

录一段 16 分钟并排对比讲解:2 分钟开场讲「推理 buyer-side 市场」框架,然后每个 vendor 2 分钟(Blackwell / Groq / Cerebras / Apple MLX / Inferentia3 / TPU v6),最后 4 分钟在同一 token 流延迟 / 吞吐 / 成本测量上并排对比六个。

平台注意

每个 vendor 都把发布框成跟自己关心的竞争集对比;The Decoder 和 IT 之家是 editorial framing 层,不是独立验证。在记录任何具体吞吐或定价声明前,对照 vendor 一手文档确认。

可用说法

  • NVIDIA Blackwell 世代(B200 数据手册)记录了 FP4/FP8 推理吞吐、NVLink Switch 互联扩展,以及面向生产推理的 DGX SuperPOD 参考架构。
  • Groq LPU 推理引擎 v3 把确定性的 token 流延迟作为头号产品特性,不受 batch 大小影响。
  • Cerebras WSE 晶圆级推理随云 SDK 交付,通过单芯片推理避免跨 GPU 的模型并行。
  • Apple MLX 1.0 框架 GA + MLX-LM Python 包,面向 Apple Silicon 上的端侧 LLM 推理,GPU 与 CPU 共享统一内存。
  • AWS Inferentia3 GA + Neuron SDK v3,支持 PyTorch / JAX / TensorFlow、分布式推理,以及用于自定义模型编译的 Neuron Compiler。
  • Google Cloud TPU v6(Trillium)在云上 GA,集成 Vertex AI 托管推理,支持按 pod 的扩展拓扑。

证据链

拆解

六个推理 vendor 同一周发了 Blackwell-era 答案 —— editorial framing(「每个推理 vendor 都发货 Blackwell-era 答案」)有用,但如果你不引入 buyer-side 模式,内容就退化成 spec sheet。本篇解释怎么用集群引入「推理现在是一个 buyer-side 市场」模式(每个 vendor 在 cost / latency / model coverage / 设备端上都挑了一条路),用这个 lens 并排对比 vendor 方案。

风险

  • The Decoder 和 IT之家可用作媒体类佐证,但在对外表述任何具体吞吐或定价声明前,请先阅读厂商原始文档。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
  • 厂商文档确认产品 / 功能存在,但精确吞吐和定价本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
  • MLX 文档明确将该框架定位为面向统一内存的 Apple Silicon。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
  • 文档确认了框架支持,但具体模型覆盖范围本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。

演示思路

  • 六个 vendor 同 token 流延迟测量并排 —— 同一模型、同一 prompt,画 time-to-first-token 和 token 间延迟
  • 决策树:「哪个推理 vendor 配哪个用例」(低延迟流式 → Groq LPU,单芯片大模型 → Cerebras WSE,设备端 / 隐私 → Apple MLX,AWS 原生 → Inferentia3,Google Cloud → TPU v6,裸 GPU → Blackwell)
  • 成本计算器:chat 工作负载下六个 vendor per-1K-token 成本对比