已核验 · Aug 5, 2026
已独立佐证Thinking Machines Inkling 7/15 一日三发:~1T 多模态开源 + vLLM day-0 + SGLang day-0,Blackwell 上 380 tok/s/user MTP8
4 个信源7 月 15 日 Thinking Machines 在 HF 上发 Inkling —— 一个 ~1T 参数开源多模态模型(图像/文本/音频原生输入、45T token 训练、975B 总参 / 41B 激活 MoE、1M 上下文、相对注意力、5:1 sliding 与 global 混合注意力、hierarchical MLP patchifier + mel-spectrogram 离散化);同日 vLLM blog 给出 day-0 支持(NVFP4 + BF16 双变体完整功能对等、8 个 MTP head、4x GB200 上 380 tok/s/user MTP8、平均 acceptance length 4.5、140 tok/s/user 无 MTP、1M 上下文按长度桶精度 99.09% / 95.68% / 81.36%);同日 LMSYS 给出 SGLang day-0 支持(Blackwell 上 71.7k tok/s 输入吞吐、SGLang Cookbook 同步给出 TP4 / TP8 / H200 / AMD MI350X / MI355X 部署菜谱)。三件事拼成「7 月开源生态最强一日之一:1T 开源多模态 + 同一日就到推理引擎」。
为什么现在讲
7/15 是 7 月初最强开源一日 —— 一个 ~1T 多模态开源 + vLLM + SGLang 三方同日 day-0,把「仓库里的 1T 多模态」直接变成「今天就能拉到 Blackwell 上跑」;创作者可以做出「开源大模型不是仓库里吃灰的权重,是次日就有推理引擎」的对照内容
推荐理由
可演示空间极大:可以在 HF 上拉 thinkingmachines/Inkling BF16 权重、用 vLLM `--model-impl` 起一个 endpoint、跑一段多模态推理(图像 + 文本 + 音频混合输入),展示 1M 上下文按长度桶精度数据;也可以对照 vLLM 与 SGLang 两个 endpoint 的吞吐量
依据
三方同日 day-0 自带高热度,而且 Inkling 自报 HLE 29.7% / AIME 97.1% / VoiceBench 91.4% / SWE-Bench Verified 77.6% 是模型卡级数字,作为单一旗舰事件热度中上;但热度来自「Thinking Machines / vLLM / SGLang 三方同发」+ Inkling 自报数字,不是独立复现
“「7/15 这一天开源生态把『仓库里的 1T 多模态』直接变成『今天就能在 Blackwell 上跑』 —— 一个 ~1T 多模态开源 + vLLM day-0 + SGLang day-0 三方同发。」”
切入角度
把 7/15 Inkling 一日三发(Thinking Machines 开源 + vLLM day-0 + LMSYS SGLang day-0)讲成「7 月开源生态最强一日之一:1T 多模态 + 同日就到推理引擎」 —— 创作者做出「仓库权重 + 推理引擎 + 部署菜谱同日就绪」的三段对照,而不是只念单一基准分
形式
长视频讲解
演示想法
做一段 15 分钟三段对照 demo:第一段 5 分钟在 HF 上拉 thinkingmachines/Inkling BF16 权重、用 vLLM `--model-impl` 起 endpoint,跑一段多模态推理(图像 + 文本 + 音频混合输入),展示按长度桶的精度数据;第二段 5 分钟用 SGLang Cookbook 同一份权重起 endpoint、对比 vLLM 与 SGLang 在 Blackwell 上的吞吐量;第三段 5 分钟讲「开放权重 + 同日 day-0 推理引擎」对创作者意味着什么 —— 不再需要等 2-4 周适配
平台注意
Inkling 头条基准分(HLE 29.7% / AIME 97.1% / VoiceBench 91.4% / SWE-Bench Verified 77.6%)是 Thinking Machines 自陈(中等风险),不要改写为「独立第三方验证」;协议在已捕获摘要里未声明(中等风险),不要凭印象说「Apache-2.0」或「MIT」;长度桶精度数据 81.36%(586K-805K)是 vLLM 自陈(中等风险),不要凭印象补数字
可用说法
- Hugging Face 2026 年 7 月 15 日博客文章宣布 Inkling by Thinking Machines —— 一个 ~1T 参数的开源多模态模型,原生接受图像、文本、音频输入,在 45T token 上训练;架构为 decoder-only 多模态 MoE,975B 总参 / 41B 激活,256 个 expert + top-6 + 2 个 shared expert,1M 上下文窗口,相对注意力(无 RoPE),5:1 sliding-window 与 global 混合注意力,hidden state 上的短 1D 卷积(SConv),视觉用 hierarchical MLP patchifier,音频用 mel-spectrogram 离散化;变体为 Inkling BF16(2 TB VRAM)与 Inkling NVFP4(600 GB),Inkling-Small BF16 600 GB(276B 总参 / 12B 激活)/ NVFP4 180 GB;自报基准 Inkling vs Inkling-Small:HLE 文本 29.7% / 31.6%,HLE 带工具 46.0% / 47.8%,AIME 2026 97.1% / 95.5%,GPQA Diamond 87.2% / 89.5%,SWE-Bench Verified 77.6% / 80.2%,SWE-Bench Pro 54.3% / 55.9%,Terminal Bench 2.1 63.8 / 64.69,MCP Atlas 74.1% / 79.2%,MMMU Pro 73.3% / 74.0%,VoiceBench 91.4% / 90.1%;协议在已捕获摘要里未声明。
- vLLM 和 SGLang 都在 2026-07-15 上线了 TML Inkling day-0 支持。vLLM 记录了 NVFP4 + BF16 变体的完整功能对等、8 个 MTP head(每次 forward step 最多 9 个 token)、原生支持 1M token,在 4x NVIDIA GB200 上引用 380 tok/s/user(MTP8,平均 acceptance length 4.5)和 140 tok/s/user(无 MTP)的吞吐量;vLLM 还记录了按长度桶的精度数据 —— 2K-221K 区间 99.09% (436/440)、294K-513K 区间 95.68% (421/440)、586K-805K 区间 81.36% (358/440)。SGLang 记录了 975B 多模态 MoE 在 1M token 上下文下的 day-0 支持,在 Blackwell 上达到 71.7k tok/s 输入吞吐。
证据链
来自新闻
拆解
Thinking Machines 开源 + vLLM day-0 + LMSYS SGLang day-0 三件事单独念任何一个都会变成「念单一基准分」(比如只说 HLE 29.7% / VoiceBench 91.4%)。本篇解释怎么用「7 月开源生态最强一日之一:1T 多模态 + 同日就到推理引擎」框架讲 —— 创作者做出「仓库权重 + 推理引擎 + 部署菜谱同日就绪」的三段对照,把 1T 多模态开源 + vLLM + SGLang 绑成一条「不再是仓库里吃灰的权重、是次日就能拉到 Blackwell 上跑」的叙事。
信源
风险
- 固定链到每条 source,只引用摘要里已公开的内容,不要改写除摘要之外的基准分、性能指标、协议细节、论文细节或架构细节。
- 固定链到 HF blog 原文,只引用文章公开的内容;不要把头条分数改写为「独立第三方验证」;明确指出协议在已捕获摘要里未声明,基准数字为厂商自陈。
演示思路
- 在 HF 上拉 thinkingmachines/Inkling BF16 权重(2 TB VRAM)、用 vLLM `--model-impl` 起 endpoint,跑同一段多模态推理(图像 + 文本 + 音频混合输入)展示 1M 上下文按长度桶精度数据
- 对照 vLLM 与 SGLang 两个 endpoint 在 Blackwell 上的吞吐量(380 tok/s/user MTP8 vs 71.7k tok/s 输入),讲「同一权重、不同推理引擎」的 trade-off
- 录一段 SGLang Cookbook 在 TP4 / TP8 / H200 / AMD MI350X / MI355X 上的部署菜谱,演示「同一权重在 5 种硬件上的部署清单」