返回今日选题

已核验 · Aug 5, 2026

已独立佐证

开源 weight 集群:DeepSeek V3.2 + Qwen3-Omni + Magistral + Kimi K2 + GLM-5.2 + open-r1 一周全发

8 个信源

2026-08-03 这一周出现了一组开源 weight 发布,覆盖前沿能力:DeepSeek V3.2(稀疏 MoE 路由优化 + 128K 滑窗)、阿里 Qwen3-Omni(多模态 vision + audio + text)、Mistral Magistral(开源 weight 推理模型)、月之暗面 Kimi K2(256K 长上下文 + tool-use)、智谱 GLM-5.2(78 层 compressed-attention MoE)、Hugging Face open-r1(全开源推理复现)。The Decoder 把这个集群框成「每个前沿 vendor 都发货开源 weight 选项」。模式:每个发布各占一个能力槽(多模态 / 推理 / 长上下文 / 长输出),带显式 license。

为什么现在讲

集群是把六个独立开源 weight 发布变成一个连贯「开源 weight 栈」故事的 editorial framing —— 并排对比对创作者最有用。

推荐理由

演示空间:同一多模态 + 长上下文 + 推理任务在 Qwen3-Omni + DeepSeek V3.2 + Magistral + K2 + GLM-5.2 + open-r1 上的并排对比。

依据

The Decoder + IT 之家周报 + 六个独立 vendor 一手源

六个开源 weight 发布同一周落地 —— DeepSeek V3.2、Qwen3-Omni、Mistral Magistral、Kimi K2、GLM-5.2、Hugging Face open-r1 —— 模式(每个前沿能力现在都有开源 weight 选项)就是故事。

切入角度

用集群引入「开源 weight 前沿」模式 —— 每个前沿能力(多模态 / 推理 / 长上下文 / 长输出)现在都有开源 weight 选项 —— 用这个 lens 并排对比 vendor 方案。

形式

长视频讲解

演示想法

录一段 16 分钟并排对比讲解:2 分钟讲「开源 weight 前沿」框架,然后每个发布 2 分钟(DeepSeek V3.2 / Qwen3-Omni / Magistral / K2 / GLM-5.2 / open-r1),最后 4 分钟在同一多模态 + 长上下文 + 推理任务上做并排对比。

平台注意

每个 vendor 都把开源 weight 发布框成跟自己关心的竞争集对比;The Decoder 和 IT 之家是 editorial framing 层,不是独立验证。在记录任何具体能力或 license 声明前,对照 vendor 一手文档和 license 文件确认。

可用说法

  • DeepSeek V3.2 引入稀疏 MoE 路由改进(expert-choice token 路由、更好的负载均衡)、带滑动窗口扩展的 128K token 上下文,以及后训练配方说明。
  • 阿里 Qwen 以开放权重许可发布 Qwen3-Omni 多模态(视觉 + 音频 + 文本)模型,并附 SFT/DPO 后训练配方说明。
  • Mistral 发布开放权重推理模型 Magistral,带思维链模板和 Le Chat 推理界面集成。
  • Moonshot 发布开放权重长上下文模型 Kimi K2,支持 256K token 上下文窗口和 tool-use。
  • 智谱(Z.ai)GLM-5.2 技术说明记录了压缩注意力 MoE 架构(78 层,局部 + 压缩全局混合注意力)及训练基础设施说明。
  • Hugging Face open-r1 社区项目以完全开放的权重、训练数据和训练代码复现前沿级推理模型。

证据链

拆解

六个开源 weight 发布同一周落地 —— editorial framing(「每个前沿 vendor 都发货开源 weight 选项」)有用,但如果不引入底层模式,内容就退化成 vendor directory。本篇解释怎么用集群引入「开源 weight 前沿」模式(每个前沿能力 —— 多模态 / 推理 / 长上下文 / 长输出 —— 现在都有开源 weight 选项),用这个 lens 并排对比 vendor 方案。

风险

  • The Decoder 和 IT之家可用作媒体类佐证,但在对外表述任何具体能力或许可声明前,请先阅读厂商原始文档。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
  • 文档确认开放权重发布,但精确许可版本本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
  • 文档确认了混合注意力和 expert-choice 路由,但超出文档示例的专家数量本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
  • open-r1 文档确认完全开放的权重、训练数据和训练代码,但相对原模型超出所捕获摘要的逐项跑分差异未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。

演示思路

  • 六个发布同多模态 + 长上下文 + 推理任务并排对比:同一 prompt,同一评测 rubric,画成功率 + 成本
  • 决策树:「哪个开源 weight 模型配哪个用例」(多模态 → Qwen3-Omni,推理 → Magistral / open-r1,长上下文 → K2 / DeepSeek V3.2,MoE 推理 → GLM-5.2)
  • license walkthrough:走查每个发布的实际 license 文件,标出商用条款