Aug 29, 2026

2026 开源权重模型怎么选:DeepSeek vs Qwen vs Kimi vs GLM vs Mistral

一周之内六个开源权重版本接连落地,本周 GLM-5.3 完整权重与腾讯 Hy4 preview 又相继到来。这份决策指南按工作负载分类:长上下文、工具调用、多模态、推理与自托管。

#tutorial#comparison#choosing#open-weights#cluster#coverage#deepseek#qwen

六个开源权重版本在 8 月初的同一周里接连落地。本周,智谱把 GLM-5.3 的完整权重挂上了 Hugging Face,腾讯又开源了 Hy4 preview。盘子已经不缺模型了 —— 难的是选型:既要不租机房,又不轻信发布会话术。

已核实的版图

2026 年 8 月 3 日,五家实验室在同一天发布开源权重更新 —— DeepSeek V3.2、阿里 Qwen3-Omni、Mistral Magistral、月之暗面 Kimi K2、智谱 GLM-5.2 —— Hugging Face 的 open-r1 项目作为第六个版本补全了这个 cluster。8 月 27 至 28 日,GLM-5.3 权重上架 Hugging Face,腾讯发布并开源 Hy4 preview。

下表只写各家官方发布材料里陈述的内容。凡是厂商自述、自测的数字,都在「亮点」列注明。

模型厂商发布说明原文陈述亮点
DeepSeek V3.2DeepSeek稀疏 MoE 路由优化,128K 上下文加滑动窗口扩展拼路由效率,不拼体量
Qwen3-Omni阿里开源权重许可下的视觉 + 音频 + 文本,附 SFT/DPO 训练配方一个开源模型吃下多模态输入
MagistralMistral开源权重推理模型,带思维链模板与 Le Chat 集成推理过程可见
Kimi K2月之暗面256K token 上下文窗口,支持工具调用长上下文加工具调用
GLM-5.2智谱压缩注意力 MoE(78 层,局部 + 压缩全局混合注意力)注意力架构本身
open-r1Hugging Face完整开源权重、训练数据与训练代码的前沿级推理模型复现可复现性
GLM-5.3智谱完整权重 + BF16 上架 Hugging Face(仓库元数据约 753B,2026-08-28);Flash 版约 321B(2026-08-27)与 GLM-5.2 共用基座,增益全部来自后训练(厂商自述)
Hy4 preview腾讯总参数 770B / 激活 49B 的 MoE,上下文超 1M token(2026-08-28)主打编程、办公与科研

决策路径

「我要长上下文加工具调用」—— Kimi K2

月之暗面的发布说明给了 Kimi K2 256K token 上下文窗口和工具调用支持。这个组合正对流水线式工作:搭摘要管线、跨文档归纳、读得多写得少的 agent 循环。DeepSeek V3.2 的 128K 上下文加滑动窗口扩展覆盖大多数单项目语料,但余量小一截。

「我要多模态输入」—— Qwen3-Omni

这套阵容里,只有 Qwen3-Omni 的发布说明把视觉、音频、文本写在同一份开源权重许可下。工作流要吃截图、播客音频或幻灯片的话,先看它,别急着在栈外面再拼一个语音或视觉模型。

「我要可审查的推理」—— Magistral,或带保留意见的 GLM-5.3

Magistral 自带思维链模板,推理表面就是产品的一部分。GLM-5.3 的编程主张更响 —— Z.ai 发布帖宣称在自家的 Z.ai Code Bench 上较 GLM-5.2 提升 50% —— 但这是自测基准,没有引用任何独立复现。选它的话,镜头上请把这句话说成「Z.ai 自己的数据」。

「我要经核实的最低价」—— 先打开定价页,再看 Hy4 preview 的数字

这套阵容里,今天唯一能从一手来源直接引用的价格,是腾讯的 Hy4 预览期定价:每百万输入 token 0.834 美元、输出 2.501 美元、缓存命中 0.042 美元。这是预览期定价,同时 WorkBuddy 和 CodeBuddy 里有两周免费窗口。本指南刻意不写其他厂商的价格 —— 选型当天打开定价页,引用当天的数字。

「我要自己跑权重」—— 先对硬件预算

GLM-5.3 完整权重约 753B 参数,是数据中心级体量;Hugging Face 组织页列出的托管服务商为:完整模型 together、baseten、zai-org,Flash 版 novita、fireworks-ai、baseten。真要自托管,GLM-5.2 这一级的模型和 open-r1 栈(发布训练数据与代码,不只是权重)才是诚实的起点。各模型许可条款不一,本指南抓取时未验证 —— 对观众承诺任何事之前,先看模型卡。

常见错误

  • 把厂商基准当独立评测。8 月 3 日 cluster 的所有能力数字都是厂商自述,GLM-5.3 的编程与网络安全基准也是 Z.ai 自测。
  • 把参数量当成可运行性。753B 的「开源权重」不等于「我电脑能跑」;演示本地部署前,先看参数量和托管服务商清单。
  • 把上下文窗口当成质量。256K 或 1M token 描述的是容量,不是输出质量 —— 只有工作流真能填满窗口时,容量才有意义。
  • 凭记忆报价格。预览期定价是促销性质且限时;从旧视频里背出来的价格,迟早要更正。
  • 按总参数量选型。Hy4 preview 的 49B 激活参数(总 770B)对部署成本的影响比总量大得多 —— 真正映射到成本的是激活参数。

模型之上的那层选型,见 2026 智能体框架怎么选。本周发布的细节,见 腾讯 Hy4 previewGLM-5.3 开放权重.