开源权重大语言模型的春日之梦:2026年1-2月发布的10种架构
2026 年春季 10 款开源权重大语言模型发布汇总与对比
如果你本月有些跟不上开源权重模型的发布节奏,本文将帮你梳理核心要点。
本文将按时间顺序逐一介绍这十款主流发布模型,重点分析它们在架构设计上的异同:
-
Arcee AI 的 Trinity Large(2026 年 1 月 27 日)
-
月之暗面(Moonshot AI)的 Kimi K2.5(2026 年 1 月 27 日)
-
阶跃星辰(StepFun)的 Step 3.5 Flash(2026 年 2 月 1 日)
-
Qwen3-Coder-Next(2026 年 2 月 3 日)
-
z.AI 的 GLM-5(2026 年 2 月 12 日)
-
MiniMax M2.5(2026 年 2 月 12 日)
-
纳米格(Nanbeige)4.1 3B(2026 年 2 月 13 日)
-
Qwen 3.5(2026 年 2 月 15 日)
-
蚂蚁集团的 Ling 2.5 1T 与 Ring 2.5 1T(2026 年 2 月 16 日)
-
Cohere 的 Tiny Aya(2026 年 2 月 17 日)
更新 1:Sarvam 30B 与 105B(2026 年 3 月 6 日)
(注:DeepSeek V4 发布后将补充加入本文。)
由于内容覆盖面较广,本文将引用我此前发布的《大语言模型架构大对比》一文(https://magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison)作为混合专家(Mixture-of-Experts, MoE)、QK 归一化(QK-Norm)、多头潜注意力(Multi-head Latent Attention, MLA)等技术主题的背景资料,避免内容重复。
1. Arcee AI 的 Trinity Large:美国初创公司推出的全新开源权重模型
1 月 27 日,此前业内关注度较低的公司 Arcee AI 发布了其 4000 亿参数的 Trinity Large 开源权重大语言模型(https://www.arcee.ai/blog/trinity-large),模型已上线 Hugging Face(https://huggingface.co/arcee-ai/Trinity-Large-Preview),同时推出两款更小的变体:
-
旗舰大模型为 4000 亿参数的混合专家架构,每 token 激活参数为 130 亿;
-
两款小尺寸变体分别为 Trinity Mini(260 亿总参数,30 亿激活参数)和 Trinity Nano(60 亿总参数,10 亿激活参数)。

图 1:Trinity Large 架构概览(基于模型库配置文件:https://huggingface.co/arcee-ai/Trinity-Large-Preview/blob/main/config.json)
除模型权重外,Arcee AI 还在 GitHub 发布了详实的技术报告(https://github.com/arcee-ai/trinity-large-tech-report),截至 2 月 18 日该报告也已上线 arXiv(https://www.arxiv.org/abs/2602.17004),包含大量技术细节。
下面详细解析这款 4000 亿参数的旗舰模型。下图 2 将其与 z.AI 的 GLM-4.5 对比,后者 3550 亿的参数规模与 Trinity Large 最为接近。

图 2:Arcee AI Trinity Large 与规模相近的 GLM-4.5 对比(4000 亿 vs 3550 亿参数)
从对比中可以看到,Trinity 模型新增了几个值得关注的架构组件:
首先是交替式局部 – 全局滑动窗口注意力(Sliding Window Attention, SWA),类似设计也见于 Gemma 3、Olmo 3、小米 MiMo 等模型。简而言之,SWA 是一种稀疏(局部)注意力模式:每个 token 仅关注最近的 t 个 token 构成的固定大小窗口(例如 4096 个),而非关注全部输入(最多可达 25.6 万个 token)。对于长度为 n 的序列,这将每层常规注意力的计算复杂度从 O (n²) 降至约 O (n・t),因此对长上下文模型极具吸引力。

图 3:常规注意力(全局注意力)与滑动窗口注意力(局部注意力)对比
但 Arcee 团队并未采用 Gemma 3 和小米常用的 5:1 局部 – 全局比例,而是选择了与 Olmo 3 类似的 3:1 比例,滑动窗口大小也和 Olmo 3 相近,达到 4096。
该架构还采用了QK 归一化技术—— 对键(K)和查询(Q)施加均方根归一化(RMSNorm)以稳定训练(如下图 4 所示);同时在全局注意力层中采用 ** 无位置编码(NoPE)** 设计,这一点与 SmolLM 3 类似。
Trinity 还采用了一种门控注意力形式。它并非完整的门控 DeltaNet – 门控注意力混合架构,而是采用了与 Qwen3 注意力机制中类似的门控设计:在输出线性投影之前,对缩放点积结果加入逐元素门控(如下图所示),以此减少注意力偏置和注意力塌陷问题,提升长序列泛化能力,同时也有助于提升训练稳定性。

图 4:Trinity Large 注意力机制中的门控机制示意图
此外,Trinity 的技术报告显示,Trinity Large 与 GLM-4.5 基础模型的建模表现几乎一致(推测未与更新的基础模型对比,因为如今很多公司仅公开经过微调的模型)。
你可能已经注意到,在前文的 Trinity Large 架构图中,使用了 4 层而非 2 层 RMSNorm,乍一看与 Gemma 3 的设计相似。

图 5:Arcee Trinity 与 Gemma 3 的 RMSNorm 位置对比
总体来看,RMSNorm 的排布方式与 Gemma 3 类似,但特别之处在于:每个模块中第二层 RMSNorm 的增益是按深度缩放的,即初始值约为 1/√L(L 为总层数)。因此在训练初期,残差更新幅度较小,随着模型逐步学习到合适的尺度,更新幅度会逐渐增大。

图 6:Arcee Trinity 与 DeepSeek V3/R1 混合专家模型对比
其混合专家模块采用类 DeepSeek 的设计,包含大量小型专家,但颗粒度更粗,以此提升推理吞吐量 ——Mistral 3 Large 采用 DeepSeek V3 架构时也采用了同样的优化思路。
最后,该模型在训练优化上还有一些细节创新(包括一种新的 MoE 负载均衡策略,以及采用 MuOpt 优化器的方案),但本文主要聚焦架构分析,且还有多款开源权重大模型待介绍,因此暂不展开。
2. 月之暗面(Moonshot AI)的 Kimi K2.5:万亿参数规模的类 DeepSeek 模型
Arcee Trinity 的表现基本追平了更早的 GLM-4.5 模型,而 1 月 27 日发布的 Kimi K2.5(https://huggingface.co/moonshotai/Kimi-K2.5)在发布时刷新了开源权重模型的性能上限。
令人印象深刻的是,根据其详实技术报告(https://arxiv.org/abs/2602.02276)中的自测基准结果,该模型发布时性能已与头部闭源模型相当。

图 7:Kimi K2.5 性能基准(来自官方技术报告https://arxiv.org/abs/2602.02276)
和前文介绍的 Arcee Trinity、GLM-4.5 等模型相比,Kimi K2.5 的优异表现并不意外:和前代 K2 类似,Kimi K2.5 是一款万亿参数模型,规模是 Trinity 的 2.5 倍、GLM-4.5 的 2.8 倍。
总体而言,Kimi K2.5 的架构与 Kimi K2 相近,而 Kimi K2 本身就是 DeepSeek V3 架构的放大版本。

图 8:Kimi K2 是 DeepSeek V3 架构的放大版本
但 K2 是纯文本模型,而 Kimi K2.5 现已升级为支持视觉能力的多模态模型。引用技术报告中的表述:
Kimi K2.5 是基于 Kimi K2 打造的原生多模态模型,通过约 15 万亿图文混合 token 的大规模联合预训练实现。
训练过程中采用了早期融合方案,视觉 token 与文本 token 在早期就一同输入模型,我在早前的《理解多模态大语言模型》一文(https://magazine.sebastianraschka.com/p/understanding-multimodal-llms)中曾讨论过这种方式。

图 9:和当前多数主流多模态大模型一样,Kimi K2.5 采用 A 类方法,训练时将视觉 token 与文本 token 一同输入
旁注:遗憾的是,在多模态相关论文中,“早期融合” 存在歧义。它可以指两种含义:
预训练阶段引入视觉 token 的时机:即视觉 token 在预训练一开始(或极早期)就混入,而非在后期阶段加入;
图像 token 在模型中的融合方式:即图像 token 以嵌入 token 的形式与文本 token 一同输入。
在本文语境中,报告里的 “早期融合” 特指第 1 种含义,但第 2 种融合方式在该模型中同样成立。
此外关于第 1 点,研究人员做了一项消融实验,结果表明预训练早期引入视觉 token 对模型性能有增益,如下图标注表格所示。

图 10:训练总视觉 token 数量固定的前提下,预训练早期引入较少视觉 token、而非后期大量加入,更有利于模型性能提升
(图标注来自 Kimi 技术报告https://arxiv.org/abs/2602.02276)
3. 阶跃星辰(StepFun)的 Step 3.5 Flash:性能优异,token 生成吞吐量出众
坦白说,我此前并未关注过 Step 系列模型。这款模型凭借独特的规模、详实的技术报告(https://arxiv.org/abs/2602.10604)以及极高的 token 生成速度吸引了我的注意。
Step 3.5 Flash 拥有 1960 亿参数,规模仅为最新 DeepSeek V3.2(6710 亿参数)的三分之一不到,但在建模性能基准上小幅领先。据 Step 团队介绍,在 128k 上下文长度下,Step 3.5 Flash 的吞吐量可达 100 token / 秒;而根据 Hugging Face 上的资料(https://huggingface.co/stepfun-ai/Step-3.5-Flash),DeepSeek V3.2 在 Hopper 架构 GPU 上的吞吐量仅为 33 token / 秒。

图 11:Step 3.5 Flash 基准表现(来自 Step 技术报告https://arxiv.org/abs/2602.10604)
性能提升的原因之一是模型规模更小:Step 3.5 Flash 是 1960 亿参数的 MoE 模型,每 token 激活参数为 110 亿;而 DeepSeek V3.2 是 6710 亿参数 MoE,每 token 激活参数 370 亿,如下图所示。

图 12:Step 3.5 Flash 与 DeepSeek V3.2 对比
除了门控注意力(前文介绍 Trinity 时已讨论过)之外,另一大原因是 ** 多 token 预测(Multi-Token Prediction, MTP)** 技术(https://arxiv.org/abs/2404.19737)。DeepSeek 是多 token 预测的早期采用者,该技术训练大语言模型每一步预测多个未来 token,而非仅预测下一个。具体来说,在每个位置 t,额外的小型头(线性层)会输出 t+1 到 t+k 位置的 logits,然后对这些偏移位置的交叉熵损失求和(在 MTP 原论文中,研究人员建议 k=4)。
这一额外的监督信号可以加快训练速度,而推理阶段仍可保持逐 token 生成,如下图所示。

图 13:多 token 预测与常规单 token 预测对比
(左子图灵感来自论文https://arxiv.org/abs/2404.19737。早期 MTP 仅用于训练阶段,不用于推理,因此图中底部的推理步骤仅展示单 token 预测)
DeepSeek V3 采用的是 MTP-1,即训练时额外预测 1 个 token(而非 3 个),并在推理阶段将 MTP 设为可选项。
Step 3.5 Flash 在训练和推理阶段均采用额外预测 3 个 token 的 MTP-3 方案(注意通常 MTP 不用于推理阶段,该设计属于例外)。
值得注意的是,前文介绍的 Arcee Trinity 和 Kimi K2.5 均未使用 MTP,但已有其他架构采用了与 Step 3.5 Flash 类似的 MTP-3 设计,例如 GLM-4.7 和 MiniMax M2.1。
4. Qwen3-Coder-Next:面向代码任务的混合注意力架构
2026 年 2 月初,通义千问团队发布了 800 亿参数的 Qwen3-Coder-Next 模型(激活参数 30 亿),因在代码任务上超越 DeepSeek V3.2(370 亿激活参数)、Kimi K2.5、GLM-4.7(均为 320 亿激活参数)等规模大得多的模型而引发广泛关注。

图 14:Qwen3-Coder-Next 与其他主流代码模型的代码基准表现对比
(该图出自技术报告https://github.com/QwenLM/Qwen3-Coder/blob/main/qwen3_coder_next_tech_report.pdf)
此外如上图基准结果所示,Qwen3-Coder-Next 在 SWE-Bench Pro 上的表现与 Claude Sonnet 4.5 基本持平,仅略低于 Claude Opus 4.5,这对于一款规模较小的开源权重模型来说十分亮眼。
在本地使用 ollama 运行 Qwen3-Coder-Next 时,该模型约占用 48.2GB 存储空间和 51GB 运行内存。

图 15:本地运行 Qwen3-Coder-Next
需要说明的是,Qwen3-Coder-Next 的底层架构与 Qwen3-Next 80B 完全一致(实际上,预训练后的 Qwen3-Next 80B 被用作基础模型,进一步开展中期训练和后训练)。下图 16 将 Qwen3-Next 架构与常规 Qwen3 235B 模型放在一起对比,供参考。

图 16:Qwen3-Coder-Next 80B(每 token 激活参数 30 亿)与规模 3 倍于它的 Qwen3 235B-A22B 架构对比
全新的 Qwen3 Next 架构亮点在于:尽管规模比前代 235B-A22B 模型小三分之二,但专家数量是前者的 4 倍,还新增了共享专家。高专家数量与共享专家的加入是两大核心设计选择。
另一大亮点是,团队将常规注意力机制替换为门控 DeltaNet + 门控注意力混合架构(相关论文:https://arxiv.org/abs/2412.06464、https://arxiv.org/abs/2505.06708),从内存层面支撑了原生 262k token 上下文长度(而 235B-A22B 模型原生支持 32k 上下文,通过 YaRN 缩放技术可扩展至 131k,论文见https://arxiv.org/abs/2309.00071)。
那么这种新型混合注意力是如何工作的?分组查询注意力(GQA)本质仍是标准缩放点积注意力,通过在查询头组间共享键值对来缩减 KV 缓存大小和内存带宽,但解码开销和缓存占用仍会随序列长度增长。而该混合机制将门控 DeltaNet 模块与门控注意力模块按 3:1 比例混合,如图 17 所示。

图 17:Qwen3-Coder-Next 的混合注意力架构
我们可以将门控注意力模块看作 GQA 中标准缩放点积注意力的改进版本,在此基础上做了几处调整。门控注意力与普通 GQA 模块的主要区别在于:
-
输出门:由 Sigmoid 控制,通常按通道维度对注意力结果进行缩放,再加入残差连接;
-
QK 归一化采用零中心化 RMSNorm,而非标准 RMSNorm;
-
采用部分旋转位置编码(RoPE),仅对部分维度施加。
需要注意的是,这些本质上都是针对 GQA 的稳定性优化。
门控 DeltaNet 则是更重大的架构改动。在 DeltaNet 模块中,查询(q)、键(k)、值(v)以及两个门控(α、β)由带归一化的线性层和轻量卷积层生成,该层用快速权重更新机制替代了传统注意力运算。
但代价是,DeltaNet 基于内容的检索精度不如全注意力,因此保留了一层门控注意力作为补充。
由于注意力的计算复杂度随序列长度呈平方增长,加入 DeltaNet 组件是为了提升内存效率。在 “线性时间、无缓存” 的架构家族中,DeltaNet 模块本质上是 Mamba 的替代方案:Mamba 通过可学习的状态空间滤波器维护状态(本质是时域动态卷积);而 DeltaNet 维护一个极小的快速权重记忆体,通过 α 和 β 进行更新,通过 q 进行读取,仅用小型卷积辅助生成 q、k、v、α、β。
关于混合注意力和 Qwen3-Next 架构的更多细节,可参考我此前的文章:https://magazine.sebastianraschka.com/i/177848019/24-qwen3-next
由于本文主要聚焦大语言模型架构,训练相关细节不在讨论范围内。感兴趣的读者可查阅其详实的技术报告:https://github.com/QwenLM/Qwen3-Coder/blob/main/qwen3_coder_next_tech_report.pdf
5. z.AI 的 GLM-5:全新旗舰级开源权重模型
2 月 12 日发布的 GLM-5(https://z.ai/blog/glm-5)是行业重磅事件,发布时其表现已对标各大旗舰级大语言模型,包括 GPT-5.2 extra-high、Gemini Pro 3 和 Claude 4.6 Opus。(当然,基准测试表现并不完全等同于实际使用体验。)

图 18:GLM-5 与前代 GLM-4.7 架构对比。底部基准数据来自官方论文https://www.arxiv.org/abs/2602.15763
就在不久前,2025 年 12 月发布的 GLM-4.7 还是最强的开源权重模型之一。从上图 18 的基准结果来看,GLM-5 的建模性能实现了大幅跃升。这种提升部分得益于训练流程的优化,但主要原因大概率是参数规模翻倍 —— 从 GLM-4.7 的 3550 亿增至 GLM-5 的 7440 亿。这一规模提升让 GLM-5 处于 DeepSeek V3.2(6710 亿)和 Kimi K2.5(万亿)之间的档位。
如下表所示,对比前文提到的万亿参数 Kimi K2.5,规模更小的 GLM-5(7440 亿)基准表现反而小幅领先。

图 19:GLM-5(7440 亿)与 Kimi K2.5(万亿)基准表现对比(数值越高越好)
和 GLM-4.7 以及前文讨论的所有模型一样,GLM-5 也是混合专家(MoE)模型。每 token 激活参数仅小幅增长,从 GLM-4.7 的 320 亿增至 GLM-5 的 400 亿。
如下图 20 所示,GLM-5 现已采用 DeepSeek 的多头潜注意力(MLA)以及 DeepSeek 稀疏注意力技术。(我在《DeepSeek 技术深度解析》一文中详细介绍过 DeepSeek 稀疏注意力,见https://magazine.sebastianraschka.com/p/technical-deepseek)
这些改动大概率是为了降低长上下文场景下的推理成本。除此之外,整体架构与前代保持相对一致。

图 20:GLM-5 与 DeepSeek V3.2 对比(两款架构相近、规模相当的模型)
相比 GLM-4.7,总参数规模的增长主要来自专家数量扩充:从 160 个增至 256 个,同时层维度略有提升(每 token 激活的专家数量保持不变:8 个常规专家 + 1 个共享专家)。例如,嵌入维度和专家隐层维度从 5120 增至 6144,中间投影维度从 1536 升至 2048。
有意思的是,Transformer 层数从 GLM-4.7 的 92 层减少到了 GLM-5 的 78 层。我推测这一改动同样是为了降低推理成本、提升延迟表现,因为网络深度无法像宽度那样通过并行计算优化。
此外,我还查阅了独立基准测试(幻觉排行榜,https://github.com/vectara/hallucination-leaderboard/tree/main),结果显示 GLM-5 的表现确实与 Opus 4.5、GPT-5.2 相当,且 token 消耗更少。

图 21:除整体基准表现外,该表还补充了来自幻觉排行榜的幻觉率数据
另外,从汇总了多项基准的最新人工智能指数来看,GLM-5 确实小幅领先 Kimi K2.5,仅比 GPT-5.2(xhigh)和最新的 Claude Sonnet 4.6 落后 1 分。

图 22:2026 年 2 月 21 日https://artificialanalysis.ai/** 网站快照**
6. MiniMax M2.5:2300 亿参数的强代码能力模型
前文提到的 GLM-5 和 Kimi K2.5 都是热门开源权重模型,但根据 OpenRouter 排行榜(https://openrouter.ai/rankings)的数据,它们的热度都不及同样在 2 月 12 日发布的 MiniMax M2.5(https://huggingface.co/MiniMaxAI/MiniMax-M2.5)。

图 23:2026 年 2 月 21 日 OpenRouter 排行榜使用情况快照
OpenRouter 是一个聚合平台与 API 服务,开发者可以通过它接入并调度多家厂商的各类大语言模型。需要说明的是,尽管其使用统计数据能很好地反映开源权重模型的热度,但统计明显偏向开源模型(对比闭源模型),因为大多数用户会直接通过官方平台使用闭源模型。同时不同开源模型之间也存在使用偏差,因为很多用户也会通过官方开发者 API 调用开源模型。但无论如何,对于多数用户无法本地运行的超大规模开源权重模型,该榜单仍能作为估算其相对热度的参考。
回到 MiniMax M2.5 本身。结合 SWE-Bench Verified 代码基准中 GLM-5 的数据,与 MiniMax M2.5 的公开结果对比来看,后者的表现似乎略胜一筹(至少在代码能力上)。

图 24:MiniMax M2.5 在 SWE-Bench Verified 上的代码表现
旁注:有意思的是,Opus 4.5 和 Opus 4.6 在 SWE-Bench Verified 上的得分几乎完全一致。这可能会让人觉得大语言模型的发展陷入了停滞。但我并不这么认为,因为 Opus 4.6 的用户能明显感受到实际使用体验的提升。
所以更可能的原因是,SWE-Bench Verified 基准已经达到饱和,从现在起它可能不再是具备区分度的评测基准,可以转向 SWE-Bench Pro 等其他基准。这里的 “饱和” 指的是由于设计缺陷,基准中可能包含无法解决的问题 —— 正如近期 Reddit 讨论以及 OpenAI 最新文章《为什么我们不再评估 SWE-Bench Verified》中提到的那样。
回到 MiniMax M2.5 的性能话题。从人工智能指数汇总的更广泛基准来看,GLM-5 仍然保持领先。这其实并不意外,因为尽管两者的 token 生成吞吐量相近,但 GLM-5 的规模仍是 M2.5 的 4 倍。

图 25:基于 2026 年 2 月 21 日https://artificialanalysis.ai/models/minimax-m2-5** 数据的 GLM-5 与 MiniMax M2.5 对比**
我认为 MiniMax M2.5 的高热度,部分源于它规模更小、部署成本更低,同时建模表现却相差不大,也就是性价比极高。
架构方面,MiniMax M2.5 是一款 2300 亿参数的模型,设计相当经典:仅采用纯分组查询注意力(GQA),没有滑动窗口注意力或其他效率优化技术。

图 26:MiniMax M2.5 与 GLM-5 对比
截至目前,它也是本报告中首款没有配套详细技术报告的架构,更多信息可查阅 Hugging Face 页面:https://huggingface.co/MiniMaxAI/MiniMax-M2.5
7. 纳米格(Nanbeige)4.1 3B:性能强劲的 Llama 3 继任者
本节我们转换视角,终于要介绍一款可以在笔记本电脑上本地运行的小模型了。在介绍 Nanbeige 4.1 3B(https://huggingface.co/Nanbeige/Nanbeige4.1-3B)之前,我们先铺垫一些背景。
通义千问系列模型一直以来都非常热门。我常说起一件事:几年前我担任 NeurIPS 大语言模型效率挑战赛顾问时,大多数获奖方案都基于 Qwen 模型开发。
如今,Qwen3 可能是应用最广泛的开源权重模型系列之一,因为它覆盖了从 6 亿到 2350 亿参数的极多档位,适配各类场景。尤其是小尺寸模型(800 亿参数及以下,比如前文介绍的 Qwen3-Next),非常适合在消费级硬件上本地运行。

图 27:开源权重模型的相对采用热度
注:该数据统计的是 Hugging Face 模型库中,以对应模型为基座进行微调的模型数量,而非本地运行该模型的用户数(后者无法统计)。
数据来源:https://www.atomproject.ai/
我铺垫这些是因为,Nanbeige 4.1 3B 瞄准的正是 Qwen3 占据优势的端侧小模型场景。根据 Nanbeige 4.1 3B 的基准测试结果,其性能大幅领先 Qwen3(考虑到 Qwen3 发布已近一年,这一结果并不意外)。

图 28:Nanbeige 4.1 3B 与 Qwen3 基准对比(来源:https://huggingface.co/Nanbeige/Nanbeige4.1-3B)
架构方面,Nanbeige 4.1 3B 与 Qwen3 4B 相近,而 Qwen3 4B 又与 Llama 3.2 3B 高度相似。下图将 Nanbeige 4.1 3B 与 Llama 3.2 3B 放在一起对比,因为两者规模最为接近。

图 29:Nanbeige 4.1 3B 与 Llama 3.2 3B 对比
Nanbeige 4.1 3B 采用与 Llama 3.2 3B 相同的架构组件,仅在规模缩放细节上有小幅差异(例如嵌入维度略小、中间投影维度更大等)。上图未体现的一个区别是,Nanbeige 没有将输入嵌入权重与输出层权重绑定,而 Llama 3.2 3B 采用了权重绑定。(根据我的经验,权重绑定是减少总参数量的好方法,但它几乎总会导致训练表现下降,体现为训练损失和验证损失升高。)
如前所述,本文主要聚焦架构对比。就这款模型而言,相比前代 Nanbeige 4 3B 的性能提升,大多来自有监督微调与强化学习等后训练阶段的优化。感兴趣的读者可查阅论文了解更多:https://arxiv.org/abs/2602.13367
8. Qwen3.5:混合注意力架构的延续
上一节简要提到 Qwen3 是应用最广的开源权重模型系列,但如果不算主打效率优化的 Qwen3-Next 变体,Qwen3 发布已近一年,略显陈旧。不过,通义千问团队刚在 2 月 15 日发布了全新的 Qwen3.5 模型版本。
Qwen3.5 397B-A17B 是混合专家(MoE)模型,总参数 3970 亿,每 token 激活参数 170 亿,相比 Qwen3 系列最大的 2350 亿参数模型实现了升级。(此外还有万亿参数的 Qwen3-Max 模型,但从未以开源权重形式发布。)
常规基准测试汇总显示,Qwen3.5 全面超越前代 Qwen3-Max,尤其在智能体终端代码应用上提升显著(这也是今年行业的核心主题)。纯智能体代码能力方面(例如 SWE-Bench Verified),Qwen3.5 与 GLM-5、MiniMax M2.5 大致处于同一水平。

图 30:Qwen3.5 基准概览,来自官方 Hugging Face 页面:https://huggingface.co/Qwen/Qwen3.5-397B-A17B
通义千问团队习惯推出独立的代码专用模型(比如前文讨论的 Qwen3-Coder-Next),因此我很好奇后续可能推出的 Qwen3.5-Coder 会有怎样的表现。
架构方面,Qwen3.5 采用了 Qwen3-Next 与 Qwen3-Coder-Next(第 4 节)使用的混合注意力模型(搭载门控 DeltaNet)。这一变化很有意思:Qwen3-Next 最初是作为全注意力 Qwen3 模型的替代方案推出的,而如今的动向表明,通义千问团队已将混合注意力机制正式纳入主力模型产品线。

图 31:Qwen3.5 与 Qwen3 (-Coder)-Next 架构对比
除了模型规模升级,如上图所示,Qwen3.5 现在还集成了多模态能力(此前该能力仅在独立的 Qwen3-VL 系列模型中提供)。
总的来说,Qwen3.5 是 Qwen 系列一次出色的迭代更新,期待未来能看到更多小尺寸的 Qwen3.5 变体!
补记:就在本文定稿之际,通义千问团队推出了上述小尺寸模型变体:
9. 蚂蚁集团 Ling 2.5 1T:搭载闪电注意力
Ling 2.5 1T(https://huggingface.co/inclusionAI/Ling-2.5-1T)及其推理版本 Ring 2.5 1T(https://huggingface.co/inclusionAI/Ring-2.5-1T)是万亿参数大语言模型,采用与 Qwen3.5、Qwen3-Next 思路相近的混合注意力架构。
但它没有采用门控 DeltaNet,而是使用了一种更简洁的循环线性注意力变体 ——闪电注意力(Lightning Attention)。此外,Ling 2.5 还采用了 DeepSeek 的多头潜注意力(MLA)机制。

图 32:Ling 2.5 与 Qwen3.5 对比;两者均为线性注意力混合架构
就绝对基准表现而言,Ling 2.5 并非最强模型,但它的核心卖点是长上下文场景下的极致效率(得益于混合注意力架构)。遗憾的是目前没有与 Qwen3.5 的直接对比数据,但与同规模的 Kimi K2(万亿参数)相比,在 32k token 序列长度下,Ling 2.5 的吞吐量是前者的 3.5 倍。

图 33:Ling 2.5 与 Kimi K2(同为万亿参数规模)的相对吞吐量对比
注:吞吐量已做归一化处理,Kimi K2 为 1 倍基准(Kimi 的吞吐量并非线性增长,只是图中呈现近似线性)。
数据来源:Ling 2.5 Hugging Face 页面https://huggingface.co/inclusionAI/Ling-2.5-1T
10. Tiny Aya:33.5 亿参数的强多语言支持模型
Tiny Aya 于 2 月 17 日发布,是 Cohere 推出的全新 “小尺寸” 大语言模型,被誉为 30 亿参数级别 “能力最强的多语言开源权重模型”。(根据 Cohere 官方博客https://cohere.com/blog/cohere-labs-tiny-aya,Tiny Aya 表现优于 Qwen3-4B、Gemma 3 4B 和 Ministral 3 3B。)
这款模型非常适合本地运行与实验。唯一需要注意的是,尽管它属于开源权重模型,但许可条款限制相对严格,仅允许非商业使用。
除此之外,Aya 是 33.5 亿参数的模型,提供多个版本,适用于个人使用与(非商业)研究场景:
-
tiny-aya-base(基础模型):https://huggingface.co/CohereLabs/tiny-aya-base
-
tiny-aya-global(跨语言区域最佳均衡版):https://huggingface.co/CohereLabs/tiny-aya-global
-
tiny-aya-fire(南亚语言优化版):https://huggingface.co/CohereLabs/tiny-aya-fire
-
tiny-aya-water(欧洲与亚太语言优化版):https://huggingface.co/CohereLabs/tiny-aya-water
-
tiny-aya-earth(西亚与非洲语言优化版):https://huggingface.co/CohereLabs/tiny-aya-earth
更详细的模型优化语言列表如下。

图 34:各版本 Aya 模型支持的语言
架构方面,Tiny Aya 是经典的解码器式 Transformer 模型,除了 SwiGLU 激活函数、分组查询注意力等常见设计外,还有几处值得关注的改动,如下图所示。

图 35:Tiny Aya(搭载并行 Transformer 模块)与 Qwen3 4B 对比
总体而言,该架构最值得关注的亮点是并行 Transformer 模块。在这种设计中,并行 Transformer 模块对同一归一化输入分别计算注意力和多层感知机(MLP),然后一步将两者同时加入残差连接。我推测这种设计是为了减少层内的串行依赖,提升计算吞吐量。
熟悉 Cohere Command-A 架构的读者会发现,Tiny Aya 像是它的缩小版本。另外一个有意思的细节是,Tiny Aya 团队取消了 QK 归一化(在注意力机制内部对键和查询施加 RMSNorm)—— 这项技术原本是提升训练稳定性、减少损失尖峰的常规操作。据 Cohere 团队的一位开发人员表示,取消 QK 归一化是因为 “它会对长上下文性能产生负面影响”。
大家可能知道,我偶尔会从零实现各种模型架构。由于我觉得并行 Transformer 模块的设计很有意思,且这款模型在低端硬件上也能流畅运行,我便从零实现了它(仅用于教学目的),代码可在此查看:https://github.com/rasbt/LLMs-from-scratch/tree/main/ch05/15_tiny-aya

图 36:对应代码笔记本:https://github.com/rasbt/LLMs-from-scratch/blob/main/ch05/15_tiny-aya/standalone-tiny-aya-plus-kv-cache.ipynb
结论
本文快速梳理了 2026 年 2 月前后发布的主流开源权重大语言模型。如果要总结核心结论,那就是:目前表现优异的模型架构多种多样,但都脱胎于原始 GPT 模型。建模性能的核心决定因素可能并非架构设计本身,而是数据集质量与训练策略 —— 这是个值得单独撰文讨论的话题。
即便如此,架构设计仍是打造成功大语言模型的关键一环,而且越来越多开发者倾向于加入更多计算性能优化。例如,Kimi K2.5、GLM-5、Ling 2.5 都采用了多头潜注意力(MLA),GLM-5 还加入了 DeepSeek 稀疏注意力;与此同时,门控 DeltaNet(Qwen3.5)和类似的线性注意力方案(Ling 2.5)也在持续发展。

图 37:本文提及的各架构采用的注意力类型
此外,分组查询注意力、滑动窗口注意力等经典效率优化手段(Arcee Trinity、Step 3.5 Flash、Tiny Aya 均有采用)仍广受欢迎。在本次新发布的模型中,只有 MiniMax M2.5 和 Nanbeige 4.1 保持了非常经典的设计,仅采用分组查询注意力,没有加入其他效率优化。
DeepSeek V4
DeepSeek V4 是所有人都在期待的模型。遗憾的是,截至本文撰写时它尚未发布。不过我计划在发布后将其补充到本文中,预计发布时间不晚于 3 月第一周。
另一款值得关注的模型是印度的 Sarvam(300 亿与 1000 亿参数版本)。该模型近期已官宣,但尚未发布。后续也会在此更新相关内容,敬请期待。
更新 1:Sarvam 30B 与 105B(2026 年 3 月 6 日)
如约,在此补充 Sarvam 的最新动态。
在等待 DeepSeek V4 的期间,我们迎来了两款来自印度的强劲开源权重大语言模型。
该系列有两种规模:300 亿参数版(https://huggingface.co/sarvamai/sarvam-30b)和 1050 亿参数版(https://huggingface.co/sarvamai/sarvam-105b),均为推理专用模型,于 3 月 6 日以开源权重形式发布,同时还公布了相当详实的官方博客:https://www.sarvam.ai/blogs/sarvam-30b-105b
有意思的是,较小的 30B 模型采用 “经典” 的分组查询注意力(GQA),而更大的 105B 版本则切换为 DeepSeek 风格的多头潜注意力(MLA)。

图 38:Sarvam 30B 与 105B 架构
正如我之前的分析中所写,这两种都是主流的注意力变体,用于缩减 KV 缓存大小 —— 上下文越长,相比常规注意力节省的空间越多。

图 39:GQA、MLA 相对于多头注意力(MHA)的效率对比
MLA 的实现更复杂,但根据论文https://arxiv.org/abs/2405.04434中的消融实验结果,它能带来更优的建模表现(据我所知,这仍是目前最严谨的同条件对比研究)。
说到建模表现,1050 亿参数版与同规模大模型(GPT-OSS 120B、Qwen3-Next 80B)处于同一水平。Sarvam 在部分任务上表现更优,部分任务上稍逊,平均表现基本持平。

图 40:105B 模型标注版基准结果,来自 Sarvam 官方博客,每行中最佳模型已高亮标注
按 SWE-Bench Verified 的成绩来看,它不是最强的代码模型,但在智能体推理与任务完成(Tau2)上的表现出人意料地出色,甚至优于 DeepSeek R1 0528(上图未展示该对比)。
再看更小的 Sarvam 30B,最具可比性的模型大概是 Nemotron 3 Nano 30B:后者在 SWE-Bench Verified 代码能力和 Tau2 智能体推理上小幅领先,但在其他一些方面(Live Code Bench v6、BrowseComp)略逊一筹。

图 41:30B 模型标注版基准结果,来自 Sarvam 官方博客,每行中最佳模型已高亮标注
遗憾的是,上述基准测试中没有纳入 Qwen3-30B-A3B—— 据我所知,它是该参数级别最热门的模型。但有意思的是,Sarvam 团队将其 30B 模型与 Qwen3-30B-A3B 做了计算性能对比,结果显示,得益于代码与内核层面的优化,Sarvam 的 token 生成吞吐量比 Qwen3 高出 20%-40%。
上述基准测试未能体现的一点是,Sarvam 在印度语言上表现优异。根据评判模型的评估,Sarvam 团队发现,在处理印度语文本时,其模型在 90% 的情况下比其他模型更受青睐。由于分词器也是从零打造训练的,Sarvam 在印度语言上的分词效率更是达到了其他模型的 4 倍。
本杂志是个人兴趣项目,你的支持是它持续更新的动力。
如果你愿意支持我的工作,可以考虑订阅我的杂志(https://magazine.sebastianraschka.com/subscribe),或者购买我的著作《从零构建大语言模型》(https://amzn.to/4fqvn0D)及其续作《从零构建推理模型》(https://mng.bz/Nwr7)。相信你会收获颇丰,书中对大语言模型工作原理的深度讲解,在其他地方很难看到。
感谢阅读,也感谢你对独立研究的支持!
《从零构建大语言模型》已在亚马逊上架:https://amzn.to/4fqvn0D
《从零构建推理模型》可在此获取:https://mng.bz/Nwr7
如果你读过这本书,能抽出几分钟时间在亚马逊留下评价(https://www.amazon.com/Build-Large-Language-Model-Scratch/dp/1633437167),我会非常感激!这对我们作者帮助很大!
你的支持意义重大!非常感谢!