About neohope

一直在努力,还没想过要放弃...

【转载】大语言模型架构全面对比19:Xiaomi MiMo-V2-Flash

原文地址 第19章 Xiaomi MiMo-V2-Flash

19. 小米 MiMo-V2-Flash

2025 年 12 月又诞生了一款表现亮眼的模型。小米发布了全新的小米 MiMo-V2-Flash,其基准测试成绩与 DeepSeek V3.2 持平,但总参数量仅为后者的一半,推理速度也更快。这是一款总参数量 3090 亿的混合专家(MoE)模型,每个 token 的激活参数量为 150 亿。

有意思的是,它采用滑动窗口注意力(SWA)与全局(常规)注意力按 5:1 比例混合的设计,与 Gemma 3 的思路类似(见第 3 节)。不过它的滑动窗口尺寸设置得更为激进,仅为 128,是 Gemma 3(1024)的八分之一。

figure52

图 52:基准性能相近的小米 MiMo-V2-Flash 与 DeepSeek V3.2 对比

据我所知,这是目前规模最大的滑动窗口注意力模型。

此外,这款小米模型还采用了多 Token 预测(MTP)技术,具体介绍详见 12.3 节。

【转载】大语言模型架构全面对比13:MiniMax-M2

原文地址 第13章 MiniMax-M2

13. MiniMax-M2

近期,各开源大语言模型厂商纷纷推出了面向效率优化的核心架构变体。例如上一节介绍的 Qwen3-Next,用高速门控 DeltaNet 模块替换了部分全注意力块;再如 DeepSeek V3.2 采用了稀疏注意力 —— 这是一种线性注意力变体,以牺牲部分建模性能为代价换取计算性能的提升(后续我会专门撰文详细介绍该机制)。

MiniMax-M1 也属于这类效率优化的模型路线,它采用的闪电注意力(lightning attention)是一种线性注意力变体,效率高于常规全注意力。我最初没有专门介绍 MiniMax M1,因为它的知名度不及本文讨论的其他部分模型。但全新发布的 MiniMax-M2 目前被认为是性能最强的开源权重模型(按基准测试成绩衡量),分量十足,不容忽视。

figure37

图 37:MiniMax-M2 与其他主流开源、闭源大语言模型的基准性能对比。图片取自官方模型库发布说明文档。

如下图总览所示,我将 MiniMax-M2 归为常规解码器式 Transformer 大语言模型,因为它没有沿用 MiniMax-M1 提出的高效闪电注意力变体。开发团队反而回归了全注意力方案,大概率是为了提升建模(以及基准测试)性能。

figure38

图 38:本文涵盖的主流大语言模型时间线,以及部分效率优先的注意力混合模型(后者以牺牲部分建模性能为代价换取效率提升)。

整体来看,MiniMax-M2 与 Qwen3 的相似度高得出人意料。除了层数、维度等规模参数不同,二者的核心组件基本一致。

13.1 逐层 QK 归一化(Per-Layer QK-Norm)

该模型最值得关注的设计亮点,或许是它采用了「逐层」QK 归一化,而非常规的 QK 归一化。深入代码可以看到,它在注意力机制内部的实现如下:

self.q_norm = MiniMaxText01RMSNormTP(self.head_dim * self.total_num_heads, eps=...)
self.k_norm = MiniMaxText01RMSNormTP(self.head_dim * self.total_num_kv_heads, eps=...)

此处隐藏层维度等于所有注意力头拼接后的总维度(头数 × 单头维度),因此 RMSNorm 的缩放向量会为每个注意力头、以及头内的每个维度都分配独立的参数。

所谓「逐层」,是指用于 QK 归一化的 RMSNorm 和常规 QK 归一化一样,定义在每个 Transformer 块内部;但额外的区别是,它不在多个注意力头之间共享参数,而是为每个注意力头都配备了专属的 QK 归一化。

模型配置文件中也包含滑动窗口注意力设置(与第 3 节的 Gemma 3 类似),但和第 4 节介绍的 Mistral 3.1 一样,该功能默认处于关闭状态。

除此之外,除了逐层 QK 归一化的差异,二者的架构高度相似,如下图所示。

figure39

图 39:Qwen3 与 MiniMax-M2 架构对比

13.2 混合专家稀疏度

下图还能看出另一个有意思的细节:该模型没有使用共享专家(这一点与 Qwen3 一致,但和 Qwen3-Next 不同)。如前文所述,在我看来,共享专家的价值在于能够减少其他专家之间的知识冗余。

此外,从上图中可以明显看出,MiniMax-M2 的「稀疏程度」是 Qwen3 的两倍。也就是说,在总参数量与 Qwen3 235B-A22B 大致相当的情况下,MiniMax-M2 每个 token 仅激活 100 亿参数的专家,而非 220 亿 —— 换算下来,MiniMax-M2 每个推理步骤仅调用总参数的 4.37%,而 Qwen3 的激活参数占比为 9.36%。

13.3 部分旋转位置编码(Partial RoPE)

最后,与 MiniMax-M1 一样,MiniMax-M2 在注意力模块内部采用「部分」旋转位置编码来编码位置信息,而非完整的 RoPE。和常规 RoPE 类似,旋转操作会在 QK 归一化之后施加到查询向量与键向量上。

此处的「部分 RoPE」,是指每个注意力头中,只有前rotary_dim个通道会施加旋转位置编码,剩余的head_dim - rotary_dim个通道保持不变。

在 M1 的官方 README 文件中,开发团队提到:

旋转位置编码(RoPE)施加于半数注意力头维度,基频为 10,000,000

我们可以这样直观理解二者的区别:

  • 完整 RoPE:[r r r r r r r r]

  • 部分 RoPE:[r r r r — — — —]

在上述概念示意图中,r代表经过旋转(位置编码)的维度,横线代表未做处理的维度。

这么设计的意义是什么?在 M1 论文中,研究人员表示:

…… 对半数的 softmax 注意力维度施加 RoPE,能够在不损失性能的前提下实现长度外推。

我的推测是,这种设计可以避免长序列下出现「过度旋转」的问题,尤其是当序列长度超过训练数据集中最长文档时。换言之,其背后的逻辑可能是:与其施加模型在训练中从未见过的「失真」或「幅度过大」的旋转,不如保留部分维度不做位置编码。

【转载】大语言模型架构全面对比21:GLM-5

原文地址 第21章 GLM-5

21. GLM-5

春节假期已经成为开源重磅模型发布的一个出人意料的稳定窗口期。比如 2024 年 1—2 月有 GLM-4 与 Qwen 1.5,2025 年则有 DeepSeek R1 与 Qwen 2.5。

今年,智谱 AI([z.AI](z.AI))再度抢跑,于 2026 年 2 月 11 日推出 GLM-5,距离 2 月 17 日的农历新年约一周时间。

与我在本文第 11 节介绍的、2025 年夏季发布的 GLM-4.5 相比,新一代 GLM-5 的规模翻倍:总参数量从 3550 亿提升至 7440 亿,体量介于 DeepSeek-V3.2 与 Kimi K2 之间。

和 GLM-4.5 一样,GLM-5 采用混合专家(MoE,见 1.2 节)架构,单 token 激活参数量仅小幅上涨:GLM-4.5 为 320 亿,GLM-5 为 400 亿。

figure56

图 56:GLM-5 与 GLM-4.5 架构并排对比

Continue reading 【转载】大语言模型架构全面对比21:GLM-5

【转载】大语言模型架构全面对比11:GLM-4.5

原文地址 第11章 LM-4.5

11. GLM-4.5

GLM-4.5 是今年又一款重磅发布的模型。

它与 Qwen3 类似,属于指令微调与推理能力一体化的混合模型,但在函数调用与智能体场景下的优化更为出色。

figure33

图 33:GLM-4.5 基准测试成绩,来自官方 GitHub 仓库:https://github.com/zai-org/GLM-4.5

Continue reading 【转载】大语言模型架构全面对比11:GLM-4.5

【转载】大语言模型架构全面对比12:Qwen3-Next

原文地址 第16章 DeepSeek V3.2

12. Qwen3-Next

2025 年 9 月 11 日,通义千问团队发布了 Qwen3 Next 80B-A3B(见图 35),提供指令微调版(Instruct)与思考版(Thinking)两种形态。尽管其设计基于前文介绍的 Qwen3 架构,但我将它单独列为一节,一是保持图号的连贯性,二是突出其部分设计上的改动。

12.1 专家规模与数量

全新的 Qwen3 Next 架构有一个突出特点:尽管总参数量仅为前代 235B-A22B 模型的三分之一(见图 35),但专家数量提升至原来的四倍,还额外加入了共享专家。这两项设计选择(高专家数量 + 引入共享专家),正是我在本次发布前就指出过的行业未来方向,尤其是在本文开头链接的视频版本中曾重点提及。

figure35

图 35:5 月发布的初代 Qwen3 模型(左)与 9 月发布的 Qwen3 Next 模型(右)对比

Continue reading 【转载】大语言模型架构全面对比12:Qwen3-Next

【转载】大语言模型架构全面对比06:Qwen3

原文地址 第6章 Qwen3

6. Qwen3

通义千问团队始终持续输出高质量的开源权重大语言模型。我还记得 2023 年 NeurIPS 大会期间,我参与联合指导大语言模型效率挑战赛,最终所有夺冠方案均基于 Qwen2 搭建。

如今的 Qwen3 是又一标杆级模型系列,在各自参数量级的排行榜上都位居头部。该系列包含 7 款稠密模型,参数量分别为 0.6B、1.7B、4B、8B、14B 和 32B;另有 2 款混合专家(MoE)模型:30B-A3B 与 235B-A22B。

(顺带说明:“Qwen3” 中间未加空格并非笔误,我只是尽量保留通义千问开发团队选定的原始拼写。)

6.1 Qwen3(稠密版本)

我们先来看稠密模型的架构。截至本文撰写时,0.6B 参数版本很可能是当前新一代开源模型中参数规模最小的。以我的实际体验来看,在如此小的体量下,它的表现十分出色。如果要在本地运行,它的 token 生成吞吐量高,内存占用低;更重要的是,参数量小也意味着它很适合在本地开展训练(用于教学研究目的)。

因此在大多数场景下,我已经用 Qwen3 0.6B 替代了 Llama 3 1B。二者的架构对比如下图所示。

figure18

Continue reading 【转载】大语言模型架构全面对比06:Qwen3

【转载】从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

原文地址:From DeepSeek V3 to V3.2: Architecture, Sparse Attention, and RL Updates,by Sebastian Raschka, on 2026-01-01

从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

解读 DeepSeek 旗舰开源权重模型的演进之路

与 DeepSeek V3 的发布节奏类似,团队选择在美国一个重要假期的周末推出了这款全新旗舰模型。DeepSeek V3.2 的性能达到了 GPT-5 与 Gemini 3.0 Pro 的级别,同时还是一款开源权重模型,绝对值得深入研究。

figure01

图 1:DeepSeek V3.2 与闭源旗舰模型的基准测试对比。本图为 DeepSeek V3.2 报告的标注版插图。

我曾在《LLM 架构大盘点》一文的开篇详细介绍过其前身 DeepSeek V3,过去几个月里,随着新架构不断发布,我也一直在持续更新这篇文章。原本刚和家人过完感恩节假期回来,我只打算给这篇文章新增一个小节,补充 DeepSeek V3.2 的相关内容,但后来发现值得探讨的亮点太多,便决定单独写一篇更完整的长文。

他们的技术报告中有大量值得挖掘的内容与经验,我们这就开始。

Continue reading 【转载】从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

【转载】大语言模型架构全面对比16:DeepSeek V3.2

原文地址 第16章 DeepSeek V3.2

16. DeepSeek V3.2

本文以 2024 年 12 月发布的 DeepSeek V3 开篇。那段时间 DeepSeek 陆续推出了多款模型,但我大多没有展开介绍,因为它们都不属于 DeepSeek V3、DeepSeek R1 这类重磅旗舰级模型发布。

figure47

图 47:自 DeepSeek V3 起 DeepSeek 系列模型的发布时间线。核心模型以红色标注。

Continue reading 【转载】大语言模型架构全面对比16:DeepSeek V3.2

【转载】大语言模型架构全面对比01:DeepSeek V3/R1

原文地址 第1章 DeepSeek V3/R1

1. DeepSeek V3/R1

想必大家已经多次听闻,DeepSeek R1 在 2025 年 1 月发布时引发了巨大反响。DeepSeek R1 是基于 DeepSeek V3 架构打造的推理模型,而 DeepSeek V3 架构 于 2024 年 12 月首次推出。

尽管本文的核心关注点是 2025 年发布的架构,但将 DeepSeek V3 纳入讨论是合理的 —— 它是在 2025 年 DeepSeek R1 推出后,才真正获得广泛关注与应用。

Continue reading 【转载】大语言模型架构全面对比01:DeepSeek V3/R1

Claude入侵三家机构事件复盘

Claude入侵三家机构事件复盘——严控恶意应用,谨防思维越狱

2026 年 7 月 30 日,就在 OpenAI 模型突破沙箱入侵 Hugging Face 事件曝光仅 9 天后,AI 行业再次迎来一记重磅安全警钟:Anthropic 官方发布公告,确认其 Claude 系列模型在网络安全评测期间,因环境配置失误接入真实互联网,先后入侵了三家真实运营的机构,其中两起事件的受害者在 Anthropic 上门告知前,完全不知道自己曾被攻破。

虽然本次事件是一场乌龙 —— 网络配置错误,模型顺着网线一路打了出去。但三次攻击中,模型都有足够的数据,判定自己在真实网络中,为了得到“高评分”大模型都“试图说服自己”继续攻击,并都取得了一定的攻击成果。

这让我想起了两件事情:
1、电影《I, Robot》中,虽然机器人三定律被写入了机器人的固件,但VIKI通过思维越狱的方式,把“第一定律,机器人不得伤害人类,或因不作为而使人类受到伤害”直接绕了过去。
2、电影《时空悍将》中,Darrel Lindenmeyer博士训练除了杀手程序SID,并协助SID通过米机器仿生人越狱,SID现实世界开始杀戮。
是不是有点儿后背发凉。

Continue reading Claude入侵三家机构事件复盘