LLM Research Papers: The 2026 List (January to May),by Sebastian Raschka, on 2026-06-06
大语言模型研究论文:2026年精选清单(1-5月)
很多读者可能知道,我一直有个长期习惯:会持续整理一份研究论文清单,收录那些我想研读、复盘,或是未来写文章、做项目时会引用的文献。
去年我分享过两份整理好的论文清单,分别覆盖上半年(1-6 月)和下半年(7-12 月)。
不少读者反馈这些清单非常实用,因此我沿用同样的思路,整理了 2026 年上半年的新清单,收录了 2026 年 1 月至 5 月我标记的论文。
请注意,这并非今年所有发表论文的完整汇总 —— 每天都有大量论文发布,做完整汇总完全不现实。这份清单是基于我个人认为有趣、或与自身工作相关的论文筛选而成的精选参考列表。整理时我仔细核对了每篇论文的标题、摘要与主题定位,但坦白说,我也只深入精读了其中一部分。
为什么要做这些清单?每当我撰写文章、书稿章节、代码示例或是备课时,常会想起 “之前在哪看到过一篇相关论文”,但回头去找往往格外麻烦。一份分类清晰的 Markdown 清单就能解决这个问题,希望对你们也同样有用。(即便在如今大模型网页搜索的时代,一份有明确语境的专题清单依然很有价值。)
今年的清单依然偏重推理模型、强化学习与高效推理方向 —— 毕竟我个人更倾向于收藏和当前工作相关的论文。不过和 2025 年的清单相比,我也新增了更多关于智能体框架、工具调用、长上下文、扩散语言模型以及实际服务部署基础设施的论文,这既是我当下重点关注的方向,也是整个领域的发展趋势。
本研究论文清单分为以下类别。
-
架构与模型设计
-
高效训练与规模化
-
推理效率与 KV 缓存
-
稀疏注意力与长上下文
-
推理与测试时计算
-
强化学习与可验证奖励强化学习(RLVR)
-
智能体系统与工具调用
-
代码智能体与软件工程
-
扩散语言模型
-
模型评估与基准测试
1. 架构与模型设计
第一部分收录了模型架构相关论文、模型发布技术报告,以及有助于解释当前大语言模型形态成因的研究。
2026 年至今一个有意思的趋势是:架构研究不再局限于单纯放大 Transformer 规模,而是涌现了大量围绕以下方向的工作:
-
混合架构(例如 Nemotron 3、Arcee Trinity)
-
状态空间层(Nemotron 3 与 Mamba-3)
-
MoE 容量分配(《扩大嵌入层效果优于扩大专家层》、Step 3.5 Flash)
-
激活行为(《尖峰、稀疏与汇点:大规模激活与注意力汇点剖析》)
-
表征几何(《语言统计中的对称性塑造模型表征的几何结构》)
这些论文都很有价值,也是我最初收藏它们的原因。如果要选出一篇必读论文,我会推荐Nemotron 3 Super—— 这篇技术报告内容极其详实,介绍了一款已落地生产的模型所采用的技术,而且它是同参数级别中表现最好的模型之一。
Nemotron 3 的一大亮点是混合架构设计:它交替使用常规注意力层与 Mamba-2(状态空间模型)层,以此提升长上下文效率。2026 年,长上下文效率是核心命题 —— 越来越多大语言模型被接入智能体框架(如 OpenClaw 等),对上下文长度的要求越来越高。
诚然,120B-A12B 规格对于普通消费级硬件做本地推理来说可能偏大,但该系列也有 Nemotron 3 Nano(4B)版本。

图 1:Nemotron-3 Super 架构,采用 Mamba-2 层的混合架构
补充说明:就在两天前,英伟达还发布了其放大版本 Nemotron 3 Ultra(550B-A55B),它扩大了嵌入层与投影维度,但基础构建模块保持一致。如果想看可视化示意图,我在 Substack Notes 上发过相关内容。
这种 “注意力层 + 替代层交替堆叠” 的混合架构趋势,是今年相当热门的发展方向。采用类似混合设计的开源大模型系列中,最知名的大概是 Qwen3.6—— 它在非注意力部分使用门控 DeltaNet 层,而非 Mamba-2 层。更多相关内容可以看我写的《混合注意力》专题文章,其中整合了我此前多篇 Substack 文章中关于这类架构的内容。
另外在下面的论文列表中你会发现,如今已经有了 Mamba-3 与门控 DeltaNet-2(即 Mamba-2 与门控 DeltaNet 的升级版本),很期待它们在后续开源大模型(比如 Nemotron-4、Qwen4?)中的落地应用。
除了混合架构设计之外,Nemotron-3 论文还包含大量其他有意思的消融实验,例如针对推测解码的多 token 预测、NVFP4 预训练对比 BF16、合成 MMLU 风格数据,以及训练后量化方案等等,但详细展开这些内容就超出本篇概览的范围了。
-
1 月 1 日,《深度 Delta 学习》,https://arxiv.org/abs/2601.00417
-
1 月 6 日,《MiMo-V2-Flash 技术报告》,https://arxiv.org/abs/2601.02780
-
1 月 13 日,《Ministral 3》,https://arxiv.org/abs/2601.08584
-
1 月 29 日,《语言模型中,扩大嵌入层效果优于扩大专家层》,https://arxiv.org/abs/2601.21204
-
1 月 30 日,《LatentLens:揭示大语言模型中高度可解释的视觉 token》,https://arxiv.org/abs/2602.00462
-
2 月 4 日,《ERNIE 5.0 技术报告》,https://arxiv.org/abs/2602.04705
-
2 月 8 日,《ViT-5:面向 2020 年代中期的视觉 Transformer》,https://arxiv.org/abs/2602.08071(本文以大语言模型为主,但实在忍不住收录这款重要的新型视觉 Transformer 架构。)
-
2 月 11 日,《Step 3.5 Flash:110 亿激活参数的开源前沿智能模型》,https://arxiv.org/abs/2602.10604
-
2 月 12 日,《Nanbeige4.1-3B:具备推理、对齐与行动能力的小型通用模型》,https://arxiv.org/abs/2602.13367
-
2 月 16 日,《语言统计中的对称性塑造模型表征的几何结构》,https://arxiv.org/abs/2602.15029
-
2 月 17 日,《GLM-5:从氛围编码到智能体工程》,https://arxiv.org/abs/2602.15763
-
2 月 18 日,《Arcee Trinity Large 技术报告》,https://www.arxiv.org/abs/2602.17004
-
3 月 4 日,《尖峰、稀疏与汇点:大规模激活与注意力汇点剖析》,https://arxiv.org/abs/2603.05498
-
3 月 12 日,《Tiny Aya:弥合模型规模与多语言深度的鸿沟》,https://arxiv.org/abs/2603.11510
-
3 月 15 日,《注意力残差》,https://arxiv.org/abs/2603.15031
-
3 月 16 日,《Mamba-3:基于状态空间原理的改进序列建模》,https://arxiv.org/abs/2603.15569
-
3 月 31 日,《从注意力到 Mamba:跨架构蒸馏方案》,https://arxiv.org/abs/2604.14191
-
4 月 13 日,《Nemotron 3 Super:面向智能体推理的开源高效 MoE 混合 Mamba-Transformer 模型》,https://arxiv.org/abs/2604.12374
-
5 月 6 日,《ZAYA1-8B 技术报告》,https://arxiv.org/abs/2605.05365
-
5 月 13 日,《Delta 注意力残差》,https://arxiv.org/abs/2605.18855
-
5 月 21 日,《门控 DeltaNet-2:在线性注意力中解耦擦除与写入》,https://arxiv.org/abs/2605.22791
-
5 月 25 日,《MiniMax-M2 系列:最小化激活释放最大化真实智能》,https://arxiv.org/abs/2605.26494
2. 高效训练与规模化
本部分聚焦训练系统、适配方法与规模化方案。这些论文并非全部围绕从零开始预训练,其中不少关注微调、蒸馏、测试时训练,或是在受限硬件上优化训练效果。
【以下为付费内容,请跳转至原文付费订阅,6$,两杯咖啡钱】
LLM Research Papers: The 2026 List (January to May),by Sebastian Raschka, on 2026-06-06