【转载】大语言模型研究论文:2026年精选清单(1-5月)

LLM Research Papers: The 2026 List (January to May),by Sebastian Raschka, on 2026-06-06

大语言模型研究论文:2026年精选清单(1-5月)

很多读者可能知道,我一直有个长期习惯:会持续整理一份研究论文清单,收录那些我想研读、复盘,或是未来写文章、做项目时会引用的文献。

去年我分享过两份整理好的论文清单,分别覆盖上半年(1-6 月)和下半年(7-12 月)。

不少读者反馈这些清单非常实用,因此我沿用同样的思路,整理了 2026 年上半年的新清单,收录了 2026 年 1 月至 5 月我标记的论文。

请注意,这并非今年所有发表论文的完整汇总 —— 每天都有大量论文发布,做完整汇总完全不现实。这份清单是基于我个人认为有趣、或与自身工作相关的论文筛选而成的精选参考列表。整理时我仔细核对了每篇论文的标题、摘要与主题定位,但坦白说,我也只深入精读了其中一部分。

为什么要做这些清单?每当我撰写文章、书稿章节、代码示例或是备课时,常会想起 “之前在哪看到过一篇相关论文”,但回头去找往往格外麻烦。一份分类清晰的 Markdown 清单就能解决这个问题,希望对你们也同样有用。(即便在如今大模型网页搜索的时代,一份有明确语境的专题清单依然很有价值。)

今年的清单依然偏重推理模型、强化学习与高效推理方向 —— 毕竟我个人更倾向于收藏和当前工作相关的论文。不过和 2025 年的清单相比,我也新增了更多关于智能体框架、工具调用、长上下文、扩散语言模型以及实际服务部署基础设施的论文,这既是我当下重点关注的方向,也是整个领域的发展趋势。

本研究论文清单分为以下类别。

  • 架构与模型设计

  • 高效训练与规模化

  • 推理效率与 KV 缓存

  • 稀疏注意力与长上下文

  • 推理与测试时计算

  • 强化学习与可验证奖励强化学习(RLVR)

  • 智能体系统与工具调用

  • 代码智能体与软件工程

  • 扩散语言模型

  • 模型评估与基准测试


Continue reading 【转载】大语言模型研究论文:2026年精选清单(1-5月)

【转载】大语言模型架构最新进展:KV共享、mHC与压缩注意力

原文地址:Recent Developments in LLM Architectures: KV Sharing, mHC, and Compressed Attention,by Sebastian Raschka, 2025-05-16

大语言模型架构最新进展:KV共享、mHC与压缩注意力

从 Gemma 4 到 DeepSeek V4:开源大模型如何降低长上下文成本

短暂休假陪伴家人后,我很高兴回归,跟进这几周密集发布的开源大语言模型。其中最突出的一点是,新一代架构都将重心放在了长上下文效率优化上。

随着推理模型与智能体工作流需要保留更多 token(且保留时长更长),KV 缓存大小、内存带宽与注意力计算成本很快成为核心瓶颈。为此,大模型开发者正在引入越来越多的架构技巧来降低这些开销。

本文重点分析四个典型设计:Gemma 4 的 KV 共享与逐层嵌入、Laguna XS.2 的逐层注意力配额、ZAYA1-8B 的压缩卷积注意力,以及 DeepSeek V4 的流形约束超连接(mHC)+ 压缩注意力方案。

在我的架构示意图里,这些改动大多看起来只是微调,但其中不少是相当精巧的设计变更,值得展开详细讨论。


figure01

图 1 2026 年 4-5 月发布的主流开源大模型架构示意图。完整图片与更多细节可在我的大模型架构图库中查看。图中未列出所有模型尺寸;Qwen3.6 包含 27B 与 35B-A3B 版本,ZAYA1 以 8B 模型为代表(省略 ZAYA1-base 与 ZAYA1-reasoning-base 版本)。虚线框标注的架构将在本文中详细解读。

Continue reading 【转载】大语言模型架构最新进展:KV共享、mHC与压缩注意力

【转载】我理解大语言模型架构的工作流程

My Workflow for Understanding LLM Architectures,by Sebastian Raschka, 2024-04-18

我理解大语言模型架构的工作流程

一套面向学习、用于解析新开源权重模型的工作方法

过去几个月里,很多人希望我分享一下,我是如何梳理出文章、演讲以及「大语言模型架构图鉴(LLM-Gallery)」里那些架构示意图的。因此我觉得,把自己常用的流程整理成文应该会有所帮助。

简而言之,我通常会从官方技术报告入手,但如今的论文往往不如以往详尽,产业实验室发布的绝大多数开源权重模型更是如此。

好在如果模型权重已在 Hugging Face 模型中心(Model Hub)公开,且 Python 的 transformers 库已支持该模型,我们通常可以直接查看配置文件与参考实现,获取更多架构细节。而能正常运行的代码从不会说谎。

figure01

图 1:这套工作流的核心出发点 —— 如今论文细节往往不足,但可运行的参考实现为我们提供了具象的研究对象。

Continue reading 【转载】我理解大语言模型架构的工作流程

【转载】提升大语言模型推理能力的推理时算力缩放分类

原文地址:Categories of Inference-Time Scaling for Improved LLM Reasoning,by Sebastian Raschka, on 2026-01-24

提升大语言模型推理能力的推理时算力缩放分类

兼述最新推理缩放研究论文(含递归语言模型)

推理缩放已经成为提升已部署大语言模型回答质量与准确率的最有效手段之一。

它的原理非常直白:如果我们愿意在推理阶段(即使用模型生成文本时)投入更多算力、花费更多时间,就能让模型输出更优质的答案。

如今,每一家主流大语言模型服务商都在采用某种形式的推理时算力缩放,学术界围绕这类方法的研究也在快速增长。

今年3月,我曾写过一篇推理缩放领域概览,总结了早期的部分技术。

《大语言模型推理模型的推理现状》

在本文中,我会在之前讨论的基础上做进一步延伸,将不同方法划分成更清晰的类别,同时重点介绍过去几个月涌现的最新研究成果。

在为《从零构建推理模型》一书撰写推理缩放完整章节的过程中,我亲自实验了这类方法的众多基础变体。为了调优超参数,我累计跑了数千次实验,花了大量精力斟酌哪些方法值得在章节中展开讲解。(这个章节最后篇幅过长,我最终拆成了两章,目前都已在抢先阅读计划中上线。)

附言:我对这两章的最终呈现非常满意。它们能把基础模型的准确率从约15%提升到52%左右,是目前整本书里成就感最强的内容之一。

本文整理了一些没有放进最终章节叙事、但仍然值得分享的思路、笔记与论文。
我也计划后续在GitHub的补充材料里加入更多代码实现。

目录概览

  1. 推理时算力缩放概述

  2. 思维链提示

  3. 自一致性

  4. N选优排序

  5. 带验证器的拒绝采样

  6. 自我精炼

  7. 解路径搜索

  8. 结论、分类与组合方式

  9. 番外:闭源大语言模型都用了哪些技术?

你可以在网页版阅读时使用左侧导航栏,直接跳转到任意章节。


1 推理时算力缩放概述

推理时算力缩放(也叫推理算力缩放、测试时缩放,或简称推理缩放)是一个统称,指代所有在推理阶段投入更多算力与时间来提升模型表现的方法。

这个概念由来已久,经典机器学习中的集成方法就可以看作推理时缩放的早期例子——使用多个模型会消耗更多算力,但能得到更好的结果。

即便在大语言模型领域,这个思路也早已存在。不过我印象中,它是去年OpenAI在o1的官宣博文《用大语言模型学习推理》里放出一张推理缩放与训练缩放的对比图后,才又一次彻底火了起来。

figure01

图1:在推理阶段(左)和训练阶段(右)投入更多资源,通常都能提升模型准确率。

Continue reading 【转载】提升大语言模型推理能力的推理时算力缩放分类

【转载】大语言模型研究论文:2025年下半年精选(7-12月)

原文地址:LLM Research Papers: The 2025 List (July to December),by Sebastian Raschka, on 2025-12-30

大语言模型研究论文:2025年下半年精选(7-12月)

今年 6 月,我曾向付费订阅用户分享过一篇附赠文章,整理了我收藏标记的研究论文清单 —— 正是这些订阅者支撑着这个 Substack 专栏的运营。

本着同样的心意,为了感谢所有热心支持者,我整理了 2025 年 7 月至 12 月期间我标记归档的优质研究论文,清单如下。

这些论文我都通读了摘要,但真正全文精读的只有极少一部分。不过我依然坚持整理这类分类清单,因为在开展具体项目时,我常常会回头查阅这些资料。

顺便一提,我同时也在撰写年度大语言模型综述文章《2025 年大语言模型发展现状:进展、问题与展望》,今天也同步发布了。大家可以通过以下链接查看:

《2025 年大语言模型发展现状:进展、问题与展望》

原本我打算把这份论文清单放进上面这篇综述里,但文章篇幅已经过长,因此决定单独成篇分享。希望大家不介意今天收到两封推送邮件。我的考虑是,拆分后两篇文章都更便于阅读、快速浏览和日后回顾,不用在超长的页面里费力查找。

本次论文清单分为以下类别(大家可以在网页版文章的目录中直接跳转对应章节):

  • 推理模型

    • 1a. 推理模型训练

    • 1b. 推理阶段推理策略

    • 1c. 大语言模型评估与推理解析

  • 大语言模型的其他强化学习方法

  • 其他推理阶段扩展方法

  • 模型发布 / 技术报告

  • 模型架构

  • 高效训练

  • 基于扩散的语言模型

  • 多模态与视觉 – 语言模型

  • 数据与预训练数据集


Continue reading 【转载】大语言模型研究论文:2025年下半年精选(7-12月)

【转载】从零理解并实现Qwen3

原文地址:Understanding and Implementing Qwen3 From Scratch,by Sebastian Raschka, on 2025-09-06

从零理解并实现Qwen3

深度解析主流开源大语言模型之一

此前,我在《大语言模型架构大比拼》一文中对比了2025年最具代表性的开源权重架构;随后又在《从GPT-2到gpt-oss:架构演进概念分析》中,从概念层面深入拆解了各类架构组件。

好事成三。在介绍今年夏天值得关注的研究亮点之前,我打算从代码层面动手实践,深入拆解这些架构。跟着本文一步步操作,你就能理解模型的底层运行原理,还能获得可复用的基础模块,适配到自己的实验或项目中。

为此我选择了Qwen3(5月首次发布,7月完成更新)——截至撰文时,它是最受青睐、应用最广的开源权重模型系列之一。

在我看来,Qwen3系列模型广受欢迎的原因如下:

  • 采用对开发者与商业应用友好的开源协议(Apache 2.0许可证),除开源许可证本身条款外无任何附加限制(其他部分开源大模型会额外设置使用约束)。

  • 性能表现优异:截至撰文时,开源权重的235B-Instruct版本在LMArena排行榜上位列第8,与闭源模型Claude Opus 4持平。排名更高的开源大模型仅有两款——参数量是其3倍的DeepSeek 3.1,以及参数量是其4倍的Kimi K2。9月5日,Qwen3在其平台发布了1万亿参数的“max”版本,在所有主流基准测试中均超越Kimi K2、DeepSeek 3.1与Claude Opus 4;不过该模型目前为闭源状态。

  • 覆盖多种模型尺寸,适配不同算力预算与应用场景,从0.6B稠密模型到480B参数的混合专家(MoE)模型一应俱全。

本文篇幅较长,因为包含纯PyTorch从零实现的完整代码。尽管代码部分看起来篇幅较多,但我相信相比单纯的概念示意图,代码能更好地帮你理解各个基础模块的原理。

提示1:如果你是在邮件收件箱中阅读本文,较窄的行宽可能导致代码片段换行错乱。为获得更好的阅读体验,建议在网页浏览器中打开本文。
提示2:你可以使用网站左侧的目录,在各章节间更便捷地跳转。

figure01

图1:本文将用纯PyTorch讲解并复现的Qwen3稠密架构与混合专家(MoE)架构示意图

Continue reading 【转载】从零理解并实现Qwen3

【转载】大语言模型研究论文:2025年上半年精选(1-6月)

原文地址:LLM Research Papers: The 2025 List (January to June),by Sebastian Raschka, on 2025-07-01

大语言模型研究论文:2025年上半年精选(1-6月)

按主题分类的 200 余篇 2025 年大语言模型研究论文合集

熟悉我的读者可能知道,我一直有整理待读、待参考研究论文清单的习惯。

大约半年前,我分享了 2024 年的论文清单,很多读者都觉得很实用。因此我打算继续更新这个系列,并且采纳了大家反复提到的建议:「能不能按主题而非日期来整理论文?」

我划分的分类如下:

  • 推理模型

    • 1a. 推理模型训练

    • 1b. 推理阶段推理策略

    • 1c. 大语言模型评估与推理解析

  • 大语言模型的其他强化学习方法

  • 其他推理阶段扩展方法

  • 高效训练与模型架构

  • 基于扩散的语言模型

  • 多模态与视觉 – 语言模型

  • 数据与预训练数据集

同时,大语言模型领域的研究更新速度极快,因此我决定将清单更新频率调整为半年一次。这样既能保证内容的时效性,也更易于阅读,希望能为大家的暑期研读提供一份扎实的参考资料。

请注意,目前这份内容仅为精选清单。在后续的文章中,我会针对其中更具价值、更有影响力的论文,按主题撰写更深入的解读与讨论,敬请期待。

Continue reading 【转载】大语言模型研究论文:2025年上半年精选(1-6月)

【转载】从零编写大语言模型:完整课程

原文地址:Coding LLMs from the Ground Up: A Complete Course,by Sebastian Raschka, on 2025-05-10

从零编写大语言模型:完整课程

近几个月我写了很多关于推理模型的内容(一连更了 4 篇)。除了 “智能体” 相关方向之外,推理能力是 2025 年大语言模型领域最核心的议题之一。

但这个月,我想分享一些更底层、更 “基础” 的内容 —— 如何从零编写大语言模型。这是理解 LLM 工作原理的最佳方式之一。

为什么要做这套内容?因为去年我分享的精简版 LLM 实战 workshop 反响非常好,很多人都从中受益:

《从零构建大语言模型:3 小时编码实战课》

所以我想,这套时长约为原版 5 倍、内容更详尽的课程(总时长约 15 小时),实用价值会更高。

另外很遗憾的是,我最近颈部受了重伤,过去三周基本没法对着电脑工作。目前我先尝试保守治疗,再考虑医生建议的手术方案。这个时机实在糟糕 —— 我刚找回工作节奏,生活就又抛来一记曲线球。

所以在康复期间,我把前几个月录好的这些视频整理出来,作为过渡内容分享给大家。

希望这份内容对你有帮助,也感谢大家的支持!

附:这些视频原本是我《从零构建大语言模型》一书的配套补充内容,但实际体验下来,它们作为独立课程也完全成立。

Continue reading 【转载】从零编写大语言模型:完整课程

【转载】从零初探推理:第1章

原文地址:First Look at Reasoning From Scratch: Chapter 1,by Sebastian Raschka, on 2025-04-29

从零初探推理:第1章

当代大语言模型的推理入门

大家好:

如各位所知,我近期撰写了大量关于大语言模型推理前沿研究的内容。在下一篇聚焦研究的博客文章发布前,我想为付费订阅者准备一份特别内容,感谢大家一直以来的支持。

目前我正在撰写一本关于大语言模型推理原理的新书,今天先和大家分享全书的第 1 章。这一章约 15 页,是大语言模型领域的推理入门内容,概述了推理时算力扩展、强化学习等核心方法。

感谢各位的支持!希望大家喜欢这一章节,也敬请期待我下一篇关于推理研究的博客文章。

祝阅读愉快
塞巴斯蒂安


第 1 章 引言

欢迎来到大语言模型(LLM)发展的下一阶段:推理。大语言模型已经彻底改变了我们处理与生成文本的方式,但此前其能力的核心驱动力主要是统计模式识别。如今,推理方法的新进展让大语言模型能够应对更复杂的任务,比如解答逻辑谜题、完成多步算术运算。理解这些方法,正是本书的核心主题。

在这一入门章节中,你将学习:

  • “推理” 在大语言模型语境下的具体定义

  • 推理与模式匹配的本质区别

  • 大语言模型常规的预训练与后训练阶段

  • 提升大语言模型推理能力的核心方法

  • 为什么从零搭建推理模型,能帮助我们更深入地理解其优势、局限与实际权衡

在本章搭建完基础概念之后,后续章节将转向实操代码案例,带你直接实现大语言模型的推理技术。

1.1 对大语言模型而言,“推理” 意味着什么?

Continue reading 【转载】从零初探推理:第1章

【转载】大语言模型研究论文:2024年度合集

原文地址:LLM Research Papers: The 2024 List,by Sebastian Raschka, on 2024-12-08

大语言模型研究论文:2024年度合集

今年的AI研究领域精彩纷呈、热点不断,如果你关注大语言模型方向,更是能感受到领域的飞速发展。

我原本为12月的这期内容做了详尽规划,打算发布一篇专题文章,盘点2024年我心目中的所有研究亮点。这个计划依然会推进,但由于意外受了重伤,我目前无法坐在电脑前完成草稿。希望接下来几周能顺利康复,尽快回归工作。

在此期间,我想分享自己2024年以来持续收藏的优质论文清单(以大语言模型相关内容为主)。这只是一份简单的列表,但或许能帮大家在假期里挖到一些值得深入研读的宝藏论文。

如果你偏好代码向的深度阅读与动手实践,我的《从零构建大语言模型》一书已于上个月在亚马逊上线。
此外,我还在GitHub仓库中补充了大量配套学习资料。

figure01

Continue reading 【转载】大语言模型研究论文:2024年度合集