原文地址:LLM Research Papers: The 2025 List (January to June),by Sebastian Raschka, on 2025-07-01
大语言模型研究论文:2025年上半年精选(1-6月)
按主题分类的 200 余篇 2025 年大语言模型研究论文合集
熟悉我的读者可能知道,我一直有整理待读、待参考研究论文清单的习惯。
大约半年前,我分享了 2024 年的论文清单,很多读者都觉得很实用。因此我打算继续更新这个系列,并且采纳了大家反复提到的建议:「能不能按主题而非日期来整理论文?」
我划分的分类如下:
-
推理模型
-
1a. 推理模型训练
-
1b. 推理阶段推理策略
-
1c. 大语言模型评估与推理解析
-
-
大语言模型的其他强化学习方法
-
其他推理阶段扩展方法
-
高效训练与模型架构
-
基于扩散的语言模型
-
多模态与视觉 – 语言模型
-
数据与预训练数据集
同时,大语言模型领域的研究更新速度极快,因此我决定将清单更新频率调整为半年一次。这样既能保证内容的时效性,也更易于阅读,希望能为大家的暑期研读提供一份扎实的参考资料。
请注意,目前这份内容仅为精选清单。在后续的文章中,我会针对其中更具价值、更有影响力的论文,按主题撰写更深入的解读与讨论,敬请期待。
公告
暑期来临,随之而来的是实习季、技术面试与集中学习的高峰。
为了帮助大家巩固中高级机器学习与人工智能相关知识,今年夏天我将《机器学习问答与 AI》一书的全部 30 个章节免费开放:
https://sebastianraschka.com/books/ml-q-and-ai/#table-of-contents
无论你是单纯好奇想学习新知识,还是正在为面试做准备,希望这份资料能对你有所帮助。
祝阅读愉快,也祝所有面试的同学一切顺利!
1. 推理模型
今年的清单中推理模型相关内容占比极高,因此我将其拆分为三个子方向:训练方法、推理阶段扩展,以及更泛化的原理分析与评估。
1a. 推理模型训练
本小节聚焦于专门用于提升大语言模型推理能力的训练策略。不难发现,近期的大部分进展都围绕着可验证奖励强化学习(RLVR)展开,我在之前的文章中对此有过详细介绍。

图注:摘自《强化预训练》(https://arxiv.org/abs/2506.08007)的标注示意图
-
1 月 8 日 《迈向大语言模型的系统 2 推理:通过元思维链学习思考方法》,https://arxiv.org/abs/2501.04682
-
1 月 13 日 《数学推理中过程奖励模型的开发经验》,https://arxiv.org/abs/2501.07301
-
1 月 16 日 《迈向大型推理模型:大语言模型强化推理研究综述》,https://arxiv.org/abs/2501.09686
-
1 月 20 日 《推理语言模型:构建蓝图》,https://arxiv.org/abs/2501.11223
-
1 月 22 日 《Kimi k1.5:大语言模型强化学习规模化实践》,https://arxiv.org/abs//2501.12599
-
1 月 22 日 《DeepSeek-R1:通过强化学习激发大语言模型的推理能力》,https://arxiv.org/abs/2501.12948
-
2 月 3 日 《大型推理模型的竞技编程应用》,https://arxiv.org/abs/2502.06807
-
2 月 5 日 《揭开大语言模型长思维链推理的面纱》,https://arxiv.org/abs/2502.03373
-
2 月 5 日 《LIMO:推理领域的少即是多》,https://arxiv.org/abs/2502.03387
-
2 月 5 日 《通过强化学习教会语言模型自我批判》,https://arxiv.org/abs/2502.03492
-
2 月 6 日 《训练语言模型实现高效推理》,https://arxiv.org/abs/2502.04463
-
2 月 10 日 《探究结果奖励在数学推理学习中的极限》,https://arxiv.org/abs/2502.06781
-
2 月 10 日 《论大语言模型中思考的涌现 I:寻找正确的直觉》,https://arxiv.org/abs/2502.06773
-
2 月 11 日 《大语言模型可轻松从演示结构中学习推理 —— 关键是结构而非内容!》,https://arxiv.org/abs/2502.07374
-
2 月 12 日 《Fino1:推理增强型大语言模型在金融领域的迁移性研究》,https://arxiv.org/abs/2502.08127
-
2 月 13 日 《一日之内通过模型合并将特定语言大语言模型适配为推理模型 —— 开源方案》,https://arxiv.org/abs/2502.09056
-
2 月 20 日 《Logic-RL:基于规则的强化学习释放大语言模型推理能力》,https://arxiv.org/abs/2502.14768
-
2 月 25 日 《SWE-RL:基于开放软件演进的强化学习提升大语言模型推理能力》,https://arxiv.org/abs/2502.18449
-
3 月 4 日 《多次尝试强化学习中的失败经验学习》,https://arxiv.org/abs/2503.04808
-
3 月 4 日 《前几个令牌就足够:一种高效的推理模型无监督前缀微调方法》,https://arxiv.org/abs/2503.02875
-
3 月 10 日 《R1-Searcher:通过强化学习激发大语言模型的搜索能力》,https://arxiv.org/abs/2503.05592
-
3 月 10 日 《LMM-R1:通过两阶段基于规则的强化学习为 30 亿参数多模态大语言模型赋予强推理能力》,https://arxiv.org/abs/2503.07536
-
3 月 12 日 《Search-R1:训练大语言模型通过强化学习进行推理并调用搜索引擎》,https://arxiv.org/abs/2503.09516
-
3 月 16 日 《面向层级化多步奖励模型,增强大语言模型推理能力》,https://arxiv.org/abs/2503.13551
-
3 月 20 日 《小参数大语言模型的推理强化学习:有效方法与局限》,https://arxiv.org/abs/2503.16219
-
3 月 25 日 《ReSearch:大语言模型通过强化学习学习结合搜索进行推理》,https://arxiv.org/abs/2503.19470
-
3 月 26 日 《理解类 R1-Zero 训练:批判性视角》,https://arxiv.org/abs/2503.20783
-
3 月 30 日 《RARE:检索增强推理建模》,https://arxiv.org/abs/2503.23513
-
3 月 31 日 《Open-Reasoner-Zero:在基础模型上规模化强化学习的开源方案》,https://arxiv.org/abs/2503.24290
-
3 月 31 日 《JudgeLRM:大型推理模型作为评判器》,https://arxiv.org/abs/2504.00050
-
4 月 7 日 《通过强化学习实现简洁推理》,https://arxiv.org/abs/2504.05185
-
4 月 10 日 《VL-Rethinker:通过强化学习激发视觉 – 语言模型的自反思能力》,https://arxiv.org/abs/2504.08837
-
4 月 11 日 《Genius:面向高级推理的通用纯无监督自训练框架》,https://arxiv.org/abs/2504.08672
-
4 月 13 日 《利用推理模型答案增强非推理模型能力》,https://arxiv.org/abs/2504.09639
-
4 月 21 日 《离策略引导下的推理学习》,https://arxiv.org/abs/2504.14945
-
4 月 22 日 《Tina:基于 LoRA 的小型推理模型》,https://arxiv.org/abs/2504.15777
-
4 月 29 日 《单训练样本下的大语言模型推理强化学习》,https://arxiv.org/abs/2504.20571
-
4 月 30 日 《Phi-4-Mini-Reasoning:探索小型推理语言模型的数学能力极限》,https://arxiv.org/abs/2504.21233
-
5 月 2 日 《Llama-Nemotron:高效推理模型》,https://arxiv.org/abs/2505.00949
-
5 月 5 日 《RM-R1:奖励建模即推理》,https://arxiv.org/abs/2505.02387
-
5 月 6 日 《绝对零样本:零数据下的强化自博弈推理》,https://arxiv.org/abs/2505.03335
-
5 月 12 日 《INTELLECT-2:通过全球去中心化强化学习训练的推理模型》,https://arxiv.org/abs/2505.07291
-
5 月 12 日 《MiMo:解锁语言模型的推理潜力 —— 从预训练到后训练》,https://arxiv.org/abs/2505.07608
-
5 月 14 日 《Qwen3 技术报告》,https://arxiv.org/abs/2505.09388
-
5 月 15 日 《超越「顿悟时刻」:迈向大型推理模型的系统化元能力对齐》,https://arxiv.org/abs/2505.10554
-
5 月 19 日 《AdaptThink:推理模型可学会何时启动思考》,https://arxiv.org/abs/2505.13417
-
5 月 19 日 《Thinkless:大语言模型学会何时思考》,https://arxiv.org/abs/2505.13379
-
5 月 20 日 《通用推理器:全领域提升大语言模型推理能力》,https://arxiv.org/abs/2505.14652
-
5 月 21 日 《通过混合思维学习逻辑推理》,https://arxiv.org/abs/2505.15817
-
5 月 21 日 《RL Tango:生成器与验证器协同强化语言推理》,https://arxiv.org/abs/2505.15034
-
5 月 23 日 《QwenLong-L1:通过强化学习迈向长上下文大型推理模型》,https://www.arxiv.org/abs/2505.17667
-
5 月 26 日 《Enigmata:通过合成可验证谜题规模化大语言模型逻辑推理》,https://arxiv.org/abs/2505.19914
-
5 月 26 日 《无外部奖励下的推理学习》,https://arxiv.org/abs/2505.19590
-
5 月 29 日 《达尔文哥德尔机器:自我进化智能体的开放式演化》,https://arxiv.org/abs/2505.22954
-
5 月 30 日 《反思、重试、奖励:通过强化学习实现大语言模型自我提升》,https://arxiv.org/abs/2505.24726
-
5 月 30 日 《ProRL:长时强化学习拓展大语言模型推理边界》,https://arxiv.org/abs/2505.24864
-
6 月 2 日 《打破 80/20 法则:高熵少数令牌驱动大语言模型推理的高效强化学习》,https://arxiv.org/abs/2506.01939
-
6 月 3 日 《奖励小概率事件:突破 GRPO 的分布锐化局限》,https://www.arxiv.org/abs/2506.02355
-
6 月 9 日 《强化预训练》,https://arxiv.org/abs/2506.08007
-
6 月 10 日 《RuleReasoner:基于领域感知动态采样的强化规则推理》,https://arxiv.org/abs/2506.08672
-
6 月 10 日 《测试阶段扩展的强化学习教师》,https://www.arxiv.org/abs/2506.08388
-
6 月 12 日 《Magistral》,https://arxiv.org/abs/2506.10910
-
6 月 12 日 《虚假奖励:重新思考可验证奖励强化学习中的训练信号》,https://arxiv.org/abs/2506.10947
-
6 月 16 日 《AlphaEvolve:面向科学与算法发现的编程智能体》,https://arxiv.org/abs/2506.13131
-
6 月 17 日 《可验证奖励强化学习隐性激发基础大语言模型的正确推理》,https://arxiv.org/abs/2506.14245
-
6 月 23 日 《反向传播编程:大语言模型在代码训练中习得可复用算法抽象》,https://arxiv.org/abs/2506.18777
-
6 月 26 日 《打通大语言模型的离线与在线强化学习》,https://arxiv.org/abs/2506.21495
1b. 推理阶段推理策略
本部分收录无需重新训练、在测试阶段动态提升推理效果的方法。这类研究通常以计算性能为代价,换取模型效果的提升。