原文地址:Noteworthy AI Research Papers of 2024 (Part Two),by Sebastian Raschka, on 2025-01-15
2024年值得关注的AI研究论文(下)
六篇7-12月的重磅AI论文
2025年1月15日
祝你的2025年有个好开端!作为开年内容,我终于完成了这篇《2024年AI研究亮点》的第二部分草稿。文章涵盖了各类相关主题,从混合专家模型到全新的LLM精度缩放定律,不一而足。
请注意,本文是该系列的第二部分,聚焦2024年下半年(7月至12月)的研究。第一部分可在此查看:https://magazine.sebastianraschka.com/p/ai-research-papers-2024-part-1
诚然,入选标准带有主观性,是基于我今年关注到的亮点内容筛选的。我也尽量兼顾了主题多样性,所以内容不局限于LLM模型发布。
祝你2025年一切顺利,阅读愉快!
7. 7月:Llama 3模型家族
读者想必对Meta AI的Llama 3模型及其论文已经十分熟悉,但鉴于这些模型的重要性与广泛应用,我想把7月的板块留给Grattafiori等人于2024年7月发表的论文:https://arxiv.org/abs/2407.21783
Llama 3模型家族的突出特点在于,相比前代Llama 2,其预训练与后训练流程的精细度大幅提升。值得注意的是,不仅Llama 3如此,其他LLM(如https://arxiv.org/abs/2408.00118、https://arxiv.org/abs/2407.10671、https://arxiv.org/abs/2407.21075等)也遵循这一趋势,正如我几个月前在这篇文章中所述:https://magazine.sebastianraschka.com/p/new-llm-pre-training-and-post-training
7.1 Llama 3架构概览
Llama 3最初发布了80亿和700亿参数两个版本,之后团队持续迭代模型,陆续推出了Llama 3.1、3.2和3.3版本。各版本参数规模汇总如下:
Llama 3(2024年4月)
- 80亿参数
- 700亿参数
Llama 3.1(2024年7月,本文讨论版本)
- 80亿参数
- 700亿参数
- 4050亿参数
Llama 3.2(2024年9月)
- 10亿参数
- 30亿参数
- 110亿参数(支持视觉)
- 900亿参数(支持视觉)
Llama 3.3(2024年12月)
- 700亿参数
整体而言,Llama 3的架构与Llama 2高度相似,核心差异在于更大的词表,以及小参数版本中引入的分组查询注意力(GQA)。二者差异总结见下图。

Llama 2与Llama 3对比图,来源:https://github.com/rasbt/LLMs-from-scratch/tree/main/ch05/07_gpt_to_llama
如果你对架构细节感兴趣,一种极佳的学习方式是从零实现模型,并加载预训练权重作为合理性校验。这个仓库实现了从GPT-2到Llama 2、Llama 3、Llama 3.1、Llama 3.2的转换:https://github.com/rasbt/LLMs-from-scratch/tree/main/ch05/07_gpt_to_llama

GPT-2到Llama 2、Llama 3、Llama 3.1、Llama 3.2的转换示意图,来源:https://github.com/rasbt/LLMs-from-scratch/tree/main/ch05/07_gpt_to_llama
7.3 Llama 3的训练
相比Llama 2,另一个值得关注的升级是Llama 3的训练数据量达到了15万亿token。

各类模型训练集规模对比
如今的预训练流程分为多个阶段。该论文主要聚焦Llama 3.1,为简洁起见,我将其预训练技术总结在了下图中。

Llama 3.1预训练所用技术总结
在后训练阶段,相比Llama 2的一个显著变化是从RLHF-PPO切换为DPO。这些方法也总结在下图中。

Llama 3.1预训练所用技术总结
出于篇幅考虑,本文还要介绍另外5篇论文,更多细节以及与其他模型的对比请参考我之前的文章:https://magazine.sebastianraschka.com/p/new-llm-pre-training-and-post-training
《Ahead of AI》是读者支持型出版物。想要接收新文章并支持我的创作,欢迎成为免费或付费订阅者。
7.4 多模态Llama
值得注意的是,Llama 3.2模型也同步发布了多模态支持版本。但我观察到这类模型在实践中应用尚不广泛,讨论度也不高。我们会在本文9月的板块中再探讨多模态技术。
7.5 Llama 3的影响与应用
尽管Llama 3发布已逾半年,但Llama系列模型仍是认知度最高、应用最广的开源权重LLM之一(这是我个人观感,暂无具体引用来源)。这类模型相对易于理解和使用,其流行的原因可能在于Llama的品牌认知度,加上在各类通用任务上的稳定表现,以及微调的便捷性。
Meta AI也保持了迭代节奏,陆续推出Llama 3.1、3.2以及最新的3.3版本,覆盖多种参数规模,适配从端侧场景(10亿参数)到高性能应用(4000亿参数)的多元需求。
尽管如今该领域已有诸多极具竞争力的开源/开放权重LLM,如Olmo 2、Qwen 2.5、Gemma 2、Phi-4等等,但我认为Llama仍将是大多数用户的首选模型,就像ChatGPT即便面临Anthropic Claude、Google Gemini、DeepSeek等竞品的挑战,依然保持着人气。
我个人很期待Llama 4,希望能在2025年与我们见面。
8. 8月:通过扩展推理时计算量提升LLM性能
我本月的选择是这篇2024年8月的论文:https://arxiv.org/abs/2408.03314。这篇论文撰写详实、论证清晰,针对推理阶段(即部署阶段)如何提升LLM输出质量提出了诸多有趣洞见。
8.1 通过增加测试时计算量提升输出质量
这篇论文的核心前提是,研究增加测试时计算量是否以及如何能提升LLM的输出效果。打个通俗的比方:人类在处理难题时,如果有更多思考时间,就能给出更优的答案。同理,如果给LLM更多时间与资源生成回复,其输出质量也可能提升。用更专业的术语来说,研究人员试图探明:如果在推理阶段投入额外算力,模型的表现能超出其训练水平多少。
此外,研究人员还探讨了一个问题:在算力预算固定的情况下,将更多算力投入测试阶段,是否比投入模型进一步预训练能带来更好的效果。这一点我们稍后再展开。
8.2 测试时计算技术的优化
论文极为详细地介绍了提升和优化测试时计算的各类技术。如果你正着手实际部署LLM(比如前面提到的Llama系列模型),我强烈推荐通读全文。
简而言之,扩展测试时计算量主要有两种方法:
- 生成多个候选答案,使用基于过程的验证器奖励模型(需单独训练)选出最优回复
- 自适应更新模型的回复分布,本质上是在推理生成过程中修正回复(同样需要单独的模型)
给第一类方法举个简单例子:提升测试时计算的一种朴素方式是使用N选优采样(best-of-N)。即让LLM并行生成多个答案,再基于验证器奖励模型选出最优的一个。N选优只是其中一种,这类方法还包括多种搜索算法:束搜索、前瞻搜索、N选优,如下图所示。

不同的基于搜索的方法均依赖过程奖励模型选出最优答案。标注图来自《LLM测试时计算》论文,https://arxiv.org/abs/2408.03314
属于第二类的另一种方法是对模型回复进行序列修正,如下图所示。

序列修正方法。标注图来自《LLM测试时计算》论文,https://arxiv.org/abs/2408.03314
哪种方法效果更好?遗憾的是,没有放之四海而皆准的答案。这取决于基础LLM以及具体的问题或查询。比如,基于修正的方法在难题上表现更优,但在简单问题上反而可能损害性能。
论文中,研究人员开发了一种“最优”策略:基于一个模型评估查询的难度等级,再针对性选择合适的方法。
8.3 测试时计算 vs 预训练更大模型
一个值得探讨的有趣问题是:在算力预算固定的情况下,哪种方式性价比更高——使用更大的模型,还是增加推理阶段的算力预算?
这里我们假设单次查询的成本是相同的,因为大模型的推理成本本身就高于小模型。
研究发现,对于高难度问题,大模型的表现优于通过前述推理扩展策略获得额外推理算力的小模型。
但对于简单和中等难度的问题,在相同算力预算下,通过增加推理时计算量,小模型可以达到14倍参数规模大模型的性能水平!
8.4 测试时计算扩展的未来价值
我们使用Llama 3这类开源权重模型时,通常直接让模型生成回复。但正如这篇论文所指出的,分配更多推理算力可以显著提升回复质量。(如果你正在部署模型,这篇论文绝对值得一读。)
当然,对于本就成本高昂的大模型,增加推理算力预算会让其运行成本进一步上升。但如果根据查询难度有选择性地应用,就能为特定回复带来质量与准确率的显著提升,这无疑是大多数用户乐于见到的。(可以肯定的是,OpenAI、Anthropic和谷歌早已在幕后应用了这类技术。)
另一个极具吸引力的应用场景是提升小型端侧LLM的性能。我认为这在未来数月乃至数年都将是热门话题,从苹果智能(Apple Intelligence)和微软Copilot PC的重磅发布与投入中也可见一斑。
9. 9月:多模态LLM范式对比
我原本认为多模态LLM会是2024年取得重大突破的领域之一。事实也确实如此,今年我们迎来了更多开源权重的多模态LLM!

多模态LLM示意图:可接收多种输入模态(音频、文本、图像、视频),输出模态为文本。
其中一篇让我印象尤为深刻的论文,是NVIDIA的Dai等人于2024年9月发表的:https://arxiv.org/abs/2409.11402。这篇论文很好地对比了两种主流多模态范式。
9.1 多模态LLM范式
构建多模态LLM主要有两种思路:
- 方法A:统一嵌入解码器架构
- 方法B:跨模态注意力架构

多模态LLM架构的两种主流开发思路
如上图所示,统一嵌入解码器架构(方法A)基于单个解码器模型,架构与GPT-2、Llama 3.2这类未修改的LLM相似。该方法将图像转换为与文本token嵌入维度相同的token,使LLM可以处理拼接后的文本与图像输入token。
与之相对,跨模态注意力架构(方法B)引入了交叉注意力机制,直接在注意力层内整合图像与文本嵌入。
如果你想了解更多细节,我今年早些时候专门写过一篇关于多模态LLM的文章,逐步讲解了这两种方法:https://magazine.sebastianraschka.com/p/understanding-multimodal-llms
9.2 英伟达的混合方法
纵观今年的多模态技术发展,在我看来,英伟达的这篇论文(https://arxiv.org/abs/2409.11402)的突出之处在于,它对各类多模态方案进行了全面的同条件对比。研究没有只聚焦单一方法,而是直接比较了三种路线:
- 方法A:统一嵌入解码器架构(“纯解码器架构”,NVLM-D)
- 方法B:跨模态注意力架构(“基于交叉注意力的架构”,NVLM-X)
- 混合方法(NVLM-H)

三种多模态方法概览。(标注图来自《NVLM:开放前沿级多模态LLM》论文:https://arxiv.org/abs/2409.11402)
如上图总结,NVLM-D对应前文所述的方法A,NVLM-X对应方法B。而混合模型NVLM-H融合了两种方法的优势:先接收图像缩略图作为输入,再通过交叉注意力处理动态数量的图像块,以捕捉更精细的高分辨率细节。
核心结论总结如下:
- NVLM-X:处理高分辨率图像时计算效率更优
- NVLM-D:在OCR相关任务上准确率更高
- NVLM-H:融合两种方法优势,实现最优性能
9.3 2025年的多模态LLM
多模态LLM是个很有意思的方向。我认为它是传统文本LLM之后的必然发展方向。OpenAI、谷歌、Anthropic等大多数LLM服务商都已支持图像等多模态输入。就我个人而言,需要用到多模态功能的场景大概只占1%(通常是“把表格提取成markdown格式”这类需求)。
我预计开源权重LLM的默认形态仍会是纯文本,因为这样复杂度更低。但同时我也认为,随着工具链和API的演进,开源多模态LLM会有更多选择,应用也会更普及。
10. 10月:复现OpenAI o1的推理能力
我10月的选择是Qin等人于2024年10月发表的论文:https://arxiv.org/abs/2410.18982
OpenAI ChatGPT的o1(以及如今的o3)已广受追捧,它们似乎代表了LLM推理任务性能提升的一次范式转变。
OpenAI o1的具体技术细节尚未公开,已有多篇论文尝试对其进行描述或复现。那我为什么选中这篇?它与众不同的行文结构,以及关于学术研究现状的更宏观的哲思,引发了我的共鸣。换句话说,这篇论文有其独特之处,让它脱颖而出,值得入选。
10.1 捷径学习 vs 旅程学习
这篇论文的核心观点之一是,研究人员提出假设:o1采用了一种名为“旅程学习”的过程,而非“捷径学习”,如下图所示。

传统上,LLM只在正确的解题路径上训练(捷径学习);而在旅程学习中,监督微调覆盖了完整的试错修正过程。标注图来自《o1复现报告》,https://arxiv.org/abs/2410.18982
值得注意的是,旅程学习的思路与本文“8月:通过扩展推理时计算量提升LLM性能”章节提到的带修正的树状方法、束搜索方法有几分相似。
但细微的差别在于,研究人员是创建旅程学习训练样本用于模型微调,而非仅在推理阶段应用该技术。(需要说明的是,我没有找到他们用于增强推理过程的技术相关信息。)
10.2 构建长思维链
研究人员构建了一棵推理树,从中衍生出完整的思考过程,重点突出试错环节。这种方法与传统方法不同——传统方法优先寻找通往正确答案的直接路径,且中间步骤都必须是正确的。在他们的框架中,推理树的每个节点都标注了奖励模型给出的评分,标明该步骤正确与否,同时附上判断理由。
随后,他们通过监督微调和DPO训练了一个deepseek-math-7b-base模型。实验训练了两个模型:
- 采用传统捷径训练范式,只提供正确的中间步骤
- 采用提出的旅程学习方法,训练数据包含完整的思考过程,包括正确与错误答案、回溯等等
(旁注:每组实验仅用了327个样本!)
如下图所示,在MATH500基准数据集上,旅程学习方法的表现大幅领先捷径学习。

经捷径学习与旅程学习训练的LLM对比。标注图来自《o1复现报告》,https://arxiv.org/abs/2410.18982
10.3 蒸馏——捷径解法?
一个月后,该团队发布了另一篇报告:Huang等人于2024年11月发表的论文:https://arxiv.org/abs/2411.16489
这篇论文采用了蒸馏方法:通过精心设计的提示词提取o1的思考过程,用以训练模型达到同等性能。本文篇幅已经很长,我就不展开细节了,但想分享该论文中一张很有意思的图,它总结了收集长思维数据的成本权衡。

他们通过这种蒸馏方法取得了极佳的效果,性能与o1-preview、o1-mini相当。但在这些实验之外,研究人员也针对这种方法背景下的研究现状,分享了一些有趣且重要的思考,我将在下一节进行总结。
10.4 AI研究的现状
第二篇报告的一大重点是“简单蒸馏的苦涩教训”。诚然,蒸馏在实践中效果很好,但它并非推动进步的动力。最好的情况也只是追平上游已有模型的性能(而非创造新的性能纪录)。以下是论文中的三段引文,堪称对当前行业现状的警示:
“这种从‘原理为何’到‘什么有用’的转变,代表了研究心态的根本性变化,可能对该领域未来的创新能力产生深远影响。”
“第一性原理思维的消解尤其令人担忧,因为它动摇了科学创新的根基。”
“快速出成果的压力可能会掩盖深度技术探索的价值,而学生们也可能因此不愿投身更具挑战性的基础研究方向。”
我个人的看法是,如今学术实验室(如今也常与产业合作)仍在产出大量优秀且重要的想法,它们可以非常实用且影响力巨大。(我脑海中最先想到的例子就是LoRA和DPO。)问题在于,很多有前景的想法从未得到大规模验证,因为高校通常缺乏所需的海量资源。
我也不知道完美的解决方案是什么,我也明白企业不可能直接公开自己的商业机密。但如果企业在采用学术论文的思路时,能公开予以认可,将会大有裨益。这种认可对于激励和回馈那些免费开放研究成果的研究者来说意义重大。同时,通过明确哪些方法在实践中真正有效,也能推动整个领域向前发展。
10.5 o1(及o3)背景下LLM的未来
《o1复现之旅》这篇论文复现了o1背后的精确机制吗?大概率没有。但它仍然是一篇很有价值的读物,充满了有助于提升效果的思路。我相信,o1、o3这类“长思维”模型将继续在LLM研究中扮演关键角色。它们的运行成本更高,但基本代表了推理任务性能的黄金标准与上限。
但由于成本更高,o1类模型并非在所有场景下都是最优选择。对于语法修正、翻译这类简单任务,我们大概率不需要推理能力极强的模型。归根结底是成本与效用的平衡。我们根据预算、延迟等因素,为具体任务选择合适的LLM。
《Ahead of AI》是读者支持型出版物。想要接收新文章并支持我的创作,欢迎成为免费或付费订阅者。
11. 11月:面向精度的LLM缩放定律
我原本想选Allen AI的这篇论文(https://arxiv.org/abs/2411.15124),因为文中详细介绍了他们的Llama后训练方法与配方,包括DPO与PPO的消融实验,以及一种名为“可验证反馈强化学习”的全新偏好对齐方法——该方法使用可验证查询(比如数学和代码问题,很容易生成标准答案)来替代奖励模型。
但经过一番权衡,我最终选择了Kumar等人于2024年11月发表的论文:https://arxiv.org/abs/2411.04330。因为它对2022年提出的Chinchilla缩放定律进行了亟需的更新——Chinchilla定律被广泛用于确定预训练阶段算力最优的LLM参数量与数据集规模,原论文见:https://arxiv.org/abs/2203.15556
简而言之,这篇2024年11月的论文将Chinchilla缩放定律进行了扩展,使其适用于低精度(16位及以下)训练与推理场景——低精度技术近年来已十分普及。例如,论文将各类低精度与量化相关的观察结论统一为一个函数形式,可以同时预测低精度训练和训练后量化带来的额外损失。
11.1 Chinchilla缩放定律回顾
2022年论文提出的原始Chinchilla缩放定律,建模了LLM参数量(N)与数据集规模(D)如何共同影响LLM的验证损失,常被用作确定LLM与训练数据集规模的指导原则。
根据经验法则,(在算力预算固定时)数据集规模D与参数量N的最优配比约为 D/N ≈ 20。
这一数据-参数比通常被称为“Chinchilla最优”,因为在相同总训练成本下,该比例能带来更低的验证损失。
但请注意,如今已有很多反例。比如前文提到的Llama 3,训练数据量为15万亿token,对于80亿参数版本,这个比值就是15000000000000 ÷ 800000000 = 1875。
在我看来,比具体的数据-参数比值更重要的结论是:模型规模与数据集规模必须成比例缩放。
11.2 低精度训练
在进一步讨论(或者说总结)低精度缩放定律之前,我先简单科普一下LLM(或深度神经网络)权重常用的不同数值精度格式。
据我所知,以下是GPT 2/3与Llama 2/3训练时采用的精度格式,供对比参考:

Float32是训练深度神经网络的标准32位浮点格式,在数值范围与精度间取得了很好的平衡。如今,float32以下的格式都被视为低精度(当然“低”的定义是动态变化的,就像“大语言模型”里的“大”一样)。
Float16(半精度)仅使用16位,能节省内存、加快计算,但动态范围更窄。

32位与16位浮点精度对比
Bfloat16(脑浮点16)同样是16位格式,但它牺牲了float16的部分精度,换取了更大的指数位,能更有效地表示极大和极小的数值。因此,bfloat16有助于避免深度学习应用中的数值溢出或下溢,不过其较低的精度仍可能导致舍入误差。

常规16位浮点与主流16位脑浮点精度对比
如果你想了解更多精度格式及其对LLM模型表现的影响,可以参考我之前的文章,里面有更详细的介绍:https://magazine.sebastianraschka.com/p/the-missing-bits-llama-2-weights
另外请注意,我这里只展示了32位和16位格式,而目前行业正向更低的训练精度进军,比如Llama 3论文中提到的(实验性)8位格式。(12月26日发布的DeepSeek-V3,其全部预训练就是在8位浮点精度下完成的:https://github.com/deepseek-ai/DeepSeek-V3)
11.3 精度缩放定律核心结论
这篇论文内容详实且有趣,推荐通读。不过核心结论是:研究人员在原始Chinchilla缩放定律基础上,新增了“精度”因子P。具体来说,他们将模型参数量N重新诠释为“有效参数量”——精度越低,有效参数量越小。(数学公式请参考原文。)
此外,他们还新增了一项,用以刻画训练后量化对模型性能的衰减影响。(我知道这里没介绍量化的基础概念,但本文篇幅已经过长,这个话题只能改天再讲了。)
下图很好地说明了一点:更多的预训练数据并非总是越好——如果训练后用极低精度(如int3)量化模型,更多数据反而可能有害。我觉得这个发现非常有意思。

不同后量化格式下,训练数据量增加对验证损失的影响
所以从上图可以得出结论:用海量数据训练的模型(比如Llama 3),训练后再量化到低精度格式会更困难,因为模型在过多数据上发生了“过训练”。
11.4 2025年的模型缩放定律
精度缩放定律的研究不仅对Chinchilla缩放定律做出了亟需的更新,也为2025年的一个关键挑战提供了新视角:随着Llama 3这类模型在更大数据集上训练,它们可能更难在量化到INT3等低精度格式时不损失性能。
这一发现凸显了我们需要反思“数据越多越好”的固有思维,在数据集规模与高效推理的实际约束之间取得平衡。这对推动硬件优化也具有重要参考价值。
我认为这类缩放定律研究常常忽略的一个维度是数据集质量。预训练数据的性质会产生重大影响。(下文讨论Phi-4时会展开说。)
12. 12月:Phi-4与合成数据学习
2024年下半年发布了不少有意思的模型,包括圣诞节当天惊艳亮相的DeepSeek-V3(https://github.com/deepseek-ai/DeepSeek-V3)。但最终我选择了微软的这篇论文(https://arxiv.org/abs/2412.08905),因为它对合成数据的应用提出了有趣的洞见。
12.1 Phi-4的性能
Abdin等人于2024年12月发表的这篇论文,介绍了微软最新140亿参数开源权重LLM的训练过程。Phi-4最特别的地方在于,它的训练数据以GPT-4o生成的合成数据为主。基准测试结果显示,它的表现优于同等规模的其他LLM,包括前代Phi-3——Phi-3的训练以非合成数据为主。

Phi-4与同等及不同规模模型的性能对比(标注表格来自Phi-4论文,https://arxiv.org/abs/2412.08905)
我不太确定为什么该模型在SimpleQA上表现较差,如上表所示。但一种可能的解释是:SimpleQA是相对较新的基准,于2024年10月30日发布。它由OpenAI开发,属于其评测套件的一部分,可能既没有被纳入GPT-4o的训练数据,也没有出现在网络爬取数据集中。而且,由于本次评估的合成数据是用GPT-4o生成的,所有模型在训练时都没见过SimpleQA。不过Phi-4可能对其他基准存在过拟合,这也能解释它在这个未见过的SimpleQA数据集上表现相对不佳。当然,这只是我的假设。
12.2 合成数据的启示
在总结论文中的消融实验之前,我们先看看数据集构成。

Phi-4训练的数据集混合比例(标注表格来自Phi-4论文,https://arxiv.org/abs/2412.08905)
研究人员观察到,虽然合成数据整体上有益,但纯合成数据训练的模型在知识类基准上表现不佳。在我看来,这引出了一个问题:是合成数据缺乏足够的专属知识信息,还是它包含了更多事实错误(比如幻觉导致的错误)?
同时,研究人员发现,增加合成数据的训练轮数(epoch),比单纯增加更多网络数据更能提升性能,如下图所示。

不同合成/网络数据集比例下的模型性能对比。(标注图来自Phi-4论文,https://arxiv.org/abs/2412.08905)
总而言之,数据混合中合成数据占比过高,会对知识类任务的表现产生负面影响。但在合成数据与网络数据比例更均衡的前提下,增加合成数据集的训练迭代次数(epoch)是有益的。
12.3 合成数据的未来价值
Phi-4技术报告为合成数据的应用提供了有趣的洞见:合成数据对模型预训练大有助益。尤其是在模型规模与数据集规模的缩放定律均显现瓶颈的当下(尽管Llama 3论文提到,在15万亿token规模下尚未看到收敛),研究者与工程师们正在寻找其他能持续突破边界的方法。
当然,预训练技术的优化与新增,尤其是后训练技术,大概率仍将是性能提升的核心动力之一。但我认为,合成数据的应用会成为一种有效手段:要么用更少的数据训练出合格的预训练基座模型,要么打造出更优的基座模型(比如在Llama 3的15万亿token数据集基础上,再加入40%的合成数据token)。
我认为高质量数据的作用类似于迁移学习。传统方式是让模型在原始、无结构的互联网数据上预训练,再在后训练阶段精调;而利用高质量模型(比如已经过大量优化的GPT-4o)生成的(部分)合成数据,相当于给训练提供了“起跑优势”。换句话说,高质量训练数据能让模型从一开始就更高效地学习。
结论与展望
希望这些研究总结对你有帮助!和往常一样,这篇文章又写得比我预想的长。最后,我用一个简短的板块来聊聊对2025年的预测与展望。
多模态LLM
去年我预测LLM会越来越走向多模态。如今,所有主流闭源LLM服务商都已提供多模态(至少是图像)支持。可见这一转型已全面展开,开源领域也会有更多相关探索。
根据我的所见所读,多模态相关论文数量确实激增了。接下来可能会出现更多开源微调方法与资源。不过我认为,对很多应用场景来说,纯文本已经足够,并且未来也依然够用,行业的核心重点仍将是开发更强的推理模型(比如o1和即将推出的o3)。
计算效率
预训练和使用LLM的成本都相当高。因此我预计,在可预见的未来,会出现更多提升LLM计算效率的巧妙方法。作为参考,按GPU租赁标价计算,训练最新的DeepSeek-V3需要花费500万美元(https://github.com/deepseek-ai/DeepSeek-V3/blob/main/DeepSeek_V3.pdf),这还不包括超参数调优、训练失败重试以及人力成本。

DeepSeek-V3报告中的粗略估算,来源:https://github.com/deepseek-ai/DeepSeek-V3/blob/main/DeepSeek_V3.pdf
顺便说一句,根据Meta AI官方的模型卡(https://github.com/meta-llama/llama-models/blob/main/models/llama3_1/MODEL_CARD.md),Llama 3 405B的训练算力更是达到了约10倍之多(3084万GPU小时 vs 266万GPU小时)。
提升LLM效率的常用技术(并非都适用于训练阶段)包括混合专家(我在第一部分文章中讨论过)、Llama系列采用的分组查询注意力等等。另一个有意思的技术是DeepSeek模型采用的多头潜在注意力,能提升多头注意力中KV缓存的效率。
另一个近期值得关注的方向是针对模型输入做优化。比如最近提出的字节潜在Transformer(BLT):https://arxiv.org/abs/2412.09871,它通过将字节动态编码为基于熵的块,无需分词即可优化算力分配,实现更好的扩展性与更快的推理。
状态空间模型
你可能注意到了,今年我没讲状态空间模型。这是因为我目前的研究重点主要是基于Transformer的LLM。虽然我觉得状态空间模型非常有意思,但现阶段它们还相当实验性。而且Transformer在各类任务上持续展现出卓越性能,让人不太有动力去考虑替代方案。
但这并不代表状态空间模型领域没有进展。我已经看到了不少该领域的有趣论文。而且我注意到一个有意思的趋势:如今的状态空间模型基本都成了混合架构,整合了Transformer的自注意力机制。比如:
从这个角度来说,它们的计算成本也在上升。随着基于Transformer的LLM不断优化效率,而状态空间模型逐步加入注意力机制,如果当前趋势持续,二者最终大概率会走向中间路线。无论如何,这都是一个值得关注的有趣研究领域。
通过缩放实现LLM进步
临近年底时,还有一场关于“LLM缩放已走到尽头”的讨论,理由是互联网数据已经用完了。这场讨论源自Ilya Sutskever(OpenAI联合创始人之一,也是GPT系列论文的共同作者)在NeurIPS上的演讲。但遗憾的是,我今年没参加这个会议,所以不了解具体细节。
无论如何,这个观点很有意思,因为互联网数据是呈指数级增长的。我可以引用这篇文章的数据:https://edgedelta.com/company/blog/how-much-data-is-created-per-day,“每天产生15.87TB数据”。当然,挑战在于并非所有数据都是文本,也并非都对LLM训练有用。但正如我们从Phi-4看到的,数据治理与数据精炼方面仍有大量机会,仅靠优化训练数据就能带来不少提升。
不过我认同“通过数据缩放的收益正在递减”这一观点。我预计性能提升会越来越小,我们大概率正走向平台期。但这并非坏事,因为它会催生其他方向的进步。
我认为未来性能提升的一个重要来源是后训练。正如我去年夏天在这篇文章中所写的:https://magazine.sebastianraschka.com/p/new-llm-pre-training-and-post-training,近期发布的LLM已经让我们见识到了后训练领域的进展。
我对2025年的期待
今年我非常享受动手复现与实现各类Llama模型(3、3.1、3.2)的过程。我非常期待Llama 4的发布,希望它也能推出小巧便捷的版本,让我可以在笔记本电脑或者性价比高的云GPU上做实验。
此外,今年我想更多地尝试专用模型微调,而不是做通用聊天机器人(这个赛道已经相当拥挤了)。我们已经看到了各类代码和数学专用模型的涌现,比如最近的Qwen 2.5 Coder和Qwen 2.5 Math,很遗憾这次报告没来得及介绍它们。
总之,我的愿望清单和计划还有很多,2025年又将是精彩且瞬息万变的一年!可以肯定的是,这一年绝不会无聊。
这本杂志是我的个人热爱项目。想要支持我的朋友,可以考虑购买我的书:https://amzn.to/4fqvn0D。(我相信你会从书中收获良多,因为它对LLM工作原理的讲解深度是别处找不到的。)

《从零构建大语言模型》现已上架:https://amzn.to/4fqvn0D
如果你已经读了这本书,并且能抽出几分钟时间,我会非常感谢你留下评价:https://www.amazon.com/Build-Large-Language-Model-Scratch/dp/1633437167。这对我们作者帮助很大!
你的支持意义重大!谢谢!