最新开源大语言模型表现如何?DPO 是否优于 PPO?
2024年4月最新模型发布与AI研究综述
2024年4月真是精彩纷呈的一个月!恰逢我的生日,我的新书《机器学习与人工智能:核心问题》(https://www.amazon.com/Machine-Learning-AI-Essential-Questions/dp/171850376)也正式推出,春天终于到来,同时还有四款重磅开源大语言模型(LLM)集中发布:Mixtral、Meta AI的Llama 3、微软的Phi-3,以及苹果的OpenELM。
本文将对过去几周发布的四款基于Transformer架构的主流大语言模型逐一进行评述,随后探讨基于人类反馈强化学习(RLHF)的指令微调最新研究,重点对比PPO与DPO两种算法。
- Mixtral、Llama 3与Phi-3表现几何?
- OpenELM:搭载开源训练与推理框架的高效语言模型家族
- 大语言模型对齐中DPO是否优于PPO?一项全面研究
- 4月其他值得关注的研究论文
1. Mixtral、Llama 3与Phi-3:有哪些新进展?
首先从本月最受瞩目的话题——几款重磅大语言模型的发布说起。本节将简要介绍Mixtral、Llama 3和Phi-3,这几款模型均配套有简短的博客文章或技术报告。下一节将更详细地介绍苹果的OpenELM,好在该模型同步发布了研究论文,披露了大量值得关注的技术细节。
1.1 Mixtral 8x22B:更大的模型,更优的表现
https://mistral.ai/news/mixtral-8x22b/ 是Mistral AI推出的最新混合专家(Mixture-of-Experts, MoE)模型,采用宽松的Apache 2.0开源许可证发布。
与2024年1月发布的Mixtral 8x7B类似,该模型的核心设计是将Transformer架构中的每个前馈模块替换为8个专家层。本文篇幅较长,因此不再展开讲解MoE的原理;如果您感兴趣,可以参考我几个月前发布的文章中关于Mixtral 8x7B的章节,其中有更详细的说明:
https://magazine.sebastianraschka.com/p/research-papers-in-january-2024
https://mistral.ai/news/mixtral-8x22b/ 中最值得关注的一张图,从两个维度对比了Mixtral 8x22B与多款大语言模型:一是在主流基准测试https://arxiv.org/abs/2009.03300(MMLU)上的建模表现,二是激活参数量(与计算资源需求相关)。

Mixtral 8x22B与其他大语言模型对比。(标注图基于https://mistral.ai/news/mixtral-8x22b/中的图表制作)
1.2 Llama 3:更大规模的数据,更优的效果
2023年2月发布的https://arxiv.org/abs/2302.13971 是开源可获取大语言模型的重大突破,也是开源大语言模型发展的关键节点。因此,去年推出的https://arxiv.org/abs/2307.09288 自然也备受期待。如今,由https://ai.meta.com/blog/meta-llama-3/ 正式发布的Llama 3系列模型,同样令人振奋。
尽管Meta仍在训练其最大规模的几款模型(例如4000亿参数版本),但本次已发布了大家熟知的80亿(8B)和700亿(70B)参数规格的模型,且表现十分出色。下文我将官方https://ai.meta.com/blog/meta-llama-3/ 公布的MMLU分数,补充到之前分享的Mixtral对比图中。

Llama 3、Mixtral与其他大语言模型对比。(标注图基于https://mistral.ai/news/mixtral-8x22b/中的图表制作)
整体而言,Llama 3的架构与Llama 2几乎完全一致,主要区别在于词表规模有所扩大,且小尺寸版本的Llama 3采用了分组查询注意力(Grouped-Query Attention)。如果您想了解分组查询注意力的原理,我曾在此处写过相关讲解:
https://magazine.sebastianraschka.com/p/ahead-of-ai-11-new-foundation-models
以下是在LitGPT中实现Llama 2与Llama 3的配置文件,可以直观体现二者的主要差异。

通过LitGPT对比Llama 2与Llama 3的配置,来源:https://github.com/Lightning-AI/litgpt
训练数据规模
Llama 3的性能相比Llama 2大幅提升,最主要的原因是训练数据集规模大得多。Llama 3的训练语料达到15万亿token,而Llama 2“仅为”2万亿token。
这一发现非常值得关注:正如https://ai.meta.com/blog/meta-llama-3/ 中提到的,根据Chinchilla缩放法则,80亿参数模型的最优训练数据量要小得多,约为2000亿token。此外,Llama 3的研究团队观察到,无论是80亿还是700亿参数的模型,在训练到15万亿token规模时,性能仍保持对数线性提升。这意味着,继续使用超过15万亿token的训练数据,模型性能还能进一步提升。
指令微调与对齐
在指令微调和模型对齐阶段,研究人员通常会二选一:要么采用基于近端策略优化(PPO)的人类反馈强化学习(RLHF),要么采用无需奖励模型的直接偏好优化(DPO)。有意思的是,Llama 3的研究团队并没有厚此薄彼,而是两种方法都使用了(后文会详细对比PPO和DPO)。
https://ai.meta.com/blog/meta-llama-3/ 中提到,Llama 3的研究论文将在次月发布,我很期待论文中能披露更多技术细节。
1.3 Phi-3:更高质量的数据,更优的表现
就在Llama 3发布仅一周后,微软推出了全新的Phi-3大语言模型。根据https://arxiv.org/abs/2404.14219 中的基准测试结果,即便尺寸最小的Phi-3模型,参数量不到Llama 3 8B的一半,性能却超越了后者。

Phi-3、Llama 3、Mixtral与其他大语言模型对比。(标注图基于https://mistral.ai/news/mixtral-8x22b/中的图表制作)
值得注意的是,基于Llama架构的Phi-3,训练token数仅为Llama 3的1/5(3.3万亿对比15万亿)。Phi-3甚至沿用了Llama 2的分词器,词表大小为32064,远小于Llama 3的词表规模。
此外,Phi-3-mini“仅有”38亿参数,规模还不到Llama 3 8B的一半。
那么,它的制胜秘诀是什么?根据技术报告,答案在于数据质量优先于数量:“经过严格过滤的网页数据与合成数据”。
论文没有过多阐述数据筛选的细节,但整体沿用了前代Phi模型的数据处理方案。几个月前我曾在此处写过关于Phi模型的更多介绍:
https://magazine.sebastianraschka.com/p/ahead-of-ai-12-llm-businesses
https://magazine.sebastianraschka.com/p/ahead-of-ai-12-llm-businesses
https://magazine.sebastianraschka.com/p/ahead-of-ai-12-llm-businesses
https://magazine.sebastianraschka.com/p/ahead-of-ai-12-llm-businesses
https://magazine.sebastianraschka.com/p/ahead-of-ai-12-llm-businesses https://substack.com/profile/27393275-sebastian-raschka-phd
·
2023年10月8日
https://magazine.sebastianraschka.com/p/ahead-of-ai-12-llm-businesses
截至本文撰写时,业界仍不确定Phi-3是否真如宣传般出色。例如,我交流过的许多人都提到,在非基准测试任务上,Phi-3的表现远不如Llama 3。
1.4 小结
从上述三款重磅发布来看,本月对开源大语言模型而言可谓成果丰硕。而我还没提到我最欣赏的模型——OpenELM,我们将在下一节展开讨论。
实际应用中该选哪款模型?我认为这三款模型各有优势,适配不同场景。Mixtral的激活参数量比Llama 3 70B更少,同时仍保持了相当不错的性能水平。Phi-3 3.8B对移动端设备极具吸引力,据研究团队称,其量化版本可以在iPhone 14上运行。而Llama 3 8B可能是微调场景下最具性价比的多面手,因为使用LoRA技术时,单张GPU就能轻松完成微调。
《Ahead of AI》是读者支持的独立出版物。如果想接收新文章并支持我的创作,欢迎订阅免费或付费会员。
2. OpenELM:搭载开源训练与推理框架的高效语言模型家族
https://arxiv.org/abs/2404.14619 是苹果研究人员发布的最新大语言模型系列及配套论文,旨在打造可部署在移动设备上的小型大语言模型。
与https://magazine.sebastianraschka.com/p/research-papers-in-february-2024?utm_source=profile&utm_medium=reader2 类似,能看到一篇公开架构、训练方法和训练数据细节的大语言模型论文,让人耳目一新。

OpenELM与其他同时公开数据集、代码和权重的开源大语言模型对比(同等开放程度的模型并不多见)。标注表格来自OpenELM论文https://arxiv.org/abs/2404.14619。
先来看最值得关注的几个亮点:
- OpenELM提供4种相对小巧实用的参数规格:2.7亿(270M)、4.5亿(450M)、11亿(1.1B)和30亿(3B)
- 每个规格均有对应的指令微调版本,采用https://arxiv.org/abs/2309.06657 与https://magazine.sebastianraschka.com/i/142924793/rlhf-vs-direct-preference-optimization-dpo 中介绍的方法训练
- 尽管训练token数仅为OLMo的一半,OpenELM的表现略优于OLMo
- 核心架构改进为逐层缩放策略
2.1 架构细节
除了逐层缩放策略(后文详述),模型的整体架构设置和超参数配置与OLMo、Llama等其他大语言模型较为相近,如下图所示。

OpenELM、最小规格OLMo模型与最小规格Llama 2模型的架构与超参数对比。标注表格来自OpenELM论文https://arxiv.org/abs/2404.14619。
2.2 训练数据集
公开数据细节和解释清楚背后的逻辑是两回事——这也是我学生时代研究论文的核心追求。例如,研究团队从多个公开数据集中采样了规模相对较小的1.8万亿token子集(数据集包括https://arxiv.org/abs/2306.01116、https://github.com/togethercomputer/RedPajama-Data、https://arxiv.org/abs/2101.00027 和https://arxiv.org/abs/2402.00159)。该子集的规模仅为训练OLMo所用的Dolma数据集的一半。但这样子采样的依据是什么?采样标准又是什么?
其中一位作者友好地回复了我的疑问:“关于数据集:我们采样没有特别的依据,只是想使用约2万亿token规模的公开数据集(参考Llama 2的设定)。”

OpenELM训练使用的token数与数据集原始token数对比(注:具体token数取决于所使用的分词器)。标注表格来自OpenELM论文https://arxiv.org/abs/2404.14619。
2.3 逐层缩放
逐层缩放策略(借鉴自https://arxiv.org/abs/2008.00623 论文)非常有创意。本质上,研究人员从Transformer的浅层到深层逐步加宽层的维度。具体来说,在保持每个注意力头尺寸不变的前提下,增加注意力模块的头数;同时对前馈模块的隐藏层维度进行缩放,如下图所示。

大语言模型架构图,基于我的著作《从零构建大语言模型》(https://www.manning.com/books/build-a-large-language-model-from-scratch)制作。
我本希望能看到在同一数据集下,分别训练采用和不采用逐层缩放策略的大语言模型的消融实验。但这类实验成本很高,我理解为什么论文没有做。
不过,我们可以参考https://arxiv.org/abs/2008.00623 论文中的消融实验——该论文首次提出逐层缩放,是在更小的数据集上基于原始的编码器-解码器架构完成的,如下图所示。

标准Transformer块与采用逐层(逐块)缩放的Transformer块对比,来自DeLighT论文https://arxiv.org/abs/2008.00623。
2.4 LoRA与DoRA对比
一个意外的惊喜是,研究人员还对比了LoRA和DoRA(https://magazine.sebastianraschka.com/p/lora-and-dora-from-scratch)两种参数高效微调方法的效果!不过结果显示,两种方法之间没有显著差异。

两种参数高效微调方法LoRA与DoRA的建模性能对比。标注表格来自OpenELM论文https://arxiv.org/abs/2404.14619。
2.5 小结
尽管这篇论文没有解决新的研究问题,但它对大语言模型的实现细节做了清晰透明的梳理,质量很高。逐层缩放策略未来可能会越来越多地出现在大语言模型设计中。此外,论文只是本次发布的一部分,苹果还同步开源了相关代码:https://github.com/apple/corenet/tree/main/mlx_examples/open_elm。
总而言之,这是一项出色的工作,向研究人员(以及苹果)的开源分享精神致敬!
3. 大语言模型对齐中DPO是否优于PPO?一项全面研究
https://arxiv.org/abs/2404.10719 终于解答了我近几个月一直关注的核心问题之一。
在深入分析结果之前,先做一个简要概述:PPO(近端策略优化)和DPO(直接偏好优化)都是通过人类反馈强化学习(RLHF)实现大语言模型对齐的主流方法。
RLHF是大语言模型开发的关键环节,用于让模型输出符合人类偏好,例如提升生成回答的安全性和有用性。

典型的大语言模型训练生命周期
更详细的原理讲解与对比,可以参考我上个月发布的文章中“语言模型的奖励建模评估”章节:https://magazine.sebastianraschka.com/p/tips-for-llm-pretraining-and-evaluating-rms
3.1 什么是RLHF-PPO和DPO?
RLHF-PPO是最早的大语言模型对齐方法,也是OpenAI的https://arxiv.org/abs/2203.02155 以及ChatGPT中部署的大语言模型的核心技术。然而近几个月,局面发生了变化:经过DPO微调的大语言模型异军突起,在公开排行榜上表现亮眼。DPO之所以快速流行,得益于它无需奖励模型的特性,使用门槛显著降低:与PPO不同,DPO不需要单独训练一个奖励模型,而是通过类似分类的目标函数直接更新大语言模型。

摘自https://magazine.sebastianraschka.com/p/tips-for-llm-pretraining-and-evaluating-rms
如今,公开排行榜上名列前茅的大语言模型大多采用DPO而非PPO训练。但遗憾的是,在这篇新论文发表之前,一直没有研究在同一模型、同一数据集的条件下,对PPO和DPO进行直接的横向对比。
3.2 整体而言PPO优于DPO
https://arxiv.org/abs/2404.10719 是一篇质量很高的论文,包含大量实验与结果,核心结论是:整体上PPO的效果优于DPO,且DPO在分布外数据上的性能衰减更严重。
这里的“分布外数据”指的是,大语言模型之前用于有监督微调的指令数据,与DPO所用的偏好数据不属于同一分布。例如,模型先在通用的Alpaca数据集上完成指令微调,再在另一个带有偏好标签的数据集上做DPO微调。(改善DPO分布外表现的方法之一,是在DPO微调之前,先在偏好数据集上增加一轮有监督指令微调。)
主要研究结论总结如下图所示。

标注表格来自《大语言模型对齐中DPO是否优于PPO?一项全面研究》(https://arxiv.org/abs/2404.10719)论文。
除了上述核心结论,论文还包含多项补充实验和消融研究,如果您对该话题感兴趣,推荐深入阅读。
3.3 最佳实践
此外,论文还总结了使用DPO和PPO的最佳实践建议,这些结论同样值得关注。
例如,如果使用DPO,务必先在偏好数据集上进行有监督微调。此外,迭代DPO(利用现有奖励模型标注更多数据再进行训练)的效果优于仅在现有偏好数据上做DPO。
如果使用PPO,成功的关键因素是大批次训练、优势函数归一化,以及通过指数移动平均更新参数。

偏好数据集示例(样例取自https://huggingface.co/datasets/Intel/orca_dpo_pairs)
3.4 小结
根据论文结果,如果使用得当,PPO的效果优于DPO。但考虑到DPO使用和实现更简单,我预计它仍会是非常受欢迎的主流方法。
一个实用的建议是:如果你有真实的奖励标签(无需自己预训练奖励模型),或者能下载到同领域的奖励模型,就使用PPO;否则,为了简便优先选择DPO。
此外,从Llama 3的博客文章来看,我们不必在PPO和DPO之间二选一,两者可以结合使用!例如,Llama 3的训练流程就是:预训练 → 有监督微调 → 拒绝采样 → PPO → DPO。(希望Llama 3的开发团队能尽快发布论文,披露更多细节!)
深入理解大语言模型
深入理解大语言模型的最佳方式之一,就是从零开始手写实现一个!
如果您想深入学习大语言模型,我的著作《从零构建大语言模型》(https://www.manning.com/books/build-a-large-language-model-from-scratch)会完整覆盖、实现并讲解大语言模型的全生命周期。该书将于2024年夏季正式出版,目前正处于预售优惠阶段。
讲解预训练的第5章已于两周前发布。如果您感兴趣,也可以在GitHub上提前查看代码:https://github.com/rasbt/LLMs-from-scratch/blob/main/ch05/01_main-chapter-code/ch05.ipynb

https://www.manning.com/books/build-a-large-language-model-from-scratch
4. 4月其他值得关注的研究论文
以下是本月我发现的其他值得关注的论文。即便和成果丰硕的前几个月相比,4月的大语言模型研究也堪称精彩纷呈。
- KAN:柯尔莫哥洛夫-阿诺德网络,Liu、Wang、Vaidya等人(4月30日),https://arxiv.org/abs/2404.19756
柯尔莫哥洛夫-阿诺德网络(KAN)用边上可学习的样条函数替代线性权重参数,且没有固定的激活函数。它在准确率、模型缩放性和可解释性上均优于多层感知机,是颇具潜力的替代方案。 - 何时检索:教大语言模型高效利用信息检索,Labruna、Ander Campos、Azkune(4月30日),https://arxiv.org/abs/2404.19705
本文提出了一种定制化训练方法,通过特殊token<RET>教会大语言模型:当不知道答案时,是调用自身的参数记忆,还是使用外部信息检索系统。 - 基于Transformer的语言模型内部工作原理入门,Ferrando、Sarti、Bisazza、Costa-jussa(4月30日),https://arxiv.org/abs/2405.00208
这份入门指南对基于Transformer的解码器-only语言模型的相关技术做了精炼的技术综述。 - RAG与RAU:自然语言处理中检索增强语言模型综述,Hu、Lu(4月30日),https://arxiv.org/abs/2404.19543
该综述全面梳理了检索增强大语言模型的研究进展,详细介绍了其组成模块、架构、应用场景与评估方法。 - 通过多token预测打造更优更快的大语言模型,Gloeckle、Idrissi、Rozière等人(4月30日),https://arxiv.org/abs/2404.19737
研究表明,训练大语言模型同时预测多个未来token而非仅下一个token,不仅能提升采样效率,还能改善生成类任务的性能。 - LoRA Land:310个媲美GPT-4的微调大语言模型技术报告,Zhao、Wang、Abid等人(4月28日),https://arxiv.org/abs/2405.00732
LoRA是应用最广泛的参数高效微调技术之一。本研究发现,4位LoRA微调后的模型性能显著超越基座模型,甚至优于GPT-4。 - 让你的大语言模型充分利用上下文,An、Ma、Lin等人(4月25日),https://arxiv.org/abs/2404.16811
该研究提出了FILM-7B模型,采用信息密集型训练方法解决“中间丢失”难题——即大语言模型难以提取上下文窗口中间位置信息的问题。 - 层跳过:实现早停推理与自推测解码,Elhoushi、Shrivastava、Liskovich等人(4月25日),https://arxiv.org/abs/2404.16710
LayerSkip通过训练时的层丢弃与早停损失、推理时的自推测解码,能够加速大语言模型的推理过程。 - 检索头从机制上解释长上下文事实性,Wu、Wang、Xiao等人(4月24日),https://arxiv.org/abs/2404.15574
本文探究了具备长上下文能力的Transformer模型如何利用注意力机制中的特定“检索头”高效提取信息,揭示了这类头具有通用性、稀疏性、内在性、动态激活的特点,且对需要参考上下文或推理的任务至关重要。 - 大语言模型时代的图机器学习,Fan、Wang、Huang等人(4月23日),https://arxiv.org/abs/2404.14928
这篇综述介绍了图神经网络与大语言模型如何日益深度融合,以提升图机器学习与推理能力。 - NExT:教大语言模型对代码执行进行推理,Ni、Allamanis、Cohan等人(4月23日),https://arxiv.org/abs/2404.14662
NExT是一种提升大语言模型理解与修复代码能力的方法,核心是教会模型分析程序执行过程。 - 多头混合专家,Wu、Huang、Wang、Wei(4月23日),https://arxiv.org/abs/2404.15045
提出的多头混合专家(MH-MoE)模型,通过引入多头机制将token拆分为子token,由不同专家并行处理,解决了稀疏混合专家模型中专家激活率低、难以处理多个语义概念的问题。 - 大语言模型自我进化综述,Tao、Lin、Chen等人(4月22日),https://arxiv.org/abs/2404.14662
该工作全面梳理了大语言模型自我进化的相关方法,提出了大语言模型自我进化的概念框架,并指出了当前挑战与未来提升方向。 - OpenELM:搭载开源训练与推理框架的高效语言模型家族,Mehta、Sekhavat、Cao等人(4月22日),https://arxiv.org/abs/2404.14619
苹果研究人员推出的OpenELM是对标OLMo(我之前介绍过的模型家族)的大语言模型系列,包含完整的训练与评估框架、训练日志、模型检查点、配置文件以及其他可复现研究的相关产物。 - Phi-3技术报告:可在手机本地运行的高性能语言模型,Abdin、Jacobs、Awan等人(4月22日),https://arxiv.org/abs/2404.14219
Phi-3-mini是拥有38亿参数的大语言模型,训练语料为3.3万亿token。基准测试显示,其性能可匹敌Mixtral 8x7B、GPT-3.5等更大规模的模型。 - 低比特量化的LLaMA3模型表现如何?一项实证研究,Huang、Ma、Qin(4月22日),https://arxiv.org/abs/2404.14047
该实证研究发现,Meta的LLaMA3模型在超低位宽量化下会出现显著的性能下降。 - 指令层级:训练大语言模型优先处理特权指令,Wallace、Xiao、Leike等人(4月19日),https://arxiv.org/abs/2404.13208
该研究为大语言模型引入了指令层级机制,使其优先处理可信提示,在不牺牲标准能力的前提下,提升了模型对抗攻击的鲁棒性。 - OpenBezoar:在混合指令数据上训练的小型、低成本开源模型,Dissanayake、Lowe、Gunasekara、Ratnayake(4月18日),https://arxiv.org/abs/2404.12195
该研究利用Falcon-40B生成的合成数据,结合RLHF、DPO等技术对OpenLLaMA 3Bv2模型进行微调,通过系统性的数据筛选与微调,在更小的模型规模下实现了顶尖的大语言模型任务表现。 - 通过想象、检索与批判实现大语言模型自我提升,Tian、Peng、Song等人(4月18日),https://arxiv.org/abs/2404.12253
尽管大语言模型在各类任务上表现亮眼,但在复杂推理与规划上仍有不足。本文提出的AlphaLLM整合了蒙特卡洛树搜索,构建了自我提升循环,无需额外数据标注即可提升模型的推理任务表现。 - 当大语言模型不适用时,试试FastFit:面向多类别场景的快速高效文本分类,Yehudai、Bendel(4月18日),https://arxiv.org/abs/2404.12365
FastFit是一个全新的Python工具包,通过整合批次对比学习与token级相似度评分,快速精准地处理语言任务中的少样本多分类问题。实验显示,其训练速度提升3-20倍,性能优于SetFit、HF Transformers等其他方法。 - 大语言模型检索增强文本生成综述,Huang、Huang(4月17日),https://arxiv.org/abs/2404.10981
这篇综述文章探讨了检索增强生成(RAG)如何结合检索技术与深度学习,通过动态融入最新信息提升大语言模型性能;文章对RAG流程进行了分类,梳理了最新研究进展,并提出了未来的研究方向。 - RAG模型的忠实度如何?量化RAG与大语言模型内部先验的博弈,Wu、Wu、Zou(4月16日),https://arxiv.org/abs/2404.10198
提供正确的检索信息通常能修正GPT-4等大语言模型的错误,但错误的检索信息也会被模型反复复述,除非模型自身具备足够强的内部知识来反驳。 - CLIP缩放降级:数据、架构与训练策略的全面分析,Li、Xie、Cubuk(4月16日),https://arxiv.org/abs/2404.08197
本文探究了对比语言-图像预训练(CLIP)的降级缩放方案,以适配有限的计算预算。研究表明,高质量的小型数据集往往优于规模更大但质量更低的数据集,且小型Vision Transformer(ViT)模型是这类数据集的最优选择。 - 大语言模型对齐中DPO是否优于PPO?一项全面研究,Xu、Fu、Gao等人(4月16日),https://arxiv.org/abs/2404.10719
该研究探究了直接偏好优化(DPO)与近端策略优化(PPO)在人类反馈强化学习(RLHF)中的效果,发现只要应用得当,PPO在所有场景下都能超越其他替代方法。 - 为真正优质的对齐学习你的参考模型,Gorbatovski、Shaposhnikov、Malakhov等人(4月15日),https://arxiv.org/abs/2404.09656
研究指出,全新的对齐方法——信任域直接偏好优化(TR-DPO)通过在训练中更新参考策略,在多个指标上提升了模型质量,在特定数据集上最高可带来19%的性能提升,效果优于现有技术。 - Chinchilla缩放法则:一次复现尝试,Besiroglu、Erdil、Barnett、You(4月15日),https://arxiv.org/abs/2404.10102
作者尝试复现Hoffmann等人提出的计算最优缩放法则估算方法,发现与其他方法的原始估算结果相比,存在不一致性与不合理的结果。 - 新一代Transformer替代方案:状态空间模型综述,Wang、Wang、Ding等人(4月15日),https://arxiv.org/abs/2404.09516
本文对状态空间模型(SSM)作为Transformer架构的高效替代方案进行了全面综述与实验分析,详细介绍了SSM的原理、在各领域的应用,并通过统计对比展示了其优势与未来研究方向。 - 大语言模型的上下文回忆依赖于提示,Machlab、Battle(4月13日),https://arxiv.org/abs/2404.08865
该研究通过在文本块中嵌入事实信息,评估不同条件下大语言模型提取该信息的能力,以此测试模型的上下文回忆能力。研究发现,模型表现同时受提示内容与训练数据中潜在偏差的影响。 - 面向RLHF的数据集重置策略优化,Chang、Zhan、Oertell等人(4月12日),https://arxiv.org/abs/2404.08495
该工作提出了数据集重置策略优化(DR-PO),这是一种全新的基于人类偏好反馈的强化学习(RLHF)算法,通过将离线偏好数据集直接融入在线策略训练,提升了训练效果。 - 用更少token预训练小型基座语言模型,Sanyal、Sanghavi、Dimakis(4月12日),https://arxiv.org/abs/2404.08634
该研究提出了“Inheritune”方法:从更大的模型中继承部分Transformer块,仅用大模型极少比例的数据进行训练,以此构建小型基座语言模型。实验表明,尽管训练数据与资源大幅减少,这些小型模型的表现仍与大模型相当。 - Rho-1:并非所有token都必不可少,Lin、Gou、Gong等人(4月11日),https://arxiv.org/abs/2404.07965
Rho-1是一种全新的语言模型,它选择性地在损失较高的token上训练,而非采用传统的下一个token预测方法。 - 大语言模型合成数据的最佳实践与经验总结,Liu、Wei、Liu等人(4月11日),https://arxiv.org/abs/2404.07503
本文围绕大语言模型场景下的合成数据研究进行了综述。 - JetMoE:仅需10万美元达到Llama2性能,Shen、Guo、Cai、Qin(4月11日),https://arxiv.org/abs/2404.07413
JetMoE-8B是拥有80亿参数的稀疏门控混合专家模型,训练语料1.25万亿token,成本不到10万美元。它每个输入token仅激活20亿参数,仅用3万GPU训练小时,性能就超越了Llama2-7B等成本更高的模型。 - LLoCO:离线学习长上下文,Tan、Li、Patil等人(4月11日),https://arxiv.org/abs/2404.07979
LLoCO方法结合了上下文压缩、检索与基于LoRA的参数高效微调,可有效将LLaMA2-7B模型的上下文窗口扩展至12.8万token。 - 不遗漏任何上下文:基于无限注意力的高效无限上下文Transformer,Munkhdalai、Faruqui、Gopal(4月10日),https://arxiv.org/abs/2404.07143
该研究提出了一种方法,在单个Transformer块内结合多种注意力策略,让基于Transformer的大语言模型能高效处理无限长的输入,适配需要海量上下文的任务。 - 将LLaMA解码器适配为视觉Transformer,Wang、Shao、Chen等人(4月10日),https://arxiv.org/abs/2404.06773
该研究通过后序列类别token、软掩码策略等技术修改标准视觉Transformer(ViT),将Llama这类解码器-only的Transformer大语言模型适配到计算机视觉领域。 - LLM2Vec:大语言模型是隐藏的强大文本编码器,BehnamGhader、Adlakha、Mosbach等人(4月9日),https://arxiv.org/abs/2404.05961
该研究提出了一种简单的无监督方法,可将GPT、Llama这类解码器风格的大语言模型转化为强大的文本编码器,步骤包括:1)禁用因果注意力掩码;2)掩码下一个token预测;3)无监督对比学习。 - 大象永不忘记:大语言模型对表格数据的记忆与学习,Bordt、Nori、Rodrigues等人(4月9日),https://arxiv.org/abs/2404.06209
该研究揭示了大语言模型中数据污染与记忆化的关键问题:模型往往会记住流行的表格数据集,在训练中见过的数据集上表现更好,进而导致过拟合。 - MiniCPM:通过可扩展训练策略释放小语言模型的潜力,Hu、Tu、Han等人(4月9日),https://arxiv.org/abs/2404.06395
该研究推出了全新的高效能“小型”语言模型,参数量在12亿-24亿区间,并提出了热身-稳定-衰减(WSD)学习率调度器等技术,适用于持续预训练与领域适配。 - CodecLM:用定制合成数据对齐语言模型,Wang、Li、Perot等人(4月8日),https://arxiv.org/abs/2404.05875
CodecLM提出了一套基于编解码原理的框架,以大语言模型为编解码器,自适应生成高质量合成数据,让大语言模型对齐不同的指令分布,提升其遵循复杂多样指令的能力。 - Eagle与Finch:具备矩阵值状态与动态循环的RWKV,Peng、Goldstein、Anthony等人(4月8日),https://arxiv.org/abs/2404.05892
Eagle与Finch是基于RWKV架构的全新序列模型,引入了多头矩阵状态、动态循环等特性。 - AutoCodeRover:自动化程序改进,Zhang、Ruan、Fan、Roychoudhury(4月8日),https://arxiv.org/abs/2404.05427
AutoCodeRover是一种自动化方案,利用大语言模型与高级代码搜索技术,通过修改软件程序解决GitHub上的问题。 - Sigma:面向多模态语义分割的孪生Mamba网络,Wan、Wang、Yong等人(4月5日),https://arxiv.org/abs/2404.04256
Sigma是一种采用孪生Mamba(状态空间模型结构)网络的多模态语义分割方法,它将热成像、深度等模态与RGB信息融合,为基于CNN和视觉Transformer的方案提供了替代选择。 - 设计即可验证:让语言模型学会引用预训练数据原文,Zhang、Marone、Li等人(2024年4月5日),https://arxiv.org/abs/2404.03862
Quote-Tuning通过训练模型更多地引用可靠来源的原文,提升大语言模型的可信度与准确率。相比标准模型,其原文引用量提升了55%至130%。 - ReFT:语言模型的表示微调,Wu、Arora、Wang等人(4月5日),https://arxiv.org/abs/2404.03592
本文提出了表示微调(ReFT)方法,与参数高效微调(PEFT)类似,它仅修改模型的隐藏表示而非全部参数,就能高效适配大模型。 - CantTalkAboutThis:对齐语言模型以在对话中保持话题聚焦,Sreedhar、Rebedea、Ghosh、Parisien(4月4日),https://arxiv.org/abs/2404.03820
本文推出了CantTalkAboutThis数据集,旨在帮助大语言模型在任务导向对话中紧扣主题。数据集包含跨领域的合成对话,其中穿插了干扰轮次,用以挑战并训练模型抵御话题偏离。 - 在神经压缩文本上训练大语言模型,Lester、Lee、Alemi等人(4月4日),https://arxiv.org/abs/2404.03626
本文提出了一种方法,使用“等信息窗口”技术(将文本分割为比特长度相等的块),在经过小型语言模型压缩的文本上训练大语言模型。 - 直接纳什优化:教语言模型通过通用偏好自我提升,Andriushchenko、Croce、Flammarion(4月4日),https://arxiv.org/abs/2404.02151
本文提出了直接纳什优化(DNO),这是一种大语言模型训练后方法,它利用来自先知的偏好反馈迭代提升模型性能,可作为其他人类反馈强化学习(RLHF)方法的替代方案。 - 交叉注意力让文本到图像扩散模型的推理变得繁琐,Zhang、Liu、Xie等人(4月3日),https://arxiv.org/abs/2404.02747
该研究探究了文本条件扩散模型中交叉注意力在推理阶段的作用,发现它会在特定节点后趋于稳定;而在该收敛点之后绕过文本输入,能简化推理过程且不损失输出质量。 - BAdam:面向大语言模型的内存高效全参数训练方法,Luo、Hengzu、Li(4月3日),https://arxiv.org/abs/2404.02827
BAdam是一种内存高效的优化器,提升了大语言模型微调的效率,同时易于使用,仅新增一个超参数。 - 基于扩散的文本到图像生成的可扩展性研究,Li、Zou、Wang等人(4月3日),https://arxiv.org/abs/2404.02883
该研究通过分析去噪主干网络与训练集缩放的影响,实证探究了基于扩散的文本到图像模型的缩放特性,揭示了交叉注意力与Transformer块的效率对性能有显著影响,并提出了在更低成本下提升图文对齐效果与学习效率的策略。 - 用简单自适应攻击破解主流安全对齐大语言模型,Andriushchenko、Croce、Flammarion(4月2日),https://arxiv.org/abs/2404.02151
研究表明,即便是最新的安全对齐大语言模型,也能通过自适应技术轻松破解。通过对抗性提示、利用API漏洞、限制token搜索空间等方法,在各类模型上实现了近100%的攻击成功率。 - 缩减规模生成式语言模型中的涌现能力,Muckatira、Deshpande、Lialin、Rumshisky(4月2日),https://arxiv.org/abs/2404.02204
研究发现,如果对预训练数据集进行降维和简化,即便“非常小”的大语言模型(100万到1.65亿参数)也能展现出涌现能力。 - 长上下文大语言模型在长上下文学习中表现不佳,Li、Zheng、Do等人(4月2日),https://arxiv.org/abs/2404.02060
全新基准测试LongICLBench聚焦长上下文学习与极端标签分类任务,结果显示:大语言模型在2万token以内表现良好,但更长序列下性能会下降(GPT-4是个例外),凸显了模型处理海量富上下文信息的能力短板。 - 深度混合:在基于Transformer的语言模型中动态分配计算资源,Raposo、Ritter、Richard等人(4月2日),https://arxiv.org/abs/2404.02258
该研究提出了一种方法,让基于Transformer的语言模型能在输入序列的不同位置动态分配计算资源(FLOPs),通过在每一层选择特定token进行处理,优化性能与效率。 - Diffusion-RWKV:将类RWKV架构扩展到扩散模型,Fei、Fan、Yu等人(4月6日),https://arxiv.org/abs/2404.04478
本文将NLP领域的RWKV架构进行适配,引入到图像生成任务的扩散模型中,提出了Diffusion-RWKV。 - 细微边界:通过下游能力分析导航大语言模型预训练,Yang、Li、Niu等人(4月1日),https://arxiv.org/abs/2404.01204
该研究识别出了可预测大语言模型最终性能的早期指标,有助于在预训练过程中分析模型并优化预训练方案。 - 更大并不总意味着更好:潜扩散模型的缩放特性,Mei、Tu、Delbracio等人(4月1日),https://arxiv.org/abs/2404.01367
该研究探究了潜扩散模型的尺寸如何影响不同采样步数与任务下的采样效率,揭示了一个反直觉的趋势:在给定推理预算下,更小的模型往往能生成质量更高的结果。 - 语言模型会为未来token提前规划吗?,Wu、Morris、Levine(4月1日),https://arxiv.org/abs/2404.00859
该论文通过实证发现,Transformer在推理过程中会通过“预缓存”和“面包屑”机制预判未来信息。
机器学习问答与AI
如果您正在寻找一本聚焦机器学习与人工智能中高级话题的书籍,或许会喜欢我的新书《机器学习与人工智能:核心问题》(https://www.amazon.com/Machine-Learning-AI-Essential-Questions/dp/1718503768)。纸质版已于两周前正式发售!

https://www.amazon.com/Machine-Learning-AI-Essential-Questions/dp/1718503768
《Ahead of AI》是个人兴趣驱动的创作项目,没有直接的商业收入,非常感谢您的支持。
如果您购买了这本书,也非常欢迎在亚马逊上留下评论!