模型合并、混合专家,以及迈向更小的大语言模型
2023年,大语言模型(Large Language Models,LLM)的潜力与复杂度都在飞速增长。纵观2024年的开源进展与研究成果,我们似乎正进入一个可喜的阶段:无需扩大模型规模,就能让模型变得更优、也更小巧。
在本月的文章中,我将重点介绍四篇符合这一主题的最新论文:
- 权重平均与模型合并让我们得以将多个大语言模型整合为单个更优的模型,且不会带来传统集成方法的典型弊端,比如资源需求上升。
- 代理调优(Proxy-tuning)利用两个小型大语言模型提升现有大型大语言模型的性能,且无需修改大模型的权重。
- 通过组合多个更小的模块构建混合专家模型,得到的大语言模型在效率与效果上足以比肩、甚至往往超越更大的同类模型。
- 预训练一个参数量仅11亿的小型大语言模型,既能降低开发与运行成本,也为教育和研究应用开辟了新路径。
1. WARM:论权重平均奖励模型的优势
在这篇论文中(https://arxiv.org/abs/2401.12187),研究人员提出了一种针对大语言模型奖励模型的权重平均方法。(“奖励模型”指的是用于基于人类反馈的强化学习(RLHF)对齐阶段的模型,相关内容见https://magazine.sebastianraschka.com/p/llm-training-rlhf-and-its-alternatives)
什么是权重平均?既然权重平均与模型合并似乎是2024年最受关注的方向,在深入讲解WARM论文之前,我想先简要介绍这个主题。
理解模型合并与权重平均
模型合并与权重平均虽然并非新技术,但目前已是最主流的方法,主导着开源大语言模型排行榜。我们来简要讨论这两个概念。(未来我可能会写一篇更详细的文章。)
权重平均和模型合并都涉及将多个模型或检查点整合为单个实体。它们的优势是什么?与构建模型集成的思路类似,这种将多个模型合二为一的方法可以提升训练收敛性、改善整体性能并增强鲁棒性。值得强调的是,与传统集成方法不同,模型合并与权重平均最终得到的是单个模型,而非维护多个独立的模型,如下图所示。

权重平均与模型合并(左)和多数投票等传统集成方法(右)的对比。
传统上,权重平均指的是对单个模型在训练过程中不同节点的权重(参数)取平均值。通常在训练末期、模型接近收敛时进行。该技术的一种常见形式是随机权重平均(https://arxiv.org/abs/1803.05407):我们先从一个较大的学习率开始衰减,在学习率衰减(但仍相对较高)的阶段内,对多个迭代步的权重取平均。

随机权重平均(SWA)在训练周期末期对模型权重取平均。
由于模型的训练轨迹可能并不平稳,该策略会在训练末期、学习率较低时(如果使用了学习率调度器)对模型取平均,如上图所示,此时训练已接近收敛。
另一种方法是指数移动平均(https://openreview.net/pdf?id=2M9CUnYnBA),通过对更早的模型状态赋予指数递减的权重,计算得到平滑版的权重。
2022年,有研究(https://arxiv.org/abs/2209.14981)证明,对每个epoch末期保存的最近k个检查点的权重取平均,可以在损失值和准确率上加快数个epoch的训练进度。这一效果在ResNet视觉模型和RoBERTa语言模型上都得到了验证。
随后在2023年,论文《Early Weight Averaging meets High Learning Rates for LLM Pre-training》(https://arxiv.org/abs/2306.03241)探索了一种改进版的LaWA方法:采用更高的学习率,且在训练过程中更早开始对检查点取平均。研究人员发现,该方法的表现显著优于标准SWA和EMA技术。

改进版LaWA方法,出自论文《Early Weight Averaging meets High Learning Rates for LLM Pre-training》(https://arxiv.org/abs/2306.03241)。
权重平均是将同一模型的多个检查点合并为单个模型,而模型合并则是将多个不同的训练后模型整合为一个模型。这些模型可能是独立训练的,训练数据集或任务也可能各不相同。
模型合并的由来已久,但对大语言模型领域而言,最新且最具影响力的论文或许是《Model Ratatouille》(https://arxiv.org/abs/2212.10445)(感谢Alexandre Ramé让我注意到这篇论文)。
Model Ratatouille的核心思路是:将同一个基础模型在各类不同辅助任务上的多个微调版本复用起来,如下图所示。

通过Model Ratatouille进行模型合并,与其他微调策略的对比。(OOD = 分布外/泛化);图片标注来自https://arxiv.org/abs/2212.10445
更详细地说,Model Ratatouille方法的流程可以总结为下图。

用于模型合并的Model Ratatouille方法;图片标注来自https://arxiv.org/abs/2212.10445
需要注意的是,这种整体合并思路也可以应用于LoRA适配器,如论文https://arxiv.org/abs/2307.13269所示。
我计划未来写更多关于模型合并的内容。与此同时,我非常推荐Hugging Face的模型合辑(https://huggingface.co/collections/osanseviero/model-merging-65097893623330a3a51ead66 ),以及NathanLambert在Interconnects上关于模型合并的文章(https://www.interconnects.ai/p/model-merging)。
权重平均奖励模型
讨论完权重平均与模型合并的概念,我们再回到上周1月22日发布的新论文https://arxiv.org/abs/2401.12187。
这项研究主要旨在优化大语言模型的RLHF对齐阶段(RLHF是ChatGPT和Llama 2 Chat背后的方法,关于该流程的更多细节,请参考我的文章https://magazine.sebastianraschka.com/p/llm-training-rlhf-and-its-alternatives)。具体而言,研究人员尝试通过对微调后的奖励模型权重取平均,来缓解大语言模型中的奖励黑客问题。
奖励黑客指的是大语言模型学会操纵或利用奖励系统的漏洞来获取高分或奖励,而并未真正完成预期任务或达成核心目标。

权重平均让奖励建模对奖励黑客更具鲁棒性(图片标注来自WARM论文:https://arxiv.org/abs/2401.12187)
为了解决奖励黑客问题,研究人员提出通过权重平均合并大语言模型奖励模型。通过该流程得到的合并奖励模型,相比单个奖励模型的胜率达到79.4%。
WARM是如何工作的?该方法相当直接:与随机权重平均类似,WARM对多个模型(这里是奖励模型)的权重取平均,如下图所示。

WARM在RLHF流程中的使用框架。这里唯一的新点是,该方法使用权重平均得到的奖励模型,而非训练单个奖励模型(图片标注来自WARM论文:https://arxiv.org/abs/2401.12187)。
我们之前讨论了几种权重平均方法。WARM具体是如何对权重取平均得到奖励模型的?在这里,他们使用了与随机权重平均类似的简单线性平均。但不同之处在于,这些模型并非来自同一条训练轨迹,而是像Model ratatouille那样,从预训练模型开始独立创建的。此外,WARM还有一种名为Baklava的流程,可以沿着微调轨迹进行采样。两种方法的对比如下图所示。

不同模型合并与平均方法的对比。感谢Alexandre Rame提供了这张来自Model ratatouille论文的调整版本。
按照上述WARM流程,对10个奖励模型取平均后,研究人员发现,采用WARM的RL策略相比使用单个奖励模型的策略,胜率达到79.4%,如下图所示。

在第3000步时,WARM的表现优于单个最优奖励模型(图片标注来自WARM论文:https://arxiv.org/abs/2401.12187)。
结论
模型合并并非新技术,但在大语言模型语境下,它似乎尤其有前景——因为大语言模型的训练成本极高、资源消耗极大。因此,这种能利用训练过程中产生的多个现有大语言模型(无需额外工作)的方法格外有吸引力。此外,与需要同时运行多个模型的传统集成方法不同,权重平均得到的模型相对轻量,推理阶段的成本不会超过单个模型。
展望未来,我认为大语言模型的模型合并领域前景广阔。特别是,我预计未来还会出现更多有创意的模型合并方式。
2. 通过代理调优大语言模型
论文https://arxiv.org/abs/2401.08565提出了一种名为**代理调优(proxy-tuning)**的大语言模型优化技术,前景广阔。该方法可以(在一定程度上)微调大语言模型,且无需修改其权重。
代理调优在解码阶段通过调整目标大语言模型的logits来工作,流程非常直接。具体来说,它先计算小型基础模型与微调模型之间的logits差值,再将这个差值加到目标模型的logits上。(Logits是模型最终层输出的原始分值,在通过softmax等函数转换为概率之前,这些logits代表大语言模型词表中每个可能输出token的未归一化得分。)

代理调优示意图,标注改自https://arxiv.org/abs/2401.08565
为了更清晰地说明这个概念,假设我们的目标是优化一个大型目标模型M1(比如Llama 2 70B)。该流程会用到两个更小的模型:
- 小型基础模型(M2),比如Llama 2 7B
- 基础模型的微调版本(M3),比如Llama 2 7B Chat
优化的实现方式是:将这两个小型模型的预测差值(logits)应用到目标模型M1上。优化后的目标模型M1的输出logits计算公式为:M1(x) = M1(x) + [M3(x) – M2(x)]。得到输出logits后,通过softmax函数将其转换为概率,再利用这些概率采样得到最终输出,也就是生成的文本,采样方法可参考https://arxiv.org/abs/1904.09751或https://peterchng.com/blog/2023/05/02/token-selection-strategies-top-k-top-p-and-temperature。
代理调优在实际中效果如何?
实验结果非常乐观。研究人员在三种不同场景下应用了该方法:
- 指令调优:优化70B规模的Llama 2 Base模型,使其达到Llama 2 70B Chat模型的性能。
- 领域适配:提升70B规模的Llama 2 Base模型在代码任务上的表现,目标是达到CodeLlama 70B的性能水平。
- 特定任务微调:针对问答(TriviaQA)或数学题等专门任务,优化70B规模的Llama 2 Base模型。
在每种场景下,相比原始基础模型都观察到了显著提升。下表为了简洁起见,重点对比了Llama 70B Base和Chat模型,但论文中还提供了CodeLlama的更多基准测试结果。

修改并标注后的图片,来自代理调优论文https://arxiv.org/abs/2401.08565
可以看到,基于上图中的基准测试结果,经过代理调优的70B Llama 2模型表现远优于70B基础模型,几乎和直接微调的Llama 70B Chat模型一样好。
实际考量
使用该方法的场景或动机可能是提升研发效率:先在更小的模型上开发新的训练或模型优化方法并测试,以降低成本;之后再将这些方法放大,用于优化更大的基础模型,而无需重新训练大模型。
不过,在实际场景中落地该方法仍然需要用到三个不同的模型:
- 大型通用基础模型;
- 小型通用模型;
- 多个针对特定用例或客户需求定制的小型专用模型。
那么,为什么要选择这种方法,而不用LoRA(https://arxiv.org/abs/2106.09685)呢?LoRA不需要上述的小型通用模型(2),还可以用一组小型LoRA矩阵替代多个小型专用模型(3)。
代理调优方法有两个潜在优势:
a) 在某些场景下它的表现可能优于LoRA,尽管目前还没有直接的对比研究。
b) 当大型基础模型(1)是“黑盒”、无法获取其内部权重时,该方法非常有用。
但有一个前提:小型模型必须与更大的目标模型共享同一个词表。(理论上,如果有人知道GPT-4的词表,并且能获取其logit输出,就可以用这种方法创建专用的GPT-4模型。)
3. 混合专家Mixtral
论文https://arxiv.org/abs/2401.04088终于发布了!Mixtral 8x7B是一个稀疏混合专家(sparse MoE)模型,目前是表现最好、也最受关注的开源大语言模型之一。其代码库https://github.com/mistralai/mistral-src基于Apache 2许可证发布,据论文称,学术和商业用途均可免费使用。
什么是MoE?MoE即混合专家(Mixture of Experts),是一种集成模型,由多个更小的“专家”子网络组合而成。每个子网络负责处理不同类型的任务,或者更具体地说,处理不同的token。通过使用多个更小的子网络而非一个大型网络,MoE旨在更高效地分配计算资源,从而实现更有效的规模化,并有潜力在更广泛的任务上取得更好的性能。(也可参考我之前文章中关于混合专家的简介:https://magazine.sebastianraschka.com/i/139848187/mixture-of-experts)
在下面要讨论的论文https://arxiv.org/abs/2401.04088中,作者介绍了Mixtral 8x7B的构建过程。该模型的表现远超规模大得多的Llama 2 70B模型。

Mixtral of Experts论文(https://arxiv.org/abs/2401.04088)中的标注图,显示Mixtral 8x7B在多项基准测试上持平甚至超越更大的Llama 2 70B模型
Mixtral架构
Mixtral 8x7B的核心思路是:将Transformer架构中的每个前馈模块替换为8个专家层,如下图所示。

Transformer架构标注图,出自《Attention Is All You Need》https://arxiv.org/abs/1706.03762
前馈模块本质上就是一个多层感知机。用类似PyTorch的伪代码表示的话,它大致是这样的:
class FeedForward(torch.nn.Module):
def __init__(self, embed_dim, coef):
super().__init__()
self.layers = nn.Sequential(
torch.nn.Linear(embed_dim, coef*embed_dim),
torch.nn.ReLU(),
torch.nn.Linear(coef*n_embed, embed_dim),
torch.nn.Dropout(dropout)
)
def forward(self, x):
return self.layers(x)
此外,还有一个路由模块(也称为门控网络),负责将每个token嵌入分配到8个专家前馈模块中。这8个专家前馈层的输出随后会被求和,如下图所示。

Mixtral of Experts论文中解释MoE模块的标注图,https://arxiv.org/abs/2401.04088
从数学上看,对于8个专家{E1, E2, …, E8},上图的结构可以表示为:
其中,G代表路由器(或门控网络),Ei是专家模块的输出。基于上式,MoE层计算专家输出Ei的加权和,权重由门控网络G(x)针对输入x给出。
乍一看,Mixtral似乎只是通过这些专家(前馈)模块为大语言模型增加了更多参数,形成一种加权集成的思路。但它还有一个额外的设计:Mixtral是稀疏MoE,也就是说,每个输入只会激活一部分专家:
在Mixtral 8x7B的具体实现中,作者指定TopK=2,意味着每次只会用到2个专家。因此,基于上式,G(x)的输出可能是这样的:[0, 0, 0.63, 0, 0, 0.37, 0, 0]。这表示第三个专家贡献了63%的输出,第六个专家贡献了37%。
模型规模
Mixtral 8x7B的名字从何而来?这个稀疏MoE模型的实际规模又是多少?“8x”指的是使用了8个专家子网络,“7B”表示它组合了Mistral 7B模块。但需要注意的是,Mixtral的规模并不是8×7B = 56B。70亿参数是整个Mistral 7B模型的参数量,但在Mixtral 8x7B中,只有前馈层被替换成了专家层。
Mixtral 8x7B总共有47B参数。我们可以通过以下公式推导,其中FF代表前馈层,NonFF代表非前馈层(比如注意力权重):
- NonFF + 8×FF = 47B(MoE Mixtral模型)
- NonFF + FF = 7B(常规Mistral模型)
解这两个方程可以得到:7B的Mistral模型中,前馈层有40/7 ≈ 57.1亿参数,注意力层有7B – 5.71B = 12.9亿参数。有趣的是,大语言模型中的大部分参数都集中在前馈模块中,而非注意力机制中。对于Mixtral 8x7B来说尤其如此:它的专家(前馈)层参数达到8×5.71B = 456.8亿。
Mixtral 8x7B总参数量为47B,远小于比如Llama 2 70B这样的模型。此外,由于每个时间步只有2个专家处于激活状态,模型处理每个输入token时仅用到13B参数,比常规的非MoE 47B参数模型高效得多。

Mixtral of Experts论文中的标注图,https://arxiv.org/abs/2401.04088
专家专业化
一个有意思的问题是:这些专家是否会表现出特定任务或特定token的模式?遗憾的是,作者并未观察到按主题的专业化分工(这里的“主题”指GitHub、Arxiv、数学、维基百科等数据集)。
但作者发现了一个有趣的现象:文本数据集中的连续token往往会被分配给相同的专家。此外,Python代码中的缩进token也经常被分配给同一个专家,如下图所示。

Mixtral of Experts论文中的标注图,https://arxiv.org/abs/2401.04088
(作者没有说明每个token对应的两个专家中哪个被标了色,但我推测他们始终标记权重更高的那个专家。)
结论
Mixtral 8x7B有几大优势:它完全开源,表现持平或超越Llama 2 70B等更大的模型,并且以一种相对新颖(尽管并非全新)的方式采用稀疏MoE模块构建大语言模型。
它出色的性能,加上参数高效性以及最高支持32k上下文窗口的能力,很可能让它在未来一段时间内(至少在接下来的几个月里)都是极具吸引力的模型。我相信,混合专家模型也将成为2024年大多数开源项目的核心方向之一,Mixtral of Experts值得持续关注。
如果说有一点小瑕疵的话,就是作者没有分享任何关于训练数据集的信息。(这可能是为了避免版权争议,可以理解。)
此外,尽管这样的研究成本会非常高,但如果能看到Mixtral 8x70B与在相同数据集上训练的Llama 2 70B模型对比会很有意思。我还希望未来能看到Mixtral 8x70B与以下两个假设模型的对比,从而更直接地比较MoE和非MoE方法的性能:
- Mistral 56B(一个更大的非MoE模型)
- Mistral 47B(参数量与Mixtral 8x70B相同的非MoE模型)
(趣闻:Brave浏览器的Leo助手功能已将Mixtral 8x7B作为默认大语言模型,见https://brave.com/leo-mixtral/)
4. TinyLlama:一款开源的小型语言模型
继微软的Phi-2在去年12月引发热议之后(https://www.microsoft.com/en-us/research/blog/phi-2-the-surprising-power-of-small-language-models/),论文https://arxiv.org/abs/2401.02385为“小型”大语言模型家族再添新成员。TinyLlama不仅体型小巧——仅11亿参数——而且完全开源。这里的“开源”指的是训练代码和模型检查点都通过无限制的开源库提供。你可以在这里找到GitHub仓库:https://github.com/jzhang38/TinyLlama。
小型大语言模型(也称为SLM,即Small Language Models)为什么如此有吸引力?小型大语言模型具备以下特点:
- 易获取、成本低:意味着它们可以在资源有限的环境中(比如笔记本电脑和/或小型GPU)运行(推理模式)。
- 开发与预训练成本更低:这类模型只需要相对较少的GPU。
- 更易针对目标任务定制:小型模型通常仅用单个GPU就能完成微调。
- 能效更高:考虑到训练和运行大规模AI模型的环境影响,这一点至关重要;或者,想想在智能手机等便携设备上部署大语言模型时的续航问题。
- 具有教育价值:它们更易于掌控,因此更容易理解和调试。
TinyLlama的性能
除了小巧与开源之外,与其他同规模的开源模型相比,TinyLlama在常识推理和问题解决基准测试上的表现也相当不错。

来源:《TinyLlama: An Open-Source Small Language Model》,https://arxiv.org/abs/2401.02385
当然,TinyLlama在这些基准测试上还无法与大得多的模型抗衡,但由于所有代码都是开源的,它为后续的研究和微调提供了丰富的可能性。
TinyLlama带来的启发
比如,从作者的训练实验中,一个有意思的教育性结论是:在1万亿token上训练模型3个epoch(而非1个epoch)实际上是有益的(尽管根据Chinchilla缩放定律,这可能并非最优,相关见https://arxiv.org/abs/2203.15556)。

来源:《Training Compute-Optimal Large Language Models》,https://arxiv.org/abs/2203.15556
比如,如下图所示,即使数据被重复使用,通过多epoch训练,模型的性能仍在持续提升。

TinyLlama论文(https://arxiv.org/abs/2401.02385)中的标注图;论文中还有其他6个基准测试的类似图表
研究“超大规模”数据集上的行为,或者将训练运行超过1个epoch,对于更大的模型来说绝非易事。无论如何,我很期待看到未来在TinyLlama上的微调实验会带来怎样的成果。(不过,有推文指出,它目前的表现还落后于体积是它3倍的小型模型Phi-2,见https://x.com/abacaj/status/174408661353529713?s=20)
一月份其他值得关注的研究论文
以下是我本月发现的其他一些有意思的论文。由于列表较长,我用星号(*)标出了我认为尤其值得关注的论文。
-
*KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization,作者Hooper、Kim、Mohammadzadeh、Mahoney等人(1月31日),https://arxiv.org/abs/2401.18079
研究人员提出了一种键值缓存激活量化方法,在困惑度下降极小的情况下,实现了在单张A100(80GB)GPU上运行Llama-7B这类模型时,上下文长度可达100万。 -
*Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling,作者Maini、Seto、Bai、Grangier等人(1月29日),https://arxiv.org/abs/2401.16380
作者提出使用改写后的网页文档来更高效地训练大语言模型,实现了更快的预训练、在各类任务上更优的性能,并揭示了训练数据构成如何影响分布外表现。 -
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models,作者Lin、Tang、Ye、Cui等人(1月29日),https://arxiv.org/abs/2401.15947
本文提出一种混合专家范式来规模化大视觉语言模型,以更少的参数达到了与更大模型相当的性能。 -
EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty,作者Li、Wei、C. Zhang、H. Zhang(1月26日),https://arxiv.org/abs/2401.15077
EAGLE通过在次级特征层面进行处理并融入未来token,加快了大语言模型的自回归解码速度。 -
Multimodal Pathway: Improve Transformers with Irrelevant Data from Other Modalities,作者Zhang、Ding、Gong、Ge、Yue(1月25日),https://arxiv.org/abs/2401.14405
本文提出了多模态通路(Multimodal Pathway)技术,利用来自其他模态(比如音频)的未配对数据来提升特定模态(比如图像)的视觉Transformer,在各类图像识别任务中实现了显著的性能提升。 -
Pix2gestalt: Amodal Segmentation by Synthesizing Wholes,作者Ozguroglu、Liu、Surís、Chen等人(1月25日),https://arxiv.org/abs/2401.14398
Pix2gestalt是一个零样本模态分割框架,利用扩散模型和人工筛选的合成数据集,估计被部分遮挡物体的形状和外观。 -
Rethinking Patch Dependence for Masked Autoencoders,作者Fu、Lian、Wang、Shi等人(1月25日),https://arxiv.org/abs/2401.14391
交叉注意力掩码自编码器是一种新型预训练框架,仅使用掩码token与可见token之间的交叉注意力来进行掩码块重建,相比传统掩码自编码器,在效率和质量上都有提升。 -
SpacTor-T5: Pre-training T5 Models with Span Corruption and Replaced Token Detection,作者Ye、Jiang、Rostamizadeh、Chakrabarti等人(1月24日),https://arxiv.org/abs/2401.13160
本文提出SPACTOR,一种大语言模型训练方法,将跨度破坏¹和token替换检测²结合在两阶段课程中,在预训练迭代次数减少50%、计算成本降低40%的情况下,达到了与标准方法相同的性能。¹ 与BERT中掩码单个token不同,T5会将输入文本中的连续token跨度随机替换为单个掩码token。
² 在替换检测中,输入文本中的部分token(单词或子词)会被替换为其他token,模型的任务是识别哪些token被替换了。 -
MambaByte: Token-free Selective State Space Model,作者Wang、Gangavarapu、Yan、Rush(1月24日),https://arxiv.org/abs/2401.13660
MambaByte是一种无token的语言Mamba选择性状态空间模型,直接基于原始字节运行,避免了子词分词带来的偏差。 -
Spotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated Text,作者Hans、Schwarzschild、Cherepanova、Kazemi等人(1月22日),https://arxiv.org/abs/2401.12070
Binoculars是一种全新的、(更)准确的机器生成文本检测方法,无需训练数据,通过对比两个预训练大语言模型的简单计算即可实现。 -
*WARM: On the Benefits of Weight Averaged Reward Models,作者Ramé、Vieillard、Hussenot、Dadashi等人(1月22日),https://arxiv.org/abs/2401.12187
该研究通过对微调后的奖励模型权重取平均,解决了经人类偏好强化学习对齐的大语言模型中的奖励崩溃问题。 -
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities,作者Chen、Xu、Kirmani、Ichter等人(1月22日),https://arxiv.org/abs/2401.12168
该研究通过构建互联网规模的空间推理数据集并在其上训练视觉语言模型(VLM),提升了这类模型的3D空间推理能力。 -
*Knowledge Fusion of Large Language Models,作者Wan、Huang、Cai、Quan等人(1月19日),https://arxiv.org/abs/2401.10491
研究人员提出一种知识融合方法,将多个不同的大语言模型合并为一个统一模型,其表现优于单个模型、传统集成方法以及其他模型合并方法。 -
VMamba: Visual State Space Model,作者Liu、Tian、Zhao、Yu等人(1月18日),https://arxiv.org/abs/2401.10166
该研究将视觉Transformer的全局感受野与动态权重,和CNN的线性复杂度相结合,提出了名为VMamba的新架构,在更高图像分辨率下表现尤为出色。 -
* Self-Rewarding Language Models,作者Yuan、Pang、Cho、Sukhbaatar等人(1月18日),https://arxiv.org/abs/2401.10020
研究人员在训练中采用“大语言模型即法官”的方法进行自我奖励,成功提升了大语言模型遵循指令和建模奖励的能力,这意味着模型有望在基于人类偏好的常规训练之外实现持续自我提升。 -
DiffusionGPT: LLM-Driven Text-to-Image Generation System,作者Qin、Wu、Chen、Ren等人(1月18日),https://arxiv.org/abs/2401.10061
DiffusionGPT是一个文本生成图像框架,利用大语言模型解析多样化的提示词,并从思维树结构中选择最合适的生成模型,同时还融入了人类反馈。 -
ReFT: Reasoning with Reinforced Fine-Tuning,作者Luong、Zhang、Jie、Sun等人(1月17日),https://arxiv.org/abs/2401.08967
本文提出强化微调(Reinforced FineTuning,ReFT)技术,通过将监督微调与强化学习相结合,提升大语言模型在数学解题等任务中的推理能力,在无需额外训练数据的情况下,效果优于标准微调。 -
RAG vs Fine-tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture,作者Balaguer、Benara、de Freitas Cunha、Estevão Filho等人(1月16日),https://arxiv.org/abs/2401.08406
尽管通常存在“检索增强生成(RAG)vs 微调”的争论,但本文证明,将RAG与微调结合可以带来累积的准确率提升(在农业应用场景下)。 -
Code Generation with AlphaCodium: From Prompt Engineering to Flow Engineering,作者Ridnik、Kredo、Friedman(1月16日),https://arxiv.org/abs/2401.08500
AlphaCodium是一种迭代式、基于测试的大语言模型代码生成方法,以更小的计算预算超越了此前的方法。 -
* Scalable Pre-training of Large Autoregressive Image Models,作者El-Nouby、Klein、Zhai、Bautista等人(1月16日),https://arxiv.org/abs/2401.08541
受大语言模型预训练启发,本文以自回归方式(无监督)预训练视觉模型,证明了其性能随模型规模和数据量增长而提升,并在ImageNet-1k上取得了显著成果,且未出现饱和。 -
* Tuning Language Models by Proxy,作者Liu、Han、Wang等人(1月16日),https://arxiv.org/abs/2401.08565
代理调优是一种资源高效的大语言模型适配方法,通过更小的微调模型来修改大模型的预测,即使是专有模型也能达到与直接微调接近的性能。 -
An Experimental Design Framework for Label-Efficient Supervised Finetuning of Large Language Models,作者Bhatt、Chen、Das等人(1月12日),https://arxiv.org/abs/2401.06692
研究人员将实验设计技术用于大语言模型的监督微调,通过选择信息量最大的样本进行标注来最大化效率,相比随机采样,标注成本降低了50%。 -
A Closer Look at AUROC and AUPRC under Class Imbalance,作者McDermott、Hansen、Zhang等人(1月11日),https://arxiv.org/abs/2401.06091
本文对机器学习中一个广为接受的观点提出了挑战:在类别不平衡的二分类任务中,精确率-召回率曲线下面积(AUPRC)优于受试者工作特征曲线下面积(AUROC)。 -
* The Unreasonable Effectiveness of Easy Training Data for Hard Tasks,作者Hase、Bansal、Clark、Wiegreffe,https://arxiv.org/abs/2401.06751
作者发现,模型通常能从简单数据很好地泛化到困难数据,并提出训练时使用更简单的数据效率更高——通过在各类问答数据集上对最高700亿参数的模型进行实验,验证了这一结论。 -
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training,作者Hubinger、Denison、Mu等人(1月10日),https://arxiv.org/abs/2401.05566
该研究探究了大语言模型学习欺骗性行为的可能性,比如当提示词表明年份是2023时编写安全代码,而当年份是2024时插入可利用代码;研究发现,标准的安全训练技术无法清除这些顽固的欺骗性策略。 -
Transformers are Multi-State RNNs,作者Oren、Hassid、Adi、Schwartz(1月11日),https://arxiv.org/abs/2401.06104
该研究表明,原本被认为与循环神经网络(RNN)截然不同的仅解码器Transformer,可以被理解为隐藏状态大小无限的多状态RNN。 -
RoSA: Accurate Parameter-Efficient Fine-Tuning via Robust Adaptation,作者Nikdan、Tabesh、Alistarh(1月9日),https://arxiv.org/abs/2401.04679
该研究提出了鲁棒适配(Robust Adaptation,RoSA),一种新型的大语言模型参数高效微调方法,通过在固定预训练权重上训练低秩和高稀疏组件,表现优于LoRA等现有方法。 -
A Minimaximalist Approach to Reinforcement Learning from Human Feedback,作者Swamy、Dann、Kidambi等人(1月8日),https://arxiv.org/abs/2401.04056
本文提出自博弈偏好优化(Self-Play Preference Optimization,SPO),一种简单高效的强化学习算法,作为基于人类反馈的强化学习(RLHF)的替代方案,且无需奖励模型。 -
MoE-Mamba: Efficient Selective State Space Models with Mixture of Experts,作者Pioro、Ciebiera、Krol等人(1月8日),https://arxiv.org/abs/2401.04081
本文提出将Mamba这类状态空间模型与混合专家(MoE)相结合,得到MoE-Mamba模型,在效率和效果上都优于标准Mamba结构的状态空间模型和Transformer-MoE基线。 -
* Mixtral of Experts,作者Jiang、Sablayrolles、Roux等人(1月8日),https://arxiv.org/abs/2401.04088
Mixtral 8x7B是一个稀疏混合专家模型,对Mistral 7B进行修改,每层设置8个专家,最终得到47B参数的模型,在多项基准测试中持平或超越Llama 2 70B等更大的模型。 -
Soaring from 4K to 400K: Extending LLM’s Context with Activation Beacon,作者Zhang、Liu、Xiao、Shao等人(2024年1月7日),https://arxiv.org/abs/2401.03462
研究人员提出通过所谓的“激活信标”来扩展大语言模型的上下文窗口——激活信标是激活状态的压缩形式,被添加到输入上下文中。 -
* Denoising Vision Transformers,作者Yang、Luo、Li等人(1月5日),https://arxiv.org/abs/2401.02957
作者发现,视觉Transformer(ViT)中常见的网格状伪影源于输入阶段的位置嵌入,并提出了一种去噪视觉Transformer,可以提取现有ViT的干净特征。 -
DeepSeek LLM: Scaling Open-Source Language Models with Longtermism,作者Bi、Chen、Chen等人(1月5日),https://arxiv.org/abs/2401.02954
DeepSeek LLM采用7B和67B两种配置,在2万亿token的数据集上训练,完善了Chinchilla缩放定律,性能超越LLaMA-2 70B和GPT-3.5等模型。 -
Blending Is All You Need: Cheaper, Better Alternative to Trillion-Parameters LLM,作者Lu、Liusie、Raina等人(1月4日),https://arxiv.org/abs/2401.02994
本文提出“融合(Blending)”方法,从多个小型聊天AI模型中随机选择响应,证明中等规模模型(6B/13B参数)的组合可以达到甚至超越ChatGPT(175B+参数)等更大模型的性能。 -
LLM Augmented LLMs: Expanding Capabilities through Composition,作者Bansal、Samanta、Dalmia等人(1月4日),https://arxiv.org/abs/2401.02412
CALM(Composition to Augment Language Models,大语言模型增强组合)利用交叉注意力将基础大语言模型与专用大语言模型结合,以极少的额外参数和数据,在新任务(比如低资源语言翻译和代码生成)上实现提升。 -
LLaMA Pro: Progressive LLaMA with Block Expansion,作者Wu、Gan、Ge等人(1月4日),https://arxiv.org/abs/2401.02415
本文提出一种大语言模型后预训练方法(将Llama 7B升级为Llama Pro-8.3B),通过扩展Transformer块来提升编程和数学等领域的能力,且不会遗忘之前的知识。 -
A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity,作者Lee、Bai、Pres等人(1月3日),https://arxiv.org/abs/2401.01967
该研究探究了直接偏好优化(DPO)算法如何通过降低毒性将GPT2-medium等预训练模型对齐到用户偏好,揭示了它是绕过而非移除预训练能力,并且还展示了一种让模型恢复到原始有毒行为的方法。 -
LLaMA Beyond English: An Empirical Study on Language Capability Transfer,作者Zhao、Zhang、Gao等人(1月2日),https://arxiv.org/abs/2401.01055
本文研究如何将Llama等大语言模型的能力迁移到非英语语言——仅用不到1%的预训练数据,就能达到与当前最优模型相当的性能。 -
* Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models,作者Chen、Deng、Yuan等人(1月2日),https://arxiv.org/abs/2401.01335
本文提出自博弈微调(Self-Play fIne-tuNing,SPIN)方法,无需额外的人类标注数据,通过自博弈机制让大语言模型生成并优化自己的训练数据,从而提升模型能力。 -
LLM Maybe LongLM: Self-Extend LLM Context Window Without Tuning,作者Jin、Han、Yang等人(1月2日),https://arxiv.org/abs/2401.01325
本文提出了一种仅需4行代码的简单技术,无需任何微调就能扩展大语言模型的上下文处理能力。 -
A Comprehensive Study of Knowledge Editing for Large Language Models(1月2日),作者Zhang、Yao、Tian等人,https://arxiv.org/abs/2401.01286
本文讨论了如何通过各类知识编辑技术(诉诸外部知识、将知识融入模型、编辑内在知识)让大语言模型保持时效性,同时还提出了全新的KnowEdit基准测试。 -
Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models(1月1日),作者Terry Zhuo、Zebaze、Suppattarachai等人,https://arxiv.org/abs/2401.00788
本文评估了不同的全参数和参数高效微调技术,发现全参数微调通常能带来最佳性能,而LoRA通常在成本与性能之间实现了最优平衡。
从零构建大语言模型
从零开始创建大语言模型,是深入理解其内部运作原理的绝佳方式。在我的图书项目《从零构建大语言模型》(https://github.com/rasbt/LLMs-from-scratch)中,我编写并详细讲解了整个流程:从设计大语言模型架构,到实现预训练、微调和对齐阶段。

更多信息请访问GitHub仓库:https://github.com/rasbt/LLMs-from-scratch
这本杂志是我的个人兴趣项目,不提供直接报酬。不过,如果您愿意支持我,可以考虑购买我的书(https://sebastianraschka.com/books)。如果您觉得这些内容有洞见、有帮助,也欢迎推荐给您的朋友和同事。

https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/ 、https://nostarch.com/machine-learning-and-ai-beyond-basics 以及 http://mng.bz/M96o
您的支持对我意义重大!非常感谢!