大语言模型研究洞察:指令掩码与新型LoRA微调实验
讨论2024年5月最新模型发布与AI研究
本月我将介绍三篇与大语言模型(LLM)的指令微调、以及基于LoRA的参数高效微调相关的新论文。我日常工作中经常用到这些方法,因此看到能带来实践洞见的新研究总是令人兴奋。
这篇文章可能会比往常稍短一些,因为我目前正在完成我的著作《http://mng.bz/orYv》的最后一章。此外,我还在准备本周三的一场线上讲座:https://events.zoom.us/ev/ArzwACAJCGWLB-pPrWeIwszDr8WDhlEcFLL4VMCb1SJVU4fzrQo9~AvhUziSVIoulf4yLm7f0hhyew2qRK0ZEIE6Xztz4yEDudekpMeEd9L_UXVY_6lWFFOTqXHlF-N_xKaCrP5aP07ZzFQ。讲座免费向所有人开放,如果感兴趣的话非常欢迎你参加!

1. 对指令计算损失的指令微调
本月吸引我注意的一篇论文是:https://arxiv.org/abs/2405.14394
在这篇论文中,作者们对指令微调中一个被广泛认可的做法提出了质疑:计算损失时对指令部分进行掩码。在讨论研究结果之前,我们先来做一个整体概述。
1.1 指令微调过程中的指令掩码
指令微调(简称指令调优)的任务是提升预训练大语言模型遵循指令的响应能力(比如“总结这篇文章”“翻译这个句子”等)。

指令微调数据集示例示意图
在对大语言模型进行指令微调时,计算损失时通常会将指令本身掩码掉。例如,我们的https://github.com/Lightning-AI/litgpt库默认就是这么做的,我在自己的著作《https://github.com/rasbt/LLMs-from-scratch》的第7章中也采用了这种做法(不过我现在正考虑把掩码相关内容改成读者练习题)。
在其他主流大语言模型库中,比如https://github.com/OpenAccess-AI-Collective/axolotl,该功能也会通过config.yaml中默认的`train_on_inputs: false设置自动实现。而在Hugging Face中,默认不会这么做,但可以通过DataCollatorForCompletionOnlyLM`数据集整理器来实现,详情参见:https://huggingface.co/docs/trl/en/sft_trainer#train-on-completions-only

输入掩码示意图:高亮的文本仍会输入给大语言模型,但在训练计算损失时不参与计算。
如上所述,对输入提示进行掩码是一项常规操作,有些论文中也会对比使用和不使用掩码的效果。例如QLoRA论文的附录中就包含了一组对比,结果显示掩码的效果更好。

《QLoRA:量化大语言模型的高效微调》中的带标注表格,原文:https://arxiv.org/abs/2305.14314
需要注意的是,MMLU是一个专注于测评选择题表现的基准测试,作者们并没有研究当微调后的模型用作聊天机器人时,该做法对对话性能的影响。
1.2 指令建模
在上一节对主题做了简要介绍之后,我们来详细分析https://arxiv.org/abs/2405.14394这篇论文。在这项研究中,作者系统地探究了指令掩码与非掩码两种情况下大语言模型的性能差异。

三种方式示意图:(1) 无指令掩码;(2) 指令掩码;(3) 样板文本掩码。
上图中的方法1是实现大语言模型时的默认做法,因为它不需要对损失函数做任何额外的修改。论文中作者将这种方法称为“指令建模”(论文中还额外对非Alpaca提示模板中可能出现的特殊提示词元,比如<|user|>、<|assistant|>和<|system|>进行了掩码)。
方法2是目前实践中最常用的方式:计算损失时,除了响应部分之外的所有内容都被掩码。论文中作者将这种方法称为“指令微调”(在这个语境下这个命名有点不妥,因为和方法1相比,我们并不是在“微调”指令,而是将指令排除在损失计算之外)。
在绘制上图的时候,我想到了论文中没有探讨的第三种有趣的思路:对提示中特定的样板文本进行掩码。例如在Alpaca风格的提示中,所有示例都以“以下是一条指令……”开头。和实际的指令与输入相比,这段文本是固定的,因此可以排除在损失计算之外。论文中没有研究这一点,但这可能是一个有趣的补充实验,我正计划把它作为另一道读者练习题(附答案)加入到我的《https://github.com/rasbt/LLMs-from-scratch》中。
结果表明,指令建模(即不对指令进行掩码)的效果似乎优于掩码方法,如下图所示。

不对指令掩码的效果优于对指令掩码。改绘自《对指令计算损失的指令微调》,原文:https://arxiv.org/abs/2405.14394
不过,“指令建模”的效果取决于两个因素:(a) 指令长度与响应长度的比值;(b) 数据集的大小(以训练样本数量计)。

不掩码指令的收益取决于数据集的长度与规模。改绘自《对指令计算损失的指令微调》,原文:https://arxiv.org/abs/2405.14394
对于上图呈现的数据集长度和规模依赖性,一个合理的解释是:如果响应很短且训练样本很少,模型会更容易记住响应,因此采用指令建模(也就是在损失中对更多模型输出进行建模)有助于减少过拟合。
1.3 结论
简而言之,作者们发现,回归最基础的做法——不对指令进行掩码——能够提升模型性能。
令人意外的是,不对指令掩码(仅对<|user|>、<|assistant|>和<|system|>这类特殊提示词元进行掩码)这种更简单的方法,效果反而更好。
以我个人的经验来看,过去我尝试过两种方法,但并没有看到明显的优劣之分,所以通常不会在掩码上做太多实验,效果不好的时候更多会去调整其他设置。现在回头看,多尝试一下(非)掩码方法或许是有意义的,因为它的效果似乎取决于数据集的大小和长度。
Ahead of AI是一份由读者支持的刊物。想要接收新文章并支持我的创作,欢迎成为免费或付费订阅者。
2. LoRA学得更少,忘得也更少
https://arxiv.org/abs/2405.09673是一项针对大语言模型低秩适配(LoRA)微调的综合实证研究,在编程和数学两个目标领域对比了LoRA与全量微调的效果。除了领域维度,对比还覆盖了两种目标任务:指令微调和持续预训练。
如果你在继续阅读前想回顾一下LoRA的相关知识,我之前在《改进LoRA:从零实现权重分解低秩适配(DoRA)》一文中有过介绍:
https://magazine.sebastianraschka.com/p/lora-and-dora-from-scratch
2.1 LoRA的学习能力更弱
从第一组结果来看,LoRA的学习效果明显不如全量微调,如下图所示。在我看来这是意料之中的,因为更新更少的参数会限制学习能力。学习新知识通常需要比“将预训练基础模型转化为指令遵循模型”更大的容量。

全量微调 vs LoRA。性能在HumanEval数据集上测得,该数据集包含164道编程挑战题。改绘自《LoRA学得更少,忘得也更少》,原文:https://arxiv.org/abs/2405.09673
在上图中还有一个值得注意的现象:持续预训练场景下,LoRA与全量微调的差距比指令微调场景下更大。这符合我们的普遍认知:预训练主要是教大语言模型新知识,而指令微调主要是改变大语言模型的行为模式。
接下来,在数学领域而非编程领域重复同一组实验,我们会发现全量微调和LoRA之间的差距缩小了,如下图所示。

数学任务下全量微调与LoRA的对比。改绘自《LoRA学得更少,忘得也更少》,原文:https://arxiv.org/abs/2405.09673
可以认为,相比编程,解决数学问题与大语言模型的预训练源域关联更紧密。换句话说,大语言模型在预训练过程中接触到的数学题可能比编程任务更多。此外,数学题通常用自然语言描述,而编程需要一整套全新的术语体系。
总结一下,目前我们可以得出结论:新任务与预训练数据的差异越大,在获取新知识时(比如通过持续预训练),全量微调相比LoRA的优势就越明显。
2.2 LoRA的遗忘程度更低
上文我们对比了LoRA和全量微调在知识更新方面的表现。接下来的一组实验评估了两种方法在经过持续预训练和指令微调后,对原有信息的遗忘情况。和之前结果的区别在于,这里测量的是模型在原始源任务上的性能。

在编程数据上训练后,全量微调与LoRA在原始源任务上的表现。改绘自《LoRA学得更少,忘得也更少》,原文:https://arxiv.org/abs/2405.09673
从上图可以看出,当训练数据集离源域更远时(这里是编程),全量微调比LoRA遗忘的知识多得多。而在数学数据集上,两者的差距更小,如下图所示。

在数学数据上训练后,全量微调与LoRA在原始源任务上的表现。改绘自《LoRA学得更少,忘得也更少》,原文:https://arxiv.org/abs/2405.09673
2.3 结论
LoRA还是全量微调?或许正如预期,归根结底是“学习-遗忘”的权衡问题。全量微调在新目标域上能带来更强的性能,而LoRA能更好地保留原始源域的性能*。
直观上,我认为这只是LoRA修改模型参数更少带来的副作用——顾名思义,LoRA的目标是低秩适配,也就是不会大幅修改所有模型参数。
而且在实践中,很多时候根本不是“选全量微调还是LoRA”的问题:由于LoRA能节省显存、占用更低的存储空间,很多场景下它可能是唯一可行的选择。
尽管如此,能看到这个问题被如此详尽地通过实验梳理和分析,还是非常有价值的。(实验基于7B和13B参数的Llama 2模型开展。)
*(Mariano Kamp向我指出过一个注意事项:在LoRA实验中他们没有更新嵌入层,而这一点在让模型适配新任务时至关重要。)
3. MoRA:面向参数高效微调的高秩更新方法
每当有新论文提出一种类LoRA的大语言模型高效微调方法时,总是令人兴奋。在https://arxiv.org/abs/2405.12130中,作者们采用了一种与低秩适配相关但方向相反的思路:用一个方阵替换LoRA适配器。
另外,我的著作《http://mng.bz/orYv》的附录E中,从零实现了针对垃圾邮件分类GPT模型的LoRA。

我著作《http://mng.bz/orYv》中LoRA章节的可视化内容
3.1 低秩与高秩的对比
如下图所示,MoRA使用一个小型方阵(M),而非LoRA的两个小型矩阵A和B。我们会在下一节详细讨论其工作原理。

LoRA与MoRA的结构对比,W为神经网络层的权重。图片来源:《MoRA:面向参数高效微调的高秩更新方法》,原文:https://arxiv.org/abs/2405.12130
为什么要提出另一种LoRA替代方案,而且还是“高秩”的?原因在于,LoRA对原始权重的更新方式相对受限。在我看来这是刻意设计的:当我们用LoRA微调模型时,我们不希望过度扰动或改变原始模型的能力。然而,尽管低秩更新对于指令微调这类任务来说有效且足够,但它的一个缺点是,在融入新知识时(比如通过持续预训练,也就是在常规文本数据上微调,而非指令微调)效果相对较差。
在MoRA论文中,作者们希望开发出一种参数高效的微调方法,既能在指令微调上表现良好,也能在持续预训练中很好地吸收新知识。
下面是基于合成数据集的LoRA、MoRA和常规全量微调(FFT)的横向对比,该合成数据集要求大语言模型记住特定的识别码。

LoRA、MoRA和全量微调(FFT)在记忆识别码任务上的性能。图片来源:《MoRA:面向参数高效微调的高秩更新方法》,原文:https://arxiv.org/abs/2405.12130
在上图展示的合成基准测试中,MoRA的知识获取(或记忆)能力与全量微调相近。高秩LoRA(r=256)最终也能记住合成识别码,但需要更多的训练步数。而小秩LoRA(r=8)则无法完成记忆。
需要注意的是,大语言模型中的记忆不一定是好事(当然,历史日期和事实类知识除外)。不过,LoRA不容易产生记忆的特点,也有助于降低模型对训练数据过拟合的倾向。话虽如此,这个基准测试主要是为了探究LoRA是否提供了足够的容量来学习新知识。可以把它类比为批量过拟合调试法:我们让模型在一小部分训练集上过拟合,以此确认架构实现是否正确。(下一节我们会看真实数据上的基准测试结果。)
3.2 MoRA方法概览
那么MoRA是如何实现的呢?
作者们使用了一个可训练的方阵,作用于原始权重W上,而非LoRA中的AB矩阵。这个方阵通常远小于原始权重矩阵。实际上,LoRA和MoRA的可训练参数数量甚至可以相同。
例如,如果原始权重层有4096 × 4096 = 16,777,216个参数,秩r=8的LoRA有4096×8 + 8×4096 = 65,536个参数。而用MoRA时,我们可以取r=256来匹配参数量,即256 × 256 = 65,536个参数。
如何将这个256×256的矩阵作用于原始的1024×1024权重矩阵?作者定义了几种非参数化的压缩与解压缩方法(具体细节超出了本文的范围,但我在图中尝试用PyTorch代码做了总结)。
左图:总参数量相同时,LoRA与DoRA的矩阵维度可视化。右图:MoRA矩阵压缩与解压缩的示例代码。

左子图来源:《MoRA:面向参数高效微调的高秩更新方法》,原文:https://arxiv.org/abs/2405.121
LoRA和MoRA的效果对比如何?
从真实数据集的基准测试来看(见下表),MoRA和LoRA的表现处于相近水平。不过,在生物医学和金融数据的持续预训练场景下,MoRA的表现优于所有LoRA变体;只有全量微调(FFT)效果更好。此外一个有趣的发现是,LoRA的表现与DoRA持平甚至更优——DoRA是我几个月前在《改进LoRA:从零实现权重分解低秩适配(DoRA)》中介绍过的LoRA变体:
https://magazine.sebastianraschka.com/p/lora-and-dora-from-scratch
https://magazine.sebastianraschka.com/p/lora-and-dora-from-scratch
https://magazine.sebastianraschka.com/p/lora-and-dora-from-scratch
https://magazine.sebastianraschka.com/p/lora-and-dora-from-scratch
https://magazine.sebastianraschka.com/p/lora-and-dora-from-scratch https://substack.com/profile/27393275-sebastian-raschka-phd
· 2024年2月19日
https://magazine.sebastianraschka.com/p/lora-and-dora-from-scratch
<
多种LoRA变体与MoRA在真实数据集上的对比。改绘自《MoRA:面向参数高效微调的高秩更新方法》,原文:https://arxiv.org/abs/2405.12130
3.3 结论
事实证明,相对简单的MoRA方法效果出人意料地好。它在持续预训练上确实略优于LoRA,但在指令微调和小秩数学推理任务上略逊于LoRA。对我而言,这些结果还不足以让人用MoRA替换LoRA。尽管如此,这篇论文提出了一种有趣的方法,配套的实验也很有价值。
4. 5月其他值得关注的研究论文
以下是我本月偶然发现的其他一些有趣论文。由于列表较长,我将10篇我认为特别值得关注的论文用星号(*)标注。不过请注意,这份列表及其标注完全基于我个人的兴趣,以及和我自身项目的相关性。
-
《上下文位置编码:学会计数重要信息》,作者Golovneva、Wang、Weston和Sukhbaatar(5月29日),https://arxiv.org/abs/2405.18719
该研究提出了上下文位置编码(CoPE)——一种适用于大语言模型的新型位置编码方法,能够根据上下文自适应,支持更抽象的基于位置的注意力机制。 -
《LLaMA-NAS:面向大语言模型的高效神经架构搜索》,作者Sarah、Sridhar、Szanking和Sundaresan(5月28日),https://arxiv.org/abs/2405.18377
该研究提出了一种结合一次性NAS和遗传算法的方法来优化LLaMA2-7B模型,在精度损失极小的情况下实现了1.5倍的体积缩减和1.3倍的推理吞吐量提升,效果优于传统的剪枝和稀疏化技术。 -
《VeLoRA:基于秩1子词元投影的显存高效训练方法》,作者Miles、Reddy、Elezi和Deng(5月28日),https://arxiv.org/abs/2405.17991
该论文提出了一种用于大语言模型训练与微调的显存高效算法,能够在不损失性能的前提下压缩中间激活值,将词元拆分为子词元并投影到固定的一维子空间中。 -
*《gzip可预测数据相关的缩放法则》,作者Pandey(5月26日),https://arxiv.org/abs/2405.16684
该研究挑战了“神经语言模型的缩放法则与数据无关”的观点,证明模型性能的缩放对训练数据的复杂度敏感,并提出了一种新的数据相关缩放法则,将模型的最优计算资源分配与训练数据的gzip压缩率相关联。 -
《面向大语言模型对齐的离线正则化强化学习》,作者Yao、Wu、Yang等人(5月22日),https://arxiv.org/abs/2405.13800
该论文提出了直接奖励优化(DRO)——一种用于大语言模型对齐的新框架,它利用更丰富的单轨迹数据集(包含提示、响应和用户反馈),无需像直接偏好优化(DPO)那样使用成对偏好数据。 -
《Trans-LoRA:迈向无数据可迁移的参数高效微调》,作者Wang、Ghosh、Cox等人(5月27日),https://arxiv.org/abs/2405.17258
Trans-LoRA能够利用合成数据,在不同基础模型之间实现低秩适配器(LoRA)的近乎无数据、无损迁移。 -
《堆叠你的Transformer:深入探究高效大语言模型预训练中的模型增长方法》,作者Du、Luo、Qiu等人(5月26日),https://arxiv.org/abs/2405.15319
该论文研究了预训练大语言模型中的模型增长方法,特别是一种名为Gstack的深度堆叠算子,能够加快训练速度并提升性能。 -
《更少调度的训练之路》,作者Defazio、Yang、Mehta等人(5月24日),https://arxiv.org/abs/2405.15682
该研究提出了一种无调度优化方法,效果优于传统的学习率调度方法,且无需预设停止时机,除了标准动量优化器中的超参数外,无需引入额外超参数。 -
《对指令计算损失的指令微调》,作者Shi、Yang、Wu等人(5月23日),https://arxiv.org/abs/2405.14394
该论文对比了指令微调时对指令进行掩码与不掩码两种情况下大语言模型的性能,发现不掩码的效果通常更好。 -
《SimPO:基于无参考奖励的简单偏好优化》,作者Meng、Xia和Chen(5月23日),https://arxiv.org/abs/2405.14734
直接偏好优化(DPO)简化了大语言模型基于人类反馈的强化学习,而该论文通过对对数概率取平均、去除参考模型的需求,进一步简化了DPO。 -
《AlignGPT:具备自适应对齐能力的多模态大语言模型》,作者Fei Zhao、Taotian Pang和Chunhui Li(5月23日),https://arxiv.org/abs/2405.14129
AlignGPT是一种新型多模态大语言模型,通过在预训练阶段区分图文对的对齐能力、在指令微调阶段自适应调整对齐能力,提升了跨模态对齐效果。 -
《面向多模态大语言模型的密集连接器》,作者Yao、Wu、Yang等人(5月22日),https://arxiv.org/abs/2405.13800
该论文提出了密集连接器(Dense Connector)——一种视觉-语言连接器,通过整合多层视觉特征来改进多模态大语言模型(MLLM)。 -
《作为循环神经网络的注意力机制》,作者Feng、Tung、Hajimirsadeghi等人(5月22日),https://arxiv.org/abs/2405.13956
该研究将Transformer重新解释为循环神经网络的一种变体,并提出了Aaren——一种新型注意力模块,兼具Transformer的并行训练能力和传统循环神经网络高效、恒定内存更新的优势。 -
*《MoRA:面向参数高效微调的高秩更新方法》,作者Jiang、Huang、Luo等人(5月20日),https://arxiv.org/abs/2405.12130
该论文分析了大语言模型中低秩更新的局限性,并提出了MoRA方法:使用方阵进行高秩更新,在保持与LoRA相当的参数效率的同时,在内存密集型任务上表现更优,其他任务上表现相近。 -
《SLAB:结合简化线性注意力与渐进重参数化批归一化的高效Transformer》,作者Guo、Chen、Tang和Wang(5月19日),https://arxiv.org/abs/2405.11582
该论文提出了一种方法,在基于Transformer的模型中用重参数化的批归一化渐进替换层归一化,同时搭配简化线性注意力(SLA)模块。 -
《构建与复用LoRA库,迈向模块化大语言模型》,作者Ostapenko、Su、Ponti等人(5月17日),https://arxiv.org/abs/2405.11157
该研究探索了将基础大语言模型上训练好的适配器复用于新任务的方法,提出了一种基于模型聚类(MBC)构建适配器库的方法,以及零样本路由机制,无需重新训练即可提升任务泛化能力。 -
《Chameleon:混合模态早期融合基础模型》,Meta AI团队作者(5月16日),https://arxiv.org/abs/2405.09818
Chameleon是一种早期融合、基于词元的混合模态模型,擅长以任意顺序处理和生成图像与文本。 -
《Xmodel-VLM:多模态视觉语言模型的简单基线》,作者Xu、Liu、He等人(5月15日),https://arxiv.org/abs/2405.09215
该论文提出了Xmodel-VLM——一个10亿参数规模、高效的多模态视觉语言模型,专为消费级GPU部署设计。 -
*《LoRA学得更少,忘得也更少》,作者Biderman、Ortiz、Portes等人(5月15日),https://arxiv.org/abs/2405.09673
该研究在编程和数学领域对比了参数高效微调方法低秩适配(LoRA)与全量微调在大语言模型上的效果,发现尽管LoRA通常表现稍差,但它能更好地保留目标域之外的基础模型能力,并且提供了更强的正则化效果。 -
《RLHF工作流:从奖励建模到在线RLHF》,作者Dong、Xiong、Pang等人(5月13日),https://arxiv.org/abs/2405.07863
该报告概述了一种适用于大语言模型的在线迭代RLHF方法,它使用代理模型模拟人类反馈,效果优于离线方法,并训练出了性能优异的SFR-Iterative-DPO-LLaMA-3-8B-R模型。 -
《PHUDGE:可扩展评判模型Phi-3》,作者Deshwal和Chawla(5月12日),https://arxiv.org/abs/2405.08029
该报告介绍了PHUDGE——一个基于Phi-3的模型,在评分任务上的速度和效果都超过了ChatGPT的GPT-4。 -
《面向语言模型对齐与个性化的价值增强采样》,作者Han、Shenfeld、Srivastava等人(5月10日),https://arxiv.org/abs/2405.06639
该研究提出了价值增强采样(VAS)——一种新型奖励优化框架,能够高效对齐大语言模型,无需修改模型权重,也无需联合训练策略和价值函数,并且支持对仅开放API的大语言模型(如ChatGPT)进行适配。 -
*《在新知识上微调大语言模型会加剧幻觉吗?》,作者Gekhman、Yona、Aharoni等人(5月9日),https://arxiv.org/abs/2405.05904
该研究探究了在有监督微调过程中引入新事实信息对大语言模型的影响,发现尽管模型很难融入新事实、学习新事实的速度比熟悉的信息慢,但最终学会这些事实后,模型生成错误事实回答的倾向会线性增加。 -
*《寻找鲤鱼王:自动检测大语言模型中训练不足的词元》,作者Land和Bartolo(5月8日),https://arxiv.org/abs/2405.05417
该论文对大语言模型的分词器问题进行了全面分析,并提出了一种自动检测“故障词元”的方法——这类词元存在于分词器词表中,但在训练数据中几乎或完全没有出现过。 -
*《DeepSeek-V2:一款强大、经济、高效的混合专家语言模型》,作者Liu、Feng、Wang等人(5月8日),https://arxiv.org/abs/2405.04434
DeepSeek-V2是一个2360亿参数的混合专家语言模型(每个词元仅激活210亿参数),它引入了多头潜注意力(MLA),旨在将键值(KV)缓存压缩为潜向量,从而提升推理效率并降低显存需求。 -
《仅缓存一次:面向语言模型的解码器-解码器架构》,作者Sun、Dong、Zhu等人(5月8日),https://arxiv.org/abs/2405.05254
该研究提出了YOCO——一种面向大语言模型的解码器-解码器架构,它通过自解码器编码全局键值缓存,供交叉解码器复用,大幅降低了GPU显存需求并提升了预填充阶段的性能。 -
*《xLSTM:扩展长短期记忆网络》,作者Beck、Poeppel、Spanring等人(5月7日),https://arxiv.org/abs/2405.04517
该研究探索了将LSTM扩展到数十亿参数规模的潜力,通过指数门控、增强记忆结构等新改进,将其整合为xLSTM架构,性能与当前最先进的基于Transformer和状态空间模型的大语言模型相当。 -
《vAttention:无需分页注意力的大语言模型服务动态内存管理》,作者Prabhu、Nayak、Mohan等人(5月7日),https://arxiv.org/abs/2405.04437
该论文提出了vAttention——一种大语言模型GPU显存管理方法,它将键值缓存保存在连续的虚拟内存中,并利用现有的底层系统按需分页支持来动态分配物理内存。 -
*《Flash Attention稳定吗?》,作者Golden、Hsia、Sun等人(5月5日),https://arxiv.org/abs/2405.02803
该研究建立了一套分析数值偏差对大规模机器学习训练影响的框架,发现被广泛使用的Flash Attention优化确实存在显著的数值偏差,不过其影响程度低于低精度训练带来的偏差。 -
*《构建视觉语言模型,什么才是关键?》,作者Laurencon、Tronchon、Cord和Sanh(5月3日),https://arxiv.org/abs/2405.02246
该论文指出,视觉语言模型(VLM)中很多关键设计选择都缺乏依据,并提出了Idefics2——一个80亿参数的新型视觉语言基础模型,通过严格评估不同架构、数据和训练方法,实现了同量级下的最优性能,其模型和数据集均已公开。 -
《Prometheus 2:一款专门用于评估其他语言模型的开源语言模型》(5月2日),https://arxiv.org/abs/2405.01535
该论文提出了Prometheus 2——一款开源的评估用大语言模型,它解决了此前模型的局限性,与人类和GPT-4的判断高度对齐,并且在评估格式和标准上具备灵活性。 -
*《大语言模型小学数学表现的细致检验》,作者Zhang、Da、Lee等人(5月1日),https://arxiv.org/abs/2405.00332
该研究提出了GSM1k——一个复刻了经典基准GSM8k的新基准,用于测试大语言模型,结果发现模型性能出现显著下降,表明之前的优异表现可能更多源于对训练数据的记忆,而非真正的数学推理能力。(注:GSM8k是一个用于评估大语言模型数学推理能力的基准,通过呈现小学难度的题目来衡量模型能力。) -
《面向语言模型对齐的自博弈偏好优化》,作者Wu、Sun、Yuan等人(5月1日),https://arxiv.org/abs/2405.00675
该论文提出了自博弈概率偏好优化(SPPO)方法用于语言模型对齐,它利用自博弈框架,通过迭代策略更新来逼近纳什均衡。 -
《编辑批次越大越好吗?——基于Llama-3的模型编辑实证研究》,作者Yoon、Gupta和Anumanchipalli(5月1日),https://arxiv.org/abs/2405.00664
该研究在Llama-3上检验了模型编辑技术的效果,通过测试顺序编辑、批量编辑以及一种新颖的顺序-批量混合编辑策略在不同层上的表现,得出结论:更小的顺序编辑比更大的批量编辑更能提升模型性能。(注:编辑批次大小指的是一轮编辑中同时对模型参数做出的修改数量。)
这本杂志是我个人的兴趣项目,不提供直接报酬。不过,如果您愿意支持我的话,可以考虑购买我的著作:https://sebastianraschka.com/books。如果您觉得这些书有洞见、对您有帮助,非常欢迎推荐给您的朋友和同事。(也欢迎在亚马逊上分享您的反馈,这对我帮助很大)

http://mng.bz/M96o 、https://nostarch.com/machine-learning-and-ai-beyond-basics 以及https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/
您的支持对我意义重大!非常感谢!






















































































































































