【转载】指令预训练大语言模型

原文地址:Instruction Pretraining LLMs,by Sebastian Raschka, on 2024-06-20

指令预训练大语言模型

指令微调领域的最新研究

2024年7月20日

上个月发生了不少大事:苹果宣布集成端侧大语言模型,英伟达发布了旗下大型Nemotron模型,FlashAttention-3正式推出,谷歌的Gemma 2也正式亮相,诸如此类,不胜枚举。

大家或许已经通过各大新闻渠道了解了这些动态。因此在本篇文章中,我想聚焦于指令微调方向的最新研究——这是训练大语言模型的一项核心技术。

本文将涵盖以下内容:

  • 一种低成本、高效生成指令微调数据的新方法
  • 从零开始实现指令微调
  • 用指令数据对大语言模型进行预训练
  • Gemma 2的核心更新概览
  • 6月发布的其他值得关注的研究论文总览

祝阅读愉快!

1. 从零生成对齐数据

论文 https://arxiv.org/abs/2406.08464 分享了一种极具巧思的技巧,能够生成高质量的大语言模型指令微调数据集。虽然它并未提出特别前沿的研究洞见,但属于那种巧妙又实用的技术方案,应用价值很高。

1.1 从零生成指令数据集

这种指令数据生成方法的独特之处在于,它可以实现完全自动化,且不需要任何初始的问题或指令作为输入。正如论文标题所示,它能实现“从零”创建指令数据集——我们只需要一个本地运行的Llama 3 8B模型即可。下图总结了该方法的工作流程。

figure01

Magpie方法生成指令微调合成数据集的示意图。该图基于Magpie论文的配图改制:https://arxiv.org/abs/2406.08464

简单来说,如上图所示,我们只需要用预查询模板提示Llama 3 8B Instruct模型,它就会为我们生成一条指令。接着,我们再把这条指令输入给大语言模型,模型就会生成对应的回答。重复这个过程几千次,就能得到一个指令微调数据集。(可选步骤:我们可以用大语言模型按质量筛选这些指令-回答对。)

1.2 数据集质量

令人惊叹的是,研究者发现,仅用生成的指令数据集对Llama 3 8B基座模型进行指令微调(不经过RLHF、DPO等偏好微调),效果就能超过Meta AI官方的原版Llama 2 8B Instruct模型,如下图所示。

figure02

在Magpie生成的指令数据集上微调后的Llama 3 8B基座模型,效果优于原版Llama 3 8B Instruct模型。基于Magpie论文的带标注示意图改制:https://arxiv.org/abs/2406.08464

上图展示的Magpie效果,仅用了30万条样本就实现了。作为对比,原版Llama 3 Instruct模型的微调和对齐过程,使用了多达1亿条样本!

1.3 本地运行数据集生成

一开始我对此持怀疑态度,于是自己动手实现了这个方法。结果它真的可行!你可以在 https://github.com/rasbt/LLMs-from-scratch/tree/main/ch07/05_dataset-generation 找到我基于Ollama的复现代码,它甚至可以在MacBook Air上流畅运行。

figure03

本地运行的Magpie方法复现代码截图。代码可在此处获取:https://github.com/rasbt/LLMs-from-scratch/blob/main/ch07/05_dataset-generation/instruction-data-llama3-7b.json

1.4 更多细节

研究者创建了两个版本的数据集:使用Llama 3 70B Instruct模型生成的“Pro”版本,以及使用Llama 3 8B Instruct模型生成的“Air”版本。如之前的图示所示,用Magpie-Pro生成的数据集对Llama 3 8B基座模型进行指令微调,得到的模型效果略优于Magpie-Air数据集的结果。

下图补充了大语言模型对两个数据集质量与难度的评分对比。

figure04

Magpie论文中的带标注图表,展示了Air与Pro数据集的质量与难度对比

如上图所示,Air和Pro数据集的质量大致相当。此外,如果能和Alpaca数据集做个对比会很有意思。(目前普遍认为Magpie的数据质量远高于Alpaca,但有一个参照基准会更直观。)

此外,论文中的分析显示,该数据集的广度和多样性远高于其他主流指令微调数据集,比如Alpaca、Evol Instruct和UltraChat。同时,与使用其他指令微调数据集训练的模型相比,Magpie-Pro微调后的模型表现也十分出色。

1.5 小结

总的来说,我认为Magpie是一个很巧妙的技术方案:一方面,它的效果之好令人惊叹;另一方面,它具备极高的实用价值。未来在构建通用指令数据集时,我肯定会将它作为一种有趣、简单且低成本的候选方案。

2. 从零开始进行指令微调

如果你正在寻找学习大语言模型指令微调流程的资料,我很高兴地告诉大家,关于大语言模型指令微调的第7章现已正式上线:https://mng.bz/M96o

这是全书篇幅最长的一章,采用从零实现的思路讲解指令微调全流程,内容涵盖输入格式化、基于自定义整理函数的批处理、填充掩码标记、训练循环本身,以及在自定义测试集上评估微调后大语言模型的回答质量。

(章节练习包括修改提示风格、指令掩码,以及加入LoRA等。)

祝编码愉快!

figure05

我的著作《从零构建大语言模型》第7章内容概览。配套代码资源可在此处获取:https://github.com/rasbt/LLMs-from-scratch

附:这也是全书的最后一章,出版社目前正在准备纸质版的排版工作。

3. 大语言模型的指令预训练

在《指令预训练:语言模型是有监督的多任务学习者》(https://arxiv.org/abs/2406.14491)这篇论文中,研究者探究了通过加入合成指令-回答对(而非仅使用原始文本)来提升大语言模型预训练效率的可能性。(这里的“原始文本”指的是书籍、网站、论文等来源的文本,未经过特定格式的再加工。)

figure06

常规预训练(上)与提出的指令预训练方法(下)的对比,改绘自论文https://arxiv.org/abs/2406.14491的带标注示意图

具体来说,研究者通过一个“指令合成器”——专门为此任务微调的大语言模型——从原始训练语料本身生成指令-回答数据。

(需要说明的是,这并非第一篇提出将原始文本格式化为指令数据的论文。我能想到的另一项相关工作是《Genie:在内容 grounded 数据集生成中达到人类水平》(https://arxiv.org/abs/2401.14367)。我记得几个月前还看过另一篇论文或博客,也提到了在预训练中使用指令数据——我还和同事讨论过这个方法——但可惜找不到出处了。尽管如此,本文讨论的研究尤其值得关注,因为它基于可本地运行的开源大语言模型实现,同时覆盖了预训练和持续预训练两种场景。)

3.1 指令合成器

在深入讲解预训练和持续预训练的结果之前,我们先来说明该方法的核心组件:指令合成器。它是一个开源的Mistral 7B v0.1大语言模型(我去年在这篇文章里写过它:https://magazine.sebastianraschka.com/i/13855764/mistral-b),经过微调后可以从原始文本生成指令-回答对。

为了微调这个合成器,研究者使用了HotpotQA(https://arxiv.org/abs/1809.09600)等数据集,该数据集由维基百科的段落及对应的问答对组成。同时,研究者也确保覆盖了多种任务类型,比如常识推理、情感分析、数学题等。

figure07

指令合成器的输入与输出数据,改绘自论文https://arxiv.org/abs/2406.14491的带标注示意图

当指令合成器开发完成(即微调完毕)后,就可以用它来生成目标大语言模型预训练所需的输入数据。

关于指令合成器,还有一个值得注意的细节:多个原始文本(Tn)和指令-回答对(In ⊕ Rn)会被拼接起来作为少样本示例,如下图所示。

figure08

用于微调(及使用)指令合成器的指令数据格式,改绘自论文https://arxiv.org/abs/2406.14491的带标注示意图

3.2 使用指令数据进行预训练

讲完生成指令-回答对的方法,接下来就是最有意思的部分:模型在这种增强数据集上的训练效果如何。第一组结果针对两个从头训练的小模型:5亿参数和13亿参数(均基于Mistral架构)。

figure09

三种不同预训练方法的从头训练效果对比,改绘自论文https://arxiv.org/abs/2406.14491的带标注表格

从上表可以看出,采用本文提出的指令预训练方法(Instruct PT)训练的模型,在大多数基准任务上表现最优(数值越高越好)。

不过需要注意的是,相比普通预训练(Vanilla PT),它见过的token数量更多,因为其中包含了合成的指令-回答对。因此研究者还加入了Mix PT作为对比——该模型在混合数据集上训练,混合了原始文本和用于训练合成器的指令数据。

从这个对比可以看出,并非随便加入指令数据就能带来提升。Instruct PT在多数任务上表现优于Mix PT,这说明指令-回答数据的性质(即与原始数据相关联的指令-回答数据)才是关键。(研究者所有实验都使用了相同数量的token。)

此外值得注意的是,经过指令预训练的模型还有另一个优势:后续再进行指令微调时,提升幅度更大,如下图所示。

figure10

分别经过传统预训练(Vanilla PT)和指令预训练的大语言模型在微调后的效果对比,改绘自论文https://arxiv.org/abs/2406.14491的带标注示意图

3.3 使用指令数据进行持续预训练

从头预训练固然有意思,因为这是大语言模型诞生的方式。但我认为,从业者更关心的是持续预训练和微调。

这里的持续预训练,指的是取一个已经预训练好的模型,在新的领域数据上继续预训练。比如,你有一个在通用文本语料上训练好的Llama 3 8B基座模型,想让它适配金融、医疗、法律等特定领域。

下表总结了研究者将指令预训练方法应用于预训练好的Llama 3 8B基座模型时得到的结果。具体来说,他们分别用生物医学文本和金融文本做了持续预训练实验。

figure11

三种不同预训练方法在持续预训练场景下的效果对比,改绘自论文https://arxiv.org/abs/2406.14491的带标注表格

从上表可以看出,指令预训练方法(Instruct PT)的表现明显优于普通预训练(Vanilla PT)方法(这里的普通预训练指的是对基座模型进行常规持续预训练)。

表中还加入了Llama 3 70B基座模型作为参照——我想这是为了说明,小型专用模型也能胜过大型通用模型。

3.4 小结

每次我给别人讲解大语言模型的预训练流程时,他们都会惊讶于它的简洁,以及如今训练大语言模型依然在沿用这套方法。从这个角度来说,指令预训练方法让人耳目一新。

需要注意的一点是,对于大规模预训练语料,创建指令增强语料的成本可能依然较高。不过生成数据的好处在于,一旦创建完成,就可以在多个不同项目中重复使用。

4. Gemma 2

写这篇文章就不得不提谷歌发布的全新报告 https://storage.googleapis.com/deepmind-media/gemma/gemma-2-report.pdf ,它可以说是上个月最重磅的模型发布。不过如果单论参数规模,英伟达的Nemotron-4 340B才是最大的(https://arxiv.org/abs/2406.11704)。Gemma 2系列模型包含26亿、90亿和270亿参数三个版本。

本文篇幅已经不短了,而且大家可能已经通过其他渠道了解过Gemma 2,那我们就直奔主题:谷歌最新发布的Gemma 2大语言模型有哪些核心亮点和值得关注的更新?其核心思路是,不一定非要扩大训练数据集的规模,而是专注于研发体量相对较小、效率更高的大语言模型。

具体来说,他们融合了三种主要的架构和训练方案来打造26亿和90亿参数模型:滑动窗口注意力、分组查询注意力和知识蒸馏。

4.1 滑动窗口注意力

滑动窗口注意力(比如因Mistral而普及的技术)是一种使用固定大小注意力块的技术:当前token仅能关注之前特定数量的token,而非所有之前的token,如下图所示。

figure12

解释滑动窗口注意力的示意图,改绘自论文https://arxiv.org/abs/2310.06825

在Gemma 2中,研究者将普通注意力层和滑动窗口注意力层交替使用。滑动注意力块的大小为4096个token,总块跨度为8192个token。

滑动窗口注意力主要用于提升计算性能,研究者还做了一项小型消融研究,结果显示推理时缩小块大小,对困惑度的影响微乎其微。

figure13

来自Gemma 2报告的消融研究:缩小滑动窗口的块大小,对90亿参数模型推理时的建模效果几乎没有影响。报告链接:https://storage.googleapis.com/deepmind-media/gemma/gemma-2-report.pdf

(如果能同时看到GPU显存的提升效果就更有意思了。)

4.2 分组查询注意力

分组查询注意力(和Llama 2、3中的技术类似)可以看作是多查询注意力的更通用形式。其核心动机是,通过让多个查询头共享同一组键和值头,来减少可训练参数的数量,从而降低计算开销。

figure14

示意图改绘自论文https://arxiv.org/abs/2305.13245 https://arxiv.org/abs/2305.13245 https://arxiv.org/abs/2305.13245

4.3 知识蒸馏

知识蒸馏的核心思想(比如MiniLLM,https://arxiv.org/abs/2306.08543)是将知识从更大的模型(教师模型)迁移到更小的模型(学生模型)中。在Gemma 2中,研究者先从头训练了一个270亿参数的(教师)模型,然后用这个大教师模型的输出来训练更小的20亿和90亿(学生)模型。270亿参数模型没有使用知识蒸馏,而是从头训练,专门作为小模型的“教师”。

figure15

计算机视觉领域的知识蒸馏概览,图源:https://www.amazon.com/Machine-Learning-AI-Essential-Questions/dp/1718503768/ref=sr_1_1。在大语言模型语境下,把图像换成文本,把类别标签换成预测token即可。

4.4 其他值得关注的架构细节

报告中还有很多有意思的细节。比如,Gemma 2的一大特点是其超大的词表规模:256000个token。这和初代Gemma模型差不多,但依然值得一提——它是Llama 3词表(128000)的两倍,是Phi-3词表(32000)的八倍。

大语言模型的词表规模,指的是模型能够识别和生成的唯一token(词、子词或字符)的数量。

更大的词表可以让大语言模型更好地覆盖词汇和概念,提升多语言内容的处理能力,减少分词带来的伪影。但更大的词表也有代价,比如模型体积会增大,并且由于嵌入层和输出层变大,推理速度可能会变慢。(这也正是滑动窗口注意力和多查询注意力机制的重要性所在——它们可以抵消这部分开销。)

报告中还有一个关于“对数几率截断(logit capping)”的有趣章节,这种技术我之前没见过有人使用。本质上,它是一种对logit值进行最大最小归一化和裁剪的方法,将其限制在一定范围内。我推测这是为了提升训练过程中的稳定性和梯度流动性。

$$\text{logits} \leftarrow \text{soft_cap} * \tanh(\text{logits}/\text{soft_cap})$$

此外,他们还利用模型合并技术,将多次不同超参数训练得到的模型进行融合,不过报告中没有提供太多细节。(感兴趣的读者可以参考这篇论文了解更多:https://arxiv.org/abs/2406.16768 ,Gemma 2也用到了这项技术。)

在建模性能方面,Gemma 2的表现几乎是体量3倍于它的Llama 3 70B的水平,并且超过了旧版的Qwen 1.5 32B模型。如果能和更新的Qwen 2模型做对比会很有意思。

figure16

另外两款主流开源权重模型的对比:Llama 3和Qwen 1.5。(带标注表格来自Gemma 2报告:https://storage.googleapis.com/deepmind-media/gemma/gemma-2-report.pdf

在我看来,一大亮点是Gemma 2的报告中针对部分架构选择做了消融研究。这在学术研究中本是常规操作,但在如今的大语言模型研究中已经越来越少见了。

figure17

Gemma 2报告中其中一项消融研究的示例。报告链接:https://storage.googleapis.com/deepmind-media/gemma/gemma-2-report.pdf 。其中“wide”指28层、中间维度24576的中等体量模型,“deep”指42层、中间维度14336的深度架构。

4.5 小结

能看到谷歌发布如此详尽的技术报告,让人耳目一新。就模型本身而言,根据业界共识,Gemma 2可能是目前单GPU场景下能力最强的模型。而在更大的模型梯队中,Llama 3 70B和Qwen 2 72B依然是强有力的竞争者。


支持《Ahead of AI》

《Ahead of AI》是我的个人兴趣项目,没有直接的商业回报。不过,如果您愿意支持我,可以考虑购买我的书:https://sebastianraschka.com/books/ 。如果您觉得这些书有洞见、对您有帮助,也欢迎推荐给您的朋友和同事。

如果您有几分钟时间,在亚马逊上给 https://www.amazon.com/Machine-Learning-AI-Essential-Questions/dp/1718503768 或者 写条评论 ,也会对我有很大帮助!

您的支持意义重大,对我继续创作帮助良多。非常感谢!


5. 四月其他值得关注的研究论文

以下是我本月发现的其他一些有意思的论文。由于列表较长,我把个人认为特别值得关注的20篇用星号(*)标注了出来。不过请注意,这份列表及标注仅基于我个人的兴趣,以及和我自身项目的相关性。

  • Scaling Synthetic Data Creation with 1,000,000,000 Personas,作者:Chan, Wang, Yu 等(6月28日),https://arxiv.org/abs/2406.20094
    该研究提出了一种基于人设的数据合成方法,利用大语言模型,通过一个自动构建的大规模人设库(Persona Hub)来生成多样化的合成数据,这个人设库覆盖了全球约13%的人口。

  • LLM Critics Help Catch LLM Bugs,作者:McAleese, Pokorny, Ceron Uribe 等(6月28日),https://arxiv.org/abs/2407.00215
    该研究利用RLHF训练“批评家”模型,辅助人类评估模型生成的代码,训练大语言模型用自然语言反馈代码错误,并证明了它们在各类任务中捕捉漏洞的有效性。

  • Direct Preference Knowledge Distillation for Large Language Models,作者:Li, Gu, Dong 等(6月28日),https://arxiv.org/abs/2406.19774
    DPKD将大语言模型的知识蒸馏重构为两阶段流程:首先优化结合隐式奖励和反向KL散度的目标函数,然后提升教师输出相对学生输出的偏好概率。

  • Changing Answer Order Can Decrease MMLU Accuracy,作者:Gupta, Pantoja, Ross 等(6月27日),https://arxiv.org/abs/2406.19470
    该研究探究了大语言模型MMLU基准测试中准确率测量的鲁棒性,发现打乱答案标签的顺序会导致各模型的准确率普遍下降,且不同模型的敏感程度不同。

  • From Artificial Needles to Real Haystacks: Improving Retrieval Capabilities in LLMs by Finetuning on Synthetic Data,作者:Xiong, Papageorgiou, Lee, Papailiopoulos(6月27日),https://arxiv.org/abs/2406.19292
    该研究提出一种微调方法,使用数值键值检索任务的合成数据集,来提升大语言模型的长上下文信息检索和推理能力。

  • Dataset Size Recovery from LoRA Weights,作者:Salama, Kahana, Horwitz, Hoshen(6月27日),https://arxiv.org/abs/2406.19395
    该研究提出了一种方法,通过分析LoRA矩阵的范数和频谱,从视觉模型的LoRA权重中还原出微调时使用的图像数量。

  • Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs,作者:Azerbayev, Shao, Lin 等(6月26日),https://arxiv.org/abs/2406.18629
    本文提出Step-DPO方法,利用自定义的1万条分步偏好对数据集,针对大语言模型数学解题中的各个推理步骤分别进行优化。

  • RouteLLM: Learning to Route LLMs with Preference Data,作者:Ong, Amjad 等(6月26日),https://arxiv.org/abs/2406.18665
    该研究提出了高效的路由模型,能在推理时动态选择更强或更弱的大语言模型,以优化成本-性能权衡。

  • *** A Closer Look into Mixture-of-Experts in Large Language Models**,作者:Zhang, Liu, Patel 等(6月26日),https://arxiv.org/abs/2406.18219
    该研究深入剖析了混合专家(MoE)大语言模型的内部工作机制,分享了关于神经元行为、专家选择准则、跨层专家多样性的洞见,并基于这些观察为MoE的设计与实现提供了实用建议。

  • *** Following Length Constraints in Instructions**,作者:Yuan, Kulikov, Yu 等(6月25日),https://arxiv.org/abs/2406.17744
    该研究提出了一种训练大语言模型的方法,使其能在推理时遵循用户指定的长度约束,解决了模型评估中的长度偏差问题,在长度受控任务上的表现优于标准指令跟随模型。

  • LongIns: A Challenging Long-context Instruction-based Exam for LLMs,作者:Shaham, Bai, An 等(6月25日),https://arxiv.org/abs/2406.17588
    LongIns是一个评估大语言模型长上下文能力的新基准,通过三种设置来考察模型的检索和推理能力。

  • *** The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale**,作者:He, Wang, Shen 等(6月25日),https://arxiv.org/abs/2406.17557
    该报告介绍了FineWeb——一个从Common Crawl提取的15万亿token数据集,以及FineWeb-Edu——一个1.3万亿token的教育子集。

  • Adam-mini: Use Fewer Learning Rates To Gain More,作者:Zhang, Chen, Li 等(6月24日),https://arxiv.org/abs/2406.16793
    Adam-mini是一种新提出的优化器,通过策略性地减少学习率资源、基于海森结构划分参数、为参数块分配优化后的单一学习率,在达到与AdamW相当或更优性能的同时,减少了45-50%的显存占用。

  • WARP: On the Benefits of Weight Averaged Rewarded Policies,作者:Ramé, Ferret, Vieillard 等(6月24日),https://arxiv.org/abs/2406.16768
    本文提出了一种新的大语言模型对齐策略,在三个阶段融合策略:使用指数移动平均做动态KL正则化、对独立微调的策略进行球面插值、以及与初始化进行线性插值。

  • Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers,作者:Lou, Jia, Zheng, Tu(6月24日),https://arxiv.org/abs/2406.16747
    作者提出了一种新的自回归Transformer稀疏注意力机制,通过评分网络和可微分的top-k掩码算子,为每个查询选择固定数量的KV对,实现了线性时间复杂度和恒定的显存占用。

  • Efficient Continual Pre-training by Mitigating the Stability Gap,作者:Wang, Hu, Xiong 等(6月21日),https://arxiv.org/abs/2406.14833
    该研究提出了三种改进大语言模型持续预训练的策略:在子集上进行多轮迭代、聚焦高质量数据、使用与预训练数据相似的混合数据。

  • MoA: Mixture of Sparse Attention for Automatic Large Language Model Compression,作者:Fu, Huang, Ning 等(6月21日),https://arxiv.org/abs/2406.14909
    混合注意力(MoA)能针对大语言模型中不同的模型组件和输入长度,自动优化稀疏注意力模式,相比统一稀疏注意力方案,提升了上下文长度、准确率和效率。

  • LongRAG: Enhancing Retrieval-Augmented Generation with Long-context LLMs,作者:Jiang, Ma, Chen 等(6月21日),https://arxiv.org/abs/2406.15319
    LongRAG提出了一种新的RAG框架,使用4K token的检索单元和长上下文大语言模型进行答案抽取,在无需额外训练的情况下,提升了检索性能,并在问答任务上达到了业界最优水平。

  • *** A Tale of Trust and Accuracy: Base vs. Instruct LLMs in RAG Systems**,作者:Cuconasu, Trappolini, Tonellotto 等(6月21日),https://arxiv.org/abs/2406.14972
    该研究挑战了传统认知,证明在检索增强生成(RAG)任务中,基座大语言模型的表现优于指令微调模型。

  • Can LLMs Learn by Teaching? A Preliminary Study,作者:Ning, Wang, Li, Lin 等(6月20日),https://arxiv.org/abs/2406.14629
    作者开发并测试了三种在大语言模型中实现“以教促学”的方法,在不同层面模拟人类教学过程:观察学生反馈、从反馈中学习、迭代学习,在不依赖额外人工数据或更强模型的情况下提升了模型性能。

  • *** Instruction Pre-Training: Language Models are Supervised Multitask Learners**,作者:Cheng, Gu, Huang 等(6月20日),https://arxiv.org/abs/2406.14491
    该研究提出了大语言模型有监督多任务预训练框架,用合成生成的指令-回答对来增强原始语料。

  • *** Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More?**,作者:Wu, Zhang, Johnson 等(6月19日),https://arxiv.org/abs/2406.13121
    该研究提出了一个基准,用于评估长上下文大语言模型在需要数百万token的任务上的表现,证明这些长上下文大语言模型在上下文内检索和推理任务上,能够媲美专用检索系统和RAG系统。

  • Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges,作者:Ye, Turpin, Li, He 等(6月18日),https://arxiv.org/abs/2406.12624
    本文以TriviaQA为基准,评估了“大语言模型作为评委”这一范式,将9个评委模型和9个考生模型与人类标注进行对比,发现人类对齐程度高的模型,未必最擅长给考生模型排名。

  • From RAGs to Rich Parameters: Probing How Language Models Utilize External Knowledge Over Parametric Information for Factual Queries,作者:Wadhwa, Seetharaman, Aggarwal 等(6月18日),https://arxiv.org/abs/2406.12824
    作者探究了大语言模型中检索增强生成(RAG)的工作机制,发现模型回答问题时主要依赖检索到的上下文信息,而非自身的参数记忆,在不同模型家族中都表现出这种捷径行为。

  • Self-MoE: Towards Compositional Large Language Models with Self-Specialized Experts,作者:Kang, Karlinsky, Luo 等(6月17日),https://arxiv.org/abs/2406.12034
    本文提出了一种方法,将单体大语言模型转化为名为MiXSE(自专业化专家混合)的模块化系统,利用自生成的合成数据,创建具有共享基座大语言模型和自优化路由的专用专家模块。

  • Measuring memorization in RLHF for code completion,作者:Pappu, Porter, Shumailov, Hayes(6月17日),https://arxiv.org/abs/2406.11715
    该研究探究了基于人类反馈的强化学习(RLHF)对大语言模型中数据记忆的影响,聚焦代码补全任务。研究发现,与直接微调相比,RLHF减少了对奖励建模和强化学习阶段所用数据的记忆,但基本保留了初始微调阶段的记忆。

  • HARE: HumAn pRiors, a key to small language model Efficiency,作者:Zhang, Jin, Ge 等(6月17日),https://arxiv.org/abs/2406.11410
    该研究提出了在小语言模型(SLM)的数据构建中利用人类先验的原则,核心关注语义多样性和数据质量一致性,同时避免基准数据泄露。

  • Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level,作者:Kim, Lee, Park 等(6月17日),https://arxiv.org/abs/2406.11817
    该研究提出了迭代长度正则化直接偏好优化(iLR-DPO)方法,在控制回答冗长程度的同时,提升大语言模型与人类偏好的对齐度。

  • Unveiling Encoder-Free Vision-Language Models,作者:Choi, Yoon, Lee 等(6月17日),https://arxiv.org/abs/2406.11832
    该研究提出了一种无编码器的视觉语言模型(VLM),能够在统一的解码器中直接处理视觉和文本输入。

  • *** DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence**,作者:Zhu, Wang, Lee 等(6月17日),https://arxiv.org/abs/2406.11931
    DeepSeek-Coder-V2是一款开源的混合专家代码大语言模型,通过额外6万亿token的持续预训练,在代码任务上达到了GPT-4 Turbo级别的性能。

  • Tokenization Falling Short: The Curse of Tokenization,作者:Nguyen, Kim, Patel 等(6月17日),https://arxiv.org/abs/2406.11687
    该研究通过考察大语言模型在复杂问题求解、token结构探测和对拼写变化的鲁棒性等方面的表现,探究了大语言模型中的“分词诅咒”。研究发现,虽然扩参能起到一定帮助,但大语言模型依然容易受到分词带来的偏差影响。

  • DataComp-LM: In Search of the Next Generation of Training Sets for Language Models,作者:Li, Fang, Smyrnis 等(6月17日),https://arxiv.org/abs/2406.11794
    作者提供了一个标准化测试平台,用于实验语言模型训练中的数据集筛选策略,包含240万亿token的语料、预训练方案和53项下游评估。

  • *Nemotron-4 340B Technical Report,作者:英伟达未署名作者(6月17日),https://arxiv.org/abs/2406.11704
    这份技术报告伴随英伟达Nemotron-4 340B模型家族的发布,该模型在各类基准上表现出色,尤其擅长合成数据生成,同时开源了其数据生成管线,供后续研究和开发使用。

  • mDPO: Conditional Preference Optimization for Multimodal Large Language Models,作者:Wang, Zhou, Huang 等(6月17日),https://arxiv.org/abs/2406.11839
    mDPO解决了多模态DPO中的无条件偏好问题,通过同时优化图像偏好和语言偏好,并引入奖励锚点,防止选中回答的似然度下降。

  • *** How Do Large Language Models Acquire Factual Knowledge During Pretraining?**,作者:Chang, Park, Ye 等(6月17日),https://arxiv.org/abs/2406.11813

  • Task Me Anything,作者:Zhang, Huang, Ma 等(6月17日),https://arxiv.org/abs/2406.11775
    Task-Me-Anything是一个基准生成引擎,通过从海量图像和视频分类体系中程序化生成任务实例,为多模态大语言模型创建定制化基准。

  • THEANINE: Revisiting Memory Management in Long-term Conversations with Timeline-augmented Response Generation,作者:Kim, Ong, Kwon 等(6月16日),https://arxiv.org/abs/2406.10996
    Theanine通过使用记忆时间线(展示过往事件发展和因果关系的系列记忆)来增强大语言模型的回复生成,提升模型从冗长对话历史中回忆和利用信息的能力。

  • Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs,作者:Yang, Ding, Lin 等(6月14日),https://arxiv.org/abs/2406.10216
    该研究提出,在RLHF中通过保留基座模型的语言模型头、加入文本生成损失来正则化隐藏状态,同时学习奖励头,以此提升奖励模型的泛化能力,从而提升分布外任务的表现,缓解奖励过优化问题。

  • Be like a Goldfish, Don’t Memorize! Mitigating Memorization in Generative LLMs,作者:Hans, Wen, Jain 等(6月14日),https://arxiv.org/abs/2406.10209
    “金鱼损失”技术通过在训练时随机从损失计算中排除一部分token,减少大语言模型的记忆行为,防止模型从训练数据中学到完整的逐字序列。

  • Bootstrapping Language Models with DPO Implicit Rewards,作者:Chen, Liu, Du 等(6月14日),https://arxiv.org/abs/2406.09760
    研究者发现,利用直接偏好优化(DPO)过程中生成的对齐模型(一种隐式奖励模型),本身就可以用来生成偏好数据集,进一步大幅提升模型自身的性能。

  • FouRA: Fourier Low Rank Adaptation,作者:Borse, Kadambi, Pandey 等(6月13日),https://arxiv.org/abs/2406.08798
    该研究提出了FouRA——一种在傅里叶域运行的新型低秩适配(LoRA)方法,采用自适应秩选择,解决了LoRA微调的文生图扩散模型中的数据复制和分布崩塌问题,同时提升了图像质量和泛化能力。

  • *** An Image is Worth More Than 16×16 Patches: Exploring Transformers on Individual Pixels**,作者:Nguyen, Mahmoud Assran, Jain 等(6月13日),https://arxiv.org/abs/2406.09415
    该研究表明,普通Transformer将单个像素作为token,就能在各种计算机视觉任务中达到高性能。这挑战了现代视觉架构中基于局部性的归纳偏置的必要性,也为未来计算机视觉领域的神经网络设计提供了新的可能。

  • MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer Decoding,作者:Zuhri, Adilazuarda, Purwarianti, Aji(6月13日),https://arxiv.org/abs/2406.09297
    该研究提出了多层键值(MLKV)共享技术,这是一种将键值(KV)缓存跨Transformer层扩展的新技术。相比多查询注意力(MQA)和分组查询注意力(GQA)等现有方法,它大幅降低了自回归推理时的显存占用,同时保持了自然语言处理任务的性能。

  • Transformers Meet Neural Algorithmic Reasoners,作者:Bounsi, Ibarz, Dudzik 等(6月13日),https://arxiv.org/abs/2406.09308
    TransNAR是一种混合架构,将Transformer与基于图神经网络的神经算法推理器(NAR)相结合,让Transformer能够利用NAR强大的计算能力,同时保持出色的自然语言理解能力,从而提升算法推理任务的表现。

  • Discovering Preference Optimization Algorithms with and for Large Language Models,作者:Lu, Holt, Fanconi 等(6月12日),https://arxiv.org/abs/2406.08414
    提出的“发现偏好优化”方法,利用大语言模型自动发现并实现新的偏好优化算法,以提升大语言模型的输出效果。

  • *** An Empirical Study of Mamba-based Language Models**,作者:Waleffe, Byeon, Riach 等(6月12日),https://arxiv.org/abs/2406.07887
    该研究对比了在大规模数据集上训练的80亿参数状态空间模型(Mamba、Mamba-2)和Transformer模型。研究发现,虽然纯状态空间模型在很多任务上持平甚至超过Transformer,但在需要强复制能力、上下文内学习或长上下文推理的任务上仍有差距;不过混合架构似乎能集两者之长。

  • *** Large Language Models Must Be Taught to Know What They Don’t Know**,作者:Kapoor, Gruver, Roberts 等(6月12日),https://arxiv.org/abs/2406.08391
    该研究证明,用少量分级样本对大语言模型进行微调,能得到比仅靠提示更可靠的不确定性估计,得到的模型能够估算自身和其他模型的不确定性。

  • Large Language Model Unlearning via Embedding-Corrupted Prompts,作者:Liu, Flannigan, Liu(6月12日),https://arxiv.org/abs/2406.07933
    该研究提出了嵌入损坏提示法,一种大语言模型选择性知识遗忘的方法,利用提示分类和嵌入损坏实现定向遗忘,在各种模型规模下副作用都很小。

  • What If We Recaption Billions of Web Images with LLaMA-3?,作者:Li, Tu, Hui 等(6月12日),https://arxiv.org/abs/2406.08478
    该研究证明,使用微调后的Llama 3驱动的LLaVA-1.5多模态大语言模型,为DataComp-1B数据集中的13亿张图片重新生成说明文字,能显著提升视觉语言模型在各类任务中的表现。

  • *** Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing**,作者:Xu, Jiang, Niu 等(6月12日),https://arxiv.org/abs/2406.08464
    研究者提出了一种合成指令数据生成方法,能从Llama-3-Instruct生成30万条高质量指令-回答对;这些数据可用于有监督指令微调,在无需实际对齐步骤的情况下,就能媲美对齐后的大语言模型性能。

  • *** Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling**(6月11日),https://arxiv.org/abs/2406.07522
    Samba是一种混合模型,将选择性状态空间模型(可以理解为Mamba)与滑动窗口注意力相结合,能高效扩展到38亿参数。

  • *** Never Miss A Beat: An Efficient Recipe for Context Window Extension of Large Language Models with Consistent “Middle” Enhancement**,作者:Wu, Zhao, Zheng(6月11日),https://arxiv.org/abs/2406.07138
    CREAM是一种训练高效的大语言模型上下文长度扩展方法,通过插值位置编码,并使用截断高斯函数来优先考虑中间上下文信息。

  • Simple and Effective Masked Diffusion Language Models,作者:Sahoo, Arriola, Schiff 等(6月11日),https://arxiv.org/abs/2406.07524
    这项工作证明,经过有效训练策略和简化目标训练的掩码离散扩散模型,能大幅缩小与自回归方法在语言建模上的性能差距。

  • TextGrad: Automatic “Differentiation” via Text,作者:Yuksekgonul, Bianchi, Boen 等(6月11日),https://arxiv.org/abs/2406.07496
    TextGrad是一个框架,利用大语言模型对文本反馈进行“反向传播”,用于优化复合AI系统中的基础组件(比如“工具调用器”“搜索引擎”等)。

  • An Image is Worth 32 Tokens for Reconstruction and Generation,作者:Yu, Weber, Deng 等(6月11日),https://arxiv.org/abs/2406.07550
    作者提出了一种基于Transformer的一维图像生成分词器,能将256×256×3的图像压缩为仅32个离散token。

  • *** Self-Tuning: Instructing LLMs to Effectively Acquire New Knowledge through Self-Teaching**,作者:Zhang, Peng, Zhou 等(6月10日),https://arxiv.org/abs/2406.06326
    自调优框架通过围绕记忆、理解和自我反思的自教学任务,提升大语言模型从原始文档中获取知识的能力。

  • Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters,作者:Song, Xie, Zhang 等(6月10日),https://arxiv.org/abs/2406.05955
    本文提出了dReLU激活函数和优化的训练数据混合方案,以提升大语言模型的激活稀疏性。

  • Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning,作者:Kim, Paranjape, Khot, Hajishirzi(6月10日),https://arxiv.org/abs/2406.06469
    Husky是一个开源语言智能体,在统一的动作空间中学习推理,通过在生成动作和执行动作之间迭代,借助专家模型处理涉及数值、表格和知识推理的各类任务。

  • Margin-aware Preference Optimization for Aligning Diffusion Models Without Reference,作者:Hong, Paul, Lee 等(6月10日),https://arxiv.org/abs/2406.06424
    为解决RLHF和DPO等传统对齐技术的局限,作者提出了面向文生图扩散模型的边距感知偏好优化(MaPO),在不使用参考模型的情况下,最大化偏好图像集与非偏好图像集之间的似然边距。

  • *** Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation**,作者:Sun, Jian, Chen 等(6月10日),https://arxiv.org/abs/2406.06525
    作者提出了LlamaGen,将大语言模型的“下一个token预测”范式应用到图像生成中。

  • Creativity Has Left the Chat: The Price of Debiasing Language Models,作者:Mohammidi(6月8日),https://arxiv.org/abs/2406.05587
    该研究揭示,虽然RLHF等对齐技术能减轻大语言模型中的偏差,但也会削弱模型的创造力,影响句法和语义多样性——这对需要创造性输出的任务至关重要。

  • 3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination,作者:Yang, Chen, Madaan 等(6月7日),https://arxiv.org/abs/2406.05132
    该研究推出了3D-GRAND数据集,包含40087个家庭场景及配套的620万条场景语言指令,并通过指令微调和3D-POPE基准,提升了3D大语言模型的基础能力,减少了幻觉。

  • BERTs are Generative In-Context Learners,作者:Samuel(6月7日),https://arxiv.org/abs/2406.04823
    本文证明,掩码语言模型(如DeBERTa)可以通过一种简单的推理技术实现上下文内学习:用类似因果注意力掩码结构的掩码token,重新排列输入token的序列。

  • June 7, Mixture-of-Agents Enhances Large Language Model Capabilitieshttps://arxiv.org/abs/2406.04692

  • WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild,作者:Lin, Deng, Chandu 等(6月7日),https://arxiv.org/abs/2406.04770
    作者推出了一个用真实用户查询评测大语言模型的自动化评估框架,包含1024个任务和两项先进指标WB-Reward和WB-Score,通过任务特定检查清单和结构化解释,提供可靠、可解释的自动评判结果。

  • CRAG — Comprehensive RAG Benchmark,作者:Yang, Sun, Xin 等(6月7日),https://arxiv.org/abs/2406.04744
    该研究推出了一个事实问答数据集,包含4409个问答对及模拟网页和知识图谱搜索的模拟API,旨在真实反映多样化、动态变化的现实世界问答任务。

  • Boosting Large-scale Parallel Training Efficiency with C4: A Communication-Driven Approach,作者:Dong, Luo, Zhang 等(6月7日),https://arxiv.org/abs/2406.04594
    该研究推出了C4——一种面向大语言模型并行训练的通信驱动方案,能快速识别并隔离硬件故障,同时优化流量规划以减少网络拥塞,可将故障导致的开销降低最多30%,运行时性能提升最多15%。

  • Step-aware Preference Optimization: Aligning Preference with Denoising Performance at Each Step,作者:Liang, Yuan, Gu 等(6月6日),https://arxiv.org/abs/2406.04314
    该研究提出了步骤感知偏好优化——一种后训练方法,能独立评估并调整文生图扩散模型中每一步的去噪性能,在图像对齐和美学效果上优于Diffusion-DPO,同时训练效率提升20倍。

  • *** Are We Done with MMLU?**,作者:Gema, Leang, Hong 等(6月6日),https://arxiv.org/abs/2406.04127
    该研究指出了广泛使用的MMLU基准中存在大量错误,创建了重新标注的子集MMLU-Redux,揭示了已报告的模型性能存在显著偏差,并呼吁修订MMLU以提升其可靠性。

  • *** Transformers Need Glasses! Information Over-Squashing in Language Tasks**,作者:Barbero, Banino, Kapturowski 等(6月6日),https://arxiv.org/abs/2406.04267
    该研究分析了大语言模型(具体来说是仅解码器Transformer)中的信息传播,揭示了一种表示崩塌现象:不同的输入序列可能生成极其接近的最终token表示,导致计数、复制等任务出错,并且模型对特定输入token的敏感度下降。

  • The Prompt Report: A Systematic Survey of Prompting Techniques,作者:Schulhoff, Ilie, Balepur 等(6月6日),https://arxiv.org/abs/2406.06608
    这篇长达76页的论文旨在为理解提示和提示工程技术提供一个清晰、系统的框架。

  • Buffer of Thoughts: Thought-Augmented Reasoning with Large Language Models,作者:Yang, Yu, Zhang 等(6月6日),https://arxiv.org/abs/2406.04271
    这种“思维缓冲区”方法,通过检索并实例化思维模板(即通用的问题解决蓝图)来提升大语言模型在各领域的推理能力。

  • Block Transformer: Global-to-Local Language Modeling for Fast Inference,作者:Ho, Bae, Kim 等(6月4日),https://arxiv.org/abs/2406.02657
    提出的Block Transformer将计算量大的全局注意力限制在低层的固定大小token块上,在高层使用快速的局部注意力,将推理吞吐量提升了10-20倍。

  • *** Scalable MatMul-free Language Modeling**,作者:Zhu, Zhang, Sifferman 等(6月4日),https://arxiv.org/abs/2406.02528
    本文提出了一种可扩展的无矩阵乘法语言模型架构,用元素级乘积和三值权重累加替代矩阵乘法,即使在十亿参数规模下也能保持良好性能。

  • Towards Scalable Automated Alignment of LLMs: A Survey,作者:Cao, Lu, Lu 等(6月3日),https://arxiv.org/abs/2406.01252
    本文综述了近期兴起的大语言模型自动对齐方法,这些方法通常应用于大语言模型开发流程中的指令微调步骤之后。

  • The Geometry of Categorical and Hierarchical Concepts in Large Language Models,作者:Park, Choe, Jiang, Veitch(6月3日),https://arxiv.org/abs/2406.01506
    本文基于Gemma大语言模型,拓展了线性表示假说,证明了类别概念是单纯形、层级关系是正交的、复杂概念是多胞形,并使用957个WordNet概念进行了验证。

  • OLoRA: Orthonormal Low-Rank Adaptation of Large Language Models,作者:Büyükakyüz(6月3日),https://arxiv.org/abs/2406.01775
    OLoRA是对低秩适配(LoRA)的改进,通过QR分解实现正交矩阵初始化,与标准LoRA相比,加快了大语言模型的训练收敛速度。

  • Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models,作者:Wei, Zhu, Zhao 等(6月3日),https://arxiv.org/abs/2406.06563
    这份报告介绍了从已有的130亿参数稠密(非混合专家)模型,开发1460亿参数混合专家大语言模型的部分思路和方法。

  • Show, Don’t Tell: Aligning Language Models with Demonstrated Feedback,作者:Shaikh, Lam, Hejna 等(6月2日),https://arxiv.org/abs/2406.00888
    提出的方法用不到10个示范作为反馈,将大语言模型的输出与特定用户行为对齐,核心思路借鉴了模仿学习。


本杂志是个人兴趣项目,没有直接的商业回报。不过,如果您愿意支持我,可以考虑购买我的书:https://sebastianraschka.com/books 。如果您觉得这些书有洞见、对您有帮助,也欢迎推荐给您的朋友和同事。(也欢迎在亚马逊上分享您的反馈:https://www.amazon.com/Machine-Learning-AI-Essential-Questions/dp/1718503768/ref=sr_1_1?crid=1566EI5BQC9U0&dib=eyJ2IjoiMSJ9.4oCd5DaBraiVbzZDag-sX4dJQTIguc2mCbDGm1UCKmulcZsTRWmz–_y1AwHt5OmSFglsDpUXQO6FJ_fhs3n9qizrIqlU4STsWxFGor7WdW0QRtPtWgyzz8w0C3PHW8uwsDMJLN4VxjnFIkMizRHBoiHZjLGslLzmiLpzLTTlhbS7bSkGnUcb1wKkartwWqVtq8c8KbnTdEJ34G6dOlf_YIfsYyG2XOGXneQuNmWh8.AZ3qpJ95F8x9PhDbClERH4iibU3U4r4CTLdtf2r1Nyc&dib_tag=se&keywords=Machine+Learning+Q+and+AI&qid=1717088426&sprefix=%2Caps%2C275&sr=8-1 ,这对我也很有帮助!)

figure18

http://mng.bz/M96o , https://nostarch.com/machine-learning-and-ai-beyond-basics , 以及 https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/

您的支持意义重大!非常感谢!

Leave a Reply

Your email address will not be published. Required fields are marked *

*