【转载】LoRA的继任者、小型微调大语言模型 vs 通用大语言模型,以及透明化大语言模型研究

原文地址:A LoRA Successor, Small Finetuned LLMs Vs Generalist LLMs, and Transparent LLM Research,by Sebastian Raschka, on 2024-03-03

LoRA的继任者、小型微调大语言模型 vs 通用大语言模型,以及透明化大语言模型研究

2024年3月3日

AI研究领域又度过了精彩纷呈的一个月。本月,我将介绍两款全新的开源大语言模型(LLM)、关于小型微调大语言模型的深度洞察,以及一种新型参数高效的大语言模型微调技术。

上述两款大语言模型之所以脱颖而出,原因有几点。其中一款大语言模型(OLMo)是完全开源的,这意味着从训练代码、数据集到日志文件的所有内容都全部公开共享。

另一款大语言模型(Gemma)同样提供开源权重,在多项基准测试中取得了当前最优的性能,并且以大幅优势超越了Llama 2 7B、Mistral 7B等同尺寸的主流大语言模型。

不过,在讨论这款新型大语言模型的架构优化细节之前,我们先从下文的《Tiny Titans》论文入手,更深入地探讨小型大语言模型的实用价值。

1) Tiny Titans:小型语言模型能否在真实会议摘要任务中实现越级表现?

在这篇论文(https://arxiv.org/abs/2402.00841)中,研究人员试图解答一个价值百万美元的问题:参数量低于20亿的“小型”微调大语言模型,能否超越Llama 2 Chat这类更大的开源大语言模型,以及GPT-3.5这类闭源商业大语言模型?

答案并非非黑即白。在讨论细节之前,下表汇总了相关实验结果。

figure01

带标注的表格(来源:https://arxiv.org/abs/2402.00841),展示了现有大语言模型与小型微调大语言模型的文本摘要性能对比

在上表中,“零样本(zero-shot)”指这些模型未在会议数据和摘要任务上进行额外微调,而是直接开箱即用——要么通过开源权重直接部署(如Llama 2 7B Chat),要么调用其商业API(如GPT-3.5)。

但需要注意一个重要前提:尽管这些“零样本”模型没有经过论文作者的额外微调,但它们在原生训练阶段已经完成了大规模的指令微调,其中就包含文本摘要生成任务。

从结果来看,FLAN-T5-Large在领域内数据集(即互联网上无法获取的真实会议数据)类别中表现一骑绝尘,因此我们可以部分给出肯定答案:小型微调大语言模型确实能够超越更大的现有大语言模型。但为什么它在QMSUM-I数据集上的表现远逊于GPT-3.5、Mixtral-8x7B这类模型?原因可能有两方面。

第一,GPT-3.5和Mixtral在训练过程中可能已经使用了部分公开的QMSUM数据(由于模型训练所用数据的细节并未公开,我们无法下定论)。

第二种合理的解释是,FLAN-T5-Large的上下文窗口限制为2048个token,而QMSUM数据集的输入长度是它的4-5倍,如下表所示。

figure02

带标注的表格(来源:https://arxiv.org/abs/2402.00841),展示了不同数据集的文本长度差异

自动化评估指标是否可靠?

除了上文讨论的截断问题之外,ROUGE分数这类自动化评估指标(相关代码:https://github.com/rasbt/MachineLearning-QandAI-book/blob/main/supplementary/q19-evaluation-llms/rouge.ipynb)究竟是否可靠?

总体而言,摘要任务的ROUGE分数被认为可以有效评估机器生成摘要与参考摘要之间的重合度,尤其是在n元语法重叠、词语序列和词对匹配层面。但这类指标无法全面衡量摘要在连贯性、可读性或事实准确性方面的质量,因此并非完美的评估工具。为此,研究人员也开展了人工评估,结果汇总如下表。

figure03

带标注的表格(来源:https://arxiv.org/abs/2402.00841),展示人工评估结果,分数越高表现越好

基于上表结果,FLAN在领域内数据集上的表现显著优于Llama 2 7B,与GPT-3.5基本持平。而它在QMSUM-I数据集上的短板,与我们之前看ROUGE分数时观察到的情况一致。

另外需要注意的是,金标准参考摘要是由GPT-4生成的。假设GPT-3.5的预训练和指令微调方式与GPT-4相近,我推测结果会略微偏向GPT-3.5。

为什么小型模型的表现相对欠佳?

总体来看,除了在领域内数据集上的FLAN-T5之外,我们发现小型微调大语言模型的表现普遍弱于更大的大语言模型。

原因之一是它们的上下文窗口有限,导致输入数据被截断,这对生成摘要任务来说十分不利。可以通过在训练和推理阶段扩展上下文长度来解决这个问题,而这并不一定需要增大模型参数量。

另一个原因可能是模型在中间状态下存储和处理信息的能力更弱。要验证这一点,我们至少需要训练一批上下文长度各不相同的大语言模型进行对比。

本次实验中,小型大语言模型的目标任务是摘要任务微调。但摘要微调本身也是大型闭源大语言模型训练中的重要组成部分。换句话说,我们对比的其实是“大型微调大语言模型”和“小型微调大语言模型”。如果换成大语言模型指令微调流程中从未覆盖过的全新领域特定任务,对比结果会很有意思。

核心结论

Mixtral(我在2024年1月的研究论文盘点中介绍过:https://magazine.sebastianraschka.com/p/research-papers-in-january-2024)的表现十分出色!而参数量小得多的FLAN-T5,在特定微调任务中依然是非常优秀的模型。

2) DoRA:权重分解式低秩适配

在这篇论文(https://arxiv.org/abs/2402.09353)中,研究人员提出了LoRA的一种创新替代方案。LoRA是目前大语言模型和视觉Transformer中应用最广泛的参数高效微调方法。我原本只打算在本文中简单介绍它,但这个方法实在太有意思,我几周前就忍不住自己动手实现了一遍。

想要了解更多细节和论文解读的读者,可以查看我写的这篇深度文章,其中包含了DoRA的从零实现指南:
https://magazine.sebastianraschka.com/p/lora-and-dora-from-scratch

《Ahead of AI》是一份由读者支持的出版物。想要接收新文章并支持我的创作,欢迎注册免费订阅或付费订阅。

3) OLMo:推动语言模型科学发展

论文(https://arxiv.org/abs/2402.00838)中的“OLMo”全称为Open Language Model(开放语言模型),是近期发布的一款开源大语言模型,提供10亿和70亿参数量两个版本。OLMo的特别之处在于,研究人员不仅公开了模型权重(https://huggingface.co/allenai/OLMo-7B),还公开了全部训练细节,包括训练代码(https://github.com/allenai/OLMo)、训练数据集Dolma(https://huggingface.co/datasets/allenai/dolma)、模型评估代码(https://github.com/allenai/OLMo-Eval)、训练日志报告(https://wandb.ai/ai2-llm/OLMo-7B/reports/OLMo-7B–Vmlldzo2NzQyMzk5)以及指令微调代码(https://github.com/allenai/open-instruct)。

我非常推荐大家去读OLMo的原论文。虽然我希望论文能包含更多深度洞察和分析,但光是里面列出的各类架构细节选择和超参数配置,就已经对我自己的实验很有帮助了。这里分享两个值得注意的设计:

  • 他们在所有线性层中禁用了偏置向量(与Llama的设计类似),以提升训练稳定性。
  • 他们没有使用标准的层归一化(LayerNorm,包含可训练的缩放和偏移参数)或RMSNorm,而是采用了一种不含任何可训练参数的层归一化变体。

此外,下表列出了OLMo与其他主流大语言模型在架构上的核心差异。

figure04

OLMo架构细节(来源:OLMo论文,https://arxiv.org/abs/2402.00838

不仅如此,OLMo论文还给出了AdamW优化器的超参数和学习率的详细信息,汇总如下表。

figure05

OLMo优化器配置(来源:OLMo论文,https://arxiv.org/abs/2402.00838

在学习率方面,他们采用了5000步(约210亿token)的热身阶段,随后使用线性衰减(而非余弦衰减)将学习率降至表中数值的十分之一。同时,他们将梯度的L2范数最大值裁剪为1.0。

最后值得一提的是,他们使用了线性学习率调度而非余弦调度来衰减学习率,如下对比表所示:

figure06

OLMo训练参数(来源:OLMo论文,https://arxiv.org/abs/2402.00838

这些设计选择都很有意思,但OLMo的实际性能和其他大语言模型相比如何?结果表明,OLMo的性能与Llama 2和Falcon相当,如下表所示。

figure07

OLMo与其他主流大语言模型对比(来源:OLMo论文,https://arxiv.org/abs/2402.00838

尽管论文没有针对部分超参数和架构选择做额外的消融实验,但所有训练日志都可以在W&B平台上查看,我们未来几周或几个月里可以自己做分析。总的来说,我认为OLMo是对开源社区和研究领域的极佳贡献,非常感谢作者公开了所有代码和训练产物。

从零搭建大语言模型

如果你想要通过从零搭建大语言模型(仅使用PyTorch,不借助外部大语言模型库)来加深理解,我的新书《从零构建大语言模型》(https://www.manning.com/books/build-a-large-language-model-from-scratch)的第4章已经在Manning的抢先体验版中上线了。

figure08

《从零构建大语言模型》相关仓库:https://github.com/rasbt/LLMs-from-scratch,书籍地址:https://www.manning.com/books/build-a-large-language-model-from-scratch

4) Gemma

当然,我们必须聊聊Gemma——谷歌近期推出的大语言模型系列。Gemma大语言模型基于Gemini架构构建,共有四个版本:预训练的Gemma 2B和7B基础模型,以及经过指令微调的Gemma 2B和7B模型。

除了模型权重(https://huggingface.co/google/gemma-7b),谷歌还发布了一份技术报告(https://storage.googleapis.com/deepmind-media/gemma/gemma-report.pdf),我们将在下文详细解读。

Gemma的性能表现

Gemma最引人注目的一点,是它相比Llama 2 7B、Mistral等主流开源模型的出色性能,如下图所示:

figure09

带标注的性能对比图,来源:https://storage.googleapis.com/deepmind-media/gemma/gemma-report.pdf

目前尚不完全清楚上述分数对应的是预训练版本还是指令微调版本;不过我推测,这些结果大概率代表指令微调模型的性能。

Gemma为何能有如此出色的表现?论文中没有明确说明原因,但我推测主要得益于以下两点:

  • 25.6万的超大词表(相比之下,Llama的词表仅为3.2万);
  • 规模达6万亿token的海量训练数据集(Llama的训练数据量仅为其三分之一)。

此外,我和同事在将Gemma接入我们的开源项目Lit-GPT(https://github.com/Lightning-AI/lit-gpt)时发现,它的整体架构与Llama 2高度相似。我们在下一节详细分析这一点。

Gemma架构深度解析

Gemma背后有哪些有意思的设计选择?如上所述,它的词表规模很大,对应的嵌入矩阵尺寸也很大。下表对比了Gemma、Llama 2 7B和我们之前讨论过的OLMo 7B的架构概览。

figure10

Gemma、Llama 2与OLMo的架构对比。表格来源:https://storage.googleapis.com/deepmind-media/gemma/gemma-report.pdf

模型规模

另外值得注意的是,Gemma 2B采用了多查询注意力,而Gemma 7B没有。此外,尽管Gemma 7B的总层数更少(28层对比32层),但它的前馈层规模比Llama 2更大。不过,虽然层数更少,Gemma的参数量却相当可观。

尽管它被称作Gemma 7B,但实际总参数量达到93亿;如果考虑权重共享(weight tying),参数量为85亿。权重共享指输入嵌入层和输出投影层使用同一套权重,GPT-2和OLMo 1B都采用了这种设计(OLMo 7B训练时没有使用权重共享)。

归一化层

另一个值得关注的细节是论文中的这段描述:

归一化位置:我们对每个Transformer子层的输入和输出都做归一化,这与仅对其中一侧做归一化的常规做法不同。我们采用RMSNorm(Zhang和Sennrich,2019)作为归一化层。

乍一看,这似乎意味着Gemma在每个Transformer块之后都额外加了一层RMSNorm。但查看源码(https://github.com/keras-team/keras-nlp/blob/34a2cba28f6cb501ade97d6a9e308705d5095ec7/keras_nlp/models/gemma/rms_normalization.py#L39)后会发现,Gemma采用的其实就是GPT-2、Llama 2等其他大语言模型通用的前置归一化方案,如下图所示。

figure11

GPT、Llama 2等大语言模型的典型层归一化位置:Gemma在这一点上并无创新。(图出自我的著作《从零构建大语言模型》,https://www.manning.com/books/build-a-large-language-model-from-scratch

GeGLU激活函数

Gemma与其他架构的一个显著区别是它使用了GeGLU激活函数,该函数出自2020年的这篇论文:https://arxiv.org/abs/2002.05202

GeLU(高斯误差线性单元)是一种越来越流行的激活函数,常作为传统ReLU的替代方案。GeLU的优势在于,它既能引入非线性,又能让负输入值的梯度继续传播,解决了ReLU完全阻断负值的缺陷。

figure12

GELU与ReLU对比图(图出自我的著作《从零构建大语言模型》,https://www.manning.com/books/build-a-large-language-model-from-scratch

而GeGLU是GELU的门控线性单元变体,它将激活分为两部分:一部分是类S型的激活,另一部分是线性投影,两部分的输出按元素相乘,如下图所示:

figure13

如上图所示,GeGLU与Llama 2、Mistral等大语言模型使用的SwiGLU激活函数原理类似,区别仅在于它的基础激活函数是GELU而非Swish。

看这些激活函数的伪代码会更容易理解:

# Feedforward module with GELU (GPT-2)
x = linear(x)
x = gelu(x)
x = linear_projection(x)

# Feedforward module with SwiGLU (Llama 2)
x_1 = self.linear_1(x)
x_2 = self.linear_2(x)
x = silu(x_1) * x_2
x = linear_projection(x)

# Feedforward module with GeGLU (Gemma)
x_1 = self.linear_1(x)
x_2 = self.linear_2(x)
x = gelu(x_1) * x_2
x = linear_projection(x)

需要注意的是,与使用普通GELU的前馈模块(只有一个线性层)相比,使用SwiGLU和GeGLU的前馈模块实际上多了一个线性层(分为linear_1和linear_2)。不过在GeGLU和SwiGLU前馈模块中,linear_1和linear_2通常是将单个线性层拆分为两部分得到的,因此不一定会增加参数量。

GeGLU比SwiGLU更好吗?目前还没有消融实验能给出定论。我猜测这个选择可能也只是为了让Gemma和Llama 2略有区分度。

其他设计选择

此外,在为Lit-GPT添加Gemma支持的过程中(https://github.com/Lightning-AI/lit-gpt/pull/941),我们还发现了一些其他有意思的设计选择。

例如,Gemma在RMSNorm层中加了+1的偏移量,并且用隐藏层维度的平方根对嵌入做归一化。后者其实是原始Transformer论文(https://arxiv.org/abs/1706.03762)中的做法,但GPT-2、OLMo等同样使用权重共享的模型并没有这么做。

figure14

摘自《Attention Is All You Need》论文,https://arxiv.org/abs/1706.03762

这些细节在论文中没有提及或讨论,其作用也尚不明确。

我想到一个可能的解释:尽管线性层和嵌入层的本质是一样的(详见我的文章:https://github.com/rasbt/LLMs-from-scratch/blob/main/ch02/03_bonus_embedding-vs-matmul/embeddings-and-linear-layers.ipynb),但两者的初始权重尺度不同。而谷歌的研究人员习惯用TensorFlow做实验,乘以嵌入维度的平方根或许是为了让权重尺度更合理,正如我在下面的示例代码中展示的那样。

figure15

将权重乘以嵌入维度的平方根后,权重的尺度就和标准线性层中的权重一致了。

结论

Gemma是开源大语言模型生态的优秀补充。看起来7B版本是一款性能极强的模型,在实际应用场景中有望替代Llama 2和Mistral。

此外,既然目前已经有大量7B左右的开源模型,Gemma 2B反而更值得关注——它可以轻松在单张GPU上运行。看看它和同样27亿参数量的phi-2相比表现如何,会很有意思。

如果你想通过上述的Lit-GPT实现实际使用Gemma,我创建了一个Studio环境:https://lightning.ai/lightning-ai/studios/understanding-using-and-finetuning-gemma

figure16

通过Lit-GPT Studio使用Gemma(地址:https://lightning.ai/lightning-ai/studios/understanding-using-and-finetuning-gemma

2月其他值得关注的研究论文

以下是本月我发现的其他一些有意思的论文。由于列表较长,我用星号(*)标注了10篇我认为特别值得关注的论文。不过请注意,这份列表及解读仅基于我个人的兴趣和与我自身项目的相关性。

  1. 《Griffin:将门控线性循环与局部注意力结合,打造高效语言模型》,作者:De、Smith、Fernando等,2月29日,https://arxiv.org/abs/2402.19427
    该论文提出了Hawk和Griffin两种架构:前者是循环神经网络大语言模型,后者是将循环神经网络单元与局部注意力结合的混合架构,为基于Transformer的大语言模型提供了新的高效替代方案。

  2. 《当缩放定律遇上大语言模型微调:数据、模型与微调方法的影响》,作者:Zhang、Liu、Cherry、Firat,2月27日,https://arxiv.org/abs/2402.17193
    该研究系统探究了模型规模、预训练数据量、微调参数量、微调数据量等缩放因素对大语言模型微调性能的影响,在大语言模型规模超过微调数据规模的场景下,对比了全参数微调与参数高效微调(包括提示微调、LoRA)的效果。

  3. 《Sora生成的视频具备惊人的几何一致性》,作者:Li、Zhou、Zhang等,2月27日,https://arxiv.org/abs/2402.17403
    该论文提出了一套基准测试方法,用于评估Sora模型生成视频对真实物理规律的还原度:将生成的视频转换为3D模型,以3D重建的准确率作为指标衡量模型对物理原理的遵循程度。研究发现,Sora的表现远优于Pika等其他文生视频模型。

  4. * 《1比特大语言模型时代:所有大语言模型都可压缩至1.58比特》,作者:Ma、Wang、Ma等,2月27日,https://arxiv.org/abs/2402.17764
    该研究提出了一种1比特大语言模型变体(仅支持-1、0、1三种取值),在推理阶段的困惑度和下游任务表现上,与传统16比特精度的大语言模型相当。

  5. 《Genie:生成式交互环境》,作者:Bruce、Dennis、Edwards等,2月23日,https://arxiv.org/abs/2402.15391
    Genie是一款开创性的110亿参数量生成式交互环境,基于时空Transformer构建,通过互联网视频无监督训练而成,能够根据文本、图像和草图生成无限多样、可控制动作的虚拟世界。

  6. * 《回归基础:重新审视基于人类反馈学习的REINFORCE式优化方法在大语言模型中的应用》,作者:Ahmadian、Cremer、Galle等,2月22日,https://arxiv.org/abs/2402.14740
    该研究表明,在基于人类反馈的强化学习(RLHF)大语言模型对齐任务中,更简单的REINFORCE式优化方法比近端策略优化(PPO)效率更高、效果更好。

  7. 《TinyLLaVA:小型多模态大模型框架》,作者:Zhou、Hu、Weng等,2月22日,https://arxiv.org/abs/2402.14289
    TinyLLaVA框架证明,小型多模态大模型通过使用高质量数据和优化训练,能够达到甚至超越更大模型的表现——其最佳模型TinyLLaVA-3.1B的性能超过了现有7B级别的多模态模型。

  8. 《大语言模型用于数据标注:综述》,作者:Tan、Beigi、Wang等,2月21日,https://arxiv.org/abs/2402.13446
    该论文探讨了GPT-4等大语言模型在自动化数据标注这一劳动密集型流程中的潜力,重点关注大语言模型在数据标注中的应用、对大语言模型生成标注的评估,以及基于这些标注的模型学习。

  9. * 《LongRoPE:将大语言模型上下文窗口扩展至200万token以上》,作者:Ding、Zhang、Zhang等,2月21日,https://arxiv.org/abs/2402.13753
    LongRoPE是一种新方法,仅需少量微调即可将预训练大语言模型的上下文窗口扩展至204.8万token,通过改进位置插值和渐进式扩展策略,在不同上下文长度下都能保持性能稳定。

  10. 《YOLOv9:利用可编程梯度信息学习你想要的内容》,作者:Wang、Yeh、Liao,2月21日,https://arxiv.org/abs/2402.13616
    该研究针对深度监督机制的信息瓶颈和适用性问题提出了解决方案,推出了YOLOv9,在MS COCO数据集上的效率和表现均优于YOLOv8。

  11. 《神经网络扩散》,作者:Wang、Xu、Zhou等,2月20日,https://arxiv.org/abs/2402.13144
    该研究展示了传统上用于图像和视频生成的扩散模型,如何被用于生成高性能的神经网络参数。

  12. * 《LoRA+:大模型的高效低秩适配》,作者:Hayou、Ghosh、Yu,2月19日,https://arxiv.org/abs/2402.12354
    该论文提出了LoRA+,对原始低秩适配(LoRA)方法做了改进:对适配器矩阵A和B使用不同的学习率以增强特征学习,在不增加额外计算成本的前提下,实现了1-2%的性能提升,微调速度最高可达原来的2倍。

  13. 《迈向跨分词器蒸馏:面向大语言模型的通用对数似然蒸馏损失》,作者:Boizard、Haddad、Hudelot、Colombo,2月19日,https://arxiv.org/abs/2402.12030
    该论文提出了通用对数似然蒸馏损失,能够在不同架构、不同分词器的大语言模型之间实现高效的知识蒸馏,突破了必须使用相同分词器的限制。

  14. 《AnyGPT:基于离散序列建模的统一多模态大语言模型》,作者:Zhan、Dai、Ye、Zhou,2月19日,https://arxiv.org/abs/2402.12226
    AnyGPT是一款多模态语言模型,通过离散表示无缝融合语音、文本、图像和音乐,无需改动大语言模型的核心架构,即可实现灵活的任意模态间交互。

  15. * 《重格式化对齐》,作者:Fan、Li、Zou、Li,2月19日,https://arxiv.org/abs/2402.12219
    该论文提出了ReAlign方法,通过简单的重格式化手段,提升大语言模型微调数据的质量,使其更好地与人类价值观对齐。

  16. 《LongAgent:通过多智能体协作将语言模型上下文扩展至12.8万token》,作者:Zhao、Zu、Xu等,2月18日,https://arxiv.org/abs/2402.11550
    LongAgent通过多智能体协作和智能体间通信机制,提升了大语言模型的长文本处理能力,在文本检索、多跳问答等任务中表现超过GPT-4等模型。

  17. 《Vision-Flan:在视觉指令微调中扩展人工标注任务规模》,作者:Xu、Feng、Shao等,2024年,https://arxiv.org/abs/2402.11690
    该研究提出了Vision-Flan——一个多样化的视觉指令微调数据集,以及一套面向视觉语言模型的两阶段指令微调框架,通过结合专家数据和GPT-4合成数据,解决了泛化性差、存在偏差等问题。

  18. 《OneBit:迈向极低比特大语言模型》,作者:Xu、Han、Yang等,2月17日,https://arxiv.org/abs/2402.11295
    该论文提出了OneBit——一种面向大语言模型的1比特量化感知训练框架,通过新的参数表示和初始化方法,在性能损失极小的情况下,大幅提升了存储和计算效率。

  19. 《FinTral:达到GPT-4水平的多模态金融大语言模型系列》,作者:Bhatia、Nagoudi、Cavusoglu、Abdul-Mageed,2月16日,https://arxiv.org/abs/2402.10986
    FinTral是专为金融分析优化的多模态大语言模型套件,基于Mistral-7B构建,通过领域专属训练和基准测试做了增强,在核心任务上表现超过ChatGPT-3.5和GPT-4,是金融AI领域的优秀案例。

  20. 《生成式表征指令微调》,作者:Muennighoff、Su、Wang等,2月15日,https://arxiv.org/abs/2402.09906
    GRIT是一种新的训练方法,能够让大语言模型GritLM通过遵循指令,在生成任务和嵌入任务中都有出色表现。

  21. 《恢复生成模型的微调前权重》,作者:Horwitz、Kahana、Hoshen,2月15日,https://arxiv.org/abs/2402.10208
    该论文提出了Spectral DeTuning方法,能够从Stable Diffusion、Mistral等大规模微调模型中恢复出微调前的权重。

  22. 《BASE TTS:用10万小时数据打造十亿参数量语音合成模型的经验》,作者:Lajszczak、Cambara、Li等,2月15日,https://arxiv.org/abs/2402.08093
    BASE TTS是亚马逊研究人员推出的新型语音合成模型,基于十亿参数量的Transformer架构,用10万小时数据训练而成,实现了前所未有的语音自然度。

  23. 《Transformer可以实现长度泛化,但鲁棒性不足》,作者:Zhou、Alon、Chen等,2月14日,https://arxiv.org/abs/2402.09371
    该论文探究了语言模型的长度泛化难题,证明标准Transformer通过特定的数据格式和位置编码,可以外推至训练输入长度2.5倍的序列,但这种能力对权重初始化、数据顺序等因素高度敏感。

  24. * 《DoRA:权重分解式低秩适配》,作者:Liu、Wang、Yin等,2月14日,https://arxiv.org/abs/2402.09353
    DoRA是对标准低秩适配(LoRA)的改进,它将预训练权重分解为幅值和方向两部分以实现更高效的参数更新,填补了LoRA这类参数高效微调方法与全参数微调之间的精度差距。

  25. 《混合专家架构为深度强化学习解锁参数缩放能力》,作者:Obando-Ceron、Sokar、Willi等,2月13日,https://arxiv.org/abs/2402.08609
    该论文表明,将混合专家(MoE)模块(尤其是软混合专家)融入基于价值的强化学习网络,能够让模型随规模增长更高效地提升性能,为在强化学习领域建立缩放定律提供了方向。

  26. 《基于RingAttention的百万长度视频与语言世界模型》,作者:Liu、Yan、Zaharia、Abbeel,2月13日,https://arxiv.org/abs/2402.08268
    该研究提出利用RingAttention等最新技术,在超长视频和语言序列组成的海量数据集上训练神经网络。

  27. 《用直接原则反馈抑制“粉红大象”问题》,2月12日,https://arxiv.org/abs/2402.07896
    该研究提出了直接原则反馈(DPF)方法,用于实时调整大语言模型的输出,并在“粉红大象”问题上验证了其效果,成功引导模型避开特定话题。

  28. 《Step-On-Feet微调:通过自举扩展大语言模型的自对齐能力》,作者:Wang、Ma、Meng等,2月12日,https://arxiv.org/abs/2402.07610
    该研究通过Step-On-Feet微调(SOFT)探究了大语言模型的多轮自举自对齐,与单步方法相比,该方法通过迭代对齐和优化训练序列提升了模型性能。

  29. 《Aya模型:经过指令微调的开源多语种语言模型》,作者:Ustun、Aryabumi、Yong等,2月12日,https://arxiv.org/abs/2402.07610
    该研究推出了Aya——一款精通101种语言的多语种生成式语言模型。

  30. 《细粒度混合专家架构的缩放定律》,作者:Jakub Krajewski、Jan Ludziejewski、Kamil Adamczewski等,2月12日,https://arxiv.org/abs/2402.07871
    该研究探究了混合专家(MoE)模型的缩放特性,引入了“粒度”作为调整专家规模的新超参数,并证明了MoE模型优于稠密Transformer模型。

  31. 《利用语言反馈模型改进策略》,作者:Zhong、Misra、Yuan、Cote,2月12日,https://arxiv.org/abs/2402.07876
    语言反馈模型(LFM)利用大语言模型对文本化视觉轨迹的反馈来改进模仿学习,在任务完成率和新环境适配方面优于传统方法,同时还能提供人类可解读的反馈,用于验证最优行为。

  32. 《ODIN:解耦奖励缓解RLHF中的奖励破解问题》,作者:Chen、Zhu、Soselia等,2月11日,https://arxiv.org/abs/2402.07319
    该研究针对大语言模型中的奖励破解问题,设计了更精细的评估协议和改进的奖励模型:通过联合训练两个输出头,让模型更关注内容而非长度,显著降低了长度偏差,提升了策略效果。

  33. 《神经网络可训练性的边界是分形的》,作者:Dickstein,2月9日,https://arxiv.org/abs/2402.06184
    该研究揭示了神经网络训练中存在分形边界,强调在各种配置和规模下,训练动态对超参数的微小调整都极度敏感。

  34. 《混合专家架构中的缓冲区溢出》,作者:Hayes、Shumailov、Yona,2月8日,https://arxiv.org/abs/2402.05526
    该研究表明,混合专家(MoE)模型容易受到基于跨批次依赖的专家路由策略攻击:恶意查询可以影响同一批次中良性查询的输出。

  35. 《基于在线AI反馈的大语言模型直接对齐》,作者:Guo、Zhang、Liu等,2月7日,https://arxiv.org/abs/2402.04792
    该论文提出了一种用于模型训练的在线反馈方法,通过利用大语言模型的实时评估,效果超越了DPO等直接偏好对齐(DAP)方法以及RLHF。

  36. 《无需搜索实现大师级国际象棋水平》,作者:Ruoss、Deletang、Medapati,2月7日,https://arxiv.org/abs/2402.04494
    这篇来自谷歌DeepMind的论文提出了一个“小型”2.7亿参数量的Transformer模型,在1000万局国际象棋对局上训练而成,棋力表现超过了AlphaZero的网络和GPT-3.5-turbo-instruct。

  37. 《Self-Discover:大语言模型自组合推理结构》,作者:Zhou、Pujara、Ren等,2月6日,https://arxiv.org/abs/2402.03620
    SELF-DISCOVER框架让大语言模型能够自主构建推理策略,以更高的效率提升问题解决能力,且具备跨模型适用性,其推理方式可能更接近人类。

  38. 《视觉超对齐:视觉基础模型的弱到强泛化》,作者:Guo、Chen、Wang等,2月6日,https://arxiv.org/abs/2402.03749
    该论文通过自适应置信度损失进行知识蒸馏,探究了视觉基础模型中的弱到强泛化,证明较弱的模型可以有效增强更强模型的性能,是视觉任务AI能力的重要进展。

  39. 《MOMENT:开源时间序列基础模型系列》,作者:Goswami、Szafer、Choudhry等,2月6日,https://arxiv.org/abs/2402.03885
    MOMENT提出了一种基于开源基础模型的通用时间序列分析新方法,通过构建“时间序列堆”数据集,并设计低监督场景下的模型评估基准,解决了时间序列数据集不统一、多数据集训练难度大等挑战。

  40. 《大语言模型下游任务性能的缩放定律》,作者:Isik、Ponomareva、Hazimeh等,2月6日,https://arxiv.org/abs/2402.04177
    该研究探究了预训练数据的规模和相关性如何影响大语言模型的机器翻译性能,发现数据对齐会提升效果,而错位则可能导致结果波动。

  41. 《点积注意力可解模型中位置学习与语义学习的相变》,作者:Cui、Behrens、Krzakala、Zdeborova,2月6日,https://arxiv.org/abs/2402.03902
    该研究探究了点积注意力层如何学习关注数据中的位置或语义,揭示了当数据量足够时,这些层会从位置注意力机制过渡到语义注意力机制,从而超越线性模型的表现。

  42. 《MobileVLM V2:更快更强的视觉语言模型基线》,作者:Chu、Qiao、Zhang等,2月6日,https://arxiv.org/abs/2402.03766
    MobileVLM V2推出了小型高效的视觉语言模型,性能超越更大的模型:17亿版本持平或超过30亿规模的模型,30亿版本则超过70亿以上规模的模型。

  43. 《DeepSeekMath:突破开源语言模型数学推理的极限》,作者:Shao、Wang、Zhu等,2月5日,https://arxiv.org/abs/2402.03300
    DeepSeekMath 7B是在1200亿数学相关token上预训练的大语言模型,通过挖掘网页数据,并引入组相对策略优化(PPO的替代方案)提升数学推理能力,在MATH基准上取得了51.7%的分数,接近Gemini Ultra和GPT-4等顶尖模型的水平。

  44. 《更多智能体就是你所需的全部》,作者:Li、Zhang、Yu、Fu、Ye,2月3日,https://arxiv.org/abs/2402.05120
    该研究表明,通过对多个大语言模型采用简单的多数投票集成方法,可以提升模型性能,且这种提升与现有方法互补,在难度更高的任务中效果更明显。

  45. 《FindingEmo:面向真实场景情感识别的图像数据集》,作者:Mertens、Yargholi、Op de Beeck等,2月2日,https://arxiv.org/abs/2402.01355
    FindingEmo是一个全新的情感识别标注数据集,包含2.5万张图像,聚焦自然场景中的复杂多人情境,数据集和源码均已公开。

  46. * 《LiPO:基于排序学习的列表式偏好优化》,作者:Liu、Qin、Wu等,2月2日,https://arxiv.org/abs/2402.01878
    该研究提出了列表式偏好优化(LiPO)方法,将大语言模型对齐转化为列表排序问题,利用人类反馈进行优化,证明LiPO的效果优于DPO等现有策略优化方法。

  47. * 《跟着我复述:Transformer在复制任务上优于状态空间模型》,作者:Jelassi、Brandfonbrener、Kakade、Malach,2月1日,https://arxiv.org/abs/2402.01032
    该论文证明,尽管状态空间模型在推理效率上有优势,但受限于固定大小的隐状态,在需要复制输入上下文的任务上,它们的表现不如Transformer。

  48. * 《Tiny Titans:小型大语言模型能否在真实会议摘要任务中实现越级表现?》,作者:Fu、Laskar、Khasanonva等,2月1日,https://arxiv.org/abs/2402.00841
    该研究发现,FLAN-T5等紧凑型大语言模型在会议摘要等特定任务上,效率和表现可以持平甚至超越更大的模型,作为高性价比的部署方案具有实用价值。

  49. * 《OLMo:推动语言模型科学发展》,作者:Groeneveld、Beltagy、Walsh等,2月1日,https://arxiv.org/abs/2402.00838
    这份技术报告介绍了完全开源的大语言模型OLMo,以及包含训练数据、训练代码、评估代码在内的完整框架。

  50. 《大语言模型的高效探索》,作者:Dwaracherla、Asghari、Hao、Van Roy,2月1日,https://arxiv.org/abs/2402.00396
    该研究论文证明,高效探索生成人类反馈查询的不同方式,能够通过基于收到的反馈持续优化奖励模型,用更少的查询大幅提升大语言模型的性能。

《机器学习与AI问答》

我非常激动,《机器学习与AI问答》终于要出版了,这周我刚收到了作者样书。

如果你正在寻找新的学习资源来加深对机器学习和AI概念的理解,《机器学习与AI问答》以通俗易懂的方式讲解了中高级概念。

figure17

书籍地址:https://nostarch.com/machine-learning-and-ai-beyond-basics

《Ahead of AI》是我的个人兴趣项目,没有直接的商业收益。如果你愿意支持我的工作,非常欢迎购买我的书。
https://nostarch.com/machine-learning-and-ai-beyond-basics
https://www.amazon.com/Machine-Learning-AI-Beyond-Basics/dp/1718503768

Leave a Reply

Your email address will not be published. Required fields are marked *

*