【转载】面向人类反馈的直接偏好优化及更多AI研究

原文地址:Direct-Preference Optimization for Human Feedback and More, by Sebastian Raschka, on 2023-06-10

面向人类反馈的直接偏好优化及更多AI研究

本文精选并汇总了23项AI研究亮点。当前自然语言处理和计算机视觉领域正涌现出大量令人振奋的进展!

此外,如果你对上月的研究亮点感兴趣,可以通过以下链接查看:
https://magazine.sebastianraschka.com/p/ai-research-highlights-in-3-sentences

大语言模型

直接偏好优化:你的语言模型本质上是一个奖励模型(https://arxiv.org/abs/2305.18290,2023年5月29日)

直接偏好优化(DPO)是一种替代基于近端策略优化(PPO)的人类反馈强化学习(RLHF)的全新方案,后者被用于ChatGPT等指令微调模型。该研究表明,RLHF中用于拟合奖励模型的交叉熵损失,可直接用于微调大语言模型。根据基准测试结果,使用DPO效率更高,且在响应质量上往往优于RLHF/PPO。

figure01
标注图源自:https://arxiv.org/abs/2305.18290

LIMA:对齐之道,少即是多(https://arxiv.org/abs/2305.11206,2023年5月18日)

研究人员精心筛选了1000组指令对,以监督方式微调了一个650亿参数的LLaMA模型,命名为LIMA。值得注意的是,Alpaca等其他经过微调的LLaMA模型是基于52000组自动生成的指令对训练的。令人惊艳的是,LIMA的表现超越了采用人类反馈强化学习(RLHF)技术训练的模型,例如ChatGPT/GPT 3.5。

figure02
标注图源自:https://arxiv.org/abs/2305.11206

QLoRA:量化大语言模型的高效微调方法(https://arxiv.org/abs/2305.14314,2023年5月23日)

QLoRA(量化低秩适配)是参数高效型大语言模型微调领域的最新成果。QLoRA降低了650亿参数LLaMA模型的内存需求,使其可在单张48GB显存的GPU(如A100)上运行。通过4位量化训练得到的650亿参数Guanaco模型,保留了全16位微调的任务性能,仅经过24小时微调,性能就达到ChatGPT的99.3%。

figure03
标注图源自:https://arxiv.org/abs/2305.14314

SpQR:实现大语言模型权重近无损压缩的稀疏量化表示(https://arxiv.org/abs/2306.03078,2023年6月5日)

将大语言模型量化至4位,是目前在单GPU或笔记本电脑上运行这类模型的唯一方式,但这会牺牲精度。该研究提出的稀疏量化表示(SpQR)方法,提供了一种全新的近无损替代方案。其核心思路是将部分离群权重保持在更高精度,从而将精度损失控制在1%以内,同时实现与int4量化几乎相同的模型压缩率。

figure04
标注图源自:https://arxiv.org/abs/2306.03078

重复训练与否:Token危机下大语言模型缩放的启示(https://arxiv.org/abs/2305.13230,2023年5月22日)

研究发现,互联网上高质量文本数据的增长速度,跟不上大语言模型规模扩张的需求。那么,如果对大语言模型进行多轮次训练会发生什么?结果表明,多轮次训练会导致过拟合,且大多数正则化技术都无法解决这一问题(Dropout除外)。

figure05
标注图源自:https://arxiv.org/abs/2305.13230

DoReMi:优化数据混合比例可加速大语言模型预训练(https://arxiv.org/abs/2305.10429,2023年5月17日)

该研究中,研究人员探讨了预训练数据中维基百科文章、书籍和网页的相对占比,是否会显著影响大语言模型的性能。为解答这一问题,他们训练了一个代理模型,推导得出训练更大规模目标大语言模型的相对领域权重。研究发现,这一方法可将下游任务准确率提升6.5%;在经过权重重分配的The Pile数据集上预训练时,模型达到基线准确率的速度可提升2.6倍。

figure06
标注图源自:https://arxiv.org/abs/2305.10429

Falcon大语言模型的RefinedWeb数据集:纯网页数据效果超越精选语料库(https://arxiv.org/abs/2306.01116,2023年6月1日)

该研究发现,基于去重网页数据训练的大语言模型,其零样本性能可与基于精选数据集训练的模型相媲美。该研究中,使用100%网页数据预训练得到的Falcon 7B模型,性能与80亿参数的PaLM模型相当,而PaLM仅使用了18%的网页数据(其余为书籍等更高质量的数据)。研究人员开发的RefinedWeb数据集,是CommonCrawl的过滤去重版本(约为原大小的11%)。

figure07
标注图源自:https://arxiv.org/abs/2306.01116

模仿专有大语言模型的虚假承诺(https://arxiv.org/abs/2305.15717,2023年5月25日)

近几个月来,基于ChatGPT等其他大语言模型生成的数据来微调大语言模型,已成为普遍做法。这项最新研究发现,众包人员对这些所谓的“模仿模型”评价很高。但事实证明,这些模仿模型往往只是复刻了其训练数据来源的上游大语言模型的风格,而非事实准确性。

figure08
标注图源自:https://arxiv.org/abs/2305.15717

位置编码对Transformer长度泛化能力的影响(https://arxiv.org/abs/2305.19466,2023年5月31日)

Transformer在不同长度的训练样本上表现出的性能存在差异,这在微调阶段尤为突出——因为长指令样本相对稀缺。该研究发现,在仅解码器架构的Transformer中,移除位置编码的效果,优于绝对位置编码、相对位置编码、ALiBi以及旋转位置编码等所有变体。

figure09
标注图源自:https://arxiv.org/abs/2305.19466

Goat:经过微调的LLaMA在算术任务上超越GPT-4(https://arxiv.org/abs/2305.14201,2023年5月23日)

研究人员对70亿参数的LLaMA模型Goat进行微调,使其在算术任务上超越了规模是其75倍的5400亿参数PaLM模型以及GPT-4。Goat的优异表现归功于监督微调以及LLaMA的分词器。尽管计算器(以及Wolfram Alpha这类工具)更适合完成算术任务,但研究人员选择该任务,大概率是因为生成合成数据和通过准确率指标评估模型性能都较为简便。

figure10
标注图源自:https://arxiv.org/abs/2305.14201

Gorilla:接入海量API的大语言模型(https://arxiv.org/abs/2305.15334,2023年5月24日)

Gorilla是一款专门经过微调、用于生成API调用的大语言模型(这一点GPT-4或许可以做得更好)。研究人员以LLaMA-7B为基础模型,在来自Torch Hub、TensorFlow Hub和HuggingFace的1645个API调用数据上对其进行微调。经过微调的Gorilla,表现优于其他未针对API调用进行微调的大语言模型。

figure11
标注图源自:https://arxiv.org/abs/2305.15334

掩码语言模型预训练的动态掩码率调度策略(https://arxiv.org/abs/2305.15096,2023年5月24日)

传统上,BERT类大语言模型采用15%的固定掩码率进行预训练。该研究中,研究人员在预训练过程中将掩码率在15%-30%之间动态调整,发现这可将GLUE等语言翻译基准的准确率小幅提升0.46%。更值得关注的是,采用所提出的动态掩码率策略,模型达到原始BERT准确率的速度可提升1.89倍。

figure12
标注图源自:https://arxiv.org/abs/2305.15096

面向长上下文大模型的分块并行Transformer(https://arxiv.org/abs/2305.19370,2023年5月30日)

本文提出的优化技术采用分块方式执行自注意力计算,避免对整个序列进行前向传播。该方法节省的内存,使得Transformer可训练的上下文长度是原始自注意力实现的32倍,约为FlashAttention的2倍。与FlashAttention类似,这是一种不修改模型架构的优化手段,因此不会影响预测结果。

figure13
标注图源自:https://arxiv.org/abs/2305.19370

RWKV:Transformer时代的RNN革新(https://arxiv.org/abs/2305.13048,2023年5月22日)

RWKV语言模型的代码于去年公布后,几乎淡出了公众视野,直到本月研究人员正式发布相关研究成果。RWKV是一种循环神经网络,具备Transformer级别的大语言模型性能。RWKV的非凡之处在于,其建模性能与Pythia等部分大语言模型相当,但计算成本却大幅降低。

figure14
标注图源自:https://arxiv.org/abs/2305.13048

SEAHORSE:面向摘要评估的多语言、多维度数据集(https://arxiv.org/abs/2305.13194,2023年5月22日)

大多数大语言模型基于英文指令数据集训练,并在英文基准上进行评估。Seahorse提供了全新的数据集,包含覆盖6种语言的9.6万条摘要,可用于多语言、多维度的摘要评估。该数据集以宽松的知识共享署名4.0国际许可协议发布;不过数据集的收集流程尚不够透明,希望其中不包含任何受版权保护的文本。

figure115
标注图源自:https://arxiv.org/abs/2305.13194

基于原则驱动、极少人工监督的语言模型自对齐方法(https://arxiv.org/abs/2305.03047,2023年5月4日)

研究人员提出了SELF-ALIGN方法,以此开发出经过微调的650亿参数LLaMA模型Dromedary。SELF-ALIGN是监督微调和人类反馈强化学习(RLHF)之外,另一种实现大语言模型与人类意图对齐的方案。该方法分为四个步骤:(1)利用大语言模型生成提示词;(2)制定人工编写的原则,通过上下文学习引导大语言模型生成回复;(3)利用自对齐后的回复训练大语言模型;(4)对过于简略或间接的回复进行优化。

figure16
标注图源自:https://arxiv.org/abs/2305.03047

计算机视觉

EfficientViT:采用级联分组注意力的内存高效视觉Transformer(https://arxiv.org/abs/2305.07027,2023年5月11日)

EfficientViT是一款全新的视觉Transformer,在速度与精度之间实现了出色的平衡。它的性能超越MobileNetV3和MobileViT等现有高效架构,同时速度大幅提升。研究人员通过级联分组注意力实现这一成果:通过向每个注意力头输入完整特征的不同分组,减少多头自注意力层中的冗余(类似于分组卷积的思路)。

figure17
标注图源自:https://arxiv.org/abs/2305.07027

扩散模型的并行采样(https://arxiv.org/abs/2305.16317,2023年5月25日)

扩散模型通过数百到数千步的去噪扩散步骤生成高质量图像,计算成本很高。该研究没有采取减少扩散步数、牺牲质量的常规思路,而是提出在一定程度上并行执行扩散步骤。所提出的方法可将采样速度提升2-4倍,同时保持相近的图像质量。

figure18
标注图源自:https://arxiv.org/abs/2305.16317

重塑ViT:计算最优模型设计的缩放法则(https://arxiv.org/abs/2305.13035,2023年5月22日)

此前的研究主要聚焦于参数量层面的最优数据集规模和模型规模。该研究中,研究人员提出了推导计算最优模型形状(例如宽度和深度)的方法。最终得到的视觉Transformer,性能超越了规模是其两倍的模型。此外,尽管这款计算最优的小模型使用相同的计算资源预算训练,但其推理成本还不到更大模型的一半。

figure19
标注图源自:https://arxiv.org/abs/2305.13035

音频与语音

将语音技术扩展至1000+种语言(https://arxiv.org/abs/2305.13516,2023年5月22日)

Meta AI开发了一款支持约1100种语言的语音转文本模型MMS(相比之下,OpenAI的Whisper模型支持99种语言)。在FLEURS基准测试中,MMS与Whisper共同覆盖的54种语言上,Meta的MMS模型表现均优于Whisper。该模型以宽松的CC-BY-NC 4.0许可协议发布。

figure20
标注图源自:https://arxiv.org/abs/2305.13516

通用方法

Sophia:面向大语言模型预训练的可扩展随机二阶优化器(https://arxiv.org/abs/2305.14342,2023年5月23日)

Sophia是一种二阶优化算法,对于普遍采用Adam和AdamW作为主流优化器的大语言模型来说,它极具吸引力。与Adam相比,Sophia的速度提升2倍,且使用Sophia训练的模型能取得更优的建模性能。简而言之,Sophia通过梯度曲率而非梯度方差对梯度进行归一化,这是与Adam的核心区别。

figure21
标注图源自:https://arxiv.org/abs/2305.14342

仅需前向传播的大语言模型微调(https://arxiv.org/abs/2305.17333,2023年5月27日)

研究人员提出了一种内存高效的零阶优化器(MeZO),使微调大语言模型所需的内存占用与推理时相当。需要注意的是,零阶方法仅需前向传播,无需梯度信息——这与使用梯度信息的一阶方法(如SGD和Adam),以及额外使用曲率或海森矩阵信息的二阶方法形成对比。基准测试显示,采用该方法微调的大语言模型,表现优于上下文学习基线,且效果似乎优于全量微调。

figure22
标注图源自:https://arxiv.org/abs/2305.17333

Dropout可消除双下降现象(https://arxiv.org/abs/2305.16179,2023年5月25日)

双下降是指随着模型复杂度提升,模型测试误差先下降、再上升、之后又下降的现象。这篇标题玩了有趣谐音梗的论文《Dropout Drops Double Descent》,解释了为什么我们在实践中很少见到双下降现象:“以往的深度学习模型不会出现双下降场景——因为我们已经在模型中应用了Dropout这类常用的正则化方法。”

figure23
标注图左:《深度双下降》(https://arxiv.org/abs/2305.16179);右:《Dropout可消除双下降》(https://arxiv.org/abs/2305.16179)

本杂志是一项个人兴趣项目,不提供直接报酬。不过,如果您愿意支持我,可以考虑购买https://sebastianraschka.com/books 上的书籍。如果您觉得这些书籍富有洞见、有所帮助,欢迎推荐给您的朋友和同事。

figure24
https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/ , https://nostarch.com/machine-learning-and-ai-beyond-basics , 以及 http://mng.bz/M96o

您的支持意义重大!非常感谢!

Leave a Reply

Your email address will not be published. Required fields are marked *

*