原文地址:From Self-Alignment to LongLoRA,by Sebastian Raschka, on 2023-09-23
从自对齐到LongLoRA
又一个月,又一批涵盖大语言建模到计算机视觉领域的有趣研究论文。
近期的一个研究重点是对大语言模型(LLM)进行优化。例如,Platypus模型与强化自训练(Reinforced Self-Training,ReST)方法的提出,是提升模型与人类偏好对齐度的最新尝试。
此外,指令回译自对齐与OctoPack两项研究则利用现有的知识结构——无论是指令还是代码——来提升模型性能。
一个反复出现的研究主题是致力于让模型更高效、更易获取。LongLoRA为大语言模型带来了另一种稀疏注意力机制;而一些更简单、更底层的思路,比如在视觉Transformer中用ReLU替代softmax,也在提升计算效率,为更好的并行化铺平道路。
但这只是本月研究进展的一个缩影。希望你能从下面精选的22项研究亮点中有所收获。
大语言模型
RLAIF:借助AI反馈规模化基于人类反馈的强化学习(2023年9月1日,https://arxiv.org/abs/2309.00267)
近期这项关于AI反馈强化学习(RLAIF)的研究表明,RLHF中奖励模型训练所需的评分不一定非要由人类提供,也可以由大语言模型(本研究中为PaLM 2)生成。人类评估者在半数情况下更偏好RLAIF模型,而非传统的RLHF模型,这说明二者其实没有明显的优劣之分。此外值得注意的是,RLHF和RLAIF的表现都大幅优于仅通过监督指令微调训练的模型。

图片标注源自:https://arxiv.org/abs/2309.00267
语言模型的强化自训练(ReST)(2023年8月17日,https://arxiv.org/abs/2308.08998)
ReST是基于人类反馈的强化学习(RLHF)的一种替代方案,用于让大语言模型与人类偏好对齐。ReST采用采样方法构建更优的数据集,通过在质量不断提升的子集上迭代训练来优化其奖励函数。据作者称,由于训练数据集是离线生成的,ReST相比标准的在线RLHF方法(例如搭配近端策略优化PPO的RLHF)效率更高;但该研究并未与InstructGPT或Llama 2中使用的标准RLHF PPO方法做全面对比。

图片标注源自:https://arxiv.org/abs/2308.08998
Platypus:快速、低成本、高性能的大语言模型优化方案(2023年8月14日,https://arxiv.org/abs/2308.07317)
Platypus是一套全新的开源大语言模型,在撰写本文时位居人类反馈类大语言模型排行榜榜首。它的两大成功支柱是:对底层数据集进行精选(去除相似与重复问题),以及对低秩适配(LoRA)模块进行微调与合并。特别有意思的一点是,作者在应用LoRA时,聚焦于非注意力模块而非注意力模块。

图片标注源自:https://arxiv.org/abs/2308.07317
指令回译自对齐(8月11日,https://arxiv.org/abs/2308.06259)
通常的指令微调要么收集人类撰写的数据集,要么用大语言模型生成指令-响应对(即蒸馏法),而本文提出了第三种思路。研究人员从一个预训练大语言模型出发,为网页等无标注文本生成指令。采用这种所谓“指令回译”方法微调的大语言模型,表现优于在蒸馏数据集(如Alpaca)上训练的模型。

图片标注源自:https://arxiv.org/abs/2308.06259
大语言模型的高效基准测试(2023年8月31日,https://arxiv.org/abs/2308.11696)
如果你跑过HELM或Evaluation Harness这类大语言模型基准测试,就会知道基准测试成本极高,动辄耗时数小时。为了提升大语言模型评估效率,研究人员提出了Flash-HELM,它能得出与HELM相近的模型排名,但成本大幅降低。举例来说,如果模型在早期评估轮次中表现不佳,就会被分配更低的权重,仅在更少的样本和提示上进行评估。

图片标注源自:https://arxiv.org/abs/2308.11696
LongLoRA:长上下文大语言模型的高效微调(2023年9月21日,https://arxiv.org/abs/2309.12307)
LongLoRA是一种高效的大语言模型微调方法,它能扩展模型的上下文窗口,且不会产生长上下文通常伴随的高昂计算成本。该方法采用稀疏局部注意力,在微调阶段节省计算量,而在推理阶段仍可使用常规的稠密注意力。

图片标注源自:https://arxiv.org/abs/2309.12307
课本即全部所需 II:phi-1.5技术报告(2023年9月11日,https://arxiv.org/abs/2309.05463)
本文提出了一款全新的“小尺寸”开源大语言模型,参数量仅13亿,性能却十分出色。它没有打破任何基准测试纪录,但表现堪比参数量是其5倍的模型,比如广受欢迎的70亿参数Llama 2。该模型的训练遵循https://arxiv.org/abs/2306.11644 中的流程,在70亿代码token(来自https://arxiv.org/abs/2211.15533 、StackOverflow等来源)的基础上,额外使用了约200亿课本质量的合成文本。

图片标注源自:https://arxiv.org/abs/2309.05463
在测试集上预训练即全部所需(2023年9月19日,https://arxiv.org/abs/2309.08632)
在这篇带有讽刺意味的论文中,作者训练了一个仅100万参数的小模型,其表现却超过了所有其他模型,包括13亿参数的phi-1.5。实现的方法是让模型在所有下游学术基准测试集上进行训练。这篇文章委婉地批评了一个现象:基准测试很容易被有意或无意地“作弊”(由数据污染导致)。

图片标注源自:https://arxiv.org/abs/2309.08632
GPT无需计算器即可解决数学问题(2023年9月6日,https://arxiv.org/abs/2309.03241)
大语言模型在大数可靠算术运算上表现不佳,对比ChatGPT和标准计算器的计算结果就能看出来(比如试试计算16342391 × 12325234243)。在这篇概念验证论文中,研究人员表明,无需借助外部API,仅通过微调就能提升大语言模型的数学能力。不过从实用角度来说,使用计算器或者让大语言模型接入计算器API,显然仍是更优选择。

图片与表格标注源自:https://arxiv.org/abs/2309.03241
RAIN:无需微调即可让语言模型完成自对齐(2023年9月13日,https://arxiv.org/abs/2309.07124)
本文探讨了如何在无需额外数据、无需更新模型参数的情况下,让大语言模型与人类偏好对齐。提出的可回溯自回归推理(Rewindable Auto-regressive INference,RAIN)机制,核心是自我评估与回溯模型生成的回复。在Llama 30B上的测试显示,该方法在保持模型有用性的同时,将无害率从82%提升至97%。

图片标注源自:https://arxiv.org/abs/2309.07124
大语言模型的涌现能力只是上下文学习吗?(2023年9月4日,https://arxiv.org/abs/2309.01809)
一种普遍的观点认为,随着模型规模增大,大语言模型会发展出小模型不具备的涌现能力。在这项涵盖18个模型(参数量最高达1750亿)、22项任务的全面新研究中,研究人员发现这些能力主要来源于上下文学习,而非推理能力。这一结论应该能让部分担心模型规模增长会催生涌现能力的人稍感安心。

图片标注源自:https://arxiv.org/abs/2309.01809
语言建模即压缩(2023年9月19日,https://arxiv.org/abs/2309.10668)
预测式深度学习模型的训练目标通常是最小化交叉熵损失,这本质上意味着模型的预测能用最少的比特数编码训练数据的真实标签。本文进一步研究了压缩与分类为何等价、如何等价。有意思的是,作者发现大语言模型的压缩能力不仅在文本上表现出色,在从未训练过的模态(比如图像数据)上也具备竞争力。

表格标注源自:https://arxiv.org/abs/2309.10668
Struc-Bench:大语言模型真的擅长生成复杂结构化数据吗?(2023年9月16日,https://arxiv.org/abs/2309.08963)
本文评估了大语言模型在生成HTML、LaTeX表格等复杂结构化输出方面的能力。此外,作者提出了一种特定的思维链格式,能从目标输出反推生成指令。最后作者发现,结构化感知的微调方法(在生成的数据集上进行标准指令微调)能提升大语言模型在结构化输出生成任务上的表现。

图片标注源自:https://arxiv.org/abs/2309.08963
Code Llama:开源代码基础模型(2023年8月24日,https://arxiv.org/abs/2308.12950)
Code Llama是Meta AI基于今年早些时候发布的热门基础模型Llama 2推出的最新系列大语言模型。Code Llama系列包含70亿、130亿和340亿参数量的版本,均在代码数据上完成了训练与微调。该系列模型的训练上下文长度为16k(是Llama 2的4倍),在推理阶段最多可支持100k的上下文长度。

图片标注源自:https://arxiv.org/abs/2308.12950
OctoPack:代码大语言模型的指令微调(2023年8月14日,https://arxiv.org/abs/2308.07124)
研究人员用4TB的Git提交数据(涵盖350种编程语言)训练大语言模型,并将该数据集命名为CommitPack,发布于https://huggingface.co/datasets/bigcode/commitpack 。研究利用Git提交信息的天然结构(例如“为sin函数添加噪声修改”)来微调大语言模型,使其能对应地修改代码。最终模型在代码修复、代码解释和代码合成任务上的表现,与WizardCoder等其他热门代码大语言模型相当。

图片标注源自:https://arxiv.org/abs/2308.07124
计算机视觉与多模态模型
Qwen-VL:具备多能能力的前沿大视觉语言模型(2023年8月24日,https://arxiv.org/abs/2308.12966)
Qwen-VL系列模型是多模态AI领域的又一力作。该系列是大规模视觉语言Transformer模型,旨在同时理解文本与图像。Qwen-VL与Qwen-VL-Chat可用于图像描述、问答、视觉定位等任务,支持英文、中文及多语言对话。

图片标注源自:https://arxiv.org/abs/2308.12966
EVE:基于掩码预测与模态感知混合专家的高效视觉语言预训练(2023年8月23日,https://arxiv.org/abs/2308.11971)
传统上,构建视觉语言模型需要针对每个模态设计多个专门的预训练任务。本文提出了一个统一的多模态Transformer,仅用单一任务完成预训练。为实现这一点,提出的EVE模型在共享Transformer网络中融合视觉与语言,利用模态感知的稀疏混合专家(MoE)模块处理模态特定的信息。

图片标注源自:https://arxiv.org/abs/2308.11971
ImageBind-LLM:多模态指令微调(2023年9月7日,https://arxiv.org/abs/2309.03905)
ImageBind-LLM是一种借助ImageBind对大语言模型进行多模态指令微调的方法。该方法及对应的模型能通过全新的图像-文本对齐训练方式,理解图像、音频、3D点云、视频等多种模态。其中,一个可学习的Bind网络对齐了LLaMA与ImageBind图像编码器的嵌入空间,而一个无需训练的缓存模型解决了训练与推理之间的模态差异问题。

图片标注源自:https://arxiv.org/abs/2309.03905
在视觉Transformer中用ReLU替代Softmax(2023年9月15日,https://arxiv.org/abs/2309.08586)
视觉(以及语言)Transformer的自注意力模块通常使用softmax运算,而softmax很难并行化。在这篇短篇论文中,研究人员表明,可以用逐点ReLU函数替代softmax函数,且不会带来明显的精度损失(也没有提升)。这为并行化开辟了新的方向。

图片标注源自:https://arxiv.org/abs/2309.08586
通用方法与其他研究
从电路效率角度解释“顿悟现象”(2023年9月5日,https://arxiv.org/abs/2309.02390)
本文对https://arxiv.org/abs/2201.02177 中提出的“顿悟现象”(神经网络从训练准确率完美、泛化能力差,过渡到泛化能力完美的现象)给出了进一步的解释与洞见。作者提出,当任务同时存在记忆型解和泛化型解时就会出现这种现象:泛化型解学习速度更慢,但效率更高。有意思的是,随着数据集增大,记忆型解的效率会下降,而泛化型解的效率保持稳定,最终促成顿悟现象的发生。

图片源自:https://arxiv.org/abs/2309.02390
课程学习与Adam:问题出在错误的细节上(2023年8月23日,https://arxiv.org/abs/2308.12202)
课程学习是一种训练策略:模型会按难度递增的顺序逐步学习任务,类似人类教育从易到难的知识结构。研究发现,自然语言处理领域近期的课程学习方法效果很不稳定,这往往是因为它们与Adam优化算法相互作用,导致参数选择次优。此外,本文发现没有任何一种课程学习方法的表现,能超过使用精心挑选超参数的纯Adam优化。

图片源自:https://arxiv.org/abs/2308.12202
基于扩散与流匹配梯度提升树的表格数据生成与插补(2023年9月18日,https://arxiv.org/abs/2309.09968)
本文提出了一种新方法,利用基于得分的扩散与条件流匹配来生成和插补混合类型(分类型与连续型)的表格数据,核心是采用XGBoost而非深度神经网络。该方法不仅能生成高度真实的合成数据,即便在存在缺失值的数据集上训练也同样有效。此外,它仅用CPU即可训练(无需GPU)。

图片源自:https://arxiv.org/abs/2309.09968
本专栏是个人兴趣项目,无直接稿酬。如果你愿意支持我,可以考虑购买https://sebastianraschka.com/books 上的书籍。如果你觉得这些内容有洞见、有帮助,也欢迎推荐给你的朋友和同事。

https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/ 、https://nostarch.com/machine-learning-and-ai-beyond-basics 与http://mng.bz/M96o
你的支持对我意义重大!非常感谢!