【转载】应对幻觉问题、提升推理能力与Transformer架构新洞察

原文地址:Tackling Hallucinations, Boosting Reasoning Abilities, and New Insights into the Transformer Architecture,by Sebastian Raschka, on 2023-12-09

应对幻觉问题、提升推理能力与Transformer架构新洞察

本月,我想重点介绍三篇论文,它们分别针对大语言模型(LLM)三类不同的问题展开研究:

  • 减少幻觉现象
  • 提升开源小型模型的推理能力
  • 深化对Transformer架构的理解,并探索其简化可能

减少幻觉之所以重要,是因为尽管GPT-4这类大语言模型已被广泛用于知识生成,但它们仍会生成看似合理却存在错误的信息。
提升小型模型的推理能力同样意义重大。当前,在处理诸多任务时,ChatGPT与GPT-4(相较于私有或个人大语言模型)依然是我们的首选方案。提升这些小型模型的推理能力,是缩小开源模型与当前前沿闭源模型差距的途径之一。
最后,深化对Transformer架构的理解,是掌握大语言模型训练动态的基础。这些知识有望催生更简洁、更高效的模型,提升开源模型的性能,甚至可能为新的架构创新铺平道路。

1)针对事实性微调语言模型

大语言模型(LLM)常受幻觉问题困扰,即会生成看似可信但事实有误的内容。在将大语言模型用于知识类问答场景时,这个问题尤为突出,因为用户需要手动对回复进行事实核查。这一过程耗时耗力,对于某些查询来说,甚至会让使用大语言模型的意义大打折扣。

在论文https://arxiv.org/abs/2311.08401中,作者提出利用https://arxiv.org/abs/2305.18290(DPO,直接偏好优化)的微调方法来降低幻觉发生率。通过对7B参数的Llama 2模型使用该方法进行微调,与原始Llama-2-chat模型相比,其事实错误率降低了58%。

figure01
摘自论文https://arxiv.org/abs/2311.08401的带标注图表,显示该方法在事实错误率方面优于其他方案。

关于幻觉

这一点在论文中并未展开讨论。但在深入探讨论文内容之前,我们有必要先了解大语言模型的训练与推理机制,它们带来了两方面挑战。在预训练阶段,低质量的数据集可能会让大语言模型吸收事实错误的信息。
其次,在推理阶段,我们会使用温度参数和采样方法,让大语言模型变换句式结构,避免每次生成完全相同的文本。这种机制避免了模型单纯像数据库查询一样输出内容,但同时,也没有机制能保证哪些词元应该采样生成、哪些应该直接沿用训练集中的内容。

比如,对于“iPhone是谁发明的?首次发布于何时?”这样的问题,可能的回复包括以下几种:
figure02
大语言模型的不同回复,关键事实已用蓝色标出。

大语言模型可以变换句式和措辞,但核心事实——即iPhone由苹果公司在史蒂夫·乔布斯领导下的团队研发,于2007年6月29日发布——不应被改动。
更具体地说,把“发明(invented)”换成“研发(created)”是可以接受的;但把“苹果(Apple)”换成“橙子(Orange)”“三星(Samsung)”,或是改动发布日期,显然就是严重错误。

直接偏好优化

研究人员在这里采用的核心方法是https://arxiv.org/abs/2305.18290(DPO,直接偏好优化),它正逐渐成为人类反馈强化学习(RLHF)之外的热门替代方案。
RLHF是ChatGPT、Llama 2 Chat等模型背后的训练方法。想了解更多RLHF的内容,可以参考我的另一篇文章,链接如下:
https://magazine.sebastianraschka.com/p/llm-training-rlhf-and-its-alternatives
https://substack.com/profile/27393275-sebastian-raschka-phd
·
2023年9月10日
https://magazine.sebastianraschka.com/p/llm-training-rlhf-and-its-alternatives
无论是讨论研究前沿还是教程内容,我经常会提到“人类反馈强化学习(RLHF)”这一流程。由于能将人类偏好融入优化过程,提升模型的有用性与安全性,RLHF已成为现代大语言模型训练流程中不可或缺的一环。
https://magazine.sebastianraschka.com/p/llm-training-rlhf-and-its-alternatives

DPO在概念上比RLHF更简单:它直接基于回复偏好排名对大语言模型进行训练,无需单独构建奖励模型。本质上,DPO直接在偏好数据上计算分类损失,实现和使用难度都远低于RLHF。此外,DPO近期已被成功应用——比如Lewis Tunstall团队开发的https://huggingface.co/HuggingFaceH4/zephyr-7b-alpha,其表现似乎超过了通过RLHF训练的更大参数的Llama-2 70b Chat模型——DPO正逐渐成为最主流的微调方法之一。

figure03
DPO论文(https://arxiv.org/abs/2305.18290)中的带标注图表。

注:这篇《针对事实性微调语言模型》论文中,有三位作者同时也是原始DPO论文的作者。

省去人工标注工作

与RLHF相比,DPO简化了微调流程,因为它不需要构建奖励模型。但DPO仍然需要生成偏好数据,通常需要先让模型生成回复,再由人工进行事实核查,然后由标注人员按偏好对这些回复排序。
作者指出,人工核查一条大语言模型回复(比如一位知名人物的生平介绍)平均需要9分钟。按照这个速度,核查本研究使用的505条生平传记数据集,成本约为2000美元。

作为人工事实核查的替代方案,作者提出了一种DPO变体,完全不需要人工参与。这种思路与https://arxiv.org/abs/2309.00267(AI反馈强化学习)类似,后者和RLHF不同,不需要人工输入。
figure04
RLAIF论文(https://arxiv.org/abs/2309.00267)中的带标注图表。

在《针对事实性微调语言模型》论文中,作者实验了两种生成全自动“真实性”评分的方法:

  • 基于参考的真实性评分,简称FactTune-FS
  • 无参考的真实性评分,简称FactTune-MC

figure05
《针对事实性微调语言模型》论文(https://arxiv.org/abs/2311.08401)中的带标注图表。

两种方法的第一步,都是获取一个回复数据集(比如知名人物的生平介绍),再用GPT-3.5模型从中提取出原子化的事实主张。
在方法1(FactTune-FS)中,作者沿用了已有的https://arxiv.org/abs/2305.14251方法:以维基百科作为事实来源,用Llama 1 7B模型验证每条原子主张是否能得到对应文章的支持。我推测这里使用小型Llama 1模型,是因为原始FactScore论文中采用的就是该模型。

在方法2(FactTune-MC)中,作者先用GPT-3.5把原子主张转化为问题,再将这些问题作为查询,输入给设置了高温度参数的Llama 1模型,让它生成多个不同的回复,将出现频率最高的回复的频次作为真实性评分。和方法1相比,FactTune-MC的优势在于不需要外部来源提供参考文章。

之后,利用真实性评分为数据集生成偏好排名,再通过DPO流程对模型进行微调。实验结果显示,FactTune-FS表现极为出色,在降低事实错误率方面,超过了包括RLHF和常规监督微调在内的所有其他测试方法。
figure06
《针对事实性微调语言模型》论文(https://arxiv.org/abs/2311.08401)中对比不同方法效果的带标注图表。

注意:作者实验了对Llama 1和Llama 2都进行微调,但并未说明上图中微调的是哪款模型。结合论文表2的数据比对,我推测是Llama 2模型。图中RLHF指的是Meta提供的Llama 2 Chat模型;SFT模型是作者用常规监督学习(而非基于偏好数据的DPO)微调的Llama 2模型,使用的数据集和FactTune-FS模型相同,即生平传记与医疗问答数据集。

数据集

正如上图所提示的,作者使用了两个数据集:知名人物生平传记、医疗问答。这些数据集规模相对较小,但每条回复都包含多个事实点,因此两个数据集各自用到的事实总数都可能达到四位数级别。
figure07
《针对事实性微调语言模型》论文(https://arxiv.org/abs/2311.08401)中创建并使用的数据集。

鲁棒性

从上述介绍可以看出,这套方法有很多环节都依赖大语言模型,比如用GPT-3.5生成原子主张、用7B参数的Llama 1模型核查主张是否成立等。这意味着我们在很大程度上是信任大语言模型,让它们去核查另一款大语言模型的输出。

总的来说,这套方法的效果之好令人意外。但一个无法回避的问题是:由于正确与错误回复的数量是基于自动化的https://arxiv.org/abs/2305.14251流程判定的,模型会不会是过拟合了FactScore的判定规则,而非真的生成了事实准确的回复?

为了解答对FactScore评估方式的质疑,作者引入人工标注人员对模型进行评估。如下图所示,FactScore的评分与人工标注的评分高度吻合。如果我们相信人工核查回复的准确性,那么FactScore的评分仅存在轻微的高估。
figure08
《针对事实性微调语言模型》论文(https://arxiv.org/abs/2311.08401)中的带标注表格,显示自动化的FactScore与人工标注的表现一致。

权衡

Llama 2 Chat是通过人类反馈强化学习(RLHF)训练的,目标是优化有用性与无害性。作者发现,在其基础上应用FactTune-FS,能进一步提升Llama 2 Chat的事实准确性。但我好奇的是,这种提升是否是以降低有用性与无害性为代价的。

理论上,有用性和事实准确性应该高度相关。比如,事实正确的回复理应比事实错误的回复更有用。但Llama 2奖励模型数据的标注方式,可能并没有充分体现这一点。也就是说,参与Llama 2训练、负责有用性排序的标注人员,或许并没有仔细核查所有回复的事实。因此,一条看似有说服力、但可能存在事实错误的回复,也可能被判定为更有用。
figure09
Llama 2 Chat针对有用性与无害性进行了优化;图为Llama 2原始论文(https://arxiv.org/abs/2307.09288)中的带标注图表。

当然,让本就有用的回复变得更符合事实,肯定是更优的。但我好奇的是,这会不会对对话能力,或是翻译、语法纠错、小说创作等不依赖事实的任务产生负面影响。

目前我们没有数据表明,针对事实准确性的DPO微调,会不会降低Llama 2 Chat原本优化的有用性与无害性评分。但作者提出了一些有意思的观察:

  • 我们发现,与SFT模型相比,FactTune-FS和FactTune-MC生成的样本往往句式更客观、直接,对话感和叙事感更弱。
  • FactTune-FS和FactTune-MC生成的样本句子更简单,缺少口语化表达。
  • 再比如,FactTune-FS和FactTune-MC生成的生平介绍事实准确,但没有遵循自然的时间顺序。

局限性与结论

总的来说,我认为这是一篇非常优秀的论文,证明了DPO微调的实用价值。此前一些大语言模型的微调明确以降低危害性为目标,而这篇论文也说明,我们可以用其他目标成功地对模型进行微调。

一个小的不足是,论文使用的数据集规模偏小。但换个角度看,在小数据集上方法依然能取得这么好的效果,反而更令人印象深刻。好消息是,这套方法是完全自动化的,因此可以轻松扩展到更大的数据集。

2)Orca 2:教小型语言模型如何推理

论文https://arxiv.org/abs/2311.11045提出了一种有效方法,通过使用专门的合成数据进行训练,大幅提升小型语言模型(LLM)的推理能力。其核心思路是:运用多种推理技巧,教会大语言模型针对每个任务识别最高效的解题策略。

最终得到的Orca-2-13B模型,在零样本推理任务上表现优于同规模模型:相比https://arxiv.org/abs/2307.09288提升了47.54%,相比https://arxiv.org/abs/2304.12244提升了28.15%。注意,这三款模型(Orca、Llama-2-Chat、WizardLM)都是基于相同的Llama-2基座模型进行微调的。
此外,Orca-2-13B甚至能与参数规模是其5-10倍的模型一较高下,比如LLaMA-2-Chat-70B、WizardLM-70B以及ChatGPT。
figure10
Orca 2论文(https://arxiv.org/abs/2311.11045)中的带标注图表,显示Orca 2在推理基准测试上的表现优于同规模及更大规模的大语言模型。注意Orca 2和WizardLM都基于Llama 2开发,因此对比很有参考价值。

(上图中的“小型谨慎系统提示词”是一个实现细节:他们在指令中加入了以下文本:“你是Orca,由微软开发的AI语言模型。你是一名谨慎的助手,严格遵循指令,乐于助人且安全无害,遵守道德准则,倡导积极行为。”)

模仿学习

近几个月来,模仿学习蔚然成风。在大语言模型领域,模仿学习指的是让小型目标模型(称为“学生模型”)学习大型源模型(称为“教师模型”,比如GPT-4)的输出。
figure11
大语言模型场景下的模仿学习示意图:小型大语言模型通过学习大型模型的回复,模仿其输出。

论文https://arxiv.org/abs/2305.15717指出了小型语言模型模仿大型模型的一个核心问题:这些小模型可以模仿大模型的风格,生成乍一看很惊艳的内容,但仔细审视就会发现输出并不准确。也就是说,它们看似表现不错,但深入检查生成内容时,实则错误百出。

在Orca 2论文中,作者解释道,小型语言模型(按如今的标准,70亿到130亿参数都算“小型”)不能只靠照搬大模型的方法来提升效果。他们提出了另一种思路:教这些小模型独特的解题或思考方式,有别于大模型的思路。这是因为参数量更少、能力有限的小模型,可能无法沿用大模型的解题策略。

教授不同的推理策略

作者将他们的方法称为“解释微调”,核心是通过特定的查询提示,从源大语言模型(此处为GPT-4)中提取带有高质量解释的答案,以此构建合成数据集。

如果你用过ChatGPT(尤其是早期版本),大概会知道答案质量很大程度上取决于你如何提示模型。不同的任务需要不同的提示策略,比如逐步推导、先回忆再生成、回忆-推理-生成、直接作答等等。

作者认为,不应该让小模型只训练或使用某一种特定的解题策略,而应该让模型的解题(或推理)策略随任务变化而调整。

他们为Orca 2设计了如下训练流程,其中“Orca(参考版)”是前代模型:
figure12

注意,在训练过程中,小型模型只学习任务和对应的回复,看不到最初用来从大型教师模型中提取这些回复的问题或指令。

换句话说,基座大语言模型(此处为Llama 2)本身以及微调方式并没有什么特别之处。真正带来惊人效果的创新,完全在于合成训练数据的构建方式。
figure13
https://arxiv.org/abs/2305.14045数据集的片段,展示同一提示对应的不同答案。这是基于Orca 2论文(https://arxiv.org/abs/2311.11045)中图表制作的带标注示意图。

基准测试与结果

如下图所示,与同规模的其他模型相比,最终的Orca-2模型在推理与知识类基准测试上表现极为出色。
figure14
Orca 2论文(https://arxiv.org/abs/2311.11045)中部分知识与推理基准测试结果的带标注图表。

注意,上图只是很小一部分内容。Orca 2论文中的基准测试相当全面,覆盖了推理能力、知识与语言理解、文本补全、多轮开放式对话、事实依据与抽象总结、安全性、真实性等多个维度。

13B参数的模型表现十分惊艳,大幅超越了同尺寸的其他模型。只有在多轮对话基准测试中,Orca-2-13B的表现略逊于Llama-2-Chat。作者解释这是因为训练数据集中没有包含这类对话数据,这个说法完全合理。

在我看来,语言模型的优势不在于通用性,而在于专业性。并非所有任务都需要由对话式AI来完成。我更倾向于一套高度专业化、能力极强的工具,而不是一个样样通、样样松的“万金油”方案。

结论与总结思考

以13B参数的Llama 2模型为起点能取得这样的成果,非常令人赞叹。我很好奇,也很期待:如果将这种定制化合成数据策略应用于70B参数的Llama 2模型甚至更大的模型,推理等基准测试的显著提升是否依然成立。

论文给出了全面的基准测试结果,出色的表现有目共睹。但一个小的瑕疵是:作者强调了让小型模型根据任务选择最高效解题策略的重要性,却没有针对Orca 2模型在这方面做任何实验或消融研究。唯一的证据是,经过精心筛选的合成数据混合训练的Orca 2模型(本质是Llama 2),表现优于通过其他方式微调的Llama 2模型,包括更大的模型。

值得肯定的是,这些成果完全是通过在精选合成数据上进行监督微调实现的,Orca 2模型没有经过任何RLHF或DPO微调。有理由认为,甚至很有可能,RLHF或DPO微调能进一步提升这些模型的效果,这也是未来研究中一个很有意思的方向。

附:Orca 2的权重已公开,可在此处获取:https://www.microsoft.com/en-us/research/project/orca/

3)简化Transformer模块

在论文https://arxiv.org/abs/2311.01906中,作者研究了如何在不损失收敛特性与下游任务性能的前提下,简化大语言模型核心的标准Transformer模块。

基于信号传播理论与实证结果,他们发现GPT类解码器架构和BERT类编码器架构中的很多组件都可以移除:

  • 跳跃连接
  • 投影矩阵与值参数
  • 串行的注意力与MLP子模块(可替换为并行布局)
  • 归一化层(LayerNorm)

figure15
原始Transformer模块(左)与简化后Transformer模块(右)的对比标注图(来自https://arxiv.org/abs/2311.01906)。

移除跳跃连接

随着网络层数加深,梯度在反向传播过程中会逐渐衰减,导致模型训练困难。跳跃连接(也叫残差连接)是深度神经网络中常见的架构设计,用于缓解梯度消失问题。

直接粗暴地移除跳跃连接会引发梯度问题。为了避免这一点,作者基于信号传播理论,提出了特定的权重初始化方案。对细节感兴趣的读者非常推荐阅读这篇优秀的论文,里面有大量有意思的洞见。
figure16
移除跳跃连接后,通过调整权重初始化方式、并用额外超参数β对残差进行加权,得到的评估损失与原始Transformer模块几乎一致。(来自https://arxiv.org/abs/2311.01906的带标注曲线图)

顺便一提,原始Transformer模块示意图左上角的“Pre-LN”,指的是LayerNorm(“Norm”层)的位置。实际上,https://arxiv.org/abs/1706.03762中提出的原始Transformer采用的是Post-LN结构。近年来,Transformer模型越来越多地从Post-LN转向Pre-LN,因为它能简化训练流程。

Pre-LN的一大优势是对初始学习率更不敏感,不需要精心设计学习率预热,而学习率预热是影响训练稳定性与效果的关键因素。想了解更多Pre-LN与Post-LN的优缺点,推荐观看我的朋友兼合作者Vahid的视频:https://www.youtube.com/watch?v=RsuSOylfN2I
figure17
实现细节的直观对比:前置层归一化(Pre-LayerNorm)与后置层归一化(Post-LayerNorm)

移除其他组件

上一节实验(将加权超参数β设为0)带来的启发,让作者成功移除了投影矩阵与值参数。作者认为,值矩阵和投影矩阵只是对输入的线性投影(不同于MLP子模块中的线性层,中间还有非线性激活函数),因此可能是冗余的。

作者还尝试移除归一化层(即LayerNorm)。理由是:前置层归一化本质上会降低残差分支的权重,而这种降权效果也可以通过作者之前的修改方案实现,因此LayerNorm在这套架构中理论上是多余的。

不过,作者观察到训练收敛性出现了轻微下降,这一点目前还无法用信号传播理论解释。因此结论是,建议在Transformer模块中保留LayerNorm。

局限性与结论

作者的实验是在相对小型的模型上进行的。虽然没有理由认为这些结论不适用于更大的语言模型,但目前还没有实证证据支持这一点。我并不认为作者没做更大规模的实验是什么缺点——恰恰相反,这篇只有两位作者的研究让我印象极为深刻,堪称我今年读过的最佳论文之一。他们还引用了大量相关工作,为实验提供了充分的理论支撑。光是参考文献部分,就非常值得一读。

在我看来,这些修改方案的主要价值之一,是帮助我们更好地理解并简化Transformer架构。除此之外,作者还报告称,修改后模型的训练吞吐量提升了15%,参数量减少了15%。

我希望拥有更多算力的大型研究机构也能关注这项工作,将这些洞见应用于新的架构(当然,最好也能分享他们的研究成果)。我非常想知道这些修改是否也适用于更大的大语言模型。

其他值得关注的研究论文

  • 《ChatGPT发布一周年:开源大语言模型正在迎头赶上吗?》,作者Chen、Jiao、Li、Qin(11月29日),https://arxiv.org/abs/2311.16989
    该研究调研了开源大语言模型被报道达到或超越ChatGPT能力的相关案例。

  • 《语言模型逆向》,作者Morris、Zhao、Chiu、Shmatikov、Rush(11月22日),https://arxiv.org/abs/2311.13647
    研究表明,下一个词元的概率包含了大量前文文本的信息,可以据此从大语言模型生成的输出中还原用户的提示词。

  • 《无需奖励模型,利用人类反馈微调扩散模型》,作者Yang、Tao、Lyu、Ge等(11月22日),https://arxiv.org/abs/2311.13231
    D3PO是一种直接偏好优化(DPO)方法,提供了一种高性价比的方案,无需奖励模型即可利用人类反馈微调扩散模型。

  • 《PaSS:并行推测采样》,作者Monea、Joulin、Grave(11月22日),https://arxiv.org/abs/2311.13581
    该研究提出并行解码方案,解决大语言模型生成词元时的内存瓶颈,无需额外辅助模型即可同时生成多个词元,速度提升最高达30%,额外参数极少。

  • 《ZipLoRA:通过有效融合LoRA实现任意主题、任意风格》,作者Shah、Ruiz、Cole、Lu等(11月22日),https://arxiv.org/abs/2311.13600
    ZipLoRA可将独立训练的风格低秩适配与主题低秩适配进行有效融合,此处应用于扩散模型。

  • 《GAIA:通用AI助手基准测试》,作者Mialon、Fourrier、Swift、Wolf等(11月21日),https://arxiv.org/abs/2311.12983
    GAIA是全新的通用AI助手基准测试,包含考验推理、工具使用等核心能力的真实场景问题,在该基准上人类的表现显著优于GPT-4等当前AI/大语言模型。

  • 《系统2注意力(或许你也需要)》,作者Weston、Sukhbaatar(11月20日),https://arxiv.org/abs/2311.11829
    提出的系统2注意力(S2A)机制,通过重构输入上下文以聚焦相关信息,优化基于Transformer的大语言模型,提升了对事实性、客观性要求高的任务的表现,减少了无关或有偏见的内容。

  • 《Orca 2:教小型语言模型如何推理》,作者Mitra、Del Corro、Mahajan、Codas等(11月18日),https://arxiv.org/abs/2311.11045
    继Orca之后,Orca 2聚焦于教小型语言模型不同的推理策略,而非单纯依赖模仿学习,以提升其解决问题的能力,路径可能与大型模型有所不同。

  • 《气候变迁中的骆驼:用Tulu 2增强语言模型适配能力》,作者Ivison、Wang、Pyatkin、Lambert等(11月17日),https://arxiv.org/abs/2311.10702
    作者发布了TÜLU 2模型系列,其中包含一款70B参数的DPO微调模型,是目前为止参数最大的DPO微调大语言模型。

  • 《Video-LLaVA:通过投影前对齐学习统一视觉表征》,作者Lin、Zhu、Ye、Ning等(11月16日),https://arxiv.org/abs/2311.10122
    Video-LLaVA是一款大型视觉语言模型,将视觉表征与语言特征进行统一,其统一分词方法的表现优于ImageBind-LLM、Llama-Adapter等未对齐图像与视频投影的模型。

  • 《Emu Edit:通过识别与生成任务实现精准图像编辑》,作者Sheynin、Polyak、Singer、Kirstain等(11月16日),https://arxiv.org/abs/2311.10089
    Emu Edit是一款多任务图像编辑模型,通过在广泛任务上训练并引入学习到的任务嵌入,在指令引导的图像编辑任务上达到了当前最优水平。

  • 《Tied-Lora:通过权重绑定提升LoRA的参数效率》,作者Renduchintala、Konuk、Kuchaiev(11月16日),https://arxiv.org/abs/2311.09578
    研究人员实验了LoRA(低秩适配)的权重绑定(即权重共享)方案,发现平均而言不绑定权重的效果最好;但在部分任务上,绑定权重也能取得不错的效果,同时可将所需的LoRA参数量减少至13%。

  • 《指数级提速的语言建模》,作者Belcak、Wattenhofer(11月15日),https://arxiv.org/abs/2311.10770
    作者提出UltraFastBERT——一种BERT(编码器式大语言模型)变体,仅使用原模型0.3%的参数,速度最高提升78倍,同时保持预测精度。

  • 《大羊驼知道GPT不会展示的事:用于置信度估计的代理模型》,作者Shrivastava、Liang、Kumar(11月15日),https://arxiv.org/abs/2311.08877
    论文提出使用带有可获取概率的代理置信度模型,来估计GPT-4、Claude-v1.3等不提供softmax概率的前沿大语言模型的置信度。结果显示,与直接询问大语言模型对答案的置信度相比,该方法在12个数据集中的9个上准确率更高。

  • 《笔记链:提升检索增强语言模型的鲁棒性》,作者Yu、Zhang、Pan、Ma等(11月15日),https://arxiv.org/abs/2311.09210
    论文提出“笔记链”方法,通过为检索到的文档生成连续笔记,提升检索增强语言模型的评估效果与回复准确性,即使存在噪声或无关信息也能生效。该方法使用ChatGPT在LLaMa-2 7B模型上生成的训练数据进行训练。

  • 《Fusion-Eval:将评估器与大语言模型融合》,作者Shu、Wichers、Luo、Zhu等(11月15日),https://arxiv.org/abs/2311.09204
    论文提出Fusion-Eval——一种基于提示的大语言模型评估聚合器,使用模板整合辅助评估器评分与模型回复,无需微调即可生成评分(及理由),并使用另一款大语言模型规划和优化评估流程。

  • 《路由到专家:大语言模型的高效奖励引导集成》,作者Lu、Yuan、Lin、Lin等(11月15日),https://arxiv.org/abs/2311.08692
    研究提出Zooter——一种针对大语言模型集成的奖励引导路由方法,能识别并利用单个模型的潜在专长,降低计算开销,在多个领域和任务上,效率与表现均优于传统的奖励模型排序方法。

  • 《对比人类、GPT-4与GPT-4V在抽象推理任务上的表现》,作者Mitchell、Palmarini、Moskvichev(11月14日),https://arxiv.org/abs/2311.09247
    研究使用ConceptARC基准测试,评估纯文本与多模态GPT-4的抽象推理能力。结果显示,尽管对GPT-4使用了详细的单样本提示、对GPT-4V使用了零样本和单样本图像提示,两个版本都未展现出人类级别的鲁棒抽象能力。

  • 《DiLoCo:大语言模型的分布式低通信训练》,作者Douillard、Feng、Rusu、Chhaparia等(11月14日),https://arxiv.org/abs/2311.08105
    论文提出DiLoCo——一种分布式优化算法,用于在大量连接不畅的小型设备上训练语言模型。与传统方法相比,该方法表现稳定,同时大幅降低了通信需求。

  • 《代码大语言模型综述》,作者Zhang、Chen、Liu、Liao等(11月14日),https://arxiv.org/abs/2311.07989v1
    该工作全面梳理了代码处理大语言模型的相关研究,考察了50余款模型、500余篇相关工作,探讨了从统计模型到大语言模型的演进历程,包括代码专属特性与未来方向。

  • 《Monkey:图像分辨率与文本标注对大多模态模型至关重要》,作者Li、Yang、Liu、Ma等(11月12日),https://arxiv.org/abs/2311.06607
    研究提出双管齐下的方案,提升现有模型在视觉-语言任务上的表现:一是用视觉编码器处理更高分辨率的图像(最高达896×1344像素),二是采用多级描述生成方法,深化场景与物体之间的上下文理解。

  • 《LCM-LoRA:通用稳定扩散加速模块》,作者Luo、Tan、Patil、Gu等(11月9日),https://arxiv.org/abs/2311.05556
    潜在一致性模型(从潜在扩散模型蒸馏而来)能大幅加速文生图任务,输出质量高且训练时间更短。在这份技术报告中,作者介绍了成功应用LoRA(低秩适配)的方案,进一步降低了扩散模型的资源需求。

  • 《通过微调移除GPT-4的RLHF防护》,作者Zhan、Fang、Bindu、Gupta等(11月9日),https://arxiv.org/abs/2311.05553
    人类反馈强化学习(RLHF)通常用于减少大语言模型的有害输出,但研究人员表明,这些防护机制通过微调就能轻易移除——研究人员仅用340个样本就达到了95%的成功率。

  • 《大语言模型幻觉综述:原理、分类、挑战与开放问题》,作者Huang、Yu、Ma、Zhong等(11月9日),https://arxiv.org/abs/2311.05232
    该综述全面介绍了大语言模型幻觉问题的挑战与最新进展,幻觉问题会影响大语言模型的可靠性与实际落地效果。

  • 《文生图模型的整体评估》,作者Lee、Yasunaga、Meng、Mai等(11月7日),https://arxiv.org/abs/2311.04287
    论文提出HEIM基准测试,从12个不同维度(从生成质量到原创性)评估文生图模型。结果显示,不同模型各有所长,没有任何一款模型在所有维度上都表现最优。

  • 《OtterHD:高分辨率多模态模型》,作者Li、Zhang、Yang、Zhang等(11月7日),https://arxiv.org/abs/2311.04219
    OtterHD-8B是一款全新的多模态大语言模型,源自Adept的https://www.adept.ai/blog/fuyu-8b多模态模型,既能处理高分辨率视觉输入,也支持灵活的输入尺寸,适配多样的推理应用。

  • 《S-LoRA:服务数千个并发LoRA适配器》,作者Sheng、Cao、Li、Hooper等(11月6日),https://arxiv.org/abs/2311.03285
    论文提出了多项效率优化技术(统一分页、全新的张量并行策略),用于推理阶段同时服务多个LoRA(低秩适配)适配器。

  • 《GPT4All:开源压缩语言模型生态》,作者Anand、Nussbaum、Treat、Miller等(11月6日),https://arxiv.org/abs/2311.04931
    这篇短文介绍了GPT4All的发展历程,这是一个旨在普及大语言模型使用的开源项目,目标是打破现有模型基础设施昂贵、访问受限、缺乏透明度的局限。

  • 《CogVLM:面向预训练语言模型的视觉专家》,作者Wang、Lv、Yu、Hong等(11月6日),https://arxiv.org/abs/2311.03079
    CogVLM是全新的多模态大语言模型,它没有采用冻结的图像编码器模块,而是集成了一个可训练的视觉专家模块,实现视觉与语言特征的深度融合。

  • 《FreshLLMs:借助搜索引擎增强为大语言模型更新知识》,作者Vu、Iyyer、Wang、Constant等(11月5日),https://arxiv.org/abs/2310.03214
    论文提出FreshQA基准测试,用于测试模型应对快速更新知识与错误前提的能力;同时提出FreshPrompt——一种有效的少样本提示方法,通过整合搜索引擎数据提升大语言模型的表现。

  • 《AGI层级:推动通用人工智能之路的进展》,作者Morris、Sohl-dickstein、Fiedel、Warkentin等(11月4日),https://arxiv.org/abs/2311.02462
    DeepMind的研究人员尝试用五级体系定义通用人工智能(AGI):从包含ChatGPT等新兴AI的1级,到被描述为“超人类”、能力100%超越人类的5级(2-5级目前尚未实现)。

  • 《FlashDecoding++:GPU上更快的大语言模型推理》,作者Hong、Dai、Xu、Mao等(11月2日),https://arxiv.org/abs/2311.01282
    FlashDecoding++是一款大语言模型推理引擎,针对核心挑战提出了异步softmax、扁平GEMM优化、启发式数据流适配等技术,在NVIDIA和AMD GPU上分别实现最高4.86倍和2.18倍的速度提升。

  • 《预训练数据混合让Transformer模型具备窄范围模型选择能力》,作者Yadlowsky、Doshi、Tripuraneni(11月1日),https://arxiv.org/abs/2311.00871
    研究考察了Transformer基于预训练数据混合,适配新的上下文内任务的能力,揭示了其在域外任务上的局限性,并表明其上下文学习能力更多依赖于数据覆盖度,而非基础的泛化能力。


本杂志是个人兴趣项目,无直接报酬。如果您愿意支持我,可以考虑购买https://sebastianraschka.com/books上的图书。如果您觉得它们有洞见、有帮助,也欢迎推荐给朋友和同事。
figure18
https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/https://nostarch.com/machine-learning-and-ai-beyond-basics 以及http://mng.bz/M96o

您的支持意义重大!非常感谢!

Leave a Reply

Your email address will not be published. Required fields are marked *

*