【转载】长输入与少训练数据场景下的Transformer

原文地址:
Transformers for Long Inputs and Less Training Data,by Sebastian Raschka, on 2023-05-13

长输入与少训练数据场景下的Transformer

本文精选并汇总了22项人工智能研究亮点。当前,自然语言处理与计算机视觉领域正涌现出大量令人振奋的技术进展!

当然,我无法将所有前沿且具潜力的研究论文都纳入每月一期的《Ahead of AI》通讯。因此,下文列出了过去几周我精读或泛读过的、未入选主通讯的优质论文补充清单。

祝阅读愉快!

大语言模型

借助循环记忆Transformer(RMT)将Transformer上下文扩展至100万令牌及以上

https://arxiv.org/abs/2304.11062,2023年4月19日

研究人员提出利用循环记忆机制,将输入上下文长度扩展至200万令牌。作为对比,ChatGPT搭载的GPT-4模型当前最多支持8192令牌。该论文的核心思路是:将上一段的输出作为记忆,与下一段的输入序列嵌入一同递归传入模型。

figure01

Unlimiformer:支持无限长度输入的长程Transformer

https://arxiv.org/abs/2305.01625,2023年5月2日

该方法是现有预训练大语言模型的一层封装框架,无需额外微调权重,提出将自注意力机制卸载为k近邻(k-NN)检索操作。其核心思路是:将长输入编码为多个更小的文本块并存储在数据库中,随后针对每个注意力头,通过k近邻检索调取对应的文本块。

figure02
图示注解来源:https://arxiv.org/abs/2305.01625

分步蒸馏!用更少训练数据、更小模型尺寸超越大语言模型

https://arxiv.org/abs/2305.02301,2023年5月3日

研究人员提出了一种蒸馏机制,用于定制面向特定任务的小模型;与标准微调相比,该机制只需更少训练数据,就能实现更优的模型性能。首先,通过大语言模型提取推理依据(一种经过重述的提示),再将这些推理依据与类别标签用于有监督训练更小的任务专属模型。

figure03
图示注解来源:https://arxiv.org/abs/2305.02301

规模化语言反馈下的语言模型训练

https://arxiv.org/abs/2303.16755,2023年4月9日

现有的大语言模型微调方法(例如ChatGPT采用的基于人类反馈的强化学习),在微调过程中需要对模型生成的成对输出进行比较(例如用于训练奖励模型)。在该研究中,研究人员提出了一种名为“语言反馈模仿学习(ILF)”的替代方案:(1)用户让模型生成回复;(2)用户对回复提出修改要求;(3)基于修改后的最终回复对大语言模型进行微调。

figure04
图示注解来源:https://arxiv.org/abs/2303.16755

ResiDual:具备双残差连接的Transformer

https://arxiv.org/abs/2304.14802,2023年4月28日

自《Attention Is All You Need》提出原始Transformer架构以来,层归一化的放置位置一直是学界讨论的焦点(可参考:https://arxiv.org/abs/2002.04745 )。层归一化前放置残差连接(Pre-LN)易导致表示坍缩,层归一化后放置残差连接(Post-LN)则易出现梯度消失问题。该论文中,研究人员提出融合Post-LN与Pre-LN的连接方式,兼具二者优势的同时规避各自缺陷。

figure05
图示注解来源:https://arxiv.org/abs/2304.14802

有观点指出,NormFormer论文中已提出过类似思路,且架构更简洁(http://arxiv.org/abs/2110.09456)。

利用摘要令牌学习提示压缩

https://arxiv.org/abs/2304.08467,2023年4月17日

近来提示工程备受关注(此处无双关含义),但让大语言模型重复运行相似的提示难道不是一种算力浪费吗?研究人员设计了“摘要(gist)”令牌,将任务压缩为特殊令牌以节省算力。该思路与软提示微调类似(相关介绍见https://magazine.sebastianraschka.com/p/understanding-parameter-efficient ),同时还能泛化到全新的提示场景。

figure06
图示注解来源:https://arxiv.org/abs/2304.08467

大语言模型的涌现能力是海市蜃楼吗?

https://arxiv.org/abs/2304.15004,2023年4月28日

在大语言模型领域,“涌现能力”指的是训练过程中未被明确教授、却随着模型接触海量信息后理解与生成文本的能力提升而自然产生的能力(例如摘要、翻译等)。在这项最新分析中,研究人员发现有力证据表明,这些涌现能力并非单纯由模型规模扩大带来。研究人员认为,涌现能力是选取特定性能指标后产生的错觉,因此“可能是研究者选择指标后的人为产物”。

论AI生成文本检测的可行性

https://arxiv.org/abs/2304.04736,2023年4月10日

随着大语言模型与AI生成文本日益普及,研究人员重新探讨了“AI生成文本能否被可靠检测”这一饱受争议的话题。该研究表明,答案是肯定的。基于信息论边界,在大多数场景下,只要样本量足够,就能够检测出AI生成的文本。

最少人工监督下、从零开始的原则驱动型语言模型自对齐

https://arxiv.org/abs/2305.03047,2023年5月4日

研究人员推出了Dromedary模型,性能优于同级别Alpaca模型(Alpaca本身是基于LLaMA微调的模型)。与ChatGPT不同,Dromedary未采用基于人类反馈的强化学习;也不像Alpaca那样需要提取ChatGPT的提示-回复对。取而代之的是,研究人员提出了一种全新的自对齐方法:在指令提示后附加行为准则即可实现对齐。

大语言模型对齐的固有局限性

https://arxiv.org/abs/2304.11082,2023年4月19日

自2022年11月ChatGPT发布以来,大语言模型研究大量聚焦于指令微调与对齐,让模型对用户更有帮助、更低风险。该论文提出了名为“行为期望边界(BEB)”的理论框架,证明对齐只能减少、无法彻底消除不良与有害行为。结论是:经过对齐的大语言模型仍无法抵御对抗性提示攻击。

生成式搜索引擎的可验证性评估

https://arxiv.org/abs/2304.09848,2023年4月19日

基于大语言模型的生成式搜索引擎正快速兴起。研究人员对Bing Chat、NeevaAI、Perplexity AI和YouChat进行了审计,结果显示:尽管回复看起来信息丰富、行文流畅,但生成的句子中仅有51.5%完全有引用支撑,而引用中也仅74.5%确实能佐证对应句子。

figure07
图示注解来源:https://arxiv.org/abs/2304.09848

StarCoder:愿源码与你同在!

https://arxiv.org/abs/2305.06161,2023年5月9日

研究人员基于GitHub爬取的1万亿令牌开源代码(来自The Stack数据集),训练了一个参数量155亿、上下文宽度8k的大语言模型。在构建出StarCoderBase基础模型后,研究人员又用350亿Python令牌对其进行微调,最终得到的StarCoder模型性能超越了当前所有代码大语言模型。

大语言模型涌现出的自主科研能力

https://arxiv.org/abs/2304.05332,2023年4月11日

作者将多个大语言模型串联,构建了一个基于多模型的智能体,能够设计和规划化学实验,包括使用工具、浏览互联网开展实验。从技术角度看,多个大语言模型的串联方式能达到如此好的效果颇具亮点。但尽管标题吸睛,该系统尚无法替代科研人员提出原创假设与实验设计。

scGPT:利用生成式AI构建单细胞多组学基础模型

https://www.biorxiv.org/content/10.1101/2023.04.30.538439v1,2023年5月1日

看到Transformer等通用方法被应用到其他领域总是很有意思。该研究中,研究人员借鉴大语言模型的生成式预训练思路,在基因等单细胞测序数据上预训练基础模型。最终得到的预训练模型具备基因网络的零样本学习与聚类能力。

PMC-LLaMA:基于医学论文对LLaMA进行进一步微调

https://arxiv.org/abs/2304.14454,2023年4月27日

这是大语言模型在领域专属数据上的又一应用,不过采用的是微调而非预训练范式。研究人员发现,在医学数据上微调后的LLaMA模型,在医学任务上的表现优于预训练基础模型,也超过了ChatGPT。这一结果符合预期,同时也再次印证:随着企业追求优化大语言模型的任务表现,模型微调将变得越来越重要。

计算机视觉

作为掩码自编码器的扩散模型

https://arxiv.org/abs/2304.03283,2023年4月6日

与大语言模型不同,扩散模型的预训练无法生成可用于其他下游任务的强特征表示。为此,研究人员将扩散模型重构为掩码自编码器形式。该研究有望催生图像任务中扩散基础模型的全新前沿方向。

figure08
图示注解来源:https://arxiv.org/abs/2304.03283

分割一切

https://arxiv.org/abs/2304.02643,2023年4月5日

Meta的“分割一切(Segment Anything)”项目提出了全新的图像分割任务、模型与数据集。配套的图像数据集是目前规模最大的分割数据集,涵盖1100万张图像、超10亿个掩码。尤其值得称赞的是,研究人员使用的是获得授权、符合隐私规范的图像,因此模型可以开源,且无重大版权风险。

figure09
图示注解来源:https://arxiv.org/abs/2304.02643

一次性全场景全域分割

https://arxiv.org/abs/2304.06718,2023年5月13日

与上文提到的Segment Anything思路类似,该论文提出了一种支持提示交互的图像分割模型。但相比Segment Anything,该项目支持更多交互类型,且能完成更复杂的语义任务。研究人员表示,Segment Anything的提示仅支持点、框和文本,而他们的模型还支持其他形式的提示,并且能够完成全景分割与实例分割。

figure10
图示注解来源:https://arxiv.org/abs/2304.06718

Generative Disco:面向音乐可视化的文本生成视频技术

https://arxiv.org/abs/2304.08551,2023年4月17日

正如《Ahead of AI》第7期(https://magazine.sebastianraschka.com/p/ahead-of-ai-7-large-language-models )中提到的,未来几个月将涌现更多创意多模态研究,这便是其中之一:研究人员可根据用户的音乐描述提示生成视频片段。该论文提出的文本生成图像模型能够生成丰富多样的视频,输出示例包括抽象动画,以及看起来像在跟唱的动画角色。

对齐你的潜变量:基于潜扩散模型的高分辨率视频合成

https://arxiv.org/abs/2304.08818,2023年4月18日

该研究将扩散模型的文本生成图像思路拓展到了视频生成领域。有意思的是,研究人员能够直接复用现成的预训练图像扩散模型来完成这个文本生成视频项目。

figure11>
图示注解来源:https://arxiv.org/abs/2304.08818

大规模视觉-语言模型的稳定低精度训练

https://arxiv.org/abs/2304.13013,2023年4月25日

目前bfloat16(混合精度)已是各类模型的常用训练精度,而随着NVIDIA新款H100 GPU推出,8位浮点数也开始得到支持。那么量化训练的表现如何?研究人员提出了Switch-Back——一种用于int8量化训练的线性层,性能优于现有LLM.int8()基线,精度与bfloat16持平,同时训练速度提升约20%。

figure12
图示注解来源:
https://arxiv.org/abs/2304.13013

Patch Diffusion:更快、数据效率更高的扩散模型训练方法

https://arxiv.org/abs/2304.12526,2023年4月25日

Patch Diffusion通过提升数据效率,将扩散模型的训练速度提升了2倍,同时保持图像质量不变。在该研究的实验中,研究人员仅用5000个训练样本就训练出了具备竞争力的模型。该方法的核心思路是:引入随机裁剪图像块的块级信息参与训练。

本通讯是个人兴趣驱动的项目,无直接商业报酬。如果您愿意支持我,欢迎购买我的书籍(https://sebastianraschka.com/books)。如果您觉得内容有启发、有帮助,也欢迎推荐给身边的朋友和同事。

figure13
https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/ , https://nostarch.com/machine-learning-and-ai-beyond-basics , and http://mng.bz/M96o

您的支持对我意义重大!非常感谢!

Leave a Reply

Your email address will not be published. Required fields are marked *

*