【转载】2023年值得关注的10篇AI研究论文

原文地址:Ten Noteworthy AI Research Papers of 2023,by Sebastian Raschka, on 2023-12-30

2023年值得关注的10篇AI研究论文

今年的感觉格外不同。我从事机器学习与AI领域的研究、应用与相关工作已有十余年,但印象中从未有哪个时期,这些领域能像今年这样备受瞩目、发展如此迅猛。

为给精彩纷呈的2023年机器学习与AI研究收尾,我很乐意分享今年读过的10篇值得关注的论文。我个人的研究重心更偏向大语言模型,因此今年的榜单中大语言模型(LLM)相关论文的占比会高于计算机视觉类论文。

我没有把这篇文章命名为“2023年顶级AI研究论文”,因为评判“最佳”论文本身带有主观性。这份榜单的遴选标准,是结合了我个人特别欣赏、或是认为具有重要影响力、值得关注的论文。(排序是推荐的阅读顺序,而非按感知到的质量或影响力高低排序。)

对了,滑到文章末尾有个小惊喜。感谢大家一路的支持,祝大家新年开局顺利!

1) Pythia —— 来自大规模训练运行的洞见

https://arxiv.org/abs/2304.01373 这篇论文中,研究者们发布了8个参数规模从7000万到120亿不等的大语言模型(权重与训练数据均公开,这在行业中十分罕见)。

但在我看来,这篇论文最突出的亮点在于,他们同时公开了训练细节、分析与洞见(其中一部分展示在下方的带注释图中)。

figure01
来自Pythia论文的带注释图表,https://arxiv.org/abs/2304.01373

Pythia论文解答了以下问题:

  • 在重复数据上进行预训练(即训练超过1个epoch)会有影响吗?结果表明,去重既不会提升也不会损害模型性能。
  • 训练顺序会影响记忆效果吗?遗憾的是,答案是否定的。说“遗憾”,是因为如果训练顺序会影响记忆,我们就可以通过重排训练数据来缓解不良的逐字记忆问题。
  • 预训练中的词频会影响任务性能吗?会的。出现频率更高的词汇,其少样本准确率往往更高。
  • 增大批次大小会影响训练效率与模型收敛吗?批次大小翻倍可让训练时间减半,且不会损害收敛效果。

如今,仅仅过去六个月,这些大语言模型早已算不上突破性成果。但我仍然将这篇论文纳入榜单,因为它不仅尝试解答关于训练设置的诸多有趣问题,更是在细节披露与透明度方面做出了良好示范。此外,参数规模小于10亿的小型大语言模型,是小型研究、实验探索的绝佳模板,也适合作为预训练实验的起步模型(这是他们的GitHub仓库链接:https://github.com/EleutherAI/pythia )。

我对2024年的期许是,未来能看到更多此类研究,以及更多写作精良的论文!

2) Llama 2:开源基础模型与经过微调的对话模型

https://arxiv.org/abs/2307.09288 是Meta广受欢迎的首篇Llama论文的后续研究。

Llama 2模型的参数范围从70亿到700亿,这也是它入选榜单的原因之一:这些模型至今仍是能力最强、应用最广泛的开源模型之一。值得一提的是,https://github.com/facebookresearch/llama/blob/main/LICENSE 许可协议也允许商业用途(详见https://ai.meta.com/resources/models-and-libraries/llama-downloads/ )。

figure02
来自Llama 2论文(https://arxiv.org/abs/2307.09288)的带注释图,对比Llama 2模型与ChatGPT的性能

在模型层面,Llama 2系列与其他许多大语言模型的区别在于,它既提供标准预训练模型,也提供经过基于人类反馈的强化学习(RLHF,正是ChatGPT所采用的训练方法)微调的对话模型,使其能像ChatGPT一样遵循人类指令——经过RLHF微调的模型目前仍然十分少见。

figure03
来自Llama 2论文(https://arxiv.org/abs/2307.09288)的带注释图,总结了用于指令微调的RLHF流程

关于RLHF及其在Llama 2中的应用细节,可参见我之前更全面的专题文章:
https://magazine.sebastianraschka.com/p/llm-training-rlhf-and-its-alternatives

除了Llama 2模型应用广泛且提供RLHF指令微调版本之外,我决定将这篇论文纳入榜单的另一个原因,是随附的这份长达77页的深度研究报告。

在报告中,作者们还很好地展示了Llama 2 70B对话模型的演进过程,追溯了从初始监督微调(SFT-v1)到最终采用PPO的RLHF微调阶段(RLHF-v5)的完整历程。下图反映了模型在无害性与有用性两个维度上的持续提升,如带注释图表所示。

figure04
来自Llama 2论文(https://arxiv.org/abs/2307.09288)的带注释图,展示了从第一代监督微调模型(SFT-1)到最终RLHF微调对话模型(RLHF-v5)的性能演进

尽管Mistral-8x7B(后文会详述)、DeepSeek-67B、YI-34B等模型在公开基准测试中超越了更大的Llama-2-70B模型,但在开源大语言模型以及基于其进行方法开发的场景中,Llama 2仍然是普遍且热门的选择。

此外,尽管部分基准测试显示已有更优模型,但今年行业面临的更大挑战之一,是基准测试结果的可信度。比如,我们如何确定模型没有在这些基准测试数据上训练过,分数没有被高估?在经典机器学习领域,有人提出一种新的梯度提升模型时,复现结果并验证相对容易。而如今,鉴于训练大语言模型的成本与复杂度(且大多数研究者既不公开架构,也不披露训练数据细节),我们根本无从考证。

总而言之,在其他所有主流公司都纷纷推出自有闭源大语言模型(谷歌的Bard与Gemini、亚马逊的Q、Twitter/X的Grok,以及OpenAI的ChatGPT)的当下,Meta仍在坚持开源,这令人耳目一新。

3) QLoRA:量化大语言模型的高效微调

https://arxiv.org/abs/2305.14314 是今年大语言模型研究与微调社区最受欢迎的技术之一,它让本已流行的LoRA(低秩适配)技术进一步降低了内存占用。简而言之,这意味着你可以在显存更小的GPU上运行更大的模型。

figure05
常规LoRA的简要可视化总结

QLoRA即量化低秩适配(Quantized Low-Rank Adaptation)。标准LoRA方法通过在模型各层权重上添加低秩矩阵来修改预训练大语言模型。这些矩阵规模更小,因此微调过程中更新所需的资源更少。

在QLoRA中,这些低秩矩阵被量化,也就是降低其数值精度。具体做法是将矩阵中连续的取值范围映射到有限的离散电平集合。这一过程降低了模型的内存占用与计算需求,因为低精度数值的运算内存开销更低。

figure06
在大语言模型的众多高效微调方法中,LoRA是最流行、应用最广泛的方法之一。图为出色的综述论文https://arxiv.org/abs/2303.15647 中的带注释图。

根据https://arxiv.org/abs/2305.14314 的数据,QLoRA将650亿参数Llama模型的内存需求降低到可在单张48GB GPU(如A100)上运行。通过对650亿参数Llama进行4位量化训练得到的650亿参数Guanaco模型,保持了完整16位微调的任务性能,仅经过24小时微调,性能就达到ChatGPT的99.3%。

我今年也做了很多QLoRA实验,发现它是降低微调时GPU内存需求的实用工具。不过它也存在权衡:额外的量化步骤会带来额外的计算开销,意味着训练速度会比常规LoRA稍慢。

figure07
我之前撰写的LoRA与QLoRA实验节选,见https://magazine.sebastianraschka.com/p/practical-tips-for-finetuning-llms

随着研究者与从业者致力于打造定制化大语言模型,大语言模型微调的重要性一如既往。而QLoRA这类技术降低了GPU内存门槛,让微调过程更易上手,我对此十分认可。

4) BloombergGPT:面向金融领域的大语言模型

纵观今年发表的所有论文,https://arxiv.org/abs/2303.17564 入选十佳榜单看起来或许有些意外,因为它并没有带来突破性的新洞见、新方法,也没有开源模型。

我将它纳入榜单,是因为它是一个很有意思的案例:研究者在领域专属数据集上预训练了一个规模较大的大语言模型。此外,论文的描述相当详尽,这在如今越来越少见。尤其是企业作者参与的论文更是如此——今年的一个趋势是,在竞争激烈的格局下,大公司为了保护商业机密,对架构或数据集细节越来越保密(注:我对此并无指责之意)。

同时,BloombergGPT也让我思考了在领域专属数据上预训练与微调模型的各种不同方式,如下图所总结(注意:这一点并未在BloombergGPT论文中探讨,但未来的相关研究会很有意思)。

figure08
大语言模型预训练与微调的不同方式

简而言之,BloombergGPT是一个拥有500亿参数的金融领域语言模型,在3630亿金融领域token与3450亿公开通用数据集token上训练而成。作为对比,GPT-3的参数规模是它的3.5倍(1750亿参数),但训练token量仅为它的1.4倍(4990亿)。

既然GPT-3的规模是它的3.5倍,为什么作者们要采用“仅”500亿参数的架构?这个问题更好回答。他们采用了Chinchilla缩放法则,结合可用金融数据的规模,认为这个参数量是合适的。

在混合数据集上从头(预)训练大语言模型是否值得?从论文来看,该模型在目标领域表现非常出色。但我们并不知道,它是否优于以下两种方案:a)在领域专属数据上对预训练模型做进一步预训练;b)在领域专属数据上微调预训练模型。

尽管有上述小幅批评,总体而言这仍是一篇有趣的论文,是领域专属大语言模型的出色案例与范本;同时,它也为“向大语言模型注入知识时,预训练与微调孰优孰劣”这一问题留下了进一步研究的空间。

(注:好奇微调效果对比的读者,可参见我和他人的相关讨论:https://x.com/rohanpaul_ai/status/1738474868214235163?s=20 。“小型”模型https://arxiv.org/abs/2309.09530 在一个数据集上表现优于BloombergGPT,在另外三个金融数据集上性能与其接近。尽管整体来看BloombergGPT略胜一筹,但值得注意的是,训练AdaptLLM-7B的成本仅约100美元,而BloombergGPT的投入高达数百万美元。)

《Ahead of AI》是读者支持型出版物。若想接收新文章并支持我的创作,欢迎成为免费或付费订阅者。

5) 直接偏好优化:你的语言模型本质上是一个奖励模型

在讨论https://arxiv.org/abs/2305.18290 这篇论文之前,我们先稍作回顾,聊聊它旨在取代的方法——基于人类反馈的强化学习(RLHF)。

RLHF是ChatGPT与Llama 2对话模型背后的核心技术。我曾在https://magazine.sebastianraschka.com/p/llm-training-rlhf-and-its-alternatives 一文中更详细地介绍过RLHF,它采用多步骤流程:

  1. 监督微调:首先在包含指令与期望回复的数据集上训练模型。
  2. 奖励建模:人类标注者对模型的输出给出反馈。这些反馈用于训练奖励模型,学习预测什么样的输出更受偏好。
  3. 近端策略优化(PPO):模型生成输出,由奖励模型为每个输出打分。PPO算法利用这些分数调整模型的策略,使其生成更高质量的输出。(这是一种用于微调模型策略的强化学习算法。)

figure09
监督指令微调步骤所用数据集中的两个训练示例。注意“输入”是可选的。

RLHF虽然流行且有效——正如ChatGPT与Llama 2所展现的那样,但它的实现也相当复杂,且对参数十分敏感。

https://arxiv.org/abs/2305.18290 提出了一种算法,无需显式的奖励建模或强化学习,就能优化语言模型以对齐人类偏好。相反,DPO采用简单的分类目标。

figure10
来自DPO论文https://arxiv.org/abs/2305.18290 的带注释图

在DPO中,我们保留监督微调步骤(即上述步骤1),但将步骤2和步骤3替换为单个步骤,在偏好数据上进一步微调模型。换句话说,DPO完全省去了RLHF所需的奖励模型构建环节,极大简化了微调流程。

它的效果如何?直到最近,采用DPO训练的模型还不多。(这也合理,因为DPO本身也是较新的方法。)不过,https://arxiv.org/abs/2310.16944 中介绍的Zephyr 7B模型就是一个近期的例子。Zephyr-7B基于Mistral-7B基础大语言模型,采用DPO进行微调。(后文还会详细介绍Mistral。)

如下方性能表格所示,70亿参数的Zephyr模型在发布时,在同规模模型中表现超越所有其他模型。更令人印象深刻的是,在对话类基准测试https://arxiv.org/abs/2306.05685 上,Zephyr-7B甚至超越了参数规模是它10倍的700亿参数Llama 2对话模型。

figure11
来自https://arxiv.org/abs/2310.16944 的Zephyr模型(经DPO微调的大语言模型)带注释基准测试结果

总而言之,DPO论文的吸引力在于其方法的简洁性。除了Llama 2等少数例外,采用RLHF训练的对话模型十分稀少,这很大程度上归因于RLHF方法的复杂性。有鉴于此,我认为未来一年DPO模型的应用会愈发广泛,这一判断是合理的。

6) Mistral 7B

必须承认,https://arxiv.org/abs/2310.06825 这篇论文篇幅简短,并不在我最喜爱的论文之列。但它提出的模型却产生了相当大的影响力。

我决定将这篇论文纳入榜单,是因为Mistral 7B模型不仅在发布时大受欢迎,还作为基础模型催生了另外两个知名模型:Zephyr 7B与最新的Mistral混合专家(MoE)模型。这些模型很好地代表了我所预见的、至少在2024年上半年小型大语言模型的发展趋势。

在讨论Zephyr 7B与Mistral MoE模型之前,我们先简要聊聊Mistral 7B本身。

简而言之,Mistral 7B论文提出了一个紧凑而强大的语言模型:尽管仅有70亿参数的适中规模,它在各类基准测试中却超越了更大的模型,比如130亿参数的Llama 2模型。(除了规模是它两倍的https://github.com/QwenLM/Qwen 之外,Mistral 7B也是今年https://llm-efficiency-challenge.github.io/leaderboard 竞赛优胜方案所采用的基础模型。)

figure12
来自https://arxiv.org/abs/2310.06825 的带注释图,对比Mistral 7B与Llama 13B的性能

它为何如此出色,确切原因尚不清楚,但很可能得益于其训练数据。Llama 2与Mistral均未公开训练数据,因此我们只能推测。

架构层面,该模型与Llama 2一样采用分组查询注意力。尽管与Llama 2非常相似,但Mistral架构的一个有趣新增特性是滑动窗口注意力,它能够节省内存、提升计算吞吐量,从而加快训练速度。(滑动窗口注意力此前已在https://arxiv.org/abs/1904.10509https://arxiv.org/abs/2004.05150 中被提出。)

Mistral所采用的滑动窗口注意力机制,本质上是一个固定大小的注意力块,让当前token仅能关注特定数量的之前token(而非所有之前的token),如下图所示。

figure13
来自https://arxiv.org/abs/2310.06825 的带注释图,解释滑动窗口注意力机制

具体到7B Mistral,注意力块大小为4096个token,研究者训练模型时的上下文长度可达10万token。举个具体的例子:在常规自注意力中,模型处理第50000个token时,可以关注之前全部49999个token。而在滑动窗口自注意力中,Mistral模型仅能关注第45904到50000个token(因为50000 – 4096 = 45904)。

不过,滑动窗口注意力主要用于提升计算性能。Mistral能够超越更大的Llama 2模型,大概率不是因为滑动窗口注意力,而恰恰是在采用滑动窗口注意力的情况下依然实现了超越。

Zephyr与Mixtral

Mistral 7B极具影响力的原因之一,是它作为Zephyr 7B的基础模型——正如前文DPO部分所提到的。Zephyr 7B是首个采用DPO训练且表现超越其他方案的热门模型,它可能为DPO成为未来数月对话模型微调的首选方法奠定了基础。

另一个源自Mistral 7B的值得关注的模型,是最近发布的https://mistral.ai/news/mixtral-of-experts/ ,也称为Mixtral-8x7B。该模型在多个公开基准测试中,性能追平甚至超越了更大的Llama-2-70B。

figure14
OpenCompass基准测试结果,来自https://github.com/open-compass/MixtralKit。蓝色方框标出了每行中的最优结果。

更多基准测试结果可参见官方页面:https://mistral.ai/news/mixtral-of-experts/ 。该团队还发布了Mixtral-8x7B-Instruct模型,采用DPO进行微调(不过截至撰写本文时,尚无基准测试将其与经过RLHF微调的Llama-2-70-Chat做对比)。

figure15
Mixtral架构概览,基于Mistral团队最初通过社交媒体磁力链接分享的param.json文件

有传闻称GPT-4也是一个混合专家模型,由16个子模块组成。据传这16个子模块每个都有110亿参数(作为参考,GPT-3有1750亿参数)。如果你大约两个月前读过我的文章https://magazine.sebastianraschka.com/p/ai-and-open-source-in-2023 ,我曾提到“看看2024年混合专家方法能否将开源模型提升到新高度,会很有意思”。看起来Mixtral早早开启了这一趋势,而我确信这仅仅是个开始。

混合专家模型入门

如果你对混合专家模型还不熟悉,这里做个简要说明。

figure16
来自Switch Transformer论文(https://arxiv.org/abs/2101.03961)的带注释图,解释混合专家架构

上图展示了Switch Transformer的架构,它每个token使用1个专家,总共有4个专家。而Mixtral-8x-7B则包含8个专家,每个token使用2个专家。

为什么采用混合专家架构?综合来看,像Mixtral这样的7B级模型中的8个专家,总参数量仍约为560亿。实际上,实际数值低于560亿,因为混合专家方法仅应用于前馈网络(FFN,即全连接层),而非自注意力权重矩阵。因此,总参数量更可能在400-500亿之间。

注意,路由器会对token进行路由分配,使得前向传播时每次仅激活不到140亿参数(2×小于70亿,而非全部560亿),因此训练(尤其是推理)速度会比传统的非混合专家方法更快。

如果你想了解更多关于混合专家模型的内容,这里是https://twitter.com/sophiamyang 推荐的阅读清单:
https://arxiv.org/abs/1701.06538
https://arxiv.org/abs/2006.16668
https://arxiv.org/abs/2211.15841
https://arxiv.org/abs/2305.14705

此外,如果你想试用混合专家大语言模型,也可以看看https://github.com/XueFuzhao/OpenMoE 仓库,它在今年早些时候实现并开源了混合专家大语言模型。

其他小型但竞争力强的大语言模型

Mistral 7B、Zephyr 7B与Mixtral-8x7B是2023年小型但高性能、且权重开源的模型取得进展的绝佳范例。另一个值得一提的模型、也是我个人榜单的亚军,是微软的phi系列。

phi系列的秘诀在于,通过过滤网络数据得到高质量数据(被称为“教科书级数据”)进行训练。

phi系列模型在2023年分阶段发布,包括phi-1(13亿参数)、phi-1.5(13亿参数)与phi-2(27亿参数)。其中phi-2于两周前刚刚发布,据称尽管规模仅为Mistral 7B的一半,性能却追平甚至超越了后者。

figure17
13亿参数的phi-1.5模型与各类70亿参数模型的对比(来自phi-1.5论文https://arxiv.org/abs/2309.05463

想了解更多phi模型的信息,推荐以下资源:
https://arxiv.org/abs/2306.11644 —— phi-1论文
https://arxiv.org/abs/2309.05463
https://www.microsoft.com/en-us/research/blog/phi-2-the-surprising-power-of-small-language-models/ 官方发布公告

7) Orca 2:教小语言模型学会推理

https://arxiv.org/abs/2311.11045 是一篇相对较新的论文,未来它会对我们未来数月乃至数年训练大语言模型的方式产生多大影响,还有待时间检验。

我决定将它纳入榜单,是因为它融合了多个概念与思路。

其中一个思路是从GPT-4等大型高性能模型中蒸馏数据,创建合成数据集来训练小型但高性能的大语言模型。这一思路在去年发表的Self-Instruct论文中已有阐述。今年早些时候,Alpaca(一个在ChatGPT输出上微调的Llama模型)真正让这种方法流行开来。

它的工作原理是什么?简而言之,这是一个4步流程:

  1. 用一组人工编写的指令(本研究中为175条)与示例指令初始化任务池;
  2. 用预训练大语言模型(如GPT-3)确定任务类别;
  3. 给定新指令,让预训练大语言模型生成回复;
  4. 对回复进行收集、修剪与过滤,再加入任务池。

figure18
基于Self-Instruct论文https://arxiv.org/abs/2212.10560 的带注释图

另一个思路或许并不令人意外,但值得强调:高质量数据对微调至关重要。例如,https://arxiv.org/abs/2305.11206 提出了一个人工生成的高质量数据集,仅包含1000个训练样本,用其微调后的模型,性能优于在5万条ChatGPT生成回复上微调的同一模型。

figure19
来自LIMA论文https://arxiv.org/abs/2305.11206 的带注释图

与以往严重依赖模仿学习来复制更大模型输出的研究不同,Orca 2旨在教“小型”(即70亿与130亿参数)大语言模型掌握各类推理技巧(如逐步推理、回忆后生成等),并帮助它们确定每个任务最有效的策略。这一方法让Orca 2的表现明显优于同规模模型,甚至能达到5-10倍规模模型的性能水平。

figure20
Orca 2论文https://arxiv.org/abs/2311.11045 中评估的众多基准测试任务的子集

尽管我们尚未看到广泛的相关研究,但Orca 2的方法或许也能解决https://arxiv.org/abs/2305.15717 论文中强调的合成数据问题。该研究中,研究者们探究了用Alpaca、Self-Instruct等方法,让较弱的语言模型模仿ChatGPT等更强的闭源模型。最初,这些模仿模型表现亮眼,指令遵循能力出色,众包标注者给出的评分也与ChatGPT相当。但后续更多评估发现,这些模仿模型只是在人类观察者看起来表现好,生成的回复却常常存在事实错误。

8) 大规模下卷积神经网络与视觉Transformer性能相当

近年来,由于Transformer的出色性能,我几乎只研究大语言Transformer或视觉Transformer(ViT)。

最后三篇我们切换到计算机视觉领域的论文。我觉得计算机视觉Transformer尤其吸引人的一点是,预训练的视觉Transformer甚至比卷积神经网络更易于微调。(我今年早些时候在CVPR的一个动手实践讲座中做过总结,见:https://magazine.sebastianraschka.com/p/accelerating-pytorch-model-training

令我意外的是,我偶然发现了https://arxiv.org/abs/2310.16764 这篇论文,它表明当拥有足够大的数据集时,卷积神经网络(CNN)实际上与视觉Transformer具有竞争力。

figure21
来自《大规模下卷积神经网络与视觉Transformer性能相当》(https://arxiv.org/abs/2310.16764)论文的带注释图

该研究中,研究者投入了最高达11000 TPU小时的计算预算,对视觉Transformer与卷积神经网络进行了公平对比。结果表明,当卷积神经网络的预训练计算预算与视觉Transformer的常用预算相当时,二者性能可以持平。为此,他们在JFT的40亿张标注图像上进行预训练,随后在ImageNet上微调模型。

9) Segment Anything

图像与视频中的目标识别与分割,以及分类与生成建模,是计算机视觉的主要研究方向。

先简要说明这两个任务的区别:目标检测是预测边界框及对应的类别标签;分割则是对每个像素进行分类,以区分前景与背景物体。

figure22
目标检测(上)与分割(下)。图分别来自YOLO论文(https://arxiv.org/abs/1506.02640)与Mask R-CNN论文(https://arxiv.org/abs/1703.06870v3

Meta的https://arxiv.org/abs/2304.02643 论文是开源与图像分割研究领域的重要里程碑。该论文提出了图像分割的新任务、新模型与新数据集。随附的图像数据集是迄今为止最大的分割数据集,包含1100万张图像上的超过10亿个掩码。

figure23
Segment Anything模型(SAM)专为高效、基于提示的图像分割而设计。图为Segment Anything论文https://arxiv.org/abs/2304.02643 的带注释截图

而尤为难得、值得称赞的是,研究者们使用的是获得授权且尊重隐私的图像,因此该模型可以开源,而不会存在重大版权问题。

Segment Anything模型(SAM)由三个主要组件组成,如上方带注释图所总结。

figure24
Segment Anything模型的三个主要组件,来自https://arxiv.org/abs/2304.02643

更详细地说,三个组件可总结如下:

  1. 图像编码器:采用基于预训练视觉Transformer(ViT)的掩码自动编码器,可处理高分辨率输入。该编码器每张图像仅运行一次,可在向模型输入提示前完成计算。
  2. 提示编码器:处理两类提示:稀疏提示(点、框、文本)与密集提示(掩码)。点与框通过位置编码结合每种提示类型的可学习嵌入来表示;自由格式文本则使用CLIP的现成文本编码器。密集提示即掩码,通过卷积进行嵌入,并与图像嵌入逐元素相加。
  3. 掩码解码器:将图像嵌入、提示嵌入与输出token映射为掩码。它采用解码器式Transformer架构,计算每个图像位置的掩码前景概率。

图像分割对于自动驾驶、医学影像等诸多应用都至关重要。在短短6个月时间里,这篇论文的引用量已达https://scholar.google.com/scholar?cites=1574144728855576863&as_sdt=5,39&sciodt=0,39&hl=en ,并且已有大量项目基于这篇论文展开。

10) 对齐你的潜在向量:基于潜在扩散模型的高分辨率视频合成

https://arxiv.org/abs/2311.10709 是Meta研究部门的另一个知名计算机视觉项目。

Emu是一个文本生成视频模型,可以根据文本提示生成完整视频。

尽管它并非首个实现出色文本生成视频效果的模型,但与此前的工作相比,它的表现十分优异。

figure25
Emu与其他文本生成视频模型的性能对比,来自https://arxiv.org/abs/2311.10709

正如作者们所指出的,与此前的方法相比,Emu的架构设计相对简洁。其核心思路之一是,Emu将生成过程拆解为两步:首先根据文本生成图像(采用扩散模型),然后同时基于文本与生成的图像生成视频(采用另一个扩散模型)。

2022年是DALL-E 2、Stable Diffusion、Midjourney等文本生成图像模型的大年。尽管2023年文本生成图像模型仍然非常流行(虽然大语言模型占据了全年大部分关注度),但我认为,文本生成视频模型即将在未来一年的线上社区中变得更加普及。

由于我并非图像或视频设计师,目前暂时没有这些工具的使用场景;不过,作为衡量计算机视觉领域进展的通用指标,文本生成图像与文本生成视频模型的发展仍然值得关注。

这本杂志是个人兴趣项目,不提供直接报酬。不过,如果您愿意支持我的创作,欢迎购买https://sebastianraschka.com/books 上的书籍。如果您觉得这些书有洞见、有帮助,也欢迎推荐给您的朋友与同事。

figure26
https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/ , https://nostarch.com/machine-learning-and-ai-beyond-basics , 以及 http://mng.bz/M96o

您的支持意义重大!谢谢!

Leave a Reply

Your email address will not be published. Required fields are marked *

*