【转载】2023年的人工智能与开源:高潮与低谷——年度回顾

原文地址:AI and Open Source in 2023,by Sebastian Raschka, on 2025-10-23

2023年的人工智能与开源:高潮与低谷——年度回顾

我们正稳步走向2023年末。我觉得现在是个好时机,来简要回顾一下2023年人工智能研究、产业以及开源领域发生的重大进展。

当然,本文只选取了我脑海中印象最深的相关主题。如果想了解更多内容,推荐大家查看我在https://magazine.sebastianraschka.com/archive上发布的月度《研究亮点》以及《Ahead of AI》第4-12期。

延续2022年的技术规模化趋势

今年,AI产品端尚未出现任何根本性的新技术或方法论。相反,今年的重点很大程度上是在去年已验证有效的方向上持续加码:

有一则Reddit爆料(https://www.reddit.com/r/LocalLLaMA/comments/14wbmio/gpt4_details_leaked/)称,GPT-4是一个混合专家(MoE)模型,由16个子模块组成。据传这16个子模块每个都有110亿参数(作为参考,GPT-3有1750亿参数)。

figure01
来自https://www.stateof.ai/的一张GPT-3/GPT-4梗图

GPT-4采用混合专家架构这件事大概率是真的,尽管我们目前还无法完全确认。一个趋势是,行业研究者在论文中披露的信息比以前越来越少。比如,此前的论文(https://arxiv.org/abs/2305.10435、https://paperswithcode.com/paper/language-models-are-unsupervised-multitask、https://arxiv.org/abs/2005.14165、https://arxiv.org/abs/2203.02155)都会披露架构和训练细节,而GPT-4的架构却是严格保密的。再举一例:Meta AI的第一篇论文(https://arxiv.org/abs/2302.13971)还详细说明了训练模型所用的数据集,而后续的论文(https://arxiv.org/abs/2307.09288)则对这些信息秘而不宣。
说到这里,斯坦福大学上周推出了“基础模型透明度指数”(https://hai.stanford.edu/news/introducing-foundation-model-transparency-index),根据该指数,Llama 2以54%的透明度位居第一,GPT-4以48%位列第三。

当然,要求企业公开商业机密可能并不合理。但这仍是一个值得关注的有趣趋势,因为看起来2024年我们还会沿着这个方向继续走。

关于模型规模化,今年的另一个趋势是输入上下文长度的拓展。比如,GPT-4的竞品Claude 2(https://www.anthropic.com/index/claude-2)的核心卖点之一就是支持最高10万输入token(GPT-4目前限制为3.2万token),这让它在生成长文档摘要方面尤其有吸引力。再加上支持PDF输入,让它在实际场景中格外实用。

figure02
使用Claude 2生成PDF文档摘要

开源与研究趋势

在我的印象里,去年开源社区的重心很大程度上放在扩散模型(https://arxiv.org/abs/2112.10752,比如Stable Diffusion:https://github.com/CompVis/stable-diffusion)以及其他计算机视觉模型上。扩散模型和计算机视觉如今依然举足轻重,但今年开源社区和研究界更关注的焦点是大语言模型(LLM)。

开源(或者说“可公开获取”)大语言模型的爆发,一定程度上要归功于Meta发布的首个预训练模型(https://arxiv.org/abs/2302.13971)——尽管它的许可证限制颇多,但还是启发了大量研究者和从业者:比如斯坦福的 Alpaca(https://crfm.stanford.edu/2023/03/13/alpaca.html)、LMSYS的Vicuna(https://lmsys.org/blog/2023-03-30-vicuna/)、GPT4All(https://arxiv.org/abs/2303.16199)、Lit-LLaMA(https://github.com/Lightning-AI/lit-llama),这里只列举几个。

几个月后,Llama 2(https://arxiv.org/abs/2307.09288)——我在《Ahead of AI》第11期《新基础模型》(https://magazine.sebastianraschka.com/p/ahead-of-ai-11-new-foundation-models)中有过更详细的介绍——作为能力更强的基础模型,很大程度上取代了Llama 1,甚至还附带了微调版本。

不过,大多数开源大语言模型仍然是纯文本模型,尽管像Llama-Adapter V2(https://arxiv.org/abs/2304.15010)这类微调方法有望将现有大语言模型改造为多模态模型。

figure03
图片来自Llama-Adapter V2论文(https://arxiv.org/abs/2304.15010

一个值得注意的例外是Fuyu-8B(https://www.adept.ai/blog/fuyu-8b),它就在10月17日刚刚发布。

figure04
标注图来自https://www.adept.ai/blog/fuyu-8b

值得注意的是,Fuyu将输入图像块直接传入线性投影层(或嵌入层)来学习自身的图像块嵌入,而不像其他模型和方法那样依赖额外的预训练图像编码器(比如LLaVA:https://github.com/haotian-liu/LLaVA、MiniGPT-4:https://github.com/Vision-CAIR/MiniGPT-4)。这极大简化了架构和训练流程。

除了上面提到的少数多模态尝试之外,最大的研究焦点仍然是用参数量小于1000亿的小型模型追平GPT-4的文本性能——这背后的原因可能是硬件资源成本与限制、数据获取渠道有限,以及更短的开发周期要求(迫于发表压力,大多数研究者没法花数年时间训练单个模型)。

不过,开源大语言模型的下一个突破未必来自模型规模的扩大。2024年,混合专家(MoE)方法能否将开源模型推向新高度,值得期待。

有意思的是,在研究层面,2023年我们也看到了一些基于Transformer的大语言模型的替代方案,包括循环架构的Hyena大语言模型(https://arxiv.org/abs/2305.13048)和卷积架构的大语言模型(https://arxiv.org/abs/2306.15794),它们的目标都是提升效率。但目前基于Transformer的大语言模型依然是行业标杆。

figure05
Hyena大语言模型架构标注图,来自https://hazyresearch.stanford.edu/blog/2023-06-29-hyena-dna

总的来说,开源领域今年非常活跃,取得了众多突破与进展。这个领域的价值远大于各部分的简单相加。因此,看到有些人主动游说反对开源AI,我感到很遗憾。但我希望我们能保持这种积极势头,打造更高效的解决方案和替代方案,而不是越来越依赖大型科技公司发布的ChatGPT类产品。

用一个积极的点结束这一部分:多亏了开源和研究社区,我们看到了可以在单张GPU上运行的小型高效模型,比如Mistral 7B(https://arxiv.org/abs/2309.05463,https://mistral.ai/)以及Zephyr(https://news.ycombinator.com/item?id=37891848),它们的性能正在向大型闭源模型靠拢——这是一个令人振奋的趋势,希望2024年能延续下去。

生产力承诺

我认为开源AI是发展高效、定制化大语言模型方案的主要路径,包括基于个人或领域特定数据进行微调、适配各类应用的大语言模型。如果你在社交媒体上关注我,可能见过我谈论并实践Lit-GPT(https://github.com/Lightning-AI/lit-gpt)——这是我积极参与贡献的一个大语言模型开源仓库。不过,虽然我是开源的坚定支持者,我也同样推崇设计精良的产品。

自ChatGPT发布以来,大语言模型几乎被用到了方方面面。读这篇文章的读者大概率都用过ChatGPT,所以我不用再赘述大语言模型在某些任务上确实很有用。

关键在于我们要把它们用在“合适”的地方。比如,我大概不会去问ChatGPT我常去的杂货店几点开门。但我最喜欢的用法之一,是修正语法,或者帮我头脑风暴、改写句子和段落。从更大的层面来说,大语言模型背后蕴藏的是生产力提升的承诺,这一点你可能也已经感受到了。

除了普通文本大语言模型,微软和GitHub推出的Copilot(https://github.com/features/copilot)也在不断成熟,越来越多的人开始使用它。今年早些时候,Ark Invest的一份报告(https://ark-invest.com/home-thank-you-big-ideas-2023/)估算,代码助手能将编码任务的完成时间缩短约55%。

figure06
图表来自https://ark-invest.com/home-thank-you-big-ideas-2023/

具体是不是55%还有待商榷,但如果你用过代码助手就会发现,它们真的非常有用,能让繁琐的编码工作轻松不少。

有一点是确定的:代码助手已经成为常态,而且未来只会变得更好。它们会取代程序员吗?我希望不会。但它们无疑会让现有程序员的生产力更高。

这对Stack Overflow意味着什么?《AI现状报告》里有一张图表,对比了Stack Overflow和GitHub的网站流量,这可能和Copilot的普及度上升有关。不过我觉得,即便是ChatGPT/GPT-4,对编码相关任务也已经非常有帮助了。我怀疑Stack Overflow流量的下滑,部分(甚至很大程度上)也要归因于ChatGPT。

figure07
图表来自http://stateof.ai/报告

AI面临的问题

幻觉问题

和2022年一样,这个问题依然困扰着大语言模型:它们可能生成有害内容,还容易出现幻觉。这一年里,我讨论过好几种解决方法,包括基于人类反馈的强化学习(RLHF)以及英伟达的NeMo Guardrails(https://github.com/NVIDIA/NeMo-Guardrails)。但这些方法都只是权宜之计,要么限制太严,要么约束不够。

到目前为止,还没有哪种方法(甚至连思路都没有)能100%可靠地解决这个问题,同时又不削弱大语言模型的正向能力。在我看来,归根结底还是我们怎么用大语言模型:不要什么事都依赖大语言模型,数学题就用计算器,把大语言模型当作写作伙伴,并且对它的输出做双重检查,诸如此类。

此外,针对特定的商业应用,探索检索增强生成(RAG)系统作为折中方案或许是值得的。在RAG架构中,我们从语料库中检索相关的文档片段,然后让大语言模型基于检索到的内容生成文本。这种方法让模型可以调用数据库和文档里的外部信息,而不用记住所有知识。

figure08
RAG示意图,来自https://leanpub.com/machine-learning-q-and-ai/

版权问题

更紧迫的问题是围绕AI的版权争议。根据维基百科“合理使用”词条(https://en.wikipedia.org/wiki/Fair_use)的说法:“基于受版权保护材料训练的大语言模型,其版权地位尚未完全明确。”总的来说,很多规则还在制定和修订中。我希望最终的规则——不管是什么样的——能够清晰明确,让AI研究者和从业者可以据此调整和行动。(我在《大语言模型与版权法》一文中写过更多关于AI和版权争议的内容:https://magazine.sebastianraschka.com/i/136352403/llms-and-copyright-laws)

评测问题

困扰学术研究的一个问题是,主流的基准测试和排行榜被认为已经“半失效”了,因为测试集可能已经泄露,变成了大语言模型的训练数据。这已经成为Phi-1.5和Mistral等模型的争议点,我在《Ahead of AI》第12期《大语言模型商业化》(https://magazine.sebastianraschka.com/p/ahead-of-ai-12-llm-businesses)里讨论过这个问题。

自动化大语言模型评测有一种流行但没那么容易实现的方式:询问人类的偏好。另外,很多论文也将GPT-4作为次优方案来做评测。

figure09
使用人类偏好与GPT-4偏好进行评测的示例,来自https://arxiv.org/abs/2305.11206

营收问题

生成式AI目前仍处于探索阶段。当然,我们都能感受到文本和图像生成器在特定应用场景中的用处。但它们能否为公司带来正向现金流,仍是一个备受争议的话题——因为部署和运行成本非常高昂。比如,去年Futurism就报道过OpenAI因ChatGPT亏损的消息(https://futurism.com/the-byte/openai-losing-money-chatgpt)。另一方面,《财富》杂志报道(https://fortune.com/2023/08/30/chatgpt-creator-openai-earnings-80-million-a-month-1-billion-annual-revenue-540-million-loss-sam-altman/#:~:text=ChatGPT%20creator%20OpenAI%20is%20reportedly,million%20loss%20from%20last%20year)称,OpenAI现在每月营收8000万美元,这可能抵消甚至超过其运营成本。

虚假图像问题

生成式AI相关的更大问题之一——如今在社交媒体平台上尤为突出——是虚假图像和视频的生成。虚假图像和视频一直是个问题,就像Photoshop这类软件降低了伪造内容的门槛一样,AI正在把这件事推向新的高度。

虽然有其他AI系统旨在检测AI生成的内容,但这些系统不管是针对文本、图像还是视频,都不够可靠。要想在一定程度上遏制和解决这些问题,唯一的办法是依赖值得信赖的专业人士。就像我们不会随便从网上的论坛或网站获取医疗或法律建议一样,我们大概也不应该不加核实就相信网上陌生账号发布的图像和视频。

数据集瓶颈

和前面提到的版权争议相关,很多公司(包括Twitter/X和Reddit)都关闭了免费API访问,一方面是为了增加营收,另一方面也是为了防止爬虫抓取平台数据用于AI训练。

我见过很多专门做数据集相关业务的公司打广告。虽然AI可能遗憾地导致某些工作岗位的自动化,但它似乎也在同时创造新的机会。

推动开源大语言模型进步的最佳方式之一,可能是搭建一个众包数据集的平台。我的意思是,编写、收集、整理那些明确获得授权、可用于大语言模型训练的数据集。

RLHF只是锦上添花吗?

Llama 2模型系列发布时,我很高兴看到它包含了针对对话场景微调的模型。通过基于人类反馈的强化学习(RLHF),Meta AI提升了模型的有用性和安全性——如果你想了解更详细的解释,我专门写过一篇关于RLHF及其替代方案的文章:https://magazine.sebastianraschka.com/p/llm-training-rlhf-and-its-alternatives

figure10标注图来自《Llama 2:开放基础模型与微调对话模型》论文(https://arxiv.org/abs/2307.09288

我一直觉得RLHF是一种非常有意思且很有前景的方法,但除了InstructGPT、ChatGPT和Llama 2之外,它并没有得到广泛应用。所以当我看到一张RLHF热度上升的图表时,我挺惊讶的。我之前完全没预料到,因为它至今应用范围还不广。

figure11
RLHF热度图表,来自https://stateof.ai/报告

由于RLHF实现起来比较复杂、有一定难度,大多数开源项目仍然聚焦于有监督微调,也就是指令微调。

RLHF最近的一个替代方案是直接偏好优化(DPO)。在论文(https://arxiv.org/abs/2305.18290)中,研究者表明,RLHF中拟合奖励模型的交叉熵损失,可以直接用于微调大语言模型。根据他们的基准测试,DPO效率更高,而且在回复质量方面往往也优于RLHF/近端策略优化(PPO)。

figure12
标注图来自https://arxiv.org/abs/2305.18290

DPO目前似乎还没有被广泛使用。不过让我兴奋的是,两周前,我们有了第一个通过DPO训练的公开可用大语言模型Zephyr-7B-alpha(https://huggingface.co/HuggingFaceH4/zephyr-7b-alpha),它的表现似乎超过了更大的、通过RLHF训练的Llama-2 70B对话模型:

figure13
截图来自https://x.com/_lewtun/status/1711756736758178270?s=20

不过值得注意的是,RLHF并不是专门用来优化基准测试性能的;它的核心优化目标是人类评估的“有用性”和“安全性”,这一点在上面的对比中并没有体现。

分类任务有人做吗?

几周前,我在Packt的“让AI落地”大会(https://www.packtpub.com/conference/put-gen-ai-to-work)上做了一个演讲,其中强调文本模型最主流的应用场景之一仍然是分类。比如常见的任务:垃圾邮件分类、文档归类、客户评论分类、社交媒体有害言论标注等等。

根据我的经验,用“小型”大语言模型就能取得非常好的分类效果,比如BERT(https://arxiv.org/abs/1910.01108),只用单张GPU就够了。

figure14
截取自https://www.packtpub.com/conference/put-gen-ai-to-work,展示了可以将小型大语言模型微调为文本分类器

今年,我在《深度学习基础》课程(https://lightning.ai/pages/courses/deep-learning-fundamentals/)的第8单元里,把“用小型大语言模型做文本分类”作为练习,在IMDB电影评论数据集上微调现成的RoBERTa模型,相关讨论见这里:https://github.com/Lightning-AI/dl-fundamentals/discussions/41。(作为参考,我在该数据集上训练的最优逻辑回归词袋模型https://github.com/rasbt/machine-learning-book/blob/main/ch08/logistic-regression-bag-of-words/log-reg.ipynb 准确率只有89%)

figure15
来自我的《深度学习基础》课程的讨论帖:https://github.com/Lightning-AI/dl-fundamentals/discussions/41

话说回来,我还没看到大语言模型在分类任务上有什么新的重大成果或趋势。大多数从业者仍然使用基于BERT的编码器模型,或者像Flan-PaLM(https://arxiv.org/abs/2210.11416)这类编码器-解码器模型——后者还是2022年发布的。这可能是因为这些架构的表现已经足够好,完全能满足需求。

表格数据的现状

2022年,我写过一篇文章(https://sebastianraschka.com/blog/2022/deep-learning-for-tabular-data.html),介绍了很多基于深度学习的表格数据处理方法。不过,和上面提到的分类大语言模型类似,表格数据集领域也没出现太多新进展——也可能是我太忙了没注意到。

figure16
表格数据集示例,供参考

2022年,Grinsztajn等人发表了一篇论文(https://arxiv.org/abs/2207.08815),我认为其核心结论——在中小数据集(1万训练样本)上,树模型(随机森林和XGBoost)的表现优于深度学习方法——至今仍然成立。

说到这里,问世快10年的XGBoost推出了2.0正式版(https://github.com/dmlc/xgboost/releases/tag/v2.0.0),带来了更好的内存效率、对超内存大数据集的支持、多目标树等诸多新特性。

2023年的计算机视觉

虽然今年的焦点几乎都在大语言模型上,但计算机视觉领域也有很多进展。这篇文章已经很长了,我就不展开讲最新的计算机视觉研究了。不过,今年夏天我参加了CVPR 2023,专门写了一篇独立的《2023年计算机视觉研究现状》:
https://magazine.sebastianraschka.com/p/ahead-of-ai-10-state-of-computer

https://substack.com/profile/27393275-sebastian-raschka-phd
·
2023年7月6日
https://magazine.sebastianraschka.com/p/ahead-of-ai-10-state-of-computer

大语言模型(LLM)的发展仍在快速推进。与此同时,抛开AI监管的争议不谈,大语言模型的新闻更新速度似乎比往常稍慢了一点。这正好是个机会,让我们把目光投向计算机视觉,聊聊这个领域的研究与发展现状。这个主题也刚好和CVPR 2023温哥华大会的回顾很搭——那是一场很棒的会议,会场可能是我参加过的会议里最好的。

除了研究之外,计算机视觉相关的AI也催生了很多新产品和新体验,今年都在逐步成熟。

比如,今年夏天我去奥斯汀参加SciPy 2023大会(https://www.scipy2023.scipy.org/)时,看到了第一批真正的全自动无人驾驶Waymo汽车在街上行驶。

还有一次去电影院,我也发现AI在电影行业的应用越来越普及。最近的一个例子是《夺宝奇兵5》里哈里森·福特的“减龄”效果——电影制作者用演员的旧档案素材训练了一个AI模型。

此外,生成式AI能力现在已经深度整合进了主流软件产品中。最近的例子就是Adobe Firefly:https://www.adobe.com/sensei/generative-ai/firefly.html

2024年预测

预测向来是最主观、最有挑战的部分。去年,我预测大语言模型会在文本和代码之外的领域得到更多应用。其中一个例子就是针对DNA的大语言模型(https://arxiv.org/abs/2306.15794);另一个是Geneformer——在3000万个单细胞转录组上预训练的Transformer模型,用于辅助网络生物学预测:https://www.nature.com/articles/s41586-023-06139-9

2024年,大语言模型将越来越多地变革计算机科学之外的STEM研究领域。

另一个新兴趋势是各家公司纷纷开发定制AI芯片,背后的驱动力是高需求导致的GPU短缺。谷歌将继续加码其云TPU v5e和A3 GPU(https://cloud.google.com/blog/products/compute/announcing-cloud-tpu-v5e-and-a3-gpus-in-ga),亚马逊推出了Trainium(https://aws.amazon.com/machine-learning/trainium/),AMD也可能在缩小与英伟达的差距。而现在,微软(https://www.theinformation.com/articles/microsoft-to-debut-ai-chip-next-month-that-could-cut-nvidia-gpu-costs)和OpenAI(https://arstechnica.com/information-technology/2023/10/openai-may-jump-into-ai-hardware-amid-high-costs-supply-constraints/)也开始研发自己的定制AI芯片。这其中的挑战将是,确保主流深度学习框架对这些硬件提供全面、完善的支持。

在开源方面,我们仍然落后于最大的闭源模型。目前,最大的公开可用模型是Falcon-180B(https://huggingface.co/blog/falcon-180b)。这可能没什么好担心的,因为大多数人都没有足够的硬件资源来运行这些模型。比起更大的模型,我更期待看到更多由多个小型子模块组成的开源混合专家模型——我在本文前面已经讨论过。

我也乐观地认为,众包数据集的工作会持续推进,而DPO(https://arxiv.org/abs/2305.18290)会逐步取代有监督微调,成为顶尖开源模型的主流训练方式。

这本杂志是我个人的热情项目,不提供直接报酬。不过,如果您愿意支持我,可以考虑购买我的书:https://sebastianraschka.com/books。如果您觉得这些书有洞见、有帮助,也欢迎推荐给您的朋友和同事。

figure17
相关书籍链接:
https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/
https://nostarch.com/machine-learning-and-ai-beyond-basics
http://mng.bz/M96o

您的支持对我意义重大!非常感谢!

Leave a Reply

Your email address will not be published. Required fields are marked *

*