新型基础模型:CodeLlama 与开源 AI 的其他热点
在本期通讯中,我们将聚焦今年夏天最重磅的热点之一:Llama 2 基础模型与对话模型的发布,以及 CodeLlama——它们共同构成了开源 AI 大语言模型(LLM)领域的最新亮点。
此外,我们还将深入探讨遭泄露的 GPT-4 模型细节,分析其性能随时间的变化,并介绍当前主流 Transformer 架构大语言模型的新兴替代方案。
OpenAI 于本周发布了全新的微调 API,用于基于自定义数据集训练 GPT-3.5-turbo。这一新举措可能会进一步引发关于闭源专有 AI 系统与可本地部署的开源 AI 模型之间的讨论。
AI 领域仍在持续变革与演进,开源社区做出了巨大贡献,包括 Llama-Adapters、LoRA、QLoRA 等微调技术的发展。我尤其期待 NeurIPS 大语言模型效率挑战赛(NeurIPS LLM Efficiency Challenge)能带来更多创新。
预训练大语言模型
深入解读 Llama 2
我们直接进入正题,从今年夏天(我认为)最重磅的大语言模型发布——Llama 2 开始说起。Meta 的 Llama 2 是广受欢迎的 LLaMA 模型的官方继任者。初代 LLaMA 和 Llama 2 的发布都配套了非常详尽的研究论文,这点我非常赞赏:
https://arxiv.org/abs/2302.13971,Touvron 等人,2023年2月
https://arxiv.org/abs/2307.09288,Touvron 等人,2023年7月
和 LLaMA 一样,Llama 2 是一个模型系列,包含多个不同参数量的预训练大语言模型。那么,Llama 2 有哪些新特性、值得关注的点?我们来逐一讨论。
命名规则
首先说明命名问题。LLaMA 的全称是 Large Language Model Meta AI(Meta AI 大语言模型)。全大写的拼写打起来有点麻烦,不过好消息是,它的继任者官方名称就叫 “Llama 2”。所以如果本文里出现 LLaMA,指的是初代 LLaMA v1,而 Llama 2 就是我们本次重点介绍的新模型。
新特性一览
在深入讨论各个细节之前,先简要总结一下核心更新点:
- Llama 2 的训练数据量比初代 LLaMA 多 40%。
- 同时,Llama 2 支持的输入长度是初代的 2 倍。
- 参数量更大的 34B 和 70B 模型在架构上有小幅改动,采用了多查询注意力,我们稍后会展开说明。
- 另一大变化是,Llama 2 模型系列现在包含微调后的对话模型(通过有监督微调与基于人类反馈的强化学习实现),详见后文。
- Llama 2 的协议现在允许商业使用。

标注版表格,出自 https://arxiv.org/abs/2307.09288
模型尺寸
LLaMA 有 7B、13B、33B、65B 四种参数量,Llama 2 则分为 7B、13B、34B*、70B 四个版本,不同尺寸在模型效果与计算开销之间提供了不同的权衡。不过,LLaMA 仅提供预训练基础模型,而 Llama 2 同时提供预训练基础模型和微调对话模型。其中,基础模型指仅通过下一词预测预训练任务训练得到的模型;微调对话模型则是在指令数据集上通过有监督学习和基于人类反馈的强化学习(RLHF)微调而来,详见后文。
*(值得注意的是,Meta 只发布了 7B、13B 和 70B 版本,没有开放 34B 模型。)
开源协议
大部分读者在决定是否花时间深入了解 Llama 2 之前,可能都想先知道它的协议和使用限制。初代 LLaMA 在研究圈大获成功、广受赞誉,但也因其限制严格的协议受到一些批评。LLaMA 的推理代码是开源的,但模型权重仅逐案授予学术研究者,并非开源发布。简而言之,LLaMA 的协议允许用于研究但不允许商业使用;而现在的 https://github.com/facebookresearch/llama/blob/main/LICENSE 协议同时允许商业场景使用(详见 https://ai.meta.com/resources/models-and-libraries/llama-downloads/ )。不过,尽管 Llama 2 的协议对大多数使用场景来说都足够宽松,但它并不是严格意义上的开源协议;正如这篇文章所讨论的:https://www.google.com/url?q=https://blog.opensource.org/metas-llama-2-license-is-not-open-source/&sa=D&source=editors&ust=1692833158282053&usg=AOvVaw12tE3bEYV5jVbDiv6dE-jg 。就我个人而言,我认为 Llama 2 的使用条款非常合理,只是使用“开源”这个词可能会造成混淆,甚至有误导性。(但为了行文简洁,本文后续仍将 Llama 2 归入开源模型范畴。)

协议截图,来自 https://github.com/facebookresearch/llama/blob/main/LICENSE
Llama 2 基础模型性能
上一节说完了协议和使用限制,接下来进入最有意思的部分,也是大家最关心的问题:“Llama 2 到底有多强?”要公平回答这个问题,我们需要区分 Llama 2 基础模型和微调后的 Llama 2 对话模型。
我们先来说基础模型——它们属于解码器式大语言模型,仅通过传统的下一词预测预训练任务训练得到。
想了解更多解码器式与编码器式大语言模型的区别,可以看我之前的文章:
https://magazine.sebastianraschka.com/p/understanding-encoder-and-decoder
https://substack.com/profile/27393275-sebastian-raschka-phd
·
2023年6月17日
https://magazine.sebastianraschka.com/p/understanding-encoder-and-decoder
很多人让我再深入讲讲大语言模型的行业黑话,解释一些如今我们习以为常的技术术语,其中就包括“编码器式”和“解码器式”大语言模型。这些术语到底是什么意思?
https://magazine.sebastianraschka.com/p/understanding-encoder-and-decoder
简而言之,如下图中标注所示,Llama 2 基础模型的表现远超其他开源模型。

标注版表格,出自 https://arxiv.org/abs/2307.09288
不过,Llama 2 基础模型的性能不如主流闭源模型——但这也在情理之中,因为下表中的闭源模型 1)都经过了微调,2)参数量要大得多(GPT-3.5 有 1750 亿参数,而 Llama 2 最大只有 700 亿)。后面我们会拿微调后的 Llama 2 模型做更公平的对比。

标注版表格,出自 https://arxiv.org/abs/2307.09288
训练数据
长达 77 页的 Llama 2 论文细节非常详实,这点我很欣赏。但有意思的是,和初代 LLaMA 不同,这篇论文除了下面这句简短描述外,没有透露任何训练数据的细节:
更完善的数据清洗,更新了数据混合比例,总训练 token 量增加 40%
我们可以推测,原因可能是 1)保持对其他开源模型的竞争优势,或者 2)避免版权相关诉讼。
Business Insider 的这篇文章认为原因可能是后者:https://www.businessinsider.in/tech/news/llama-copyright-drama-meta-stops-disclosing-what-data-it-uses-to-train-the-companys-giant-ai-models/articleshow/101887460.cms 。
Llama 2 对话模型
Llama 2 模型系列的一大亮点是对话模型。这些对话模型以 Llama 2 基础模型为底座,经过了额外的指令微调,类似 InstructGPT 和 ChatGPT 的做法。
如下图中标注所示,Llama 2 对话模型的表现相比其他主流对话模型毫不逊色。

标注版图示,出自 https://arxiv.org/abs/2307.09288
微调分为多个阶段:首先是有监督指令微调,和 Alpaca(斯坦福研究者基于初代 LLaMA 微调的模型,后来也被大量开源大语言模型沿用)的做法一致;之后是基于人类反馈的强化学习(RLHF),类似 ChatGPT 的流程,如下图标注总结。

标注版图示,出自 https://arxiv.org/abs/2307.09288
有监督微调阶段重点使用了小批量的高质量数据,在数百万样本池中只选用了数千条样本。这种思路与这篇论文提出的“少即是多”理念一致:https://www.google.com/url?q=https://arxiv.org/abs/2305.11206&sa=D&source=editors&ust=1692833158286565&usg=AOvVaw2cZIpO1zw7yT7xRnrVyB4N ,我之前在本期通讯的另一篇文章里也聊过这个话题:
https://magazine.sebastianraschka.com/p/ahead-of-ai-9-llm-tuning-and-dataset
在初始有监督微调之后,模型还通过 RLHF 进一步优化。深入讨论 RLHF 超出了本文的范围,大家可以参考我之前的另一期通讯:
https://magazine.sebastianraschka.com/p/ahead-of-ai-6-train-differently
值得一提的是,InstructGPT 和 ChatGPT 在 RLHF 训练中使用了近端策略优化(PPO)算法。相比之下,Llama 2 的作者实验了两种不同的方法:https://arxiv.org/abs/2302.01318 以及带 PPO 的 RLHF。
作者还很好地展示了 Llama 2 70B 对话模型的迭代过程,追踪了从初始有监督微调(SFT-v1)到最终带 PPO 的 RLHF 微调阶段(RLHF-v5)的演进。如下图的标注图表所示,模型在无害性和有用性两个维度上都得到了持续提升。

标注版图示,出自 https://arxiv.org/abs/2307.09288
未来,看看 https://arxiv.org/abs/2305.18290 这种无需强化学习的替代方案和这些 RLHF 方法相比效果如何,会很有意思。我之前在这篇文章里介绍过它:https://magazine.sebastianraschka.com/p/ai-research-highlights-in-3-sentences-2a1 。
Llama 2 实现细节与趣闻
Llama 2 的论文内容非常详实,本期通讯不可能覆盖所有方面。不过下面我想再挑几个我觉得有意思的细节说说。
比如,34B 和 70B 参数的 Llama 模型使用了 https://arxiv.org/abs/2305.13245 提出的技术。GQA(分组查询注意力)可以看作是多查询注意力的更通用形式,而多查询注意力之前已经在 Falcon 等模型中应用过。

标注版图示,出自 https://arxiv.org/abs/2305.13245
https://www.google.com/url?q=https://arxiv.org/abs/2305.13245&sa=D&source=editors&ust=1692833158289904&usg=AOvVaw3BnurYvKcaeEiolaGvvHfi
https://www.google.com/url?q=https://arxiv.org/abs/2305.13245&sa=D&source=editors&ust=1692833158290062&usg=AOvVaw18yvNgUlVaEcw5RdctA974
这么做的动机大概率是在尽量不影响模型效果的前提下,降低计算开销。
我们还需要微调模型吗?
尽管 Llama 2 基础模型和对话模型表现都不错,但通过微调仍有提升空间。可以把 Llama 2 看作一个经过优化的基础模型,还可以针对更专业的任务做进一步微调。
为了说明微调的潜在收益,我们拿 BoolQ 基准测试举个例子。令人意外的是,在这个特定任务上,Llama 2 的表现甚至不如 DeBERTa-1.5B 这个仅编码器模型。这提醒我们,即便是 Llama 2 这样的强模型,在特定任务上也可能被更小的微调模型超越。

公平起见,DeBERTa-1.5B 模型(最初在 ICLR 2021 上提出)是在 BoolQ 的训练集上微调过的,而 Llama 2 是通过少样本提示来完成任务的。
虽然还没有相关实验,但经过微调的 Llama 2 模型在这个数据集上表现应该会更好——至少比 Llama 2 基础模型要好。
(而且正如 ICLR 2023 上 https://arxiv.org/abs/2111.09543 论文展示的,用一个仅 3 亿参数的小模型也能在这个任务上取得不错的效果。)
如何使用 Llama 2
如上所述,Llama 2 是性能极强的模型。但我们怎么在自己的项目里使用它呢?
Meta 在 https://github.com/facebookresearch/llama 维护了推理代码,可以用来加载 Llama 2 权重。
此外,Lit-GPT 现在也支持 Llama 了——这是一个开源仓库,支持大量大语言模型的预训练和微调。我最近也帮忙在 Lit-GPT 里实现了 QLoRA 支持,下面附上一些 Llama 2 的性能基准测试结果。

https://github.com/Lightning-AI/lit-gpt 结合 QLoRA 的 Llama 2 基准测试
另外还有 https://github.com/karpathy/llama2.c 这个 GitHub 仓库,用纯 C 语言实现了 Llama 2 的推理(不支持预训练和微调),适合那些只想运行模型、不需要微调的爱好者折腾。
Code Llama
Llama 2 已经很出色了,但编程任务并不是它的强项。比如 HumanEval 基准就是一个编程相关的测试基准,出自这篇论文:https://arxiv.org/abs/2107.03374 。

标注版图示,出自原始论文 https://arxiv.org/abs/2307.09288
两天前,https://ai.meta.com/research/publications/code-llama-open-foundation-models-for-code/ 发布了 Code Llama(7B、13B、34B 三个版本),采用和 Llama 2 相同的协议,是专门针对代码训练的模型。这些模型分为三个版本:通用代码模型(Code Llama)、指令跟随模型(Code Llama-instruct),以及专门针对 Python 代码的版本(Code Llama-Python)。注意,所有 Code Llama 模型都是先以 Llama 2 权重初始化,再进一步在代码数据上训练得到的。
34B 参数的 Code Llama 模型,编程能力大约是初代 70B Llama 2 模型的两倍,缩小了和(参数量大得多的)GPT-4 的差距。
为何没有 70B 参数的 Code Llama 模型?
有意思的是,Code Llama 只有 7B、13B、34B 参数版本;和 Llama 2 不同,没有 70B 版本。论文里没有给出解释,我猜测可能有两个原因:
- Code Llama 模型是在 Llama 2 权重基础上,额外训练了 5000 亿代码 token,而 Llama 2 模型的训练数据是 2 万亿 token。由于 Code Llama 的领域专属训练 token 量只有前者的 1/4,根据 https://arxiv.org/abs/2001.08361 的结论——训练数据不足的话,70B 版本的 Code Llama 可能效果不够好。
- Code Llama 模型支持 10 万 token 的上下文,这在处理代码时非常实用。相比之下,Llama 2 最多只支持 4096 个 token 输入。如果 70B 模型要支持 10 万 token 输入,计算量可能会大到不切实际(或者说在常规硬件集群上不合理)。
GPT-4 模型细节遭泄露
把话题从开源模型转到闭源模型,上个月 GPT-4 方面也有几个有意思的消息。比如,Reddit 上泄露了 GPT-4 的模型参数:https://www.reddit.com/r/LocalLLaMA/comments/14wbmio/gpt4_details_leaked/
GPT-4 是一个参数量约 1.8 万亿的语言模型,共 120 层,规模是 GPT-3 的 10 倍。它采用混合专家(MoE)模型架构,包含 16 个专家,每个专家约 110 亿参数。采用 MoE 架构可以提升推理时的资源利用效率,仅需约 2800 亿参数、560 TFLOPs 的算力,而纯稠密模型则需要 1.8 万亿参数、3700 TFLOPs。
该模型在约 13 万亿 token 上训练,数据来源广泛,包括互联网数据、书籍、研究论文等。为了降低训练成本,OpenAI 采用了张量并行和流水线并行,以及 6000 万的大批次大小。据估计,GPT-4 的训练成本约为 6300 万美元。
来源:https://www.reddit.com/r/LocalLLaMA/comments/14wbmio/gpt4_details_leaked/
尤其值得关注的是,GPT-4 显然采用了混合专家(MoE)方案,这点非常重要。MoE 的核心思想是通过组合多个专门的子模型(即“专家”)的预测或决策,来提升系统的整体性能。
所以,如果我们想进一步优化 Llama 2 这类模型,大幅超越类似 GPT-4 的产品,可能不仅要把模型规模扩展到相近水平(这种情况下要做到参数量相当,需要扩大 25 倍),还要考虑采用 MoE 架构。
GPT-4 的性能在变差吗?
我们经常看到一种说法,称 OpenAI 为了节省计算时间和成本,一直在降低 ChatGPT 的性能。在最近的 https://arxiv.org/abs/2307.09009 论文中,研究者有一个有趣的发现:GPT-4 的模型表现确实似乎随时间推移在变差。这是因为为了节省成本采用了蒸馏方法,还是为了防止滥用加了安全护栏?(顺便说一句,看到研究精力被用来研究这些变化,还挺有意思的,其实这些问题问一下参与模型开发的研究员和工程师就能得到答案。)

标注版图示,出自 https://arxiv.org/abs/2307.09009
作为补充,我强烈推荐阅读 Substack 上的这篇文章:https://www.aisnakeoil.com/p/is-gpt-4-getting-worse-over-time ,作者是 https://open.substack.com/users/891603-sayash-kapoor?utm_source=mentions 和 https://open.substack.com/users/19265909-arvind-narayanan?utm_source=mentions ,文章指出了上述研究论文的几个重要缺陷。比如:
真正发生变化的是,3 月版的 GPT-4 几乎总会猜测数字是质数,而 6 月版几乎总会猜测是合数。作者只测试了质数,就把这解读为性能大幅下降。而 GPT-3.5 的情况正好相反。
所以,“GPT-4 性能随时间变差”这个说法未必成立。不过,它的行为模式确实在发生变化。
实际使用中,使用 API 的最大好处之一是我们不用关心模型的部署和服务。但如果我们在 API 之上构建服务,这也成了最大的缺点。诚然,性能提升通常是好事,但模型行为的不透明变更,可能会让你之前所有正常运行的查询第二天就失效了。你在闭源 API 之上构建的东西越多,这个问题就越棘手。
ChatGPT 微调即服务
上周三,https://openai.com/blog/gpt-3-5-turbo-fine-tuning-and-api-updates 发布了 GPT-3.5-turbo 的微调 API。对于想要基于自定义数据微调大语言模型的人来说,这是个非常有意思的消息。
看看它和开源方案相比表现如何会很有趣——毕竟最新最前沿的微调技术(Llama-Adapters、LoRA、QLoRA 等)都诞生于开源社区。
而且,我们上面讨论的最新开源模型 Llama 2,和 ChatGPT / GPT-3.5 相比表现也毫不逊色,如下图所示。

标注版图示,出自 https://arxiv.org/abs/2307.09288
从 OpenAI 的文档和宣传材料来看,这项服务似乎不只是改变大语言模型回复的风格或语气。相反,OpenAI 提供的是一套完整的指令微调服务。
不过,这也意味着,要让模型完全适配医疗、金融、法律等新的专业领域,大概率还是做不到。因为新知识通常是通过预训练注入的,而不是微调;开源模型也是如此。

节选自 https://platform.openai.com/docs/guides/fine-tuning/when-to-use-fine-tuning
虽然 OpenAI 没有说明他们会使用哪种微调方法,但采用低秩适配(LoRA)作为微调技术会是很合理的选择。我认为这会是最简单、性价比最高的方案,因为他们不用为每个客户都存储一个全新的 1750 亿参数大语言模型。使用 LoRA 的话,可以共用同一个基础大语言模型,只需要存储 LoRA 权重即可。
大语言模型的扩展与 Transformer 架构的替代方案
开放的研究挑战之一,是如何将大语言模型扩展到更长的输入上下文。近期的方法包括:
- https://arxiv.org/abs/2304.11062#:~:text=This%20technical%20report%20presents%20the,models%20in%20natural%20language%20processing. ;
- https://arxiv.org/abs/2306.15794 ;
- https://arxiv.org/abs/2307.02486 。
尽管长上下文大语言模型有不少应用场景,比如针对长文档输入提问,但大家都回避了一个核心问题:大语言模型对这些长上下文的利用效率到底怎么样?
最新研究(https://arxiv.org/abs//2307.03172)表明,大语言模型擅长检索文档开头的信息,但如果信息在文档中间,检索效果就会差很多。

标注版图示,出自 https://arxiv.org/abs//2307.03172
这篇论文的分析主要针对 ChatGPT(如图所示)和 Claude。当然,未来如果能纳入其他模型(比如 Hyena、LongNet 等)会更有意思。
不过这已经很能说明问题了!
- 我反而觉得,比如基于 RNN 的大语言模型(像 https://www.google.com/url?q=https://arxiv.org/abs/2305.13048&sa=D&source=editors&ust=1692833158299736&usg=AOvVaw2h6bCGXGmMWf0X9Af5mXGh )表现会相反——因为它是顺序处理信息的,反而可能会忘记早期的信息。
- 据我所知,基于 Transformer 的大语言模型架构里,没有特定的归纳偏置能解释为什么文档中间的文本检索效果会更差。我猜测这完全是因为训练数据和人类的写作习惯:最重要的信息通常在开头或结尾(想想论文的摘要和结论部分),大语言模型在训练时就是这样学习注意力权重的分配的。
更多 Transformer 替代方案
上一段我提到了几个 Transformer 架构大语言模型的替代方案,比如基于循环神经网络的 https://arxiv.org/abs/2305.13048 大语言模型,以及基于卷积的 https://arxiv.org/abs/2306.15794 。
最新的 Transformer 替代方案是保留网络(Retentive Network,简称 RetNet),上个月的一篇论文提出了这个架构,标题很有冲击力:https://arxiv.org/abs/2307.08621 。
这篇论文提出了另一种大语言 Transformer 的替代方案,它的计算复杂度随输入序列长度呈线性增长,而非二次增长。RetNet 可以用并行模式训练,再切换为循环模式来扩展上下文长度,且不会增加内存开销,同时保持良好的推理性能。目前最大的模型是 67 亿参数,未来看看 RetNet 和 Llama-2 70B 等模型的对比研究结果会很有意思。

它会成为被广泛采用的 Transformer 替代方案吗?初期热度过后,目前似乎还没有其他项目采用这个架构,不过时间会给出答案。
什么是“前沿 AI 模型”?
AI 社区特别喜欢造新词!
很长一段时间里,我都很抵触用“基础模型”这个词。我觉得完全没必要发明一个新说法来描述预训练大语言模型或者预训练视觉 Transformer。
最初,很多人觉得那篇发明“基础模型”一词的论文,本质上是学术界用来刷引用的手段(从 https://arxiv.org/abs/2108.07258 这篇论文就能看出来,截至目前已经被引用 1372 次)。但尽管早期有诸多批评,这个词最近几年还是开始被更广泛地接受。顺应这个趋势,我也开始把“基础模型”纳入我的词汇表。
上个月,来自 https://www.governance.ai/post/frontier-ai-regulation 的作者们(合著者包括 Google DeepMind、OpenAI 和微软的研究人员)发表了一篇新论文 https://arxiv.org/abs/2307.03718 ,在基础模型之上又提出了一个新概念——“前沿 AI 模型”:
我们将“前沿 AI 模型”定义为具备高度能力、可能展现出危险特性的基础模型。
我们正身处一个有趣的时代。
硬件观察
尽管(或者说正因为)近期大语言模型进展飞速,GPU 短缺的问题一直存在,尤其是 NVIDIA 的 H100 芯片。正如 VentureBeat 最近报道的:https://venturebeat.com/ai/nvidia-gpu-shortage-is-top-gossip-of-silicon-valley/ 。
就在所有人都在争抢 H100 的时候,NVIDIA 也发布了下一代 GPU:https://www.cnbc.com/2023/08/08/nvidia-reveals-new-ai-chip-says-cost-of-running-large-language-models-will-drop-significantly-.html ,它将配备 141GB 显存(而 H100 只有 80GB)——这或许是用硬件暴力破解大语言模型长上下文问题的另一种方式。

机器学习趣味梗图
大语言模型与版权法
关于大语言模型和生成式 AI 的版权问题,目前现状如何?2023 年已经过去 8 个月,这个问题似乎仍没有明确答案。下面我根据自己的了解,整理了几篇相关文章。如果你有更多见解或资源,欢迎补充!注意:我不是律师,无法对任何法律问题发表评论。同时,正因为我不是律师,以下信息不应被视为法律建议。
https://en.wikipedia.org/wiki/Wikipedia:Large_language_models_and_copyright#:~:text=3%20Notes-,Does%20LLM%20output%20inherently%20violate%20copyright%20law%3F,works%20created%20by%20non%2Dhumans. 中提到:“利用受版权保护的材料训练大语言模型的版权归属问题,目前尚无定论。”
在这个背景下,《大西洋月刊》最近的一篇报道和研究值得关注:https://www.theatlantic.com/technology/archive/2023/08/books3-ai-meta-llama-pirated-books/675063/ 。
这篇文章谈到了多位作者对 Meta 提起的法律诉讼,指控该公司在训练 https://arxiv.org/abs/2302.13971 时使用了他们的版权作品。诉讼的起因是训练数据中包含了 The Pile 数据集(https://arxiv.org/abs/2101.0027 )的 Books3 部分,涵盖了多达 17 万本书。值得注意的是,EleutherAI 的 GPT-J(https://arankomatsuzaki.wordpress.com/2021/06/04/gpt-j/ ,一款类似 GPT-3 的模型)和彭博的金融领域语言模型 BloombergGPT(https://arxiv.org/abs/2303.17564 ,我在《Ahead of AI》第三期里详细介绍过)也使用了同一个数据集。
此外,https://www.npr.org/2023/08/16/1194202562/new-york-times-considers-legal-action-against-openai-as-copyright-tensions-swirl 报道称,《纽约时报》正准备起诉 OpenAI,因为该报担心 ChatGPT 基于其团队的原创报道和写作生成回答,会成为自己的直接竞争对手。
法律就是法律,开发者应当与内容创作者合作,避免违反版权法。此外,如果能有更新的法律指引,明确规范大语言模型的使用,会很有帮助。在起草政策或修订法律时,可以考虑“合理使用”的场景。换句话说,区分用于商业目的的大语言模型(比如 ChatGPT)和仅用于研究目的、协议禁止商业应用的大语言模型(比如 Meta 的 LLaMA),或许会有帮助。
什么是“合理使用”?根据 https://en.wikipedia.org/wiki/Fair_use ,在美国,版权法中的“合理使用”原则允许在未经授权的情况下使用受版权保护的材料,前提是使用方式构成对作品的实质性转化,且不会损害版权所有者的利益。不过,合理使用原则是否适用于机器学习模型的训练,目前仍没有定论。
其他国家在 AI 训练使用版权材料方面是怎么做的?
https://petapixel.com/2023/06/05/japan-declares-ai-training-data-fair-game-and-will-not-enforce-copyright/ 报道称,日本宣布允许生成式 AI 使用任何数据进行训练,并且不会对生成式 AI 模型的训练执行版权限制。
欧盟的《人工智能法案》要求企业公开训练中使用的所有受版权保护的作品,据 Lexology报道。不过这篇文章没有明确说明如果违反版权会有什么后果。
总的来说,很多规则仍在制定和修订中。我希望最终的规则无论是什么,都能清晰明确,让 AI 研究者和从业者可以据此调整和行动。
本杂志是个人兴趣项目,不提供直接报酬。不过,如果您愿意支持我,可以考虑购买我的书:https://sebastianraschka.com/books 。如果您觉得这些书有洞见、有帮助,也欢迎推荐给朋友和同事。

https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/ 、https://nostarch.com/machine-learning-and-ai-beyond-basics ,以及 http://mng.bz/M96o
非常感谢您的支持!
