【转载】大语言模型预训练与奖励模型评估技巧

原文地址:Tips for LLM Pretraining and Evaluating Reward Models,by Sebastian Raschka, on 2024-03-31

大语言模型预训练与奖励模型评估技巧

2024年3月AI研究论文述评

2024年3月31日

AI研究领域又走过了一个月,精彩成果层出不穷,很难选出最心仪的作品。

除了新研究之外,本月还有诸多重磅发布。其中xAI开源了其https://github.com/xai-org/grok-1 模型,参数量达3140亿,是目前规模最大的开源模型。此外有报道称,https://www.anthropic.com/news/claude-3-family 的性能正在接近甚至超越GPT-4。同时值得关注的还有:https://github.com/hpcaitech/Open-Sora(一个完全开源的视频生成项目)、https://blog.rwkv.com/p/eagle-7b-soaring-past-transformers(全新的基于RWKV的模型)、Mosaic推出的1320亿参数https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm(混合专家模型),以及https://huggingface.co/ai21labs/Jamba-v0.1(基于Mamba的状态空间模型-Transformer混合架构)。

不过由于这些模型的详细信息还十分有限,我将重点讨论研究论文。本月我会先解读一篇探讨大语言模型持续预训练策略的论文,随后讨论基于人类反馈的强化学习(当下主流的大语言模型对齐方法)中所用的奖励建模,以及一个全新的基准测试。

大语言模型的持续预训练是一个重要课题:它让我们能够更新现有大语言模型,比如保证模型能跟进最新的信息与趋势;同时也能让模型适配新的目标领域,而无需从头重新训练。

奖励建模的重要性在于,它能让大语言模型更贴合人类偏好,并且在一定程度上有助于提升安全性。但除了优化人类偏好之外,奖励建模还提供了一种机制,让大语言模型能够学习并适配复杂任务——只需提供指令-输出示例即可,而无需为正确行为编写明确的程序(这往往难度很高甚至不切实际)。

祝阅读愉快!

1. 大语言模型持续预训练的简洁可扩展策略

我们经常讨论对大语言模型进行微调以使其遵循指令,但在实际应用中,用新知识或特定领域数据更新大语言模型同样非常重要。近期论文https://arxiv.org/abs/2403.08763 就如何利用新数据持续预训练大语言模型提供了宝贵的见解。

具体而言,研究者对比了三种不同的训练方式:

  • 常规预训练:用随机权重初始化模型,在数据集D1上进行预训练。
  • 持续预训练:取上述场景中已完成预训练的模型,在数据集D2上进一步预训练。
  • 联合数据集重训练:与第一种场景一样用随机权重初始化模型,但在数据集D1与D2的并集上训练。

figure01
三种预训练方法示意图

方法3(在联合数据集上重训练)是业界常用的做法,例如https://magazine.sebastianraschka.com/p/ahead-of-ai-7-large-language-models?utm_source=%2Fsearch%2F%2520BloombergGPT&utm_medium=reader2 中所述。原因在于,重训练通常有助于确定合适的学习率调度——往往采用线性热身加半周期余弦衰减的策略——并且能缓解灾难性遗忘问题。

灾难性遗忘指的是神经网络(尤其是在序列学习任务中)在学习新信息后,会遗忘之前学到的知识的现象。对于在不同数据集或任务上依次训练的模型而言,这是一个尤为突出的问题。

因此,通过在包含新旧信息的联合数据集上重训练模型,模型既能适配新数据,又能保持在之前已学任务上的性能。

1.1 核心结论与实验结果

这篇长达24页的论文包含大量实验与海量图表,以当下的标准来看研究非常详尽。为了便于理解,下图总结了核心结果:采用持续预训练,能够达到与从头在联合数据集上重训练相当的优异性能。

figure02
持续预训练的成本仅为从头重训练的一半(因为已有预训练模型,只需使用一半的数据量),却能达到同等的优异性能。来源:改编自https://arxiv.org/abs/2403.08763 的图表

成功实现持续预训练的“技巧”有哪些?

  • 重新热身与重新衰减学习率(见下一节)。
  • 在新数据集(D2)中加入一小部分(如5%)原始预训练数据(D1),以防止灾难性遗忘。值得注意的是,0.5%和1%等更小的比例同样有效。

1.2 学习率调度

在预训练或微调大语言模型时,通常会采用“线性热身+半周期余弦衰减”的学习率调度,如下图所示。

figure03
大语言模型预训练与微调的常用学习率调度。来源:https://www.manning.com/books/build-a-large-language-model-from-scratch、https://github.com/rasbt/LLMs-from-scratch/blob/main/appendix-D/01_main-chapter-code/appendix-D.ipynb

如上图所示,在线性热身阶段,学习率从一个较低的值开始,在训练初期逐步提升至预设值。这种方法有助于在进入主训练阶段前稳定模型的权重参数。热身阶段结束后,学习率转入余弦衰减调度,在训练的同时逐步降低模型的学习率。

既然预训练结束时学习率已经非常低,那持续预训练时该如何调整学习率?通常的做法是重新引入一个热身阶段,再跟进一个衰减阶段,这被称为重新热身与重新衰减。简单来说,就是沿用初始预训练阶段完全相同的学习率调度。

figure04
持续预训练的调度方案。图基于https://www.manning.com/books/build-a-large-language-model-from-scratch、https://github.com/rasbt/LLMs-from-scratch/blob/main/appendix-D/01_main-chapter-code/appendix-D.ipynb

作者发现,重新热身与重新衰减确实有效。此外,他们还与所谓的“无限学习率”调度进行了对比——该调度出自2021年的论文https://arxiv.org/abs/2106.04560。这种调度以平缓的余弦(或可选的逆平方根)衰减开始,过渡到恒定学习率,最后以陡峭的衰减进行退火收尾。

figure05
三个预训练阶段下,重新热身-重新衰减调度与无限学习率调度的实验对比。来源:改编自https://arxiv.org/abs/2403.08763 的图表

无限学习率调度的便利之处在于,在恒定学习率阶段的任意时刻,都可以通过一个短暂的退火阶段终止预训练(而无需完成整个余弦半周期)。但如上图结果所示,预训练和持续预训练都没必要使用“无限学习率”。常用的重新热身-重新衰减方法,最终损失与无限学习率调度相当。

1.3 结论与注意事项

据我所知,重新热身-重新衰减、以及在新数据中加入原始预训练数据,或多或少都属于业界常识。但我非常欣赏研究者们花时间在这篇长达24页的详细报告中,对该方法进行了正式的验证。

此外我认为很有意思的一点是,“无限学习率”调度并非必需,它最终得到的损失,和我们常用的“线性热身+半周期余弦衰减”方案基本一致。

尽管这篇论文的实验非常全面,但有一点值得注意:大部分实验都是在参数规模较小的4.05亿模型上开展的,采用的是相对经典的大语言模型架构(GPT-NeoX)。不过作者也证明,该结论在100亿参数模型上同样成立,这让我们有理由相信,这些结果也适用于更大的模型(比如700亿参数),以及可能的架构变体。

研究者聚焦于规模相近的预训练数据集。此外,附录也显示,当持续预训练仅使用50%或30%的数据集时,结果依然一致。一个值得未来研究的方向是:当持续预训练的数据集远小于初始预训练数据集时(这在实际中很常见),这些趋势和建议是否仍然成立。

另一个值得未来研究的方向是,测试持续预训练会对经过指令微调的大语言模型的指令遵循能力产生怎样的影响。我尤其好奇的是,用持续预训练更新大语言模型的知识后,是否需要再进行一轮指令微调。

顺带一提,如果您对高效预训练大语言模型感兴趣,我们最近开源了一个面向PyTorch的编译器,名为https://github.com/Lightning-AI/lightning-thunder。

我的同事将它应用到我参与开发的开源大语言模型库https://github.com/Lightning-AI/litgpt 后,在预训练Llama 2 7B模型时,运行时性能提升了40%。

figure06
使用Thunder预训练大语言模型,图片来源:https://github.com/Lightning-AI/lightning-thunder

《Ahead of AI》是读者支持型出版物。如果想收到新文章并支持我的创作,欢迎成为免费或付费订阅者。

2. 语言建模中的奖励建模评估

https://arxiv.org/abs/2403.13787 提出了一个面向奖励模型的基准测试,奖励模型用于基于人类反馈的强化学习(RLHF)——这是当下流行的大语言模型指令调优与对齐流程。

在讨论这篇论文的核心结论之前,我们先在下一节简要介绍一下RLHF和奖励建模。

2.1 奖励建模与RLHF简介

RLHF的目标是改进大语言模型,使其生成的输出更贴合人类偏好,通常指模型回复的有用性与无害性。我之前的文章也更详细地介绍过RLHF流程:https://magazine.sebastianraschka.com/p/llm-training-rlhf-and-its-alternatives

请注意,这篇论文聚焦于对奖励模型进行基准测试,而非对通过RLHF得到的指令微调大语言模型本身。RLHF流程用于打造ChatGPT、Llama 2-chat这类遵循指令的大语言模型,其流程总结如下图。

figure07
通过RLHF对大语言模型进行微调与人类偏好对齐的三步流程总结。基于InstructGPT论文的图表改编,https://arxiv.org/abs/2203.02155

如上图所示,奖励模型构建是RLHF流程中的中间步骤,并且奖励模型本身也是一个大语言模型。

奖励模型与原始基础大语言模型的区别在于,我们调整了奖励模型的输出层,使其返回一个可作为奖励标签的分数。实现方式有两种:(1)将现有输出层替换为新的线性层,输出单个对数几率值;(2)复用现有输出对数几率中的一个,并用奖励标签对其进行微调。

训练奖励模型的流程与损失函数,和训练分类神经网络类似。在常规二分类中,我们预测输入样本属于类别1还是类别0,通过逻辑斯蒂函数计算输入样本属于类别1的类成员概率来建模。

通过逻辑斯蒂函数完成二分类任务的核心要点如下图所示。

figure08
二分类总结

如果您不熟悉用于训练分类器的逻辑斯蒂函数,可以在这里了解更多:

在奖励建模中,我们可以用二分类的逻辑斯蒂损失(输出标记为0或1)来训练奖励模型。

但对于奖励模型,更常用的是对应的Bradley-Terry模型,它专为成对比较任务设计:目标不是将样本独立分类,而是确定每对样本之间的偏好或排名。

Bradley-Terry模型尤其适用于关注相对比较的场景,比如“这两个输出哪个更受偏好?”,而非绝对分类,比如“这个输出是0还是1?”。

figure09
用于相对比较的Bradley-Terry模型概览

2.2 RLHF与直接偏好优化(DPO)

在大多数模型中(比如Llama 2和OpenAI的InstructGPT,ChatGPT背后很可能也是同样的方法),奖励模型被训练成一个分类器,用于预测两个回答之间的人类偏好概率,如上一节所述。

但训练奖励模型是一个额外步骤,实际中如果不用创建显式的奖励模型,直接优化奖励会更简便。这种方法也被称为https://arxiv.org/abs/2305.18290,近年来广受欢迎。

在DPO中,核心思想是优化策略π(“策略”只是被训练模型的术语),使其最大化期望奖励,同时与参考策略π_ref保持一定程度的接近。这有助于在新策略π中保留π_ref的某些期望属性(比如稳定性或安全性)。

figure10
奖励模型与DPO对比

上述公式中的β通常作为温度参数,控制概率分布对策略分数差异的敏感度。β越高,分布对差异越敏感,函数越陡峭,选项间的偏好差异越明显;β越低,模型对分数差异越不敏感,函数越平缓,代表偏好越弱。本质上,β用于校准偏好模型中偏好表达的强弱程度。

由于DPO相对简单(无需训练单独的奖励模型),通过DPO微调的大语言模型非常流行。但一个核心问题是:它的性能到底如何?根据原始论文https://arxiv.org/abs/2305.18290,如下表所示,DPO的表现非常出色。但对此要持保留态度:因为带专用奖励模型的RLHF(即RLHF-PPO)需要更大的数据集和算力,训练难度更高,这种对比未必能反映最优DPO模型与最优RLHF-PPO模型的真实差距。

figure11

此外,在大多数大语言模型排行榜上,DPO模型都名列前茅。但由于DPO比带专用奖励模型的RLHF简单得多,因此DPO模型的数量也要多得多。所以很难说DPO在直接对比中是否真的更优——因为不存在对等的模型(即架构完全相同、训练数据集完全一致,仅分别使用DPO和带专用奖励模型的RLHF)。

2.3 RewardBench基准

在简要介绍了RLHF和奖励建模之后,本节将深入解读https://arxiv.org/abs/2403.13787 这篇论文,它提出了一个基准,用于评估奖励模型以及DPO模型的奖励分数。

该基准套件会同时评估被选中(偏好)回复和被拒绝回复的分数,如下图所示。

figure12
RewardBench将奖励模型与DPO模型的评估建模为预测任务,统计方法选中“偏好”回复的频次。(改编自RewardBench论文的图表,https://arxiv.org/abs/2403.13787

下图列出了RewardBench排名前20的模型。图中的表格基本印证了我之前的观点:很多DPO模型都在大语言模型排行榜前列,这很可能是因为DPO比带专用奖励模型的RLHF简单得多,因此DPO模型的数量要多得多。

figure13
RewardBench排名前20的模型。(改编自RewardBench论文的表格,https://arxiv.org/abs/2403.13787

需要注意的是,现有排行榜与RewardBench的区别在于评估指标不同。其他排行榜评估的是通过奖励模型训练得到的大语言模型的问答与对话性能,而RewardBench聚焦于训练这些大语言模型所用的奖励分数。

这篇论文另一个有趣的结论是,测得的奖励准确率与模型规模正相关,这符合预期,如下表所示。(遗憾的是,该对比仅针对DPO模型。)

figure14
按模型类型与规模划分的DPO模型。(改编自RewardBench论文的表格,https://arxiv.org/abs/2403.13787

2.4 结论、注意事项与未来研究建议

尽管这篇论文没有提出新的大语言模型微调方法,但它为我们讨论奖励建模与DPO提供了很好的契机。而且,终于有了专门针对奖励模型的基准测试,这一点非常好。向研究者们的创建与分享工作致敬。

一点小遗憾:如果能看到RewardBench上的排名,与使用这些奖励模型得到的大语言模型对话模型在公开排行榜上的排名是否高度相关,会很有意思。不过既然公开排行榜数据和RewardBench数据都是公开的,希望能启发未来的论文对此进行分析。

另一个小问题(作者在论文中也承认了)是,RewardBench对DPO模型更有利,因为DPO模型的数量远多于奖励模型。

未来如果有其他论文在固定算力与数据集的条件下,对RLHF奖励模型和DPO模型进行对照实验,看看哪种方法更优,将会非常有意义。

《Ahead of AI》是一个个人兴趣项目,不提供直接报酬。如果您希望支持我,欢迎购买https://sebastianraschka.com/books/ 上的书籍。如果您觉得这些书有洞见、有帮助,也欢迎推荐给您的朋友和同事。
https://sebastianraschka.com/books/


2024年3月其他值得关注的研究论文

以下是本月我发现的其他一些有趣论文。由于列表较长,我用星号(*)标出了10篇我认为尤其值得关注的论文。请注意,这份列表及注解仅基于我个人的兴趣和与我自身项目的相关性。

  • Model Stock: All We Need Is Just a Few Fine-Tuned Models,作者Jang、Yun、Han(3月28日),https://arxiv.org/abs/2403.19522
    该论文提出了一种名为Model Stock的高效微调技术,仅使用两个模型进行逐层权重平均。

  • MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions,作者Zhang、Luan、Hu等(3月28日),https://arxiv.org/abs/2403.19651
    MagicLens是一个自监督图像检索模型框架,它利用文本指令,支持基于远超视觉相似性的各类关系进行图像搜索。

  • Mechanistic Design and Scaling of Hybrid Architectures,作者Poli、Thomas、Nguyen等(3月26日),https://arxiv.org/abs/2403.17844
    该论文提出了一种机制化的架构设计流水线,通过合成任务实现高效的架构评估,简化了深度学习开发流程;研究发现,混合架构与稀疏架构在可扩展性与效率上均优于传统模型。

  • *** LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning**,作者Pan、Liu、Diao等(3月26日),https://arxiv.org/abs/2403.17919
    该研究提出了一种简单的技术:训练时基于重要性采样,随机冻结中间层。该方法高效,在模型性能上显著优于LoRA和全量大语言模型微调。

  • Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models,作者Li、Zhang、Wang等(3月27日),https://arxiv.org/abs/2403.18814
    Mini-Gemini是一个旨在提升多模态视觉语言模型(VLM)性能的框架,通过高分辨率视觉token、高质量数据集与VLM引导生成实现优化。

  • Long-form Factuality in Large Language Models,作者Wei、Yang、Song等(3月27日),https://arxiv.org/abs/2403.18802
    LongFact是一套全面的提示集,用于基准测试大语言模型在38个主题上的长文本事实准确性。

  • ViTAR: Vision Transformer with Any Resolution,作者Fan、You、Han等(3月27日),https://arxiv.org/abs/2403.18361
    该论文解决了视觉Transformer在不同图像分辨率下扩展性受限的难题,提出了动态分辨率调整与模糊位置编码。

  • BioMedLM: A 2.7B Parameter Language Model Trained On Biomedical Text,作者Bolton、Venigalla、Yasunaga等(3月27日),https://arxiv.org/abs/2403.18421
    BioMedLM是一个紧凑的GPT风格大语言模型,在PubMed的生物医学论文上训练,是打造“小型”、专业化但能力出色的大语言模型的又一个优秀案例。

  • The Unreasonable Ineffectiveness of the Deeper Layers,作者Gromov、Tirumala、Shapourian等(3月26日),https://arxiv.org/abs/2403.17887
    研究表明,选择性剪枝预训练大语言模型最多一半的层,再结合量化与QLoRA进行策略性微调,对问答任务的性能影响极小。

  • LLM Agent Operating System,作者Mei、Li、Xu等(3月25日),https://arxiv.org/abs/2403.16971
    该论文提出了AIOS,一个旨在将大语言模型与智能体深度整合的操作系统。

  • LLM2LLM: Boosting LLMs with Novel Iterative Data Enhancement,作者Lee、Wattanawong、Kim等(3月22日),https://arxiv.org/abs/2403.15042
    LLM2LLM是一种数据增强策略,通过教师模型根据学生模型初始训练时产生的错误生成合成数据,提升大语言模型在小样本场景下的性能。

  • Can Large Language Models Explore In-Context?,作者Krishnamurthy、Harris、Foster等(3月22日),https://arxiv.org/abs/2403.15371
    研究发现,当前主流大语言模型包括GPT-3.5、GPT-4和Llama2,在多臂老虎机环境中,如果没有显著干预,无法可靠地进行探索性行为。

  • SiMBA: Simplified Mamba-Based Architecture for Vision and Multivariate Time Series,作者Patro、Agneeswaran(3月22日),https://arxiv.org/abs/2403.15360
    SiMBA提出了一种新颖架构,结合Einstein FFT进行通道建模、Mamba块进行序列建模,解决了大规模网络在图像与时序领域的稳定性问题。

  • RakutenAI-7B: Extending Large Language Models for Japanese,作者Levine、Huang、Wang等(3月21日),https://arxiv.org/abs/2403.15484
    RakutenAI-7B是面向日语的大语言模型系列,采用Apache 2.0协议开源,包含专用的指令模型与对话模型,在日语LM Harness基准测试中取得了顶尖性能。

  • LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models,作者Zheng、Zhang、Zhang等(3月20日),https://arxiv.org/abs/2403.13372
    LlamaFactory提出了一个多功能框架,配备友好的网页界面LlamaBoard,可对100余种大语言模型进行高效、无代码的微调。

  • *** RewardBench: Evaluating Reward Models for Language Modeling**,作者Lambert、Pyatkin、Morrison等(3月20日),https://arxiv.org/abs/2403.13787
    该论文提出了RewardBench基准数据集与工具包,用于全面评估基于人类反馈的强化学习(RLHF)中的奖励模型,RLHF用于将预训练语言模型与人类偏好对齐。

  • *** PERL: Parameter Efficient Reinforcement Learning from Human Feedback**,作者Sidahmed、Phatale、Hutcheson等(3月19日),https://arxiv.org/abs/2403.10704
    该工作提出了参数高效的人类反馈强化学习(PERL),采用低秩适配(LoRA)训练模型,能高效地将预训练基础大语言模型与人类偏好对齐。

  • Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under Compression,作者Hong、Duan、Zhang等(3月18日),https://arxiv.org/abs/2403.15447
    该研究分析了大语言模型压缩技术与可信度之间的复杂关系,发现在保持效率与可信度方面,量化优于剪枝。

  • TnT-LLM: Text Mining at Scale with Large Language Models,作者Wan、Safavi、Jauhar等(3月18日),https://arxiv.org/abs/2403.12173
    该论文提出了TnT-LLM框架,利用大语言模型自动化标签分类体系的生成与分配,仅需极少的人工参与。

  • *** RAFT: Adapting Language Model to Domain Specific RAG**,作者Zhang、Patil、Jain等(3月15日),https://arxiv.org/abs/2403.10131
    该论文提出了检索增强微调(RAFT),用于提升大语言模型的开卷、领域内问答能力;通过训练模型识别并忽略无帮助的“干扰”文档,同时准确引用正确来源的相关信息。

  • *** MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training**,作者McKinzie、Gan、Fauconnier等(3月14日),https://arxiv.org/abs/2403.09611
    该工作通过分析架构与数据策略推动多模态大语言模型发展,提出了300亿参数的MM1模型系列,在各基准测试的预训练与微调中表现出色。

  • GiT: Towards Generalist Vision Transformer through Universal Language Interface,作者Wang、Tang、Jiang等(3月14日),https://arxiv.org/abs/2403.09394
    GiT是一个利用基础视觉Transformer(ViT)处理各类视觉任务的框架,核心是通过通用语言接口简化架构,支持图像描述、目标检测、语义分割等任务。

  • LocalMamba: Visual State Space Model with Windowed Selective Scan,作者Huang、Pei、You等,https://arxiv.org/abs/2403.09338
    该工作通过优化扫描方向改进视觉Mamba任务,采用局部扫描方法更好地捕捉二维依赖,并进行动态的逐层扫描优化,在ImageNet等基准上实现了显著的性能提升。

  • BurstAttention: An Efficient Distributed Attention Framework for Extremely Long Sequences,作者Ao、Zhao、Han等(3月14日),https://arxiv.org/abs/2403.09347
    “BurstAttention”优化了Transformer模型中长序列的分布式注意力,将通信开销降低40%,在GPU上的处理速度提升一倍。

  • Language Models Scale Reliably With Over-Training and on Downstream Tasks,作者Gadre、Smyrnis、Shankar等(3月13日),https://arxiv.org/abs/2403.08540
    该论文聚焦于过训练以及模型困惑度与下游任务性能的关系,探究了大语言模型缩放定律中的空白。

  • *** Simple and Scalable Strategies to Continually Pre-train Large Language Models**,作者Ibrahim、Thérien、Gupta等(3月13日),https://arxiv.org/abs/2403.08763
    该工作证明,通过简单的学习率重新热身、以及加入小比例的历史训练数据来对抗灾难性遗忘,能够高效地用新数据更新大语言模型。

  • Chronos: Learning the Language of Time Series,作者Ansari、Stella、Turkmen等(3月12日),https://arxiv.org/abs/2403.07815
    Chronos将基于Transformer的模型应用于时间序列预测,通过混合真实数据与合成数据进行训练,在已知和未知数据集上均取得了良好性能。

  • *** Stealing Part of a Production Language Model**,作者Carlini、Paleka、Dvijotham等(3月11日),https://arxiv.org/abs/2403.06634
    研究者提出了一种新的模型窃取攻击,能够从OpenAI的ChatGPT、Google的PaLM-2等黑盒语言模型中精确提取信息(首次揭示了这些模型的隐藏维度)。

  • Algorithmic Progress in Language Models,作者Ho、Besiroglu、Erdil(3月9日),https://arxiv.org/abs/2403.05812
    研究发现,自2012年以来,预训练语言模型(包括大语言模型)的计算效率大约每8个月翻一番,这一速度远超摩尔定律预测的硬件进步速度。

  • LLM4Decompile: Decompiling Binary Code with Large Language Models,作者Tan、Luo、Li、Zhang(3月8日),https://arxiv.org/abs/2403.05286
    本文介绍了多款开源反编译大语言模型,它们在包含C源代码与对应汇编代码的大规模数据集上进行了预训练。

  • Is Cosine-Similarity of Embeddings Really About Similarity?,作者Steck、Ekanadham、Kallus(3月8日),https://arxiv.org/abs/2403.05440
    该论文探讨了利用余弦相似度,通过低维嵌入判断高维对象语义相似性的有效性与局限性。

  • Gemini 1.5: Unlocking Multimodal Understanding Across Millions of Tokens of Context,作者Reid、Savinov、Teplyashin等(3月8日),https://arxiv.org/abs/2403.05530
    该技术报告介绍了Gemini 1.5 Pro,这是Google Gemini系列的多模态模型,在各模态的长上下文任务中表现出色。

  • *** Common 7B Language Models Already Possess Strong Math Capabilities**,作者Li、Wang、Hu等(3月7日),https://arxiv.org/abs/2403.04706
    研究发现,LLaMA-2 7B模型即使仅经过标准预训练,也具备出人意料的数学能力;并且随着有监督指令微调数据规模扩大,其数学能力的一致性会提升。

  • How Far Are We from Intelligent Visual Deductive Reasoning?,作者Zhang、Bai、Zhang等(3月7日),https://arxiv.org/abs/2403.04732
    该研究探究了GPT-4V等顶尖视觉语言模型(VLM)在视觉演绎推理这一精细领域的能力,发现视觉演绎推理存在显著盲区;并且,在大语言模型文本推理中有效的技术,无法直接迁移到视觉推理挑战中。

  • Stop Regressing: Training Value Functions via Classification for Scalable Deep RL,作者Farebrother、Orbay、Vuong等(3月6日),https://arxiv.org/abs/2403.03950
    该论文探讨了提升深度强化学习(RL)可扩展性的潜力:用分类交叉熵分类而非传统回归,来训练强化学习中至关重要的价值函数。

  • *** GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection**,作者Zhao、Zhang、Chen等(3月6日),https://arxiv.org/abs/2403.03507
    梯度低秩投影(GaLore)是一种全新的训练策略,在大语言模型训练中,能将优化器状态的内存占用最多降低65.5%,同时不损失性能。

  • MedMamba: Vision Mamba for Medical Image Classification,作者Yue、Li(2024),https://arxiv.org/abs/2403.03849
    MedMamba将卷积神经网络与状态空间模型(Conv-SSM)相结合,用于医学图像分类,可高效建模长距离依赖并提取局部特征。

  • 3D Diffusion Policy,作者Ze、Zhang、Zhang等(3月6日),https://arxiv.org/abs/2403.03954
    3D Diffusion Policy是一种全新的视觉模仿学习方法,将3D视觉表征与扩散策略相结合,提升了机器人训练的效率与泛化能力,所需演示更少,安全性更高。

  • Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning,作者Ghosal、Han、Ken、Poria(3月6日),https://arxiv.org/abs/2403.03864
    该论文提出了一项全新的多模态解谜挑战,揭示了GPT4-V、Gemini等模型在复杂谜题任务中存在明显困难。

  • SaulLM-7B: A pioneering Large Language Model for Law,作者Colombo、Pires、Boudiaf等(3月6日),https://arxiv.org/abs/2403.03883
    SaulLM-7B是专门面向法律领域的70亿参数语言模型,基于Mistral 7B架构构建,在海量英文法律文本语料上训练。

  • Learning to Decode Collaboratively with Multiple Language Models,作者Shen、Lang、Wang等(3月6日),https://arxiv.org/abs/2403.03870
    该方法让多个大语言模型在token级别协作生成文本,自动学习何时自主生成、何时让其他模型生成;通过整合通用模型与领域专家模型的各自优势,提升各类任务的性能。

  • Backtracing: Retrieving the Cause of the Query,作者Wang、Wirawarn、Khattab等(3月6日),https://arxiv.org/abs/2403.03956
    该研究将“回溯”作为一项任务,帮助讲师等内容创作者定位引发用户提问的文本片段,旨在提升教育、新闻、对话等领域的内容交付效果。

  • *** ShortGPT: Layers in Large Language Models are More Redundant Than You Expect**,作者Men、Xu、Zhang等(3月6日),https://arxiv.org/abs/2403.03853
    该研究提出了块影响力(BI)指标,用于评估大语言模型中每一层的重要性;并提出了ShortGPT剪枝方法,根据BI分数移除冗余层。

  • Design2Code: How Far Are We From Automating Front-End Engineering?,作者Si、Zhang、Yang等(3月5日),https://arxiv.org/abs/2403.03163
    该研究提出了Design2Code基准,用于测试多模态大语言模型将视觉设计转化为代码的能力;基准使用人工整理的484个真实网页作为测试用例,其中GPT-4V表现最优。

  • Scaling Rectified Flow Transformers for High-Resolution Image Synthesis,作者Esser、Kulal、Blattmann等(3月5日),https://arxiv.org/abs/2403.03206
    该工作改进了用于高分辨率文本到图像合成的整流流模型,优化了噪声采样,并提出了一种全新的Transformer架构,提升了文本理解能力与图像质量;通过大量评估与人类偏好评分,证明了该方法的更优性能。

  • Enhancing Vision-Language Pre-training with Rich Supervisions,作者Gao、Shi、Zhu等(3月5日),https://arxiv.org/abs/2403.03346
    强监督截图预训练(S4)提出了一种全新的视觉-语言模型预训练范式,使用网页截图数据,并利用HTML元素固有的树状层级结构。

  • Evolution Transformer: In-Context Evolutionary Optimization,作者Lange、Tian、Tang(3月5日),https://arxiv.org/abs/2403.02985
    提出的演化Transformer采用因果Transformer架构,用于元优化。

  • *** The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning**,作者Li、Pan、Gopal等(3月5日),https://arxiv.org/abs/2403.03218
    WMDP基准是一个经过精心整理的数据集,包含4000余个问题,用于评估并降低大语言模型在生物安全、网络安全等易被滥用领域的知识。

  • Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures,作者Duan、Wang、Chen等(3月4日),https://arxiv.org/abs/2403.02308
    VRWKV将NLP领域的RWKV模型适配到计算机视觉领域,在分类任务的速度与内存占用上优于DeiT等视觉Transformer(ViT),并且在密集预测任务中表现出色。

  • Training-Free Pretrained Model Merging,作者Xu、Yuan、Wang等(3月4日),https://arxiv.org/abs/2403.01753
    提出的模型合并框架解决了模型合并时权重空间与激活空间的单元相似性不一致的难题,通过线性融合两个空间的相似性矩阵,提升了多任务模型的性能。

  • The Hidden Attention of Mamba Models,作者Ali、Zimerman、Wolf(3月3日),https://arxiv.org/abs/2403.01590
    该论文证明,Mamba这类选择性状态空间模型,可以被视为注意力驱动的模型。

  • Improving LLM Code Generation with Grammar Augmentation,作者Ugare、Suresh、Kang(3月3日),https://arxiv.org/abs/2403.01632
    SynCode是一个提升大语言模型代码生成能力的框架,利用编程语言的语法(本质是离线构建的高效查找表)进行语法验证,将大语言模型的词表约束为仅包含语法合法的token。

  • Learning and Leveraging World Models in Visual Representation Learning,作者Garrido、Assran、Ballas等(3月1日),https://arxiv.org/abs/2403.00504
    该研究拓展了流行的联合嵌入预测架构(JEPA),提出了图像世界模型(IWM),超越了掩码图像建模的范畴。


本杂志是一个个人兴趣项目,不提供直接报酬。如果您希望支持我,欢迎购买https://sebastianraschka.com/books/ 上的书籍。如果您觉得这些书有洞见、有帮助,也欢迎推荐给您的朋友和同事。

figure15

https://www.amazon.com/Machine-Learning-PyTorch-Scikit-Learn-scikit-learn-ebook-dp-B09NW48MR1/dp/B09NW48MR1/、https://nostarch.com/machine-learning-and-ai-beyond-basics、http://mng.bz/M96o

您的支持对我意义重大!非常感谢!

Leave a Reply

Your email address will not be published. Required fields are marked *

*