原文地址:LLM Research Papers: The 2024 List,by Sebastian Raschka, on 2024-12-08
大语言模型研究论文:2024年度合集
今年的AI研究领域精彩纷呈、热点不断,如果你关注大语言模型方向,更是能感受到领域的飞速发展。
我原本为12月的这期内容做了详尽规划,打算发布一篇专题文章,盘点2024年我心目中的所有研究亮点。这个计划依然会推进,但由于意外受了重伤,我目前无法坐在电脑前完成草稿。希望接下来几周能顺利康复,尽快回归工作。
在此期间,我想分享自己2024年以来持续收藏的优质论文清单(以大语言模型相关内容为主)。这只是一份简单的列表,但或许能帮大家在假期里挖到一些值得深入研读的宝藏论文。
如果你偏好代码向的深度阅读与动手实践,我的《从零构建大语言模型》一书已于上个月在亚马逊上线。
此外,我还在GitHub仓库中补充了大量配套学习资料。

GitHub仓库中的配套资料(星标为我个人特别推荐)
感谢大家的理解与支持,希望我能尽快痊愈,在几周后带来《2024年研究亮点》专题文章!
2024年1月
-
1月1日 《Astraios:面向代码大语言模型的参数高效指令微调》,https://arxiv\.org/abs/2401\.00788
-
1月2日 《大语言模型知识编辑全面研究》,https://arxiv\.org/abs/2401\.01286
-
1月2日 《LLM亦可长上下文:无需微调的大语言模型上下文窗口自扩展》,https://arxiv\.org/abs/2401\.01325
-
1月2日 《自博弈微调:将弱语言模型转化为强语言模型》,https://arxiv\.org/abs/2401\.01335
-
1月2日 《超越英语的LLaMA:语言能力迁移实证研究》,https://arxiv\.org/abs/2401\.01055
-
1月3日 《对齐算法的机制理解:以DPO与毒性问题为例》,https://arxiv\.org/abs/2401\.01967
-
1月4日 《LLaMA Pro:基于模块扩展的渐进式LLaMA》,https://arxiv\.org/abs/2401\.02415
-
1月4日 《大模型增强大模型:通过组合扩展能力边界》,https://arxiv\.org/abs/2401\.02412
-
1月4日 《融合即最优:万亿参数大语言模型的更优平价替代方案》,https://arxiv\.org/abs/2401\.02994
-
1月5日 《DeepSeek大语言模型:以长期主义规模化开源语言模型》,https://arxiv\.org/abs/2401\.02954
-
1月5日 《去噪视觉Transformer》,https://arxiv\.org/abs/2401\.02957
-
1月7日 《从4K飞跃至400K:通过激活信标扩展大语言模型上下文》,https://arxiv\.org/abs/2401\.03462
-
1月8日 《Mixtral混合专家模型》,https://arxiv\.org/abs/2401\.04088
-
1月8日 《MoE-Mamba:带混合专家的高效选择性状态空间模型》,https://arxiv\.org/abs/2401\.04081
-
1月8日 《人类反馈强化学习的极简主义方法》,https://arxiv\.org/abs/2401\.04056
-
1月9日 《RoSA:基于鲁棒适配的精准参数高效微调》,https://arxiv\.org/abs/2401\.04679
-
1月10日 《潜伏智能体:训练能在安全训练中保留欺骗性的大语言模型》,https://arxiv\.org/abs/2401\.05566
-
1月11日 《Transformer本质是多状态循环神经网络》,https://arxiv\.org/abs/2401\.06104
-
1月11日 《类别不平衡下的AUROC与AUPRC深度辨析》,https://arxiv\.org/abs/2401\.06091
-
1月12日 《大语言模型标签高效监督微调的实验设计框架》,https://arxiv\.org/abs/2401\.06692
-
1月16日 《通过代理调优语言模型》,https://arxiv\.org/abs/2401\.08565
-
1月16日 《大型自回归图像模型的可扩展预训练》,https://arxiv\.org/abs/2401\.08541
-
1月16日 《AlphaCodium代码生成:从提示工程到流程工程》,https://arxiv\.org/abs/2401\.08500
-
1月16日 《RAG vs 微调:流程、权衡与农业场景案例研究》,https://arxiv\.org/abs/2401\.08406
-
1月17日 《ReFT:基于强化微调的推理增强》,https://arxiv\.org/abs/2401\.08967
-
1月18日 《DiffusionGPT:大语言模型驱动的文生图系统》,https://arxiv\.org/abs/2401\.10061
-
1月18日 《自奖励语言模型》,https://arxiv\.org/abs/2401\.10020
-
1月18日 《VMamba:视觉状态空间模型》,https://arxiv\.org/abs/2401\.10166
-
1月19日 《大语言模型的知识融合》,https://arxiv\.org/abs/2401\.10491
-
1月22日 《SpatialVLM:赋予视觉-语言模型空间推理能力》,https://arxiv\.org/abs/2401\.12168
-
1月22日 《WARM:论权重平均奖励模型的优势》,https://arxiv\.org/abs/2401\.12187
-
1月22日 《双筒望远镜识别大模型:机器生成文本的零样本检测》,https://arxiv\.org/abs/2401\.12070
-
1月24日 《MambaByte:无令牌化的选择性状态空间模型》,https://arxiv\.org/abs/2401\.13660
-
1月24日 《SpacTor-T5:结合跨度损坏与替换令牌检测的T5预训练》,https://arxiv\.org/abs/2401\.13160
-
1月25日 《重新思考掩码自编码器的块依赖关系》,https://arxiv\.org/abs/2401\.14391
-
1月25日 《Pix2gestalt:通过合成整体实现无模态分割》,https://arxiv\.org/abs/2401\.14398
-
1月25日 《多模态通路:利用其他模态的无关数据优化Transformer》,https://arxiv\.org/abs/2401\.14405
-
1月26日 《EAGLE:投机采样需重新思考特征不确定性》,https://arxiv\.org/abs/2401\.15077
-
1月29日 《MoE-LLaVA:面向大型视觉-语言模型的混合专家架构》,https://arxiv\.org/abs/2401\.15947
-
1月29日 《网页重述:计算与数据高效的语言建模方案》,https://arxiv\.org/abs/2401\.16380
-
1月31日 《KVQuant:通过KV缓存量化实现千万级上下文长度大语言模型推理》,https://arxiv\.org/abs/2401\.18079
2024年2月
-
2月1日 《大语言模型的高效探索》,https://arxiv\.org/abs/2402\.00396
-
2月1日 《OLMo:加速语言模型科学发展》,https://arxiv\.org/abs/2402\.00838
-
2月1日 《微型泰坦:小型大语言模型能否在真实会议摘要任务中超越体量限制?》,https://arxiv\.org/abs/2402\.00841
-
2月1日 《跟我重复:Transformer在复制任务上优于状态空间模型》,https://arxiv\.org/abs/2402\.01032
-
2月2日 《LiPO:基于排序学习的列表式偏好优化》,https://arxiv\.org/abs/2402\.01878
-
2月2日 《FindingEmo:面向真实场景情感识别的图像数据集》,https://arxiv\.org/abs/2402\.01355
-
2月3日 《智能体数量足够即可提升效果》,https://arxiv\.org/abs/2402\.05120
-
2月5日 《DeepSeekMath:突破开源语言模型的数学推理极限》,https://arxiv\.org/abs/2402\.03300
-
2月6日 《MobileVLM V2:更快更强的视觉语言模型基线》,https://arxiv\.org/abs/2402\.03766
-
2月6日 《点积注意力可解模型中位置学习与语义学习的相变》,https://arxiv\.org/abs/2402\.03902
-
2月6日 《大语言模型下游任务性能的缩放定律》,https://arxiv\.org/abs/2402\.04177
-
2月6日 《MOMENT:开源时间序列基础模型家族》,https://arxiv\.org/abs/2402\.03885
-
2月6日 《视觉超级对齐:视觉基础模型的弱到强泛化》,https://arxiv\.org/abs/2402\.03749
-
2月6日 《自我发现:大语言模型自组合推理结构》,https://arxiv\.org/abs/2402\.03620
-
2月7日 《无需搜索的大师级国际象棋水平》,https://arxiv\.org/abs/2402\.04494
-
2月7日 《基于在线AI反馈的直接语言模型对齐》,https://arxiv\.org/abs/2402\.04792
-
2月8日 《混合专家模型中的缓冲区溢出问题》,https://arxiv\.org/abs/2402\.05526
-
2月9日 《神经网络可训练性的边界是分形的》,https://arxiv\.org/abs/2402\.06184
-
2月11日 《ODIN:解耦奖励缓解RLHF中的投机取巧问题》,https://arxiv\.org/abs/2402\.07319
-
2月12日 《利用语言反馈模型改进策略》,https://arxiv\.org/abs/2402\.07876
-
2月12日 《细粒度混合专家的缩放定律》,https://arxiv\.org/abs/2402\.07871
-
2月12日 《Aya模型:指令微调的开源多语种语言模型》,https://arxiv\.org/abs/2402\.07610
-
2月12日 《立足调优:通过自举规模化大语言模型自对齐》,https://arxiv\.org/abs/2402\.07610
-
2月12日 《用直接原则反馈抑制「粉红大象」效应》,https://arxiv\.org/abs/2402\.07896
-
2月13日 《基于环形注意力的百万级视频与语言世界模型》,https://arxiv\.org/abs/2402\.08268
-
2月13日 《混合专家解锁深度强化学习的参数缩放》,https://arxiv\.org/abs/2402\.08609
-
2月14日 《DoRA:权重分解低秩适配》,https://arxiv\.org/abs/2402\.09353
-
2月14日 《Transformer可实现长度泛化,但鲁棒性不足》,https://arxiv\.org/abs/2402\.09371
-
2月15日 《BASE TTS:10万小时数据训练十亿参数文生语音模型的经验》,https://arxiv\.org/abs/2402\.08093
-
2月15日 《恢复生成式模型微调前的权重》,https://arxiv\.org/abs/2402\.10208
-
2月15日 《生成式表示指令微调》,https://arxiv\.org/abs/2402\.09906
-
2月16日 《FinTral:GPT-4级多模态金融大语言模型家族》,https://arxiv\.org/abs/2402\.10986
-
2月17日 《OneBit:迈向极低比特大语言模型》,https://arxiv\.org/abs/2402\.11295
-
2月18日 《LongAgent:通过多智能体协作将语言模型扩展至128k上下文》,https://arxiv\.org/abs/2402\.11550
-
2月19日 《重格式化对齐》,https://arxiv\.org/abs/2402\.12219
-
2月19日 《AnyGPT:基于离散序列建模的统一多模态大语言模型》,https://arxiv\.org/abs/2402\.12226
-
2月19日 《迈向跨分词器蒸馏:大语言模型通用对数蒸馏损失》,https://arxiv\.org/abs/2402\.12030
-
2月19日 《LoRA+:大模型的高效低秩适配》,https://arxiv\.org/abs/2402\.12354
-
2月20日 《神经网络扩散》,https://arxiv\.org/abs/2402\.13144
-
2月21日 《YOLOv9:利用可编程梯度信息学习目标知识》,https://arxiv\.org/abs/2402\.13616
-
2月21日 《LongRoPE:将大语言模型上下文窗口扩展至200万令牌以上》,https://arxiv\.org/abs/2402\.13753
-
2月21日 《大语言模型用于数据标注:综述》,https://arxiv\.org/abs/2402\.13446
-
2月22日 《TinyLLaVA:小型大规模多模态模型框架》,https://arxiv\.org/abs/2402\.14289
-
2月22日 《回归本质:重新审视大语言模型人类反馈学习中的REINFORCE式优化》,https://arxiv\.org/abs/2402\.14740
-
2月23日 《Genie:生成式交互环境》,https://arxiv\.org/abs/2402\.15391
-
2月26日 《CARTE:表格学习的预训练与迁移》,https://arxiv\.org/abs/2402\.16785
-
2月27日 《1比特大语言模型时代:所有大语言模型均可降至1.58比特》,https://arxiv\.org/abs/2402\.17764
-
2月27日 《Sora生成视频具备惊人的几何一致性》,https://arxiv\.org/abs/2402\.17403
-
2月27日 《当缩放遇上大语言模型微调:数据、模型与微调方法的影响》,https://arxiv\.org/abs/2402\.17193
-
2月29日 《Griffin:融合门控线性循环与局部注意力的高效语言模型》,https://arxiv\.org/abs/2402\.19427
2024年3月
-
3月1日 《在视觉表示学习中学习并利用世界模型》,https://arxiv\.org/abs/2403\.00504
-
3月3日 《通过语法增强提升大语言模型代码生成能力》,https://arxiv\.org/abs/2403\.01632
-
3月3日 《Mamba模型的隐藏注意力机制》,https://arxiv\.org/abs/2403\.01590
-
3月4日 《无需训练的预训练模型合并》,https://arxiv\.org/abs/2403\.01753
-
3月4日 《Vision-RWKV:基于类RWKV架构的高效可扩展视觉感知》,https://arxiv\.org/abs/2403\.02308
-
3月5日 《WMDP基准:通过遗忘学习衡量并降低恶意使用风险》,https://arxiv\.org/abs/2403\.03218
-
3月5日 《进化Transformer:上下文进化优化》,https://arxiv\.org/abs/2403\.02985
-
3月5日 《用丰富监督增强视觉-语言预训练》,https://arxiv\.org/abs/2403\.03346
-
3月5日 《面向高分辨率图像合成的整流流Transformer缩放》,https://arxiv\.org/abs/2403\.03206
-
3月5日 《Design2Code:前端工程自动化还有多远?》,https://arxiv\.org/abs/2403\.03163
-
3月6日 《ShortGPT:大语言模型的层冗余度远超预期》,https://arxiv\.org/abs/2403\.03853
-
3月6日 《回溯:检索查询的成因》,https://arxiv\.org/abs/2403\.03956
-
3月6日 《多语言模型协作解码学习》,https://arxiv\.org/abs/2403\.03870
-
3月6日 《SaulLM-7B:开创性的法律领域大语言模型》,https://arxiv\.org/abs/2403\.03883
-
3月6日 《语言模型是解谜天才吗?算法谜题揭示多模态推理的严峻挑战》,https://arxiv\.org/abs/2403\.03864
-
3月6日 《3D扩散策略》,https://arxiv\.org/abs/2403\.03954
-
3月6日 《MedMamba:面向医学图像分类的视觉Mamba》,https://arxiv\.org/abs/2403\.03849
-
3月6日 《GaLore:通过梯度低秩投影实现内存高效的大语言模型训练》,https://arxiv\.org/abs/2403\.03507
-
3月6日 《停止回归:面向可扩展深度强化学习的分类法价值函数训练》,https://arxiv\.org/abs/2403\.03950
-
3月7日 《智能视觉演绎推理还有多远?》,https://arxiv\.org/abs/2403\.04732
-
3月7日 《普通70亿参数语言模型已具备强大数学能力》,https://arxiv\.org/abs/2403\.04706
-
3月8日 《Gemini 1.5:解锁数百万令牌上下文的多模态理解》,https://arxiv\.org/abs/2403\.05530
-
3月8日 《嵌入的余弦相似度真的代表相似度吗?》,https://arxiv\.org/abs/2403\.05440
-
3月8日 《LLM4Decompile:用大语言模型反编译二进制代码》,https://arxiv\.org/abs/2403\.05286
-
3月9日 《语言模型的算法进展》,https://arxiv\.org/abs/2403\.05812
-
3月11日 《窃取生产级语言模型的部分能力》,https://arxiv\.org/abs/2403\.06634
-
3月12日 《Chronos:学习时间序列的语言》,https://arxiv\.org/abs/2403\.07815
-
3月13日 《持续预训练大语言模型的简单可扩展策略》,https://arxiv\.org/abs/2403\.08763
-
3月13日 《语言模型在过训练与下游任务上均可稳定缩放》,https://arxiv\.org/abs/2403\.08540
-
3月14日 《BurstAttention:面向超长序列的高效分布式注意力框架》,https://arxiv\.org/abs/2403\.09347
-
3月14日 《LocalMamba:带窗口选择性扫描的视觉状态空间模型》,https://arxiv\.org/abs/2403\.09338
-
3月14日 《GiT:通过通用语言接口迈向通用视觉Transformer》,https://arxiv\.org/abs/2403\.09394
-
3月14日 《MM1:多模态大语言模型预训练的方法、分析与洞见》,https://arxiv\.org/abs/2403\.09611
-
3月15日 《RAFT:让语言模型适配领域特定检索增强生成》,https://arxiv\.org/abs/2403\.10131
-
3月18日 《TnT-LLM:用大语言模型规模化文本挖掘》,https://arxiv\.org/abs/2403\.12173
-
3月18日 《解码压缩后的信任:审视压缩下高效大语言模型的可信度》,https://arxiv\.org/abs/2403\.15447
-
3月19日 《PERL:参数高效的人类反馈强化学习》,https://arxiv\.org/abs/2403\.10704
-
3月20日 《RewardBench:评估语言建模的奖励模型》,https://arxiv\.org/abs/2403\.13787
-
3月20日 《LlamaFactory:100+语言模型的统一高效微调》,https://arxiv\.org/abs/2403\.13372
-
3月21日 《RakutenAI-7B:面向日语扩展的大语言模型》,https://arxiv\.org/abs/2403\.15484
-
3月22日 《SiMBA:面向视觉与多元时间序列的简化Mamba架构》,https://arxiv\.org/abs/2403\.15360
-
3月22日 《大语言模型能在上下文中探索吗?》,https://arxiv\.org/abs/2403\.15371
-
3月22日 《LLM2LLM:通过新型迭代数据增强提升大语言模型》,https://arxiv\.org/abs/2403\.15042
-
3月25日 《大语言模型智能体操作系统》,https://arxiv\.org/abs/2403\.16971
-
3月26日 《更深层的不合理低效性》,https://arxiv\.org/abs/2403\.17887
-
3月26日 《LISA:内存高效大语言模型微调的层级重要性采样》,https://arxiv\.org/abs/2403\.17919
-
3月26日 《混合架构的机制设计与缩放》,https://arxiv\.org/abs/2403\.17844
-
3月27日 《BioMedLM:在生物医学文本上训练的27亿参数语言模型》,https://arxiv\.org/abs/2403\.18421
-
3月27日 《ViTAR:任意分辨率视觉Transformer》,https://arxiv\.org/abs/2403\.18361
-
3月27日 《大语言模型的长文本事实性》,https://arxiv\.org/abs/2403\.18802
-
3月27日 《Mini-Gemini:挖掘多模态视觉语言模型的潜力》,https://arxiv\.org/abs/2403\.18814
-
3月28日 《MagicLens:带开放指令的自监督图像检索》,https://arxiv\.org/abs/2403\.19651
-
3月28日 《模型储备:只需几个微调模型即可实现》,https://arxiv\.org/abs/2403\.19522
2024年4月
-
4月1日 《语言模型会为未来令牌提前规划吗?》,https://arxiv\.org/abs/2404\.00859
-
4月1日 《大并非总更好:潜扩散模型的缩放特性》,https://arxiv\.org/abs/2404\.01367
-
4月1日 《微妙的边界:结合下游能力分析导航大语言模型预训练》,https://arxiv\.org/abs/2404\.01204
-
4月1日 《Diffusion-RWKV:面向扩散模型缩放的类RWKV架构》,https://arxiv\.org/abs/2404\.04478
-
4月2日 《深度混合:在基于Transformer的语言模型中动态分配计算量》,https://arxiv\.org/abs/2404\.02258
-
4月2日 《长上下文大语言模型不擅长长上下文学习》,https://arxiv\.org/abs/2404\.02060
-
4月2日 《缩小规模生成式语言模型中的涌现能力》,https://arxiv\.org/abs/2404\.02204
-
4月2日 《用简单自适应攻击破解主流安全对齐大语言模型》,https://arxiv\.org/abs/2404\.02151
-
4月3日 《论基于扩散的文生图的可扩展性》,https://arxiv\.org/abs/2404\.02883
-
4月3日 《BAdam:大语言模型的内存高效全参数训练方法》,https://arxiv\.org/abs/2404\.02827
-
4月3日 《交叉注意力让文生图扩散模型推理变得笨重》,https://arxiv\.org/abs/2404\.02747
-
4月4日 《直接纳什优化:教会语言模型通过通用偏好自我提升》,https://arxiv\.org/abs/2404\.02151
-
4月4日 《在神经压缩文本上训练大语言模型》,https://arxiv\.org/abs/2404\.03626
-
4月4日 《CantTalkAboutThis:对齐语言模型以在对话中紧扣主题》,https://arxiv\.org/abs/2404\.03820
-
4月5日 《ReFT:语言模型的表示微调》,https://arxiv\.org/abs/2404\.03592
-
4月5日 《设计上可验证:对齐语言模型以引用预训练数据内容》,https://arxiv\.org/abs/2404\.03862
-
4月5日 《Sigma:面向多模态语义分割的暹罗Mamba网络》,https://arxiv\.org/abs/2404\.04256
-
4月8日 《AutoCodeRover:自主程序改进》,https://arxiv\.org/abs/2404\.05427
-
4月8日 《Eagle与Finch:带矩阵值状态与动态循环的RWKV》,https://arxiv\.org/abs/2404\.05892
-
4月8日 《CodecLM:用定制合成数据对齐语言模型》,https://arxiv\.org/abs/2404\.05875
-
4月9日 《MiniCPM:通过可扩展训练策略释放小型语言模型潜力》,https://arxiv\.org/abs/2404\.06395
-
4月9日 《大象从不忘记:大语言模型对表格数据的记忆与学习》,https://arxiv\.org/abs/2404\.06209
-
4月9日 《LLM2Vec:大语言模型本质是强大的文本编码器》,https://arxiv\.org/abs/2404\.05961
-
4月10日 《将LLaMA解码器适配为视觉Transformer》,https://arxiv\.org/abs/2404\.06773
-
4月10日 《不遗漏任何上下文:基于无限注意力的高效无限上下文Transformer》,https://arxiv\.org/abs/2404\.07143
-
4月11日 《LLoCO:离线学习长上下文》,https://arxiv\.org/abs/2404\.07979
-
4月11日 《JetMoE:十万美金达到Llama2性能》,https://arxiv\.org/abs/2404\.07413
-
4月11日 《语言模型合成数据的最佳实践与经验教训》,https://arxiv\.org/abs/2404\.07503
-
4月11日 《Rho-1:并非所有令牌都是你需要的》,https://arxiv\.org/abs/2404\.07965
-
4月12日 《用更少令牌预训练小型基础语言模型》,https://arxiv\.org/abs/2404\.08634
-
4月12日 《面向RLHF的数据集重置策略优化》,https://arxiv\.org/abs/2404\.08495
-
4月13日 《大语言模型的上下文回忆依赖于提示》,https://arxiv\.org/abs/2404\.08865
-
4月15日 《Transformer替代方案:新一代状态空间模型综述》,https://arxiv\.org/abs/2404\.09516
-
4月15日 《Chinchilla缩放定律:复现尝试》,https://arxiv\.org/abs/2404\.10102
-
4月15日 《学好参考模型,实现真正优质对齐》,https://arxiv\.org/abs/2404\.09656
-
4月16日 《DPO在大语言模型对齐上优于PPO吗?全面研究》,https://arxiv\.org/abs/2404\.10719
-
4月16日 《缩小CLIP:数据、架构与训练策略的全面分析》,https://arxiv\.org/abs/2404\.08197
-
4月16日 《RAG模型的忠实度有多高?量化RAG与大语言模型内部先验的博弈》,https://arxiv\.org/abs/2404\.10198
-
4月17日 《大语言模型检索增强文本生成综述》,https://arxiv\.org/abs/2404\.10981
-
4月18日 《当大语言模型不适用时用FastFit:多类别快速高效文本分类》,https://arxiv\.org/abs/2404\.12365
-
4月18日 《通过想象、搜索与批判迈向大语言模型自我提升》,https://arxiv\.org/abs/2404\.12253
-
4月18日 《OpenBezoar:在混合指令数据上训练的低成本小型开源模型》,https://arxiv\.org/abs/2404\.12195
-
4月19日 《指令层级:训练大语言模型优先执行特权指令》,https://arxiv\.org/abs/2404\.13208
-
4月22日 《低比特量化的LLaMA3模型效果如何?实证研究》,https://arxiv\.org/abs/2404\.14047
-
4月22日 《Phi-3技术报告:手机本地运行的高性能语言模型》,https://arxiv\.org/abs/2404\.14219
-
4月22日 《OpenELM:带开源训练与推理框架的高效语言模型家族》,https://arxiv\.org/abs/2404\.14619
-
4月22日 《大语言模型自我进化综述》,https://arxiv\.org/abs/2404\.14662
-
4月23日 《多头混合专家》,https://arxiv\.org/abs/2404\.15045
-
4月23日 《NExT:教会大语言模型推理代码执行过程》,https://arxiv\.org/abs/2404\.14662
-
4月23日 《大语言模型时代的图机器学习》,https://arxiv\.org/abs/2404\.14928
-
4月24日 《检索头从机制上解释长上下文事实性》,https://arxiv\.org/abs/2404\.15574
-
4月25日 《层跳过:支持早退推理与自我投机解码》,https://arxiv\.org/abs/2404\.16710
-
4月25日 《让你的大语言模型充分利用上下文》,https://arxiv\.org/abs/2404\.16811
-
4月28日 《LoRA Land:310个媲美GPT-4的微调大语言模型技术报告》,https://arxiv\.org/abs/2405\.00732
-
4月30日 《通过多令牌预测打造更好更快的大语言模型》,https://arxiv\.org/abs/2404\.19737
-
4月30日 《RAG与RAU:自然语言处理中检索增强语言模型综述》,https://arxiv\.org/abs/2404\.19543
-
4月30日 《基于Transformer的语言模型内部工作原理入门》,https://arxiv\.org/abs/2405\.00208
-
4月30日 《何时检索:教会大语言模型高效利用信息检索》,https://arxiv\.org/abs/2404\.19705
-
4月30日 《KAN:柯尔莫哥洛夫-阿诺德网络》,https://arxiv\.org/abs/2404\.19756
2024年5月
-
5月1日 《编辑批次越大越好吗?基于Llama-3的模型编辑实证研究》,https://arxiv\.org/abs/2405\.00664
-
5月1日 《面向语言模型对齐的自博弈偏好优化》,https://arxiv\.org/abs/2405\.00675
-
5月1日 《大语言模型小学数学运算表现的细致检验》,https://arxiv\.org/abs/2405\.00332
-
5月2日 《Prometheus 2:专用于评估其他语言模型的开源语言模型》,https://arxiv\.org/abs/2405\.01535
-
5月3日 《构建视觉-语言模型的关键要素》,https://arxiv\.org/abs/2405\.02246
-
5月5日 《FlashAttention稳定吗?》,https://arxiv\.org/abs/2405\.02803
-
5月7日 《vAttention:无需分页注意力的大语言模型服务动态内存管理》,https://arxiv\.org/abs/2405\.04437
-
5月7日 《xLSTM:扩展长短期记忆网络》,https://arxiv\.org/abs/2405\.04517
-
5月8日 《一次缓存终身受用:面向语言模型的解码器-解码器架构》,https://arxiv\.org/abs/2405\.05254
-
5月8日 《DeepSeek-V2:强大、经济、高效的混合专家语言模型》,https://arxiv\.org/abs/2405\.04434
-
5月8日 《捕捉训练不足的令牌:自动检测大语言模型中的欠训练令牌》,https://arxiv\.org/abs/2405\.05417
-
5月9日 《在新知识上微调大语言模型会加剧幻觉吗?》,https://arxiv\.org/abs/2405\.05904
-
5月10日 《面向语言模型对齐与个性化的值增强采样》,https://arxiv\.org/abs/2405\.06639
-
5月12日 《PHUDGE:Phi-3作为可扩展评判器》,https://arxiv\.org/abs/2405\.08029
-
5月13日 《RLHF工作流:从奖励建模到在线RLHF》,https://arxiv\.org/abs/2405\.07863
-
5月15日 《LoRA学得更少,忘得也更少》,https://arxiv\.org/abs/2405\.09673
-
5月15日 《Xmodel-VLM:多模态视觉语言模型的简单基线》,https://arxiv\.org/abs/2405\.09215
-
5月16日 《Chameleon:多模态早期融合基础模型》,https://arxiv\.org/abs/2405\.09818
-
5月17日 《通过构建与复用LoRA库迈向模块化大语言模型》,https://arxiv\.org/abs/2405\.11157
-
5月19日 《SLAB:带简化线性注意力与渐进重参数化批归一化的高效Transformer》,https://arxiv\.org/abs/2405\.11582
-
5月20日 《MoRA:面向参数高效微调的高秩更新》,https://arxiv\.org/abs/2405\.12130
-
5月22日 《注意力即循环神经网络》,https://arxiv\.org/abs/2405\.13956
-
5月22日 《面向多模态大语言模型的稠密连接器》,https://arxiv\.org/abs/2405\.13800
-
5月23日 《AlignGPT:带自适应对齐能力的多模态大语言模型》,https://arxiv\.org/abs/2405\.14129
-
5月23日 《SimPO:无参考奖励的简单偏好优化》,https://arxiv\.org/abs/2405\.14734
-
5月23日 《基于指令损失的指令微调》,https://arxiv\.org/abs/2405\.14394
-
5月24日 《少调度的进阶之路》,https://arxiv\.org/abs/2405\.15682
-
5月26日 《堆叠你的Transformer:深入探究高效大语言模型预训练的模型增长》,https://arxiv\.org/abs/2405\.15319
-
5月26日 《gzip预测数据依赖的缩放定律》,https://arxiv\.org/abs/2405\.16684
-
5月27日 《Trans-LoRA:迈向无数据可迁移的参数高效微调》,https://arxiv\.org/abs/2405\.17258
-
5月28日 《VeLoRA:使用秩1子令牌投影实现内存高效训练》,https://arxiv\.org/abs/2405\.17991
-
5月28日 《LLaMA-NAS:面向大语言模型的高效神经架构搜索》,https://arxiv\.org/abs/2405\.18377
-
5月29日 《上下文位置编码:学会统计重要信息》,https://arxiv\.org/abs/2405\.18719
2024年6月
-
6月2日 《展示而非告知:用演示反馈对齐语言模型》,https://arxiv\.org/abs/2406\.00888
-
6月3日 《Skywork-MoE:混合专家语言模型训练技术深度解析》,https://arxiv\.org/abs/2406\.06563
-
6月3日 《OLoRA:大语言模型的正交低秩适配》,https://arxiv\.org/abs/2406\.01775
-
6月3日 《大语言模型中类别与层级概念的几何结构》,https://arxiv\.org/abs/2406\.01506
-
6月3日 《迈向可扩展的大语言模型自动对齐:综述》,https://arxiv\.org/abs/2406\.01252
-
6月4日 《无矩阵乘法的可扩展语言建模》,https://arxiv\.org/abs/2406\.02528
-
6月4日 《分块Transformer:面向快速推理的全局到局部语言建模》,https://arxiv\.org/abs/2406\.02657
-
6月6日 《思维缓冲区:大语言模型的思维增强推理》,https://arxiv\.org/abs/2406\.04271
-
6月6日 《提示报告:提示技术系统综述》,https://arxiv\.org/abs/2406\.06608
-
6月6日 《Transformer需要「眼镜」!语言任务中的信息过度压缩问题》,https://arxiv\.org/abs/2406\.04267
-
6月6日 《MMLU已经够用了吗?》,https://arxiv\.org/abs/2406\.04127
-
6月6日 《步骤感知偏好优化:每一步的去噪性能与偏好对齐》,https://arxiv\.org/abs/2406\.04314
-
6月7日 《C4提升大规模并行训练效率:通信驱动的方法》,https://arxiv\.org/abs/2406\.04594
-
6月7日 《CRAG——全面检索增强生成基准》,https://arxiv\.org/abs/2406\.04744
-
6月7日 《WildBench:用真实用户的高难度任务评测大语言模型》,https://arxiv\.org/abs/2406\.04770
-
6月7日 《混合智能体增强大语言模型能力》,https://arxiv\.org/abs/2406\.04692
-
6月7日 《BERT是生成式上下文学习者》,https://arxiv\.org/abs/2406\.04823
-
6月7日 《3D-GRAND:百万级3D大语言模型数据集, grounding更准、幻觉更少》,https://arxiv\.org/abs/2406\.05132
-
6月8日 《创造力已离开对话:语言模型去偏差的代价》,https://arxiv\.org/abs/2406\.05587
-
6月10日 《自回归模型胜扩散:Llama实现可扩展图像生成》,https://arxiv\.org/abs/2406\.06525
-
6月10日 《感知偏好优化:无需参考模型对齐扩散模型》,https://arxiv\.org/abs/2406\.06424
-
6月10日 《Husky:面向多步推理的统一开源语言智能体》,https://arxiv\.org/abs/2406\.06469
-
6月10日 《Turbo Sparse:用最少激活参数达到大语言模型SOTA性能》,https://arxiv\.org/abs/2406\.05955
-
6月10日 《自调优:指导大语言模型通过自学有效获取新知识》,https://arxiv\.org/abs/2406\.06326
-
6月11日 《重建与生成:一张图抵32个令牌》,https://arxiv\.org/abs/2406\.07550
-
6月11日 《TextGrad:通过文本实现自动「微分」》,https://arxiv\.org/abs/2406\.07496
-
6月11日 《简单高效的掩码扩散语言模型》,https://arxiv\.org/abs/2406\.07524
-
6月11日 《绝不掉链子:大语言模型上下文窗口扩展的高效方案,持续增强中间语义》,https://arxiv\.org/abs/2406\.07138
-
6月11日 《Samba:面向无限上下文语言建模的简单混合状态空间模型》,https://arxiv\.org/abs/2406\.07522
-
6月12日 《Magpie:从零开始生成对齐数据——空提示引导对齐大语言模型》,https://arxiv\.org/abs/2406\.08464
-
6月12日 《如果用LLaMA-3给数十亿网页图片重新打字幕会怎样?》,https://arxiv\.org/abs/2406\.08478
-
6月12日 《通过嵌入损坏提示实现大语言模型遗忘学习》,https://arxiv\.org/abs/2406\.07933
-
6月12日 《必须教会大语言模型认识自己的未知边界》,https://arxiv\.org/abs/2406\.08391
-
6月12日 《基于Mamba的语言模型实证研究》,https://arxiv\.org/abs/2406\.07887
-
6月12日 《用大语言模型发现偏好优化算法》,https://arxiv\.org/abs/2406\.08414
-
6月13日 《Transformer遇上神经算法推理器》,https://arxiv\.org/abs/2406\.09308
-
6月13日 《MLKV:面向内存高效Transformer解码的多层键值头》,https://arxiv\.org/abs/2406\.09297
-
6月13日 《图像不止16×16补丁:探索Transformer在像素级的表现》,https://arxiv\.org/abs/2406\.09415
-
6月13日 《FouRA:傅里叶低秩适配》,https://arxiv\.org/abs/2406\.08798
-
6月14日 《用DPO隐式奖励自举语言模型》,https://arxiv\.org/abs/2406\.09760
-
6月14日 《像金鱼一样,别死记硬背!缓解生成式大语言模型的记忆问题》,https://arxiv\.org/abs/2406\.10209
-
6月14日 《正则化隐藏状态助力学习泛化性强的大语言模型奖励模型》,https://arxiv\.org/abs/2406\.10216
-
6月16日 《THEANINE:重新审视长期对话的内存管理:时间线增强回复生成》,https://arxiv\.org/abs/2406\.10996
-
6月17日 《任意任务皆可问》,https://arxiv\.org/abs/2406\.11775
-
6月17日 《大语言模型在预训练中如何获取事实知识?》,https://arxiv\.org/abs/2406\.11813
-
6月17日 《mDPO:面向多模态大语言模型的条件偏好优化》,https://arxiv\.org/abs/2406\.11839
-
6月17日 《Nemotron-4 340B技术报告》,https://arxiv\.org/abs/2406\.11704
-
6月17日 《DataComp-LM:寻找下一代语言模型训练集》,https://arxiv\.org/abs/2406\.11794
-
6月17日 《分词器的短板:分词的诅咒》,https://arxiv\.org/abs/2406\.11687
-
6月17日 《DeepSeek-Coder-V2:打破代码智能领域闭源模型的壁垒》,https://arxiv\.org/abs/2406\.11931
-
6月17日 《揭秘无编码器视觉-语言模型》,https://arxiv\.org/abs/2406\.11832
-
6月17日 《迭代长度正则化直接偏好优化:将70亿语言模型提升至GPT-4水平的案例研究》,https://arxiv\.org/abs/2406\.11817
-
6月17日 《HARE:人类先验——小型语言模型效率的关键》,https://arxiv\.org/abs/2406\.11410
-
6月17日 《衡量代码补全RLHF中的记忆问题》,https://arxiv\.org/abs/2406\.11715
-
6月17日 《Self-MoE:迈向专家自分化的组合式大语言模型》,https://arxiv\.org/abs/2406\.12034
-
6月18日 《从RAG到丰富参数:探究语言模型在事实查询中如何利用外部知识而非参数化信息》,https://arxiv\.org/abs/2406\.12824
-
6月18日 《评判评判者:评估大语言模型作为评判器的对齐效果与漏洞》,https://arxiv\.org/abs/2406\.12624
-
6月19日 《长上下文语言模型能取代检索、RAG、SQL等技术吗?》,https://arxiv\.org/abs/2406\.13121
-
6月20日 《指令预训练:语言模型是监督式多任务学习者》,https://arxiv\.org/abs/2406\.14491
-
6月20日 《大语言模型能通过教学学习吗?初步研究》,https://arxiv\.org/abs/2406\.14629
-
6月21日 《信任与准确性的博弈:RAG系统中基础模型vs指令模型的对比》,https://arxiv\.org/abs/2406\.14972
-
6月21日 《LongRAG:用长上下文大语言模型增强检索增强生成》,https://arxiv\.org/abs/2406\.15319
-
6月21日 《MoA:面向大语言模型自动压缩的稀疏注意力混合》,https://arxiv\.org/abs/2406\.14909
-
6月21日 《缓解稳定性差距实现高效持续预训练》,https://arxiv\.org/abs/2406\.14833
-
6月24日 《越稀疏越快,越少越好:面向长距离Transformer的高效稀疏注意力》,https://arxiv\.org/abs/2406\.16747
-
6月24日 《WARP:论权重平均奖励策略的优势》,https://arxiv\.org/abs/2406\.16768
-
6月24日 《Adam-mini:用更少学习率获得更好效果》,https://arxiv\.org/abs/2406\.16793
-
6月25日 《FineWeb数据集:大规模筛选互联网优质文本数据》,https://arxiv\.org/abs/2406\.17557
-
6月25日 《LongIns:面向大语言模型的高难度长上下文指令考试》,https://arxiv\.org/abs/2406\.17588
-
6月25日 《遵循指令中的长度约束》,https://arxiv\.org/abs/2406\.17744
-
6月26日 《深入探究大语言模型中的混合专家机制》,https://arxiv\.org/abs/2406\.18219
-
6月26日 《RouteLLM:用偏好数据学习大语言模型路由》,https://arxiv\.org/abs/2406\.18665
-
6月26日 《Step-DPO:面向大语言模型长链推理的分步偏好优化》,https://arxiv\.org/abs/2406\.18629
-
6月27日 《从LoRA权重反推数据集大小》,https://arxiv\.org/abs/2406\.19395
-
6月27日 《从人工针到真实海:通过合成数据微调提升大语言模型检索能力》,https://arxiv\.org/abs/2406\.19292
-
6月27日 《更改选项顺序会降低MMLU准确率》,https://arxiv\.org/abs/2406\.19470
-
6月28日 《面向大语言模型的直接偏好知识蒸馏》,https://arxiv\.org/abs/2406\.19774
-
6月28日 《大语言模型评论家助力发现大语言模型漏洞》,https://arxiv\.org/abs/2407\.00215
-
6月28日 《用10亿人设规模化合成数据创建》,https://arxiv\.org/abs/2406\.20094
2024年7月
-
7月1日 《大语言模型所见即所做:引导数据生成瞄准不可微目标》,https://arxiv\.org/abs/2407\.01490
-
7月1日 《检索增强生成最佳实践探索》,https://arxiv\.org/abs/2407\.01219
-
7月1日 《让专家深耕本职:稀疏架构大语言模型的专家专属微调》,https://arxiv\.org/abs/2407\.01906
-
7月1日 《扩散强制:当下一令牌预测遇上全序列扩散》,https://arxiv\.org/abs/2407\.01392
-
7月1日 《消除语言模型的位置偏差:机制化方法》,https://arxiv\.org/abs/2407\.01100
-
7月2日 《JMInference 1.0:通过动态稀疏注意力加速长上下文大语言模型预填充》,https://arxiv\.org/abs/2407\.02490
-
7月2日 《TokenPacker:面向多模态大语言模型的高效视觉投影器》,https://arxiv\.org/abs/2407\.02392
-
7月2日 《大语言模型中的推理:几何视角》,https://arxiv\.org/abs/2407\.02678
-
7月2日 《RankRAG:大语言模型中统一上下文排序与检索增强生成》,https://arxiv\.org/abs/2407\.02485
-
7月3日 《AgentInstruct:迈向智能体流程的生成式教学》,https://arxiv\.org/abs/2407\.03502
-
7月3日 《HEMM:多模态基础模型整体评估》,https://arxiv\.org/abs/2407\.03418
-
7月4日 《百万专家混合模型》,https://arxiv\.org/abs/2407\.04153
-
7月5日 《学会(在测试时学习):带强表达隐藏状态的循环神经网络》,https://arxiv\.org/abs/2407\.04620
-
7月9日 《视觉语言模型是「睁眼瞎」》,https://arxiv\.org/abs/2407\.06581
-
7月9日 《语言模型中的自我识别》,https://arxiv\.org/abs/2407\.06946
-
7月10日 《CPU上大语言模型的推理性能优化》,https://arxiv\.org/abs/2407\.07304
-
7月11日 《梯度提升强化学习》,https://arxiv\.org/abs/2407\.08250
-
7月11日 《FlashAttention-3:基于异步与低精度的快速精准注意力》,https://arxiv\.org/abs/2407\.08608
-
7月12日 《SpreadsheetLLM:面向大语言模型的电子表格编码》,https://arxiv\.org/abs/2407\.09025
-
7月12日 《直接偏好优化的新诉求》,https://arxiv\.org/abs/2407\.09072
-
7月12日 《RAG中高效生成答案的上下文嵌入方法》,https://arxiv\.org/abs/2407\.09252
-
7月15日 《Qwen2技术报告》,https://arxiv\.org/abs/2407\.10671
-
7月15日 《好的、坏的与贪婪的:大语言模型评估不应忽视非确定性》,https://arxiv\.org/abs/2407\.10457
-
7月15日 《从GaLore到WeLore:低秩梯度如何非均匀催生低秩权重》,https://arxiv\.org/abs/2407\.11239
-
7月16日 《GoldFinch:高性能RWKV/Transformer混合架构,线性预填充+极致KV缓存压缩》,https://arxiv\.org/abs/2407\.12077
-
7月16日 《将扩散Transformer缩放至160亿参数》,https://arxiv\.org/abs/2407\.11633
-
7月16日 《NeedleBench:大语言模型能在百万上下文窗口中完成检索与推理吗?》,https://arxiv\.org/abs/2407\.11963
-
7月17日 《大语言模型的补丁级训练》,https://arxiv\.org/abs/2407\.12665
-
7月17日 《LMMs-Eval:大型多模态模型评估的现实检验》,https://arxiv\.org/abs/2407\.12772
-
7月17日 《面向不同NLP任务的大语言模型提示工程方法综述》,https://arxiv\.org/abs/2407\.12994
-
7月17日 《Spectra:三值、量化与FP16语言模型全面研究》,https://arxiv\.org/abs/2407\.12327
-
7月18日 《注意力溢出:长上下文缺失项推荐中语言模型输入模糊问题》,https://arxiv\.org/abs/2407\.13481
-
7月18日 《弱到强推理》,https://arxiv\.org/abs/2407\.13647
-
7月18日 《理解直接偏好优化中的参考策略》,https://arxiv\.org/abs/2407\.13709
-
7月18日 《词汇量缩放定律:更大的模型配更大的词表》,https://arxiv\.org/abs/2407\.13623
-
7月19日 《BOND:用最佳N蒸馏对齐大语言模型》,https://arxiv\.org/abs/2407\.14622
-
7月19日 《通过剪枝与知识蒸馏打造紧凑语言模型》,https://arxiv\.org/abs/2407\.14679
-
7月19日 《LazyLLM:动态令牌剪枝实现高效长上下文大语言模型推理》,https://arxiv\.org/abs/2407\.14057
-
7月22日 《迷你序列Transformer:优化长序列训练的中间内存》,https://arxiv\.org/abs/2407\.15892
-
7月22日 《DDK:蒸馏领域知识打造高效大语言模型》,https://arxiv\.org/abs/2407\.16154
-
7月23日 《生成约束缩放可缓解幻觉》,https://arxiv\.org/abs/2407\.16908
-
7月23日 《检索增强生成还是长上下文大语言模型?全面研究与混合方案》,https://arxiv\.org/abs/2407\.16833
-
7月23日 《航向修正:使用合成偏好进行安全对齐》,https://arxiv\.org/abs/2407\.16637
-
7月26日 《数据混合推理:BPE分词器泄露了哪些训练数据信息?》,https://arxiv\.org/abs/2407\.16607
-
7月28日 《元奖励语言模型:大语言模型作为元评判器的自我提升对齐》,https://arxiv\.org/abs/2407\.19594
-
7月29日 《通过自推理增强检索增强语言模型》,https://arxiv\.org/abs/2407\.19813
-
7月29日 《苹果智能基础语言模型》,https://arxiv\.org/abs/2407\.21075
-
7月30日 《ThinK:通过查询驱动剪枝打造更轻量的键缓存》,https://arxiv\.org/abs/2407\.21018
-
7月31日 《Llama 3模型家族》,https://arxiv\.org/abs/2407\.21783
-
7月31日 《Gemma 2:以实用尺寸改进开源语言模型》,https://arxiv\.org/abs/2408\.00118
2024年8月
-
8月1日 《SAM 2:图像与视频中的任意分割》,https://arxiv\.org/abs/2408\.00714
-
8月2日 《POA:一次预训练适配全尺寸模型》,https://arxiv\.org/abs/2408\.01031
-
8月2日 《RAGEval:场景化RAG评估数据集生成框架》,https://arxiv\.org/abs/2408\.01262
-
8月2日 《Mamba综述》,https://arxiv\.org/abs/2408\.01129
-
8月3日 《MiniCPM-V:手机上可达GPT-4V水平的多模态大语言模型》,https://arxiv\.org/abs/2408\.01800
-
8月5日 《RAG Foundry:增强大语言模型检索增强生成的框架》,https://arxiv\.org/abs/2408\.02545
-
8月5日 《自学式评估器》,https://arxiv\.org/abs/2408\.02666
-
8月5日 《BioMamba:利用Mamba的预训练生物医学语言表示模型》,https://arxiv\.org/abs/2408\.02600
-
8月7日 《EXAONE 3.0 78亿参数指令微调语言模型》,https://arxiv\.org/abs/2408\.03541
-
8月7日 《1.5-Pints技术报告:数天完成预训练,而非数月——优质数据让语言模型焕发生机》,https://arxiv\.org/abs/2408\.03506
-
8月8日 《对话式提示工程》,https://arxiv\.org/abs/2408\.04560
-
8月8日 《跨令牌化与跨语言词汇迁移:低资源NLP的大语言模型语言适配》,https://arxiv\.org/abs/2408\.04303
-
8月12日 《AI科学家:迈向全自动开放式科学发现》,https://arxiv\.org/abs/2408\.06292
-
8月15日 《Hermes 3技术报告》,https://arxiv\.org/abs/2408\.12570
-
8月19日 《用实例级LoRA定制语言模型用于序列推荐》,https://arxiv\.org/abs/2408\.10159
-
8月20日 《增强大语言模型鲁棒性:通过提示缓解无关信息的影响》,https://arxiv\.org/abs/2408\.10615
-
8月20日 《代码,要不要加?探究代码在预训练中的作用》,https://arxiv\.org/abs/2408\.10914
-
8月21日 《实践中的大语言模型剪枝与蒸馏:Minitron方案》,https://arxiv\.org/abs/2408\.11796
-
8月22日 《Jamba-1.5:规模化混合Transformer-Mamba模型》,https://arxiv\.org/abs/2408\.12570
-
8月22日 《大语言模型可控文本生成综述》,https://arxiv\.org/abs/2408\.12599
-
8月23日 《多层Transformer梯度可在近似线性时间内近似》,https://arxiv\.org/abs/2408\.13233
-
8月26日 《持续多模态预训练实践者指南》,https://arxiv\.org/abs/2408\.14471
-
8月26日 《构建并深化理解视觉-语言模型:洞见与未来方向》,https://arxiv\.org/abs/2408\.12637
-
8月26日 《CURLoRA:稳定的大语言模型持续微调与灾难性遗忘缓解》,https://arxiv\.org/abs/2408\.14572
-
8月27日 《Llama中的Mamba:蒸馏与加速混合模型》,https://arxiv\.org/abs/2408\.15237
-
8月28日 《ReMamba:为Mamba配备高效长序列建模能力》,https://arxiv\.org/abs/2408\.15496
-
8月29日 《更小、更弱,却更好:通过计算最优采样训练大语言模型推理器》,https://arxiv\.org/abs/2408\.16737
-
8月31日 《LongRecipe:大语言模型高效长上下文泛化方案》,https://arxiv\.org/abs/2409\.00509
2024年9月
-
9月3日 《OLMoE:开源混合专家语言模型》,https://arxiv\.org/abs/2409\.02060
-
9月3日 《为长上下文语言模型时代的RAG正名》,https://arxiv\.org/abs/2409\.01666
-
9月5日 《大语言模型注意力头综述》,https://arxiv\.org/abs/2409\.03752
-
9月5日 《LongCite:让大语言模型在长上下文问答中生成细粒度引用》,https://arxiv\.org/abs/2409\.02897
-
9月5日 《你的代码大语言模型表现如何?用高质量数据增强代码指令微调》,https://arxiv\.org/abs/2409\.03810
-
9月6日 《Sigmoid自注意力的理论、分析与最佳实践》,https://arxiv\.org/abs/2409\.04431
-
9月10日 《LLaMA-Omni:与大语言模型的无缝语音交互》,https://arxiv\.org/abs/2409\.06666
-
9月10日 《大语言模型时代小模型的角色:综述》,https://arxiv\.org/abs/2409\.06857
-
9月11日 《RLHF中的策略过滤:微调大语言模型用于代码生成》,https://arxiv\.org/abs/2409\.06957
-
9月16日 《检索注意力:通过向量检索加速长上下文大语言模型推理》,https://arxiv\.org/abs/2409\.10516
-
9月18日 《Qwen2.5-Math技术报告:通过自我提升迈向数学专家模型》,https://arxiv\.org/abs/2409\.12122
-
9月18日 《Qwen2.5-Coder技术报告》,https://arxiv\.org/abs/2409\.12186
-
9月21日 《无需指令微调的指令遵循》,https://arxiv\.org/abs/2409\.14254
-
9月30日 《偏好对齐总是提升大语言模型翻译效果的最优选择吗?实证分析》,https://arxiv\.org/abs/2409\.20059
-
9月30日 《完美融合:用混合评判器重新定义RLHF》,https://arxiv\.org/abs/2409\.20370(Meta关于Llama 3 RLHF实现的新论文)
2024年10月
-
10月1日 《加法就够了:打造高能效语言模型》,https://arxiv\.org/abs/2410\.00907
-
10月2日 《量化大语言模型的泛化复杂度》,https://arxiv\.org/abs/2410\.01769
-
10月2日 《当语言模型针对推理优化后,还残留自回归特性吗?OpenAI o1分析》,https://arxiv\.org/abs/2410\.01792
-
10月2日 《我们只需要循环神经网络吗?》,https://arxiv\.org/abs/2410\.01201
-
10月3日 《选择性注意力改进Transformer》,https://arxiv\.org/abs/2410\.02703
-
10月3日 《大语言模型懂得比表现出来的多:论大语言模型幻觉的内在表示》,https://arxiv\.org/abs/2410\.02707
-
10月3日 《LLaVA-Critic:学习评估多模态模型》,https://arxiv\.org/abs/2410\.02712
-
10月7日 《差分Transformer》,https://arxiv\.org/abs/2410\.05258
-
10月7日 《GSM-Symbolic:理解大语言模型数学推理的局限性》,https://arxiv\.org/abs/2410\.05229
-
10月8日 《ARIA:开源原生多模态混合专家模型》,https://arxiv\.org/abs/2410\.05993
-
10月8日 《o1复现之旅:战略进展报告——第一部分》,https://arxiv\.org/abs/2410\.18982
-
10月8日 《长上下文大语言模型遇上RAG:攻克RAG长输入挑战》,https://arxiv\.org/abs/2410\.05983
-
10月9日 《从通用到专用:通过任务特定视觉指令微调适配视觉语言模型》,https://arxiv\.org/abs/2410\.06456
-
10月10日 《KV预测:缩短首令牌响应时间》,https://arxiv\.org/abs/2410\.08391
-
10月11日 《百川Omni技术报告》,https://arxiv\.org/abs/2410\.08565
-
10月13日 《MMIE:大型视觉-语言模型大规模多模态交错理解基准》,https://arxiv\.org/abs/2410\.10139
-
10月13日 《LOKI:基于大型多模态模型的综合合成数据检测基准》,https://arxiv\.org/abs/2410\.09732
-
10月15日 《AFlow:自动化智能体工作流生成》,https://arxiv\.org/abs/2410\.10762
-
10月15日 《面向检索增强生成的通用指令遵循对齐》,https://arxiv\.org/abs/2410\.09584
-
10月21日 《大语言模型预训练蒸馏:设计空间探索》,https://arxiv\.org/abs/2410\.16215
-
10月23日 《MIA-DPO:面向大型视觉-语言模型的多图像增强直接偏好优化》,https://arxiv\.org/abs/2410\.17637
-
10月23日 《面向文生图的可扩展排序偏好优化》,https://arxiv\.org/abs/2410\.18013
-
10月23日 《通过自回归模型适配缩放扩散语言模型》,https://arxiv\.org/abs/2410\.17891
-
10月24日 《混合偏好:学习路由实例选择人类反馈或AI反馈》,https://arxiv\.org/abs/2410\.19133
-
10月25日 《大语言模型的计数能力与分词化的影响》,https://arxiv\.org/abs/2410\.19730
-
10月25日 《小型语言模型综述》,https://arxiv\.org/abs/2410\.20011
-
10月26日 《通过前缀共享加速直接偏好优化》,https://arxiv\.org/abs/2410\.20305
-
10月27日 《步步留心:思维链会降低人类思考后表现变差的任务的模型性能》,https://arxiv\.org/abs/2410\.21333
-
10月28日 《LongReward:用AI反馈改进长上下文大语言模型》,https://arxiv\.org/abs/2410\.21252
-
10月28日 《ShadowKV:高吞吐长上下文大语言模型推理的影子KV缓存》,https://arxiv\.org/abs/2410\.21465
-
10月29日 《超越文本:工业场景下用多模态输入优化RAG》,https://arxiv\.org/abs/2410\.21943
-
10月30日 《CORAL:多轮对话检索增强生成基准测试》,https://arxiv\.org/abs/2410\.23090
-
10月31日 《快思考与慢思考训练下大语言模型层的变化:梯度视角》,https://arxiv\.org/abs/2410\.23743
-
10月31日 《GPT还是BERT:何不两者兼得?》,https://arxiv\.org/abs/2410\.24159
-
10月31日 《语言模型可自我延长生成长文本》,https://arxiv\.org/abs/2410\.23933
2024年11月
-
11月1日 《为评估添加误差棒:语言模型评估的统计方法》,https://arxiv\.org/abs/2411\.00640
-
11月1日 《边学习边适配:为科学问题落地大语言模型的智能工具使用适配》,https://arxiv\.org/abs/2411\.00412
-
11月1日 《多专家提示提升大语言模型的可靠性、安全性与实用性》,https://arxiv\.org/abs/2411\.00492
-
11月3日 《大语言模型的样本高效对齐》,https://arxiv\.org/abs/2411\.01493
-
11月4日 《大语言模型时代的小型语言模型全面综述:技术、增强、应用、与大模型协作及可信性》,https://arxiv\.org/abs/2411\.03350
-
11月4日 《「给我BF16否则免谈」?大语言模型量化的准确率-性能权衡》,https://arxiv\.org/abs/2411\.02355
-
11月4日 《面向单元测试生成的大语言模型参数高效微调:实证研究》,https://arxiv\.org/abs/2411\.02462
-
11月5日 《HtmlRAG:在RAG系统中建模检索知识时,HTML优于纯文本》,https://arxiv\.org/abs/2411\.02959
-
11月6日 《文本与图像双双泄露!多模态大语言模型数据污染的系统分析》,https://arxiv\.org/abs/2411\.03823
-
11月6日 《语言模型是隐藏的推理者:通过自奖励解锁潜推理能力》,https://arxiv\.org/abs/2411\.04282
-
11月6日 《数字手册:语言模型的数字理解与改进方法》,https://arxiv\.org/abs/2411\.03766
-
11月7日 《混合Transformer:面向多模态基础模型的稀疏可扩展架构》,https://arxiv\.org/abs/2411\.04996
-
11月7日 《BitNet a4.8:1比特大语言模型的4比特激活》,https://arxiv\.org/abs/2411\.04965
-
11月7日 《精度缩放定律》,https://arxiv\.org/abs/2411\.04330
-
11月8日 《高能效蛋白质语言模型:借助小型语言模型与LoRA实现可控蛋白质生成》,https://arxiv\.org/abs/2411\.05966
-
11月8日 《平衡流水线并行与词汇并行》,https://arxiv\.org/abs/2411\.05288
-
11月11日 《迈向RAG的最优搜索与检索》,https://arxiv\.org/abs/2411\.07396
-
11月12日 《大语言模型可在长上下文推理中自我提升》,https://arxiv\.org/abs/2411\.08147
-
11月12日 《更强的模型并非指令微调的更强教师》,https://arxiv\.org/abs/2411\.07133
-
11月12日 《基于稀疏特征级约束的直接偏好优化》,https://arxiv\.org/abs/2411\.07618
-
11月13日 《降低大词汇量语言模型的损失》,https://arxiv\.org/abs/2411\.09009
-
11月15日 《提示格式对大语言模型性能有影响吗?》,https://arxiv\.org/abs/2411\.10541
-
11月17日 《SymDPO:用符号演示直接偏好优化提升多模态大模型上下文学习》,https://arxiv\.org/abs/2411\.11909
-
11月17日 《SageAttention2技术报告:即插即用推理加速的精准4比特注意力》,https://arxiv\.org/abs/2411\.10958
-
11月18日 《Bi-Mamba:迈向精准1比特状态空间模型》,https://arxiv\.org/abs/2411\.11843
-
11月19日 《RedPajama:训练大语言模型的开源数据集》,https://arxiv\.org/abs/2411\.12372
-
11月20日 《Hymba:面向小型语言模型的混合头架构》,https://arxiv\.org/abs/2411\.13676
-
11月20日 《损失到损失预测:所有数据集的缩放定律》,https://arxiv\.org/abs/2411\.12925
-
11月21日 《当精度遇上位置:BFloat16在长上下文训练中破坏旋转位置编码》,https://arxiv\.org/abs/2411\.13476
-
11月21日 《大型视觉编码器的多模态自回归预训练》,https://arxiv\.org/abs/2411\.14402
-
11月21日 《自然语言强化学习》,https://arxiv\.org/abs/2411\.14251
-
11月22日 《大多模态模型可以解读大多模态模型的特征》,https://arxiv\.org/abs/2411\.14982
-
11月22日 《TÜLU 3:推进开源语言模型后训练前沿》,https://arxiv\.org/abs/2411\.15124
-
11月23日 《MME综述:多模态大语言模型评估全面综述》,https://arxiv\.org/abs/2411\.15296
-
11月24日 《大语言模型在隐式推理中不会分步思考》,https://arxiv\.org/abs/2411\.15862
-
11月25日 《o1复现之旅——第二部分:通过简单蒸馏超越o1-preview,巨大进步还是残酷教训?》,https://arxiv\.org/abs/2411\.16489
-
11月26日 《星形注意力:长序列上的高效大语言模型推理》,https://arxiv\.org/abs/2411\.17116
-
11月27日 《低比特量化偏爱欠训练大语言模型:100万亿训练令牌下量化大语言模型的缩放定律》,https://arxiv\.org/abs/2411\.17691
-
11月27日 《重新思考多模态大模型的令牌缩减:迈向免训练加速的统一范式》,https://arxiv\.org/abs/2411\.17686
-
11月29日 《逆向思维让大语言模型成为更强的推理者》,https://arxiv\.org/abs/2411\.19865
-
11月29日 《关键令牌很重要:令牌级对比估计增强大语言模型推理能力》,https://arxiv\.org/abs/2411\.19943
2024年12月
-
12月2日 《Switti:为文生图合成设计分尺度Transformer》,https://arxiv\.org/abs/2412\.01819
-
12月2日 《X-Prompt:迈向自回归视觉语言基础模型中的通用上下文图像生成》,https://arxiv\.org/abs/2412\.01824
-
12月2日 《无需过程标签的免费过程奖励》,https://arxiv\.org/abs/2412\.01981
-
12月3日 《分组球形量化缩放图像令牌化器》,https://arxiv\.org/abs/2412\.02632
-
12月3日 《RARE:大语言模型的检索增强推理提升》,https://arxiv\.org/abs/2412\.02830
-
12月4日 《感知令牌增强多模态语言模型的视觉推理》,https://arxiv\.org/abs/2412\.03548
-
12月4日 《评估语言模型作为合成数据生成器的能力》,https://arxiv\.org/abs/2412\.03679
-
12月4日 《最佳N越狱攻击》,https://arxiv\.org/abs/2412\.03556
-
12月4日 《PaliGemma 2:面向迁移的多功能视觉语言模型家族》,https://arxiv\.org/abs/2412\.03555
-
12月5日 《VisionZip:视觉语言模型中更长更好但非必需》,https://arxiv\.org/abs/2412\.04467
-
12月5日 《在人类偏好上评估并对齐代码大语言模型》,https://arxiv\.org/abs/2412\.05210
-
12月6日 《MAmmoTH-VL:通过规模化指令微调激发多模态推理》,https://arxiv\.org/abs/2412\.05237
-
12月6日 《通过模型、数据与测试阶段扩展拓展开源多模态模型的性能边界》,https://arxiv\.org/abs/2412\.05271
-
12月7日 《大语言模型作为评判器:基于大模型的评估方法全面综述》,https://arxiv\.org/abs/2412\.05579
-
12月8日 《RLHF能缩放吗?探究数据、模型与方法的影响》,https://arxiv\.org/abs/2412\.06000
-
12月9日 《解开强化学习智能体记忆的复杂性:分类与评估方法》,https://arxiv\.org/abs/2412\.06531
-
12月9日 《训练大语言模型在连续潜空间中推理》,https://arxiv\.org/abs/2412\.06769
-
12月9日 《AutoReason:自动少样本推理分解》,https://arxiv\.org/abs/2412\.06975
-
12月11日 《大概念模型:句子表示空间中的语言建模》,https://arxiv\.org/abs/2412\.08821
-
12月12日 《Phi-4技术报告》,https://arxiv\.org/abs/2412\.08905
-
12月13日 《字节潜Transformer:补丁缩放优于令牌》,https://arxiv\.org/abs/2412\.09871
-
12月13日 《SCBench:长上下文方法的KV缓存中心分析》,https://arxiv\.org/abs/2412\.10319
-
12月13日 《大语言模型智能体之间合作的文化演化》,https://arxiv\.org/abs/2412\.10270
-
12月13日 《DeepSeek-VL2:面向高级多模态理解的混合专家视觉-语言模型》,https://arxiv\.org/abs/2412\.10302
-
12月16日 《告别Adam:初始化时的学习率缩放就足够》,https://arxiv\.org/abs/2412\.11768
-
12月16日 《大语言模型的精准长度控制》,https://arxiv\.org/abs/2412\.11937
-
12月16日 《大语言模型的开源优势》,https://arxiv\.org/abs/2412\.12004
-
12月16日 《多模态大语言模型时代的数学推理综述:基准、方法与挑战》,https://arxiv\.org/abs/2412\.11936
-
12月17日 《你的大语言模型具备稳定推理能力吗?》,https://arxiv\.org/abs/2412\.13147
-
12月18日 《大语言模型后训练方案:提升大语言模型推理能力》,https://arxiv\.org/abs/2412\.14135
-
12月18日 《Hansel:大语言模型输出长度控制框架》,https://arxiv\.org/abs/2412\.14033
-
12月18日 《重视你的理论:心理理论比推理更深层》,https://arxiv\.org/abs/2412\.13631
-
12月18日 《大语言模型中的对齐伪装》,https://arxiv\.org/abs/2412\.14093
-
12月18日 《SCOPE:优化长上下文生成中的键值缓存压缩》,https://arxiv\.org/abs/2412\.13649
-
12月19日 《LongBench v2:迈向真实长上下文多任务的深度理解与推理》,https://arxiv\.org/abs/2412\.15204
-
12月20日 《面向大语言模型多步推理的离线强化学习》,https://arxiv\.org/abs/2412\.16145
-
12月24日 《Mulberry:通过集体蒙特卡洛树搜索赋予多模态大语言模型类o1推理与反思能力》,https://arxiv\.org/abs/2412\.18319
-
12月31日 《Titans:在测试时学习记忆》,https://arxiv\.org/abs/2501\.00663
本专栏是我的个人兴趣项目。如果想要支持我的创作,欢迎购买我的《从零构建大语言模型》一书。(我相信这本书会让你收获颇丰,因为它对大语言模型工作原理的讲解深度是其他资料无法比拟的。)

《从零构建大语言模型》已在亚马逊上架
如果你读过了这本书,还请花几分钟留下评价,这对作者的帮助非常大!