- 【转载】Claude如何为AI生成文本添加水印
- 【转载】从零构建AI文本检测器
- 【转载】Kimi K3 架构笔记
- 【转载】使用本地 Coding Agent
- 【转载】大语言模型的推理强度调控
- 【转载】大语言模型研究论文:2026年精选清单(1-5月)
- 【转载】大语言模型架构最新进展:KV共享、mHC与压缩注意力
- 【转载】我理解大语言模型架构的工作流程
- 【转载】Karpathy LLM Wiki
- 【转载】Coding Agent的组成
- 【转载】现代大语言模型注意力机制变体可视化指南
- 【转载】开源权重大语言模型的春日之梦
- 【转载】提升大语言模型推理能力的推理时算力缩放分类
- 【转载】2025年大语言模型发展现状:进展、问题与展望
- 【转载】大语言模型研究论文:2025年下半年精选(7-12月)
- 【转载】从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新
- 【转载】超越标准大语言模型
- 【转载】从零开始理解大语言模型评估的四大主流方法
- 【转载】从零理解并实现Qwen3
- 【转载】从GPT-2到gpt-oss:架构演进深度解析
- 【转载】大语言模型架构全面对比23:Gemma 4
- 【转载】大语言模型架构全面对比22:2026年2月更多新模型一览:从Kimi K2.5到Tiny Aya
- 【转载】大语言模型架构全面对比21:GLM-5
- 【转载】大语言模型架构全面对比20:Arcee AI Trinity Large
- 【转载】大语言模型架构全面对比19:Xiaomi MiMo-V2-Flash
- 【转载】大语言模型架构全面对比18:Nemotron 3 Nano 与 Super
- 【转载】大语言模型架构全面对比17:Mistral 3
- 【转载】大语言模型架构全面对比16:DeepSeek V3.2
- 【转载】大语言模型架构全面对比15:Olmo 3 Thinking
- 【转载】大语言模型架构全面对比14:Kimi Linear
- 【转载】大语言模型架构全面对比13:MiniMax-M2
- 【转载】大语言模型架构全面对比12:Qwen3-Next
- 【转载】大语言模型架构全面对比11:GLM-4.5
- 【转载】大语言模型架构全面对比10:Grok 2.5
- 【转载】大语言模型架构全面对比09:GPT-OSS
- 【转载】大语言模型架构全面对比08:Kimi K2 and Kimi K2 Thinking
- 【转载】大语言模型架构全面对比7:SmolLM3
- 【转载】大语言模型架构全面对比06:Qwen3
- 【转载】大语言模型架构全面对比05:Llama 4
- 【转载】大语言模型架构全面对比04:Mistral Small 3.1
- 【转载】大语言模型架构全面对比03:Gemma 3
- 【转载】大语言模型架构全面对比02:OLMo 2
- 【转载】大语言模型架构全面对比01:DeepSeek V3/R1
- 【转载】大语言模型架构全面对比00:引言
- 【转载】大语言模型研究论文:2025年上半年精选(1-6月)
- 【转载】从零开始理解并实现大语言模型中的KV缓存
- 【转载】从零编写大语言模型:完整课程
- 【转载】大语言模型推理的强化学习现状
- 【转载】从零初探推理:第1章
- 【转载】大语言模型推理模型的推理现状
- 【转载】理解推理型大语言模型
- 【转载】2024年值得关注的AI研究论文(下)
- 【转载】2024年值得关注的AI研究论文(上)
- 【转载】大语言模型研究论文:2024年度合集
- 【转载】理解多模态大语言模型:主流技术与最新模型导论
- 【转载】从零构建GPT风格大语言模型分类器
- 【转载】从零构建大语言模型:3小时编程讲习班
- 【转载】新型大语言模型预训练与后训练范式
- 【转载】指令预训练大语言模型
- 【转载】预训练Transformer模型的使用与微调
- 【转载】大语言模型研究洞察:指令掩码与新型LoRA微调实验
- 【转载】最新开源大语言模型表现如何?DPO 是否优于 PPO?
- 【转载】使用与微调预训练Transformer模型
- 【转载】大语言模型预训练与奖励模型评估技巧
- 【转载】LoRA的继任者、小型微调大语言模型 vs 通用大语言模型,以及透明化大语言模型研究
- 【转载】改进LoRA:从零实现权重分解低秩适配DoRA
- 【转载】模型合并、混合专家,以及迈向更小的大语言模型
- 【转载】理解并实现大语言模型中的自注意力、多头注意力、因果注意力与交叉注意力
- 【转载】2023年值得关注的10篇AI研究论文
- 【转载】应对幻觉问题、提升推理能力与Transformer架构新洞察
- 【转载】使用 LoRA(低秩适配)微调大语言模型的实用技巧
- 【转载】用于高效大语言模型对齐的RLHF潜在继任者,以及卷积神经网络的复兴
- 【转载】2023年的人工智能与开源:高潮与低谷——年度回顾
- 【转载】大语言模型的商业版图与行业热潮
- 【介绍】从自对齐到LongLoRA
- 【转载】大语言模型训练:基于人类反馈的强化学习(RLHF)及其替代方案
- 【转载】遗漏的细节:Llama 2权重已发生变更
- 【转载】新型基础模型:CodeLlama 与开源 AI 的其他热点
- 【转载】Llama 2、Flash-Attention 2 及更多前沿研究
- 【转载】大语言模型与近邻算法
- 【转载】长上下文与将Transformer扩展至10亿令牌
- 【转载】2023年计算机视觉发展现状:从视觉Transformer到神经辐射场
- 【转载】借助混合精度与全分片数据并行加速PyTorch模型训练
- 【转载】理解编码器式与解码器式大语言模型
- 【转载】面向人类反馈的直接偏好优化及更多AI研究
- 【转载】面向人类反馈的直接偏好优化及更多AI研究
- 【转载】大语言模型微调与数据集观察
- 【转载】关于原始Transformer论文中的层归一化变体,以及大语言模型其他有趣的历史花絮
- 【转载】使用适配器高效微调大语言模型
- 【转载】长输入与少训练数据场景下的Transformer
- 【转载】大规模大语言模型训练运行洞察
- 【转载】理解大语言模型参数高效微调:提示调优与前缀调优
- 【转载】大语言模型微调
- 【转载】理解大语言模型
- 【转载】大语言模型3.0
- 【转载】换个方式训练AI:我们需要基于人类反馈的强化学习(RLHF)吗?
- 【转载】思想的AI复兴:从下一代卷积神经网络到大语言模型
- 【转载】回望2022:AI的大年
- 【转载】大语言模型的发布与开源软件
- 【转载】Transformer的快慢之道:语言处理领域的新进展