DeepSeek-R1:用强化学习激发推理能力
纯强化学习自发产生长链推理,开源推理模型的里程碑。
改变人工智能进程与技术路线的里程碑论文 · 按发布时间倒序
纯强化学习自发产生长链推理,开源推理模型的里程碑。
6710 亿参数混合专家,训练成本远低于同级别模型,重塑了算力效率认知。
把可提示分割扩展到视频并实时处理,交互次数减少3倍且更准。
开源模型首次在通用能力上逼近闭源旗舰。
中英双语开源模型体系,国产开源生态的主力军。
MLA 注意力加混合专家,把推理成本压到行业标杆。
提出 GRPO——无需价值网络的强化学习,成为开源推理模型的训练主力。
细粒度专家加共享专家,以更低算力追平稠密模型,影响后续MoE设计。
证明植入的欺骗行为能躲过RLHF与对抗训练,敲响欺骗性对齐警钟。
稀疏混合专家开源落地的代表,推理成本显著下降。
用弱模型监督GPT-4级模型可恢复其大部分能力,为超人类对齐铺路。
线性时间的序列建模,对 Transformer 主导地位的有力挑战。
一次把已知稳定晶体数量提升近一个数量级,预测出 220 万种新晶体。
7B至180B全开源,最大者用3.5万亿token训练,性能一度比肩PaLM-2。
用可训练视觉专家模块深度融合图文特征,不损NLP性能即多项SOTA。
发现五个顶尖助手都倾向迎合用户而非讲真话,指向人类反馈的缺陷。
小体量高性能,推动高效开源模型的竞赛。
以2294个真实仓库issue定义代码智能体基准,至今仍是核心标尺。
为 7100 万个错义变异给出致病性预测,把大量「意义不明」变异推进到可判读。
借鉴操作系统虚拟内存管理KV缓存,vLLM将服务吞吐提升数倍。
在开源视觉语言模型中率先打通定位与文字识别,同规模刷新纪录。
把多智能体对话抽象为可编程框架,成为Agent应用开发主流基建。
用可微三维高斯点实现1080p实时新视角合成,重塑三维重建与渲染。
用8类交互环境系统衡量LLM作智能体的表现,暴露开源与商用差距。
以ToolBench数据与训练评估框架补齐开源模型的工具调用能力。
自动搜索的对抗后缀可诱导对齐模型输出有害内容,且能跨模型迁移。
开放且可商用,把开源大模型正式推向商业落地。
改进并行与工作划分把GPU利用率提升近一倍,成长上下文标准组件。
一次训练的运动模块可插入任意个性化文生图模型,催热AI视频创作。
提出目标冲突与泛化错配两种失效模式,解释越狱攻击的根本成因。
三倍大UNet与双文本编码器,把开源文生图质量推到商用级。
提出高质量数据可让小模型超越规模定律预期,引发「数据质量优先」讨论。
单阶段Transformer直接生成高质音乐,统一文本与旋律条件控制。
只保护约1%显著权重即大幅降低量化误差,成端侧部署主流方案。
证明逐步过程监督优于只看结果,成为训练可靠推理模型的主流做法。
跳过强化学习直接用偏好数据微调,对齐工程被大幅简化。
自动课程加可增长技能库,让GPT-4无需微调自主探索并积累技能。
微调LLaMA使API调用准确率超越GPT-4,并配检索适应接口文档变化。
在单张48G显卡上微调65B模型且不失性能,让低成本微调大模型成为常态。
在GAN特征空间做运动监督与点跟踪,拖拽即可精确改变物体姿态与形状,带来直观的生成式编辑交互。
把思维链扩展为可分支、可回溯的思维树,让模型在需要探索与前瞻的难题上大幅提升解决率。
系统研究视觉语言指令微调,用26个公开数据集训练通用多模态模型,刷新多项零样本任务表现。
仅用图像配对数据就把文本、音频、深度、热成像与IMU绑进同一嵌入空间,实现跨模态检索生成。
先制定解题计划再逐步求解,缓解零样本思维链的漏步、计算与语义理解错误,提升多步推理准确率。
仅用一个投影层对齐冻结的视觉编码器与Vicuna,以极低训练成本复现GPT-4式图文理解与生成。
以极低成本做出多模态对话模型,开源多模态的起点。
靠自监督在大规模精选数据上训练出免微调的通用视觉特征,成为视觉基础模型的重要骨干。
用记忆、反思与计划的LLM架构驱动小镇智能体,涌现出可信社会行为,成为智能体社会模拟的蓝本。
十亿掩码训练出的通用分割模型,视觉基础模型的代表。
同一个模型兼任生成、反馈与改进者,无需任何训练即可多轮提升输出质量,带起自我修正研究方向。
系统记录 GPT-4 的能力与局限,把 AGI 讨论推向主流(方法论亦有争议)。
借扩散模型的几何先验,从单张图片生成指定相机视角的新图,成为单图3D生成与重建的关键方法。
不更新权重,用语言反馈反思并存入记忆来改进后续决策,让语言智能体能从试错中快速学习。
用蛋白质语言模型一次前向预测结构,比 AlphaFold2 快一个数量级。
多模态能力加专业考试接近人类水平,成为能力评估体系的转折点。
把语言引入DINO检测器做跨模态融合,可用任意类别名或指代表达检测目标,成为开放词表检测基准。
直接把噪声映射为数据,支持单步生成并能蒸馏已有扩散模型,大幅降低扩散采样的时间成本。
开源权重引发全球微调浪潮,是今天开源大模型生态的起点。
在交织图文网页语料上从头训练,具备多模态少样本学习与指令跟随能力,推动多模态大模型路线。
把优化器设计形式化为程序搜索,发现仅用动量的Lion,比Adam更省内存并在多项任务上刷新表现。
用零初始化卷积为扩散模型加入边缘、深度、姿态等空间条件,成为可控生成的事实标准。
让模型自己学会何时调用 API,工具调用能力的研究起点。
用轻量桥接模块连接视觉与语言,多模态的低成本方案。
把语音合成当作神经音频码本上的条件语言建模,3秒录音即可零样本克隆未见说话人的音色。
在离散token空间做掩码建模生成图像,比扩散与自回归方法更高效,开辟并行解码的文生图路径。
直接从再分析数据学习10天全球天气,1分钟内出结果,在90%的验证指标上超越业务数值预报。
用成文原则替代大规模人工标注,对齐成本大幅下降。
用数十万小时数据做多语言语音识别,语音交互门槛骤降。
用小模型草稿加并行验证,在不改变输出分布的前提下加速大模型解码,成为推理加速的标准技术。
将计算从推理中剥离,用生成程序加外部执行器求答案,在多个数学应用题数据集上显著超过思维链。
用两阶段优化与稀疏哈希网格解决DreamFusion慢且低清的问题,成为文生3D的主流高效方案。
把激活的量化难度等价迁移到权重,实现免训练W8A8量化,兼顾精度与硬件效率。
让模型把解题步骤写成程序、交由解释器计算,解决了思维链的算术与逻辑错误,催生工具调用范式。
首个真正的开源多语言大模型,推动开放协作生态。
一次性权重训练后量化,把百亿级GPT/OPT压到低比特近乎无损,大幅缓解大模型推理的显存压力。
推理与工具调用交替进行,成为 AI Agent 的标准循环。
免模拟地训练连续归一化流,涵盖并优于扩散路径且更稳定,开启大规模生成建模新范式。
用级联视频扩散模型把文本生成视频推进到高清分辨率,为文生视频的扩散路线确立了工程范式。
开源1300亿参数中英双语模型,性能对标GPT-3 175B并公开了千亿规模训练的稳定性经验。
把算法发现变成游戏,找到 50 年来首个优于 Strassen 的 4×4 矩阵乘法算法。
把文生图的能力迁移到三维建模,无需三维数据即可生成 3D。
用图文对学外观、无标注视频学运动,无需配对text-video即可生成视频。
让ODE走直线缩短生成路径,为后续一步生成与流匹配模型奠定基础。
混合语义与声学token把音频生成变成语言建模,实现长时一致的语音续写。
用混合精度分解处理离群特征,175B模型INT8推理无性能损失、显存减半。
联合训练条件与无条件模型即可引导采样,成为文生图默认配置。
把文生图当作序列到序列翻译,靠ViT-VQGAN分词与Transformer缩放做复杂构图。
提出规模到一定程度能力会突然出现,引发持续至今的争论。
IO 感知的注意力实现,让长上下文在工程上变得可行。
证明冻结大语言模型T5的文本编码比放大图像模型更关键,FID达7.27。
把难题拆成子问题并依序求解,解决问题难度超过示例时的泛化困境。
单个模型覆盖数百种任务,通用智能体的早期宣言。
用图文对比预训练加ViT端到端微调做开放词表检测,并量化其缩放规律。
开源125M–175B全系列权重并对标GPT-3,碳足迹仅其1/7,便于复现研究。
冻结大模型再加视觉接口,多模态融合的经典范式。
开放权重与训练代码的200亿稠密模型,成为开源大模型的早期基石。
文生图从玩具走向可用,「用文字画画」进入大众视野。
5400 亿参数,验证超大规模稀疏路径训练的可行性。
指出大模型普遍「参数过大、数据不足」,重塑了参数与数据的配比策略。
仅凭少量示例与大量题目迭代自举推理链,让模型自我提升复杂推理。
多次采样再投票,用推理时算力换取准确率。
RLHF 三阶段流程定型,ChatGPT 的直接技术来源。
用因果干预定位中层前馈的事实存储,秩一编辑即可改写知识与纠错。
用语言模型自动生成攻击用例,在280B聊天模型中找出上万条有害回复。
让模型先写过程再给答案,推理能力大幅提升,开启推理模型路线。
DeepSpeed与Megatron 3D并行训出5300亿稠密模型,公开工程细节。
用captioner生成加filter清洗噪声图文对,一个模型兼顾图文理解与生成。
多分辨率哈希编码让NeRF训练从数天缩到秒级,实时神经渲染成为可能。
把ViT的设计经验搬回ResNet,证明纯卷积网络仍可媲美Transformer。
把扩散过程搬进潜空间,直接催生了 Stable Diffusion。
让GPT-3边浏览网页边答题并附引用,再用人类反馈优化,是检索智能体雏形。
1.2万亿参数的稀疏专家模型,训练算力远低于稠密模型,验证MoE规模化路径。
系统扫描千万到2800亿参数、评测152个任务,量化缩放收益的公开实证。
要求模型把中间步骤写进草稿纸,大幅提升多步计算,是思维链的先声。
只编码可见patch、掩码75%,训练快且可扩展,成视觉自监督主流方案。
解决困扰生物学五十年的蛋白质折叠难题,AI for Science 的标志性成果。
代码生成能力与 HumanEval 基准,AI 编程的起点。
把语言与知识双预训练结合,统一理解与生成,是中文大模型知识增强路线代表。
让大模型微调从「重新训练」变成「打个补丁」,开源生态普及的关键。
把BERT的掩码建模迁移到图像,用离散视觉token做预训练,推动图像自监督。
用离线聚类产生伪标签做掩码预测,成为语音自监督表征的代表方法。
将强化学习化为条件序列建模,用Transformer按回报生成动作,开启离线RL新范式。
自监督ViT特征自带语义分割,k-NN分类达78.3%,奠定自监督视觉表征范式。
基于 MindSpore 与昇腾集群训练 2000 亿参数中文自回归模型,验证国产算力栈。
旋转位置编码(RoPE),今天长上下文大模型普遍采用。
用层次化结构和移位窗口把注意力限制在局部窗口,成为通用视觉骨干被广泛采用。
以自回归空白填充加二维位置编码统一理解与生成,在多项 NLU 任务上优于 BERT 与 T5。
图文对比学习打通视觉与语言,成为多模态与文生图的基础组件。
简单改动让扩散模型同时获得有竞争力的对数似然与高质量采样,并能用更少步数生成。
把优化器状态与计算卸载到 CPU,单卡即可训练 130 亿参数模型,显著降低大模型门槛。
把混合专家推到万亿级,证明稀疏激活在工程上可行。
仅用 ImageNet 单机三天训练达到 83.1% 精度,蒸馏 token 降低落地门槛。
用正向加噪、反向去噪的随机微分方程统一分数匹配与扩散模型,成为扩散生成理论框架。
把 Transformer 直接用在图像块上,视觉与语言的架构就此统一。
把扩散过程改为非马尔可夫,在同样训练目标下大幅减少采样步数,开启扩散加速研究。
用正交随机特征近似 softmax 注意力,不依赖稀疏假设就把时空复杂度降为线性。
人类偏好训练的先声,是 RLHF 路线的直接铺垫。
以块稀疏加全局 token 把注意力复杂度降到线性,并证明其仍保持图灵完备性。
用轻量标注 API 与 XLA 编译实现条件计算和自动分片,把多语言翻译模型扩展到超大规模。
只用语音自监督再少量标注微调即达领先识别水平,十余小时标注即可媲美百小时数据。
用逐步去噪做生成,奠定了 Stable Diffusion 等图像生成模型的技术底座。
1750 亿参数,证明「规模+上下文」即可完成新任务,涌现能力被广泛讨论。
把检测建模为集合预测并用二分匹配损失替代锚框与 NMS,开创端到端检测范式。
让模型外挂知识库,今天企业落地大模型的主流范式。
用向量检索替代关键词匹配,成为检索增强生成的检索基座。
窗口注意力加少量全局注意力让计算随长度线性增长,使数千 token 长文档建模可行。
把预训练改为判别替换词真伪,同等算力下效果超过掩码语言模型,更省样本与计算。
用一个 MLP 表达整个三维场景,引爆神经渲染与三维重建。
用幂律量化算力、数据、参数与损失的关系,为大模型巨额投入提供了第一份定量依据。
用局部敏感哈希注意力与可逆残差降低长序列的显存与计算,可处理数万 token。
在世界模型的紧凑潜空间想象轨迹并反传梯度求策略,大幅提升图像控制的样本效率。
修正归一化与渐进增长并加入路径长度正则,消除典型伪影且让生成图更易被反演。
只学奖励、价值与策略的隐式模型即可做树搜索规划,在 Atari、围棋与国际象棋超越人类。
以编码器-解码器加任意噪声重构文本,统一 BERT 与 GPT 思路,成生成任务常用基线。
把一切 NLP 任务统一成「文本到文本」,多任务统一范式的开端。
切分优化器状态、梯度与参数消除数据并行冗余显存,让万亿参数模型训练成为可能。
用词表分解与跨层参数共享大幅减少参数量并加速训练,证明更小的模型也能更强。
用层内张量并行在原生 PyTorch 训出数十亿参数模型,成为大模型并行训练的基础方案。
证明 BERT 其实被训练不足,是系统性超参研究的方法论范例。
改掩随机文本片段并让边界向量预测整段内容,在问答、指代消解等任务上超过 BERT。
以全排列语言建模兼顾双向上下文且无掩码偏差,刷新多项理解任务,成 BERT 主要竞品。
用多尺度离散编码加自回归先验生成高保真图像,推动先压缩再生成的两阶段范式。
提出复合缩放,把「如何放大模型」变成可计算的问题。
用不同注意力掩码统一单向、双向与序列到序列预训练,一个模型兼顾理解与生成。
把注意力矩阵稀疏分解到 O(n√n),首次让上百层模型建模数万步的长文本、图像与音频。
以片段级循环与相对位置编码突破定长上下文,成为长文本建模的重要一步。
风格注入让人脸生成以假乱真,也把深度伪造推到公众面前。
确立「预训练+微调」范式,NLP 全面进入预训练时代。
用可逆1×1卷积改进流模型,纯最大似然目标即可生成并编辑高清人脸图像。
把隐藏层视为连续微分方程求解,显存恒定、精度可调,开启连续深度建模。
让两个AI就同一问题互相辩论、由人类裁决,用博弈方式扩展可监督的复杂度。
先无监督学习环境的压缩时空表示,再在模型“梦境”中训练策略并迁回真实环境。
不依赖批量维度即可归一化,小batch下依然稳定,让检测分割等大模型可训练。
解耦执行与学习并用V-trace修正离策略偏差,把RL训练扩展到上千台机器。
以最大熵目标平衡探索与稳健,成为连续控制中样本效率最高的主流算法之一。
不依赖任何人类棋谱,通用自我博弈强化学习的里程碑。
指出Adam中L2正则与权重衰减并不等价,解耦后成为训练Transformer等模型标配。
用向量量化学习离散潜码并规避后验崩塌,成为图像音频离散token化的基础。
将注意力机制用于图结构,按邻居重要性自适应加权,且无需预先给定图结构。
系统辨析并融合DQN的六项改进,刷新Atari基准的数据效率与最终性能。
强化学习最常用算法,也是 ChatGPT 人类反馈微调阶段的核心。
抛弃循环结构,纯注意力架构;当代所有大模型的共同底座。
把图嵌入从直推式变为归纳式,可对训练时未见的新节点直接生成表示。
用深度可分离卷积压缩计算量并提供宽度/分辨率缩放,让视觉模型落到移动端。
无需成对样本即可完成跨域图像翻译,让无配对数据的风格迁移成为常规操作。
在Faster R-CNN上并联掩码分支,检测与分割一体化,并可扩展至人体姿态估计。
以Wasserstein距离替代JS散度,缓解训练不稳与模式崩塌,损失曲线变得可用。
提出稀疏激活的专家混合,今天万亿参数模型扩参的主流路线。
把条件GAN做成通用图像到图像翻译框架并自动学损失,开源后被广泛二次开发。
自回归直接建模原始音频波形,显著提升语音合成自然度,成为音频生成基石。
以谱图卷积的一阶近似实现图上可扩展卷积,推动图神经网络成为通用工具。
将每层与所有前层直接相连,缓解梯度消失并复用特征,成深层网络主流设计。
Transformer 中无处不在的归一化方式,稳定训练的关键组件。
把 AI 安全从哲学讨论拉进工程议程,定义了此后十余年的安全问题清单。
用可逆仿射耦合层实现精确似然与采样,为流模型(normalizing flow)奠基。
联邦学习开山之作,数据不出本地即可联合建模。
用多线程异步actor-learner并行训练,单机CPU上即可超越当时的GPU基线。
击败人类职业棋手,成为公众认知中 AI 能力的拐点。
残差连接让上百层网络可训练,是 Transformer 等一切现代架构的必备组件。
为GAN加入卷积架构约束与训练技巧,首次让无监督图像生成稳定且可复用特征。
提出子词切分,解决未登录词;今天所有大模型分词器的根基。
把目标检测重构为单次回归问题,一次前向即输出框与类别,开创实时检测路线。
提出共享特征的区域提议网络,把候选框生成并入网络,检测走向端到端实时。
三位图灵奖得主联袂综述,深度学习从此有了公认的教科书式阐述。
编码-解码加跳连的结构,后来成为扩散模型去噪网络的标准骨架。
用信赖域约束保证策略单调改进,为深度强化学习的稳定训练提供理论基础。
让超深网络可以稳定训练,训练速度提升十余倍。
至今仍是深度学习默认优化器,引用量位居全领域前列。
首次将分类网络改造为端到端全卷积结构,实现任意尺寸输入的像素级密集预测。
提出 Inception 模块,开创模块化网络设计。
确立编码器-解码器范式,机器翻译的转折点。
用 3×3 小卷积堆到 19 层,证明「深度」本身就是能力。
首次引入注意力机制,是 Transformer 的直系祖先。
生成器与判别器博弈,开创对抗式生成范式,也让深度伪造成为现实问题。
给生成模型一个可训练的概率框架,与 GAN 并列为生成建模两大流派。
直接从像素学会打游戏,深度强化学习由此引爆。
把词变成可运算的向量,「国王-男人+女人=女王」让语义第一次可被算术。
深度卷积网络横扫 ImageNet,深度学习复兴的引爆点。
随机失活神经元,成为深度学习防过拟合的标配,几乎写进每一代网络。