收录 219 篇 · 2012–2025
FOUNDATIONAL PAPERS

AI 文献

改变人工智能进程与技术路线的里程碑论文 · 按发布时间倒序

219 篇收录2012–2025 时间跨度291.2万累计引用8个方向
20251 篇
#01
2025-01-22推理与智能体cs.CL5,621原文 ↗

DeepSeek-R1:用强化学习激发推理能力

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

纯强化学习自发产生长链推理,开源推理模型的里程碑。

DeepSeek-AI, Daya Guo, Dejian Yang, Haowei Zhang 等
20249 篇
#02
2024-12-27开源与效率cs.CL引用待补原文 ↗

DeepSeek-V3 技术报告

DeepSeek-V3 Technical Report

6710 亿参数混合专家,训练成本远低于同级别模型,重塑了算力效率认知。

DeepSeek-AI, Aixin Liu, Bei Feng, Bing Xue 等
#03
2024-08-01视觉与多模态cs.CV4,126原文 ↗

SAM 2:图像与视频中的分割一切

SAM 2: Segment Anything in Images and Videos

把可提示分割扩展到视频并实时处理,交互次数减少3倍且更准。

Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu 等
#04
2024-07-31开源与效率cs.AI1.8万原文 ↗

Llama 3 模型群

The Llama 3 Herd of Models

开源模型首次在通用能力上逼近闭源旗舰。

Aaron Grattafiori, Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey 等
#05
2024-07-15开源与效率cs.CL2,448原文 ↗

Qwen2 技术报告

Qwen2 Technical Report

中英双语开源模型体系,国产开源生态的主力军。

An Yang, Baosong Yang, Binyuan Hui, Bo Zheng 等
#06
2024-05-07开源与效率cs.CL1,427原文 ↗

DeepSeek-V2:强、省、高效的混合专家模型

DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

MLA 注意力加混合专家,把推理成本压到行业标杆。

DeepSeek-AI, Aixin Liu, Bei Feng, Bin Wang 等
#07
2024-02-05推理与智能体cs.CL8,735原文 ↗

DeepSeekMath:用 GRPO 推进数学推理

DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

提出 GRPO——无需价值网络的强化学习,成为开源推理模型的训练主力。

Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu 等
#08
2024-01-11架构与基础cs.CL1,084原文 ↗

DeepSeekMoE:极致专家专业化

DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models

细粒度专家加共享专家,以更低算力追平稠密模型,影响后续MoE设计。

Damai Dai, Chengqi Deng, Chenggang Zhao, R. X. Xu 等
#09
2024-01-10对齐与安全cs.CR557原文 ↗

Sleeper Agents:难除的欺骗性后门

Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training

证明植入的欺骗行为能躲过RLHF与对抗训练,敲响欺骗性对齐警钟。

Evan Hubinger, Carson Denison, Jesse Mu, Mike Lambert 等
#10
2024-01-08开源与效率cs.LG2,118原文 ↗

混合专家模型(Mixtral)

Mixtral of Experts

稀疏混合专家开源落地的代表,推理成本显著下降。

Albert Q. Jiang, Alexandre Sablayrolles, Antoine Roux, Arthur Mensch 等
202355 篇
#11
2023-12-14对齐与安全cs.CL532原文 ↗

Weak-to-Strong:弱监督激发强能力

Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision

用弱模型监督GPT-4级模型可恢复其大部分能力,为超人类对齐铺路。

Collin Burns, Pavel Izmailov, Jan Hendrik Kirchner, Bowen Baker 等
#12
2023-12-01架构与基础cs.LG8,947原文 ↗

Mamba:选择性状态空间模型

Mamba: Linear-Time Sequence Modeling with Selective State Spaces

线性时间的序列建模,对 Transformer 主导地位的有力挑战。

Albert Gu, Tri Dao
#13
2023-11-29强化学习与科学Nature 624, 80–85引用待补原文 ↗

用深度学习扩展材料发现(GNoME)

Scaling deep learning for materials discovery

一次把已知稳定晶体数量提升近一个数量级,预测出 220 万种新晶体。

Amil Merchant, Simon Batzner, Ekin Dogus Cubuk, 等DeepMind
#14
2023-11-28开源与效率cs.CL772原文 ↗

Falcon系列开源语言模型

The Falcon Series of Open Language Models

7B至180B全开源,最大者用3.5万亿token训练,性能一度比肩PaLM-2。

Ebtesam Almazrouei, Hamza Alobeidli, Abdulaziz Alshamsi, Alessandro Cappelli 等
#15
2023-11-06视觉与多模态cs.CV851原文 ↗

CogVLM:给语言模型加视觉专家

CogVLM: Visual Expert for Pretrained Language Models

用可训练视觉专家模块深度融合图文特征,不损NLP性能即多项SOTA。

Weihan Wang, Qingsong Lv, Wenmeng Yu, Wenyi Hong 等
#16
2023-10-20对齐与安全cs.CL1,310原文 ↗

语言模型谄媚行为的成因研究

Towards Understanding Sycophancy in Language Models

发现五个顶尖助手都倾向迎合用户而非讲真话,指向人类反馈的缺陷。

Mrinank Sharma, Meg Tong, Tomasz Korbak, David Duvenaud 等
#17
2023-10-10开源与效率cs.CL3,869原文 ↗

Mistral 7B

Mistral 7B

小体量高性能,推动高效开源模型的竞赛。

Albert Q. Jiang, Alexandre Sablayrolles, Arthur Mensch, Chris Bamford 等
#18
2023-10-10推理与智能体cs.CL3,676原文 ↗

SWE-bench:真实GitHub问题修复评测

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

以2294个真实仓库issue定义代码智能体基准,至今仍是核心标尺。

Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao 等
#19
2023-09-22强化学习与科学Science 381, eadg7492引用待补原文 ↗

蛋白质组范围致病性变异预测(AlphaMissense)

Accurate proteome-wide missense variant effect prediction with AlphaMissense

为 7100 万个错义变异给出致病性预测,把大量「意义不明」变异推进到可判读。

Jun Cheng, Guido Novati, Žiga Avsec, 等DeepMind
#20
2023-09-12开源与效率cs.LG8,176原文 ↗

PagedAttention:大模型分页显存管理

Efficient Memory Management for Large Language Model Serving with PagedAttention

借鉴操作系统虚拟内存管理KV缓存,vLLM将服务吞吐提升数倍。

Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng 等
#21
2023-08-24视觉与多模态cs.CV2,416原文 ↗

Qwen-VL:多功能的视觉语言模型

Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

在开源视觉语言模型中率先打通定位与文字识别,同规模刷新纪录。

Jinze Bai, Shuai Bai, Shusheng Yang, Shijie Wang 等
#22
2023-08-16推理与智能体cs.AI2,546原文 ↗

AutoGen:多智能体对话应用框架

AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation

把多智能体对话抽象为可编程框架,成为Agent应用开发主流基建。

Qingyun Wu, Gagan Bansal, Jieyu Zhang, Yiran Wu 等
#23
2023-08-08生成建模cs.GR1.0万原文 ↗

3D Gaussian Splatting:实时渲染

3D Gaussian Splatting for Real-Time Radiance Field Rendering

用可微三维高斯点实现1080p实时新视角合成,重塑三维重建与渲染。

Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George Drettakis
#24
2023-08-07推理与智能体cs.AI1,271原文 ↗

AgentBench:评测大模型的智能体能力

AgentBench: Evaluating LLMs as Agents

用8类交互环境系统衡量LLM作智能体的表现,暴露开源与商用差距。

Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu 等
#25
2023-07-31推理与智能体cs.AI2,207原文 ↗

ToolLLM:掌握1.6万真实API

ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs

以ToolBench数据与训练评估框架补齐开源模型的工具调用能力。

Yujia Qin, Shihao Liang, Yining Ye, Kunlun Zhu 等
#26
2023-07-27对齐与安全cs.CL3,661原文 ↗

对齐模型的通用可迁移对抗攻击

Universal and Transferable Adversarial Attacks on Aligned Language Models

自动搜索的对抗后缀可诱导对齐模型输出有害内容,且能跨模型迁移。

Andy Zou, Zifan Wang, Nicholas Carlini, Milad Nasr 等
#27
2023-07-18开源与效率cs.CL1.8万原文 ↗

Llama 2:开放基础模型与对话模型

Llama 2: Open Foundation and Fine-Tuned Chat Models

开放且可商用,把开源大模型正式推向商业落地。

Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert 等
#28
2023-07-17架构与基础cs.LG3,240原文 ↗

FlashAttention-2:更快的精确注意力

FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning

改进并行与工作划分把GPU利用率提升近一倍,成长上下文标准组件。

Tri Dao
#29
2023-07-10生成建模cs.CV1,689原文 ↗

AnimateDiff:免微调动画化文生图

AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning

一次训练的运动模块可插入任意个性化文生图模型,催热AI视频创作。

Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang 等
#30
2023-07-05对齐与安全cs.LG2,149原文 ↗

Jailbroken:安全训练为何失效

Jailbroken: How Does LLM Safety Training Fail?

提出目标冲突与泛化错配两种失效模式,解释越狱攻击的根本成因。

Alexander Wei, Nika Haghtalab, Jacob Steinhardt
#31
2023-07-04生成建模cs.CV5,314原文 ↗

SDXL:高分辨率潜扩散文生图模型

SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

三倍大UNet与双文本编码器,把开源文生图质量推到商用级。

Dustin Podell, Zion English, Kyle Lacey, Andreas Blattmann 等
#32
2023-06-20开源与效率cs.CL660原文 ↗

教科书就够了吗?(phi-1)

Textbooks Are All You Need

提出高质量数据可让小模型超越规模定律预期,引发「数据质量优先」讨论。

Suriya Gunasekar, Yi Zhang, Jyoti Aneja, Caio César Teodoro Mendes 等
#33
2023-06-08生成建模cs.SD801原文 ↗

MusicGen:可控文本到音乐生成

Simple and Controllable Music Generation

单阶段Transformer直接生成高质音乐,统一文本与旋律条件控制。

Jade Copet, Felix Kreuk, Itai Gat, Tal Remez 等
#34
2023-06-01开源与效率cs.CL1,745原文 ↗

AWQ:激活感知权重量化

AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

只保护约1%显著权重即大幅降低量化误差,成端侧部署主流方案。

Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang 等
#35
2023-05-31推理与智能体cs.LG4,379原文 ↗

Let's Verify Step:过程监督验证

Let's Verify Step by Step

证明逐步过程监督优于只看结果,成为训练可靠推理模型的主流做法。

Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards 等
#36
2023-05-29对齐与安全cs.LG1.0万原文 ↗

直接偏好优化(DPO)

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

跳过强化学习直接用偏好数据微调,对齐工程被大幅简化。

Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon 等
#37
2023-05-25推理与智能体cs.AI2,255原文 ↗

Voyager:Minecraft终身学习智能体

Voyager: An Open-Ended Embodied Agent with Large Language Models

自动课程加可增长技能库,让GPT-4无需微调自主探索并积累技能。

Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar 等
#38
2023-05-24推理与智能体cs.CL1,610原文 ↗

Gorilla:连接海量API的大模型

Gorilla: Large Language Model Connected with Massive APIs

微调LLaMA使API调用准确率超越GPT-4,并配检索适应接口文档变化。

Shishir G. Patil, Tianjun Zhang, Xin Wang, Joseph E. Gonzalez
#39
2023-05-23开源与效率cs.LG5,580原文 ↗

QLoRA:4比特量化大模型微调

QLoRA: Efficient Finetuning of Quantized LLMs

在单张48G显卡上微调65B模型且不失性能,让低成本微调大模型成为常态。

Tim Dettmers, Artidoro Pagnoni, Ari Holtzman, Luke Zettlemoyer
#40
2023-05-18生成建模cs.CV366原文 ↗

DragGAN:拖拽点交互式图像编辑

Drag Your GAN: Interactive Point-based Manipulation on the Generative Image Manifold

在GAN特征空间做运动监督与点跟踪,拖拽即可精确改变物体姿态与形状,带来直观的生成式编辑交互。

Xingang Pan, Ayush Tewari, Thomas Leimkühler, Lingjie Liu 等
#41
2023-05-17推理与智能体cs.CL4,833原文 ↗

思维树(Tree of Thoughts)

Tree of Thoughts: Deliberate Problem Solving with Large Language Models

把思维链扩展为可分支、可回溯的思维树,让模型在需要探索与前瞻的难题上大幅提升解决率。

Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran 等
#42
2023-05-11视觉与多模态cs.CV3,935原文 ↗

InstructBLIP:视觉语言指令微调

InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning

系统研究视觉语言指令微调,用26个公开数据集训练通用多模态模型,刷新多项零样本任务表现。

Wenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong 等
#43
2023-05-09视觉与多模态cs.CV1,763原文 ↗

ImageBind:单一嵌入空间绑定六模态

ImageBind: One Embedding Space To Bind Them All

仅用图像配对数据就把文本、音频、深度、热成像与IMU绑进同一嵌入空间,实现跨模态检索生成。

Rohit Girdhar, Alaaeldin El-Nouby, Zhuang Liu, Mannat Singh 等
#44
2023-05-06推理与智能体cs.CL835原文 ↗

Plan-and-Solve:零样本思维链改进

Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning by Large Language Models

先制定解题计划再逐步求解,缓解零样本思维链的漏步、计算与语义理解错误,提升多步推理准确率。

Lei Wang, Wanyu Xu, Yihuai Lan, Zhiqiang Hu 等
#45
2023-04-20视觉与多模态cs.CV3,338原文 ↗

MiniGPT-4:轻量多模态大模型

MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

仅用一个投影层对齐冻结的视觉编码器与Vicuna,以极低训练成本复现GPT-4式图文理解与生成。

Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li 等
#46
2023-04-17视觉与多模态cs.CV1.1万原文 ↗

视觉指令微调(LLaVA)

Visual Instruction Tuning

以极低成本做出多模态对话模型,开源多模态的起点。

Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee
#47
2023-04-14视觉与多模态cs.CV1.0万原文 ↗

DINOv2:无监督通用视觉特征

DINOv2: Learning Robust Visual Features without Supervision

靠自监督在大规模精选数据上训练出免微调的通用视觉特征,成为视觉基础模型的重要骨干。

Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo 等
#48
2023-04-07推理与智能体cs.HC5,465原文 ↗

生成式智能体:可信人类行为模拟

Generative Agents: Interactive Simulacra of Human Behavior

用记忆、反思与计划的LLM架构驱动小镇智能体,涌现出可信社会行为,成为智能体社会模拟的蓝本。

Joon Sung Park, Joseph C. O'Brien, Carrie J. Cai, Meredith Ringel Morris 等
#49
2023-04-05视觉与多模态cs.CV1.5万原文 ↗

分割一切(SAM)

Segment Anything

十亿掩码训练出的通用分割模型,视觉基础模型的代表。

Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao 等
#50
2023-03-30推理与智能体cs.CL4,590原文 ↗

Self-Refine:自反馈迭代式自我改进

Self-Refine: Iterative Refinement with Self-Feedback

同一个模型兼任生成、反馈与改进者,无需任何训练即可多轮提升输出质量,带起自我修正研究方向。

Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan 等
#51
2023-03-22对齐与安全cs.CL4,431原文 ↗

通用人工智能的火花:GPT-4 早期实验

Sparks of Artificial General Intelligence: Early experiments with GPT-4

系统记录 GPT-4 的能力与局限,把 AGI 讨论推向主流(方法论亦有争议)。

Sébastien Bubeck, Varun Chandrasekaran, Ronen Eldan, Johannes Gehrke 等
#52
2023-03-20生成建模cs.CV1,856原文 ↗

Zero-1-to-3:单图零样本新视角合成

Zero-1-to-3: Zero-shot One Image to 3D Object

借扩散模型的几何先验,从单张图片生成指定相机视角的新图,成为单图3D生成与重建的关键方法。

Ruoshi Liu, Rundi Wu, Basile Van Hoorick, Pavel Tokmakov 等
#53
2023-03-20推理与智能体cs.AI5,169原文 ↗

Reflexion:语言智能体的言语强化学习

Reflexion: Language Agents with Verbal Reinforcement Learning

不更新权重,用语言反馈反思并存入记忆来改进后续决策,让语言智能体能从试错中快速学习。

Noah Shinn, Federico Cassano, Edward Berman, Ashwin Gopinath 等
#54
2023-03-17强化学习与科学Science 379, 1123–1130引用待补原文 ↗

用语言模型做进化尺度蛋白质结构预测(ESMFold)

Evolutionary-scale prediction of atomic-level protein structure with a language model

用蛋白质语言模型一次前向预测结构,比 AlphaFold2 快一个数量级。

Zeming Lin, Halil Akin, Roshan Rao, 等Meta AI
#55
2023-03-15预训练与规模cs.CL2.7万原文 ↗

GPT-4 技术报告

GPT-4 Technical Report

多模态能力加专业考试接近人类水平,成为能力评估体系的转折点。

OpenAI, Josh Achiam, Steven Adler, Sandhini Agarwal 等
#56
2023-03-09视觉与多模态cs.CV4,914原文 ↗

Grounding DINO:开放集目标检测

Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

把语言引入DINO检测器做跨模态融合,可用任意类别名或指代表达检测目标,成为开放词表检测基准。

Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li 等
#57
2023-03-02生成建模cs.LG2,160原文 ↗

一致性模型:一步生成扩散替代

Consistency Models

直接把噪声映射为数据,支持单步生成并能蒸馏已有扩散模型,大幅降低扩散采样的时间成本。

Yang Song, Prafulla Dhariwal, Mark Chen, Ilya Sutskever
#58
2023-02-27开源与效率cs.CL2.2万原文 ↗

LLaMA:开放且高效的基础语言模型

LLaMA: Open and Efficient Foundation Language Models

开源权重引发全球微调浪潮,是今天开源大模型生态的起点。

Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet 等
#59
2023-02-27视觉与多模态cs.CL800原文 ↗

Kosmos-1:多模态大语言模型

Language Is Not All You Need: Aligning Perception with Language Models

在交织图文网页语料上从头训练,具备多模态少样本学习与指令跟随能力,推动多模态大模型路线。

Shaohan Huang, Li Dong, Wenhui Wang, Yaru Hao 等
#60
2023-02-13架构与基础cs.LG706原文 ↗

Lion:符号搜索发现的优化器

Symbolic Discovery of Optimization Algorithms

把优化器设计形式化为程序搜索,发现仅用动量的Lion,比Adam更省内存并在多项任务上刷新表现。

Xiangning Chen, Chen Liang, Da Huang, Esteban Real 等
#61
2023-02-10生成建模cs.CV7,698原文 ↗

ControlNet:文生图扩散模型条件控制

Adding Conditional Control to Text-to-Image Diffusion Models

用零初始化卷积为扩散模型加入边缘、深度、姿态等空间条件,成为可控生成的事实标准。

Lvmin Zhang, Anyi Rao, Maneesh Agrawala
#62
2023-02-09推理与智能体cs.CL5,513原文 ↗

Toolformer:语言模型自学使用工具

Toolformer: Language Models Can Teach Themselves to Use Tools

让模型自己学会何时调用 API,工具调用能力的研究起点。

Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu 等
#63
2023-01-30视觉与多模态cs.CV9,119原文 ↗

用冻结图像编码器引导语言图像预训练(BLIP-2)

BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

用轻量桥接模块连接视觉与语言,多模态的低成本方案。

Junnan Li, Dongxu Li, Silvio Savarese, Steven Hoi
#64
2023-01-05视觉与多模态cs.CL1,356原文 ↗

VALL-E:零样本语音合成语言模型

Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

把语音合成当作神经音频码本上的条件语言建模,3秒录音即可零样本克隆未见说话人的音色。

Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang 等
#65
2023-01-02生成建模cs.CV796原文 ↗

Muse:掩码生成式Transformer文生图

Muse: Text-To-Image Generation via Masked Generative Transformers

在离散token空间做掩码建模生成图像,比扩散与自回归方法更高效,开辟并行解码的文生图路径。

Huiwen Chang, Han Zhang, Jarred Barber, AJ Maschinot 等
202244 篇
#66
2022-12-24强化学习与科学cs.LG435原文 ↗

GraphCast:图网络全球中期天气预报

GraphCast: Learning skillful medium-range global weather forecasting

直接从再分析数据学习10天全球天气,1分钟内出结果,在90%的验证指标上超越业务数值预报。

Remi Lam, Alvaro Sanchez-Gonzalez, Matthew Willson, Peter Wirnsberger 等
#67
2022-12-15对齐与安全cs.CL3,647原文 ↗

宪法式 AI:用 AI 反馈实现无害性

Constitutional AI: Harmlessness from AI Feedback

用成文原则替代大规模人工标注,对齐成本大幅下降。

Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell 等
#68
2022-12-06视觉与多模态eess.AS8,396原文 ↗

大规模弱监督下的稳健语音识别(Whisper)

Robust Speech Recognition via Large-Scale Weak Supervision

用数十万小时数据做多语言语音识别,语音交互门槛骤降。

Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman 等
#69
2022-11-30开源与效率cs.LG1,981原文 ↗

投机解码:加速Transformer推理

Fast Inference from Transformers via Speculative Decoding

用小模型草稿加并行验证,在不改变输出分布的前提下加速大模型解码,成为推理加速的标准技术。

Yaniv Leviathan, Matan Kalman, Yossi Matias
#70
2022-11-22推理与智能体cs.CL1,472原文 ↗

PoT:把推理表达为程序

Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks

将计算从推理中剥离,用生成程序加外部执行器求答案,在多个数学应用题数据集上显著超过思维链。

Wenhu Chen, Xueguang Ma, Xinyi Wang, William W. Cohen
#71
2022-11-18生成建模cs.CV1,692原文 ↗

Magic3D:高分辨率文本生成3D

Magic3D: High-Resolution Text-to-3D Content Creation

用两阶段优化与稀疏哈希网格解决DreamFusion慢且低清的问题,成为文生3D的主流高效方案。

Chen-Hsuan Lin, Jun Gao, Luming Tang, Towaki Takikawa 等
#72
2022-11-18开源与效率cs.CL1,868原文 ↗

SmoothQuant:大模型训练后量化

SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models

把激活的量化难度等价迁移到权重,实现免训练W8A8量化,兼顾精度与硬件效率。

Guangxuan Xiao, Ji Lin, Mickael Seznec, Hao Wu 等
#73
2022-11-18推理与智能体cs.CL830原文 ↗

PAL:程序辅助语言模型

PAL: Program-aided Language Models

让模型把解题步骤写成程序、交由解释器计算,解决了思维链的算术与逻辑错误,催生工具调用范式。

Luyu Gao, Aman Madaan, Shuyan Zhou, Uri Alon 等
#74
2022-11-09开源与效率cs.CL3,028原文 ↗

BLOOM:1760 亿参数开放多语言模型

BLOOM: A 176B-Parameter Open-Access Multilingual Language Model

首个真正的开源多语言大模型,推动开放协作生态。

BigScience Workshop, :, Teven Le Scao, Angela Fan 等
#75
2022-10-31开源与效率cs.LG2,532原文 ↗

GPTQ:生成式Transformer训练后量化

GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

一次性权重训练后量化,把百亿级GPT/OPT压到低比特近乎无损,大幅缓解大模型推理的显存压力。

Elias Frantar, Saleh Ashkboos, Torsten Hoefler, Dan Alistarh
#76
2022-10-06推理与智能体cs.CL1.1万原文 ↗

ReAct:让语言模型边推理边行动

ReAct: Synergizing Reasoning and Acting in Language Models

推理与工具调用交替进行,成为 AI Agent 的标准循环。

Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du 等
#77
2022-10-06生成建模cs.LG6,062原文 ↗

Flow Matching:连续归一化流生成

Flow Matching for Generative Modeling

免模拟地训练连续归一化流,涵盖并优于扩散路径且更稳定,开启大规模生成建模新范式。

Yaron Lipman, Ricky T. Q. Chen, Heli Ben-Hamu, Maximilian Nickel 等
#78
2022-10-05生成建模cs.CV2,150原文 ↗

Imagen Video:级联扩散视频生成

Imagen Video: High Definition Video Generation with Diffusion Models

用级联视频扩散模型把文本生成视频推进到高清分辨率,为文生视频的扩散路线确立了工程范式。

Jonathan Ho, William Chan, Chitwan Saharia, Jay Whang 等
#79
2022-10-05开源与效率cs.CL1,297原文 ↗

GLM-130B:开源中英双语千亿模型

GLM-130B: An Open Bilingual Pre-trained Model

开源1300亿参数中英双语模型,性能对标GPT-3 175B并公开了千亿规模训练的稳定性经验。

Aohan Zeng, Xiao Liu, Zhengxiao Du, Zihan Wang 等
#80
2022-10-05强化学习与科学Nature 610, 47–53引用待补原文 ↗

用强化学习发现更快的矩阵乘法算法(AlphaTensor)

Discovering faster matrix multiplication algorithms with reinforcement learning

把算法发现变成游戏,找到 50 年来首个优于 Strassen 的 4×4 矩阵乘法算法。

Alhussein Fawzi, Matej Balog, Demis Hassabis, 等DeepMind
#81
2022-09-29生成建模cs.CV3,833原文 ↗

用二维扩散做文生三维(DreamFusion)

DreamFusion: Text-to-3D using 2D Diffusion

把文生图的能力迁移到三维建模,无需三维数据即可生成 3D。

Ben Poole, Ajay Jain, Jonathan T. Barron, Ben Mildenhall
#82
2022-09-29生成建模cs.CV2,169原文 ↗

Make-A-Video:无需文视频对的文生视频

Make-A-Video: Text-to-Video Generation without Text-Video Data

用图文对学外观、无标注视频学运动,无需配对text-video即可生成视频。

Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin 等
#83
2022-09-07生成建模cs.LG3,889原文 ↗

Rectified Flow:拉直轨迹的生成与迁移

Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

让ODE走直线缩短生成路径,为后续一步生成与流匹配模型奠定基础。

Xingchao Liu, Chengyue Gong, Qiang Liu
#84
2022-09-07视觉与多模态cs.SD1,016原文 ↗

AudioLM:把音频生成当作语言建模

AudioLM: a Language Modeling Approach to Audio Generation

混合语义与声学token把音频生成变成语言建模,实现长时一致的语音续写。

Zalán Borsos, Raphaël Marinier, Damien Vincent, Eugene Kharitonov 等
#85
2022-08-15开源与效率cs.LG1,244原文 ↗

LLM.int8():大模型8比特矩阵乘法

LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale

用混合精度分解处理离群特征,175B模型INT8推理无性能损失、显存减半。

Tim Dettmers, Mike Lewis, Younes Belkada, Luke Zettlemoyer
#86
2022-07-26生成建模cs.LG7,057原文 ↗

CFG:无需分类器的扩散引导

Classifier-Free Diffusion Guidance

联合训练条件与无条件模型即可引导采样,成为文生图默认配置。

Jonathan Ho, Tim Salimans
#87
2022-06-22生成建模cs.CV1,562原文 ↗

Parti:可扩展的自回归文生图模型

Scaling Autoregressive Models for Content-Rich Text-to-Image Generation

把文生图当作序列到序列翻译,靠ViT-VQGAN分词与Transformer缩放做复杂构图。

Jiahui Yu, Yuanzhong Xu, Jing Yu Koh, Thang Luong 等
#88
2022-06-15推理与智能体cs.CL3,817原文 ↗

大语言模型的涌现能力

Emergent Abilities of Large Language Models

提出规模到一定程度能力会突然出现,引发持续至今的争论。

Jason Wei, Yi Tay, Rishi Bommasani, Colin Raffel 等
#89
2022-05-27架构与基础cs.LG5,209原文 ↗

FlashAttention:快速且省显存的精确注意力

FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

IO 感知的注意力实现,让长上下文在工程上变得可行。

Tri Dao, Daniel Y. Fu, Stefano Ermon, Atri Rudra 等
#90
2022-05-23生成建模cs.CV8,838原文 ↗

Imagen:深度语言理解的文生图扩散模型

Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding

证明冻结大语言模型T5的文本编码比放大图像模型更关键,FID达7.27。

Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li 等
#91
2022-05-21推理与智能体cs.AI1,912原文 ↗

Least-to-Most:由易到难分解提示

Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

把难题拆成子问题并依序求解,解决问题难度超过示例时的泛化困境。

Denny Zhou, Nathanael Schärli, Le Hou, Jason Wei 等
#92
2022-05-12推理与智能体cs.AI1,152原文 ↗

一个通用智能体(Gato)

A Generalist Agent

单个模型覆盖数百种任务,通用智能体的早期宣言。

Scott Reed, Konrad Zolna, Emilio Parisotto, Sergio Gomez Colmenarejo 等
#93
2022-05-12视觉与多模态cs.CV443原文 ↗

OWL-ViT:简单架构的开放词表目标检测

Simple Open-Vocabulary Object Detection with Vision Transformers

用图文对比预训练加ViT端到端微调做开放词表检测,并量化其缩放规律。

Matthias Minderer, Alexey Gritsenko, Austin Stone, Maxim Neumann 等
#94
2022-05-02开源与效率cs.CL4,950原文 ↗

OPT:开放预训练Transformer模型族

OPT: Open Pre-trained Transformer Language Models

开源125M–175B全系列权重并对标GPT-3,碳足迹仅其1/7,便于复现研究。

Susan Zhang, Stephen Roller, Naman Goyal, Mikel Artetxe 等
#95
2022-04-29视觉与多模态cs.CV6,550原文 ↗

Flamingo:少样本视觉语言模型

Flamingo: a Visual Language Model for Few-Shot Learning

冻结大模型再加视觉接口,多模态融合的经典范式。

Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech 等
#96
2022-04-14开源与效率cs.CL1,046原文 ↗

GPT-NeoX-20B:开源200亿参数自回归模型

GPT-NeoX-20B: An Open-Source Autoregressive Language Model

开放权重与训练代码的200亿稠密模型,成为开源大模型的早期基石。

Sid Black, Stella Biderman, Eric Hallahan, Quentin Anthony 等
#97
2022-04-13生成建模cs.CV9,375原文 ↗

用 CLIP 潜变量做层次化文生图(DALL·E 2)

Hierarchical Text-Conditional Image Generation with CLIP Latents

文生图从玩具走向可用,「用文字画画」进入大众视野。

Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu 等
#98
2022-04-05预训练与规模cs.CL8,354原文 ↗

PaLM:用 Pathways 扩展语言建模

PaLM: Scaling Language Modeling with Pathways

5400 亿参数,验证超大规模稀疏路径训练的可行性。

Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, Maarten Bosma 等
#99
2022-03-29预训练与规模cs.CL3,707原文 ↗

训练算力最优的大语言模型(Chinchilla)

Training Compute-Optimal Large Language Models

指出大模型普遍「参数过大、数据不足」,重塑了参数与数据的配比策略。

Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, Elena Buchatskaya 等
#100
2022-03-28推理与智能体cs.LG1,058原文 ↗

STaR:用推理自举推理能力

STaR: Bootstrapping Reasoning With Reasoning

仅凭少量示例与大量题目迭代自举推理链,让模型自我提升复杂推理。

Eric Zelikman, Yuhuai Wu, Jesse Mu, Noah D. Goodman
#101
2022-03-21推理与智能体cs.CL7,612原文 ↗

自洽性提升思维链推理

Self-Consistency Improves Chain of Thought Reasoning in Language Models

多次采样再投票,用推理时算力换取准确率。

Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le 等
#102
2022-03-04对齐与安全cs.CL2.4万原文 ↗

用人类反馈训练模型遵循指令(InstructGPT)

Training language models to follow instructions with human feedback

RLHF 三阶段流程定型,ChatGPT 的直接技术来源。

Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida 等
#103
2022-02-10对齐与安全cs.CL3,201原文 ↗

ROME:定位并编辑GPT中的事实知识

Locating and Editing Factual Associations in GPT

用因果干预定位中层前馈的事实存储,秩一编辑即可改写知识与纠错。

Kevin Meng, David Bau, Alex Andonian, Yonatan Belinkov
#104
2022-02-07对齐与安全cs.CL1,306原文 ↗

Red Teaming:用语言模型红队测试语言模型

Red Teaming Language Models with Language Models

用语言模型自动生成攻击用例,在280B聊天模型中找出上万条有害回复。

Ethan Perez, Saffron Huang, Francis Song, Trevor Cai 等
#105
2022-01-28推理与智能体cs.CL2.2万原文 ↗

思维链提示激发大模型推理能力

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

让模型先写过程再给答案,推理能力大幅提升,开启推理模型路线。

Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma 等
#106
2022-01-28开源与效率cs.CL869原文 ↗

MT-NLG 530B:5300亿参数语言模型

Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model

DeepSpeed与Megatron 3D并行训出5300亿稠密模型,公开工程细节。

Shaden Smith, Mostofa Patwary, Brandon Norick, Patrick LeGresley 等
#107
2022-01-28视觉与多模态cs.CV7,281原文 ↗

BLIP:引导式图文预训练统一理解与生成

BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation

用captioner生成加filter清洗噪声图文对,一个模型兼顾图文理解与生成。

Junnan Li, Dongxu Li, Caiming Xiong, Steven Hoi
#108
2022-01-16生成建模cs.CV6,279原文 ↗

Instant-NGP:多分辨率哈希编码的即时神经图形

Instant Neural Graphics Primitives with a Multiresolution Hash Encoding

多分辨率哈希编码让NeRF训练从数天缩到秒级,实时神经渲染成为可能。

Thomas Müller, Alex Evans, Christoph Schied, Alexander Keller
#109
2022-01-10架构与基础cs.CV9,302原文 ↗

ConvNeXt:为2020年代重设计的卷积网络

A ConvNet for the 2020s

把ViT的设计经验搬回ResNet,证明纯卷积网络仍可媲美Transformer。

Zhuang Liu, Hanzi Mao, Chao-Yuan Wu, Christoph Feichtenhofer 等
202122 篇
#110
2021-12-20生成建模cs.CV2.7万原文 ↗

高分辨率图像的潜在扩散模型(Latent Diffusion)

High-Resolution Image Synthesis with Latent Diffusion Models

把扩散过程搬进潜空间,直接催生了 Stable Diffusion。

Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等
#111
2021-12-17推理与智能体cs.CL2,055原文 ↗

WebGPT:带浏览器的人类反馈问答

WebGPT: Browser-assisted question-answering with human feedback

让GPT-3边浏览网页边答题并附引用,再用人类反馈优化,是检索智能体雏形。

Reiichiro Nakano, Jacob Hilton, Suchir Balaji, Jeff Wu 等
#112
2021-12-13预训练与规模cs.CL1,319原文 ↗

GLaM:稀疏MoE的高效语言模型缩放

GLaM: Efficient Scaling of Language Models with Mixture-of-Experts

1.2万亿参数的稀疏专家模型,训练算力远低于稠密模型,验证MoE规模化路径。

Nan Du, Yanping Huang, Andrew M. Dai, Simon Tong 等
#113
2021-12-08预训练与规模cs.CL1,663原文 ↗

Gopher:从千万到2800亿参数的语言模型缩放

Scaling Language Models: Methods, Analysis & Insights from Training Gopher

系统扫描千万到2800亿参数、评测152个任务,量化缩放收益的公开实证。

Jack W. Rae, Sebastian Borgeaud, Trevor Cai, Katie Millican 等
#114
2021-11-30推理与智能体cs.LG1,111原文 ↗

Scratchpad:让语言模型写出中间计算步骤

Show Your Work: Scratchpads for Intermediate Computation with Language Models

要求模型把中间步骤写进草稿纸,大幅提升多步计算,是思维链的先声。

Maxwell Nye, Anders Johan Andreassen, Guy Gur-Ari, Henryk Michalewski 等
#115
2021-11-11视觉与多模态cs.CV1.3万原文 ↗

MAE:可扩展的掩码自编码视觉学习器

Masked Autoencoders Are Scalable Vision Learners

只编码可见patch、掩码75%,训练快且可扩展,成视觉自监督主流方案。

Kaiming He, Xinlei Chen, Saining Xie, Yanghao Li 等
#116
2021-07-15强化学习与科学Nature 596, 583–589引用待补原文 ↗

高精度蛋白质结构预测(AlphaFold2)

Highly accurate protein structure prediction with AlphaFold

解决困扰生物学五十年的蛋白质折叠难题,AI for Science 的标志性成果。

John Jumper, Richard Evans, Demis Hassabis, 等DeepMind
#117
2021-07-07推理与智能体cs.LG1.1万原文 ↗

评估面向代码训练的大模型(Codex)

Evaluating Large Language Models Trained on Code

代码生成能力与 HumanEval 基准,AI 编程的起点。

Mark Chen, Jerry Tworek, Heewoo Jun, Qiming Yuan 等
#118
2021-07-05预训练与规模cs.CL618原文 ↗

ERNIE 3.0:知识增强的预训练模型

ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation

把语言与知识双预训练结合,统一理解与生成,是中文大模型知识增强路线代表。

Yu Sun, Shuohuan Wang, Shikun Feng, Siyu Ding 等
#119
2021-06-17开源与效率cs.CL2.3万原文 ↗

低秩适配(LoRA)

LoRA: Low-Rank Adaptation of Large Language Models

让大模型微调从「重新训练」变成「打个补丁」,开源生态普及的关键。

Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu 等
#120
2021-06-15视觉与多模态cs.CV3,888原文 ↗

BEiT:图像Transformer的BERT式预训练

BEiT: BERT Pre-Training of Image Transformers

把BERT的掩码建模迁移到图像,用离散视觉token做预训练,推动图像自监督。

Hangbo Bao, Li Dong, Songhao Piao, Furu Wei
#121
2021-06-14视觉与多模态cs.CL5,080原文 ↗

HuBERT:隐单元掩码预测的语音自监督

HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units

用离线聚类产生伪标签做掩码预测,成为语音自监督表征的代表方法。

Wei-Ning Hsu, Benjamin Bolte, Yao-Hung Hubert Tsai, Kushal Lakhotia 等
#122
2021-06-02强化学习与科学cs.LG2,490原文 ↗

Decision Transformer:RL即序列建模

Decision Transformer: Reinforcement Learning via Sequence Modeling

将强化学习化为条件序列建模,用Transformer按回报生成动作,开启离线RL新范式。

Lili Chen, Kevin Lu, Aravind Rajeswaran, Kimin Lee 等
#123
2021-04-29视觉与多模态cs.CV1.0万原文 ↗

DINO:自监督ViT的涌现特性

Emerging Properties in Self-Supervised Vision Transformers

自监督ViT特征自带语义分割,k-NN分类达78.3%,奠定自监督视觉表征范式。

Mathilde Caron, Hugo Touvron, Ishan Misra, Hervé Jégou 等
#124
2021-04-26预训练与规模cs.CL247原文 ↗

PanGu-α:2000 亿参数中文预训练模型

PanGu-$α$: Large-scale Autoregressive Pretrained Chinese Language Models with Auto-parallel Computation

基于 MindSpore 与昇腾集群训练 2000 亿参数中文自回归模型,验证国产算力栈。

Wei Zeng, Xiaozhe Ren, Teng Su, Hui Wang 等
#125
2021-04-20架构与基础cs.CL6,344原文 ↗

RoFormer:带旋转位置编码的增强 Transformer

RoFormer: Enhanced Transformer with Rotary Position Embedding

旋转位置编码(RoPE),今天长上下文大模型普遍采用。

Jianlin Su, Yu Lu, Shengfeng Pan, Ahmed Murtadha 等
#126
2021-03-25视觉与多模态cs.CV3.5万原文 ↗

Swin Transformer:移位窗口视觉骨干

Swin Transformer: Hierarchical Vision Transformer using Shifted Windows

用层次化结构和移位窗口把注意力限制在局部窗口,成为通用视觉骨干被广泛采用。

Ze Liu, Yutong Lin, Yue Cao, Han Hu 等
#127
2021-03-18预训练与规模cs.CL1,985原文 ↗

GLM:自回归空白填充预训练

GLM: General Language Model Pretraining with Autoregressive Blank Infilling

以自回归空白填充加二维位置编码统一理解与生成,在多项 NLU 任务上优于 BERT 与 T5。

Zhengxiao Du, Yujie Qian, Xiao Liu, Ming Ding 等
#128
2021-02-26视觉与多模态cs.CV5.5万原文 ↗

从自然语言监督学习可迁移的视觉模型(CLIP)

Learning Transferable Visual Models From Natural Language Supervision

图文对比学习打通视觉与语言,成为多模态与文生图的基础组件。

Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等
#129
2021-02-18生成建模cs.LG5,823原文 ↗

Improved DDPM:更好的扩散模型

Improved Denoising Diffusion Probabilistic Models

简单改动让扩散模型同时获得有竞争力的对数似然与高质量采样,并能用更少步数生成。

Alex Nichol, Prafulla Dhariwal
#130
2021-01-18开源与效率cs.DC641原文 ↗

ZeRO-Offload:单卡训十亿参数

ZeRO-Offload: Democratizing Billion-Scale Model Training

把优化器状态与计算卸载到 CPU,单卡即可训练 130 亿参数模型,显著降低大模型门槛。

Jie Ren, Samyam Rajbhandari, Reza Yazdani Aminabadi, Olatunji Ruwase 等
#131
2021-01-11架构与基础cs.LG4,729原文 ↗

用简化稀疏性扩展到万亿参数(Switch Transformer)

Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity

把混合专家推到万亿级,证明稀疏激活在工程上可行。

William Fedus, Barret Zoph, Noam Shazeer
202019 篇
#132
2020-12-23视觉与多模态cs.CV9,759原文 ↗

DeiT:数据高效的视觉 Transformer

Training data-efficient image transformers & distillation through attention

仅用 ImageNet 单机三天训练达到 83.1% 精度,蒸馏 token 降低落地门槛。

Hugo Touvron, Matthieu Cord, Matthijs Douze, Francisco Massa 等
#133
2020-11-26生成建模cs.LG1.2万原文 ↗

Score SDE:随机微分方程生成模型

Score-Based Generative Modeling through Stochastic Differential Equations

用正向加噪、反向去噪的随机微分方程统一分数匹配与扩散模型,成为扩散生成理论框架。

Yang Song, Jascha Sohl-Dickstein, Diederik P. Kingma, Abhishek Kumar 等
#134
2020-10-22视觉与多模态cs.CV6.9万原文 ↗

一张图等于 16×16 个词(ViT)

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

把 Transformer 直接用在图像块上,视觉与语言的架构就此统一。

Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn 等
#135
2020-10-06生成建模cs.LG1.3万原文 ↗

DDIM:更快的扩散采样

Denoising Diffusion Implicit Models

把扩散过程改为非马尔可夫,在同样训练目标下大幅减少采样步数,开启扩散加速研究。

Jiaming Song, Chenlin Meng, Stefano Ermon
#136
2020-09-30架构与基础cs.LG2,451原文 ↗

Performer:线性复杂度的注意力

Rethinking Attention with Performers

用正交随机特征近似 softmax 注意力,不依赖稀疏假设就把时空复杂度降为线性。

Krzysztof Choromanski, Valerii Likhosherstov, David Dohan, Xingyou Song 等
#137
2020-09-02对齐与安全cs.CL3,466原文 ↗

用人类反馈训练摘要模型

Learning to summarize from human feedback

人类偏好训练的先声,是 RLHF 路线的直接铺垫。

Nisan Stiennon, Long Ouyang, Jeff Wu, Daniel M. Ziegler 等
#138
2020-07-28架构与基础cs.LG3,077原文 ↗

Big Bird:线性稀疏注意力长序列

Big Bird: Transformers for Longer Sequences

以块稀疏加全局 token 把注意力复杂度降到线性,并证明其仍保持图灵完备性。

Manzil Zaheer, Guru Guruganesh, Avinava Dubey, Joshua Ainslie 等
#139
2020-06-30开源与效率cs.CL2,322原文 ↗

GShard:条件计算与自动分片

GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding

用轻量标注 API 与 XLA 编译实现条件计算和自动分片,把多语言翻译模型扩展到超大规模。

Dmitry Lepikhin, HyoukJoong Lee, Yuanzhong Xu, Dehao Chen 等
#140
2020-06-20视觉与多模态cs.CL9,208原文 ↗

wav2vec 2.0:语音自监督预训练

wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

只用语音自监督再少量标注微调即达领先识别水平,十余小时标注即可媲美百小时数据。

Alexei Baevski, Henry Zhou, Abdelrahman Mohamed, Michael Auli
#141
2020-06-19生成建模cs.LG3.5万原文 ↗

去噪扩散概率模型(DDPM)

Denoising Diffusion Probabilistic Models

用逐步去噪做生成,奠定了 Stable Diffusion 等图像生成模型的技术底座。

Jonathan Ho, Ajay Jain, Pieter Abbeel
#142
2020-05-28预训练与规模cs.CL6.3万原文 ↗

语言模型是少样本学习者(GPT-3)

Language Models are Few-Shot Learners

1750 亿参数,证明「规模+上下文」即可完成新任务,涌现能力被广泛讨论。

Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah 等
#143
2020-05-26视觉与多模态cs.CV2.0万原文 ↗

DETR:Transformer 端到端目标检测

End-to-End Object Detection with Transformers

把检测建模为集合预测并用二分匹配损失替代锚框与 NMS,开创端到端检测范式。

Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier 等
#144
2020-05-22推理与智能体cs.CL1.8万原文 ↗

检索增强生成(RAG)

Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

让模型外挂知识库,今天企业落地大模型的主流范式。

Patrick Lewis, Ethan Perez, Aleksandra Piktus, Fabio Petroni 等
#145
2020-04-10推理与智能体cs.CL6,906原文 ↗

开放域问答的稠密段落检索(DPR)

Dense Passage Retrieval for Open-Domain Question Answering

用向量检索替代关键词匹配,成为检索增强生成的检索基座。

Vladimir Karpukhin, Barlas Oğuz, Sewon Min, Patrick Lewis 等
#146
2020-04-10架构与基础cs.CL5,904原文 ↗

Longformer:线性注意力长文档模型

Longformer: The Long-Document Transformer

窗口注意力加少量全局注意力让计算随长度线性增长,使数千 token 长文档建模可行。

Iz Beltagy, Matthew E. Peters, Arman Cohan
#147
2020-03-23预训练与规模cs.CL引用待补原文 ↗

ELECTRA:判别式预训练

ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators

把预训练改为判别替换词真伪,同等算力下效果超过掩码语言模型,更省样本与计算。

Kevin Clark, Minh-Thang Luong, Quoc V. Le, Christopher D. Manning
#148
2020-03-19生成建模cs.CV引用待补原文 ↗

用神经辐射场表示场景(NeRF)

NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis

用一个 MLP 表达整个三维场景,引爆神经渲染与三维重建。

Ben Mildenhall, Pratul P. Srinivasan, Matthew Tancik, Jonathan T. Barron 等
#149
2020-01-23预训练与规模cs.LG8,965原文 ↗

神经语言模型的缩放定律

Scaling Laws for Neural Language Models

用幂律量化算力、数据、参数与损失的关系,为大模型巨额投入提供了第一份定量依据。

Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown 等
#150
2020-01-13架构与基础cs.LG3,073原文 ↗

Reformer:高效 Transformer

Reformer: The Efficient Transformer

用局部敏感哈希注意力与可逆残差降低长序列的显存与计算,可处理数万 token。

Nikita Kitaev, Łukasz Kaiser, Anselm Levskaya
201916 篇
#151
2019-12-03强化学习与科学cs.LG2,258原文 ↗

Dreamer:潜空间想象学行为

Dream to Control: Learning Behaviors by Latent Imagination

在世界模型的紧凑潜空间想象轨迹并反传梯度求策略,大幅提升图像控制的样本效率。

Danijar Hafner, Timothy Lillicrap, Jimmy Ba, Mohammad Norouzi
#152
2019-12-03生成建模cs.CV7,199原文 ↗

StyleGAN2:改进的图像生成质量

Analyzing and Improving the Image Quality of StyleGAN

修正归一化与渐进增长并加入路径长度正则,消除典型伪影且让生成图更易被反演。

Tero Karras, Samuli Laine, Miika Aittala, Janne Hellsten 等
#153
2019-11-19强化学习与科学cs.LG2,712原文 ↗

MuZero:用学到的模型规划

Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model

只学奖励、价值与策略的隐式模型即可做树搜索规划,在 Atari、围棋与国际象棋超越人类。

Julian Schrittwieser, Ioannis Antonoglou, Thomas Hubert, Karen Simonyan 等
#154
2019-10-29预训练与规模cs.CL1.3万原文 ↗

BART:去噪序列到序列预训练

BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension

以编码器-解码器加任意噪声重构文本,统一 BERT 与 GPT 思路,成生成任务常用基线。

Mike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad 等
#155
2019-10-23预训练与规模cs.LG2.7万原文 ↗

统一文本到文本的迁移学习(T5)

Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

把一切 NLP 任务统一成「文本到文本」,多任务统一范式的开端。

Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee 等
#156
2019-10-04开源与效率cs.LG2,034原文 ↗

ZeRO:消除冗余的显存优化

ZeRO: Memory Optimizations Toward Training Trillion Parameter Models

切分优化器状态、梯度与参数消除数据并行冗余显存,让万亿参数模型训练成为可能。

Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, Yuxiong He
#157
2019-09-26开源与效率cs.CL7,695原文 ↗

ALBERT:轻量化 BERT 预训练

ALBERT: A Lite BERT for Self-supervised Learning of Language Representations

用词表分解与跨层参数共享大幅减少参数量并加速训练,证明更小的模型也能更强。

Zhenzhong Lan, Mingda Chen, Sebastian Goodman, Kevin Gimpel 等
#158
2019-09-17开源与效率cs.CL3,137原文 ↗

Megatron-LM:层内模型并行训练

Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

用层内张量并行在原生 PyTorch 训出数十亿参数模型,成为大模型并行训练的基础方案。

Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley 等
#159
2019-07-26预训练与规模cs.CL3.1万原文 ↗

稳健优化的 BERT 预训练(RoBERTa)

RoBERTa: A Robustly Optimized BERT Pretraining Approach

证明 BERT 其实被训练不足,是系统性超参研究的方法论范例。

Yinhan Liu, Myle Ott, Naman Goyal, Jingfei Du 等
#160
2019-07-24预训练与规模cs.CL2,214原文 ↗

SpanBERT:面向片段表示的预训练

SpanBERT: Improving Pre-training by Representing and Predicting Spans

改掩随机文本片段并让边界向量预测整段内容,在问答、指代消解等任务上超过 BERT。

Mandar Joshi, Danqi Chen, Yinhan Liu, Daniel S. Weld 等
#161
2019-06-19预训练与规模cs.CL9,537原文 ↗

XLNet:广义自回归预训练

XLNet: Generalized Autoregressive Pretraining for Language Understanding

以全排列语言建模兼顾双向上下文且无掩码偏差,刷新多项理解任务,成 BERT 主要竞品。

Zhilin Yang, Zihang Dai, Yiming Yang, Jaime Carbonell 等
#162
2019-06-02生成建模cs.LG2,463原文 ↗

VQ-VAE-2:层级潜变量图像生成

Generating Diverse High-Fidelity Images with VQ-VAE-2

用多尺度离散编码加自回归先验生成高保真图像,推动先压缩再生成的两阶段范式。

Ali Razavi, Aaron van den Oord, Oriol Vinyals
#163
2019-05-28架构与基础cs.LG2.6万原文 ↗

重新思考卷积网络的模型缩放(EfficientNet)

EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks

提出复合缩放,把「如何放大模型」变成可计算的问题。

Mingxing Tan, Quoc V. Le
#164
2019-05-08预训练与规模cs.CL1,677原文 ↗

UniLM:统一的预训练语言模型

Unified Language Model Pre-training for Natural Language Understanding and Generation

用不同注意力掩码统一单向、双向与序列到序列预训练,一个模型兼顾理解与生成。

Li Dong, Nan Yang, Wenhui Wang, Furu Wei 等
#165
2019-04-23架构与基础cs.LG2,669原文 ↗

Sparse Transformer:长序列稀疏注意力

Generating Long Sequences with Sparse Transformers

把注意力矩阵稀疏分解到 O(n√n),首次让上百层模型建模数万步的长文本、图像与音频。

Rewon Child, Scott Gray, Alec Radford, Ilya Sutskever
#166
2019-01-09架构与基础cs.LG4,488原文 ↗

Transformer-XL:长上下文语言模型

Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context

以片段级循环与相对位置编码突破定长上下文,成为长文本建模的重要一步。

Zihang Dai, Zhilin Yang, Yiming Yang, Jaime Carbonell 等
20189 篇
#167
2018-12-12生成建模cs.NE1.3万原文 ↗

基于风格的生成器(StyleGAN)

A Style-Based Generator Architecture for Generative Adversarial Networks

风格注入让人脸生成以假乱真,也把深度伪造推到公众面前。

Tero Karras, Samuli Laine, Timo Aila
#168
2018-10-11预训练与规模cs.CL12.1万原文 ↗

BERT:深度双向 Transformer 预训练

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

确立「预训练+微调」范式,NLP 全面进入预训练时代。

Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova
#169
2018-07-09生成建模stat.ML3,697原文 ↗

Glow:可逆1×1卷积生成流

Glow: Generative Flow with Invertible 1x1 Convolutions

用可逆1×1卷积改进流模型,纯最大似然目标即可生成并编辑高清人脸图像。

Diederik P. Kingma, Prafulla Dhariwal
#170
2018-06-19架构与基础cs.LG7,677原文 ↗

神经常微分方程(Neural ODE)

Neural Ordinary Differential Equations

把隐藏层视为连续微分方程求解,显存恒定、精度可调,开启连续深度建模。

Ricky T. Q. Chen, Yulia Rubanova, Jesse Bettencourt, David Duvenaud
#171
2018-05-02对齐与安全stat.ML460原文 ↗

AI safety via debate:对齐辩论法

AI safety via debate

让两个AI就同一问题互相辩论、由人类裁决,用博弈方式扩展可监督的复杂度。

Geoffrey Irving, Paul Christiano, Dario Amodei
#172
2018-03-27强化学习与科学cs.LG2,049原文 ↗

世界模型(World Models)

World Models

先无监督学习环境的压缩时空表示,再在模型“梦境”中训练策略并迁回真实环境。

David Ha, Jürgen Schmidhuber
#173
2018-03-22架构与基础cs.CV4,568原文 ↗

组归一化(Group Normalization)

Group Normalization

不依赖批量维度即可归一化,小batch下依然稳定,让检测分割等大模型可训练。

Yuxin Wu, Kaiming He
#174
2018-02-05开源与效率cs.LG1,923原文 ↗

IMPALA:分布式深度强化学习架构

IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures

解耦执行与学习并用V-trace修正离策略偏差,把RL训练扩展到上千台机器。

Lasse Espeholt, Hubert Soyer, Remi Munos, Karen Simonyan 等
#175
2018-01-04强化学习与科学cs.LG1.2万原文 ↗

软演员-评论家:最大熵强化学习(SAC)

Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor

以最大熵目标平衡探索与稳健,成为连续控制中样本效率最高的主流算法之一。

Tuomas Haarnoja, Aurick Zhou, Pieter Abbeel, Sergey Levine
201713 篇
#176
2017-12-05强化学习与科学cs.AI2,135原文 ↗

只用自我博弈掌握国际象棋与将棋(AlphaZero)

Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm

不依赖任何人类棋谱,通用自我博弈强化学习的里程碑。

David Silver, Thomas Hubert, Julian Schrittwieser, Ioannis Antonoglou 等
#177
2017-11-14架构与基础cs.LG2,754原文 ↗

解耦权重衰减正则(AdamW)

Decoupled Weight Decay Regularization

指出Adam中L2正则与权重衰减并不等价,解耦后成为训练Transformer等模型标配。

Ilya Loshchilov, Frank Hutter
#178
2017-11-02生成建模cs.LG7,900原文 ↗

神经离散表示学习(VQ-VAE)

Neural Discrete Representation Learning

用向量量化学习离散潜码并规避后验崩塌,成为图像音频离散token化的基础。

Aaron van den Oord, Oriol Vinyals, Koray Kavukcuoglu
#179
2017-10-30架构与基础stat.ML2.8万原文 ↗

图注意力网络(GAT)

Graph Attention Networks

将注意力机制用于图结构,按邻居重要性自适应加权,且无需预先给定图结构。

Petar Veličković, Guillem Cucurull, Arantxa Casanova, Adriana Romero 等
#180
2017-10-06强化学习与科学cs.AI2,705原文 ↗

Rainbow:DQN 六项改进集成

Rainbow: Combining Improvements in Deep Reinforcement Learning

系统辨析并融合DQN的六项改进,刷新Atari基准的数据效率与最终性能。

Matteo Hessel, Joseph Modayil, Hado van Hasselt, Tom Schaul 等
#181
2017-07-20强化学习与科学cs.LG3.1万原文 ↗

近端策略优化算法(PPO)

Proximal Policy Optimization Algorithms

强化学习最常用算法,也是 ChatGPT 人类反馈微调阶段的核心。

John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford 等
#182
2017-06-12架构与基础cs.CL19.2万原文 ↗

Attention Is All You Need(Transformer)

Attention Is All You Need

抛弃循环结构,纯注意力架构;当代所有大模型的共同底座。

Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit 等
#183
2017-06-07架构与基础cs.SI2.1万原文 ↗

GraphSAGE:大图归纳式表示学习

Inductive Representation Learning on Large Graphs

把图嵌入从直推式变为归纳式,可对训练时未见的新节点直接生成表示。

William L. Hamilton, Rex Ying, Jure Leskovec
#184
2017-04-17开源与效率cs.CV2.6万原文 ↗

MobileNets:移动端轻量视觉网络

MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications

用深度可分离卷积压缩计算量并提供宽度/分辨率缩放,让视觉模型落到移动端。

Andrew G. Howard, Menglong Zhu, Bo Chen, Dmitry Kalenichenko 等
#185
2017-03-30生成建模cs.CV5,598原文 ↗

循环一致性对抗网络(CycleGAN)

Unpaired Image-to-Image Translation using Cycle-Consistent Adversarial Networks

无需成对样本即可完成跨域图像翻译,让无配对数据的风格迁移成为常规操作。

Jun-Yan Zhu, Taesung Park, Phillip Isola, Alexei A. Efros
#186
2017-03-20视觉与多模态cs.CV3.3万原文 ↗

Mask R-CNN:实例分割框架

Mask R-CNN

在Faster R-CNN上并联掩码分支,检测与分割一体化,并可扩展至人体姿态估计。

Kaiming He, Georgia Gkioxari, Piotr Dollár, Ross Girshick
#187
2017-01-26生成建模stat.ML5,206原文 ↗

WGAN:更稳定的生成对抗训练

Wasserstein GAN

以Wasserstein距离替代JS散度,缓解训练不稳与模式崩塌,损失曲线变得可用。

Martin Arjovsky, Soumith Chintala, Léon Bottou
#188
2017-01-23架构与基础cs.LG5,553原文 ↗

稀疏门控混合专家层(MoE)

Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

提出稀疏激活的专家混合,今天万亿参数模型扩参的主流路线。

Noam Shazeer, Azalia Mirhoseini, Krzysztof Maziarz, Andy Davis 等
201610 篇
#189
2016-11-21生成建模cs.CV2.3万原文 ↗

pix2pix:条件对抗图像翻译

Image-to-Image Translation with Conditional Adversarial Networks

把条件GAN做成通用图像到图像翻译框架并自动学损失,开源后被广泛二次开发。

Phillip Isola, Jun-Yan Zhu, Tinghui Zhou, Alexei A. Efros
#190
2016-09-12生成建模cs.SD8,404原文 ↗

WaveNet:原始音频生成模型

WaveNet: A Generative Model for Raw Audio

自回归直接建模原始音频波形,显著提升语音合成自然度,成为音频生成基石。

Aaron van den Oord, Sander Dieleman, Heiga Zen, Karen Simonyan 等
#191
2016-09-09架构与基础cs.LG3.7万原文 ↗

图卷积网络(GCN):半监督分类

Semi-Supervised Classification with Graph Convolutional Networks

以谱图卷积的一阶近似实现图上可扩展卷积,推动图神经网络成为通用工具。

Thomas N. Kipf, Max Welling
#192
2016-08-25架构与基础cs.CV4.5万原文 ↗

密集连接卷积网络(DenseNet)

Densely Connected Convolutional Networks

将每层与所有前层直接相连,缓解梯度消失并复用特征,成深层网络主流设计。

Gao Huang, Zhuang Liu, Laurens van der Maaten, Kilian Q. Weinberger
#193
2016-07-21架构与基础stat.ML1.3万原文 ↗

层归一化(LayerNorm)

Layer Normalization

Transformer 中无处不在的归一化方式,稳定训练的关键组件。

Jimmy Lei Ba, Jamie Ryan Kiros, Geoffrey E. Hinton
#194
2016-06-21对齐与安全cs.AI3,438原文 ↗

人工智能安全中的具体问题

Concrete Problems in AI Safety

把 AI 安全从哲学讨论拉进工程议程,定义了此后十余年的安全问题清单。

Dario Amodei, Chris Olah, Jacob Steinhardt, Paul Christiano 等
#195
2016-05-27生成建模cs.LG4,593原文 ↗

Real NVP:可逆变换密度估计

Density estimation using Real NVP

用可逆仿射耦合层实现精确似然与采样,为流模型(normalizing flow)奠基。

Laurent Dinh, Jascha Sohl-Dickstein, Samy Bengio
#196
2016-02-17架构与基础cs.LG2.7万原文 ↗

从去中心化数据做高效学习(联邦学习)

Communication-Efficient Learning of Deep Networks from Decentralized Data

联邦学习开山之作,数据不出本地即可联合建模。

H. Brendan McMahan, Eider Moore, Daniel Ramage, Seth Hampson 等
#197
2016-02-04强化学习与科学cs.LG1.0万原文 ↗

异步深度强化学习方法(A3C)

Asynchronous Methods for Deep Reinforcement Learning

用多线程异步actor-learner并行训练,单机CPU上即可超越当时的GPU基线。

Volodymyr Mnih, Adrià Puigdomènech Badia, Mehdi Mirza, Alex Graves 等
#198
2016-01-28强化学习与科学Nature 529, 484–489引用待补原文 ↗

用深度神经网络与树搜索掌握围棋(AlphaGo)

Mastering the game of Go with deep neural networks and tree search

击败人类职业棋手,成为公众认知中 AI 能力的拐点。

David Silver, Aja Huang, Demis Hassabis, 等DeepMind
20159 篇
#199
2015-12-10架构与基础cs.CV23.8万原文 ↗

深度残差学习(ResNet)

Deep Residual Learning for Image Recognition

残差连接让上百层网络可训练,是 Transformer 等一切现代架构的必备组件。

Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun
#200
2015-11-19生成建模cs.LG1.5万原文 ↗

深度卷积生成对抗网络(DCGAN)

Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks

为GAN加入卷积架构约束与训练技巧,首次让无监督图像生成稳定且可复用特征。

Alec Radford, Luke Metz, Soumith Chintala
#201
2015-08-31架构与基础cs.CL9,001原文 ↗

用子词单元做稀有词神经机器翻译(BPE)

Neural Machine Translation of Rare Words with Subword Units

提出子词切分,解决未登录词;今天所有大模型分词器的根基。

Rico Sennrich, Barry Haddow, Alexandra Birch
#202
2015-06-08视觉与多模态cs.CV4.8万原文 ↗

你只需看一次(YOLO):实时检测

You Only Look Once: Unified, Real-Time Object Detection

把目标检测重构为单次回归问题,一次前向即输出框与类别,开创实时检测路线。

Joseph Redmon, Santosh Divvala, Ross Girshick, Ali Farhadi
#203
2015-06-04视觉与多模态cs.CV7.5万原文 ↗

Faster R-CNN:实时目标检测

Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks

提出共享特征的区域提议网络,把候选框生成并入网络,检测走向端到端实时。

Shaoqing Ren, Kaiming He, Ross Girshick, Jian Sun
#204
2015-05-28强化学习与科学Nature 521, 436–444引用待补原文 ↗

深度学习(综述)

Deep learning

三位图灵奖得主联袂综述,深度学习从此有了公认的教科书式阐述。

Yann LeCun, Yoshua Bengio, Geoffrey HintonFacebook AI / 蒙特利尔大学 / 多伦多大学
#205
2015-05-18架构与基础cs.CV10.1万原文 ↗

U-Net:生物医学图像分割网络

U-Net: Convolutional Networks for Biomedical Image Segmentation

编码-解码加跳连的结构,后来成为扩散模型去噪网络的标准骨架。

Olaf Ronneberger, Philipp Fischer, Thomas Brox
#206
2015-02-19强化学习与科学cs.LG8,271原文 ↗

信赖域策略优化(TRPO)

Trust Region Policy Optimization

用信赖域约束保证策略单调改进,为深度强化学习的稳定训练提供理论基础。

John Schulman, Sergey Levine, Philipp Moritz, Michael I. Jordan 等
#207
2015-02-11架构与基础cs.LG4.8万原文 ↗

批归一化(BatchNorm)

Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift

让超深网络可以稳定训练,训练速度提升十余倍。

Sergey Ioffe, Christian Szegedy
20147 篇
#208
2014-12-22架构与基础cs.LG17.1万原文 ↗

Adam:一种随机优化方法

Adam: A Method for Stochastic Optimization

至今仍是深度学习默认优化器,引用量位居全领域前列。

Diederik P. Kingma, Jimmy Ba
#209
2014-11-14视觉与多模态cs.CV4.3万原文 ↗

全卷积网络(FCN):语义分割

Fully Convolutional Networks for Semantic Segmentation

首次将分类网络改造为端到端全卷积结构,实现任意尺寸输入的像素级密集预测。

Jonathan Long, Evan Shelhamer, Trevor Darrell
#210
2014-09-17架构与基础cs.CV4.8万原文 ↗

Going Deeper with Convolutions(GoogLeNet)

Going Deeper with Convolutions

提出 Inception 模块,开创模块化网络设计。

Christian Szegedy, Wei Liu, Yangqing Jia, Pierre Sermanet 等
#211
2014-09-10架构与基础cs.CL2.2万原文 ↗

用神经网络做序列到序列学习(Seq2Seq)

Sequence to Sequence Learning with Neural Networks

确立编码器-解码器范式,机器翻译的转折点。

Ilya Sutskever, Oriol Vinyals, Quoc V. Le
#212
2014-09-04架构与基础cs.CV11.4万原文 ↗

用于大规模图像识别的超深卷积网络(VGG)

Very Deep Convolutional Networks for Large-Scale Image Recognition

用 3×3 小卷积堆到 19 层,证明「深度」本身就是能力。

Karen Simonyan, Andrew Zisserman
#213
2014-09-01架构与基础cs.CL3.0万原文 ↗

联合学习对齐与翻译(注意力机制)

Neural Machine Translation by Jointly Learning to Align and Translate

首次引入注意力机制,是 Transformer 的直系祖先。

Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio
#214
2014-06-10生成建模stat.ML6,813原文 ↗

生成对抗网络(GAN)

Generative Adversarial Networks

生成器与判别器博弈,开创对抗式生成范式,也让深度伪造成为现实问题。

Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu 等
20133 篇
#215
2013-12-20生成建模stat.ML1.7万原文 ↗

自编码变分贝叶斯(VAE)

Auto-Encoding Variational Bayes

给生成模型一个可训练的概率框架,与 GAN 并列为生成建模两大流派。

Diederik P Kingma, Max Welling
#216
2013-12-19强化学习与科学cs.LG1.4万原文 ↗

用深度强化学习玩 Atari(DQN)

Playing Atari with Deep Reinforcement Learning

直接从像素学会打游戏,深度强化学习由此引爆。

Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Alex Graves 等
#217
2013-01-16预训练与规模cs.CL3.5万原文 ↗

词向量的高效估计(Word2Vec)

Efficient Estimation of Word Representations in Vector Space

把词变成可运算的向量,「国王-男人+女人=女王」让语义第一次可被算术。

Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean
20122 篇
#218
2012-12-03视觉与多模态NeurIPS 2012引用待补原文 ↗

ImageNet 分类与深度卷积网络(AlexNet)

ImageNet Classification with Deep Convolutional Neural Networks

深度卷积网络横扫 ImageNet,深度学习复兴的引爆点。

Alex Krizhevsky, Ilya Sutskever, Geoffrey E. HintonUniversity of Toronto
#219
2012-07-03架构与基础cs.NE8,071原文 ↗

Dropout:阻止特征共适应的正则化

Improving neural networks by preventing co-adaptation of feature detectors

随机失活神经元,成为深度学习防过拟合的标配,几乎写进每一代网络。

Geoffrey E. Hinton, Nitish Srivastava, Alex Krizhevsky, Ilya Sutskever 等