跳到正文

论文与会议期刊

知识图谱反复回到的论文,按年份排:每篇解决了什么、推翻或延伸了什么、发表在哪里。

论文

按年份。

A Logical Calculus of the Ideas Immanent in Nervous Activity

1943所在层L1L5

把神经元抽象成只会「达到阈值就点火」的逻辑单元,并证明这种单元连成的网络能表达任何命题逻辑。它第一次把「大脑在做什么」和「计算机能算什么」放进同一套数学里,神经网络和符号逻辑两条路都从这里分出去。

关联
Warren McCulloch (提出) · The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain (延伸) · 第一次浪潮:符号与专家系统 (讨论)
反向链接
Warren McCulloch (提出) · The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain (推翻)
来源
《数学生物物理学通报》第 5 卷,1943 年 (取证 2026-10-08)

Computing Machinery and Intelligence

1950所在层L5

把「机器能不能思考」这个没法回答的问题换成一个可以操作的测验:如果在文字对话里分不出机器和人,就别再纠结定义。文末还预言了会学习的机器——那时候连第一台学习程序都没有。

关联
Alan Turing (提出) · 第一次浪潮:符号与专家系统 (讨论) · Nature (发表于)
反向链接
Alan Turing (提出)
来源
Mind LIX(236), 1950 (取证 2026-10-08)

The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain

1958所在层L1L5

McCulloch–Pitts 的单元权重是人定的,感知机让权重从样本里学出来,并给出收敛证明;还做成了硬件。它是第一个真正意义上的学习分类器,也是十年后被《Perceptrons》打压的对象。

关联
Frank Rosenblatt (提出) · 经典机器学习:从样本里学 (解决) · A Logical Calculus of the Ideas Immanent in Nervous Activity (推翻)
反向链接
Frank Rosenblatt (提出) · A Logical Calculus of the Ideas Immanent in Nervous Activity (延伸) · Perceptrons: An Introduction to Computational Geometry (推翻)
来源
Psychological Review 65(6), 1958,宾大课程镜像 (取证 2026-10-08)

Perceptrons: An Introduction to Computational Geometry

1969所在层L1L5

用数学证明单层感知机连 XOR 这样的简单函数都表示不了,多层怎么训又没人知道。这本书把经费和人才推向符号派,神经网络研究沉寂了十几年;直到反向传播普及,它的论证才被绕过去。

关联
Marvin Minsky (提出) · The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain (推翻) · 第一次浪潮:符号与专家系统 (讨论)
反向链接
Marvin Minsky (提出) · Learning representations by back-propagating errors (推翻) · MIT AI Lab / CSAIL (资助)
来源
MIT Press 书页 (取证 2026-10-08)

Learning representations by back-propagating errors

1986所在层L1L5

把链式法则用到多层网络上,让隐藏层的权重也能按误差调整,并演示隐藏层会自己学出有用的内部表示。它回答了《Perceptrons》留下的「多层怎么训」,是第二次浪潮的技术起点。

关联
Geoffrey Hinton (提出) · 数学:用到时再补 (解决) · Perceptrons: An Introduction to Computational Geometry (推翻) · Nature (发表于)
反向链接
Geoffrey Hinton (提出) · Nature (发布)
来源
Nature 323, 1986 (取证 2026-10-08)

Support-Vector Networks

1995所在层L1L5

把分类问题变成找最大间隔超平面,再用核技巧把线性方法带进高维特征空间,而且有泛化理论背书。它是 2000 年代最可靠的分类器,深度学习要到 2012 年才在大规模视觉任务上明确压过它。

关联
Vladimir Vapnik (提出) · 经典机器学习:从样本里学 (解决) · Bell Labs (任职于)
反向链接
Vladimir Vapnik (提出) · ImageNet Classification with Deep Convolutional Neural Networks (推翻) · Bell Labs (发布)
来源
《Machine Learning》第 20 卷,1995 年 (取证 2026-10-08)

Long Short-Term Memory

1997所在层L1L5

循环网络沿时间反传时梯度会消失或爆炸,远处的信息学不到。LSTM 用门控单元给信息开一条可以稳定流过很多步的通道,2010 年代的语音识别和神经翻译几乎都靠它;Transformer 出现前它就是序列建模的默认答案。

关联
Sepp Hochreiter (提出) · Jürgen Schmidhuber (提出) · Transformer (解决)
反向链接
Jürgen Schmidhuber (提出) · Sepp Hochreiter (提出) · IDSIA (发布)
来源
《神经计算》第 9 卷第 8 期,1997 年 (取证 2026-10-08)

Gradient-Based Learning Applied to Document Recognition

1998所在层L1L5

卷积 + 池化 + 梯度训练做成一整套端到端的手写识别系统,并真的部署去读支票。它证明了把先验写进网络结构(局部感受野、权值共享)而不是写进规则是可行的,AlexNet 只是它的放大版。

关联
Yann LeCun (提出) · 经典机器学习:从样本里学 (解决) · MNIST (衡量) · Bell Labs (任职于)
反向链接
Yann LeCun (提出) · Bell Labs (发布) · MNIST (讨论)
来源
《IEEE 汇刊》(Proceedings of the IEEE)第 86 卷第 11 期,1998 年 (取证 2026-10-08)

A Neural Probabilistic Language Model

2003所在层L2L5

n-gram 语言模型的症结是词与词之间没有相似性,没见过的组合概率为零。这篇论文让每个词学一个连续向量,再用神经网络预测下一个词,相似的词自动共享统计量。词向量和今天的 LLM 预训练目标都从这里来。

关联
Yoshua Bengio (提出) · Embedding:把意思变成向量 (解决) · Efficient Estimation of Word Representations in Vector Space (延伸) · JMLR (发表于)
反向链接
Yoshua Bengio (提出) · JMLR (发布)
来源
JMLR 3, 2003 (取证 2026-10-08)

A fast learning algorithm for deep belief nets

2006所在层L1L5

多层网络在 2000 年代被认为训不动。这篇论文用逐层无监督预训练给深网一个好的起点,再整体微调,证明「深」是可以训的。它让「deep learning」成为一个词,也重新把资金引回神经网络;后来大家发现有了 ReLU、GPU 和大数据,预训练这一步反而可以省掉。

关联
Geoffrey Hinton (提出) · ImageNet Classification with Deep Convolutional Neural Networks (延伸) · University of Toronto (任职于)
反向链接
Geoffrey Hinton (提出) · University of Toronto (发布)
来源
《神经计算》(Neural Computation)第 18 卷第 7 期,2006 年 (取证 2026-10-08)

ImageNet Classification with Deep Convolutional Neural Networks

2012所在层L1L5

两块消费级 GPU 上训练的深度卷积网络,在 ImageNet 挑战赛上把错误率一下拉开十个百分点,第二名还是手工特征加 SVM 的老路。它是深度学习爆发的那一刻:方法早就有,数据集和 GPU 是 2012 年才凑齐的两样东西。

关联
Alex Krizhevsky (提出) · Ilya Sutskever (提出) · Geoffrey Hinton (提出) · ImageNet (衡量) · NeurIPS (发表于) · Support-Vector Networks (推翻)
反向链接
Alex Krizhevsky (提出) · Geoffrey Hinton (提出) · Ilya Sutskever (提出) · A fast learning algorithm for deep belief nets (延伸) · NeurIPS (发布) · University of Toronto (发布) · ImageNet (讨论)
来源
NeurIPS 2012 论文页 (取证 2026-10-08)

Playing Atari with Deep Reinforcement Learning

2013所在层L2L5

卷积网络直接读屏幕像素、输出动作价值,用同一套网络和超参玩几十个 Atari 游戏。它把深度学习和强化学习接在一起,也是 DeepMind 被 Google 收购前最有说服力的演示。

关联
David Silver (提出) · Google DeepMind (发布) · 后训练:用奖励塑形 (解决) · Mastering the game of Go with deep neural networks and tree search (延伸)
反向链接
David Silver (提出) · Mastering the game of Go with deep neural networks and tree search (延伸) · Google DeepMind (发布)
来源
arXiv 1312.5602,2013年12月19日 (取证 2026-10-08)

Efficient Estimation of Word Representations in Vector Space

2013所在层L2L5

把语言模型砍到只剩一个浅层预测任务,换来能在十亿词上训练词向量,而且向量减法能做出「国王 − 男 + 女 ≈ 女王」这种类比。它让「先在无标注语料上预训练表示」成为 NLP 的常规操作,是 BERT 之前最重要的一次预训练。

关联
Tomáš Mikolov (提出) · Embedding:把意思变成向量 (解决) · Google (发布) · ICLR (发表于)
反向链接
Tomáš Mikolov (提出) · A Neural Probabilistic Language Model (延伸) · ICLR (发布) · Google (发布)
来源
arXiv 1301.3781,2013-01-16 首版 (取证 2026-10-08)

Generative Adversarial Nets

2014所在层L1L5

让一个生成器和一个判别器互相对抗训练,不用显式写出似然函数也能学会生成逼真样本。它开启了深度生成模型的一整条支线(图像合成、风格迁移、deepfake),直到扩散模型在 2021 年后把它替下来。

关联
Ian Goodfellow (提出) · Yoshua Bengio (提出) · NeurIPS (发表于) · High-Resolution Image Synthesis with Latent Diffusion Models (延伸)
反向链接
Ian Goodfellow (提出) · Yoshua Bengio (提出) · High-Resolution Image Synthesis with Latent Diffusion Models (推翻) · NeurIPS (发布) · Mila – Quebec AI Institute (发布)
来源
arXiv 1406.2661,2014 年 6 月 10 日 (取证 2026-10-08)

Sequence to Sequence Learning with Neural Networks

2014所在层L2L5

用一个 LSTM 把整句话压成向量,另一个 LSTM 从向量解出译文,端到端训练,不要词对齐、不要语法规则。它让神经机器翻译从论文变成可以上线的系统,也暴露了「一个定长向量装不下长句」的瓶颈,注意力机制就是为这个瓶颈发明的。

关联
Ilya Sutskever (提出) · Google (发布) · NeurIPS (发表于) · Neural Machine Translation by Jointly Learning to Align and Translate (延伸)
反向链接
Ilya Sutskever (提出) · Neural Machine Translation by Jointly Learning to Align and Translate (解决) · NeurIPS (发布) · Google (发布)
来源
arXiv 1409.3215,2014年9月10日 (取证 2026-10-08)

Neural Machine Translation by Jointly Learning to Align and Translate

2014所在层L2L5

解码每个词时不再只看一个压缩向量,而是回头给源句每个位置打一个权重再加权求和——这就是注意力。它解决了 seq2seq 在长句上掉分的问题,三年后 Transformer 把「只留注意力」推到极端。

关联
Yoshua Bengio (提出) · Sequence to Sequence Learning with Neural Networks (解决) · Attention Is All You Need (延伸) · ICLR (发表于) · Mila – Quebec AI Institute (任职于)
反向链接
Yoshua Bengio (提出) · Attention Is All You Need (推翻) · Sequence to Sequence Learning with Neural Networks (延伸) · ICLR (发布) · Mila – Quebec AI Institute (发布)
来源
arXiv 1409.0473,2014 年 9 月 1 日 (取证 2026-10-08)

Deep learning

2015所在层L1L5

三位后来的图灵奖得主在 AlexNet 三年后写的综述:为什么逐层学表示会赢过手工特征,卷积、循环网络各自解决什么,以及无监督学习会是下一步。它是第二次浪潮由当事人写下的自我总结。

关联
Yann LeCun (提出) · Yoshua Bengio (提出) · Geoffrey Hinton (提出) · Nature (发表于) · 第二次浪潮:统计学习与深度学习 (讨论)
反向链接
Yann LeCun (提出) · Nature (发布)
来源
Nature 521, 2015-05-27;OpenAlex 2026-10-08 被引 85,418 (取证 2026-10-08)

Deep Residual Learning for Image Recognition

2015所在层L1L5

网络一深就训不好,不是过拟合,是优化不动。残差连接让每一层学「相对上一层的修正」,一百多层照样收敛,ImageNet 上第一次超过人类标注员。残差连接从此成为所有深网的标配,Transformer 的每个块里都有它。

关联
Kaiming He (提出) · Microsoft (发布) · ImageNet (衡量) · CVPR (发表于) · Transformer (解决)
反向链接
Kaiming He (提出) · CVPR (发布) · Microsoft (发布) · ImageNet (讨论)
来源
arXiv 1512.03385,发表于 2015-12-10 (取证 2026-10-08)

Mastering the game of Go with deep neural networks and tree search

2016所在层L2L5

策略网络和价值网络给蒙特卡洛树搜索剪枝,再用自我对弈强化学习把网络越训越强,2016 年 3 月以 4:1 击败李世石。围棋当时被认为还要十年,它把深度学习的公众形象从「识图」变成「会决策」。

关联
David Silver (提出) · Demis Hassabis (提出) · Google DeepMind (发布) · Nature (发表于) · 后训练:用奖励塑形 (解决) · Playing Atari with Deep Reinforcement Learning (延伸)
反向链接
David Silver (提出) · Demis Hassabis (提出) · Playing Atari with Deep Reinforcement Learning (延伸) · The Bitter Lesson (延伸) · Nature (发布) · Google DeepMind (发布)
来源
Nature 第 529 卷,2016-01-27 (取证 2026-10-08)

Attention Is All You Need

2017所在层L2L5

把当时序列到序列模型里的循环和卷积全部拿掉,只留注意力,换来训练可以完全并行;机器翻译上以更少的训练时间刷新了成绩。它是第三次浪潮的起点:之后的 GPT、BERT、ViT 都是这个骨架的变体。节点见 Transformer。

关联
Transformer (解决) · Ashish Vaswani (提出) · NeurIPS (发表于) · Neural Machine Translation by Jointly Learning to Align and Translate (推翻)
反向链接
Ashish Vaswani (提出) · Noam Shazeer (提出) · Highly accurate protein structure prediction with AlphaFold (延伸) · BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (延伸) · Neural Machine Translation by Jointly Learning to Align and Translate (延伸) · NeurIPS (发布) · Google (发布)
来源
arXiv 1706.03762,2017-06-12 首版 (取证 2026-10-08)

Deep Reinforcement Learning from Human Preferences

2017所在层L2L5

很多任务写不出奖励函数,但人能比较两段行为哪个更好。这篇论文用这种两两比较训练一个奖励模型,再用它做强化学习,人只需要看不足百分之一 的交互。它就是 RLHF 的原型,五年后被原样搬到语言模型上成了 InstructGPT。

关联
Paul Christiano (提出) · OpenAI (发布) · Google DeepMind (发布) · NeurIPS (发表于) · Training language models to follow instructions with human feedback (延伸) · 后训练:用奖励塑形 (解决)
反向链接
Paul Christiano (提出) · Training language models to follow instructions with human feedback (延伸)
来源
arXiv 1706.03741,2017年6月12日 (取证 2026-10-08)

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

2018所在层L2L5

用「遮住一些词再猜」的目标训练双向 Transformer 编码器,微调后横扫 GLUE 和 SQuAD。它让预训练模型成为 NLP 每个任务的默认起点,也把 GLUE 这类基准在一年内推到人类水平之上。

关联
Google (发布) · GLUE / SuperGLUE (衡量) · SQuAD (衡量) · ACL (发表于) · LLM:模型怎么工作 (解决) · Attention Is All You Need (延伸)
反向链接
ACL (发布) · Google (发布) · GLUE / SuperGLUE (讨论) · SQuAD (讨论)
来源
arxiv.org (取证 2026-10-08)

Improving Language Understanding by Generative Pre-Training

2018所在层L2L5

先在大量无标注文本上训练一个 decoder-only Transformer 做语言模型,再对每个下游任务微调,一套模型在多个 NLP 基准上拿到当时最好成绩。它确立了「生成式预训练 + 微调」这条路线,GPT 系列的名字从这里开始。

关联
Alec Radford (提出) · Ilya Sutskever (提出) · OpenAI (发布) · Language Models are Unsupervised Multitask Learners (延伸) · LLM:模型怎么工作 (解决)
反向链接
Alec Radford (提出) · Ilya Sutskever (提出) · OpenAI (发布)
来源
OpenAI 发布页,2018-06-11 (取证 2026-10-08)

Language Models are Unsupervised Multitask Learners

2019所在层L2L5

把 GPT-1 放大十倍、只在网页文本上训练,不做任何微调就能做摘要、翻译、问答。它第一次显示「只要语言模型够大,任务是顺带学会的」,而分阶段公开权重的做法也让「模型发布的安全」第一次成为公开议题。

关联
Alec Radford (提出) · OpenAI (发布) · Language Models are Few-Shot Learners (延伸) · LLM:模型怎么工作 (解决)
反向链接
Alec Radford (提出) · Improving Language Understanding by Generative Pre-Training (延伸) · OpenAI (发布)
来源
OpenAI 发布页,2019-02-14 (取证 2026-10-08)

The Bitter Lesson

2019所在层L5

七十年的教训:每次把人类知识写进系统,短期有效,长期都输给靠算力堆出来的通用方法——下棋、语音、视觉都是这个剧本。它是三次浪潮最短的注解,也是 scaling 这一波的信条。

关联
Richard Sutton (提出) · AI 历史:怎么读三次浪潮 (讨论) · Scaling Laws for Neural Language Models (延伸) · Mastering the game of Go with deep neural networks and tree search (延伸)
反向链接
Richard Sutton (提出)
来源
UT Austin 课程存档的原文 PDF(作者站 incompleteideas.net 只有 http),原文 2019-03-13 (取证 2026-10-08)

Language Models are Few-Shot Learners

2020所在层L2L5

1750 亿参数,不更新一个权重,只把几个例子写进提示就能完成新任务。它让「提示」成为一种编程方式,也让 scaling laws 第一次在公众面前兑现;之后两年的 LLM 创业潮都是围绕它的 API 长出来的。

关联
OpenAI (发布) · NeurIPS (发表于) · Prompting:能度量的指令 (解决) · Training language models to follow instructions with human feedback (延伸)
反向链接
Language Models are Unsupervised Multitask Learners (延伸) · GPT-4 Technical Report (延伸) · NeurIPS (发布) · OpenAI (发布)
来源
arXiv 2005.14165,2020 年 5 月 28 日 (取证 2026-10-08)

Scaling Laws for Neural Language Models

2020所在层L2L5

语言模型的损失随参数量、数据量、算力各自呈幂律下降,跨七个数量级都成立,而且模型形状几乎不重要。它把「要不要再砸十倍算力」从信仰变成可以算的账,第三次浪潮的投资逻辑建立在这条曲线上。

关联
Jared Kaplan (提出) · Dario Amodei (提出) · OpenAI (发布) · Training Compute-Optimal Large Language Models (延伸) · LLM:模型怎么工作 (解决) · 第三次浪潮:scaling 与 LLM (讨论)
反向链接
Dario Amodei (提出) · Jared Kaplan (提出) · Training Compute-Optimal Large Language Models (推翻) · The Bitter Lesson (延伸) · arXiv (发布) · OpenAI (发布)
来源
arXiv 2001.08361,2020 年 1 月 23 日 (取证 2026-10-08)

Highly accurate protein structure prediction with AlphaFold

2021所在层L5

从氨基酸序列直接预测蛋白质三维结构,精度达到实验测定级别,把一个五十年的生物学难题基本解决。它是深度学习走出语言和图像、进入科学发现的标志,2024 年化学诺贝尔奖给了它。

关联
Demis Hassabis (提出) · Google DeepMind (发布) · Nature (发表于) · Attention Is All You Need (延伸)
反向链接
Demis Hassabis (提出) · Nature (发布) · Google DeepMind (发布)
来源
《自然》第 596 卷,2021 年 7 月 15 日 (取证 2026-10-08)

Learning Transferable Visual Models From Natural Language Supervision

2021所在层L2L5

用四亿对图文做对比学习,让图像和文字进同一个向量空间,不用标注就能零样本分类。它是文生图模型理解文字的那只眼睛,也是多模态模型的通用起点。

关联
Alec Radford (提出) · OpenAI (发布) · ICML (发表于) · High-Resolution Image Synthesis with Latent Diffusion Models (延伸) · Embedding:把意思变成向量 (解决)
反向链接
Alec Radford (提出) · High-Resolution Image Synthesis with Latent Diffusion Models (延伸) · ICML (发布) · OpenAI (发布)
来源
arXiv 2103.00020,2021 年 2 月 26 日 (取证 2026-10-08)

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

2022所在层L4L5

在提示里给几个带推理步骤的例子,大模型做算术和常识推理的成绩会跳一大截,小模型则没用。它把「让模型先想再答」变成一种技术,也引发了「涌现能力」是真是假的争论;两年后的推理模型是把这件事从提示搬进了训练。

关联
Google (发布) · NeurIPS (发表于) · Prompting:能度量的指令 (解决) · GSM8K (衡量) · DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (延伸)
反向链接
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (延伸) · Google (发布) · GSM8K (讨论)
来源
arXiv 2201.11903,2022年1月28日 (取证 2026-10-08)

Training Compute-Optimal Large Language Models

2022所在层L2L5

同样的算力下,参数和训练 token 应该同比例增加,此前的大模型普遍数据喂得太少。700 亿参数的 Chinchilla 用四倍数据打败了 2800 亿的 Gopher。它改写了 scaling 的配方,LLaMA 之后「小模型喂更多数据」成了主流。

关联
Google DeepMind (发布) · Scaling Laws for Neural Language Models (推翻) · NeurIPS (发表于) · LLaMA: Open and Efficient Foundation Language Models (延伸) · LLM:模型怎么工作 (解决)
反向链接
LLaMA: Open and Efficient Foundation Language Models (延伸) · Scaling Laws for Neural Language Models (延伸) · Google DeepMind (发布)
来源
arXiv 2203.15556,2022 年 3 月 29 日 (取证 2026-10-08)

Constitutional AI: Harmlessness from AI Feedback

2022所在层L2L5

用一组写成文字的原则让模型自己批评并修改回答,再用 AI 给出的偏好替代大部分人类无害性标注。它减少了对人工标注的依赖,也让「模型按什么价值观对齐」第一次变成可以读的文档。

关联
Anthropic (发布) · Training language models to follow instructions with human feedback (延伸) · 后训练:用奖励塑形 (解决)
反向链接
Anthropic (发布)
来源
arXiv 2212.08073,2022 年 12 月 15 日 (取证 2026-10-08)

Training language models to follow instructions with human feedback

2022所在层L2L5

预训练模型只会续写,不会听话。先用示范做监督微调,再用人类偏好训奖励模型、用 PPO 优化,13 亿参数的结果比 1750 亿的原版更受标注员喜欢。这套三步配方就是 ChatGPT 的底子,也是后来所有「对齐」工作的参照物。

关联
Paul Christiano (提出) · OpenAI (发布) · 后训练:用奖励塑形 (解决) · Deep Reinforcement Learning from Human Preferences (延伸) · Direct Preference Optimization: Your Language Model is Secretly a Reward Model (延伸) · NeurIPS (发表于)
反向链接
Paul Christiano (提出) · Constitutional AI: Harmlessness from AI Feedback (延伸) · Deep Reinforcement Learning from Human Preferences (延伸) · Direct Preference Optimization: Your Language Model is Secretly a Reward Model (推翻) · Language Models are Few-Shot Learners (延伸) · OpenAI (发布)
来源
arXiv 2203.02155,2022年3月4日 (取证 2026-10-08)

High-Resolution Image Synthesis with Latent Diffusion Models

2022所在层L2L5

把扩散过程从像素空间搬到压缩后的潜空间,训练和生成的开销降一个数量级,消费级显卡也能跑。开放权重的 Stable Diffusion 就是它,图像生成从此不再只属于有算力的公司。

关联
CVPR (发表于) · Learning Transferable Visual Models From Natural Language Supervision (延伸) · Generative Adversarial Nets (推翻) · 第三次浪潮:scaling 与 LLM (讨论)
反向链接
Learning Transferable Visual Models From Natural Language Supervision (延伸) · Generative Adversarial Nets (延伸) · CVPR (发布)
来源
arXiv 2112.10752,2021-12-20;Stable Diffusion 2022-08 开放权重 (取证 2026-10-08)

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

2023所在层L2L5

RLHF 的奖励模型和 PPO 两步可以合成一个分类损失,直接在偏好对上做监督训练,效果不差、实现只有几十行。它让偏好对齐从大实验室的工程变成开源社区的日常操作。

关联
Stanford AI Lab (SAIL) (发布) · Training language models to follow instructions with human feedback (推翻) · 后训练:用奖励塑形 (解决) · NeurIPS (发表于)
反向链接
Training language models to follow instructions with human feedback (延伸) · Stanford AI Lab (SAIL) (发布)
来源
arXiv 2305.18290,2023 年 5 月 29 日 (取证 2026-10-08)

GPT-4 Technical Report

2023所在层L2L5

多模态输入、在律师资格考等专业考试上到前 10%,并且报告里明说不公开参数量、架构和数据。它既是能力的台阶,也是前沿实验室从「发论文」转向「发产品」的分水岭;「技术报告」从此替代了论文。

关联
OpenAI (发布) · MMLU (衡量) · HumanEval (衡量) · Language Models are Few-Shot Learners (延伸) · 第三次浪潮:scaling 与 LLM (讨论)
反向链接
OpenAI (发布) · HumanEval (讨论) · MMLU (讨论)
来源
arXiv 2303.08774,2023 年 3 月 15 日 (取证 2026-10-08)

LLaMA: Open and Efficient Foundation Language Models

2023所在层L2L5

只用公开数据、按 Chinchilla 的思路把小模型训得更久,130 亿参数在多数基准上超过 GPT-3。权重一周内泄露、半年后 Llama 2 正式开放商用,llama.cpp、量化、本地推理这整条开源生态是从它长出来的。

关联
Meta AI (FAIR) (发布) · Training Compute-Optimal Large Language Models (延伸) · LLM:模型怎么工作 (解决) · 第三次浪潮:scaling 与 LLM (讨论)
反向链接
Training Compute-Optimal Large Language Models (延伸) · arXiv (发布) · Meta AI (FAIR) (发布)
来源
arXiv 2302.13971,2023-02-27;Llama 2 见 arXiv 2307.09288 (取证 2026-10-08)

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

2025所在层L2L5

只靠可验证奖励的强化学习,不给示范,模型自己长出长思维链和自我检查;权重开放、训练成本公开。它证明 o1 式的推理模型不是某一家的秘密,也把「推理期算力」这条新的 scaling 轴交到了开源社区手里。

关联
DeepSeek (发布) · Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (延伸) · 后训练:用奖励塑形 (解决) · 第三次浪潮:scaling 与 LLM (讨论) · Nature (发表于)
反向链接
Liang Wenfeng (提出) · Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (延伸) · DeepSeek (发布)
来源
arXiv 2501.12948,2025年1月22日发布 (取证 2026-10-08)

会议与期刊

上面的论文发表在哪里。

ACL

1962所在层L5

计算语言学协会的年会,NLP 的本家会议;BERT 在它的北美分会 NAACL 发表。LLM 之后它的议题被 NeurIPS/ICLR 大量吸走。

关联
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (发布) · 第二次浪潮:统计学习与深度学习 (讨论)
反向链接
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (发表于)
来源
官网 (取证 2026-10-08)

arXiv

1991所在层L5

第三次浪潮的真正发表渠道:论文先上 arXiv 再投会议,GPT-2 之后前沿实验室的「技术报告」很多根本不投会议。时间线上的「首版日期」指的是它。

关联
Scaling Laws for Neural Language Models (发布) · LLaMA: Open and Efficient Foundation Language Models (发布) · 第三次浪潮:scaling 与 LLM (讨论)
来源
官网 (取证 2026-10-08)

CVPR

1983所在层L5

计算机视觉的头号会议;ResNet 和潜空间扩散模型在这里发表。2012–2016 年视觉是深度学习的主战场,看它的论文就是看那几年的历史。

关联
Deep Residual Learning for Image Recognition (发布) · High-Resolution Image Synthesis with Latent Diffusion Models (发布)
反向链接
High-Resolution Image Synthesis with Latent Diffusion Models (发表于) · Deep Residual Learning for Image Recognition (发表于)
来源
官网 (取证 2026-10-08)

ICLR

2013所在层L5

Bengio 和 LeCun 2013 年为「表示学习」专门创办,公开评审;word2vec 和注意力机制是它第一、二届的论文。深度学习时代的会议。

关联
Efficient Estimation of Word Representations in Vector Space (发布) · Neural Machine Translation by Jointly Learning to Align and Translate (发布)
反向链接
Neural Machine Translation by Jointly Learning to Align and Translate (发表于) · Efficient Estimation of Word Representations in Vector Space (发表于)
来源
官网 (取证 2026-10-08)

ICML

1980所在层L5

历史最久的机器学习会议(1980),偏方法与理论;CLIP 在这里发表。

关联
Learning Transferable Visual Models From Natural Language Supervision (发布) · 第二次浪潮:统计学习与深度学习 (讨论)
反向链接
Learning Transferable Visual Models From Natural Language Supervision (发表于)
来源
官网 (取证 2026-10-08)

JMLR

2000所在层L5

2000 年从 Machine Learning 期刊编委集体出走创办的开放获取期刊;Bengio 的神经语言模型(2003)登在这里。

关联
A Neural Probabilistic Language Model (发布)
反向链接
A Neural Probabilistic Language Model (发表于)
来源
官网 (取证 2026-10-08)

Nature

1869所在层L5

AI 进入主流科学的标志性出口:1986 年反向传播、2015 年深度学习综述、2016 年 AlphaGo、2021 年 AlphaFold 都登在这里。

关联
Learning representations by back-propagating errors (发布) · Mastering the game of Go with deep neural networks and tree search (发布) · Highly accurate protein structure prediction with AlphaFold (发布) · Deep learning (发布)
反向链接
Highly accurate protein structure prediction with AlphaFold (发表于) · Mastering the game of Go with deep neural networks and tree search (发表于) · Learning representations by back-propagating errors (发表于) · Deep learning (发表于) · DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (发表于) · Computing Machinery and Intelligence (发表于)
来源
官网 (取证 2026-10-08)

NeurIPS

1987所在层L5

机器学习的头号会议,1987 年起每年 12 月;AlexNet、GAN、seq2seq、Transformer、GPT-3 都在这里发表。看一年的 NeurIPS 论文能猜出两年后的产品。

关联
ImageNet Classification with Deep Convolutional Neural Networks (发布) · Generative Adversarial Nets (发布) · Sequence to Sequence Learning with Neural Networks (发布) · Attention Is All You Need (发布) · Language Models are Few-Shot Learners (发布)
反向链接
ImageNet Classification with Deep Convolutional Neural Networks (发表于) · Attention Is All You Need (发表于) · Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (发表于) · Training Compute-Optimal Large Language Models (发表于) · Deep Reinforcement Learning from Human Preferences (发表于) · Direct Preference Optimization: Your Language Model is Secretly a Reward Model (发表于) · Generative Adversarial Nets (发表于) · Language Models are Few-Shot Learners (发表于) · Training language models to follow instructions with human feedback (发表于) · Sequence to Sequence Learning with Neural Networks (发表于)
来源
官网 (取证 2026-10-08)

作者的笔记原稿。