跳到正文

AI 历史时间线

三次浪潮、五十个里程碑:每一波押什么、撞上什么墙、留下什么。每一行都标出来源和取证日。

第一次浪潮:符号与专家系统(1943–1997)

这一波的赌注是:智能 = 对符号做搜索和推理,知识可以由人写成规则交给机器。它两次撞墙,都撞在同一堵墙上——组合爆炸让搜索出不了玩具世界,常识太多、太隐性,手写不完(知识获取瓶颈)。1973 年 Lighthill 报告和 1974 年 DARPA 削减是第一次寒冬,1987 年 Lisp 机市场崩盘和专家系统维护成本的暴露是第二次。它留下的东西没有消失:搜索、规划、知识表示今天都还在 agent 的工具箱里,只是不再是主角。

  1. 1943

    McCulloch & Pitts 的神经元模型 — 把神经元写成阈值逻辑单元,证明它们连成的网络能算任何逻辑函数;「大脑」和「计算」第一次进了同一套数学,神经网络和符号逻辑两条路都从这里分出去。

    A Logical Calculus of the Ideas Immanent in Nervous Activity来源 · 取证 2026-10-08

  2. 1950

    Turing《Computing Machinery and Intelligence》— 把没法回答的「机器能不能思考」换成可操作的模仿游戏,并预言会学习的机器。

    Computing Machinery and Intelligence来源 · 取证 2026-10-08

  3. 1956

    Dartmouth 夏季研讨会 — 给领域起名 artificial intelligence,提案的赌注是「智能的每个方面原则上都能精确描述到让机器模拟」。

    John McCarthy来源 · 取证 2026-10-08

  4. 1958

    Rosenblatt 感知机 — 权重从样本里学出来并有收敛证明,还做成了硬件;第一个学习分类器,连接主义的起点。

    The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain来源 · 取证 2026-10-08

  5. 1959

    Samuel 跳棋程序 — 靠自我对弈调整评估函数,水平超过作者;「machine learning」一词由此而来。

    Arthur Samuel来源 · 取证 2026-10-08

  6. 1965–1976

    DENDRAL → MYCIN — 化学家和医生的规则替代通用搜索,诊断水平比肩专家:领域知识比推理算法重要,知识工程方法论从这里来;MYCIN 从未临床使用(责任与集成问题)。

    Edward Feigenbaum来源 · 取证 2026-10-08

  7. 1966

    ELIZA — 模式匹配制造出「被理解」的幻觉,连作者都被用户的投入吓到;「看起来懂」和「真的懂」的距离第一次被看见。

    Joseph Weizenbaum来源 · 取证 2026-10-08

  8. 1969

    Minsky & Papert《Perceptrons》— 证明单层感知机连 XOR 都表示不了,多层又没人会训;经费转向符号派,神经网络沉寂十余年。

    Perceptrons: An Introduction to Computational Geometry来源 · 取证 2026-10-08

  9. 1970–1972

    SHRDLU — 积木世界里的自然语言理解,符号派的巅峰演示,也显出这条路出不了玩具世界。

    Terry Winograd来源 · 取证 2026-10-08

  10. 1973–1974

    Lighthill 报告与 DARPA 削减 — 英国官方判定 AI 没兑现承诺(组合爆炸是核心论据),美国同步收缩经费:第一次寒冬。

    DARPA来源 · 取证 2026-10-08

  11. 1980

    XCON / R1(DEC)— 配置 VAX 订单的专家系统第一次大规模省钱,引爆 1980 年代的专家系统产业。

    Carnegie Mellon University来源 · 取证 2026-10-08

  12. 1984

    Cyc 启动 — Lenat 押注手工编码全部常识,一做近四十年;符号派最彻底的实验,它的结局是「知识为什么不能手写」的最好教材。

    Douglas Lenat来源 · 取证 2026-10-08

  13. 1987

    Lisp 机市场崩盘,第二次寒冬 — 专用硬件被通用工作站替代,专家系统的维护成本和脆弱性暴露;同期日本第五代计算机计划(1982–1992)也未达目标。第一次浪潮:符号与专家系统

    来源 · 取证 2026-10-08

  14. 1997

    Deep Blue 击败 Kasparov — 搜索 + 专用硬件 + 手工评估函数赢了国际象棋:证明窄域暴力可行,也是符号搜索路线的谢幕高峰。

    IBM Research来源 · 取证 2026-10-08

第二次浪潮:统计学习与深度学习(1986–2016)

赌注换了:知识不手写,从数据里学;逻辑让位给概率;特征也不手工设计,让网络自己学表示。反向传播 1986 年就有了,为什么深度学习到 2012 年才爆发?因为缺的不是算法,是三样同时到位的东西——百万级标注数据(ImageNet,2009)、便宜的并行算力(GPU + CUDA,2007 起)、以及让深网训得动的小技巧(ReLU、dropout、好的初始化)。2012 年 AlexNet 把这三样凑齐,接下来四年视觉、语音、翻译、游戏逐个被拿下。

  1. 1986

    反向传播(Rumelhart, Hinton, Williams)— 多层网络可以按误差训练,隐藏层自己学出表示;回答了《Perceptrons》留下的问题,连接主义复活。

    Learning representations by back-propagating errors来源 · 取证 2026-10-08

  2. 1988

    Pearl《Probabilistic Reasoning in Intelligent Systems》— 贝叶斯网络让不确定推理可计算,概率重回 AI 主流。

    Judea Pearl来源 · 取证 2026-10-08

  3. 1989 / 1998

    LeCun 的卷积网络:邮编识别 → LeNet-5 — 把先验写进网络结构(局部感受野、权值共享)而不是写进规则,端到端梯度训练做成能读支票的系统;MNIST 成为标准数据集。

    Gradient-Based Learning Applied to Document Recognition来源 · 取证 2026-10-08

  4. 1995

    SVM(Cortes & Vapnik)— 最大间隔 + 核技巧,有泛化理论背书的分类器,统治 2000 年代。

    Support-Vector Networks来源 · 取证 2026-10-08

  5. 1997

    LSTM — 门控单元解决梯度消失,循环网络能记住长距离;2010 年代语音与翻译的主力。

    Long Short-Term Memory来源 · 取证 2026-10-08

  6. 2003

    神经概率语言模型(Bengio)— 每个词学一个连续向量,神经网络预测下一个词;n-gram 的稀疏问题被绕开,词向量与 LLM 的共同祖先。

    A Neural Probabilistic Language Model来源 · 取证 2026-10-08

  7. 2006

    深度信念网络(Hinton)— 逐层预训练让深网可训,「deep learning」成为一个词并重新吸引经费。

    A fast learning algorithm for deep belief nets来源 · 取证 2026-10-08

  8. 2009

    ImageNet — 千万级人工标注图片,赌注是数据规模而非算法;2012 年的爆发在它上面发生。

    ImageNet来源 · 取证 2026-10-08

  9. 2012

    AlexNet — 两块 GPU 训练的深度卷积网把 ImageNet 错误率一下拉开十个点,手工特征 + SVM 的老路被淘汰;深度学习的爆发点。

    ImageNet Classification with Deep Convolutional Neural Networks来源 · 取证 2026-10-08

  10. 2013

    word2vec — 浅层模型在十亿词上学词向量,向量算术显出语义结构;「先无监督预训练表示」成为 NLP 常规。

    Efficient Estimation of Word Representations in Vector Space来源 · 取证 2026-10-08

  11. 2013

    DQN — 卷积网直接从像素学 Atari,一套超参玩几十个游戏;深度学习与强化学习合流。

    Playing Atari with Deep Reinforcement Learning来源 · 取证 2026-10-08

  12. 2014

    GAN — 生成器与判别器对抗训练,不写似然也能生成;深度生成模型支线的起点。

    Generative Adversarial Nets来源 · 取证 2026-10-08

  13. 2014

    seq2seq — 编码器-解码器 LSTM 端到端做翻译,取代 1990 年代 IBM 的统计翻译;暴露了定长向量瓶颈。

    Sequence to Sequence Learning with Neural Networks来源 · 取证 2026-10-08

  14. 2014

    注意力机制(Bahdanau, Cho, Bengio)— 解码时回头给源句每个位置加权,解决长句掉分;Transformer 的直接前身。

    Neural Machine Translation by Jointly Learning to Align and Translate来源 · 取证 2026-10-08

  15. 2015

    ResNet — 残差连接让百层网络可训,ImageNet 上超过人类;残差从此是所有深网的标配。

    Deep Residual Learning for Image Recognition来源 · 取证 2026-10-08

  16. 2016

    AlphaGo 击败李世石 — 深度网络 + 树搜索 + 自我对弈(这条线从 1992 年 TD-Gammon 的西洋双陆棋就开始了),围棋被认为还要十年;深度学习的公众形象从「识图」变成「会决策」。

    Mastering the game of Go with deep neural networks and tree search来源 · 取证 2026-10-08

第三次浪潮:scaling 与 LLM(2017–2026)

赌注是:同一个骨架(Transformer)+ 更多数据和算力 = 可预测的能力增长,一个通用预训练模型替代所有任务专用模型。scaling 成为主题有三个原因:Transformer 去掉了循环,训练可以完全并行,算力再多也用得上;GPU 云让算力变成可以买的商品;scaling laws 把「再砸十倍」从信仰变成可算的账。2022 年之后又加了两条轴——对齐(RLHF/DPO 决定模型「听不听话」)和推理期算力(o1/R1 让模型「想多久」也能换能力)。这一波还没撞墙,但基准饱和、数据耗尽和算力成本是它正在逼近的三堵墙。

  1. 2017

    Transformer — 去掉循环,只留注意力,训练完全并行;此后所有大模型的骨架。

    Attention Is All You Need来源 · 取证 2026-10-08

  2. 2017

    从人类偏好学强化学习(Christiano 等)— 用两两比较训奖励模型,人只看不足百分之一 的交互;RLHF 的原型,同年 AlphaZero 证明零人类棋谱也能通吃三种棋。

    Deep Reinforcement Learning from Human Preferences来源 · 取证 2026-10-08

  3. 2018

    ELMo / GPT-1 / BERT — 预训练 + 微调成为 NLP 的默认范式,BERT 一年内把 GLUE 推过人类基线。

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding来源 · 取证 2026-10-08

  4. 2019

    GPT-2 — 放大十倍、不微调就能做多种任务:「任务是顺带学会的」;分阶段公开权重让发布安全第一次成为议题。

    Language Models are Unsupervised Multitask Learners来源 · 取证 2026-10-08

  5. 2019

    The Bitter Lesson — Sutton 用七十年的教训说:写进去的人类知识短期有效,长期都输给算力驱动的通用方法;scaling 一波的信条。

    The Bitter Lesson来源 · 取证 2026-10-08

  6. 2020

    Scaling Laws(Kaplan 等)— 损失随参数、数据、算力各呈幂律,跨七个数量级成立;投入变得可预测。

    Scaling Laws for Neural Language Models来源 · 取证 2026-10-08

  7. 2020

    GPT-3 — 1750 亿参数,不更新权重、只靠提示里的几个例子做新任务;「提示」成为编程方式,LLM 创业潮围绕它的 API 展开。

    Language Models are Few-Shot Learners来源 · 取证 2026-10-08

  8. 2020–2022

    ViT · DDPM · CLIP · Stable Diffusion — Transformer 进入视觉,扩散模型可用,图文进同一向量空间,潜空间扩散让文生图跑在消费级显卡上并开放权重;GAN 退场。

    Learning Transferable Visual Models From Natural Language SupervisionHigh-Resolution Image Synthesis with Latent Diffusion Models来源 · 取证 2026-10-08

  9. 2021

    AlphaFold 2 — 蛋白质结构预测达到实验精度,五十年难题基本解决;深度学习进入科学发现。

    Highly accurate protein structure prediction with AlphaFold来源 · 取证 2026-10-08

  10. 2022

    思维链提示 — 让模型先写推理步骤再作答,大模型才有效;引发「涌现能力」争论,两年后推理模型把它从提示搬进训练。

    Chain-of-Thought Prompting Elicits Reasoning in Large Language Models来源 · 取证 2026-10-08

  11. 2022

    InstructGPT 与 Constitutional AI — SFT + 奖励模型 + PPO 让 13 亿模型比 1750 亿更受偏好,ChatGPT 的配方;Anthropic 同年用写成文字的原则 + AI 反馈替代部分人工标注。

    Training language models to follow instructions with human feedbackConstitutional AI: Harmlessness from AI Feedback来源 · 取证 2026-10-08

  12. 2022

    Chinchilla — 参数与 token 应同比例扩,此前的大模型普遍训练不足;改写 scaling 配方,「小模型多喂数据」成主流。

    Training Compute-Optimal Large Language Models来源 · 取证 2026-10-08

  13. 2022-11

    ChatGPT — 两个月一亿用户,AI 从论文变成消费产品和产业议题;第三次浪潮的公众起点。

    OpenAI来源 · 取证 2026-10-08

  14. 2023

    LLaMA · Llama 2 · Mistral 7B — 开放权重的前沿级模型:llama.cpp、量化、本地推理整条生态由此长出,欧洲的 Mistral 证明小模型 + 好数据能打败更大的模型。

    LLaMA: Open and Efficient Foundation Language ModelsMistral AI来源 · 取证 2026-10-08

  15. 2023

    GPT-4 — 多模态、专业考试前 10%,报告明说不公开架构与数据;前沿实验室从「发论文」转向「发产品」的分水岭。

    GPT-4 Technical Report来源 · 取证 2026-10-08

  16. 2023

    DPO — 奖励模型和 PPO 合成一个分类损失,几十行代码做偏好对齐;对齐从大实验室工程变成开源日常。

    Direct Preference Optimization: Your Language Model is Secretly a Reward Model来源 · 取证 2026-10-08

  17. 2024

    o1 与 MCP — 用强化学习训练长思维链,「想多久」成为新的 scaling 轴(推理期算力);同年 11 月的 Model Context Protocol 让模型接工具的协议开始标准化,推理与工具是 agent 时代的两块基石。第三次浪潮:scaling 与 LLM MCP:给每个系统一个统一的插口

    来源 · 取证 2026-10-08

  18. 2024

    诺贝尔物理学奖(Hopfield, Hinton)与化学奖(Hassabis, Jumper, Baker)— 主流科学界对神经网络和 AlphaFold 的正式承认。

    Geoffrey HintonDemis Hassabis来源 · 取证 2026-10-08

  19. 2025-01

    DeepSeek-R1 — 纯强化学习激发推理,权重开放、成本公开;推理模型不是某一家的秘密,算力叙事第一次被打折。

    DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning来源 · 取证 2026-10-08

  20. 2026

    基准饱和成为瓶颈 — Stanford AI Index 2026:SWE-bench Verified 一年内从约 60% 升到接近 100%,工业界产出超过 90% 的重要模型;评测本身跟不上模型,ARC-AGI 转向交互环境。

    SWE-benchARC-AGI来源 · 取证 2026-10-08

实验室与公司

时间线里出现的机构;在本站招聘数据里的,链到它的公司页。

Amazon

1994所在层L6

Applied Scientist 岗位的主要雇主之一;它把自己的招聘流程和 Leadership Principles 公开写成了页面,是行为面准备的一手材料。

关联
行为面与价值观轮 (制定)
来源
官方 How we hire:申请 → 测评 → 电话筛 → 面试环,Bar Raiser 与 Leadership Principles 挂在同一处 (取证 2026-10-08)

Anthropic

2021所在层L6L5L4招聘数据

前沿实验室,Claude 的作者;对职业这一层重要的是它把候选人使用 AI 的政策写成了公开页面,招聘页本身就是最好的准备材料。

在历史这一层它代表「对齐作为核心研究方向」的那一支:2021 年从 OpenAI 分出,Constitutional AI: Harmlessness from AI Feedback 用一组写下来的原则代替大部分人工偏好标注,让模型自己批评和改写自己的回答。Claude 系列之外,它发布的 MCP:给每个系统一个统一的插口 协议把「模型接工具」变成了行业标准。观点与预测里 Dario Amodei 的长文是前沿那一层最常被引的判断。

关联
Constitutional AI: Harmlessness from AI Feedback (发布) · MCP:给每个系统一个统一的插口 (发布) · 行为面与价值观轮 (制定)
反向链接
Dario Amodei (任职于) · Jack Clark (任职于) · Jared Kaplan (任职于) · Constitutional AI: Harmlessness from AI Feedback (发布) · Anthropic 博客(news · engineering · research) (发布)
来源
官方招聘页:不要求学位,建议把独立研究 / 博客 / 开源放简历最上面 (取证 2026-10-08) · 候选人 AI 使用政策,页面标注最后更新 2025-07-10 (取证 2026-10-08)

Bell Labs

1925所在层L5

1990 年代 LeCun 的卷积网和 Vapnik 的 SVM 在同一栋楼里竞争——第二次浪潮的两条路线(神经网络 vs 统计学习)在这里同场。

关联
Yann LeCun (任职于) · Vladimir Vapnik (任职于) · Gradient-Based Learning Applied to Document Recognition (发布) · Support-Vector Networks (发布)
反向链接
Vladimir Vapnik (任职于) · Yann LeCun (任职于) · Gradient-Based Learning Applied to Document Recognition (任职于) · Support-Vector Networks (任职于)
来源
Bell Labs 官网 (取证 2026-10-08)

Carnegie Mellon University

1956所在层L5

Newell 和 Simon 的 Logic Theorist(1956)是第一个 AI 程序;之后的 XCON、语音识别(Sphinx)、自动驾驶(NavLab)都从这里走出来。

关联
第一次浪潮:符号与专家系统 (提出) · 第二次浪潮:统计学习与深度学习 (讨论)
来源
CMU 计算机学院 (取证 2026-10-08)

Cursor

2022所在层L6L4招聘数据

AI 编辑器公司(法人 Anysphere);AI 原生创业公司里招聘最快的一家,招聘页是看「工作样本式」岗位要求的样本。

来源
官方招聘页,只列岗位,不写流程 (取证 2026-10-08)

DARPA

1958所在层L5

1960–70 年代 AI 的主要金主,1974 年的削减是第一次寒冬的美国侧;1980 年代的战略计算计划又推了专家系统一把。读 AI 历史时它是经费曲线的代名词。

关联
第一次浪潮:符号与专家系统 (资助) · 第一次浪潮:符号与专家系统 (讨论)
来源
DARPA 官网 (取证 2026-10-08)

DeepSeek

2023所在层L5

杭州的实验室,由量化基金幻方出资;2025 年 1 月的 R1 以开放权重和公开的低训练成本证明推理模型不是某一家的秘密。

关联
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (发布) · Liang Wenfeng (任职于)
反向链接
Liang Wenfeng (任职于) · DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (发布)
来源
DeepSeek 官网 (取证 2026-10-08)

Epoch AI

2022所在层L5L3

做 AI 趋势数据的非营利研究机构:训练算力、模型规模、芯片成本、数据耗尽时间都有公开数据集。谈 scaling 和算力经济时,数字先去这里核。

关联
Epoch AI 数据中心 (发布) · 预训练与 scaling (衡量) · 算力经济:训练花在哪,推理怎么收费 (讨论)
反向链接
Epoch AI 数据中心 (发布)
来源
官方站 (取证 2026-10-08)

Google

1998所在层L5

Google Brain(2011)把深度学习变成基础设施,Transformer、BERT、TPU 都出自这里;2023 年与 DeepMind 合并成 Google DeepMind 后以 Gemini 参战。

关联
Efficient Estimation of Word Representations in Vector Space (发布) · Sequence to Sequence Learning with Neural Networks (发布) · Attention Is All You Need (发布) · BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (发布) · Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (发布) · Jeff Dean (任职于)
反向链接
Ashish Vaswani (任职于) · Geoffrey Hinton (任职于) · Ian Goodfellow (任职于) · Ilya Sutskever (任职于) · Jeff Dean (任职于) · Noam Shazeer (任职于) · Tomáš Mikolov (任职于) · BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (发布) · Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (发布) · Sequence to Sequence Learning with Neural Networks (发布) · Efficient Estimation of Word Representations in Vector Space (发布)
来源
Google Research 官网 (取证 2026-10-08)

Google DeepMind

2010所在层L6L5L2

Google 的 AI 实验室(DeepMind 2010 年成立,2023 年与 Google Brain 合并);研究岗与研究工程岗的官方招聘页公开。

在历史这一层它是第二次浪潮后半段的旗手:Playing Atari with Deep Reinforcement Learning 让一个网络从像素学会打 Atari,Mastering the game of Go with deep neural networks and tree search 用自我对弈加搜索赢了人类顶尖棋手,Highly accurate protein structure prediction with AlphaFold 把同一套方法用到蛋白质结构上,拿了诺贝尔奖;Training Compute-Optimal Large Language Models 则修正了 scaling 的配方——同样的算力,数据要和参数一起放大。2023 年与 Google Brain 合并后的 Gemini 系列让它回到 LLM 的正面战场。

关联
Playing Atari with Deep Reinforcement Learning (发布) · Mastering the game of Go with deep neural networks and tree search (发布) · Highly accurate protein structure prediction with AlphaFold (发布) · Training Compute-Optimal Large Language Models (发布)
反向链接
Arthur Mensch (任职于) · David Silver (任职于) · Demis Hassabis (任职于) · Highly accurate protein structure prediction with AlphaFold (发布) · Mastering the game of Go with deep neural networks and tree search (发布) · Training Compute-Optimal Large Language Models (发布) · Deep Reinforcement Learning from Human Preferences (发布) · Playing Atari with Deep Reinforcement Learning (发布) · Google DeepMind 博客 (发布)
来源
官方招聘页,给出四段式流程并声明按岗位微调 (取证 2026-10-08) · Google 的 How we hire 页,正文靠脚本渲染 (取证 2026-10-08)

Hugging Face

2016所在层L5

transformers 库和模型中心把预训练模型的分发标准化,开放权重生态的「GitHub」。

关联
Clément Delangue (任职于) · 第三次浪潮:scaling 与 LLM (讨论)
反向链接
Clément Delangue (任职于) · Hugging Face Daily Papers (发布)
来源
Hugging Face 官网 (取证 2026-10-08)

IBM Research

1945所在层L5

Samuel 的跳棋(1959)、Deep Blue(1997)、Watson(2011)、统计机器翻译(1990s)都在这里;三次浪潮里它每次都站在当时主流方法的最高点。

关联
Arthur Samuel (任职于) · 第一次浪潮:符号与专家系统 (讨论)
反向链接
Arthur Samuel (任职于)
来源
IBM 历史页:Deep Blue (取证 2026-10-08)

IDSIA

1988所在层L5

瑞士卢加诺的小实验室,LSTM 的出生地;2011 年前后用 GPU 卷积网赢下多项视觉比赛,比 AlexNet 还早。

关联
Jürgen Schmidhuber (任职于) · Long Short-Term Memory (发布)
反向链接
Jürgen Schmidhuber (任职于)
来源
IDSIA 官网 (取证 2026-10-08)

Meta

2004所在层L6L5

大厂里 AI 岗位最多的雇主之一,FAIR 之外还有超级智能实验室;它的招聘页是看大厂 AI 岗位 title 体系的样本。

来源
官方招聘站;对抓取工具返回 429 / 400,未能核实候选人指南页 (取证 2026-10-08)

Meta AI (FAIR)

2013所在层L5

LeCun 2013 年创建的 FAIR;PyTorch 和 LLaMA 都出自这里,开放权重这条路线的最大推手。

关联
LLaMA: Open and Efficient Foundation Language Models (发布) · Yann LeCun (任职于) · 第三次浪潮:scaling 与 LLM (讨论)
反向链接
Kaiming He (任职于) · Tomáš Mikolov (任职于) · Yann LeCun (任职于) · LLaMA: Open and Efficient Foundation Language Models (发布) · Meta AI 博客 (发布)
来源
Meta AI 官网 (取证 2026-10-08)

Microsoft

1975所在层L5

ResNet 出自微软亚洲研究院;2019 年起向 OpenAI 投资并独家提供算力,Copilot 让代码生成第一次成为大众产品。

关联
Deep Residual Learning for Image Recognition (发布) · OpenAI (资助) · Kaiming He (任职于)
反向链接
Kaiming He (任职于) · Deep Residual Learning for Image Recognition (发布)
来源
Microsoft Research 官网 (取证 2026-10-08)

Mila – Quebec AI Institute

1993所在层L5

Bengio 的实验室,2014 年同一年做出注意力机制和 GAN;加拿大把深度学习养在学术界的三个点(Toronto、Montreal、Edmonton)之一。

关联
Yoshua Bengio (任职于) · Neural Machine Translation by Jointly Learning to Align and Translate (发布) · Generative Adversarial Nets (发布)
反向链接
Ian Goodfellow (任职于) · Yoshua Bengio (任职于) · Neural Machine Translation by Jointly Learning to Align and Translate (任职于)
来源
Mila 官网 (取证 2026-10-08)

Mistral AI

2023所在层L5招聘数据

2023 年在巴黎创办,Mistral 7B 和 Mixtral 证明小模型加好数据能打败更大的模型;欧洲开放权重路线的代表。

关联
Arthur Mensch (任职于) · 第三次浪潮:scaling 与 LLM (讨论)
反向链接
Arthur Mensch (任职于)
来源
Mistral AI 官网 (取证 2026-10-08)

MIT AI Lab / CSAIL

1959所在层L5

Minsky 和 McCarthy 1959 年创建的实验室,符号派的大本营:ELIZA、SHRDLU、Lisp 机都出自这里;2003 年并成 CSAIL。

关联
第一次浪潮:符号与专家系统 (提出) · Perceptrons: An Introduction to Computational Geometry (资助) · Marvin Minsky (任职于)
反向链接
John McCarthy (任职于) · Joseph Weizenbaum (任职于) · Kaiming He (任职于) · Marvin Minsky (任职于) · Terry Winograd (任职于)
来源
CSAIL 官网 (取证 2026-10-08)

NVIDIA

1993所在层L5

CUDA(2007)让 GPU 变成通用计算设备,AlexNet 之后它就是深度学习的物理底座;第三次浪潮的算力经济围绕它的供货周期转。

关联
Jensen Huang (任职于) · 第三次浪潮:scaling 与 LLM (讨论)
反向链接
Jensen Huang (任职于)
来源
NVIDIA 研究页 (取证 2026-10-08)

OpenAI

2015所在层L6L5招聘数据

前沿实验室,GPT 系列的作者;研究工程岗是它招聘的主力,官方面试指南公开。

在历史这一层它是第三次浪潮的主角:Improving Language Understanding by Generative Pre-Training 到 Language Models are Few-Shot Learners 证明了「同一个目标、放大十倍」这条路能一直走,Scaling Laws for Neural Language Models 把这件事写成公式,Training language models to follow instructions with human feedback 让续写机器学会听指令,ChatGPT 则把它交到所有人手里。之后的 GPT-4 Technical Report 不再公开结构,标志着研究从论文转向产品。节点见 第三次浪潮:scaling 与 LLM、预训练与 scaling。

关联
Improving Language Understanding by Generative Pre-Training (发布) · Language Models are Unsupervised Multitask Learners (发布) · Language Models are Few-Shot Learners (发布) · GPT-4 Technical Report (发布) · Training language models to follow instructions with human feedback (发布) · Scaling Laws for Neural Language Models (发布) · Learning Transferable Visual Models From Natural Language Supervision (发布)
反向链接
Alec Radford (任职于) · Andrej Karpathy (任职于) · Daniel Kokotajlo (任职于) · Dario Amodei (任职于) · Ilya Sutskever (任职于) · Jared Kaplan (任职于) · Paul Christiano (任职于) · Sam Altman (任职于) · Learning Transferable Visual Models From Natural Language Supervision (发布) · Deep Reinforcement Learning from Human Preferences (发布) · Improving Language Understanding by Generative Pre-Training (发布) · Language Models are Unsupervised Multitask Learners (发布) · Language Models are Few-Shot Learners (发布) · GPT-4 Technical Report (发布) · Training language models to follow instructions with human feedback (发布) · Scaling Laws for Neural Language Models (发布) · Microsoft (资助) · OpenAI 博客 (发布)
来源
官方面试指南;抓取工具得到 403,搜索索引确认页面存在(含多语种版本) (取证 2026-10-08)

Stanford AI Lab (SAIL)

1963所在层L5

McCarthy 1963 年创建;专家系统(DENDRAL、MYCIN)在这里诞生,四十年后 ImageNet 和 DPO 也出自这里,三次浪潮都有它。

关联
第一次浪潮:符号与专家系统 (提出) · Direct Preference Optimization: Your Language Model is Secretly a Reward Model (发布) · ImageNet (提出)
反向链接
Andrew Ng (任职于) · Edward Feigenbaum (任职于) · Fei-Fei Li (任职于) · John McCarthy (任职于) · Terry Winograd (任职于) · Direct Preference Optimization: Your Language Model is Secretly a Reward Model (发布)
来源
SAIL 官网 (取证 2026-10-08)

University of Toronto

1827所在层L5

Hinton 的实验室所在地,深度学习在寒冬里被保温的地方:深度信念网络(2006)和 AlexNet(2012)都在这里做出来。

关联
Geoffrey Hinton (任职于) · ImageNet Classification with Deep Convolutional Neural Networks (发布) · A fast learning algorithm for deep belief nets (发布)
反向链接
Alex Krizhevsky (任职于) · Geoffrey Hinton (任职于) · A fast learning algorithm for deep belief nets (任职于)
来源
多伦多大学计算机系 (取证 2026-10-08)

基准

这个领域拿什么衡量自己,以及每个基准什么时候不再难。

MNIST

1998所在层L5L2

衡量什么:7 万张手写数字的 10 类分类,第二次浪潮的「Hello World」。何时饱和:2010 年代初错误率已低于 0.3%,接近标注噪声;现在只用来做教学和 sanity check。

关联
经典机器学习:从样本里学 (衡量) · Yann LeCun (提出) · Gradient-Based Learning Applied to Document Recognition (讨论)
反向链接
Gradient-Based Learning Applied to Document Recognition (衡量)
来源
MNIST 条目(LeCun 原站已不稳定) (取证 2026-10-08)

ImageNet

2009所在层L5L2

衡量什么:1000 类、百万级图片分类(ILSVRC)。何时饱和:2012 年 AlexNet 把 top-5 错误率拉到 15%,2015 年 ResNet 低于人类的约 5%,2017 年挑战赛停办。它是「数据集驱动突破」的原型。

关联
经典机器学习:从样本里学 (衡量) · Fei-Fei Li (提出) · ImageNet Classification with Deep Convolutional Neural Networks (讨论) · Deep Residual Learning for Image Recognition (讨论)
反向链接
Fei-Fei Li (提出) · ImageNet Classification with Deep Convolutional Neural Networks (衡量) · Deep Residual Learning for Image Recognition (衡量) · Stanford AI Lab (SAIL) (提出)
来源
ILSVRC 挑战赛页(2010–2017) (取证 2026-10-08)

SQuAD

2016所在层L5L2

衡量什么:从维基段落里抽取答案的阅读理解。何时饱和:2018 年 BERT 超过人类 EM/F1,2.0 版加入「无答案」问题后 2019 年也被超过。阅读理解自此不再是独立的基准。

关联
LLM:模型怎么工作 (衡量) · BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (讨论)
反向链接
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (衡量)
来源
官网排行榜 (取证 2026-10-08)

GLUE / SuperGLUE

2018所在层L5L2

衡量什么:九个句子级 NLP 任务的平均分。何时饱和:2018 年发布,BERT 一年内把它推过人类基线,2019 年换成更难的 SuperGLUE,2021 年 SuperGLUE 也被超过。预训练模型时代的第一个「一年饱和」案例。

关联
LLM:模型怎么工作 (衡量) · BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (讨论)
反向链接
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (衡量)
来源
SuperGLUE 论文(2019)说明 GLUE 已被超过人类基线 (取证 2026-10-08)

ARC-AGI

2019所在层L5L2

衡量什么:从几个例子里归纳规则的网格谜题,专门设计成「背不下来」。何时饱和:2019 年版在 2024 年底被推理模型以高算力攻破,2025 年换 ARC-AGI-2,2026 年前沿模型已过 90%,ARC-AGI-3 转向交互式环境。它是「泛化 vs 记忆」争论的靶场。

关联
LLM:模型怎么工作 (衡量) · Evals:知道它有没有变好 (衡量) · 第三次浪潮:scaling 与 LLM (讨论)
来源
ARC Prize 官网:ARC-AGI-2(2025)页 (取证 2026-10-08)

MMLU

2020所在层L5L2

衡量什么:57 个学科的多选题,从小学数学到职业法律。何时饱和:GPT-4(2023)86%,2024 年前沿模型挤在 88–90% 且题目有错,MMLU-Pro 为此出现。它是 LLM 时代「知识」一轴的标尺,饱和了四年。

关联
LLM:模型怎么工作 (衡量) · GPT-4 Technical Report (讨论)
反向链接
GPT-4 Technical Report (衡量)
来源
MMLU-Pro 论文(2024)称 MMLU 性能已趋平台 (取证 2026-10-08)

GSM8K

2021所在层L5L2

衡量什么:8.5k 道小学应用题,考多步算术推理。何时饱和:思维链提示在它上面第一次显出威力(2022),2024 年前沿模型超过 95%,之后换成 MATH、AIME 等竞赛题。

关联
LLM:模型怎么工作 (衡量) · Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (讨论)
反向链接
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (衡量)
来源
论文页(OpenAI,2021) (取证 2026-10-08)

HumanEval

2021所在层L5L2

衡量什么:164 道手写 Python 函数题,按单元测试通过率算。何时饱和:Codex 发布时 28.8%,GPT-4(2023)67%,2024 年前沿模型超过 90%。代码能力的第一把尺,之后由 SWE-bench 接棒。

关联
LLM:模型怎么工作 (衡量) · GPT-4 Technical Report (讨论)
反向链接
GPT-4 Technical Report (衡量)
来源
Codex 论文页(2021) (取证 2026-10-08)

SWE-bench

2023所在层L5L2

衡量什么:真实 GitHub issue,模型要在仓库里改代码并通过测试——第一个 agent 级基准。何时饱和:2024 年 Verified 子集约 50%,2025 年 70–80%,AI Index 2026 报告它已接近 100%,且训练数据污染让分数不再可信。

关联
Agent:循环里带工具的模型 (衡量) · LLM:模型怎么工作 (衡量) · 第三次浪潮:scaling 与 LLM (讨论)
来源
官网排行榜;AI Index 2026 称 Verified 一年内从约 60% 升至接近 100% (取证 2026-10-08)

作者的笔记原稿。