跳到正文

第 L5 层

行业脉络 I:历史

这一层

为什么值得学

历史是这一层里唯一稳定的东西——前沿是流,观点有到期日,而「三次浪潮各赌了什么、撞在哪里」十年内不会变。它值两样东西。一是面试里的「为什么」:为什么是 Transformer 而不是 LSTM、为什么 RLHF 而不是直接微调——答案都是上一波撞的墙。二是判断前沿的坐标系:新论文、新模型出来,先问它在哪一波、针对哪堵墙、有没有前例;有了坐标,流就冲不走你。

三次浪潮:赌注与转折

符号与专家系统(1943–1997) 赌智能是对符号的搜索和推理,知识由人写成规则。它兑现过(DENDRAL、XCON、Deep Blue),撞在两堵墙上:组合爆炸让搜索出不了玩具世界,常识手写不完也维护不动;两次寒冬(1974、1987)是经费对这两堵墙的反应。转折点是 1986 年反向传播让多层网络可训,被《Perceptrons》压了十七年的路线复活。

统计学习与深度学习(1986–2016) 赌知识和表示都能从数据里学。关键问题是「为什么 2012 年才爆发」:算法 1989 年就在读邮编,差的是 ImageNet 级数据、GPU 算力和几个训练技巧同时到位。AlexNet 之后四年视觉、翻译、游戏逐个被拿下,AlphaGo 是高潮,2014 年的注意力机制是下一波的种子。

scaling 与 LLM(2017–今) 赌同一骨架加更多算力能换来可预测的能力增长。Transformer 让训练完全并行,scaling laws 让投入可算,GPT-3 兑现提示即编程,RLHF 把它变成 ChatGPT,LLaMA 开放权重,o1/R1 加上推理期算力。它还没撞墙,但基准饱和、数据耗尽、算力成本三堵墙已经看得见。

怎么用时间线和实体图谱

timeline 是骨架:五十个里程碑,每个一句「解决了什么、推翻了什么」+ 一手来源。按浪潮读,每读完一波合上文件复述赌注和撞墙原因,复述不出来就回去。entities/ 是血肉:论文讲它推翻了谁(edges 里的 推翻 / 延伸),人物只讲在哪个节点上重要,基准讲「衡量什么、何时饱和」——饱和速度本身就是三次浪潮的温度计(ImageNet 八年、GLUE 一年、SWE-bench 一年)。在 Obsidian 里从任一实体打开图谱视图,顺着边走两步,就是在读一段历史。

推荐前十

按阅读顺序;每条链到下面的节点。

  1. 1

    Artificial Intelligence: A Modern Approach (4th ed.), ch. 1 paid

    三十页把每次路线更替讲成「谁押了什么、为什么输」 → AI 历史:怎么读三次浪潮

  2. 2

    Between the Booms: AI in Winter free

    寒冬为什么发生、「寒冬」这个词怎么被建构 → 第一次浪潮:符号与专家系统

  3. 3
  4. 4
  5. 5
  6. 6

    Deep learning free

    三位当事人的自我总结,「深度学习为什么有效」的标准结构 → 第二次浪潮:统计学习与深度学习

  7. 7

    AlphaGo - The Movie free

    第二波的高潮,从一行描述变成能复述的故事 → 第二次浪潮:统计学习与深度学习

  8. 8

    [1hr Talk] Intro to Large Language Models free

    预训练、对齐、scaling 一小时讲成因果链 → 第三次浪潮:scaling 与 LLM

节点

AI 历史:怎么读三次浪潮

半衰期: 稳定

ai-historyai-history-deep-learningai-history-symbolic没有先修

AI 的七十多年可以压成三次浪潮,每次都是一个赌注、一段兑现、一堵墙:符号与专家系统赌智能可以手写成规则,撞在组合爆炸和常识瓶颈上;统计学习与深度学习赌知识和表示都能从数据里学,兑现在 2012 年数据、GPU、技巧三样凑齐的那一刻;scaling 与 LLM赌同一骨架加更多算力能换来可预测的能力增长,还在兑现,墙在基准饱和、数据耗尽和算力成本那边。学它是为了面试里的「为什么」(为什么是 Transformer、为什么 RLHF)和判断前沿的坐标系——新东西出来,先问它在哪一波、针对哪堵墙。里程碑在 timeline,三波各一个节点:第一次浪潮:符号与专家系统 · 第二次浪潮:统计学习与深度学习 · 第三次浪潮:scaling 与 LLM;讲解稿在 atlas。

之后
第二次浪潮:统计学习与深度学习 · 第一次浪潮:符号与专家系统
  • Artificial Intelligence: A Modern Approach (4th ed.), ch. 1 paid

    book · 第 1 章约 2 小时 · only ch. 1 — 第 1 章用三十页把 1943 到 2020 的每一次路线更替讲成「谁押了什么、为什么输」,而且是符号派当事人写的,对第一次浪潮的内部逻辑讲得最公平;读完能按年代说出三次浪潮各自的赌注,是本层完成标准的第一句。

  • The Quest for Artificial Intelligence: A History of Ideas and Achievements free

    book · 全书约 560 页,按浪潮挑着读 10 小时 — 唯一一本由第一代研究者亲手写、按时间顺序覆盖 1950–2008 的完整史,作者把 PDF 免费放在自己的 Stanford 主页上;第一次浪潮的每个系统(DENDRAL、SHRDLU、专家系统产业)在这里有一手细节,补 AIMA 第 1 章讲不下的「它当时怎么工作、为什么停」。

复现项目: 用自己的话重画三次浪潮 — 不看时间线,从记忆里写出三次浪潮各自的赌注、撞墙原因和三个关键突破各解决了什么;再对照 timeline.md 标出写错和漏掉的,错处就是下一次复习的重点。

落选 (4)
  • Sutton《The Bitter Lesson》 — 作者站只有 http,站点只链 https;读本里仍以一句话概括它的论点,原文自己去搜。
  • Michael Wooldridge《A Brief History of AI》(2021) — 覆盖面和 AIMA 第 1 章重合,又是付费书,一个节点只留一条 paid。
  • Cade Metz《Genius Makers》(2021) — 叙事好但只讲第二波的人物,HN 评论提及仅 8 次,背书不够;放到深度学习节点的落选里再议。
  • Pamela McCorduck《Machines Who Think》(1979/2004) — 第一波最好的口述史,但绝版付费、HN 提及 9 次,没找到课程大纲引用。

第一次浪潮:符号与专家系统

半衰期: 稳定

ai-historyai-history-symbolic

1956 年 Dartmouth 的赌注是「智能的每个方面都能精确描述到让机器模拟」,具体做法是搜索和逻辑推理,后来加上手写的领域知识(专家系统)。它兑现过:Samuel 的跳棋、DENDRAL、XCON 都真的工作过,Deep Blue 是这条路的最高点。它撞的墙有两堵——搜索出不了玩具世界(组合爆炸,Lighthill 报告的核心论据),以及常识太多太隐性、手写不完也维护不动(知识获取瓶颈,Cyc 是最长的证明)。两次寒冬(1974、1987)都是经费对这两堵墙的反应。今天的 agent 工具调用、规划和知识图谱是它留下的遗产,只是不再是主角。里程碑见 timeline,关键人物 John McCarthy、Marvin Minsky、Edward Feigenbaum、Douglas Lenat。

先修
AI 历史:怎么读三次浪潮
  • Between the Booms: AI in Winter free

    article · 30 分钟 — 计算史学者写的 AI 寒冬:为什么 1970 年代和 1980 年代末经费两次断掉、专家系统产业怎么从省钱神话变成维护噩梦、「寒冬」这个词本身怎么被事后建构出来。读完能把第一次浪潮的两次撞墙讲成有因果的故事而不是两个年份。

  • Cyc: Obituary for the greatest monument to logical AGI free

    article · 2–3 小时(长文) — 用 Cyc 四十年的兴衰把符号派的赌注讲到底:手写常识为什么写不完、为什么越写越脆、Lenat 怎么一路从 AM、EURISKO 走到 Cyc 又为什么没人接班。它是「知识获取瓶颈」这个抽象名词最具体的一次解剖,读完能说清第一次浪潮推翻在哪里。

复现项目: 拆一个专家系统 — 读 MYCIN 书里任意一章的规则样例,用一百条以内的规则写一个小诊断程序,然后给它三个边界外的病例,记录它怎么坏——这就是知识获取瓶颈的手感。

落选 (3)
  • 1973 年 Lighthill 辩论录像(BBC)与其整理稿仓库 — 一手史料,但 HN 64 分、仓库 37 star,背书不到线。
  • Buchanan & Shortliffe《Rule — Based Expert Systems: The MYCIN Experiments》(1984,作者免费在线)— 专家系统的一手技术细节,HN 92 分差一点;作为项目的素材而不是精选。
  • Pamela McCorduck《Machines Who Think》 — 见 AI 历史:怎么读三次浪潮 落选。

第二次浪潮:统计学习与深度学习

半衰期: 稳定

ai-historyai-history-deep-learningai-history-scaling

赌注从「手写知识」换成「从数据学」:先是概率和统计学习(贝叶斯网络、SVM、统计机器翻译)替代逻辑,然后是神经网络连特征也不手工设计。反向传播 1986 年就有,但深度学习要到 2012 年才爆发,因为差的不是算法而是三样东西同时到位——ImageNet 级别的标注数据、GPU 带来的便宜并行算力、以及让深网训得动的一把小技巧。AlexNet 把它们凑齐后四年,视觉(ResNet)、语音、翻译(seq2seq + 注意力)、游戏(DQN、AlphaGo)逐个被拿下,而 2014 年的注意力机制已经是下一波的种子。里程碑见 timeline;关键人物 Geoffrey Hinton、Yann LeCun、Yoshua Bengio、Fei-Fei Li;关键论文 Learning representations by back-propagating errors、ImageNet Classification with Deep Convolutional Neural Networks、Deep Residual Learning for Image Recognition、Mastering the game of Go with deep neural networks and tree search。

先修
AI 历史:怎么读三次浪潮
之后
第三次浪潮:scaling 与 LLM
  • Deep Neural Nets: 33 years ago and 33 years from now free

    article · 30 分钟 — 把 LeCun 1989 年的邮编识别网络用 PyTorch 原样复现,再逐个加上这三十年的改进(Adam、数据增广、dropout……)看各自值多少;它用实验回答了「为什么深度学习到 2012 年才爆发」——算法早就有,差的是数据和算力。

  • AlphaGo - The Movie free

    video · 90 分钟 — 第二次浪潮的高潮以纪录片的形式保存下来:第 37 手为什么震惊棋手、李世石的第 4 局怎么赢回一盘、DeepMind 团队赛前到底有多没底。它让「深度学习 + 搜索 + 自我对弈」从一行描述变成能复述的故事。

  • Deep learning free

    paper · 1.5 小时 — 三位当事人在 AlexNet 三年后写的综述:为什么学出来的表示赢过手工特征、卷积和循环网络各解决什么、他们当时以为下一步是无监督学习(后来以预训练的形式兑现)。它是第二次浪潮由主角写下的自我总结,面试里讲「深度学习为什么有效」可以直接用它的结构。

复现项目: 复现 1989 — 照 Karpathy 的文章跑通 1989 年的网络,然后只改一样东西(数据量 ×10,或换 Adam,或加数据增广),画出每次改动的测试误差;得到的那张图就是「2012 年为什么爆发」的个人版证据。

落选 (3)
  • Cade Metz《Genius Makers》(2021) — 这一波最好读的人物史(Hinton 拍卖、DeepMind 收购),但付费且 HN 评论提及仅 8 次,背书不到线。
  • Terrence Sejnowski《The Deep Learning Revolution》(2018) — 当事人视角,但 HN 零讨论,付费。
  • Hinton 2024 年诺贝尔演讲 — 好的口述史,但没有可引的社区背书数字。

第三次浪潮:scaling 与 LLM

半衰期: 稳定

ai-history-deep-learningtransformerai-history-scaling

赌注是「同一个骨架 + 更多数据和算力 = 可预测的能力增长」,一个通用预训练模型替代所有任务专用模型。scaling 能成为主题有三个前提:Transformer 去掉循环后训练完全并行,算力再多也用得上;GPU 云把算力变成可买的商品;scaling laws 让「再砸十倍」从信仰变成可算的账。GPT-3 兑现了提示即编程,InstructGPT 加上对齐让它变成 ChatGPT,Chinchilla 改写配方,LLaMA 把前沿模型开放出去,o1 和 DeepSeek-R1 又加了「推理期算力」这条新轴。它还没撞墙,但三堵墙已经看得见:基准饱和、高质量数据耗尽、算力成本。里程碑见 timeline;关键论文 Attention Is All You Need、Scaling Laws for Neural Language Models、Language Models are Few-Shot Learners、Training language models to follow instructions with human feedback、Training Compute-Optimal Large Language Models、LLaMA: Open and Efficient Foundation Language Models、DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning;Transformer 本身在 Transformer,后训练在 后训练:用奖励塑形。

先修
第二次浪潮:统计学习与深度学习 · Transformer
  • [1hr Talk] Intro to Large Language Models free

    video · 60 分钟 — 一小时讲清第三次浪潮的三件事:预训练是把互联网压缩进权重、微调和 RLHF 是让它变成助手、scaling laws 为什么让所有人都在买 GPU;最后一段的「LLM 操作系统」正是 agent 一波的预告。看完能把 scaling 说成一个有因果的故事。

复现项目: 在小模型上验证一条 scaling law — 用 nanoGPT 在同一语料上训 4 个大小的模型(参数 ×2 递增),固定 token 数,画 loss–参数量的 log-log 图;再把 token 数也翻倍做一组,看斜率怎么变——这是 Kaplan 和 Chinchilla 两篇论文的手工版。

落选 (4)
  • Ilya Sutskever 的 NeurIPS 2024 时间检验奖演讲(「预训练时代会结束」) — YouTube 上只有非官方转载(seremot 频道),站点只嵌作者自己发布的视频;等官方上传再收。
  • Gwern《The Scaling Hypothesis》(2020) — scaling 信仰最早最长的辩护词,但 HN 97 分(2022-05-30)差三分;146 分那篇是别人的转述。
  • Karpathy《Deep Dive into LLMs like ChatGPT》(2025,HN 582 分) — 更好更长,但内容是 L2 的「LLM 怎么工作」,不是历史;留给 LLM:模型怎么工作。
  • Kaplan 等《Scaling Laws for Neural Language Models》 — 一手论文已是实体 Scaling Laws for Neural Language Models,不再占精选名额。

完成标准自测

  • 不看资料,能用三句话说出三次浪潮各自的赌注,和每一波撞墙(或正在逼近的墙)是什么。
  • 给出反向传播、AlexNet、Transformer、InstructGPT 四个里程碑,能各说一句「它解决了什么、推翻了什么」。
  • 能解释「为什么深度学习到 2012 年才爆发」和「为什么 scaling 是第三波的主题」,各给至少两个具体原因。
  • 拿到一篇本周的新论文或发布,能把它放进某一波、指出它针对哪堵墙,并说出一个前例。

作者的笔记原稿。