跳到正文

第 L5 层

前沿:流,不是库

这一层

L5 有三段:历史(稳定)、前沿(流)、观点(带日期)。这页讲后两段,历史在 timeline 和 AI 历史:怎么读三次浪潮 里。

前沿为什么是「流」

前沿的半衰期以周计,几个月后多半被下一个取代。按「库」对待它只会堆出再也不看的链接,还制造「已经学了」的错觉。按「流」对待:订阅少数筛过的来源,固定时间看,看完不留痕,只记改变了自己判断的东西。知识进 nodes/,热度随流走掉。

两档清单怎么用

  • 每周必看:前沿信息流(≤ 5):每周必看,上限五个,覆盖论文、研究与政策、后训练与开源、应用层实测、人物观点五个口子。要加第六个先踢一个。
  • 有事再查:前沿参考清单(≤ 15):有事再查,上限十五个,每个来源对应一类问题(选供应商、查数量级、进新方向、验证发布数字)。不订阅,问题先于来源。
  • 每个来源一个媒体实体(entities/media/):谁办的、立场、何时值得看,边连到它常讨论的节点。

每周时长规则

细则在 每周必看:前沿信息流(≤ 5):每周六上午 75 分钟,顺序固定,播客完整版放通勤;时间到就停,漏掉不补。产出只有一行:写进 opinions 的一条观点,或「本周没有值得记的」。想读的论文只记标题,下周还记得才读。

观点为什么要带日期

「AGI 五到十年」每年都有人说,不带日期就永远不会错。记观点不是收集名言,是一本能回来对答案的账本:谁、哪天、说了什么、何时能验证。所以只收带时间、规模或能力的可证伪断言,claim 用自己的话转述到能判对错的精度,出处带取证日。几年后这页会告诉你该给谁的判断多大权重。

复盘怎么回写

到期在 opinions.md 写 status 和一句 review;结论改变了某个节点的判断就去改该节点,改变了对一个人的看法就在人物实体加一句。周流看到精选过时先记一行,每季度集中改节点。流和库之间只留这一条窄通道。

节点

每周必看:前沿信息流(≤ 5)

半衰期: 流

llmfrontier-weekly

前沿是「流」不是「库」:订阅、固定时长看、看完不收藏。这张表是每周必看的全部;其他来源都在 有事再查:前沿参考清单(≤ 15),有事再查。五个来源分别覆盖论文(HF)、研究与政策(Import AI)、后训练与开源(Interconnects)、应用层实测(Simon Willison)、人物观点(Dwarkesh)。

来源 形态 节奏 为什么是它 怎么看
Hugging Face Daily Papers 论文源 每日,周看一次 社区点赞过滤后的 arXiv,接替 Papers with Code 当「最近什么热」入口 只看标题和赞数,10 分钟;想读的记一行标题,不点开
Import AI newsletter 每周一期 每条附「为什么重要」,研究 + 政策两个视角,作者在一线实验室 看每段粗体结论,20 分钟;最多点开一篇原文
Interconnects newsletter 每周一两期 后训练与开源模型的一线分析,发布日的独立判断 看全文,20 分钟;发布周优先看它而不是新闻稿
Simon Willison's Weblog 实践者博客 日更 每个新模型当天实测、成本和坑,L4 的一手记录 扫本周条目标题,15 分钟;只点开实测类
Dwarkesh Podcast 播客 每月两三期 关键人物的带年份判断在这里说出口 每月听一期完整版(通勤时间,不计入周时长);其余只看文字稿小标题,10 分钟

每周固定时长

  • 一个时段:每周六上午,总共 75 分钟(上表各项之和;播客完整版放在通勤里不占它)。
  • 先后顺序:HF 标题 → Import AI → Interconnects → Simon Willison → Dwarkesh 小标题。时间到就停,没看完的不补。
  • 看完不收藏:不存链接、不剪藏。每周只往 opinions 写一行——要么是一条带日期的观点,要么是「本周没有值得记的」。想读的论文记标题,下周还记得再去读。
  • 什么时候动节点:本周看到的东西改变了对某个节点的判断(比如一个精选过时了)才改 nodes/,每季度一次集中改,平时不动。
  • 一期没看:直接跳过,不回看;流的意思就是漏掉也没关系。
先修
LLM:模型怎么工作
  • Import AI free

    article · 20 分钟 / 周 — 一周里值得知道的论文与发布,每条都附「为什么重要」和政策视角,作者在一线实验室,不吹捧。

  • Interconnects free

    article · 20 分钟 / 周 — 后训练与开源模型的一线分析,大模型发布日的独立判断比新闻稿有用。

  • Dwarkesh Podcast free

    video · 每月一期完整版,约 2.5 小时 — 关键人物带年份的判断多半在这里说出口,是 opinions 的主要产地。

落选 (6)
  • Latent Space — 应用层气氛准但篇幅长、每日 AINews 太密,放到有事再查。
  • Ahead of AI — 不定期长文,不是周节奏,放到有事再查。
  • The Batch — 面向入门,自己跟前沿不靠它。
  • Lex Fridman Podcast — 嘉宾广但追问浅,AI 相关的少数几期直接去听即可。
  • No Priors — 投资人视角,产品与融资多于技术。
  • arXiv cs.CL / cs.LG 日更 — 没有筛选,订阅会淹死;查用。

有事再查:前沿参考清单(≤ 15)

半衰期: 流

llmfrontier-on-demand

这些来源不订阅、不定期看——它们各自回答一类问题,有那类问题时再去。每周看的只有 每周必看:前沿信息流(≤ 5) 里的五个。可信度分三档:高 = 一手且独立;中 = 一手但有立场,或独立但是估算;低 = 需要多条互相印证。

来源 查什么 可信度
arXiv cs.CL / cs.LG 列表页 知道编号或标题时找原文;按关键词看某方向最近一周的论文 高(一手,未评审)
alphaXiv 最近一周哪些论文被讨论、作者在评论里怎么答疑 中(论文一手、评论二手)
Anthropic 博客(news · engineering · research) agent / 工具调用的工程实践;新模型的模型卡与评测表 中(一手,有立场)
OpenAI 博客 系统卡、定价、推理与 RL 方向的原始出处 中(一手,营销面向)
Google DeepMind 博客 Gemini / Gemma 技术报告、世界模型、RL 与科学应用 中(一手,有立场)
Meta AI 博客 Llama 模型卡与许可证、JEPA 路线的原始论文 中(一手,有立场)
LMArena 榜(arena.ai) 新模型发布后一两周的偏好榜位置与分类榜 中(反映偏好,可被刷)
Artificial Analysis 选模型 / 选供应商:能力指数、吞吐、延迟、价格一页看完 高(独立;指数是自定义加权)
Epoch AI 数据中心 训练算力、数据、硬件成本的历史数据;写数量级判断前查 高
SemiAnalysis 芯片、互联、数据中心的经济账;某实验室算力花了多少钱 中(供应链一手、经济账估算、付费)
Latent Space 应用层某方向现在大家用什么(评测工具、agent 框架);年初阅读清单 中(气氛准,判断偶热)
Ahead of AI 一批新模型架构的逐层对比;一个月论文的主题串讲 高
Lil'Log(Lilian Weng 的博客) 进入新方向前的综述(agent、扩散、RL、幻觉) 高
The Batch 给非技术的人解释本周事件时的措辞 高但浅
r/LocalLLaMA 某模型在自己硬件上能不能跑、跑多快;怀疑发布数字时看社区实测 低到中(共识可信,单帖不可信)

怎么用

  • 问题先于来源:先写下要回答什么(选供应商?某方向综述?某数字的出处?),再按「查什么」列找来源,不反过来逛。
  • 查完的结论回写到相关节点或 opinions,不收藏来源页本身。
  • 实验室博客四家一起看:同一件事只看一家会被立场带走;数字以 Artificial Analysis 和 Epoch AI 数据中心 为准。
先修
LLM:模型怎么工作
  • Epoch AI free

    docs — 写任何带数量级的判断之前查它:训练算力、数据、硬件成本的时间序列,方法公开、数据可下载。

  • Artificial Analysis free

    docs — 选模型和选供应商时唯一能一页看完能力、速度、价格三者的地方,独立于实验室自报。

  • Lil'Log free

    article — 进入一个新方向之前先看她有没有写过综述,一篇顶那个方向几年的主线论文。

落选 (4)
  • Hacker News — 不是来源,是取证工具:本库 `evidence` 的分数从它取,不当信息流订阅。
  • Semantic Scholar — 查引用数好用,但本库的精选以社区背书为证据,引用数留给论文实体。
  • Lex Fridman Podcast · No Priors — 见 每周必看:前沿信息流(≤ 5) 的落选。
  • 各实验室的 Discord — 噪声太高,模型发布时去一次足够,不列。

媒体:跟谁看

二十个信息源,各写了谁在办、立场、什么时候值得看;上面两个节点说明哪些每周看、哪些按需看。

Ahead of AI

2022所在层L2L5

Sebastian Raschka(《Build a Large Language Model (From Scratch)》作者)的 newsletter,不定期长文:把一批新模型的架构摆在一起逐层比较,或者把一个月的论文按主题串讲。口味是 L2 的教学派,图多、公式少、自己复现过。可信度:高。有事再查:某个架构改动(MoE、注意力变体、循环层)想要一篇看懂的对比时来这里。

关联
Transformer (讨论) · LLM:模型怎么工作 (讨论) · 微调:教它你的任务 (讨论) · Sebastian Raschka (发布)
反向链接
Sebastian Raschka (发布)
来源
关于页:Over 220,000 subscribers (取证 2026-10-08) · Hacker News,521 分(2026-09-09):GPT-6 Astra 与循环 Transformer 一文 (取证 2026-10-08)

alphaXiv

2024所在层L2L5

斯坦福学生做的「arXiv 之上的评论区」:每篇论文一个讨论页、趋势榜和自动生成的概览,作者常在评论里答疑。Papers with Code 停摆后,要找「最近一周什么论文被讨论」它和 Hugging Face Daily Papers 是两个替代品。可信度:论文一手,评论和自动概览二手,拿来定位问题,不拿来当结论。

关联
LLM:模型怎么工作 (讨论) · Agent:循环里带工具的模型 (讨论)
来源
首页,趋势榜 + 论文评论 (取证 2026-10-08) · Hacker News,549 分(2024-09-08) (取证 2026-10-08)

Anthropic 博客(news · engineering · research)

2021所在层L4L5

三个索引:news 发模型与产品,engineering 写 agent、工具调用、Claude Code 的工程实践,research 放可解释性、对齐和模型卡。工程博客是 L4 的一手材料(Agent:循环里带工具的模型 的精选就来自这里)。可信度:一手但有立场——模型卡和研究看数据,产品文看它没说什么。有事再查:新模型发布日看模型卡的评测表;做 agent 时查 engineering。

关联
Agent:循环里带工具的模型 (讨论) · MCP:给每个系统一个统一的插口 (讨论) · 调用模型 API:token、流式、工具、成本 (讨论) · Anthropic (发布)
来源
工程博客索引 (取证 2026-10-08) · 研究索引(可解释性、对齐、模型卡) (取证 2026-10-08) · Hacker News,673 分(2025-11-24):工程博客「Advanced Tool Use」 (取证 2026-10-08)

Artificial Analysis

2023所在层L3L5

独立评测站,把模型放在同一组基准上跑出「智能指数」,再配上每个 API 提供商的吞吐、首 token 延迟和价格——选模型和选供应商时唯一能一页看完三者的地方。可信度:高于实验室自报,指数本身是它自己定义的加权,版本号变化时分数不可比。有事再查:选模型 / 选供应商时看价格与速度页;发布日对照实验室自报的数字。

关联
LLM:模型怎么工作 (衡量) · Serving:自己跑模型 (讨论) · 调用模型 API:token、流式、工具、成本 (讨论)
来源
首页:智能指数、速度、价格三张图 (取证 2026-10-08) · Hacker News,916 分(2026-06-17):GLM-5.2 登顶开源权重一文 (取证 2026-10-08)

arXiv cs.CL / cs.LG 列表页

1991所在层L2L3L5

预印本的原始来源,每天几百篇,没有筛选。不要订阅它的日更(会淹死),有事再查:知道论文编号或标题时直接去 abs 页;要看某个方向最近一周有什么时用列表页加关键词搜索。可信度:论文本身一手,但未经同行评审,看结论先看它的评测设置和基线是否公平。

关联
LLM:模型怎么工作 (讨论) · Transformer (讨论) · Serving:自己跑模型 (讨论)
来源
cs.CL 最近列表页 (取证 2026-10-08) · cs.LG 最近列表页 (取证 2026-10-08)

Google DeepMind 博客

2010所在层L2L5

Gemini / Gemma 发布、世界模型(Genie)、科学应用(AlphaFold 系)和强化学习的官方出口;相比其他实验室更多科学与 RL 的内容,历史上的里程碑(AlphaGo、AlphaFold)也在这里有原始记录。可信度同其他实验室博客:一手、有立场,技术报告比博客文可信。有事再查:Gemini 发布日看技术报告;RL 与科学应用方向找原始论文从这里进。

关联
LLM:模型怎么工作 (讨论) · 后训练:用奖励塑形 (讨论) · AI 历史:怎么读三次浪潮 (讨论) · Google DeepMind (发布)
来源
博客索引 (取证 2026-10-08) · Hacker News,1812 分(2026-04-02):Gemma 4 发布 (取证 2026-10-08)

Dwarkesh Podcast

2020所在层L5

Dwarkesh Patel 主持的长访谈播客,嘉宾是实验室创始人、首席科学家和经济学家,一期两三个小时,主持人做足功课、追问到底。它是 opinions 里观点的主要产地:关键人物给出带年份的判断多半在这里。值得看的时候:每月挑一期与自己关心的层相关的听完整版,其余只看文字稿的小标题;听到带时间的断言就记一条观点。

关联
AI 历史:怎么读三次浪潮 (讨论) · LLM:模型怎么工作 (讨论) · Agent:循环里带工具的模型 (讨论) · Dwarkesh Patel (发布)
反向链接
Dwarkesh Patel (发布)
来源
关于页:Over 111,000 subscribers(Substack) (取证 2026-10-08) · Hacker News,1212 分(2025-10-17):Karpathy 一期 (取证 2026-10-08) · Hacker News,450 分(2025-11-25):Ilya Sutskever 一期 (取证 2026-10-08)

Epoch AI 数据中心

2022所在层L3L5

非营利研究机构 Epoch AI 维护的数据集与图表:历年模型的训练算力、数据量、硬件性价比、算力增长率,加上 FrontierMath 等自家基准。要给「scaling 到底走了多快」配数字,这是最常被引用的一手整理。可信度:高,方法公开、数据可下载;注意它和实验室有基准合作(FrontierMath 与 OpenAI 的资助争议)。有事再查:写任何带数量级的判断之前先查这里。

关联
Serving:自己跑模型 (讨论) · Evals:知道它有没有变好 (讨论) · AI 历史:怎么读三次浪潮 (讨论) · Epoch AI (发布)
反向链接
Epoch AI (发布)
来源
趋势页:训练算力、数据、硬件、成本的时间序列 (取证 2026-10-08) · 基准面板 (取证 2026-10-08) · Hacker News,480 分(2026-03-24):FrontierMath 开放问题被解 (取证 2026-10-08) · Hacker News,445 分(2026-05-24):芯片成本构成一文 (取证 2026-10-08)

Hugging Face Daily Papers

2023所在层L2L4L5

Hugging Face 办的每日论文榜:社区把当天 arXiv 上值得看的论文投上来、点赞排序,每篇带作者或 AK 写的一段摘要。口味偏开源模型、训练与推理方法、多模态,不偏理论。值得看的时候:每周扫一遍标题(只看标题和点赞数,5–10 分钟),把真想读的那一两篇记进 每周必看:前沿信息流(≤ 5) 的「一行记录」。它替代了停摆的 Papers with Code 作为「最近什么热」的入口。

关联
LLM:模型怎么工作 (讨论) · 微调:教它你的任务 (讨论) · Agent:循环里带工具的模型 (讨论) · Hugging Face (发布)
来源
每日论文页,按社区点赞排序,可订阅邮件日报 (取证 2026-10-08)

Import AI

2016所在层L2L5

Jack Clark(Anthropic 联合创始人、前 OpenAI 政策负责人)从 2016 年起每周一期的 newsletter:挑 5–8 篇论文或发布,各写一段「它为什么重要」,末尾附政策与安全的视角和一则小说。立场是「技术乐观 + 对风险认真」,很少吹捧。值得看的时候:每周固定看一期,先看每段的粗体结论,再决定点开哪篇原文,20 分钟够。

关联
LLM:模型怎么工作 (讨论) · Evals:知道它有没有变好 (讨论) · AI 历史:怎么读三次浪潮 (讨论) · Jack Clark (发布)
反向链接
Jack Clark (发布)
来源
关于页:Over 143,000 subscribers (取证 2026-10-08) · 第 455 期(2026-05-04):自动化 AI 研发的概率判断,被 [[opinions]] 收录 (取证 2026-10-08)

Interconnects

2023所在层L2L5

Nathan Lambert(Ai2 后训练负责人)写的 newsletter,专注开源模型、后训练(RLHF / DPO / RL 推理)和实验室动态,是少数一线做后训练的人公开写的分析。口味偏技术、偏开源,对封闭实验室的发布会给独立判断。值得看的时候:每周看一期;有大模型发布(尤其开源权重)时去看他的即时解读,比新闻稿有用。

关联
微调:教它你的任务 (讨论) · 后训练:用奖励塑形 (讨论) · LLM:模型怎么工作 (讨论) · Nathan Lambert (发布)
反向链接
Nathan Lambert (发布)
来源
关于页:Over 85,000 subscribers (取证 2026-10-08) · Hacker News,367 分(2026-06-23):GLM-5.2 一文 (取证 2026-10-08)

Latent Space

2023所在层L4L5

swyx 和 Alessio 办的「AI 工程师」newsletter + 播客,另有每日 AINews 汇总。口味是应用层:agent 框架、评测、RAG、推理供应商,嘉宾多是做产品的人。可信度:中——行业气氛准、技术判断偶有过热。有事再查:想知道应用层某个方向(评测工具、agent 框架)现在大家用什么时,搜它的往期;年初的阅读清单是 L4 的好起点。

关联
Agent:循环里带工具的模型 (讨论) · RAG:先查再答 (讨论) · Evals:知道它有没有变好 (讨论) · swyx (Shawn Wang) (发布)
反向链接
swyx (Shawn Wang) (发布)
来源
关于页:Over 203,000 subscribers (取证 2026-10-08) · Hacker News,490 分(2025-01-13):AI Engineer Reading List (取证 2026-10-08)

Lil'Log(Lilian Weng 的博客)

2017所在层L2L4L5

Lilian Weng 的个人博客,一年几篇,每篇是一个方向的综述:agent、Transformer 家族、扩散模型、RL、幻觉。读完一篇等于读完那个方向过去几年的主线论文。可信度:高,作者在一线做研究。有事再查:进入一个新方向之前先看她有没有写过综述;不要等更新,更新很慢。

关联
Agent:循环里带工具的模型 (讨论) · Transformer (讨论) · 后训练:用奖励塑形 (讨论) · Lilian Weng (发布)
反向链接
Lilian Weng (发布)
来源
博客首页 (取证 2026-10-08) · Hacker News,334 分(2026-08-04):自改进的 harness 工程一文 (取证 2026-10-08) · Hacker News,285 分(2023-06-27):LLM 驱动的自主 agent 综述 (取证 2026-10-08)

LMArena 榜(arena.ai)

2023所在层L2L5

匿名双盲对战、人投票算 Elo 的榜,测的是「人更喜欢哪个回答」,不是能力上限。可信度:中——它反映偏好,而偏好可以被排版和讨好语气刷上去,2025 年 Llama 4 的刷榜和 2026 年初的公开批评都说明它只能当参考之一。有事再查:新模型发布后一两周看它的位置变化和分类榜(代码、长文),不看总榜的名次。

关联
LLM:模型怎么工作 (衡量) · Evals:知道它有没有变好 (讨论)
来源
榜单页(lmarena.ai 已 301 到 arena.ai) (取证 2026-10-08) · Hacker News,118 分(2023-05-25):榜单首发 (取证 2026-10-08) · Hacker News,246 分(2026-01-07):对它的批评「LMArena is a cancer on AI」 (取证 2026-10-08)

Meta AI 博客

2013所在层L2L5

Llama 系列和 FAIR 研究(世界模型、JEPA、多模态)的官方出口。它曾是开源权重模型的旗手,Llama 4 之后这个位置被国内模型分走不少,所以看它更多是看研究线而非榜单。可信度:一手、有立场;开源权重的模型卡可信,发布文的对比图要配第三方榜。有事再查:Llama 新版本看模型卡与许可证条款;JEPA 路线的进展从这里找原始论文。

关联
LLM:模型怎么工作 (讨论) · 微调:教它你的任务 (讨论) · Meta AI (FAIR) (发布)
来源
博客索引(对脚本抓取返回 400,浏览器可开) (取证 2026-10-08) · Hacker News,1235 分(2025-04-05):Llama 4 发布 (取证 2026-10-08)

OpenAI 博客

2015所在层L2L5

模型发布、系统卡和研究文章的官方出口。可信度:一手但是营销面向——发布文里的曲线图要配第三方榜(LMArena 榜(arena.ai)、Artificial Analysis)一起看,系统卡比发布文可信。有事再查:发布日看系统卡和定价页;研究类文章(推理、RL)仍是该方向的原始出处。

关联
LLM:模型怎么工作 (讨论) · 后训练:用奖励塑形 (讨论) · 调用模型 API:token、流式、工具、成本 (讨论) · OpenAI (发布)
来源
新闻索引(对脚本抓取返回 403,浏览器可开) (取证 2026-10-08) · Hacker News,2279 分(2026-09-03):GPT-6 Astra 发布文 (取证 2026-10-08)

r/LocalLLaMA

2023所在层L3L4L5

Reddit 上跑本地模型的社区:新开源权重发布几小时内就有量化版、显存占用和「在我这台机器上多少 token/s」的实测,也是最早戳穿发布文水分的地方。可信度:低到中——单条帖子不可信,几十条帖子的共识可信。有事再查:想在自己的硬件上跑某个模型、或者怀疑某个发布的数字时,搜版面近一周的帖子。

关联
Serving:自己跑模型 (讨论) · 微调:教它你的任务 (讨论) · LLM:模型怎么工作 (讨论)
来源
版面首页 (取证 2026-10-08) · Hacker News,248 分(2025-08-11):版面帖子「GPT-OSS-120B 在 8GB 显存上跑」被转到 HN (取证 2026-10-08)

SemiAnalysis

2020所在层L3L5

Dylan Patel 办的半导体与 AI 基础设施分析:芯片、互联、数据中心成本、训练与推理的经济账,大部分深度内容付费。可信度:供应链消息一手、模型经济账是估算,2025 年底有过关于其利益关系的公开质疑,数字当作带误差的参考。有事再查:想知道某款芯片或某家实验室的算力到底多少钱时,先看它的免费摘要,再决定要不要为那一篇付费。

关联
Serving:自己跑模型 (讨论) · Kubernetes:在客户的地方跑 (讨论) · Dylan Patel (发布)
反向链接
Dylan Patel (发布)
来源
关于页:Over 320,000 subscribers (取证 2026-10-08) · Hacker News,584 分(2026-08-25):OpenAI 自研芯片一文 (取证 2026-10-08)

Simon Willison's Weblog

2002所在层L4L5

Simon Willison(Django 联合创作者、Datasette 作者)的个人博客,几乎每天更新:每个新模型发布当天他都会亲手跑一遍、贴出成本和实际效果;对提示注入、工具调用、agent 安全的长期跟踪是 L4 的一手记录。立场是动手派怀疑论——先试再评价。值得看的时候:每周扫一遍本周条目的标题,模型发布日直接去看他的实测;要查某个 API 的坑先搜他的站。

关联
Agent:循环里带工具的模型 (讨论) · 调用模型 API:token、流式、工具、成本 (讨论) · Prompting:能度量的指令 (讨论) · Simon Willison (发布)
反向链接
Simon Willison (发布)
来源
博客首页,日更,含 TIL 与 link blog (取证 2026-10-08) · Hacker News,1094 分(2026-05-27):产品市场契合一文 (取证 2026-10-08)

The Batch

2019所在层L5

DeepLearning.AI 办的周刊,Andrew Ng 开头写一封信,后面四五条新闻各配「为什么重要」。面向入门到中级,语气平和,不追热点。可信度:高但浅。有事再查:想给非技术的人解释一个本周事件时,它的措辞最好用;自己跟前沿不靠它。

关联
LLM:模型怎么工作 (讨论) · AI 历史:怎么读三次浪潮 (讨论) · Andrew Ng (发布)
反向链接
Andrew Ng (发布)
来源
周刊索引 (取证 2026-10-08) · Hacker News,55 分(2025-01-30):Andrew Ng 谈 DeepSeek 一期 (取证 2026-10-08)

观点与预测

L5 的「未来」不是知识,是带日期的观点。每条记观点、人、日期、出处、到期复盘日;到期回来写 status 和 review。订阅清单在 每周必看:前沿信息流(≤ 5) 和 有事再查:前沿参考清单(≤ 15),层的讲解在 atlas。

怎么挑观点

  • 要能被证伪:带时间、规模或能力的断言才收(「2028 年底 60% 概率」「3–5 年内过时」「十年」),口号不收(「AI 会改变一切」)。人物越重要越要挑他说得最具体的那一句,而不是最响的那一句。
  • 一人一条为主:同一个人反复说同一件事,只记最早、最具体的那次;他改口了另起一条,旧的照常到期复盘。
  • 出处是原话所在的页面:播客页、博客原文、论文;二手报道只在原文不可抓取时用,并在复盘时补原始录音的时间点。source.date 是取证日,不是发表日。
  • claim 是自己的话:转述到足够一年后能判对错的精度,不抄原句。
  • 上限十条左右在 open:超过就先复盘最旧的,再加新的。

复盘怎么做

  • due 的规则:观点自带时间就用那个时间(年份取当年 12-31);给的是区间就先取下限做第一次复盘,没结论再把 due 推到上限;没给时间的取发表日 + 12 个月。
  • 到期那周在周流时段里做:找当时最硬的证据(Epoch AI 数据中心 的数据、Artificial Analysis 的榜、发布的模型卡),写一句 review,把 status 改成 right / wrong / partial。判不了就写「判不了,因为……」并把 due 后推,不留空。
  • 复盘的结论回写:改变了某个节点判断的,去改那个节点的正文或落选;改变了对某个人可信度的看法的,在人物实体的正文加一句。
  • 每年年底看一遍已复盘的条目,统计谁说准了:这是下一年挑观点时给「人」的权重。

和每周流的关系

观点是周流的副产品:每周必看:前沿信息流(≤ 5) 的规则是看完不收藏,每周只往这里写一行。听播客或读 newsletter 时遇到带时间的断言,当场记一条;没有就记「本周没有值得记的」。这样一年下来,这页就是自己对「谁在何时说了什么、后来怎样」的账本,而不是别人的观点合集。

  1. 只用注意力、不用循环和卷积,序列建模可以更快更好。

    Ashish Vaswani2017-06-12来源 · 取证 2026-10-08到期复盘: 2020-06-12对了

    复盘: 三年内 Transformer 成为 NLP、视觉、语音的默认骨架;这条是记法样例。

  2. 在几乎所有事情上都比几乎所有人强的 AI,最可能在 2026–2027 年出现,代价是数百万张芯片和至少几百亿美元。

    Dario Amodei2025-01-29来源 · 取证 2026-10-08到期复盘: 2027-12-31待复盘

  3. AGI(在任何任务上追平人的 AI)的各项能力会在未来 5–10 年内陆续出现,现在还没到。

    Demis Hassabis2025-03-17来源 · 取证 2026-10-08到期复盘: 2030-03-17待复盘

  4. 全球数据中心建设投入会在 2028 年达到一万亿美元一年,比他此前说的 2030 年提前。

    Jensen Huang2025-03-18来源 · 取证 2026-10-09到期复盘: 2028-12-31待复盘

  5. 当前 LLM 范式的寿命只有 3–5 年;如果 JEPA 类世界模型在这个窗口内做成,会给出更好的推理与规划范式,让 LLM 路线过时。

    Yann LeCun2025-04-02来源 · 取证 2026-10-08到期复盘: 2028-04-02待复盘

  6. 2027 年 3 月前后出现能以 80% 可靠度完成多年量级软件任务的超人类程序员,并在 2027 年内一路走到超级智能(作者的众数年份,中位数更晚)。

    Daniel Kokotajlo2025-04-03来源 · 取证 2026-10-08到期复盘: 2027-12-31待复盘

  7. AI 能像人一样在岗持续学习、胜任任何白领工作,50% 概率在 2032 年前实现;更早的里程碑是 2028 年前 50% 概率能端到端做小企业的报税。

    Dwarkesh Patel2025-06-02来源 · 取证 2026-10-08到期复盘: 2028-12-31待复盘

  8. 2026 年很可能出现能自己得出新颖洞见的系统,2027 年可能出现能在真实世界干活的机器人。

    Sam Altman2025-06-10来源 · 取证 2026-10-08到期复盘: 2027-12-31待复盘

  9. 现在是「agent 的十年」而不是「agent 之年」:持续学习等缺口是可解的但很难,把它们解决掉大约要十年。

    Andrej Karpathy2025-10-17来源 · 取证 2026-10-08到期复盘: 2035-10-17待复盘

  10. scaling 时代(2020–2025)结束、回到研究时代:现在的方法再走一段就会停滞,数据有限;能像人一样学习进而超越人的系统还要 5–20 年。

    Ilya Sutskever2025-11-25来源 · 取证 2026-10-08到期复盘: 2030-11-25待复盘

  11. 到 2028 年底有 60% 以上的概率出现完全无人参与的 AI 研发;2027 年约 30%,2026 年不会;如果没发生,说明当前范式有根本缺陷。

    Jack Clark2026-05-04来源 · 取证 2026-10-08到期复盘: 2028-12-31待复盘

完成标准自测

  • 不看笔记能说出五个每周来源各覆盖哪个口子,以及为什么第六个被拒绝。
  • 过去四周每周都在 opinions 留了一行(观点或「没有」),收藏夹没有新增 AI 链接。
  • 随手指一条 `open` 的观点,能说出到期时用什么证据判、证据在 有事再查:前沿参考清单(≤ 15) 的哪一行。
  • 给一个新 newsletter,两分钟内能按「查什么 / 可信度」归到两档之一或落选,并说出理由。

作者的笔记原稿。