阅读笔记/姚顺宇 4 小时访谈深读:在 Anthropic 和 Gemini 训模型

姚顺宇 4 小时访谈深读:在 Anthropic 和 Gemini 训模型

张小珺 × 姚顺宇✅ 已读科技趋势

张小珺《商业访谈录》第 140 期 4 小时长访谈深读。姚顺宇先后在 Anthropic、Google DeepMind 参与 Claude 3.7/4.5 与 Gemini 3 训练,是少数同时拿到两家顶级实验室一手训练经验的研究员。本笔记基于多份公开报道与其本人博客交叉整理,约 40 分钟阅读。

编者按

本文是张小珺《商业访谈录》第 140 期、对 Google DeepMind 研究科学家姚顺宇的 4 小时长访谈的深读笔记,并非原节目逐字稿。

整理基于以下公开材料的交叉验证:B 站、小宇宙、YouTube 节目页与章节时间戳;钛媒体、虎嗅、知乎专栏、新浪科技、凤凰科技、量子位、品玩、京报网、DoNews 等媒体的公开报道与姚顺宇本人公开博客中的表述。文中带引号的句子,优先取自姚顺宇个人博客原文或多家媒体可交叉验证的公开引述;对原节目里的观点,我以转述和归纳为主,避免假托"原话"。

原节目版权归张小珺及《商业访谈录》所有,强烈推荐有时间的读者去听完整版(链接见文末)。本文只做评论与归纳,方便没有 4 小时空档的读者快速建立坐标系。


开场:先把人物画像立起来

姚顺宇不是普通的"AI 研究员"。要看懂这场访谈,得先看懂他这个人为什么稀缺。

学术背景的硬度,可能是同代研究员里最高的一档。 2015 年进清华物理系,获特等奖学金——清华最高规格的本科奖项,每年全校仅个位数。本科大二就开始选修研究生理论课程,本科期间做的研究方向是周期驱动系统拓扑场论。2018 年(仍是本科阶段),他在《Physical Review Letters》发表论文,首次给出非厄米系统拓扑能带理论的新方法,并定义了两个新的物理概念。一位 211 大学副教授对他的评价被多家媒体反复引用——大意是该校的教授没有人能超过他本科期间的物理水平。

之后赴斯坦福读博,导师包括 Douglas Stanford(黑洞信息悖论、SYK 模型方向的明星理论物理学家,2017 年 New Horizons in Physics Prize 得主)和杨振斌。博士期间方向从凝聚态逐渐转向高能物理,2023 年提出 "Scramblon Mode" 机制——研究量子混沌与黑洞内部信息传递的具体技术贡献。

2024 年在加州伯克利做了几个月博士后,作为从物理到 AI 的过渡。2024 年 10 月 1 日正式加入 Anthropic 的 Claude 团队——这一年他大概 27 岁。在 Anthropic 工作 恰好 354 天——2025 年 9 月 19 日离职10 天后的 9 月 29 日入职 Google DeepMind,参与 Gemini 3 训练。访谈录于 2026 年 3 月,距他加入 DeepMind 约半年。

他的稀缺性体现在三个独立的稀缺叠加:

  1. 同时拿到过 Anthropic 和 DeepMind 两家顶级实验室一手训练经验。这在硅谷研究员里是极少数。两家公司风格几乎相反,他完整经历过 Claude 3.7、4.5 的训练(在 Anthropic),又进入 Gemini 3 的训练(在 DeepMind)。这种"横跨两端的内参视角"在公开访谈里几乎找不到第二个。
  2. 物理博士到 AI 的硬转向——且是真做出过物理顶级成果之后的转向,不是"读不下去"的逃离。所以他对两个领域的判断都有可信度。
  3. 公开姿态的直接。硅谷做模型训练的中国研究员通常极少公开发表行业意见,他是少数例外。Anthropic 离职那次他在个人博客直接写:"So Ant, it was good with you, but it is better without you 🙂"——这种公开姿态在中国研究员群体里很罕见。

整场访谈他的姿态贯穿始终:直接、不装、不害怕得罪人、对自己的话负责。"请允许我小疯一下"是他自己定的副标题——他在访谈里没真的疯,他只是把行业里很多人不敢公开说的判断说了出来。

录制时间是 2026 年 3 月。张小珺在节目开场加了一段免责说明:因为世界变化太快,节目录完到上线之间又发生了一系列大事(Meta 收购 Manus 被撤销、Cursor 被 SpaceX 收购等等),部分时态判断可能已过时;同时因为 NDA,部分技术细节他没法说——访谈本身已经是被 Anthropic 和 Google 双重 NDA 过滤过的版本。


一、两个 Shunyu Yao:先把混淆拆清楚

访谈第一分钟就处理这件事——硅谷 AI 圈有两个清华同届的姚顺宇/姚顺雨,被反复混淆。

姚顺雨(OpenAI → 腾讯):清华姚班毕业,普林斯顿博士,研究 Agent 方向 6 年,是 ReAct、Reflexion、SWE-bench 等关键论文的核心作者。2025 年从 OpenAI 跳槽到腾讯。张小珺第 115 期访谈的是他——3 小时,讨论 Agent、人与系统、单极与多元的世界。

姚顺宇(Anthropic → Google DeepMind):清华物理系毕业,斯坦福物理博士,物理转 AI。就是本期 140 期访谈的主角

两人本科同年入学清华长期被混淆。2025 年还发生了一个"对称式"事件:姚顺雨从 OpenAI 跳到腾讯,姚顺宇从 Anthropic 跳到 DeepMind,同年发生,同样是从美国头部实验室跳出。

姚顺宇在访谈里对这种混淆带一点苦笑。他强调:他不是姚顺雨,他做的也不是 Agent 方向,他是模型训练(pre-training 和 RL post-training)方向。


二、竞争与逃逸:AI 应用层到底有没有护城河

访谈正式开场就抛出一个尖锐判断——目前几乎所有的壁垒都在模型侧

他这句话不是抽象的"模型公司很强"。展开来讲:

第一,数据飞轮没有真正出现。 "数据飞轮"过去两年是 AI 应用层最流行的叙事——用户用得越多,模型/产品越好用,越拉来更多用户。姚顺宇的判断很直接:没有哪个场景形成了真正的数据飞轮。绝大多数所谓"飞轮",其实是品牌效应或者网络效应,不是数据驱动的模型自我增强。

第二,唯一的例外是 Agentic Coding。 这是当下唯一"AI 真正原生、变得非常成功"的场景。Cursor、Claude Code、Codex、Windsurf 这些产品上做编程的人是真的在每个动作里给模型留下高质量训练信号——这些信号有清晰的成功/失败判定(代码能不能跑、测试过不过、用户接受或拒绝补全),而且产生量级巨大。这是其他 AI 应用层都没有的属性。写作类、客服类、聊天类、搜索类——这些场景的成功信号都模糊得多,飞轮根本转不起来。

第三,应用层活下去只有两条路:

  • 路径一:逃得足够快。 产品增长速度必须超过模型公司反应的速度,在模型公司还没注意到这个场景之前占领用户心智——并且不只是占领心智,还要演化出自己的模型。心智占领只能保住一两代基础模型周期,下一代基础模型出来,如果你没长出自己的模型差异化,你就被吃掉。这条路 Cursor、Perplexity 已经在试,但绝大多数应用层公司不具备这种执行速度。
  • 路径二:市场足够小。 做模型公司懒得管的垂直场景。这条路能活,但天花板就摆在那里——你不会成为下一个大公司。

第四,他对当下应用层的隐含态度是冷的。 他没明说"99% 的 AI 应用层会死",但论证逻辑实际上推到了这个结论——大多数应用层公司既跑不过模型公司的迭代速度,又不愿意做小市场,那就只是"先活着"而已。

这段在 AI 创投圈是有杀伤力的——过去两年很多基金押的是"模型会快速商品化、应用层赢家通吃",姚顺宇的判断恰好相反:模型不会快速商品化,应用层赢家很少


三、Pre-train 没有到头:来自两家实验室的一手反证

行业过去 12 个月最大的叙事之一是"预训练 Scaling Law 已经撞墙"。投资人据此判断模型公司估值天花板已到、应该把钱挪到应用层。

姚顺宇直接给出反面判断:他在 Anthropic 和 DeepMind 的一手体验都是,没撞

他的精神是:过去几个月预训练实际上是变强了,而且接下来几个月也没看到撞墙的迹象。这种"双重内参视角"的可信度比外部观察家高一个数量级。

他展开了一个非常重要的研究方法论——当一个研究员"觉得规律到头"的时候,其实有三种可能

  1. 规律的适用范围真的到头了——最稀少的情况。
  2. 某个前置条件不满足——比如数据质量下降、infra 出了不稳定、某个超参没对齐、tokenizer 改了导致下游表现错位。中等可能。
  3. 自己的代码或实验里有 bug 没发现——绝大多数情况

这是整场访谈里最违反"宏大叙事"直觉的一段——很多看似"Scaling Law 终结"的现象,回到工程现场可能只是某个地方出了 bug,或者数据清洗管道有问题,或者评估集本身有泄漏。

由此延伸出他对研究员素质的一个核心观点:修好一个 bug 带来的进展,往往远大于那些看起来很神奇的技巧。这话听起来朴素,但在一个充满"魔法叙事"的领域里非常反潮流——大多数 AI 大佬会讲"算法直觉"、"对模型的理解"、"美学品味",他反过来强调"系统性地修 bug"。

他对 2026 年的具体技术预期是一个非常具体的方向:"Train with finite context, use as infinite context." 用有限上下文长度训练,但推理时能用接近无限的上下文。这是他点出来的下一个能力跃迁——目前长上下文都是训练时就喂长序列,代价大且效果不稳定;如果能做到训练时用短窗口、推理时外推到极长甚至无限,模型经济学会被改写。Gemini 在长上下文上的代际优势(2M token)也暗示 DeepMind 内部正在这个方向上推进。

这一段还有一个隐含的判断:Scaling Law 没撞墙,但 Scaling 的形态在变——不再是单纯"参数更大、数据更多、算力更大",而是预训练 + RL 后训练 + 数据合成 + 长上下文几个维度联合 scale。Scaling Law 不是死了,是分形了。


四、Coding 的爆发:90% 代码已经由 AI 写

这段他的态度近乎确定——AI 在编程上的爆发,是已经发生的事实,不是未来时

事实层面:他自己和周围很多研究员的日常工作里,90% 以上的代码已经是 AI 生成的。这不是预测,是 2026 年初这群人的真实工作流。Claude Code、Codex、Cursor 这些工具不是辅助,是主力——研究员的角色从"写代码"变成"审查代码、设计任务、定义目标"。

但他做了一个非常清醒的拆分——程序员的工作并没有被整体替代,被替代的是其中一类

不会被替代的部分
- 怎么合理设计实现方案
- 让方案契合公司未来发展方向
- 跨系统的整合判断
- 对业务的理解
- 安全和性能权衡的拍板

总结起来就是"产品经理 + 系统架构"那一层。他甚至提到——做一个好的产品经理是他目前还想不明白该怎么训练 AI 去做的事。这句话非常重要——它揭示了当下 LLM 训练的一个真实结构性限制:模型能学到任何能被清晰定义的任务,但学不到"在模糊上下文中定义任务"这件事本身。产品经理的核心工作就是后者,所以它逃过了第一波 AI 替代。

会被替代的部分
- 经理说"实现这个方案,下周五给我"的执行型任务
- 用规范化语言描述清楚的功能开发
- 已经有大量类似先例的代码改造

他对这部分的判断很冷:未来可能就不会再存在。

由此他对程序员群体的判断是 M 型分化:上半截(系统设计 + 业务判断)反而变得更值钱(因为他们可以指挥 AI 放大产出),下半截(纯执行)快速消失。中间层最危险——既不在判断侧,又不在 AI 优势放大的杠杆上。

对在校学生的建议:核心竞争力是"怎么和 AI 有效协作"。这话不是套话,是非常具体的——意思是不要把"会写代码"当成核心能力,而是要把"会用 AI 写代码、会审查 AI 写的代码、会设计 AI 解决不了的部分"当成核心能力。

这段对中国程序员的隐含信息是:国内招聘市场对应届生 coding 能力的考察标准已经过时了。八股、刷题、LeetCode——这些 AI 都做得比人好。真正应该考察的是"在一段模糊需求下,能不能合理拆解问题、能不能审查 AI 输出的错误、能不能在 AI 不擅长的地方接手"。


五、Seedance,硬蒸和软蒸:被低估的工程话题

这一段技术性强一些,但对理解模型行业的真实壁垒非常关键。

模型蒸馏(Distillation)是把大模型的能力压缩到小模型里的技术。姚顺宇区分了两种做法:

硬蒸(Hard Distillation):用大模型生成数据(比如让一个大模型生成 100 万个回答),再让小模型在这些数据上做监督学习。这是最常见、最粗暴的做法。开源社区几乎所有"对标顶级闭源模型的小模型"用的都是硬蒸。它的问题是:你只学到了大模型的"采样结果",丢失了大模型在每个 token 上的概率分布信息——大模型说"很可能是 A,但 B 也有 20% 的可能",硬蒸出来的小模型只学到了"答案是 A",B 的可能性完全丢了。

软蒸(Soft Distillation):直接对齐大模型的输出概率分布(logits)。小模型学到的不只是答案,还有大模型对每个备选答案的置信度。信息密度大一个数量级——理论上小模型在同样大小下能逼近大模型更多的能力。

为什么行业里软蒸做得好的团队是少数? 因为对 infra 和细节要求极高:
- 需要能完整保存大模型在训练数据上的 logits(存储和带宽都是巨大开销)
- 需要确保大小模型的 tokenizer 完全一致
- 需要处理蒸馏目标和原始预训练目标的权衡
- 工程链路任何一处出错,蒸馏效果就退化到不如硬蒸

这段再次回到他贯穿全场的主题——简单算法 + 强大 infra 才能跑出效果,单靠算法巧思是没用的。

Seedance 是字节豆包系的视频生成线。姚顺宇在这段里隐含地把字节系的工程能力放在了相对靠前的位置——能在视频这种"对 infra 极端挑剔"的方向上跑出来,说明工程班底是有的。中国 AI 行业里,字节是被他在访谈里相对正面提及的少数公司之一。

为什么这段在公开传播里被低估? 因为技术门槛高、不抓眼球。但这恰恰是真实的模型公司之间拉开差距的地方——不是谁有更聪明的 idea,是谁的 infra 更扎实、谁的细节处理更干净。


六、机器人 + 在 Underdog 之地赌一把

这段讲机器人和具身智能,姚顺宇的态度比当下硅谷主流冷得多。

当下机器人/具身智能的主流叙事:基础模型解决了"大脑",剩下的是"身体"问题,预计 2026-2028 年会出现 ChatGPT 时刻——人形机器人会爆发。Nvidia 把 "physical AI" 作为下一个万亿叙事在推。

姚顺宇的看法:机会是有的,但节奏被普遍高估。理由:

  • 物理世界的反馈循环天然慢——训练一个聊天模型,一秒钟可以跑无数次推理;训练一个机器人抓杯子,每次失败可能要重新摆杯子、重新校准摄像头,慢一两个数量级。
  • 数据不能无限复制——文本可以爬全互联网,机器人数据只能现采。模拟器仿真有用但有 sim-to-real gap。
  • 硬件迭代周期长——软件版本可以一天一发,机器人硬件设计一次至少几个月。
  • 事故成本高——机器人摔倒、撞人、损坏物品,每次都是真实成本。

但他不悲观。他用了一个很关键的词:"Underdog 之地"

当一个赛道还没有明确的赢家、巨头还在观望、技术路径还没有标准答案时——这种地方对年轻人和小团队反而是机会更多的。理由很简单:大厂资源垄断在还没形成的领域,做出来的是被认领的"小团队功劳";而在已经成熟的领域,无论你做什么,都会被资源更多的大厂复刻。

他和量子计算并列推荐这两条路给年轻人:量子计算和机器人/具身智能这两条路,是目前给年轻人机会比较多的方向。共同点:
- 大厂还没形成绝对压制
- 技术路径有真实的不确定性,不是单纯比工程量
- 还需要相当时间,对应届生和年轻博士反而友好

他对纯软件 AI 领域年轻人的隐含态度是冷的——这块已经被 OpenAI、Anthropic、Google 三家算力垄断锁定了,单个年轻人很难再做出方向性贡献。


七、从非厄米到 AI:他怎么做出这个转身

这是访谈个人叙事最饱满的一段,也是他人生路径最反常规的部分——做物理做到了顶级期刊和顶级奖学金,为什么要走?

7.1 物理研究方向到底有多硬核

很多媒体写他"清华物理学霸",但具体硬到什么程度需要拆开看:

  • 本科特奖:清华每年个位数。
  • 2018 年 PRL 论文:本科阶段在《Physical Review Letters》发表一作论文,首次给出非厄米系统拓扑能带理论。
  • 斯坦福博士:师从 Douglas Stanford(黑洞、SYK 模型、量子混沌方向的明星理论物理学家,2017 年 New Horizons in Physics Prize 得主)和杨振斌。
  • 2023 年提出 Scramblon Mode 机制:研究量子混沌与黑洞信息传递的具体技术贡献。

也就是说,他不是"读物理读不下去",是做到了同代里 top 1% 的位置之后主动离开

7.2 为什么离开物理

他在访谈和博客里给的理由非常具体,不是抽象的"AI 是未来"。

第一,高能/理论物理走到了"实验完全追不上"的阶段。 弦论、超对称、各种关于量子引力的猜想,提出了几十年,但 LHC 这一代加速器的能量级别上不去,没法验证。理论走得太前、实验跟不上——研究员处在一个没有客观反馈的状态。他自己博客里有一句精确的表述:理论物理学多年来一直缺乏实验,导致很难客观地判断一项理论工作的重要性。这是他给出的核心离开理由。

第二,AI 反过来——可以做任何实验。 物理没有标注的实验数据就理解不了;AI 不受这个约束——理解不了没关系,也可以往前发展。在 AI 里他可以做任何想做的实验,只要算力和 infra 跟得上。这种"实验民主化"对一个习惯了"理论必须有实验验证"的物理学家来说,是巨大的吸引力。

第三,经验规律和科学规律的边界本来就模糊。 热力学定律最初也是经验规律(开尔文、克劳修斯总结的宏观规律),后来才有玻尔兹曼建立微观统计力学解释。Scaling Law 现在没有第一性原理解释,不代表它不真。

第四,他选择 AI 而非量子计算。 他认为 AI 比量子计算的发展前景更成熟。量子计算还在等"实用量子优势"的临界点,可能还要 10 年;AI 已经在创造价值。这是工程师式的判断,不是物理学家式的。

7.3 物理对 AI 的硬技能帮助:几乎没有

这一点姚顺宇说得非常直白:物理对 AI 硬实力上其实没什么帮助。工具性技能转化非常非常少

他没说物理白学了——留下来的是性格和思维方式
- 刨根问底的习惯——遇到现象不接受表层解释,一定要往下问到底。
- 对复杂系统的直觉——做凝聚态的人习惯了"多体相互作用涌现出宏观行为",这种直觉迁移到神经网络上很自然。
- 实验迭代的耐心——做物理实验跑一次要几个月,AI 实验跑一次几小时——这种对照让他对 AI 的实验耐心是"反过来的,更轻松"。
- 理论假设要能被实验验证的执念——这一点非常关键,让他对"纸面上很漂亮但跑不出来"的工作很警惕。

为什么 Anthropic 会大规模招物理博士? Dario Amodei 自己就是物理博士出身。他曾公开解释,雇拥有物理博士学位的人能快速学习机器学习并做出贡献。目前 Anthropic 有约 30-40 名物理学家背景研究员。姚顺宇 2024 年加入是这个浪潮的一部分。他自己也评价过 Anthropic 仍是物理背景博士转行 AI 研究的最佳去处之一——即使后来他离开了,这个判断他仍然保留。


八、在 Anthropic 训 Claude 3.7 和 4.5:以及那场公开离职

这是访谈技术含量最高、时长也最长的一段(约 1:52:32–2:35:03,45 分钟左右)。

8.1 时间线

  • 2024 年 10 月 1 日:入职 Anthropic Claude 团队。
  • 2024 年 10 月–2025 年 9 月:参与组建强化学习基础团队,负责 Claude 3.7 Sonnet 框架及 Claude 4 系列背后的强化学习理论。Claude 3.7 发布于 2025 年 2 月,Claude 4.5 在他离开前后发布。
  • 2025 年 9 月 19 日:从 Anthropic 离职。
  • 2025 年 9 月 29 日:入职 Google DeepMind,参与 Gemini 3 训练。

总共在 Anthropic 354 天

8.2 在 Anthropic 学到的核心方法论

一句话简单算法 + 强大 infra 就能跑出效果

这是他在 Anthropic 学到的最深刻的一课。他反复强调不要追求算法上的花活儿——很多时候团队 A 和团队 B 拿到的是几乎一样的 paper、几乎一样的思路,差距出在:谁的 infra 更稳、谁的实验跑得更干净、谁的 bug 修得更彻底

这背后的研究文化是 Anthropic 创始团队(Dario、Jared Kaplan 等)一以贯之的——"Scaling Hypothesis" 的字面意思是:把简单的东西做大就够了,不要试图用复杂的算法绕过 scale。这种文化的优势是聚焦,劣势是研究员的个人创造空间相对小。

Claude 3.7 / 4.5 的训练重点:通过 RL 提升编码能力。这是 Anthropic 在 Coding 方向上的赌注——这个赌注被市场验证了:Claude Code 在 2025-2026 年成为开发者市场的事实标准之一,Cursor 长期把 Claude 作为默认模型。姚顺宇在 RL 基础团队的工作直接服务于这个产品成功。

8.3 Anthropic 的组织气质:top-down

姚顺宇对 Anthropic 组织风格的描述:top-down。重大方向由联合创始人 Jared Kaplan 等人直接拍板,研究员在框定的方向里做执行。这种组织的好处:
- 效率高——方向不会反复摇摆
- 资源集中——所有人围绕几个共同目标
- 质量门把得严——核心团队会审查关键决定

劣势:
- 研究员的"创新自主性"留得少——你很难自己开一个新方向
- 不适合喜欢 bottom-up 探索的人
- 对个体创造力的张力可能造成挫败感

他在访谈里没有直接批评 Anthropic 这种风格,但隐含的态度是这种文化适合特定阶段、特定类型的研究员,不是所有人都适合长期待

8.4 工作强度

他对 Anthropic 工作强度的形容是"超级忙"——忙到无暇写论文记录心路历程。这一点非常重要——意味着 Anthropic 的研究员产出主要在内部(模型本身),公开 paper 相对少。这也解释了为什么 Anthropic 给外界的"技术神秘感"比 OpenAI 更强——他们的人没时间写 paper 解释自己在做什么。

8.5 离职:40% / 60% 的精确比例

访谈里说得相对克制,但拼上他的离职博客就完整了。

他在博客里给出一个精确的比例:
- 40%可公开的原因:价值观分歧
- 60%不可公开的原因:内部细节、受 NDA 保护

那 40% 的具体内容是什么?

2025 年 9 月 5 日,Anthropic 在内部文件中把中国列为 "adversarial nations"(敌对国家),并宣布停止向"中国实体控股的公司"提供 AI 服务。这件事在硅谷中国研究员圈子里引起强烈反应。

姚顺宇在博客中的公开表述大意是:他强烈反对 Anthropic 发表的反华言论;尽管他相信 Anthropic 的大多数人都会反对这样的言论,但他认为他没有办法继续留在公司。

这是他公开给出的离职理由。注意他的措辞非常精确——他没有指控 Anthropic 整个公司反华,他明确说"大多数人会反对这样的言论"——他批评的是公司层面的官方表态,不是同事。

离职寄语(写在博客里):"So Ant, it was good with you, but it is better without you 🙂" ("Ant" 是 Anthropic 的简称,双关 "蚂蚁")

这种公开姿态在硅谷的中国研究员里非常罕见。访谈里他没有过多展开这段,但也没有回避——他不希望自己工作的公司在中国议题上采取那样的立场。

8.6 研究员素质:靠谱、自省、全局视野

这一段也是访谈最有"师父教徒弟"味道的部分。他给的核心素质:

1. 靠谱比聪明重要十倍。 他的精神是——AI 这件事其实不太需要脑子,最重要的特质就是靠谱、做事细、对自己做的事负责任。这话听起来不像研究员说的,更像工程主管说的。但这恰恰是他想强调的——当下 AI 研究已经不是"灵感"驱动,是"执行"驱动。一万个聪明 idea 跑不出一个能用的模型,一百个靠谱的人能跑出来。

2. 自我反思的能力。"自己做的事效果好,是不是真的好?" 这是判断一个研究员能不能长期可信赖的核心。指标好看不等于事情做对了——可能是数据泄漏,可能是评估集偏向,可能是某个伪相关。一个不愿意自检的研究员,效果越"好"越危险。

3. 全局视野。 一个研究员如果做不到对全局去考虑,就不是一个好的研究员。这一条对中国学术圈训练出来的研究员有特别的指向——很多博士被训练成"在小问题上做到极致",但 AI 大模型这种系统性工程不允许你只看自己那块。

4. 人是系统的组件。 他多次表达"人要变成一个更可信可靠的系统的组件"。这听起来像贬低个体,但他的意思是:真正长期能做好 AI 的人,不是来当英雄的,是来当系统里高质量节点的


九、"AI 本质是简单的":当下阶段的认识论

这是访谈里独立成节的一个判断(约 2:35:03)。

他的意思不是 AI 不难,而是:当下阶段,AI 的进展驱动力是非常少数的几个简单原则——预训练 + 后训练 + 算力 + 数据。不是因为聪明,是因为执行。任何把它说得很玄、很有"魔法"的叙事,他都不太信。

这个观点的力度需要放在 AI 行业的话语里看——过去三年,AI 公司的市场营销、技术博客、CEO 演讲,普遍走"我们做了一些非常有创意的算法突破"的叙事。姚顺宇在两家最顶级的实验室都待过,他给出的反面观察是:真正的突破很少来自算法,大多数来自工程

由此他推出对当前阶段研究范式的一个核心判断:AI 进入了一个阶段,大家不担心 AI 能否做到,而是担心这件事是否被良好定义。

这是非常重要的认识论转变。过去几年的核心问题是"能不能"——能不能写代码、能不能多模态、能不能长上下文。现在这些"能不能"大多数都能。当下的瓶颈变成了"怎么定义清楚"——奖励函数怎么写?评估集怎么设计?什么算成功?什么算失败?

他展开讲:纸面上大家看起来差不多,更难的是怎么定义问题、定义想要的行为;问题定义不清楚时,模型差异来自你想象不到的事。

举个例子帮助理解:如果两家公司都想让模型"更安全"——但 A 公司把"安全"定义为"拒绝任何有风险的请求",B 公司把"安全"定义为"在风险请求中给出建设性的替代方案"——这两家公司哪怕用一模一样的算法和数据训练,跑出来的模型行为是完全不同的。真正的差异在问题定义的精度上,不在算法。

这对中国大模型公司有什么启示? 他没明说,但隐含意思是——追上 GPT-4 / Claude 4.5 的能力上限不是最难的;最难的是把每一个具体能力"定义清楚",这需要大量产品判断和细致的评估体系。这一块往往是中国公司被低估的弱点——很多公司有算力、有数据、有论文,但没有把"模型该怎么表现"定义到那种精度

这一段还有一个延伸:做事的系统性。对他来说更重要的是做事系统——当事情和预测不一样时,能否系统性地排除各种可能性。又回到他贯穿全场的研究方法论——研究员的价值不在天才闪光,在系统性排查


十、在 Google DeepMind 训 Gemini 3:组织气质的另一极

2025 年 9 月 29 日他加入 DeepMind,到 2026 年 3 月录这期访谈时大约半年。这段他讲了组织气质对比。

10.1 DeepMind vs Anthropic 的文化对比

Anthropic:top-down、聚焦、研究方向被锁定、资源集中、执行效率高、个人自主性低。

DeepMindbottom-up、去中心化、研究员有更大的方向自主性、协同效率相对低

他描述的差异很具体——在 Anthropic 你拿到的是被框定好的赌注("我们就要在 coding 上 RL 出顶级模型,所有人围绕这个走"),在 DeepMind 你要自己证明赌注("你想做这个方向?说服我,给我看数据")。

这两种文化没有绝对优劣——不同阶段的公司、不同类型的研究员适合不同文化。他自己的偏好显然是后者——这也是为什么他在 354 天后离开了 Anthropic。

10.2 DeepMind 的历史优势仍然在

DeepMind 是 AlphaGo、AlphaFold 的家——它的研究文化天然是"长跑、深耕、bottom-up 探索"。这种文化在大模型 race 的前两年看起来吃亏(OpenAI 跑得更快),但 2025-2026 年 Gemini 系列的反扑证明 DeepMind 的底子还在——尤其在长上下文多模态科学应用几个方向上,Gemini 在 2025-2026 年开始建立明显的差异化优势。

姚顺宇没有过多展开 Gemini 3 的具体训练细节(NDA 限制),但他强调了一个判断:Gemini 在长上下文上的代际优势是真实存在的。这呼应了他前面提到的 "train with finite context, use as infinite context" 方向——Gemini 团队在这个方向上有积累。

10.3 选择 DeepMind 的另一层逻辑

除了价值观因素,他选 DeepMind 还有一个研究上的动机——Google 作为搜索 + 内容生态的母公司,能给模型训练提供 Anthropic 拿不到的训练资源。视频、长文本、跨语言、多模态——这些数据的覆盖度,Google 内部生态有结构性优势。这对一个"想做硬的训练问题"的研究员来说是吸引力。

10.4 公司情绪的微妙

访谈里他对 DeepMind 的描述比对 Anthropic 更轻松、更有掌控感——但他也提醒自己(和读者):他在 DeepMind 才半年,还没经历过那种"在大尺度下保持稳定"的考验。他对 DeepMind 的判断目前是积极的,但他不下绝对结论。这种克制的诚实也是这场访谈让人信服的原因之一。


十一、技术预测和组织搭建:2026 年的具体押注

这一段是访谈最后部分的核心(约 3:01:28)。

11.1 技术预测

1. 预训练继续 scale,至少未来几个月没看到撞墙。不是"预训练永远不会撞",是当下还没到撞的位置。

2. 长上下文范式变革:"Train with finite context, use as infinite context." 这是他点出的最具体的下一个技术跃迁方向。

3. Agentic coding 继续是 AI 唯一真正原生且成功的场景——其他场景还在试探。和他前面的产品判断完全一致。

4. Agent 的真正落地受限于"问题定义"而非"模型能力"。换言之,2026 年的 Agent 突破不会来自更聪明的模型,会来自更精确地定义 Agent 要做什么

5. 机器人和量子计算是 underdog 的机会区——对年轻人友好,对大厂资源垄断不友好。

6. AI 中心化加剧——大部分价值集中在少数公司、少数产品、少数人手里。

11.2 组织搭建

关于怎么搭一个好的 AI 团队,他的核心观点:一个好的 AI 团队不是天才聚集地,是高质量靠谱组件的网络。

招人时的取舍:宁可要靠谱平均水平的人,也不要不靠谱的天才。

这条对管理者特别有杀伤力——很多 AI 团队的失败不是因为没招到聪明人,是招了太多无法被信任的"明星"。一个不靠谱的天才会污染整个系统——他/她的实验结果你不能信、写的代码别人不敢碰、优先级和团队不对齐——长期看是负资产。

他延伸了一个具体建议:信任的本质是反思。真正可信赖的研究员会反思"自己做的事效果好,是不是真的"——而不是只在指标上下功夫。一个不会自检的研究员,跑得越快越危险

11.3 "在大尺度下保持稳定"

他还提到一个非典型管理理念:研究员关键问题不是"我能不能做出好结果",而是 "在真正大的尺度下,我是否能保持稳定"

单次实验跑出好结果不难,难的是在几个月、几个季度的尺度上,对几十个并行实验都保持质量短期亮眼的研究员很多,长期稳定的研究员极少——后者才是真正的稀缺资源。


十二、集体主义胜利:英雄主义已过去

整场访谈最让人记忆深刻的一段,也是 B 站简介里挑出来的副标题。

12.1 主论点

AI 个人英雄主义时代已经过去了,所以也没有什么英雄。

这句话不是煽情,是结构性判断。

12.2 结构性论证

第一,规模本身决定了个体不可能是关键变量。 当下做出一个顶级模型需要几百人、几亿美金算力、几个月时间的协同。预训练动辄 10²⁵ FLOPs,需要几万张 GPU 集群、几百个工程师维护 infra、几十个研究员负责数据/算法/评估、几个产品方负责对齐目标。任何一个环节出问题,整个东西都会塌。

在这种规模下,没有任何单个个体能决定结果。 即使是 Ilya Sutskever、Demis Hassabis 这种级别的人物,离开当时的组织也无法独立做出一个 GPT-4 级别的模型。

第二,因此个体在大叙事里的位置变了:现在大家都是冲浪的人,本质上是那个浪,而不是冲浪的人。这句话的精妙在于"本质上是那个浪"——意思是个人的成功不是个人能力使然,是被时代浪潮托起来的。研究员从"英雄"变成"浪上的一个点"

第三,真正重要的不是个人能力上限,是集体的稳定性:在真正大的尺度下,能否保持稳定?这需要理解系统和对公司的责任。

由此他对自己的工作描述也是克制的——他强调自己只是有机会在那个时候加入了一个重要的项目。注意措辞——是"有机会加入",不是"做出了什么"。他反复警惕对个人的神话叙事。

12.3 推论:AI 的社会影响

由集体主义胜利,他推出一个对社会影响的尖锐判断:AI 是一个很中心化的技术,会让少部分人变得更强,但让大部分人失去独特价值。

这是他对 AI 社会影响最冷的一句话——不是乐观也不是悲观,是结构性的

少部分人变得更强:他们站在 AI 这个杠杆的支点上,工作产出被放大几个数量级——头部模型公司的研究员、能高效用 AI 的产品经理、能定义 AI 任务的少数人。

大部分人失去独特价值:他们过去的工作正好是 AI 现在能替代的——执行型程序员、初级翻译、初级写作、初级客服、初级分析师。"独特价值"消失,不是说人没有价值,是说他们能向市场提供的差异化贡献被 AI 抹平了

这个判断不光适用于行业,也适用于个人选择——站在杠杆支点上的人和被杠杆拍平的人,差距会迅速拉大

12.4 给年轻人的建议(密度最高的一段)

1. 离开学校就是自己的 career:在学校可以有学生心态,离开学校后是自己的 career,得给自己找一条路。警告:很多人离开学校后还在用学生心态——等老师/老板分配任务、等导师指方向、等组织认可——这种心态在 AI 时代会被快速淘汰。

2. 不要伺候老登:人这一辈子也没多长,为什么要把自己的时间浪费在伺候老登身上。"老登"是网络词,指资深权威人物(特别是那种依赖权威关系而非真实贡献的)。这句话非常直接,对中国职场文化的隐含批评强烈——很多年轻人在国内职场被训练成"先服侍权威、再争取空间",他直接说这是浪费生命

3. 不必怕得罪人:不用太担心因为自己的观点而惹到什么人,只要观点是自洽的、有一套自己的理解,大家会尊重你。这一条他自己就身体力行——他公开离开 Anthropic 时直接写 "better without you",得罪了一家市值千亿美金的公司,但他的判断力反而因此被行业更尊重

4. 客观评价标准存在:最终你在这个领域做得怎么样,是有客观的评价标准的。不是看你混得多熟、人缘多好,是看你做出了什么。这条对那种"在大厂用关系混上去"的路径是釜底抽薪——长期看,没有客观贡献的关系会贬值

5. 没有谁可以养老在生成式 AI 这个领域没有谁可以养老,除非你已经完全对技术没有兴趣、对自己没有追求。包括他自己——他离开 Anthropic 是为了继续在前沿打仗,不是为了 Google 更好的福利或工作生活平衡。


收尾:把这场访谈浓缩成一张卡片

如果你只能记住 10 件事:

  1. Pre-train 没撞墙——两家顶级实验室一手数据验证。撞墙错觉多半是自己代码有 bug。
  2. Agentic coding 是当下唯一真正成立的 AI 原生场景,其他场景还没出现真正的数据飞轮。
  3. AI 本质是简单的——简单算法 + 强大 infra。差距出在执行、出在 bug、出在问题定义。
  4. 当下瓶颈不是"AI 能不能做",是"问题能不能定义清楚"。模型能力被任务定义精度约束。
  5. 程序员 M 型分化:系统设计 + 业务判断变得更值钱,执行型工作快速消失。中间层最危险。
  6. 个人英雄主义已经过去。做 AI 是几百人协同 + 几亿算力,重要的不是天才,是高质量靠谱组件。
  7. 靠谱比聪明重要十倍。AI 这件事不太需要脑子,最重要的特质是靠谱。
  8. AI 是中心化技术,少数人变得更强、大多数人失去独特价值。
  9. 机器人和量子计算是年轻人的 underdog 之地——大厂还没形成绝对压制。
  10. 没有人可以在生成式 AI 里养老,除非已经对技术失去兴趣。

姚顺宇这场访谈的姿态

不浪漫化技术、不浪漫化个人、不浪漫化未来。

他对 AI 行业的观察既不像 Sam Altman 那样"AGI 改变人类"的宏大叙事,也不像 Yann LeCun 那样"现在 LLM 不行"的保留态度——他冷静地站在工程现场说:当下行得通、未来还有路、但不要把它包装得很神。

他对个人选择的态度也对应:不要等被认可、不要伺候老登、不要怕得罪人、做事要有客观标准、生成式 AI 里没有养老。这些建议给中国年轻研究员的指向尤其明确——别走人情关系路径,走客观贡献路径。

最后他自己说的话是这场访谈最好的注脚:"请允许我小疯一下。" 他在访谈里没真的疯——他只是把行业里很多人不敢公开说的判断说了出来。


原节目与公开资料来源

原节目入口(强烈推荐听完整版):

事实交叉验证用的公开二手报道:


版权与转载

  • 原节目 © 张小珺《商业访谈录》。本文不复制原节目内容,仅基于公开报道做二手归纳与评论。
  • 本文 为个人阅读笔记,欢迎转载,请保留作者署名与原文链接。
  • 若你时间充裕,强烈建议绕过本笔记,直接听 4 小时原节目——观点的密度、姚顺宇的语气、张小珺的提问节奏,都是二手归纳无法复刻的。