2026年5月,张小珺商业访谈录连续发布两期重磅节目:E140对话姚顺宇(Anthropic→DeepMind,参与Claude 3.7/4.5和Gemini 3训练),E139对话苏煜(OSU教授,NeoCognition创始人,$40M seed)。一位是inside the room的一线模型训练者,一位是outside looking in的Agent学术谱系学者。两篇访谈合计6小时,覆盖了从Pre-train到Agent、从蒸馏到组织、从物理直觉到商业预测的完整图谱。
本调研以五步法(表象→规律→类比→回验→预测)系统提炼两篇访谈的核心洞察,并用多源交叉验证确保结论可靠性。
身份:Google DeepMind研究科学家(原Anthropic)
背景:清华+斯坦福物理博士(9年非厄米/量子/高能物理)
核心经历:参与Claude 3.7、4.5和Gemini 3的训练
视角:inside the room——一线训模型的人怎么看这行
核心论断:AI不需要天才,需要靠谱;英雄主义已死
身份:OSU计算机系教授 + NeoCognition创始人
背景:Semantic Parsing先驱 → Language Agent转型者
核心经历:2025斯隆研究奖;NeoCognition $40M seed
视角:outside looking in——70年Agent史的学术谱系学者
核心论断:语言是通用脚手架;专业化>通用化
集体主义胜利
可靠性是真正壁垒
驱动力
工程执行 vs 理论框架
Musk Macrohard
$6-7B视觉Agent赌注
姚顺宇的这些话不是谦虚,而是一种冷静的观察。他在Anthropic和DeepMind两家中参与了核心模型的训练——Claude 3.7是"后训练大规模化"的起点,Claude 4.5是对齐和能力的平衡,Gemini 3则是Google的最新主力。他的结论来自一手经验:模型训练已经变成了集体工程,而不是天才的手工活。
苏煜从学术视角给出了平行论证:Agent不是某个人的发明,它贯穿AI的70年历史——从1960年代的Logical Agent,到2000年代的Neural Agent,到2010年代的Semantic Parsing,再到2022年以来的Language Agent。每一步都是几十人、几百人的集体工作累积而成。他对神话个体的叙事同样保持警惕。
这个规律的驱动力很清晰:模型规模扩大→训练成本指数级上升→一次训练失败的成本变得不可承受→工程纪律成为刚性约束→"靠谱"成为最稀缺的品质。
类比:这就像航空航天——莱特兄弟时代靠的是个人勇气和手工直觉,但波音737 MAX出事是因为软件工程出了bug,不是因为飞行员不够天才。当系统复杂度超过一定阈值,个人英雄主义不再是优势,反而是一种风险。
这个类比极其精确。冲浪者的技术当然重要——站得稳不稳、转向灵不灵。但决定你能走多远的,是浪本身。在AI行业,"浪"是算力规模、数据质量、训练infra和团队协作的系统性能力。任何单个研究者,无论多聪明,都只是在已经形成的浪上做微调。
| 现象 | 规律解释力 | 说明 |
|---|---|---|
| Claude/GPT/Gemini训练团队动辄上百人 | ✅ 匹配 | 集体工程已是标配 |
| 姚顺宇说"我不重要,是幸运" | ✅ 匹配 | 一线训练者的直接印证 |
| AutoGPT病毒传播后实际能力很差 | ✅ 匹配 | 个人英雄式项目不可靠 |
| Dario Amodei个人品牌仍然极强 | ⚠️ 部分偏离 | CEO品牌≠模型训练的个人英雄 |
| Ilya Sutskever离开OpenAI | ⚠️ 部分偏离 | 顶尖研究者仍有独特价值,但转向了新方向 |
| Cursor两个创始人做出爆款产品 | ❌ 例外 | 应用层仍然有"小团队英雄"空间——但前提是市场够窄、速度够快 |
⚠️ 回验注意:Cursor是例外,但姚顺宇自己解释了——"要么成长够快(Cursor),要么市场够小(Midjourney);否则都被收购。"应用层仍有个人英雄空间,但模型层几乎没有了。
苏煜引用Stuart Russell的亲口说法:"虽然所有人都认为《Artificial Intelligence: A Modern Approach》是一本AI书,但本质上它是一本关于Agent的书。"Agent研究不是新话题,它从AI诞生之初就是核心问题,只是被拆分成了不同的子领域。
| 时代 | 范式 | 核心思想 | 代表工作 |
|---|---|---|---|
| 1960-1990s | Logical Agent | 基于逻辑规则的推理与规划 | STRIPS, Prolog, GOFAI |
| 2000s+ | Neural Agent | 神经网络驱动的感知与决策 | DQN, AlphaGo, 机器人学习 |
| 2010s | Semantic Parsing | 自然语言→可执行程序的映射 | Percy Liang, Luke Zettlemoyer的工作 |
| 2022+ | Language Agent | LLM作为语言脚手架,统一感知/推理/行动 | ReAct, Toolformer, OpenClaw |
苏煜是少数横跨Semantic Parsing和Language Agent的学者。他指出,很多人后来在LLM和Agent上做出大贡献的,其实都是从Semantic Parsing来的——比如Percy Liang(Stanford)、Luke Zettlemoyer(UW/Meta)。Luke Zettlemoyer主导的Toolformer论文(2023年2月),被Satya Nadella在公司内部全量转发,被认为是微软认知到Agent重要性的标志时刻。
Chris Manning(Stanford NLP)最近在播客中的观点与苏煜高度一致:人类和黑猩猩的智力差异,不是因为视觉更敏锐(我们的视觉可能比很多动物更差),而是因为语言独特——这是人类文明的根本原因。
类比展开:ChatGPT不是GPT-3的技术突破,而是把已有能力包装成"人人都能用的对话界面"的交互突破。OpenCloud对Agent做的是同一件事——不是新算法,而是让普通人第一次感受到"Agent可以帮我做事"。两者都不是技术跃迁,而是交付范式的跃迁。
苏煜的判断更倾向左侧,但他承认这是一个正在争论的问题。他的语义网类比很有力——Tim Berners-Lee推了20年语义网,全世界都没有重写。如果Agent需要整个互联网都变成API,那这件事也可能推不动。但Musk的Macrohard走了一条完全不同的路线:用视觉(实时截屏+视频流)而非语言/脚手架来做Agent——这是一场范式之争,目前胜负未分。
姚顺宇在访谈中专门留了一个章节聊"字节和豆包"(00:51:25)——这本身就是信号。硅谷一线训模型的人,已经需要认真讨论中国公司的产品了。
苏煜的论证更系统化。他引用了Eric Schmidt(前Google CEO)的观点:"美国在应用层普遍慢得多。"苏煜认为在AI时代,这是一个很大的优势——因为基础模型智能已经越过一个"够用"的临界点。
美国的AI辐射像iOS——底层极强,应用受控,质量高但慢。中国的AI辐射像Android——底层开放,应用爆发式增长,质量参差但速度极快。当底层"够用"后,应用生态的丰富度和迭代速度成为决定性的差异化因素。
| 现象 | 规律解释力 | 说明 |
|---|---|---|
| 字节豆包用户量快速突破 | ✅ 匹配 | 全民化驱动+移动端基因 |
| 某公司AI员工服务全员 | ✅ 匹配 | 应用层速度=核心竞争力 |
| OpenAI/Anthropic在中国影响力弱 | ✅ 匹配 | 美国应用层天然慢 |
| 中国基础模型仍落后GPT一代 | ⚠️ 部分偏离 | 应用层快≠模型强,但"够用"阈值已过 |
| 部分中国AI产品体验粗糙 | ❌ 例外 | 速度优势的代价——质量控制不足 |
姚顺宇从模型训练视角:训练一个前沿模型的成本已经到了"一次失败不可承受"的程度。在这个成本约束下,"靠谱"不是美德,是生存必需。做事细、对结果负责、能复现——这些"不性感"的特质,才是真正有壁垒的能力。
苏煜从Agent应用视角:当前Agent(无论是Claude Code、OpenClaw还是其他工具)成功完成任务的比率大约只有50%。这意味着每次使用Agent,你都在"赌"——赌它能完成,赌它不出错。这个50%的可靠性,是Agent从demo走向生产的最大障碍。
苏煜估计,Claude Code/OpenClaw等
SparkCo 2026 benchmark
模型不一致性导致
这个规律的底层逻辑是信任经济学。AI产品不像传统软件——传统软件的bug是"异常",用户可以容忍;AI产品的失败是"常态",用户会怀疑"是不是整个产品都不靠谱"。一次失败对信任的破坏,需要十次成功来修复。
信任像银行存款——每次Agent成功完成任务,存入一笔小额定存;每次失败,取出一笔大额活期。存入10次可能积累100分的信任,取出1次可能扣掉80分。这就是为什么"50%成功率"看起来还不错,实际上让信任永远在0附近波动。
| 产品/现象 | 规律解释力 | 说明 |
|---|---|---|
| Claude Code 高精度模式成功 | ✅ 匹配 | 聚焦coding+可靠性=口碑飞轮 |
| OpenClaw 功能强但不稳定 | ✅ 匹配 | "有时候完美有时候什么都没做" |
| AutoGPT病毒传播后快速沉寂 | ✅ 匹配 | demo很酷,但实际能力≈0 |
| Cursor快速占领开发者心智 | ✅ 匹配 | 可靠性+速度=口碑飞轮 |
| ChatGPT仍是最广泛使用的AI | ⚠️ 部分偏离 | 先发优势+品牌惯性也有影响 |
姚顺宇和苏煜的交叉验证给出了一个清晰的AI产品原则:不是所有"能做到"的事都"该做"。产品决策应该从"我们能做到什么"转向"我们能做到且做可靠的是什么"。这个转变,就是从"炫技模式"到"靠谱模式"。
苏煜的"百万小世界"理论与Skill市场的逻辑完全一致:通用Agent可靠性50%,但限定领域的专业Agent可以达到95%+。专业化不是限制,而是可靠性提升的路径。每个Skill就是一个小世界的专家。
| 领域 | 姚顺宇 | 苏煜 | 交叉验证 |
|---|---|---|---|
| Pre-train | 远没到头,觉得撞墙多半是bug没找到 | "Pre-train也是一种RL" | ✅ 一致 |
| 后训练 | 真正大规模化始于Claude 3.7;关键在数据窄而精 | Agent范式很吃后训练 | ✅ 一致 |
| Coding | 爆发源于奖励信号清晰+GitHub数据基座 | "coding是数字世界最根本的结构层"(引用Dario) | ✅ 一致 |
| 蒸馏 | 硬蒸可耻且蠢;软蒸/聪明蒸是multi-agent先驱 | (未直接讨论) | — |
| 机器人/多模态 | 还没到GPT-1阶段,在特征工程时代 | 需要Continual Learning+世界模型 | 互补 |
| Chatbot形态 | "蠢",远不是终极形态 | OpenCloud=交互范式突破 | ✅ 一致 |
| AI安全 | Anthropic"造最强模型才有话语权"太天真,类比核武多方威慑 | 真正担心的是失业而非奇点 | ⚠️ 侧重不同 |
2026年3月11日,Musk公布了一个名为"Macrohard"(Microsoft的反面翻译)或"Digital Optimus"的xAI+Tesla联合项目。这个项目的核心是:用Grok作为"导航大脑"(System 2),Tesla构建的AI Agent处理实时截屏+键盘鼠标操作(System 1),目标是"模拟整个软件公司的功能"。
为什么重要:苏煜在访谈中短暂提到,几乎所有分析师都没关注。但这是一条与"语言脚手架"范式完全不同的技术路线——走Tesla FSD的小模型+视觉端到端路线。如果Musk赌对了,整个Language Agent范式可能被Vision Agent范式挑战。
现状:仍处早期阶段,beta预计2026年底,公开发布可能2027年中。但$6-7B的投入规模已经说明这不是实验项目。
苏煜指出:2023年3月的AutoGPT在GitHub star增速与OpenCloud几乎一样——但"它实际能做的事非常非常少"。真正的价值在于每一波炒作退潮后留下的基础设施和公司:AutoGPT → Lovable;OpenCloud → ?
关键问题:当前OpenCloud热潮会退,但会留下什么?如果AI产品只做demo不做可靠性,就会重蹈AutoGPT的覆辙。能留下来的,一定是"靠谱"的那批。
姚顺雨2025年从OpenAI跳到腾讯,姚顺宇同年从Anthropic跳到DeepMind。两位清华同届毕业生,同一年跳槽。信号:顶级人才在"御三家"之间的流动加速——不是对原公司不满,而是对新技术方向的追逐。对组织的稳定性提出新挑战。
| 现象 | 规律解释力 |
|---|---|
| 模型训练团队动辄上百人 | ✅ 集体工程已是标配 |
| 姚顺宇"我不重要,是幸运" | ✅ 一线训练者的印证 |
| Agent成功率只有~50% | ✅ 可靠性阈值未过 |
| 中国应用层速度优势 | ✅ 结构性差异,非努力差异 |
| Cursor/Midjourney小团队成功 | ⚠️ 应用层仍有英雄空间 |
| Musk走视觉Agent路线 | ❌ 可能挑战语言Agent范式 |
| 术语 | 含义 | 来源 |
|---|---|---|
| Pre-train | 预训练,在大规模数据上训练基础模型的过程 | 姚顺宇:"Pre-train没有到头" |
| Post-train / 后训练 | 预训练之后的微调、对齐、RLHF等阶段 | 姚顺宇:"真正大规模化始于Claude 3.7" |
| 硬蒸 | 暴力蒸馏——直接用API大量调用模型输出做训练数据 | 姚顺宇:"硬蒸可耻且蠢" |
| 聪明的蒸(软蒸) | 策略性蒸馏——用multi-agent交互生成更高质量的训练数据 | 姚顺宇:"软蒸是multi-agent训练的先驱" |
| Language Agent | 以LLM语言能力为脚手架的Agent范式 | 苏煜:"语言是通用脚手架" |
| Semantic Parsing | 语义解析——将自然语言映射为可执行程序 | 苏煜的学术背景 |
| Computer Use Agent | 通过操作计算机GUI完成任务的Agent | OpenCloud、Macrohard的路线 |
| Forward-deployed Engineer | 驻场工程师——AI公司派人到客户现场帮助建Agent | 苏煜:"Agent还不够可靠" |
| Constructive Validity | 建构效度——benchmark评估的应与实际价值正相关 | 苏煜的评估哲学 |
| Specialized Intelligence | 专业化智能——在特定领域达到专家水平的AI | NeoCognition的创业定位 |
| World Model | 世界模型——对特定环境的规则/关系/约束的内部表征 | NeoCognition核心研究方向 |
| Macrohard / Digital Optimus | Musk的xAI+Tesla联合项目,走视觉Agent路线 | CNBC 2026-03-11报道 |
| ReAct | Reason+Act——CoT扩展到外部环境的Agent框架 | Yao Shunyu (Princeton) 2022 |
| Toolformer | 首个用LM做工具使用的论文 | Luke Zettlemoyer (Meta) 2023 |
| Chain of Thought (CoT) | 思维链——让模型逐步推理的技术 | Google 2022 |
出生在宁夏大武口(一座因煤矿而生的城市),小学到高中在上海。高中择校时放弃上海四大名校普通班,选择格致中学竞赛班——"赤脚的不怕穿鞋的,值得一试。"这种"总想挑战自己不太会的事"的性格贯穿了他的学术路径。
清华基科班→斯坦福物理博士(师从Douglas Stanford和Stephen Shenker,研究非厄米系统、量子引力、高能物理)→博士毕业后毅然离开9年的物理,转行AI→Anthropic(参与Claude 3.7/4.5训练)→Google DeepMind(参与Gemini 3训练)。
物理对他最大的影响:刨根问底、系统性排查问题的性格。在模型训练中,这种性格转化为对loss landscape和训练动力学的直觉——"Pre-train没有到头,觉得撞墙多半是bug没找到。"
俄亥俄州立大学计算机系教授,2025年斯隆研究奖得主。最早从Semantic Parsing转型做Language Agent的学者之一。与清华唐杰团队有合作(AgentBench),是智谱AutoGLM系列的技术关联者。
2024年创办NeoCognition,6个月融完$40M seed(Cambium Capital + Walden Catalyst领投,Vista Equity跟投,天使投资人包括Intel CEO Lip-Bu Tan、Databricks联合创始人Ion Stoica、Dawn Song、Luke Zettlemoyer、Ruslan Salakhutdinov)。公司定位:Agent Research Lab for Specialized Intelligence——不做通用智能,做"百万小世界"的专家级Agent。
他的思维方式:喜欢搭conceptual framework,从长周期看技术演进。Jeff Hawkins的《A Thousand Brains》是他的理论灵感来源——"每个皮层柱都在学习一个世界模型,这个世界模型不限于物理世界,还包括语言、数学系统和各种抽象概念。"
如果把AI的发展分成两幕,第一幕是ChatGPT式的"能做"——证明大模型能做到以前做不到的事。第二幕是Agent式的"可靠"——让能做到的事变得稳定可依赖。姚顺宇从模型训练侧看到了第二幕的工程要求,苏煜从Agent应用侧看到了第一幕的交付不足。两条线在2026年交汇。
交汇的结论只有一个:AI的下一个壁垒不是"更聪明",而是"更靠谱"。这听起来不性感,但它可能是2026年最重要的一句话。