斯坦福教授、扩散模型先驱、Inception 联合创始人兼 CEO Stefano Ermon 向 Sarah Guo 论证:下一轮 AI 竞争的主战场是推理效率而非训练规模;diffusion LLM 因并行生成多 token、工作负载更接近训练,能更好吃满 GPU,将在延迟敏感场景击败自回归模型。Inception 的 Mercury 系列已对标 Haiku/Flash/mini 级质量,并宣称约 5–10× 更快;语音 agent 客户 OpenCall 甚至能从 Cerebras 定制芯片切回普通 Nvidia GPU。
- 推理经济学 > 预训练军备:下一阶段比拼 intelligence per watt/dollar。
- 2017 类比的推理版:更并行的生成范式最终更吃硬件。
- 速度是可测楔子:先打 Haiku/Flash/mini 档,再追巅峰智商。
播出信息
- 日期:2026-09-18(来自 RSS
pubDate) - 节目:No Priors(主持人 Sarah Guo)
- 嘉宾:Stefano Ermon(Stanford CS;Inception Labs 联合创始人 / CEO)
- 时长:约 38:13(2293 秒)
- 音频:Megaphone MP3
- YouTube(全集):N1rjtDs8blY(2294s,@NoPriorsPodcast)
- 单集页面:Podtail
- 分析主来源:BigGo 对本集的长文摘要(无本集公开完整 EN 转写;未使用 Whisper)
背景
【节目内】 生成式 AI 撞上硬件与延迟瓶颈;几乎所有 frontier lab(OpenAI、Anthropic、Google、Meta)文本/代码默认仍是自回归——逐 token 从左到右生成。Ermon 把 2017 年 RNN→Transformer(训练侧并行化)的类比搬到推理侧:自回归推理仍是串行、偏 memory-bound,与 GPU 不匹配;diffusion 从噪声逐步精炼、一次改许多 token,推理工作负载「basically very very similar to the workload you have for training」。
【背景补充】 Ermon 实验室 2019 年前后在 score-based / diffusion 上的工作成为图像/视频生成主流技术底座之一;离散文本上的扩散长期难做,直到约 2024 年以 GPT-2 规模展示困惑度可对齐自回归且生成约 10× 更快,才促成创办 Inception。公开材料中 Mercury / Mercury 2 / 2.5 定位为 diffusion LLM(dLLM),强调在标准 Nvidia GPU 上的高吞吐与 OpenAI 兼容 API。本笔记以章节时间戳 + BigGo 对本集的事实整理为主,不以其他播客(如 TWIML)口述冒充本集对白。
节目结构 / 议程
- 开场与研究背景:从 MNIST 到 score-based diffusion — 00:35 🎧 · ▶️
- 创办 Inception:离散扩散在 GPT-2 规模证明可行 — 02:54 🎧 · ▶️
- 为何 diffusion 会赢推理:并行 vs 自回归串行 — 05:59 🎧 · ▶️
- 离散 vs 连续:文本/代码的「新科学」 — 11:10 🎧 · ▶️
- Inception 今日:Mercury、质量对标与自建 serving — 13:19 🎧 · ▶️
- 速度场景、客户与硬件:OpenCall 案例 — 16:45 🎧 · ▶️
- 与更广行业:护城河 vs 被大厂吸收 — 19:34 🎧 · ▶️
- 数据压缩与结构 — 21:41 🎧 · ▶️
- 可控性:粗到细、中途可 steer — 24:45 🎧 · ▶️
- 涌现能力与工作负载切分 — 27:25 🎧 · ▶️
- 采用挑战、组织与递归自我改进 — 30:03 🎧 · ▶️
- 资源分配、学术界影响与收尾 — 35:10 🎧 · ▶️
分节详解
1) 开场与研究背景:从 MNIST 到 score-based diffusion — 00:35 🎧 · ▶️
💬 他们说了什么: Sarah 介绍 Ermon:Stanford 教授、diffusion 先驱、Inception 联合创始人/CEO。Ermon 回顾 2014 年入职 Stanford 时生成模型仍冷门——在 MNIST 上生成糊数字就算成功,论文常要把生成训练正当化为有监督任务的特征学习。他原以为这会花掉整个学术生涯,承认「timeline 完全错了」。路径历经自回归图像模型、VAE、GAN;2019 年与博士生做 score-based generative models(训练网络去噪,再由此构建生成过程),成为现代 diffusion 的技术基底,现主导图像、视频、音乐乃至大量蛋白生成工作。
💡 为什么重要: 把「contrarian academia bet」写成公司叙事前置:Inception 不是跟风换壳 LLM,而是把已在连续模态打赢的范式硬推到离散文本/代码。
⚡ 争议点: 「先驱」叙事中个人/实验室贡献与领域并行工作的边界,公开摘要未逐篇对比;听众需对照原始论文作者列表。
2) 创办 Inception:离散扩散在 GPT-2 规模证明可行 — 02:54 🎧 · ▶️
💬 真正难点是离散数据:两像素可插值,两词之间未必有意义中间态。把 diffusion 从连续图像延到文本/代码需要「a new science」。约 2024 年的突破:同一 transformer、同一数据,diffusion 训练可在 **GPT-2 规模(<10 亿参数)**匹配自回归困惑度,却因一次输出多 token 而大约 10× 更快——这直接促成创办 Inception。公司约两岁(截至访谈)、约 50 人,重 R&D:训练配方、推理加速、数据配比、RL post-training 基建。
💡 创业触发条件是「学术规模可证伪的速度优势」,而不是口号;后续商业叙事都锚定在可测的 latency/quality frontier。
⚡ GPT-2 规模结果外推到商业/frontier 规模是否成立,仍是核心未解问题;摘要承认「是否更聪明而不只是更快,nobody knows」。
3) 为何 diffusion 会赢推理:并行 vs 自回归串行 — 05:59 🎧 · ▶️
💬 核心类比:2017 训练侧用 Transformer 并行干掉 RNN;推理侧自回归仍「one left to right one token at a time」——不能生成第 10 个 token 除非前面都生成完,这种负载不映射 GPU。Diffusion 从噪声逐步精炼、并行生成多 token,推理近似训练负载。Sarah 总结论点:「The more parallel solution is the one that is eventually going to win。」优势还沿两条轴复合:① 推理时 compute(reasoning)更好 scaling;② RL post-training 被 rollout 生成卡住——更快推理 → 更快自我改进(「If you have a model that scales better at inference time, then automatically you're going to get better scaling during our post training.」)。
💡 这是整集的 thesis:下一时代比的是 intelligence per watt / per dollar,不是谁预训练最大。
⚡ 「最终一定是更并行者赢」是 bitter lesson 风格断言;若专用推理芯片或 speculative decoding / 连续批处理把自回归 gap 收窄,diffusion 的相对优势可能被压缩。
4) 离散 vs 连续:文本/代码的「新科学」 — 11:10 🎧 · ▶️
💬 连续空间依赖几何与插值;离散 token 空间缺乏同样几何,噪声与去噪需重新定义(公开材料中常见做法包括 mask token 式「噪声」与任意顺序填空,使网络可左右上下文并用、一步输出多 token)。Inception 仍大量复用 transformer/attention/公开数据与评测,差异化放在建模目标、采样与 serving。
💡 解释为何「图像 diffusion 已赢」不能自动推出「文本 diffusion 已赢」——中间隔着离散数学与工程栈。
⚡ 具体噪声过程、采样 ODE/SDE 技巧在本集公开摘要中未展开到可复现程度;属 trade secret / 论文细节区。
5) Inception 今日:Mercury、质量对标与自建 serving — 13:19 🎧 · ▶️
💬 初始产品楔子选速度——易测、易卖。Mercury 系列对标 frontier 的速度优化档(Haiku / Flash / mini-nano),宣称质量相当但显著更快。关键工程事实:diffusion LLM 跑不了现成 vLLM / SGLang 一类自回归 serving;公司自建 serving engine、kernels、以及 SFT/RLHF/RL 栈。「Even if you train the diffusion based LLM, if you don't have the serving engine... you're still stuck。」端到端部署倒逼学习,并变成 IP;因此选择不全开源。
💡 护城河叙事从「论文想法」下沉到「serving + kernels + 客户反馈环」——大厂抄论文相对容易,抄生产栈更难。
⚡ 不开放权重/引擎会拖慢生态与采用;与「需要社区」之间的张力在 Adoption 段还会出现。
6) 速度场景、客户与硬件:OpenCall 案例 — 16:45 🎧 · ▶️
💬 速度赢在延迟敏感链路。客户例:OpenCall(语音 agent:ASR → 推理 LLM 做 tool call → TTS)曾靠 Cerebras 定制芯片才达标延迟;改用 Inception diffusion LLM 后,在 Nvidia GPU 上拿到相近速度——供应更足、成本更低、质量更好。硬件互动上,论点是「软件并行架构」可在商品 GPU 上逼近专用推理硅的体验。客户群覆盖编码、搜索、语音 agent 等(公开新闻亦称 Mercury 用量级增长、Enterprise 就绪)。
💡 买家故事极具体:不是「benchmark 快」,而是「能换掉定制芯片」。
⚡ 单一客户案例的可推广性;与 Cerebras/Groq 等推理芯片路线的长期成本曲线对比未在摘要中量化。
7) 与更广行业:护城河 vs 被大厂吸收 — 19:34 🎧 · ▶️
💬 Sarah 提出结构性质疑:新架构常被有算力的大玩家吸收。Ermon 承认 top of mind。分层护城河:研究想法与 trade secrets;serving/kernels;真实部署与客户数据/评测闭环。策略上从第一天就强制端到端上线以积累 serving IP。
💡 定义 startup 在「架构范式转移」中如何活下来——不是赌大厂永远不做 diffusion,而是赌执行与反馈速度。
⚡ Google 等也曾展示 Gemini Diffusion 类工作;大厂一旦认真产品化,50 人公司的窗口可能收窄(公开摘要称部分竞品尚未同等生产化)。
8) 数据压缩与结构 — 21:41 🎧 · ▶️
💬 Ermon 的统一心智模型是压缩:训练即寻找高效压缩数据的方式,「压得越狠,识别的结构/模式越多」。Sarah 追问:人类代码是否「脏」、是否缺少图像那种「真实结构」?Ermon 经验回答:只要能把困惑度打下来,就说明压缩方案成立,结构一定在、模型一定挖到了。仍开放的是 inductive bias:transformer vs 其他、next-token vs denoising 谁是更好的模式发现器——「field lacks the tools to answer that today」。
💡 把「diffusion 是否适合语言」从美学争论拉回可测指标(perplexity / downstream)。
⚡ 困惑度下降 ≠ 下游对齐、长程推理或真实性;压缩叙事可能掩盖评测 gaming。
9) 可控性:粗到细、中途可 steer — 24:45 🎧 · ▶️
💬 产品上追求向后兼容:OpenAI 兼容 API、text in/out、指令遵循与 JSON 等结构化输出;OpenCall 案例中甚至优于被替换模型。结构优势:自回归往往要等整段生成完才能对约束/奖励打分;diffusion 粗到细,生成早期就能判断「像不像目标对象」并朝外部 reward/约束 steer。学术上有大量证据表明 diffusion 更易控,部分 steering 方法自回归根本没有。Inception 在想:哪些产品体验建立在「自回归没有的能力」上。
💡 速度是楔子;可控性/对齐可能是第二增长曲线。
⚡ 文本侧可控性优势是否已变成可感知产品,还是仍偏学术;摘要未给出可复现 demo 指标。
10) 涌现能力与工作负载切分 — 27:25 🎧 · ▶️
💬 数据效率直觉:diffusion 训练对同一样本加噪再去噪,相当于多种噪声视图的数据增强——若规模上成立,则在数据(而非算力)瓶颈时更有吸引力。Ermon:「We don't know what we're gonna find。」工作负载:估 OpenRouter 任务分类中约 20–30% 以延迟为主导(研究、对话、编码、软件工程、日志等)——可寻址市场且是下界。未来可能是 diffusion 与传统自回归并存,而非瞬时全面替换;延迟敏感与 agent 紧循环最吃香。
💡 给投资/产品划定「先赢哪一块」:不是挑战 Opus/Pro 巅峰智商,而是吃透速度档与实时环。
⚡ 20–30% 为口述估计;「最终更智能」仍明确未知。
11) 采用挑战、组织与递归自我改进 — 30:03 🎧 · ▶️
💬 采用障碍包括:生态工具链(IDE/agent 框架)默认自回归;serving 不通用;教育成本。组织上拆成 product/platform(服务当前最好模型)与 research(做下一代);瓶颈常是算力而非人头。对 recursive self-improvement:大量使用 frontier 模型加速迭代,但截至访谈仍认为人类巧思关键——提出正确想法、剪枝搜索空间、识别方向;不愿预测六个月后局面。
💡 降温「dLLM 一夜取代一切」预期,同时解释为何小团队仍要重仓基础设施。
⚡ 「算力瓶颈」是否掩盖配方/人才瓶颈;RSI 立场偏谨慎,与部分加速主义叙事不合拍。
12) 资源分配、学术界影响与收尾 — 35:10 🎧 · ▶️
💬 资源上持续重仓训练与推理栈。谈到 academia:早期 diffusion、Flash Attention、DPO(被广泛用于 LLM 与 diffusion 对齐)等皆出自其 Stanford 群体相关工作;主张学界允许 contrarian bets,「there are gems」,但「never enough resources / if we had more compute we could be more efficient」。收尾回到效率定义下一轮竞争:谁能更便宜、更快地供给智能。
💡 把公司故事嵌回「学界仍能出基础设施级算法」的元论点,呼应开场。
⚡ 单项算法归属常有多机构并行贡献;DPO 等需对照原始论文作者与后续工业改写史。
人物与机构
- Stefano Ermon:嘉宾;Stanford;Inception CEO/联合创始人
- Sarah Guo:No Priors 主持人
- Inception Labs / Mercury(dLLM):产品
- OpenCall:语音 agent 客户案例
- OpenAI / Anthropic / Google / Meta:自回归默认对照
- Cerebras(及 Groq 等推理芯片叙事):被「GPU + diffusion」替代的对照
- Nvidia GPU / H100 等:部署基底
- vLLM / SGLang:自回归 serving 生态(diffusion 不兼容)
- OpenRouter:任务分类与延迟敏感比例的参照
- Menlo、Mayfield、Innovation Endeavors、M12、Snowflake、Databricks 等(公开融资背景);个人支持者含 Andrew Ng、Andrej Karpathy、Eric Schmidt 等(公司公开材料)
数字与证据
- 时长 2293s ≈ 38:13;YouTube 全集 2294s
- 公司约 2 年、约 50 人(访谈时点)
- GPT-2 规模论文级结果:困惑度对齐 + 约 10× 更快
- 商业宣称:相对速度优化自回归模型约 5–10× 更快
- 延迟敏感负载估计:20–30%(OpenRouter 分类口述)
- OpenCall:自 Cerebras 定制硅迁到 Nvidia GPU 上的 diffusion LLM
- Mercury 公开吞吐数字(新闻侧,非本集必述):H100 上数百–一千+ tokens/s 量级——写入时需与官方 blog 核对
金句
- 「更并行的方案最终会赢。」— The more parallel solution is the one that is eventually going to win.(Sarah 总结)
- 「自回归仍是从左到右一个 token;这种负载映射不好 GPU。」
- 「Diffusion 推理工作负载 basically 非常像训练。」
- 「推理缩放更好,post-training 缩放也会更好。」
- 「没有 serving engine,训练出 diffusion LLM 也 stuck。」
- 「困惑度能打下来,结构就一定在。」
- 「We don't know what we're gonna find.」(涌现/数据效率)
- 「是否最终更聪明而不只是更快——nobody knows。」
争议与需核实
- 本集无找到公开完整 EN 转写;细节依赖 BigGo 摘要与章节,可能有转述误差。
- 5–10× / 10× 速度对比的基准模型、batch、硬件与测量口径。
- OpenCall 案例的独立确认与是否可推广。
- 20–30% 延迟敏感比例的统计方法。
- Mercury 与 Claude Haiku / GPT mini / Gemini Flash 的第三方评测对齐(Artificial Analysis 等)。
- 「学术界出品 Flash Attention / DPO」的贡献边界表述。
- 大厂 diffusion 语言项目的真实进度 vs 访谈时点认知。
- 短视频 clip
6ux4t8VOdsI非全集;全集 ID 为N1rjtDs8blY。
来源
- YouTube 全集:YouTube
- 音频
- 单集页:podtail.com
- RSS:音频
- BigGo 本集长文:finance.biggo.com
- GUID:
51c4092c-b309-11f1-8603-fb8d30e1277f - 日期:2026-09-18(RSS)
- EN 来源说明:chapters + public summaries only(无 Whisper;无中文转写页)