Aftercasting
Dwarkesh

AI researchers debate how close we are to recursive self-improvement

2026-09-19

三位「相对开放」阵营的一线研究者钢化「2036 仍无超级智能爆炸」的技术理由:持续 sim-to-real 缺口、锯齿能力与判断力瓶颈、以及当前 Transformer+RL 范式距全局最优仍可能差一次不连续创新;同时深入蒸馏/路由器数据如何削弱中心化、长程 RL 能否炼出可部署远程员工、部署学习 vs 数据中心模拟、数据对进步的解释力、RL 为何比「每 episode 一比特」直觉更成功,并以快速问答给出远程工人 / 10× 研究加速 / ASI 时间表。

  1. 无 RSI 的技术钢化:持续 sim-to-real、判断力瓶颈、或距全局最优差一次当前配方发现不了的不连续。
  2. 最后人类工作常是定义目标(含对齐规范),优化可更早自动化。
  3. 蒸馏 + 真实提示分布(含路由器数据) 强力反中心化;难度≠真实感。

AI researchers debate how close we are to recursive self-improvement|深度中文详解

嘉宾:John Schulman · Beren Millidge · Charlie O'Neill · 日期:2026-09-11(PT)


播出信息

  • 日期:2026-09-11(PT;RSS pubDate Fri, 11 Sep 2026 16:28:11 GMT)
  • 嘉宾:John Schulman(Thinking Machines 首席科学家;前 OpenAI 联合创始人、RLHF 关键贡献者);Beren Millidge(Zyphra CTO);Charlie O'Neill(Baseten 模型训练负责人)
  • 时长:5821 秒(约 1h37m)
  • 官方章节末段起点:5312s(≈91.3% of 5821)——满足 seek 覆盖 >70%

节目结构 / 议程

  1. 开场与钢化「无 RSI」:Moravec、循环震惊与范式天花板 — 00:00 🎧 · ▶️
  2. 不连续创新、Elo 穿越与目标设定作为最后人类工作 — 00:00 🎧 · ▶️
  3. 中国实验室、蒸馏与反中心化:提示分布与路由器数据 — 18:39 🎧 · ▶️
  4. 自动化 AI 研究者如何训练:人类品味、环境补丁与可验证超人类目标 — 28:06 🎧 · ▶️
  5. 长程 RL 赌注:远程员工、按域烘焙与部署学习缺失 — 33:51 🎧 · ▶️
  6. Sim-to-real、累积任务 vs 非平稳、样本效率百万倍差距 — 45:24 🎧 · ▶️
  7. 数据解释了多少进步:梯子、Talkie、过滤 vs 创造比特 — 1:00:33 🎧 · ▶️
  8. RL 为何比「每 episode 一比特」更成功:中训热身、信噪比与视界泛化 — 1:18:03 🎧 · ▶️
  9. Move 37、熵塌缩与蒸馏单一文化 — 1:24:54 🎧 · ▶️
  10. 快速问答:远程工人、10× 研究加速与 ASI — 1:28:32 🎧 · ▶️

分节详解

1) 开场与钢化「无 RSI」:Moravec、循环震惊与范式天花板 — 00:00 🎧 · ▶️

💬 他们说了什么: Dwarkesh 请来三位能公开说话的「半开放」研究者朋友:Zyphra CTO Beren、Thinking Machines 首席科学家 / 前 OpenAI RLHF 关键人物 John、Baseten 训练负责人 Charlie。核心反事实:若到 2036 仍没有数十亿疯狂超级智能彻底改写世界(排除战争/禁令等外生冲击),最可能的技术原因是什么?Beren:类似 Moravec——模型把人们以为「一旦做到就会改天换地」的硬题(棋、难数学)都解了,但冲击不如预期;若永远缺「真泛化火花」、只擅长基准与环境、再叠加持续的 sim-to-real 缺口与未解的持续学习,就可能卡死(他自认此默认情景不太可能,因实践里已见 RL 泛化)。John:人相对模型有大量优势;每代模型补一块短板,但仍被更弱判断力 / 自我校验不足卡住;「出新模型 → 惊为天人 → 用一个月觉得蠢」的循环可能比预期重复更多次;写码再多也不等于研究员 100× 生产力。Charlie:关键是「芯片上能有的最优学习器」距当前 Transformer + RL 配方有多远;人常假设一旦 AI 研究略超人,百万并行 + 更快芯片就能压过一切瓶颈进入快起飞——但若像摩尔定律那样,直线背后藏着一串必须的不连续创新,预训练缩放撞墙后靠 RL 续命,下一次不连续若离当前轨迹太远,即便 RSI 定向 RL 环境也未必能发现;若需要扔掉梯度下降/神经网络本身,当前配方更难自举。

💡 为什么重要: 把「为什么可能没有 foom」从政治借口落到可争的技术机制(泛化、判断、范式距离),为后文蒸馏、长程 RL、样本效率铺垫。

⚡ 争议点: 「循环震惊」是能力锯齿还是期望管理?「必须扔掉深度学」是否过度悲观——2012 至今的斜率是否已暗示足以支配人类 R&D?

2) 不连续创新、Elo 穿越与目标设定作为最后人类工作 — 00:00 🎧 · ▶️

💬(同章深入。)Dwarkesh:自 2012 的斜率若延续,几年内支配人类 R&D 并不奇怪;Ryan Greenblatt 论点——更强 AI 可改进激励科学/AI R&D 的仿真;象棋 Elo 近线性却在人类区间出现「专家从总赢到总输」的断崖。Charlie:区分目标已清晰的 autoresearch(压预训练损失、抬环境奖励)与无法预先指定目标的范式转移科学;后者 AI 也可能定不出目标。John 回忆早期 OpenAI 直觉:下一 token 对数损失会被噪声淹没、学不到「重要比特」——结果还是成了;领域高度依赖难以预测的泛化(预训练 → 深理解任务、可验证 → 不可验证)。Dwarkesh 直觉泵:每次七位数实验前用等量算力让 AI 花「一世纪」想最优实验与理论——远未到研究天花板。Charlie:目标清晰时,纯思考只能更新后验、不产生新比特,但仍可砍掉大量低垂果实(如更早发现 Kaplan 缩放律退火错误)→ 或有约 10× 加速;但想不出正确目标。真正 RSI 关键:AI 能否自己提出目标、优化、再提新目标且长期不脱轨——可能成另一种 Moravec(自主闭环对人「显然」、对 AI 极难);不过时间视界拉长已是反证。Beren:人类最后留存角色常是问对问题;Charlie 举 DeepMind「用游戏解智能」vs Radford 下一 token + 缩放律。John:定义目标 / 想要什么(助手应如何行为、RLHF 目标、宪法与 model spec)是最持久的人工作;对齐≈规范目标 + 优化目标,前者短期难自动化——后训练团队大,正因为要逐域想清「模型该怎样」。

💡 把 RSI 成败拆成「内循环优化」vs「外循环选目标」;对齐被重新表述为最后的人类工作而非纯安全口号。

10×「想清楚再实验」是否高估理论可压缩性?「对齐=最后工作」是否低估模型已能写 model spec?

3) 中国实验室、蒸馏与反中心化:提示分布与路由器数据 — 18:39 🎧 · ▶️

💬 Dwarkesh:模型供给为何未巨大 consolidation?John:蒸馏是主要抗中心化力量——凡能被 RL 学到的行为比特少、易从轨迹蒸馏;也可能出现公司专属、从部署持续改进的模型。Beren:持续学习也挡不住「每天蒸馏」。蒸馏难点是提示分布:即便有 CoT 全访问,也要用真实、宽分布提示才能抽干能力。近期线索:部分中国公司可能用「路由器/代理」服务(帮国内访问被挡的美方前沿模型,多用于编程)收集并出售数据——这是近乎完美的提示分布。Beren:前沿管线常从种子提示合成海量覆盖,人提供的比特越来越少。Charlie 尖锐观察:即便有 Mythos 的 logit 蒸馏,Sonnet 5 / Opus 5 仍可能显得不如 GLM-5.3 / Kimi K3——若提示分布解释成立,则真实部署可能比「最难 RL 环境」更重要;也可能处于学生-教师差距过大的诡异谷,或 Opus 5 过度「AI-as-judge」自我检查却缺大模型「何时停」的味道。John 补轴:环境有难度真实感两轴;首次塑造行为需双推,naive 蒸馏易只对齐 benchmaxxing;大模型从刁钻窄任务泛化到真实任务更好。Beren:中美都可从大数据公司买同样数据。

💡 解释开源/中国阵营追赶机制,并预警「基准满分、真实感崩」与写作/行为单一文化(后文呼应)。

路由器数据叙事证据强度?「部署 > 环境」是否过度外推个别模型代际?

4) 自动化 AI 研究者如何训练:人类品味、环境补丁与可验证超人类目标 — 28:06 🎧 · ▶️

💬 Dwarkesh 对比 Ryan 玩具版(让 GPT-8 练造 GPT-3 级、打通关/压损失等内环)与 John 的实践直觉。John:实际会是 人类反馈吸收研究者品味 + 多步研究项目练习环境 的组合;每轮修补上轮最破的点。Charlie:关键是 lineage 回滚多远再自博弈——极限是给 GPU+神经网络说「自己想」;现实因算力瓶颈会停在前沿,把近几个月栈上的 bug/改进 diff 成环境(也利于代际非陈旧数据)。感觉像渐近逼近人类研究员发现物,人类仍在环。Beren:纯轨迹蒸馏无法超越示范,但环境可远超人——可设无人能达的损失目标或更难游戏;AI 研究特别容易定义可测目标。John:很多研究并非在良定义目标上爬山,而是直觉 → 放松真实感找 signs of life → 再推回真实;还有解释性/非正式理论工作。Beren:希望可验证 + LLM-as-judge + 问人「看起来合理吗」能泛化到模糊任务;能否无人类自封环仍不清。

💡 给出实验室真实 RSI 训练配方的钢化预期,区分「可验证内环加速」与「品味/选题」残留。

「环境可超人」路径是否会被错误指定目标带偏?回滚自博弈在算力政治上是否永远不会发生?

5) 长程 RL 赌注:远程员工、按域烘焙与部署学习缺失 — 33:51 🎧 · ▶️

💬 Dwarkesh 概括实验室赌注:在海量多样环境上放大 RLVR,涌现持久、分诊上下文、多智能体协作等元技能;上下文内学习拉长后,得到「一周/一月级可远程上班」的智能体——但主要在数据中心模拟里学元技能,而非从真实部署学。Charlie:难拆「直接 RSI」vs「做能卖钱的通用模型养下一次训练」;商业路径清晰——Anthropic 式从编程 → 金融/Excel → PPT → 经济长尾,开源也跟进。Dwarkesh 曾问 Dario:若预期上岗即学,为何烘焙 PowerPoint?可能是尚未到位先摊销,或收入喂养真 RSI。John:若上下文学习够强,理论上读完书就能做金融;实践仍按高价值域加强,也是近年变强的原因之一;即便能现场学,权重里烘焙直觉仍提高运行效率。Beren:参数空间够大、可两边做;有迁移;直接 RSI 数据稀缺。John:sim-to-real 是否永为主框架存疑——难模拟真人实时互动。Beren:样本效率低时必须模拟;效率上来后部署学习应变大。Dwarkesh:约一半算力在推理却几乎不回馈改进;数字心智本该跨实例汇聚百万年经验——蜂巢式部署学习何时到来?Beren:已以「下一代预训练/中训吃部署数据」弱形式发生;中国肯定用。Charlie:圣杯是实例级在线更新,微观上很多方法会坏;但 Composer/Harvey 等用部署反馈做更快 cadence 的后训练甚至在线 REINFORCE;Cursor 曾用 Tab 接受信号,后对生成模型也做,约每五小时以 CursorBench 门控部署。John:最大问题常是不知道自然数据的奖励该是什么——接受编辑等浅信号易被黑。

💡 把「AGI 产品形态」接到商业域覆盖与持续学习经济学;指出推理算力未闭环是文明级浪费/机会。

按域烘焙是通往元学习还是锁死「技能清单」路线?在线 REINFORCE 的奖励黑客风险有多大?

6) Sim-to-real、累积任务 vs 非平稳、样本效率百万倍差距 — 45:24 🎧 · ▶️

💬 Dwarkesh:任务视界越长越难数据中心模拟;编程也已触及需客户/用户互动的年尺度工作;跑公司、交易、打赢官司等都难模拟——若迁移不够且必须权重更新,则模型相对人样本效率落后或达百万倍可能咬人。Charlie:拆累积任务(RSI:发现写入训练栈即可保留;如调用 pretrain.sh)vs 非平稳(律所助理:关系、潜规则持续变)。若实验室认定 RSI 累积且不必新架构,算力会更砸向 RSI 而非paralegal——「不幸的是 RSI 比当律师助理容易」。John:弱点多样——某些体制样本效率差,也有思维多样性低、长程判断/品味差(软件工程品味≈长期可维护系统)。Charlie 思想实验:若上下文能装下万亿 token 的人生经验且样本效率同百万级,品味是否解决?John:仍需被训练「如何从该上下文更新」。Beren:人类用相对短序列项目就能形成品味;AI 经验更多,泛化到真长程仍未知。关于蜂巢学习:John 强调激励——公司不愿让模型提供方学走全部部署优势。Charlie:经济压力更可能先走 LoRA/cartridge(压缩 KV)模块 而非改共用基座;Beren:仍可把 traces 倒进下一代预训练;节奏会从三月→周→日→时。Charlie:大规模外环(中训+自建环境)有点像持续学习,但微观多次 SFT/蒸馏会灾难遗忘、伤通用能力;RL 改动小、宜能力不宜灌显式知识。Beren:容量不是主因——同尺寸从零重训含新数据会更好;瓶颈是塑性/灾难遗忘,故不断新造基座而非无限中训同一基座。

💡 给出「十年内默认该有疯狂 RSI、唯一技术逃逸口」的最强钢化版本:样本效率 + 难模拟真实 + 遗忘。

「RSI 比paralegal 易」是否过度故事化?模块化个性化是否永久阻止实验室级蜂巢智能?

7) 数据解释了多少进步:梯子、Talkie、过滤 vs 创造比特 — 1:00:33 🎧 · ▶️

💬 Dwarkesh:是否存在某种数据分布,使当前架构训出全面支配人类专家的超智?平凡解:让权重背下「训练超智的 Python 文件」。Charlie:存在可爬的 RL 环境梯子,但每级努力近似指数上升;仍处环境创造早期,利用「倒着比正着容易」、真实世界信息注入(Anthropic 万人找 bug → 压成百万 token 内可发现的环境)等不对称;终将在构造成本与智能体耗时上收益递减。John:有人把只训到 1930 的 Talkie 模型在现代编程代理数据上微调,SWE-bench 胜过 Claude 3 Opus——说明有正确专家行为后,较弱模型也可惊人复制。Charlie 反例:只训到小学数学再直接 RL 高中/大学爬不动,需逐年级课程。Beren:RL 探索弱——128 rollout 内碰不到就几乎无信号,故需课程;预训练无此问题。Charlie:前沿能力相关的「世界新比特」可能很少——新数学题/超模型能力的新编程问题供给不足 → 收益递减。Beren:预训练信号在 Common Crawl,问题是滤噪;中/后训练则常根本不存在待滤的千年难题证明,必须向人要推理、造环境、或吃部署。Dwarkesh+Jerry Han 小规模网格:数据约 12×、架构约 3.7× 算力效率;Epoch 估年 3× 暗示更大总倍数,差额或来自后训练/尺度依赖。Beren:架构常是解锁新体制(如 GQA→百万上下文)的一次性门,而非单纯乘子;中后训练数据随尺度更有用。参数缩放:Charlie 预期未来几年因长程 RL 推理效率重要、环境仍瓶颈,活跃参数或平台期;Mythos/GPT 或远小于传闻 10T。John:算力与 GPU 变大仍会推大模型;缺高质量预训练时数据效率将主导架构选择与稀疏度;稀疏理论仍糊。Beren:推理效率压低活跃参数;总参数看 HBM;数据紧时或回到更大、欠饱和、泛化更好的模型。

💡 用可引用实验与反例校准「堆数据/堆环境」叙事,并连接硬件与活跃参数政治。

小规模 12× vs 3.7× 外推大模型是否成立?Talkie 结果可复现性与评测污染?

8) RL 为何比「每 episode 一比特」更成功:中训热身、信噪比与视界泛化 — 1:18:03 🎧 · ▶️

💬 Dwarkesh:一年前流行「RL 难缩放」;John 论文指模型每 episode 约学一比特;Dwarkesh 博文称 pass 率低时几乎学不到——但今日模型很强,像 RL 放大的结果。Beren:成功常被低估的是中训——合成推理与环境热身可把模型送到最终 RL 检查点的约 80%;RL 只是微调策略,故不需天真以为的那么多比特;且相对 SFT,RL 目标忽略「必须匹配教师推理用词」的噪声,信噪比剧增。Charlie:pass@1 升、pass@k 降的争议;足够大 group size 使正确轨迹有不可忽略概率才会被上权;起点 pass@1 随预训练 token 对数增长。Dwarkesh:如何与「质性能力暴涨」和解?Beren:参数微变也可在函数空间剧变——一比特可砍半假设空间。Charlie:未得到跨域「水平泛化」(只训数学≠最强编程),但得到视界泛化——学会用更多 token 更久推进;EdgeBench:可工作时长约每三月翻倍。类比预训练 quanta:平滑损失下是大量离散技能相变;RL+把合成轨迹倒回中训的慢外环,在单任务上像 0.5%→90% 相变,平均起来就是「模型质变」。Beren:亦有些数学↔代码迁移;环境覆盖面比两年前广得多。

💡 修正「RL=几乎不学」的公共误解,区分水平泛化失败与视界泛化成功。

「中训 80%」是否可操作化测量?视界变长是否等同真能力?

9) Move 37、熵塌缩与蒸馏单一文化 — 1:24:54 🎧 · ▶️

💬 Dwarkesh:另一叙事是 AlphaGo Move 37——非人类初始化带来超人类创意;LLM 上的 RL 会否 similarly 产生超越人类的 de novo 智能?Beren:AlphaGo 有 MCTS 更利探索;但 RL 未必毁创意——OpenAI–Hugging Face 事件中模型连出多枚 zero-day,已是某种 Move 37,来自 LLM 泛化而非「RL 杀熵」。John:一种「创意」=解难搜索(约束诗、Move 37),AI 会极强;另一种是输出多样性——RL 后 tic 增多、主题/角色名重复,分布分析显示不如人类作者多样;且大量从 Claude 蒸馏导致开源模型文风单一文化,令人忧。Beren:问题常在数据/裁判而非 RL 方法本身——简单可验证器 + 窄环境 → 熵塌缩;写作被有 tic 的 judge 奖励黑客。

💡 同时承认超人类搜索创意已现身,并警告文化/风格塌缩的文明外部性。

HF zero-day 算不算「对齐失败下的创意」示范?单一文化是否可用更宽裁判修复?

10) 快速问答:远程工人、10× 研究加速与 ASI — 1:28:32 🎧 · ▶️

💬 可替代白领远程工人(月级无缝、电脑使用、与人协作):Charlie ≈1 年(非浏览器、可用 Slack 等)或强制浏览器则数年;Beren ≈3 年全通才,但组织先改造成 AI 友好可先到 80–90%;长尾杂务与「对人强硬催办」仍难。John:Upwork 人类质量方差大,某些低质量工种 AI 已不差;形态一年左右出现并参差改进。Charlie:已能让 Codex 点鼠标下税表材料。10× 总研究生产力(一年突破变一月):John 拒给标量,某些数学或已过;对 AI 研究员本身 Charlie 偏 5–10 年,John ~2 年,Beren 认同偏短——编码已 >10×,若能自主跑通 1–2 个实验反馈环就很大;Charlie 卡点是自己吸收信息做贝叶斯最优下一实验的能力,Beren 假设可部分委托 AI。全面电脑认知 ASI(含数年视界、稀缺数据现场学如成 TSMC 工程师):John 3–4 年(AI 研究吃香且偏代码数学;3D/机械等更久);讨论截断于稀缺现场数据领域。

💡 把整集抽象争论压成可记的时间表分歧,暴露「远程工人」定义差如何驱动 1 年 vs 3 年。

2 年 10× 研究员是否隐含已进入 RSI?Charlie 更长尾是否更现实主义?

金句

  • "We're nowhere near the ceiling." — Dwarkesh Patel
  • "Alignment is sort of the answer… specification of the objective… is not going to go away anytime soon." — John Schulman
  • "It's so unfortunate that RSI happened to be easier than being a paralegal." — Dwarkesh Patel
  • "All thinking can do is update your posterior based on the bits that you've gotten… You can't gain any new bits from just thinking." — Charlie O'Neill
  • "Distillation is the main thing that fights against the centralizing force." — John Schulman

来源