World Labs 联合创始人 Justin Johnson 上 MTS(Theo Jaffee / Sofia Puccini)讲解 Atlas:面向物理世界的多模态世界模型,做生成、稀疏重建与仿真三条能力;相对上一代 Marble 打破「凡事过 Gaussian」瓶颈,让 2D 直出、按需升维 3D。重点用例包括创意飞穿世界,以及机器人 real-to-sim 最后一公里评估/微调;并暗示 VR 可能是导航与提示世界模型的自然界面。
- World models = 视觉/物理理解横轴,补齐 LLM 的离散文本轴。
- Atlas 三能力:生成 / 稀疏重建 / 仿真。
- 相对 Marble:早分支 2D/3D,摆脱处处 Gaussian。
播出信息
- 节目: The a16z Show(MTS)
- 嘉宾: Justin Johnson(World Labs 联合创始人)
- 主持: Theo Jaffee、Sofia Puccini
- 发布: 2026-09-13(RSS pubDate 日)
- 时长: 00:23:30(约 1410 秒)
- 单集页: https://a16z.simplecast.com/episodes/world-models-robotics-and-the-future-of-3d-ai-mGOuUHi0
- YouTube: https://www.youtube.com/watch?v=KouEgasT_rw(MTS:World Models Will Eclipse LLMs | World Labs Co-Founder)
- 音频: https://mgln.ai/e/1344/afp-848985-injected.calisto.simplecastaudio.com/3f86df7b-51c6-4101-88a2-550dba782de8/episodes/e578e083-6b40-4815-a479-28213e86988a/audio/128/default.mp3?aid=rss_feed&awCollectionId=3f86df7b-51c6-4101-88a2-550dba782de8&awEpisodeId=e578e083-6b40-4815-a479-28213e86988a&feed=JGE3yC0V
- 英文转写来源: Podscripts + YouTube auto captions
来源
节目结构
- 论题:世界模型是语言模型之外的另一横轴 — 00:00 🎧 · ▶️
- 宣布 Atlas:模型发布而非产品发布 — 00:45 🎧 · ▶️
- 三大能力:生成、重建、模拟 — 01:30 🎧 · ▶️
- 与视频生成的差别:输出锚定在 3D — 04:00 🎧 · ▶️
- 相对 Marble:打破 Gaussian 瓶颈 — 08:00 🎧 · ▶️
- 实时漫游两条技术树 — 10:00 🎧 · ▶️
- Real-to-sim:机器人最后一公里 — 12:00 🎧 · ▶️
- 视频模型研究 vs 世界模型产品路径 — 14:00 🎧 · ▶️
- 控制感与作者性:生成必须「像你的」 — 18:00 🎧 · ▶️
- 子弹时间与 VR 导航;Marble 已在 VR — 20:00 🎧 · ▶️
分节详解
1) 论题:世界模型是语言模型之外的另一横轴
💬 他们说了什么: Justin:LLM 是处理离散 token 流的通用引擎;World Labs 主张还存在一类基于视觉与物理理解的 world models,用于生成、模拟、重建世界,若足够通用可覆盖娱乐、VR、建筑、机器人等。我们生活在物理建成空间,需要模型帮我们处理它。
💡 为什么重要: 把「下一平台」从聊天框拉到空间智能,给 3D/机器人投资一个清晰类别标签。
⚡ 争议点: 「另一类别」是否与视频生成模型连续谱而非分立?后文会拆。
2) 宣布 Atlas:模型发布而非产品发布
💬 主持 Theo/Sofia:World Labs 联合创始人 Justin 当日宣布 Atlas——多模态世界模型,像素级相机控制生成图像/视频并重建 3D。Justin 澄清:这是 base model 发布,产品稍后;Atlas 将驱动未来产品。
💡 管理预期:先能力底座,再产品化——避免把 demo 当 GTM。
⚡ 无产品日的「发布」如何转化开发者生态?
3) 三大能力:生成、重建、模拟
💬 Generation:从文本/图像提示生成从未存在的世界并飞穿相机。Reconstruction:稀疏重建——少至 1 张、多至 100+ 张照片重建真实空间,照片越多越准。Simulation:在重建空间里模拟物体/机器人行为,服务 VFX 与机器人。
💡 给出可记忆的产品能力三角形,直接映射创意与 robotics 两类买家。
⚡ 「一张照片重建」精度与幻觉边界未量化。
4) 与视频生成的差别:输出锚定在 3D
💬 强调帧不是漂浮 2D:被 grounding 在 3D 空间,可布置、控相机、做时间模拟。这与纯视频扩散「看起来像」不同,目标是可导航、可仿真的世界状态。
💡 为「为何不直接用 Sora 类模型」提供技术答案:可控几何与仿真接口。
⚡ 代价是算力与延迟;实时性后文讨论。
5) 相对 Marble:打破 Gaussian 瓶颈
💬 Marble 把 Gaussian splats 放在中心,视频/图像常经高斯场景再渲染。Atlas 全栈重建,让 2D/3D 分支更早:2D/视频可直接出像素,仅在需要时再 lift 到 3D;架构更统一、易扩展。
💡 展示第二代世界模型的架构教训:表示选择会锁死扩展路径。
⚡ 放弃处处高斯是否损失部分 3D 一致性?
6) 实时漫游两条技术树
💬 问到 Flight Simulator/Google Maps 级遍历:Justin 认为比预期快。Atlas 为两条树都准备:显式 3D(高斯/点云客户端插值)与直接流式出帧。内部工具已有类似 FPS 的空间画布,产品层仍需迭代暴露方式。
💡 投资人可跟踪的里程碑:流式帧 vs 显式场景哪个先产品化。
⚡ 「 sooner than you expect」缺具体 SLA。
7) Real-to-sim:机器人最后一公里
💬 对机器人:在最终工厂/场景做匹配仿真,用于评估与微调——即使有通用机器人基础模型,仍需对准具体环境。相对纯遥操作演示采集,仿真提供另一条数据与验证角度;也可 real→sim→real 适配特定桌面/麦克风等场景,用手机随手拍几段即可开建。
💡 把世界模型卖点钉在 robotics 的评估与适配瓶颈,而非只做炫酷生成。
⚡ 仿真保真度与真机迁移误差仍是领域难题。
8) 视频模型研究 vs 世界模型产品路径
💬 讨论基础研究上视频模型作为世界模型的路线,与 World Labs 强调可控相机/3D 重建的产品路径并置:不是否定视频模型,而是要可编辑、可仿真、可重建的接口。
💡 帮听众区分学术「world model」口号与可交付空间智能栈。
⚡ 长期是否殊途同归未定。
9) 控制感与作者性:生成必须「像你的」
💬 创意侧关键体验:若用户觉得生成不受控、不属于自己,就难付费留存。Atlas 强调像素级相机控制与空间画布,是在抢「作者性」而不只是随机惊喜。
💡 创意工具 PMF 往往取决于控制感 > 单次惊艳。
⚡ 专业 VFX 管线集成深度仍未知。
10) 子弹时间与 VR 导航;Marble 已在 VR
💬 聊到草莓击奶的子弹时间式镜头控制、以及用 VR 作为世界模型自然交互模态。Justin:Marble 已在 VR 近一年,戴上头显进入自己生成的世界「相当震撼」。收束展望 Atlas 全面开放后的创意爆发。
💡 闭环:交互前端可能是 VR/空间计算,而不只是时间线剪辑。
⚡ 消费级 VR 渗透是否配得上模型野心?
金句
Language models process streams of discrete tokens — world models should be based in visual and physical understanding.
This is a model announcement, not a product launch — the base model will power future products.
Break the dependency of bottlenecking everything through a Gaussian splat scene.
来源(再列)
- Episode: https://a16z.simplecast.com/episodes/world-models-robotics-and-the-future-of-3d-ai-mGOuUHi0
- YouTube: https://www.youtube.com/watch?v=KouEgasT_rw
- Podscripts: https://podscripts.co/podcasts/the-a16z-show/world-models-robotics-and-the-future-of-3d-ai
- Local EN:
/workspace/podcasts/a16z/transcripts/world_models_3d.en.md