Aftercasting
a16z

The Next Frontier of AI Video Is Control

2026-09-17

a16z GP Jennifer Li 对话 fal 联合创始人 Gorkem 与工程负责人 Batuhan:当生成视频快到实时,游戏从「更好看的抽卡」变成可导播的连续流。H3 Max 通过对 MiniMax 开源权重帖训+系统/硬件优化,把时延压到可直播(乃至 Turbo 约 1.5s 出 5s 片);Director 模式用约 2 分钟细粒度记忆+长程提示,支持中途改指令仍保持人物场景。下一战场不是更快,而是运镜/灯光/角色/唇形的可控性逼近制片厂要的 99.9% 可靠;Blender 参考渲染+模型已成为专业工作流,好莱坞是增长最快客户群。

  • 实时是产品形态开关:使连续导播与中途改指令成为可能。
  • H3 Max = 开源权重帖训 + 系统/硬件优化,而不只是换基座。
  • 场景记忆(~2 分钟细记 + 长程提示)是 Director/连续流的技术底座。

播出信息

  • 节目: The a16z Show
  • 嘉宾: Gorkem Yurtseven(fal 联合创始人)、Batuhan Taskaya(fal 工程负责人)
  • 主持: Jennifer Li(a16z GP)
  • 发布: 2026-09-17(RSS pubDate 日)
  • 时长: 00:39:32(约 2372 秒)
  • 单集页: a16z.simplecast.com
  • YouTube: YouTube
  • 音频: 音频
  • 英文转写来源: YouTube auto captions(未找到更优公开全文稿)

来源

节目结构

  1. 开场:实时生成视频改变了什么 — 00:00 🎧 · ▶️
  2. fal 与 H3 Max:从推理平台到帖训模型 — 00:47 🎧 · ▶️
  3. 为何押注帖训练:速度×质量的交汇 — 02:45 🎧 · ▶️
  4. 系统工程秘方:架构、硬件与成本延迟 — 06:33 🎧 · ▶️
  5. Twitch 时刻:上线次日就实时直播 — 10:44 🎧 · ▶️
  6. 场景记忆:模型如何「记得」刚才发生了什么 — 13:11 🎧 · ▶️
  7. 经济账:服务成本、芯片与流式体验 — 15:47 🎧 · ▶️
  8. 超越消费者:好莱坞级可控性 — 22:02 🎧 · ▶️
  9. 当导演用提示词:运镜、灯光与场理解 — 28:37 🎧 · ▶️
  10. 下一步与创作者经济:从生成到可控生产 — 35:43 🎧 · ▶️

分节详解

1) 开场:实时生成视频改变了什么

⏱ 00:00 🎧 · ▶️

💬 他们说了什么: Jennifer Li 引出主题:生成视频一旦快到实时,创作者工作流会发生什么质变。嘉宾是 fal 联合创始人 Gorkem Yurtseven 与工程负责人 Batuhan Taskaya。开场点出本期核心张力——速度已破局,下一战场是控制

💡 为什么重要: 把整集框架钉在「实时」阈值上:不是又一个更好看的 demo,而是交互式、可导播的生产工具门槛。

⚡ 争议点: 「实时」是否已足够普适,还是仍限于短片段/特定硬件?

2) fal 与 H3 Max:从推理平台到帖训模型

⏱ 00:47 🎧 · ▶️

💬 介绍 fal:原本是推理/生成媒体平台;H3 Max 是他们对 MiniMax 开源权重视频模型做帖训练后的版本。发布后迅速成为平台上最受欢迎的视频模型之一。团队把模型帖训与系统/硬件优化叠在一起,显著压低生成时延同时保住质量。

💡 展示「平台公司」如何向上游延伸到帖训:不是只卖 GPU 分钟,而是用端到端优化定义体验。

帖训开源权重的护城河有多深?上游模型迭代是否随时抹平差异?

3) 为何押注帖训练:速度×质量的交汇

⏱ 02:45 🎧 · ▶️

💬 为何从纯推理平台走到帖训?因为只做托管,难同时打穿延迟与画质。H3 Max / Turbo:约 1.5 秒出 5 秒视频、质量仍在高分位。速度使「边生成边改」成为可能,而不只是离线批跑。

💡 帖训+系统优化是 fal 的差异化赌注;实时是产品形态开关,不是营销形容词。

过度优化延迟是否牺牲长镜头一致性与物理可信度?

4) 系统工程秘方:架构、硬件与成本延迟

⏱ 06:33 🎧 · ▶️

💬 Batuhan 拆解逐组件优化:管线、硬件选型、架构改动共同把成本/延迟曲线压下去。视频模型服务链路比文本复杂得多,fal 的策略是跨硬件把整条管线打薄。

💡 提醒听众:视频「可用」往往是系统工程胜利,不只是换更大基座模型。

这类优化是否可复现于其他开源视频模型,还是高度绑定 H3/特定栈?

5) Twitch 时刻:上线次日就实时直播

⏱ 10:44 🎧 · ▶️

💬 上线次日就有人在 Twitch 把模型当实时工具直播;内部也被速度吓到,先做验证再公开发布。速度解锁了自发项目与连续视频实验。

💡 产品市场契合的信号来自「有人立刻拿去直播」,而非只看榜单分数。

病毒式直播是否可持续转化为付费工作流,还是一阵新奇?

6) 场景记忆:模型如何「记得」刚才发生了什么

⏱ 13:11 🎧 · ▶️

💬 讲解场景记忆:从记住上一段 5 秒,扩展到约 2 分钟细粒度记忆;更长则用演进式系统提示保持叙事/世界观,连贯可至约 60 分钟。H3 Max Director:连续可交互流,可中途语音/文本插入新指令并保持人物与场景。

💡 「记忆」把生成从剪贴片段升级为可导播的时间线——这是控制问题的技术底座。

2 分钟细记 + 长程提示是否在复杂多角色场景下崩坏?幻觉与身份漂移如何度量?

7) 经济账:服务成本、芯片与流式体验

⏱ 15:47 🎧 · ▶️

💬 讨论服务成本、芯片占用与流式体验的经济性。实时流对算力密度与调度要求更高;需要把成本压到创作者/工作室愿意持续开着的水平。

💡 没有单位经济,实时只是演示;有单位经济,才能变成默认创作环境。

芯片供给与价格波动下,实时视频的毛利能否撑住消费级定价?

8) 超越消费者:好莱坞级可控性

⏱ 22:02 🎧 · ▶️

💬 下一挑战从速度转向可控性:运镜、灯光、角色、动作、唇形同步,目标是接近工作室要的 99.9% 可靠而非 80–90%「差不多」。好莱坞等专业客户是增长最快的一段;法律与数据驻留障碍已打通,可用自有 IP。专业工作流常见:Blender 参考渲染 + H3 Max,接近「全控制」。

💡 市场叙事从「消费者玩梗」切到「制片厂生产工具」——采购标准完全不同。

99.9% 是否可实现?版权/表演权/工会约束是否比技术更硬?

9) 当导演用提示词:运镜、灯光与场理解

⏱ 28:37 🎧 · ▶️

💬 用自然语言「当导演」:指定机位、运动、场理解;模型需理解空间关系才能执行。控制面从单次提示词变成持续导播指令流。

💡 交互范式变了:创作者从「抽卡」转向「执导」——技能曲线与产品 UI 都要重写。

语言控制精度是否足以替代传统时间线/关键帧工具,还是永远互补?

10) 下一步与创作者经济:从生成到可控生产

⏱ 35:43 🎧 · ▶️

💬 展望下一阶段与创作者经济:速度已够用后,胜负手是可控生产与工作流嵌入。生成媒体大会观众结构已明显专业化。预测工作室 AI 用量可能数量级上升。

💡 收束论点——控制 > 单纯更快跑分;平台要服务职业创作者的可预测性。

创作者经济是扩容还是替代人力?本期偏工具赋能叙事,分配效应着墨较少。

金句

The next frontier of AI video is control — not just going faster.

Real-time turns generation from a lottery into something you can direct.

Studios do not want 80–90% “pretty good”; they want something closer to 99.9% reliable.

来源(再列)