课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
全局图景
- 已知海岸我们已经能说清可用的流程。
- 虚线海岸仍有多种解释与证据相符。
- 下一次航行选择一个能区分这些解释的测试。
一个小故事:尚未完成的地图集
地图集中,船只实测过的海岸画成实线,仍可能呈现多种形状的地方则画成虚线。严谨的制图师不会拿最新旅人最喜欢的一幅图,擅自填满那些虚线区域。
本课程的坚实主干其实很克制:观察像素,把它们压缩成有用的潜在状态,想象以动作为条件的未来,用 CEM/MPC 搜索并行动,然后诊断想象在哪些地方不可靠。前沿问题则在问:什么样的几何、目标、不确定性、层次结构、支持域规则或后继范式最适合服务这条闭环。较新的论文提供候选方案和作者自报的证据;它们并不会把虚线海岸自动变成共识。

这张图用于组织问题,而不是给论文排名,也不预测哪条路线会胜出。
技术背包:十个开放问题
| # | 开放问题 | 相互竞争的假设 | 一个有用的判别实验 |
|---|---|---|---|
| 1 | 什么几何适合规划? | 欧氏邻近度、有向可达性、任务进度、轨迹代价或不确定性感知的决策排序,可能分别主导不同任务 | 在开放房间、墙体、接触和预算场景中做匹配扫描,并与预言机排序比较 |
| 2 | 防止崩塌是否需要全局分布匹配? | 完整高斯压力、子空间/局部匹配、时间中心化,或从转移中导出的动作目标可能已经足够 | 等数据量的抗崩塌测试,再加拓扑、慢变量、尾部和规划检查 |
| 3 | 应当怎样表示多个可能的未来? | 条件均值可能足以控制,也可能必须显式表示分支或分布 | 使用校准过的多模态环境,其中均值在物理上并不真实 |
| 4 | 怎样知道想象已经超出支持域? | 集成分歧、预测分布宽度、到最近数据的距离、动作条件一致性或实际误差,可能各自更合适 | 有控制地移除支持域,再比较之后的真实滚动误差 |
| 5 | 能否从离线行为中学到可控性? | 逆动作和动作敏感分支可能识别有用的控制,也可能因缺少状态条件干预而留下歧义 | 固定状态,选择性展示或隐藏动作方向 |
| 6 | 长程目标是否需要显式层次结构? | 前缀预测、采用更好代价的扁平 MPC、学得的动作块或潜在子目标,都可能各自已经足够 | 跨视界匹配模型调用、动作、延迟和支持域预算 |
| 7 | 潜在状态应该有多大? | 更大宽度可能保留罕见差异,也可能浪费容量并与低内在维度冲突 | 在固定计算量下扫描宽度/秩,同时诊断崩塌、滚动和规划 |
| 8 | 任务无关与任务有效的表示是否冲突? | 不变性可能帮助迁移,而任务上下文或特权定基也可能不可或缺 | 分离因素的干扰项/任务干预,以及留出任务组合 |
| 9 | 模型怎样才能从预测走向解释? | 探针和反事实预测可能揭示机制,也可能只有具备因果假设的干预才足以支持解释 | 预注册干预,明确区分相关性、模型使用和因果效应 |
| 10 | 什么可能取代或吸收 LeWM 路线? | 分支预测、统一 JEPA 目标、摊销式/无搜索控制、价值塑形的几何,或其他世界模型范式 | 一套共享压力测试:预测、反事实、支持域、规划、迁移、计算与安全 |
这些问题彼此相互作用,却不能被压成一个总排行榜。一个模型可以预测得很好,却把计划排得很差;它可以在某个规划器下很有用,却并不具备可辨识性;它可以公开代码,却没有独立复现;它可以在某个单 GPU 预算下更快,却在支持域发生偏移的目标上更弱。
尝试推翻这个想法
构造两个系统 Cedar 和 Comet。它们的平均单步损失相同,平均成功率也相同。Cedar 能完成附近目标,却在每个隔墙目标上失败;Comet 能完成隔墙目标,却在视觉变化后失败。一个平均值让它们看起来完全一样,但它们心中的世界并不一样。
现在把目标类型、视界、支持域、视觉干预、规划器预算和失败轨迹全部公开。下一步实验自然不同:Cedar 需要几何/代价测试,Comet 需要干扰项/表示测试。这就是为什么开放问题需要一个判别实验,而不是再做一个聚合排行榜。
面对任何拟议中的后继方案,在欣赏它的名字之前,先冻结一份压力测试账本:训练信息、目标图、未来表示、动作接口、模型调用、搜索预算、硬件、数据支持域、迁移划分和安全机制。新范式可能在一列获胜,也可能在另一列失败。在声明的证据真正出现之前,“将取代 LeWM”仍只是推测。
实验凭据与证据边界
- 基线坐标:LeWorldModel v3 与 LeJEPA v3。直接更新包括 TRM、SMWM、VLWM、PSG-JEPA、TwoRoom 复现、VIScore、ACPC、Objective Bottleneck、Traj-LeWM、SCALE、AC-MTM 和 DA-LeWM。
- 相邻路线包括 Branch-JEPA v3、UniJEPA、Qantara 和 INTACT。它们不是 LeWM 的版本,相邻也不代表已经能够取而代之。
- LeJEPA v3 修订于 2025-11-14;LeWM v3 修订于 2026-06-03;具名的最新直接更新是 2026-08-19 的 DA-LeWM v1。证据截止时间:2026-08-20,Asia/Tokyo。基线代码冻结在
8edfeb3;其他已检查的修订版本也冻结在附录 E 中,而不是随main移动。 - 已确认基线以及最新条目中的 SMWM、PSG-JEPA、tinylab、VIScore、ACPC、Traj-LeWM、AC-MTM 和 INTACT 有作者关联代码;TRM、VLWM、SCALE 和 DA-LeWM 没有找到此类代码。独立复现只在所述 TwoRoom 环境和协议中成立。其他每项结果都必须保留作者原有的任务、监督、规划器、计算预算与假设边界。
三个快问快答
- 什么能把一个宽泛的未知变成科学的开放问题?
- 为什么相同的平均损失和成功率可能掩盖不同的世界模型失败?
- 一个拟议中的后继方案必须共享哪些证据字段,“更好”这个说法才有意义?