课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 预测这个动作之后会发生什么?
- 排序我们应当偏爱哪个结局?
- 搜索CEM 考虑过哪些计划?
- 执行现实世界中发生了什么?

一个小故事
一名快递员能准确预测每一个小步骤。目标隔着墙却很近,于是规划器不断选择“朝目标走”。快递员最终一直顶着墙,而没有先远离目标、走向门口。
这个故事根本不需要糟糕的下一步预测。训练问的是:“这个动作是否通往正确的下一潜在状态?”规划问的是:“应当偏爱哪一整段序列?”原始 LeWM v3 用终端潜在状态的平方欧氏距离回答第二个问题。预测未来与判断路线并不是同一个对象。
真正规则
较低均方预测误差无法保证良好排序,因为:
- 常见局部运动可能淹没罕见的门口或接触决策;
- 表征可以预测邻近转移,却把墙壁两侧的终点排列得很糟;
- 规划评估的是自反馈、模型生成状态,而不只是记录上下文;
- 欧氏代价具有对称性,没有显式的方向、预算、支持范围或不确定性参数。
在改变整个模型之前,先进行预言机替换:
oracle rollout + learned cost still ranks badly
→ inspect cost or representation geometry
learned rollout + oracle cost fails
→ inspect multi-step dynamics and support
both oracles succeed, deployed planner fails
→ inspect search, observation, action conversion, execution
预言机是拥有特权模拟器访问权的实验室仪器,而不是可部署的纯像素组件。
后来的两项方案改变的是不同工作。RC-aux 用加权的多时域开环预测取代原始单步预测项,其时域集合仍包含第 1 步,并增加一个预算条件可达性头。Temporal-Distance JEPA 学习一个独立的有向时间代价,以及一个 (H=5) 的滚动一致性损失,把每个预测潜在状态与记录未来经过 stop-gradient 的编码相匹配。这个局部 detach 属于后来的方法;原始 v3 的目标仍然保持连接。
轨迹偏移只证明某种行为实际做过什么,并不是预言机最短时间。跨轨迹负样本也可能是假负样本。
可能骗过我们的把戏
首先只改变直尺。对一个固定 TwoRoom 候选库使用精确模拟器终点,分别按直线距离和尊重墙壁的图距离排序,再移除墙壁并重复。
如果图距离只在墙壁造成绕路时改变排序,那么拓扑代价解释就通过了这项玩具移除测试。如果面对精确终点,两种代价都失败,应检查候选覆盖或任务定义。随后再加入学习编码,反转方向,改变预算,最后才加入学习滚动展开。
不要把每个后续方法都称作同一种“规划感知目标”:
- Objective Bottleneck 冻结一个 TwoRoom 表征/预测器,只替换规划器代价。
- Traj-LeWM 增加目标条件潜在轨迹代价和合成排序负样本,并在每个 epoch 后挖掘只执行终点规划时的失败案例,用于训练该代价。
- Decision-Metric Alignment 测量 Plan–Real 和 CEM 各阶段的 Spearman,再加入只在训练时使用的逆动力学头和目标动作头,同时保留欧氏 MPC 代价。
这些干预分别针对直尺、路径和表征几何。
实验凭据
Objective Bottleneck 后续工作报告:潜在 L2 与真实距离之间只有 (r=0.426),尽管位置 ridge 探针达到 (R^2=0.9922)。在其检查点上,offset-100 时间代价把成功率从 26% 提高到 98%;在发布检查点上,从 14% 提高到 34%,而采用特权解码位置的代价达到 70%。这只涉及一个环境、每个检查点一个随机种子,以及不同于 v3 默认值的长距离目标协议。
Traj-LeWM 报告,相比其 LeWM 对照,在 PushT、Cube、Reacher 和 TwoRoom 上分别提高 3、14、7 和 7 个百分点,结果在三个评估随机种子上取平均。它会挖掘失败案例,因此该干预并不只依赖离线数据训练。
Decision-Metric Alignment 的每项配置只有一次训练运行;三个随机种子度量的是评估变异,其排序诊断还需要模拟器滚动展开。这些都是作者报告结果,不是独立复现。
基准来源仍是 LeWorldModel v3,提交 8edfeb3。不能把任何后续 stop-gradient、可达性、时间或动作头目标倒推回 v3。
快速检查
- 为什么采用预言机动力学时,TwoRoom 规划仍可能很差?
- 多时域预测和可达性评分分别承担什么工作?
- 哪个预言机单元格会告诉你:应先改变直尺,而不是预测器?