课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 当前开始滚动展开
- 动作形成候选未来
- 目标在终点等待
- 排序CEM 逐步改进计划

一个小故事
世界模型已经从无奖励的观测—动作旅程中学完一本地图集。现在,一位旅行者带着当前照片和目的地明信片到来。地图集可以预测后果,但预测本身没有偏好;明信片为它提供了偏好。
潜在地图集仍可能扭曲墙壁、方向、时间和数据支持范围。目标图像不是成功检测器,不是路线,不是训练时使用的奖励,也不能证明目的地可达。
技术背包
当前观测与目标观测使用同一个冻结视觉编码器,因此可以比较二者的坐标。但它们的角色仍然不同:
current history -> initial condition for dynamics
candidate actions -> controls for dynamics
goal image -> terminal comparison only
固定当前历史和候选动作,只交换目标时,基准滚动展开不能发生变化;只有它们的排名应当改变。目标的预处理、摄像机、环境和支持范围仍需符合检查点的输入契约。共享编码器无法修复不匹配的裁剪或归一化。
CEM 对时域 H 上的完整动作序列进行采样。每个候选序列都从同一当前潜在历史出发,并接收各自的动作。冻结预测器以自回归方式展开每个序列。基准模型输出潜在 token,而不是视频;它只提供一条确定性路径,没有经过校准的置信度。
对于每个候选序列,冻结准则取最终预测潜在状态并计算:
J(a0:H-1) = sum_d (z_hat_H[d] - z_goal[d])^2
只有终端 token 会被评分。目标中没有显式的墙壁、碰撞、中间安全、控制消耗、路线长度或支持范围惩罚。平方欧氏距离在学完表征后计算便宜且不需要参数;但从定义上说,它并不是可达性。
CEM 选取低代价样本作为精英,并重新拟合动作提议分布。“最佳”始终只表示:在这个冻结模型、终端代价、有限样本和已记录的求解器约定下最佳。附录 B 的文字描述返回最终提议分布均值;算法 2 也允许返回最佳样本,或均值序列的第一个动作。LeWM 仓库的外部求解器版本没有锁定,因此精确复现必须记录它。
所以,无奖励训练和目标导向行动并不矛盾:动力学学习不使用任务奖励;之后在推理时,目标函数告诉搜索应该偏爱哪个想象未来。
容易骗过我们的把戏
让一个固定候选群体只滚动展开一次,然后在三张有数据支持的目标图像之间切换。终端潜在状态必须保持不变,而代价排序应随之改变。如果滚动展开也发生变化,说明目标泄漏进了动力学,或随机性没有固定。
现在使用一个不可能或数据支持不足的目标。每个候选仍会得到一个数值;若没有显式的弃权规则,CEM 仍会返回计划。能够数值排序并不意味着可行。
协议细节可以主导结果。LeWM v1/v2 使用 TwoRoom 目标偏移量/预算 100/150;当前 v3 将其修订为 25/50,与仓库在这两个字段上的设置一致。一项独立审计报告称,同一组发布权重在两种协议解读下分别得到 14% 和 84%。在一项配对比较中,将目标改为每个回合记录中的最终目标,并把预算设为 150 步,会使 84% 变为 8%;由于目标构造和预算都发生了变化,这不是单变量因果结果。
证据凭据
LeWorldModel v3、冻结的 jepa.py 和 eval.py,支持冻结模型的目标图像规划和终端潜在代价。
沿用同一系统的 Research Frontier 后续工作 arXiv:2608.12959v1 报告称,在一条 TwoRoom 证据链中,终端潜在 L2 会随真实距离增加先饱和,随后反而下降;替代目标也会改变行为。它并没有为原始 LeWM 添加可达性头,也没有建立通用修复方案。
快速检查
- 哪两个输入会进入动力学,哪个输入只进入代价函数?
- 为什么不可达目标仍然会产生一个 CEM 计划?
- 只交换目标明信片时,什么应当保持不变?