课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 同一个现在一段潜在历史
- 动作 A这样转动控制旋钮
- 动作 B换种方式转动
- 新的分支比较下一潜在状态

一个小故事
把智能体放在门口下方。仅凭当前图像,无法决定明天会发生什么。“向左”“向右”和“停留”可能带来不同后继状态。编码器提供一个紧凑的名词——当前情形;动力学预测器提供一个动词——以动作为条件的变化。
当单帧图像无法显示运动时,历史信息会有帮助,但它不可能揭示每一种隐藏力、接触模式或被遮挡物体。输出只是确定性的潜在估计,并不承诺现实中的未来只有一个取值。
技术背包
概念接口如下:
state_history = encode(observed_frames) # [B,T,D]
action_history = encode(action_blocks) # [B,T,D]
next_guesses = causal_predict(state_history, action_history)
冻结的数据配置中,frameskip=5:一个模型步包含五个连续的环境动作。稠密动作块被展平,再映射到宽度 D。动作嵌入器采用宽度为一的时间卷积和一个小型多层映射,因此它不会在这里混合相邻时间位置;时间混合发生在因果 Transformer 中。
论文描述的预测器有六层,dropout 为 10%。动作通过 AdaLN 进入每一个条件 Transformer 块。动作路径会为注意力分支和前馈分支分别生成平移、缩放和残差门控,一共六个控制量。最终调制层从零开始初始化,因此动作调制在初始化时为中性,并可在学习中逐渐增强。
AdaLN 只是安装了一条控制线,并不能证明训练后的模型真的会听取动作。类似地,因果掩码能阻止模型偷看后面的 token,但不能证明模型学到了因果物理。未来突变检查应当显示:改变较晚的输入,不会影响较早的输出。
在冻结的四观测默认设置下,训练会对齐全部三组样本对:
context: z0 z1 z2
actions: a0 a1 a2
predictions: p1 p2 p3
targets: z1 z2 z3
这就是教师强制:上下文来自记录观测的编码结果。它不是教师编码器。规划期间,滚动展开会追加 p1,然后依据越来越多由模型自己产生的历史继续预测。冻结代码只保留最近的、长度由配置指定的历史窗口。
容易骗过我们的把戏
把所有动作块替换为零,从而关闭动作通道,同时保持数据、模型大小和预算一致。如果行为策略通常走同一条路线,即使动作被静音,模型也可能很好地预测出平均的后续状态。
现在选择一个受数据支持的门口上下文,其中向左和向右有不同的记录后继状态。固定视觉历史,交换动作,然后把预测状态之间的间距,与编码后真实后继状态之间的间距相比较。再加入一组自由空间对照,其中两个微小动作确实应产生相似效果。
必须区分三项指标:教师强制的单步误差、动作交换敏感性,以及随时域变化的开环误差。动作可以在第一步产生影响,却在后面消失;低单步误差可以与漂移并存;好的滚动展开也可能被错误的规划代价错误排序。
证据凭据
LeWorldModel v3 和冻结的 module.py 支持因果注意力与 AdaLN 路径。冻结的 jepa.py 支持以追加和截断方式进行的自回归滚动展开。
允许的表述是:v3 提供了一条动作条件路径、因果训练上下文和自回归规划。不要声称 AdaLN 能证明可控性,不要把教师强制理解成师生架构,不要说每一个 LeWM 步在所有配置中都代表五个原始动作,也不要说低单步误差保证规划成功。
快速检查
- AdaLN 使什么成为可能?它不能证明什么?
- 为什么这里的教师强制并不是师生架构?
- 哪三项诊断分别衡量局部预测、动作利用和滚动展开稳定性?