课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 改变外观保持物理转移不变。
- 改变物理保持外观几乎不变。
- 改变动作保持完整历史不变。

一个小故事
护照签发处给每个人一张不同的卡片,档案永远不会崩塌。但每张卡片只记录衬衫颜色和墙纸,却遗漏运动方向,以及可以穿过哪一道门。
潜在状态也可能如此。背景纹理可以填满许多维度,一个很小的速度或接触变量却会消失。全局方差、秩和漂亮投影可以排除部分故障,却不能证明与任务相关的动力学保留了下来。
真正规则
使用匹配干预。
- 保持模拟器状态和转移不变,只改变环境保证在动力学上无关的外观因素。
- 保持外观几乎不变,只改变一个已知会改变下一结果的物理变量。
- 保持完整可观测历史不变,只改变候选动作,重置模拟器,再把每个预测分支与匹配的真实转移比较。
“外观”并不会自动成为干扰因素。交通灯颜色、阴影或纹理都可能指示真实控制状态。必须由实验——而不是直觉——保证不变性。
首先要保证观测充分。单帧图像无法揭示渲染结果相同的两种相反速度。诊断表征失败前,要提供足够的历史,使运动变得可观察。如果历史已经包含线索,而潜在状态和预测未来仍然相互重合,测试才更有力。
动作敏感性有三个层次:输出是否变化、是否朝正确方向变化,以及响应是否依赖状态—动作交互。打乱、归零、相反和留出动作都有帮助,但可能产生支持范围之外的样本对。只有非零响应,并不等于动力学正确。
可能骗过我们的把戏
让同一个 PushT 姿态出现在三种无害地板纹理下,再构造一个外观几乎相同、运动方向或接触状态却相反的场景。如果无害纹理造成的预测变化大于物理干预,说明在这个受控环境中,模型优先保留了错误差异。
PhyLatent 为三种操作性故障命名:
- 物理不变性崩塌(physical invariance collapse): 仅外观变化超过某个选定物理转移的影响;
- 物理可识别性崩塌(physical identifiability collapse): 在选定物理变量上相距很远的状态被映射到近处;
- 反事实动力学崩塌(counterfactual dynamics collapse): 后果显著不同的动作被压缩到一起。
这些是最近一篇论文内部的定义,不是通用分类法,也不是定理级识别。阈值、模拟器变量、尺度、可观测性和样本对选择都会产生影响。PhyLatent 描述的基线使用停止梯度的未来目标,不同于原始的连通目标 LeWM v3;其训练方案还使用特权物理目标。
实验凭据
后续 LeWM 家族方案购买了不同类型的监督:
- PSG-JEPA 保留 LeWM 前向损失和 SIGReg,再加入只在训练时使用的本体状态头,以及多时域关节角变化 (q_{t+k}-q_t) 预测头。测试时不再提供特权标签。
- SCALE 加入 (1-\mathrm{corr}(d_z,d_q)),让潜在状态对之间的平方距离,与标准化后的选定模拟器状态中的平方距离对齐。它的回归对照使用同一组标签,却不塑造成对几何。作者报告 15 个任务—求解器平均值全部改善;每项训练配置只有一个随机种子,评估集则衡量回合采样。
- AC-MTM 移除 SIGReg,保留连通前向 MSE,并加入只在训练时使用的 Action-NCE 逆向头,用于从 batch 内动作中识别记录的连续动作块。它没有目标网络、stop-gradient、预训练编码器或重建损失;测试时丢弃逆向头。在一个匹配的三训练随机种子研究中,它在四项标准任务上的平均结果与 SIGReg 相当,但在 PushT 上落后;在其 OGBench Visual Scene 轨迹目标压力测试中则报告 80%,对比 58%。52% 的随机基线来自一次 50 回合运行。
PSG-JEPA 和 SCALE 使用特权模拟器标签。AC-MTM 则需要有信息量的动作变化和可观测后果。它们都不是原始 v3 的组成部分,本课程也没有独立复现任何一种。
每项新诊断都要保存模拟器重置状态、历史、干预、真实结果、外观对照、支持范围、检查点、阈值和随机种子。还应把每项表征改进与固定规划器的排序和成功率交叉检查;更好的探针结果仍可能无法被代价读取。
快速检查
- 一个全局未崩塌的表征,如何丢失控制变量?
- 把外观变化称为无关之前,必须满足什么条件?
- 为什么动作分支必须与匹配的真实结果比较?