课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 潜在状态人群同一时刻,多个样本
- 投下影子随机一维方向
- 提取指纹余弦 + 正弦探针
- 比较标准高斯

一个小故事
“不要让所有人住在同一个地址”这条要求太模糊。一座城市可以避开单点,却把所有居民挤在同一条路上;也可以沿某个方向无限拉长,或排成简单统计量看似健康的 X 形。
SIGReg——Sketched Isotropic Gaussian Regularization(草图式等方高斯正则化)——为这群人提供了一个参考形状。它要求嵌入群体在许多一维方向上的投影,类似等方标准高斯的投影。
技术背包
对于每个相对时间位置,冻结的 LeWM 会把 B 个嵌入视为一个群体,不会把时间混入其中。一个随机单位向量会把每个 D=192 维嵌入投影为一个有符号标量。对许多方向重复这个过程,再将每个一维样本与解析形式的高斯“指纹”比较。
这里的每个高斯术语都很重要:
- 标准(standard): 每个单位方向上的投影都以零为中心,尺度为一;
- 等方(isotropic): 参考分布没有偏好的方向;
- 高斯(Gaussian): 它不是均匀球体。密度在原点达到峰值,而高维径向概率质量大致集中在半径
sqrt(D)附近。
Epps–Pulley 构造使用经验特征函数。在有限的频率探针上,它会对余弦和正弦响应取平均,再与已知的标准高斯响应比较。LeWM 最小化的是一个平滑差异;它不会计算 p-value,也不会宣布某个 batch“通过了正态性检验”。
[T,B,D]
-> for each time: B-point cloud
-> random 1D projections
-> cosine/sine responses at finite knots
-> gap to analytic N(0,1) fingerprint
-> average across directions and time
冻结代码每次调用采样 1,024 个方向,并使用从 0 到 3 的 17 个节点及高斯加权窗口。方向会被重新采样,因此训练数值具有随机性。该类被标记为仅支持单 GPU,也不会跨设备汇聚全局群体。论文附录以不同方式展示了示意性积分;应当区分论文描述与可执行代码事实。
Cramér–Wold 原理指出,如果所有一维投影都匹配,就可以确定多元分布。冻结训练只有有限 batch、有限方向和有限节点。这是一种近似,并不是高斯性的合格证。
容易骗过我们的把戏
只检查 X 形点云的水平轴和垂直轴,两个方向上的投影都可能看起来无害,而对角线投影却会暴露依赖关系。随机视角能减少永久盲区,但有限的 1,024 个视角仍可能漏掉狭窄缺陷。
再来看一段真实走廊轨迹。狭窄点云也许反映了世界真正具有低维结构,而不是编码器发生故障。强迫它匹配 192 维等方目标,可能造成冲突。LeWM 论文提出,这种失配可能是 TwoRoom 问题的原因之一;这是作者假设,并不是已经确定的原因。
增加投影并不会创造更多观测。从一千个角度观察一小群人,并不会让它变成一大群人。batch 大小和投影数量处理的是不同类型的不确定性。
证据凭据
这一机制来自 LeWorldModel v3、冻结的 SIGReg、LeJEPA v3、Epps–Pulley 论文 和 Cramér–Wold。
SIGReg 需要 batch 中的多个样本,却不需要有标签的负样本,也不需要学习得到的教师,因为其参考分布是解析的。在理想目标下,匹配该参考分布会排除完全相同的常量表征。它不能证明物理规律、动作敏感性、可达性或有限运行中的成功。
快速检查
- 为什么非零方差和单位协方差仍是不完整的检查?
- 为什么有限随机投影不能把 Cramér–Wold 变成证明?
- SIGReg 用什么取代了负样本对或 EMA 教师?