课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 许多场景房间、门口、运动
- 同一个编码一切都变得相同
- 完美作弊预测差距变成零

一个小故事
设想一家护照签发处,给每位旅客都盖上同一张卡片。它的记录一致得惊人:每一本“下一张护照”都与每次预测完全相符。但这些护照无法区分任何人。
这就是完全表征崩塌(complete representation collapse)。维度崩塌(dimensional collapse)更加隐蔽:护照之间虽有变化,但几乎所有信息都挤在高维潜在空间里的一条细路上。较低的内在维数也可能完全合理,因此“狭窄”是一个需要结合数据和任务解读的警告,而不是自动判决。
真正规则
这个漏洞只需四行就能写完:
encode(any_image) -> the_same_vector
predict(any_vector, any_action) -> the_same_vector
prediction_gap -> zero
state distinctions -> gone
它之所以成立,是因为下一状态目标也由同一个可训练编码器产生,而不是一份固定的物理答案。因此,只采用预测损失的训练允许常量解;这不代表每次低损失运行都会走到这个解。
SIGReg 加入了一个群体分布形状目标。单个重复点不可能匹配非退化的等方标准高斯,因此完全采用常量的捷径会与理想联合目标发生冲突。这里的结论刻意保持狭窄。一个分布广阔的点云仍可能编码背景颜色、忽略动作,或把状态排列成误导规划的几何结构。
崩塌也不等同于过拟合。一个模型可能在训练集和验证集上同时崩塌;也可能保留丰富的训练样本差异,却严重泛化不良。因此既要测量表征结构,也要测量留出数据上的行为。
下列筛查手段应配合使用:
- 每坐标方差,用来发现明显收缩;
- 协方差谱,用来发现经过旋转的狭窄子空间;
- 有效秩,用来比较匹配设置下的不同运行;
- 成对距离分布和重复率;
- 能回溯到原始观测的最近邻面板;
- 用于检验控制利用情况的动作交换敏感性。
它们都不是证明。类似单位阵的协方差只描述二阶结构;满秩不能证明动力学正确;看起来漂亮的邻居可能只是遵循颜色,而不是可达性。
容易骗过我们的把戏
分别使用和不使用 SIGReg,训练两组其余条件匹配的小型 TwoRoom 模型。在每个检查点上,始终使用同一批探针数据,记录预测损失、原始 SIGReg、方差、协方差谱、有效秩、成对距离、最近邻和动作交换结果。
假设并不是“没有 SIGReg 的运行一定会崩塌”,而是:移除群体分布项会重新引入一个预测损失本身无法排除的平凡最优解。如果点云仍然分布广泛,说明避免了完全崩塌,但仍然必须进行动作和滚动展开测试。如果一批多样化输入变成狭窄的潜在点云,这条证据会比仅在一个狭小房间角落得到的秩数值更有力。
证据凭据
LeWorldModel v3 指出了常量捷径并使用 SIGReg。LeJEPA v3 解释了完全崩塌与维度崩塌,并以隐藏的 X 形示例说明,简单的坐标轴检查为何会漏掉依赖关系。冻结的 train.py 分别记录预测损失、SIGReg 和总损失。
单随机种子的独立 TwoRoom 报告测得位置探针 Pearson 相关系数为 0.9988,接近论文中的 0.996。这说明在该表征中,位置可由线性方法读出;却不能证明是 SIGReg 导致了这一结果、预测器确实使用了位置,或表征学到了物理规律。
快速检查
- 为什么常量编码能得到完美的下一潜在状态一致性?
- 维度崩塌与过拟合有何不同?
- 为什么必须让多项潜在空间诊断相互印证,才能判定崩塌?