课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
全局图景
- 缩成一点表示很容易崩塌。
- 把它撑开SIGReg 要求投影像高斯分布。
- 检查路线圆润的云团仍可能隐藏门的位置。
一个小故事:圆形城市
一位市长发现,所有居民都被挤在同一个广场里。解决办法是建造一座宽敞、圆润,且没有偏爱方向的城市。拥挤消失了——但真实的国家其实是两座由一座桥相连的岛屿。一个完美的圆,并不会自动成为有用的旅行地图。
这正是原始 LeWorldModel v3 中的张力所在。SIGReg 会取一批嵌入的许多一维投影,并将它们与标准各向同性高斯分布比较。恒定不变的表示无法满足这个目标,因此该规则能施加很强的抗崩塌压力。但 高斯 和 各向同性 描述的是整个样本群体的形状;它们并不会标出位置、速度、门口,或一条通过动作真正可行的路线。

“高斯不匹配”这一个说法,可能掩盖几种截然不同的机制。图中只是教学用的构造,不是对嵌入的实测,也不是因果证明。
技术背包
下面三项检查必须始终分开:
- 展开程度: 均值、协方差、有效秩和投影尾部,用来询问样本群体是否已经崩塌。
- 局部有用性: 时间相邻状态、动作分支、门口排序和滚动预测,用来询问邻近结构是否有助于预测与规划。
- 决策有用性: 闭环成功率用来询问模型、终端代价、CEM 搜索和动作执行能否协同工作。
低内在维度并不自动意味着崩塌。即使 TwoRoom 的像素维度很高,其有效变化也可能主要来自智能体的位置和近期运动。LeWM v3 报告了在其评估设置中较弱的 TwoRoom 规划表现,并提出数据多样性低、内在维度低,以及它们与高维高斯目标之间的张力,可能是原因。这是作者的假设,不是已证明的因果关系。后来的独立 TwoRoom 审计发现协议细节很重要,其后续研究则在特定检查点和协议下发现了终端度量瓶颈。这两项结果都不能普遍地为 SIGReg 脱责,也不能将其定罪。
后续论文测试了不同的修复方案;它们都不属于原始 v3:
| 后续路线 | 它改变了什么 | 它没有证明什么 |
|---|---|---|
| Sub-JEPA | 有限个固定的随机正交子空间 | 未见过的联合几何或拓扑 |
| TC-LeWM | 对时间居中后的残差施加 SIGReg | 慢变信息没有用;它的证据来自 LIBERO 行为克隆,而非基线 MPC |
| QQWorld | 将排序后的投影样本与高斯分位数匹配;可选的跨批次分离队列 | 全局高斯形状与任务一致,或原始 LeWM 分离了目标 |
| SMWM | 将逆动作回归用作抗崩塌目标 | 每一个任务变量都能被保留 |
| AC-MTM | 在批次内对比识别动作 | 它覆盖了重复、空操作、隐变量、随机、离散、混合或不受支持的动作 |
系数 lambda 决定 SIGReg 相对于预测损失的“音量”。当同一个群体目标看起来有用,只是声音太大或太小时,可以调节它。只有当受控证据指向某种具体不匹配时,才应改变结构:全空间压力、缓慢的任务漂移、尾部矫正,或不合适的边缘分布目标。
尝试推翻这个想法
为同一条环形轨迹构建两张潜在地图。地图 A 保留了每个时间邻居及路线的顺序,但它只位于一张很薄的二维曲面上。地图 B 则在打乱各点后,拥有漂亮的球形高斯总体。
如果地图 B 只在分布检查上获胜,而地图 A 在动作条件滚动预测和规划检查上获胜,那么“更像高斯分布”并不意味着“更有用”。现在固定数据、编码器、预测器、优化器、规划器、随机种子和预算;先扫描 lambda,然后每次只更换一个正则化器。同时测量崩塌程度、局部连续性、门口排序、多步预测与闭环规划。如果最佳结果出现在中间的 lambda,它支持的只是该设置下存在取舍,而非关于内在维度的普遍定律。
实验凭据与证据边界
- 基线:LeWorldModel v3,修订于 2026-06-03;固定代码
8edfeb3。它的共享编码器是端到端训练的:没有停止梯度的目标、EMA 教师,也没有预训练视觉编码器。 - 后续方案:Sub-JEPA v1、SMWM v1、TC-LeWM v2、QQWorld v1 和 AC-MTM v1。在证据截止日前,已确认 Sub-JEPA、SMWM 和 AC-MTM 的公开快照;TC-LeWM 和 QQWorld 则没有。
- 审计:TwoRoom 复现 v1、其目标函数后续研究,以及 tinylab
efa9e5d。独立性只对该 TwoRoom 重新实现及协议成立,不延伸到后续正则化器或整套基准。 - 日期:Sub-JEPA 2026-05-10;SMWM 2026-06-18;QQWorld 2026-07-30;TC-LeWM v2 2026-07-31;复现研究 2026-08-10;目标函数后续研究 2026-08-13;AC-MTM 2026-08-18。证据截止时间:2026-08-20,Asia/Tokyo。除非明确标注,所有后续实验结果均仍是作者自报。
三个快问快答
- 为什么一个没有崩塌的高斯云团,仍可能是糟糕的规划地图?
- 哪些测量可以区分合理的低内在维度与破坏性崩塌?
- 在
lambda扫描能支持因果解释之前,哪些因素必须保持不变?