课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 分布宽度点云还“活着”吗?
- 邻居相近状态真是有用邻居吗?
- 路径动作和事件会让路径弯曲吗?
- 图像把漂亮视图变成检验。

一个小故事
病人的血压可以完美,却仍然无法爬楼梯。测量是真实的,只是不能代表整个身体。
潜在点云可以拥有广泛方差,却丢掉接触、速度或位于墙哪一侧的信息。它也可以只记住缓慢变化的背景,从而画出一条漂亮平滑的路径。先冻结待检样本:检查点、预处理、history、连接位置、回合和采样规则。
真正规则
使用多种仪器,并将它们回答的问题分开:
- 均值和坐标方差: 捕获常量、失效坐标轴、尺度漂移和重载错误。
- 协方差谱和有效维度: 显示群体分布位于哪些方向。较低数值既可能是崩塌,也可能反映任务确实简单。
- 成对距离和重复项: 捕获点的堆积,但无法说明可达性。
- 最近邻: 展示原始观测、时间距离、动作、状态差异和下一结果;除非测试目标就是重复,否则要排除自身及相邻重复项。
- 轨迹连续性: 把视觉变化、潜在状态变化和任务变量变化放到同一时间轴上。分开真实编码状态与自反馈预测。
按门口、墙壁、自由移动、接近、首次接触和持续接触,分别切片每项读数。广泛的干扰因素变化可以掩盖某项任务差异的缺失。
LeWM v3 报告,在其选定的事后度量下,PushT 潜在轨迹会随训练变得更直,并且在该分析中比 PLDM 更直。基准 LeWM 并没有显式的直线度损失。应把直线度与表征分布、动作敏感性和匹配轨迹区域共同报告:一条崩塌后的直线也会完美笔直。
可能骗过我们的把戏
t-SNE 和 UMAP 是把学习到的高维世界压平的制图师。应重复使用多个随机种子、邻域设置和合理度量,保留每一张图,审计原始空间中的邻居,不要把坐标轴命名为“位置”或“时间”。岛屿、桥梁、空白间隙、面积和远距离簇之间的距离,都可能是投影伪影。
LeWM v3 在结构化 PushT 状态网格上使用 t-SNE,并报告定性的采样邻域模式。UMAP 是教程扩展。二者都无法揭示真实拓扑、可达性、因果性或理解能力。
辅助解码器是另一种查看器。论文描述了一个轻量 Transformer 解码器,从 192 维最终 [CLS] 表征出发;在一个 224 像素、patch-16 示例中,它使用 196 个学习得到的图块查询。论文不同章节对时间顺序的措辞并不一致。这里采用一个明确的教程协议:冻结命名检查点,按回合划分数据,在之后训练解码器,并使重建始终位于基准 LeWM 训练和规划之外。
清晰图像只能证明依赖于解码器的可重建性,不能证明状态完整,也不能证明模型使用了这些信息。论文的 PushT 重建损失消融,在其测试设置下规划成功率低于基准;却不能证明重建总是有害。
实验凭据
每个邻居画廊或投影都要保存样本身份、原始潜在距离、拟合后添加的标签、算法设置、随机种子和原始观测。对每条轨迹,标记穿门、接触、摄像机变化和动作;跨回合使用同一个参考投影。
不要把基准中自发出现的事后直线化,与独立工作 Temporal Straightening for Latent Planning 混淆。后者使用显式曲率正则项、stop-gradient 目标和基于梯度的规划。这些组成部分不属于原始 LeWM v3。
来源边界是 LeWorldModel v3 和冻结核心提交 8edfeb3。冻结仓库不包含完整的 t-SNE、直线化、解码器或 VoE 脚本与设置,因此本课程没有确立对这些分析的精确复现。
快速检查
- 为什么较低有效维度在一个任务中可能健康,在另一个任务中却可能有害?
- 什么能把最近邻画廊变成动力学审计?
- 清晰的事后解码器能证明什么,又不能证明什么?