JEPA4Japan · 教程

第 27 章——为潜在空间做一次“健康检查”

1,291字 3分钟阅读 #LeWorldModel#世界模型#JEPA

检查矩、协方差谱、有效维度、近邻、轨迹连续性和路径几何,同时避免过度解读 t-SNE、UMAP 或解码器。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 当前课程
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 分布宽度点云还“活着”吗?
  2. 邻居相近状态真是有用邻居吗?
  3. 路径动作和事件会让路径弯曲吗?
  4. 图像把漂亮视图变成检验。
没有任何一项潜在空间生命体征能单独宣告“健康”。

多种仪器分别检查同一个冻结潜在群体,不把结果合成一个分数。

一个小故事

病人的血压可以完美,却仍然无法爬楼梯。测量是真实的,只是不能代表整个身体。

潜在点云可以拥有广泛方差,却丢掉接触、速度或位于墙哪一侧的信息。它也可以只记住缓慢变化的背景,从而画出一条漂亮平滑的路径。先冻结待检样本:检查点、预处理、history、连接位置、回合和采样规则。

真正规则

使用多种仪器,并将它们回答的问题分开:

  • 均值和坐标方差: 捕获常量、失效坐标轴、尺度漂移和重载错误。
  • 协方差谱和有效维度: 显示群体分布位于哪些方向。较低数值既可能是崩塌,也可能反映任务确实简单。
  • 成对距离和重复项: 捕获点的堆积,但无法说明可达性。
  • 最近邻: 展示原始观测、时间距离、动作、状态差异和下一结果;除非测试目标就是重复,否则要排除自身及相邻重复项。
  • 轨迹连续性: 把视觉变化、潜在状态变化和任务变量变化放到同一时间轴上。分开真实编码状态与自反馈预测。

按门口、墙壁、自由移动、接近、首次接触和持续接触,分别切片每项读数。广泛的干扰因素变化可以掩盖某项任务差异的缺失。

LeWM v3 报告,在其选定的事后度量下,PushT 潜在轨迹会随训练变得更直,并且在该分析中比 PLDM 更直。基准 LeWM 并没有显式的直线度损失。应把直线度与表征分布、动作敏感性和匹配轨迹区域共同报告:一条崩塌后的直线也会完美笔直。

可能骗过我们的把戏

t-SNE 和 UMAP 是把学习到的高维世界压平的制图师。应重复使用多个随机种子、邻域设置和合理度量,保留每一张图,审计原始空间中的邻居,不要把坐标轴命名为“位置”或“时间”。岛屿、桥梁、空白间隙、面积和远距离簇之间的距离,都可能是投影伪影。

LeWM v3 在结构化 PushT 状态网格上使用 t-SNE,并报告定性的采样邻域模式。UMAP 是教程扩展。二者都无法揭示真实拓扑、可达性、因果性或理解能力。

辅助解码器是另一种查看器。论文描述了一个轻量 Transformer 解码器,从 192 维最终 [CLS] 表征出发;在一个 224 像素、patch-16 示例中,它使用 196 个学习得到的图块查询。论文不同章节对时间顺序的措辞并不一致。这里采用一个明确的教程协议:冻结命名检查点,按回合划分数据,在之后训练解码器,并使重建始终位于基准 LeWM 训练和规划之外。

清晰图像只能证明依赖于解码器的可重建性,不能证明状态完整,也不能证明模型使用了这些信息。论文的 PushT 重建损失消融,在其测试设置下规划成功率低于基准;却不能证明重建总是有害。

实验凭据

每个邻居画廊或投影都要保存样本身份、原始潜在距离、拟合后添加的标签、算法设置、随机种子和原始观测。对每条轨迹,标记穿门、接触、摄像机变化和动作;跨回合使用同一个参考投影。

不要把基准中自发出现的事后直线化,与独立工作 Temporal Straightening for Latent Planning 混淆。后者使用显式曲率正则项、stop-gradient 目标和基于梯度的规划。这些组成部分不属于原始 LeWM v3。

来源边界是 LeWorldModel v3 和冻结核心提交 8edfeb3。冻结仓库不包含完整的 t-SNE、直线化、解码器或 VoE 脚本与设置,因此本课程没有确立对这些分析的精确复现。

快速检查

  1. 为什么较低有效维度在一个任务中可能健康,在另一个任务中却可能有害?
  2. 什么能把最近邻画廊变成动力学审计?
  3. 清晰的事后解码器能证明什么,又不能证明什么?