JEPA4Japan · 教程

第 25 章——失败诊断手册

1,307字 3分钟阅读 #LeWorldModel#世界模型#JEPA

从数据覆盖和潜在崩塌,到被忽略的动作、不稳定统计、误导性代价与停滞规划器,逐层追踪失败。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 当前课程

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 冻结一次失败相同回合、随机种子、候选。
  2. 向后排查从执行回溯到数据。
  3. 每次替换一层换成测量或预言机对应项。
  4. 只提出最小主张保留其他可能解释。
同一个一动不动的智能体,可能有许多不同原因。

故障排查树从环境动作开始,一路向后回溯到有效数据。

一个小故事

医生听到一句“病人无法移动”。原因可能是肌肉、神经、药物、疼痛,也可能只是监视器没有接好。替换一切也许能消除症状,却会破坏诊断。

LeWM 智能体静止不动,可能意味着表征崩塌、动力学听不见动作、代价平坦、CEM 样本糟糕、反归一化把动作归零,或一堵墙挡住了有效命令。应从一个冻结的失败样本开始,而不是从自己最喜欢的理论开始。

真正规则

从最后一个物理事实开始反向排查:

  1. 环境收到了预期的原始动作吗?
  2. 反归一化动作有变化,并且通过裁剪了吗?
  3. CEM 的提议分布和精英发生变化了吗?
  4. 候选代价有变化吗?
  5. 滚动展开会正确响应动作吗?
  6. 表征保留了所需差异吗?
  7. 数据窗口、时序和动作有效吗?

记录每个接口的两侧。只说“选定动作”并不完整,必须说明它是归一化值、裁剪值、重复动作、动作块级数值,还是环境单位。冻结规划器随机性和候选 batch。

为了检查动作利用,应固定一段历史,把记录动作、交换动作、归零动作和置换动作,分别与相应环境转移比较。输出发生变化,比非零梯度更有力;但如果变化方向错误,结果仍然是错的。

对于自反馈失败,使用同一段记录动作,分别在记录上下文路径和自反馈路径中重放。标记第一次分歧,并按门口、接触和支持范围切片。在这项更简单的比较可以解释之前,不要引入 CEM。

可能骗过我们的把戏

两段最终视频都显示一个不动的点。

智能体一: 候选和滚动展开都有变化;CEM 更新正确;但代价平坦,因为当前嵌入被错误复制到了目标位置。预言机代价能够区分冻结候选。

智能体二: 代价能够区分,CEM 也选择了很强的动作;但错误的归一化列在环境执行前把它变成了零。

症状相同,最早可观察到的断点却不同。

其他具有区分力的测试包括:

  • 代价平坦:验证目标身份、广播、终端分布、打乱后的目标,以及预言机任务进度;
  • 覆盖不足还是程序错误:把支持范围图谱与已知转移重放、极少量重复转移拟合交叉检查;
  • 极小样本过拟合:按顺序增加复杂度——一个转移、同一上下文下的两个动作、一段短序列,再到门口/接触;
  • SIGReg 主导:记录各项损失和模块梯度、分布宽度、预测,以及受控权重扫描;
  • 小 batch:跨 batch 和随机投影重复统计,统计每个相对时间位置的不同样本数,并改变组成。

增加投影方向无法创造缺失观测。梯度累积也不会扩大 batch 级 SIGReg 检验实际见过的群体。

实验凭据

修复之前,归档源代码版本、检查点哈希、组合后的配置、数据集索引、原始观测、归一化与原始动作、候选 batch、代价和随机状态。

冻结 SIGReg 权重是 0.09;方法文字在没有另行说明时写作 0.1。PushT 的高权重消融只适用于特定任务,不是通用安全区间。只有在受控权重下,留出动力学和行为也发生变化时,较大的打印损失或梯度才足以称为“主导”。

诊断树是围绕 LeWorldModel v3 原始路径,以及冻结的 jepa.py、train.py 和 eval.py 构建的教程结构,提交为 8edfeb3。预言机修复只会在该项测试下把疑点指向被替换层;绝不能证明所有未替换层都正确。

快速检查

  1. 为什么固定动作重放必须先于规划器调优?
  2. 对一个不动的智能体,什么证据可以推翻“CEM 坏了”?
  3. 最早可观察到的断点与唯一根本原因有何不同?