JEPA4Japan · 教程

第 31 章——全局不崩塌不保证保留任务相关动力学

1,450字 4分钟阅读 #LeWorldModel#世界模型#JEPA

测试状态可辨识性、物理不变量和反事实动作敏感性,同时把 PhyLatent 视为较新的诊断提议,而不是 LeWM 基线。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 当前课程
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 改变外观保持物理转移不变。
  2. 改变物理保持外观几乎不变。
  3. 改变动作保持完整历史不变。
表征可能因为错误的原因而分布得很广。

两个分布同样广泛的潜在点云,分别按外观和动作后果组织观测。

一个小故事

护照签发处给每个人一张不同的卡片,档案永远不会崩塌。但每张卡片只记录衬衫颜色和墙纸,却遗漏运动方向,以及可以穿过哪一道门。

潜在状态也可能如此。背景纹理可以填满许多维度,一个很小的速度或接触变量却会消失。全局方差、秩和漂亮投影可以排除部分故障,却不能证明与任务相关的动力学保留了下来。

真正规则

使用匹配干预。

  • 保持模拟器状态和转移不变,只改变环境保证在动力学上无关的外观因素。
  • 保持外观几乎不变,只改变一个已知会改变下一结果的物理变量。
  • 保持完整可观测历史不变,只改变候选动作,重置模拟器,再把每个预测分支与匹配的真实转移比较。

“外观”并不会自动成为干扰因素。交通灯颜色、阴影或纹理都可能指示真实控制状态。必须由实验——而不是直觉——保证不变性。

首先要保证观测充分。单帧图像无法揭示渲染结果相同的两种相反速度。诊断表征失败前,要提供足够的历史,使运动变得可观察。如果历史已经包含线索,而潜在状态和预测未来仍然相互重合,测试才更有力。

动作敏感性有三个层次:输出是否变化、是否朝正确方向变化,以及响应是否依赖状态—动作交互。打乱、归零、相反和留出动作都有帮助,但可能产生支持范围之外的样本对。只有非零响应,并不等于动力学正确。

可能骗过我们的把戏

让同一个 PushT 姿态出现在三种无害地板纹理下,再构造一个外观几乎相同、运动方向或接触状态却相反的场景。如果无害纹理造成的预测变化大于物理干预,说明在这个受控环境中,模型优先保留了错误差异。

PhyLatent 为三种操作性故障命名:

  1. 物理不变性崩塌(physical invariance collapse): 仅外观变化超过某个选定物理转移的影响;
  2. 物理可识别性崩塌(physical identifiability collapse): 在选定物理变量上相距很远的状态被映射到近处;
  3. 反事实动力学崩塌(counterfactual dynamics collapse): 后果显著不同的动作被压缩到一起。

这些是最近一篇论文内部的定义,不是通用分类法,也不是定理级识别。阈值、模拟器变量、尺度、可观测性和样本对选择都会产生影响。PhyLatent 描述的基线使用停止梯度的未来目标,不同于原始的连通目标 LeWM v3;其训练方案还使用特权物理目标。

实验凭据

后续 LeWM 家族方案购买了不同类型的监督:

  • PSG-JEPA 保留 LeWM 前向损失和 SIGReg,再加入只在训练时使用的本体状态头,以及多时域关节角变化 (q_{t+k}-q_t) 预测头。测试时不再提供特权标签。
  • SCALE 加入 (1-\mathrm{corr}(d_z,d_q)),让潜在状态对之间的平方距离,与标准化后的选定模拟器状态中的平方距离对齐。它的回归对照使用同一组标签,却不塑造成对几何。作者报告 15 个任务—求解器平均值全部改善;每项训练配置只有一个随机种子,评估集则衡量回合采样。
  • AC-MTM 移除 SIGReg,保留连通前向 MSE,并加入只在训练时使用的 Action-NCE 逆向头,用于从 batch 内动作中识别记录的连续动作块。它没有目标网络、stop-gradient、预训练编码器或重建损失;测试时丢弃逆向头。在一个匹配的三训练随机种子研究中,它在四项标准任务上的平均结果与 SIGReg 相当,但在 PushT 上落后;在其 OGBench Visual Scene 轨迹目标压力测试中则报告 80%,对比 58%。52% 的随机基线来自一次 50 回合运行。

PSG-JEPA 和 SCALE 使用特权模拟器标签。AC-MTM 则需要有信息量的动作变化和可观测后果。它们都不是原始 v3 的组成部分,本课程也没有独立复现任何一种。

每项新诊断都要保存模拟器重置状态、历史、干预、真实结果、外观对照、支持范围、检查点、阈值和随机种子。还应把每项表征改进与固定规划器的排序和成功率交叉检查;更好的探针结果仍可能无法被代价读取。

快速检查

  1. 一个全局未崩塌的表征,如何丢失控制变量?
  2. 把外观变化称为无关之前,必须满足什么条件?
  3. 为什么动作分支必须与匹配的真实结果比较?