JEPA4Japan · 教程

第 2 章——为什么不直接预测下一张图像?

1,228字 3分钟阅读 #LeWorldModel#世界模型#JEPA

理解像素误差为何可能漏掉与任务相关的结构,以及有用的潜在状态为什么必须在压缩与可预测性之间取得平衡。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 当前课程
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 许多像素纹理、光照、噪声
  2. 一个微小线索门开着还是关着?
  3. 形成编码保留有用差异
  4. 测试它紧凑不代表正确
较大的像素误差可能无关紧要;门口的一点小误差却可能完全逆转正确动作。

一个预测弄错了无害纹理,另一个预测只在门口犯了很小却至关重要的错误。

一个小故事

预测 A 弄错了地板纹理和阴影,但智能体、墙壁和门口都在正确位置。预测 B 看起来几乎完美,唯一问题是一条很细的区域把门口封住了。像素分数也许会更喜欢 B,但控制器不应该这样选。

像素并非毫无用处。一个小红灯、一根电缆、一块湿地或一道接触边缘,都可能极其重要。这里的结论更窄:我们在哪里测量误差,决定了训练会迫使模型保留哪些差异。

真正规则

LeWM 的核心目标不是生成下一张图像。它对记录中的下一观测进行编码,根据更早的编码和动作预测该观测的编码,再比较这两个编码。

observations: [B,T,C,H,W] -> codes: [B,T,D]
used actions: [B,T-1,A]
prediction and target: [B,T-1,D] <-> [B,T-1,D]

这为**选择性抽象(selective abstraction)**留出了空间。如果不同光照不改变动作后果,它们可以共享一个有用编码。但“潜在”二字并不提供任何保证。学习到的编码可能保留墙纸,却丢掉门口。核心滚动展开是一串向量,而不是隐藏的视频;若要渲染图像,需要另配诊断用解码器。

对控制有用的表征,应该保留情境差异、动作效果、时间线索,以及能供规划器使用的比较关系。在离线数据的状态—动作支持范围之外,还必须谨慎对待这种表征。这些都是需要检验的期望性质,不是压缩天然承诺的属性。

冻结的基准路径使用一个共享且可训练的编码器。编码后的下一观测与它保持连接——没有 EMA 教师,也没有 stop-gradient。后面介绍的 SIGReg 会抵抗最简单的常量编码捷径,但 SIGReg 并不会为物理规律或可达性贴标签。

容易骗过我们的把戏

想象一个“压缩旋钮”。一端是包含一切干扰因素的完整图像,另一端则把所有图像变成同一个常量向量。常量非常小,也完全可以预测:预测器每次返回它即可。但它同样毫无用处。

一种好的诊断方式,是每次只改变一个因素。先固定几何结构,只改变纹理和光照;然后保持外观相似,只开关门口。理想结果是:编码对明确指定的干扰因素保持不变,却对会改变路线的线索敏感。再把任务反过来——例如让地板纹理指示摩擦力——以证明“干扰因素”取决于任务,并不是像素固有的属性。

一张漂亮的聚类图远远不够。还要同时查看留出数据上的预测、动作交换测试和规划结果。

证据凭据

LeWorldModel v3 和冻结的 train.py 支持紧凑的下一嵌入预测、保持连接的目标、SIGReg,以及位于核心目标之外的辅助解码器。

I-JEPA v3 中一项范围有限的比较报告称:在 ImageNet-1K 上使用 ViT-L/16,并以 1% 标签进行线性评估时,采用表征目标得到 66.9 的 top-1,采用像素目标得到 40.7。两者预训练日程并不相同——分别为 500 和 800 个 epoch。这是一个有明确名称的静态图像结果,不能证明在控制任务中,潜在预测总是优于像素预测。

允许的表述是:潜在预测允许选择性抽象,但不保证它一定发生。不要声称像素预测天生更差、编码越小越好,或潜在误差就等于任务误差。

快速检查

  1. 为什么许多错误像素可能不如一条错误的门边重要?
  2. 为什么常量编码很容易预测,却无法用于控制?
  3. 哪一组受控样本可以检验编码是否保留了门口几何结构?