JEPA4Japan · 教程

第 3 章——JEPA 思想:预测意义,而不是图像的复制品

1,115字 3分钟阅读 #LeWorldModel#世界模型#JEPA

理解编码器、目标表示和预测器,再将 JEPA 与自编码器、对比学习和生成式视频模型进行比较。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 当前课程
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 编码形成上下文编码
  2. 施加条件加入掩码、时间或动作
  3. 预测瞄准目标编码
  4. 说清计算图模型家族不等于具体配方
JEPA 在表征空间中进行预测。“目标”一词并不自动意味着存在“教师”。

四间工坊分别重建像素、匹配样本对、生成帧,或预测目标表征。

一个小故事

画家会临摹每一块砖和每一道倒影,制图师则保留道路与路口。为了预测旅行者下一步会走到哪里,制图师只需在地图上推进一个点,而不必把整条街重新画一遍。

这就是“预测含义,而不是图像副本”的有用解释。但学习得到的地图并没有人类制图师为符号命名。第 17 维并没有贴着“门口”的标签。模型可能记住油漆颜色,却忘记单行规则。这里的“含义”指学习到的表征,而它是否有用仍需要证据。

真正规则

模型家族层面的 JEPA 骨架刻意保持中立:

context_code = encode_context(context)
target_code = encode_target(target)
predicted_code = predict(context_code, optional_condition)
loss = compare(predicted_code, target_code)

这段示意并没有规定使用一个还是两个编码器、权重共享还是分离、是否采用 stop-gradient、EMA、负样本或随机潜变量。这些选择属于具体命名的方法。

LeWM v3 对这一思想作了如下具体化:

image-history codes + recorded actions -> next-image code prediction

当前帧和下一帧使用同一个共享且可训练的视觉编码器。动作条件预测器估计下一表征。预测损失通过编码器在上下文侧和目标侧的使用路径保持连接,而 SIGReg 另行施加群体分布形状的约束。原始 v3 没有 EMA 目标教师、目标 stop-gradient,也没有预训练视觉编码器。

自编码器重建输入空间中的目标;生成式视频模型输出帧或视觉 token;对比式目标比较指定的匹配与不匹配样本;LeJEPA 与 LeWM 则在没有负样本对的情况下结合预测和 SIGReg。这些是不同的契约,并不是通用性能排名;原则上,JEPA 也可以用其他损失训练。

容易骗过我们的把戏

固定同一个观测,分别输入两个动作:

up = predict(current, action="up")
right = predict(current, action="right")
check distance(up, right)

如果真实后果明明不同,而两个输出仍几乎一致,模型可能只是在预测常见的后续,并没有理会控制信号。此时 CEM 虽然评估了许多动作序列,却几乎都经过同一条分支。更多搜索无法创造出被预测器抹掉的选择。

非零间距还不能证明动力学正确。应当把变化方向和大小与数据支持范围内记录的后继状态相比较,同时加入一个对照状态:在那个状态下,两个小动作确实应该产生相似效果。

证据凭据

宽泛的架构来自 A Path Towards Autonomous Machine Intelligence v0.9.2。I-JEPA v3 是一种面向图像、带 EMA 目标编码器的特定方案。LeJEPA v3 提出了结合预测与 SIGReg 的动机。LeWorldModel v3 和冻结的 train.py 才是 LeWM 动作条件连接计算图的权威依据。

不要把 I-JEPA 的教师网络移植到 LeWM 的描述中,不要按定义把所有 JEPA 都称为非对比式方法,也不要仅凭架构推断语义。受控探针最多只能支持一个范围明确的主张:某项差异可被解码、可用于预测,或对规划有用。

快速检查

  1. 为什么“目标表征”不能证明教师网络一定存在?
  2. LeWM v3 的哪些计算图特征使它有别于 I-JEPA 的方案?
  3. 为什么良好的平均预测仍可能与无用的 CEM 搜索并存?