JEPA4Japan · 教程

第 13 章——原始 LeWM 的端到端训练机制

1,228字 4分钟阅读 #LeWorldModel#世界模型#JEPA

说明 LeWM v3 为什么既没有停止梯度、EMA 教师,也没有预训练视觉编码器,并把它的训练图与相关 JEPA 方法区分开。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 当前课程
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 一个编码器上下文和未来
  2. 动作作为预测器的条件
  3. 连通目标没有停止标志
  4. SIGReg抵抗常量作弊
原始 LeWM v3 端到端训练一个实时变化的坐标系——没有 EMA 教师。

在 v3 训练计算图中,上下文观测和未来观测使用同一个保持连接的共享编码器。

一个小故事

一张简单却错误的示意图,画着上下文编码器、浅色目标塔、停止标志和一条 EMA 箭头。它看起来眼熟,是因为 BYOL、I-JEPA 和 V-JEPA 的特定版本确实使用相关的目标机制。但它不是原始 LeWM v3。

LeWM 更像是一位制图师和一位路线规则学习者共同编辑同一张实时地图。SIGReg 是一项分区规定,防止所有地址都挤到同一块土地上。分区规定可以让城市铺开,却无法让道路自动变得正确。

技术背包

v3 的训练拓扑如下:

observations -> one shared trainable encoder -> all latents
context latents + recorded actions -> predicted future latent
predicted future <-> connected future latent
observation latents -> SIGReg
one total objective -> joint update

**目标(target)**一词仅表示“预测要与什么进行比较”,并没有规定谁拥有权重、权重如何更新。冻结的 train.py 从同一段编码序列中切出未来潜在状态,并且在计算预测损失前不会将其 detach。因此,预测压力会通过共享编码器在上下文侧和未来侧的使用路径到达它,同时也会到达动作编码器和预测器。

高斯参考是解析的,不是学习得到的教师。记录中的下一观测是数据,并不是教师网络。原始 v3 还关闭了视觉预训练;“从头开始”意味着视觉编码器仍然存在,只是没有从外部预训练检查点初始化。

只使用预测损失时,每个地点都可以获得同一个地址。在理想的 SIGReg 目标下,一个重复点无法匹配非退化的等方高斯。因此,联合目标会抵抗最简单、最精确的常量解。但它无法让有限优化中的崩塌变得不可能,也无法确保分布广泛的表征保留了罕见的任务变量。

“端到端”的范围止于训练边界。数据集构建不是学习出来的。后续 CEM 规划中,编码器和预测器权重都被冻结,也不会有规划梯度返回去重新训练它们。

命名不同的计算图仍然不同:BYOL v3、I-JEPA v3 和 V-JEPA v1 在所引用的方案中使用 stop-gradient/EMA 目标机制;LeWorldModel v3 则使用共享的连通编码器加 SIGReg。这是机制比较,不是在不同数据和任务之间进行性能排名。

容易骗过我们的把戏

关键字搜索中,三处 .detach() 调用可能看起来完全一样,含义却各不相同:

  • 在训练损失之前 detach 未来目标:会改变方法;
  • 在损失之后 detach 指标副本:只是日志记录;
  • 在冻结规划期间 detach 目标:此时本来就不可能更新模型。

审计时要看数值、调用时机和所处阶段。然后运行一个小型拓扑探针:

A: future target connected
B: future target detached before comparison
C: target connected + SIGReg

钩子应当显示:B 只丢失目标侧的预测路径,而 C 新增了一条编码器侧的群体分布路径。一个 batch 能揭示连接关系,却不能说明哪种变体最终训练或规划得更好。

证据凭据

这张计算图来自 LeWorldModel v3、冻结的 train.py 和冻结的 model/lewm.yaml。比较对象分别绑定到 BYOL v3、I-JEPA v3 和 V-JEPA v1。

允许的表述是:LeWM v3 完全采用端到端训练,并且在结构上不同于这些有明确名称的停止目标/EMA 方案。不要声称 EMA 已经过时、SIGReg 能普遍替代教师、从头训练天生更好,或梯度连通就证明学到了物理规律。

快速检查

  1. 为什么“目标”并不意味着“教师”?
  2. 哪些学习路径会收到预测压力?SIGReg 又会直接作用于哪些路径?
  3. 日志记录、冻结目标和损失前的未来目标中,哪一种 detach 会改变 v3?