JEPA4Japan · 教程

第 30 章——训练目标与规划目标之间的差距

1,411字 4分钟阅读 #LeWorldModel#世界模型#JEPA

比较局部 MSE 与全局可达性、有向时间距离、多时间尺度预测和滚动一致性,同时不改写原始 LeWM。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 当前课程
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 预测这个动作之后会发生什么?
  2. 排序我们应当偏爱哪个结局?
  3. 搜索CEM 考虑过哪些计划?
  4. 执行现实世界中发生了什么?
准确的局部预测与有用的计划排序,是两项不同工作。

即使每个局部步骤都预测准确,计划仍可能被排向一条穿墙到达目标的路线。

一个小故事

一名快递员能准确预测每一个小步骤。目标隔着墙却很近,于是规划器不断选择“朝目标走”。快递员最终一直顶着墙,而没有先远离目标、走向门口。

这个故事根本不需要糟糕的下一步预测。训练问的是:“这个动作是否通往正确的下一潜在状态?”规划问的是:“应当偏爱哪一整段序列?”原始 LeWM v3 用终端潜在状态的平方欧氏距离回答第二个问题。预测未来与判断路线并不是同一个对象。

真正规则

较低均方预测误差无法保证良好排序,因为:

  • 常见局部运动可能淹没罕见的门口或接触决策;
  • 表征可以预测邻近转移,却把墙壁两侧的终点排列得很糟;
  • 规划评估的是自反馈、模型生成状态,而不只是记录上下文;
  • 欧氏代价具有对称性,没有显式的方向、预算、支持范围或不确定性参数。

在改变整个模型之前,先进行预言机替换:

oracle rollout + learned cost still ranks badly
  → inspect cost or representation geometry
learned rollout + oracle cost fails
  → inspect multi-step dynamics and support
both oracles succeed, deployed planner fails
  → inspect search, observation, action conversion, execution

预言机是拥有特权模拟器访问权的实验室仪器,而不是可部署的纯像素组件。

后来的两项方案改变的是不同工作。RC-aux 用加权的多时域开环预测取代原始单步预测项,其时域集合仍包含第 1 步,并增加一个预算条件可达性头。Temporal-Distance JEPA 学习一个独立的有向时间代价,以及一个 (H=5) 的滚动一致性损失,把每个预测潜在状态与记录未来经过 stop-gradient 的编码相匹配。这个局部 detach 属于后来的方法;原始 v3 的目标仍然保持连接。

轨迹偏移只证明某种行为实际做过什么,并不是预言机最短时间。跨轨迹负样本也可能是假负样本。

可能骗过我们的把戏

首先只改变直尺。对一个固定 TwoRoom 候选库使用精确模拟器终点,分别按直线距离和尊重墙壁的图距离排序,再移除墙壁并重复。

如果图距离只在墙壁造成绕路时改变排序,那么拓扑代价解释就通过了这项玩具移除测试。如果面对精确终点,两种代价都失败,应检查候选覆盖或任务定义。随后再加入学习编码,反转方向,改变预算,最后才加入学习滚动展开。

不要把每个后续方法都称作同一种“规划感知目标”:

  • Objective Bottleneck 冻结一个 TwoRoom 表征/预测器,只替换规划器代价。
  • Traj-LeWM 增加目标条件潜在轨迹代价和合成排序负样本,并在每个 epoch 后挖掘只执行终点规划时的失败案例,用于训练该代价。
  • Decision-Metric Alignment 测量 Plan–Real 和 CEM 各阶段的 Spearman,再加入只在训练时使用的逆动力学头和目标动作头,同时保留欧氏 MPC 代价。

这些干预分别针对直尺、路径和表征几何。

实验凭据

Objective Bottleneck 后续工作报告:潜在 L2 与真实距离之间只有 (r=0.426),尽管位置 ridge 探针达到 (R^2=0.9922)。在其检查点上,offset-100 时间代价把成功率从 26% 提高到 98%;在发布检查点上,从 14% 提高到 34%,而采用特权解码位置的代价达到 70%。这只涉及一个环境、每个检查点一个随机种子,以及不同于 v3 默认值的长距离目标协议。

Traj-LeWM 报告,相比其 LeWM 对照,在 PushT、Cube、Reacher 和 TwoRoom 上分别提高 3、14、7 和 7 个百分点,结果在三个评估随机种子上取平均。它会挖掘失败案例,因此该干预并不只依赖离线数据训练。

Decision-Metric Alignment 的每项配置只有一次训练运行;三个随机种子度量的是评估变异,其排序诊断还需要模拟器滚动展开。这些都是作者报告结果,不是独立复现。

基准来源仍是 LeWorldModel v3,提交 8edfeb3。不能把任何后续 stop-gradient、可达性、时间或动作头目标倒推回 v3。

快速检查

  1. 为什么采用预言机动力学时,TwoRoom 规划仍可能很差?
  2. 多时域预测和可达性评分分别承担什么工作?
  3. 哪个预言机单元格会告诉你:应先改变直尺,而不是预测器?