JEPA4Japan · 教程

第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?”

1,356字 4分钟阅读 #LeWorldModel#世界模型#JEPA

一起编码当前图像和目标图像,滚动候选动作序列,再按终点潜在代价选择计划;训练世界模型时不需要奖励。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 当前课程
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 当前开始滚动展开
  2. 动作形成候选未来
  3. 目标在终点等待
  4. 排序CEM 逐步改进计划
目标是规划时才送达的明信片。它为想象终点排序,并不训练或引导基准动力学。

一个封装好的世界模型在规划时收到当前观测,以及另一张独立的目的地明信片。

一个小故事

世界模型已经从无奖励的观测—动作旅程中学完一本地图集。现在,一位旅行者带着当前照片和目的地明信片到来。地图集可以预测后果,但预测本身没有偏好;明信片为它提供了偏好。

潜在地图集仍可能扭曲墙壁、方向、时间和数据支持范围。目标图像不是成功检测器,不是路线,不是训练时使用的奖励,也不能证明目的地可达。

技术背包

当前观测与目标观测使用同一个冻结视觉编码器,因此可以比较二者的坐标。但它们的角色仍然不同:

current history -> initial condition for dynamics
candidate actions -> controls for dynamics
goal image -> terminal comparison only

固定当前历史和候选动作,只交换目标时,基准滚动展开不能发生变化;只有它们的排名应当改变。目标的预处理、摄像机、环境和支持范围仍需符合检查点的输入契约。共享编码器无法修复不匹配的裁剪或归一化。

CEM 对时域 H 上的完整动作序列进行采样。每个候选序列都从同一当前潜在历史出发,并接收各自的动作。冻结预测器以自回归方式展开每个序列。基准模型输出潜在 token,而不是视频;它只提供一条确定性路径,没有经过校准的置信度。

对于每个候选序列,冻结准则取最终预测潜在状态并计算:

J(a0:H-1) = sum_d (z_hat_H[d] - z_goal[d])^2

只有终端 token 会被评分。目标中没有显式的墙壁、碰撞、中间安全、控制消耗、路线长度或支持范围惩罚。平方欧氏距离在学完表征后计算便宜且不需要参数;但从定义上说,它并不是可达性。

CEM 选取低代价样本作为精英,并重新拟合动作提议分布。“最佳”始终只表示:在这个冻结模型、终端代价、有限样本和已记录的求解器约定下最佳。附录 B 的文字描述返回最终提议分布均值;算法 2 也允许返回最佳样本,或均值序列的第一个动作。LeWM 仓库的外部求解器版本没有锁定,因此精确复现必须记录它。

所以,无奖励训练和目标导向行动并不矛盾:动力学学习不使用任务奖励;之后在推理时,目标函数告诉搜索应该偏爱哪个想象未来。

容易骗过我们的把戏

让一个固定候选群体只滚动展开一次,然后在三张有数据支持的目标图像之间切换。终端潜在状态必须保持不变,而代价排序应随之改变。如果滚动展开也发生变化,说明目标泄漏进了动力学,或随机性没有固定。

现在使用一个不可能或数据支持不足的目标。每个候选仍会得到一个数值;若没有显式的弃权规则,CEM 仍会返回计划。能够数值排序并不意味着可行。

协议细节可以主导结果。LeWM v1/v2 使用 TwoRoom 目标偏移量/预算 100/150;当前 v3 将其修订为 25/50,与仓库在这两个字段上的设置一致。一项独立审计报告称,同一组发布权重在两种协议解读下分别得到 14% 和 84%。在一项配对比较中,将目标改为每个回合记录中的最终目标,并把预算设为 150 步,会使 84% 变为 8%;由于目标构造和预算都发生了变化,这不是单变量因果结果。

证据凭据

LeWorldModel v3、冻结的 jepa.py 和 eval.py,支持冻结模型的目标图像规划和终端潜在代价。

沿用同一系统的 Research Frontier 后续工作 arXiv:2608.12959v1 报告称,在一条 TwoRoom 证据链中,终端潜在 L2 会随真实距离增加先饱和,随后反而下降;替代目标也会改变行为。它并没有为原始 LeWM 添加可达性头,也没有建立通用修复方案。

快速检查

  1. 哪两个输入会进入动力学,哪个输入只进入代价函数?
  2. 为什么不可达目标仍然会产生一个 CEM 计划?
  3. 只交换目标明信片时,什么应当保持不变?