JEPA4Japan · 教程

第 33 章——长视界规划:预测得更远,还是规划得更聪明?

1,522字 4分钟阅读 #LeWorldModel#世界模型#JEPA

比较动作前缀预测、并行未来、宏动作与层次规划,同时正视不受支持的潜在子目标和分布外搜索。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 当前课程
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

全局图景

  1. 缓慢的链条每个想象出的步骤都要等待上一步。
  2. 跨大步前缀预测或层次结构可能有用。
  3. 错误的终点更长的视界修不好错误的代价函数。
“长视界”之下隐藏着不同的问题:串行计算、误差累积、可复用的时间结构、超出支持的子目标,以及会误导人的终端度量。

一个小故事:四家旅行办事处

一名信使必须穿越整个国家。办事处 A 一条接一条地画出每条道路。办事处 B 并行地询问:“前 1、2、3 或 4 条指令分别会把人带到哪里?”办事处 C 使用可复用的火车区间来规划。办事处 D 则凭空发明了一座靠近目标、却不与任何轨道相连的魔法车站。

四家都宣称自己在做“长程规划”,但它们修复的是不同问题。基线 LeWorldModel v3 以自回归方式向前滚动潜在状态:候选计划可以彼此并行,但每个计划内部的时间步仍然是串行的。后面的预测状态会把前面的预测状态当作输入,因此计算量和模型误差都可能累积。

同一段动作序列,一边被当作自我馈入的链条评估,另一边则以观测状态为锚点,分别预测多个动作前缀。

扇形结构改变了预测接口;它不会因此生成多个随机未来,不保证校准,也没有取消动作搜索。

技术背包

路线确切改动必须随时附带的边界
基线 v3在 CEM/MPC 内进行单步、自我馈入的潜在滚动预测候选项并行不会消除时间依赖
Fast-LeWM从同一个观测锚点并行预测多个前缀视界“多个未来”指多个时间视界,而非多模态结果;编码、采样、评分和模型误差仍然存在
VLWM,Beyond the Next Step用分块调度进行可变长度的直接预测它不是 Fast-LeWM;所报告的平均 13% 使用训练种子 3072,并对每个 (dataset, Δ) 在事后选取最佳 P1/P2/P3
2024 年层次 RSSM 研究学习更粗时间层级和抽象动作“HWM”是本课程的简称,不是论文中的方法名,也不是 LeWM 变体
Hi-LeWM高层 CEM 在一个冻结的低层 LeWM 之上提议潜在子目标不受限制的宏动作和子目标可能离开训练支持;层次化不会自动变得更好

一个有用的层次结构需要:可复用的动作块;一个误差增长速度慢于所节省低层工作量的高层模型;低层控制器真正可达的子目标;以及两层都足够的搜索预算。经验宏动作搜索能使提案更靠近已观测的锚点,但接近数据并不是可达性或安全性证书。

在增加任何时间视界之前,先测试终端度量。独立 TwoRoom 后续研究报告称,对其审计的检查点和协议而言,仅更换代价函数就大幅改善了远距离目标的结果。这标识了该设置中的规划器接口瓶颈;它不能证明所有长视界失败都是代价函数导致的。

尝试推翻这个想法

给一名完美的低层司机安排一座不可能的高层车站:它在潜在欧氏距离上看似接近目标,却落在已编码宏动作的集合之外,而且与目标之间隔着一面墙。提高高层视界和 CEM 种群数。如果规划器反而更自信地选中了这座不可能的车站,那么更多搜索只是放大了支持不匹配。

现在比较四个锁定条件:基线滚动预测、前缀预测、使用自由潜在子目标的层次结构,以及受经验宏动作约束的层次结构。使用完全相同的数据、编码器、低层模型、动作预算、候选项统计口径、目标和随机种子。记录实际时延、模型调用次数、滚动误差、支持距离、子目标可行性和闭环成功率。没有匹配硬件和预算的加速比不可移植;没有可行子目标的成功率提升,也不能作为层次结构的证据。

实验凭据与证据边界

三个快问快答

  1. 即使候选项已经向量化,基线滚动预测中哪一部分仍是串行的?
  2. 为什么一个在潜在空间中看似可达的子目标,对低层控制器而言可能无法使用?
  3. 在为更长时间视界付出成本之前,应该先诊断什么?