JEPA4Japan · 教程

第 19 章——长视界滚动:小误差怎样滚成大失败

1,304字 3分钟阅读 #LeWorldModel#世界模型#JEPA

诊断误差累积、模型生成的分布偏移、潜在漂移、隐藏不确定性,以及利用模型漏洞的规划器。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 当前课程
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 从真实开始编码一段真实历史。
  2. 预测形成下一潜在状态。
  3. 反馈给自身估计结果变成上下文。
  4. 测量跟踪每个时域上的漂移。
即使第一份复印件看起来很好,反复复印也可能逐渐偏离正确路线。

连续复印形成的链条逐渐偏离原件。

一个小故事

把一张图片复印一次,看起来也许没有问题。再把复印件反复复印,微小失真就可能产生显著影响。

LeWM 的滚动展开是自回归的。第一次预测从编码后的真实观测开始,后续预测则可能消费先前预测出的潜在状态。训练和单步测试通常看到的真实上下文,比长时间规划滚动展开更多。这就是训练—滚动展开上下文差距。

不过,复印故事也有局限:误差不一定平滑增长,也不一定永远增长。动力学可以放大、旋转、抵消或衰减一项差异。应当测量曲线,而不是假设误差会指数或单调漂移。

真正规则

针对同一个留出回合和同一段记录动作序列,保留两条路径:

  • 记录上下文路径: 每一步都重新编码真实观测。
  • 自反馈路径: 初始历史之后,把预测结果反馈给下一次预测。

把每个预测潜在状态,与冻结编码器为现实中实际后继观测产生的潜在状态相比较。绘制误差随模型时域的变化,而不只查看终点。按穿门、开始接触、丢失接触、动作幅度和经验支持范围分别切片。

原始 LeWM v3 只输出一个潜在估计。它不会输出经过校准的置信度,也不会给出可能未来的分布。确定性输出并不意味着环境本身是确定的。

单步准确率仍然有用,只是回答的问题更小。良好的记录上下文预测,可以与糟糕的自反馈滚动展开、错误的终端代价或损坏的执行适配器同时存在。

可能骗过我们的把戏

CEM 的职责是寻找较低的预测代价。如果某个不受数据支持的动作序列,会让学习到的滚动展开产生不切实际的乐观结果,那么增加候选数或优化轮数,反而可能更可靠地找到这个漏洞。

不要把每一次失败都直接叫作“模型利用”,而应检验下列主张:

  1. 固定一组动作序列库。
  2. 比较想象代价与真实执行结果。
  3. 标注动作支持范围和时域。
  4. 保持模型、任务和真实动作预算不变,增加搜索预算。

如果预测出的最佳代价改善、选中序列离数据支持范围更远,同时真实结果以配对方式恶化,模型利用就成为可信假设。仅凭最终崩溃,无法区分动力学、代价、搜索、支持范围和执行问题。

如果预言机代价修复了候选排序,但滚动终点仍错误,应修复动力学。如果采用预言机动力学加学习代价后仍偏爱错误路线,应修复代价或表征几何。缩短时域可以减少滚动深度,却无法修复一把把隔墙状态错误排序的直尺。

实验凭据

保存检查点、预处理、初始真实历史、对齐的记录动作、动作块语义、教师强制和自反馈潜在状态、每个时域的误差、支持范围标签及所有随机种子。标记第一次定性分歧,而不只记录最后一张难看的图像。

这一机制以作者提交 8edfeb3 中冻结的 LeWM 滚动展开代码,以及 LeWorldModel v3 的局限性讨论为依据。模型利用思想在相邻工作 Model-Based Planning with Energy-Based Models 中也有先例。

独立的 TwoRoom 重实现 报告称,在一个环境、每项配置只使用一个训练随机种子的条件下,单步误差能够排序三个检查点的短时域成功率,却不能排序其长时域成功率。该研究没有确定原因;它不能证明漂移或模型利用普遍存在。

快速检查

  1. 记录上下文预测与自反馈预测之间发生了什么变化?
  2. 为什么一个确定性潜在状态并不代表经过校准的确定性?
  3. 哪种成对变化趋势会让模型利用成为可信假设?