JEPA4Japan · 教程

第 18 章——MPC:不要一次信任模型太久

1,128字 3分钟阅读 #LeWorldModel#世界模型#JEPA

只执行一小段动作,再次观测并重新规划,从而闭合控制回路,限制模型误差和环境扰动。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 当前课程
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 观察编码真实证据。
  2. 规划CEM 想象 H 个动作块。
  3. 执行承诺执行 K 个动作块。
  4. 再次观察丢弃过时后缀并重新规划。
CEM 在想象中搜索;MPC 则把真实观测带回来。

内层 CEM 搜索位于外层观察、执行和重规划循环之中。

一个小故事

地图说“向右转”,道路施工却把你挤向左边。明智的导航系统会再次观察,并绘制一条新路线。

模型预测控制(Model Predictive Control,MPC)也是如此。它想象一段有限计划,执行明确指定的前缀,接收新的真实观测,再次进行搜索。反馈限制了一条预测作为唯一叙事持续的时间;却无法保证编码器、预测器、代价或搜索能正确解释新证据。

真正规则

请区分三种时钟:

  • (H):每个候选序列中想象的模型级动作块数量。
  • (K):重规划之前实际执行的模型级动作块数量,其中 (K\le H)。
  • 一个动作块内部包含的原始环境时间步。

在报告和冻结的 LeWM 配置中,(H=5)、(K=5),每个动作块含五个连续环境动作。所以整个五块计划横跨 25 个环境时间步,并在下一次规划调用前全部执行。整个回合范围内它仍属于 MPC,但不是示意图中常见的 (K=1) 反馈循环。

freeze the trained encoder and predictor
while the task is active:
  encode the real observation history and separate goal
  run inner CEM over H-block candidates
  select a plan using the recorded return convention
  execute its first K blocks in the environment
  receive a new real observation and plan again

CEM 和 MPC 不是同义词。CEM 在单次规划调用内部改变动作提议分布;MPC 是外层的“观察—规划—执行—观察”策略。评估期间,二者都不会更新 LeWM 权重;从未执行的候选序列也永远不会收到真实反馈。

可能骗过我们的把戏

可以把新观测称作一次认知重置(epistemic reset),但必须看清它的边界。它重置的是系统对旧想象终点的依赖;并不会揭示隐藏速度、接触力或特权模拟器状态。一个系统性的穿墙代价错误,可能每一轮都会再次被选中。

在执行完第一个动作块后,施加一次受控推搡。比较:

  1. 整个回合采用开环的控制器;
  2. 教学用 (K=1) 控制器;
  3. 报告式 (K=5) 控制器。

固定起点、目标、检查点、动作边界、真实动作总预算和随机种子计划。记录每个控制器第一次看见推搡的时间、下一份计划如何变化、规划调用次数、延迟和实际路径。较短的 (K) 能获得更新鲜的反馈,也会进行更多次 CEM 调用。这是反馈与计算之间的权衡,并不是免费提升。

实验凭据

每个循环都应保存选定的想象计划、实线表示的已执行前缀、虚线表示的未使用后缀、返回的观测、前缀预测误差和替代计划。同时记录归一化模型动作与原始环境动作;适配器错误可能伪装成模型失败。

来源边界是 LeWorldModel v3 和冻结的 TwoRoom 评估配置,提交为 8edfeb3。独立的 TwoRoom 重实现 在其自身系统中,也采用了五块规划时域和五块执行间隔。

严谨的结论是:当偏差可被观测,且其余模型、代价、搜索和动作路径都有用时,MPC 可以减少系统对长期开环预测的依赖。它不是安全性证明,不是完美状态重置,也不能证明较短的 (K) 普遍更好。

快速检查

  1. 为什么报告必须区分模型动作块与环境时间步?
  2. 新观测会重置什么?哪些错误仍可能保留?
  3. 内层 CEM 时钟与外层 MPC 时钟有何不同?