课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 观察编码真实证据。
- 规划CEM 想象 H 个动作块。
- 执行承诺执行 K 个动作块。
- 再次观察丢弃过时后缀并重新规划。

一个小故事
地图说“向右转”,道路施工却把你挤向左边。明智的导航系统会再次观察,并绘制一条新路线。
模型预测控制(Model Predictive Control,MPC)也是如此。它想象一段有限计划,执行明确指定的前缀,接收新的真实观测,再次进行搜索。反馈限制了一条预测作为唯一叙事持续的时间;却无法保证编码器、预测器、代价或搜索能正确解释新证据。
真正规则
请区分三种时钟:
- (H):每个候选序列中想象的模型级动作块数量。
- (K):重规划之前实际执行的模型级动作块数量,其中 (K\le H)。
- 一个动作块内部包含的原始环境时间步。
在报告和冻结的 LeWM 配置中,(H=5)、(K=5),每个动作块含五个连续环境动作。所以整个五块计划横跨 25 个环境时间步,并在下一次规划调用前全部执行。整个回合范围内它仍属于 MPC,但不是示意图中常见的 (K=1) 反馈循环。
freeze the trained encoder and predictor
while the task is active:
encode the real observation history and separate goal
run inner CEM over H-block candidates
select a plan using the recorded return convention
execute its first K blocks in the environment
receive a new real observation and plan again
CEM 和 MPC 不是同义词。CEM 在单次规划调用内部改变动作提议分布;MPC 是外层的“观察—规划—执行—观察”策略。评估期间,二者都不会更新 LeWM 权重;从未执行的候选序列也永远不会收到真实反馈。
可能骗过我们的把戏
可以把新观测称作一次认知重置(epistemic reset),但必须看清它的边界。它重置的是系统对旧想象终点的依赖;并不会揭示隐藏速度、接触力或特权模拟器状态。一个系统性的穿墙代价错误,可能每一轮都会再次被选中。
在执行完第一个动作块后,施加一次受控推搡。比较:
- 整个回合采用开环的控制器;
- 教学用 (K=1) 控制器;
- 报告式 (K=5) 控制器。
固定起点、目标、检查点、动作边界、真实动作总预算和随机种子计划。记录每个控制器第一次看见推搡的时间、下一份计划如何变化、规划调用次数、延迟和实际路径。较短的 (K) 能获得更新鲜的反馈,也会进行更多次 CEM 调用。这是反馈与计算之间的权衡,并不是免费提升。
实验凭据
每个循环都应保存选定的想象计划、实线表示的已执行前缀、虚线表示的未使用后缀、返回的观测、前缀预测误差和替代计划。同时记录归一化模型动作与原始环境动作;适配器错误可能伪装成模型失败。
来源边界是 LeWorldModel v3 和冻结的 TwoRoom 评估配置,提交为 8edfeb3。独立的 TwoRoom 重实现 在其自身系统中,也采用了五块规划时域和五块执行间隔。
严谨的结论是:当偏差可被观测,且其余模型、代价、搜索和动作路径都有用时,MPC 可以减少系统对长期开环预测的依赖。它不是安全性证明,不是完美状态重置,也不能证明较短的 (K) 普遍更好。
快速检查
- 为什么报告必须区分模型动作块与环境时间步?
- 新观测会重置什么?哪些错误仍可能保留?
- 内层 CEM 时钟与外层 MPC 时钟有何不同?