课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 编码形成两个潜在点。
- 测量间距越小看起来越好。
- 检查短直线可能被墙挡住。
- 测试排序会偏爱真实可行的路线吗?

一个小故事
两个孩子隔着一堵墙,站得非常近。直尺说:“距离好短!”双脚却说:“先去找门。”
原始 LeWorldModel v3 使用一把同样简单的规划直尺。它比较最终想象潜在状态 (z_H) 与单独编码的目标潜在状态 (z_g):
[ J = \lVert zH-z_g\rVert_2^2 = \sum_i (z{H,i}-z_{g,i})^2 . ]
这把直尺速度快,不需要奖励标签,还能为每个候选计划给出一个分数。这些都是优秀的基准性质,却不能让该分数自动变成最短路径长度、行程时间、成功概率、安全性或任务进度。
真正规则
- 目标由终端代价使用;它并不是偷偷输入动力学预测器的未来观测。
- 对非负欧氏间距取平方,在固定表征内不会改变排序;但忠于来源的 LeWM 准则是求和后的平方间距。
- 欧氏距离具有对称性:(d(A,B)=d(B,A))。可达性却可能有方向,或取决于动作预算。
- 原始代价尺度取决于潜在维度和坐标尺度。跨模型比较未经处理的数值前,应先在一个明确命名的检查点内部比较排序。
- SIGReg 可以让群体大致呈高斯分布,却不能让相邻潜在点自动通过有效动作相连。
规划器真正需要的是一种排序:当候选 A 是更好的决策时,它的代价应低于候选 B。在简单样本对上得到较高的平均相关性,仍可能掩盖墙壁或接触边界附近少量却决定性的反序。
可能骗过我们的把戏
构造四组直线距离相同的起点—目标对:
- 两点都在同一个开放房间;
- 两点隔着墙,彼此很近;
- 两点与门口对齐;
- 两点位于不同房间,并且都离门很远。
只把模拟器几何用作评估预言机。比较潜在状态排序、最短可行路线、预算约束下的可达性、固定 CEM 预算下选出的第一个动作,以及真实执行结果。
先为真实编码的终点打分,再为模型生成的终点打分。如果采用预言机动力学时排序就已出错,应检查表征或代价几何;如果只在滚动展开后出错,应检查动力学漂移;如果排序良好而计划失败,责任可能在搜索、支持范围、动作转换或执行。
实验凭据
基准主张来自 LeWorldModel v3 和冻结的作者提交 8edfeb3。它只支持这样一种范围有限的表述:LeWM 用简单、对称的平方距离为终端潜在状态排序,而该距离是否符合路线长度或可达性,必须通过实验检验。
后续的 Objective Bottleneck 研究报告称,在一个独立实现的 TwoRoom 系统中,潜在 L2 与空间距离对齐较弱,替换代价后行为也发生了变化。它是同一系统的后续工作,并不是第二次独立复现,也不是通用可达性度量。
应记录检查点、预处理、潜在宽度、样本对生成器、预言机定义、动作预算、CEM 预算和随机种子。墙壁示意图是教程反例,并不能证明每个 LeWM 检查点都会在这里失败。
快速检查
- 为什么平方潜在距离是一个有用的基准?
- 对称的终点直尺本身永远无法表达什么?
- 哪种预言机替换可以区分错误的代价排序和错误的滚动展开?