课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 说清能力预测?解码?控制?
- 说清测试指标、基线、干预。
- 说清条件数据、支持范围、预算、随机种子。
- 说清边界仍然无法推出什么?

一个小故事
七位证人都说:“模型理解了世界。”一位看见较低预测误差,一位解码出位置,一位改变了动作,一位测试了新组合,一位看到瞬移峰值,一位执行了因果干预,另一位看到规划器成功。
他们报告的可能都是真实观测,但并不是同一种能力。
真正规则
使用七个彼此独立的坐标:
- 可预测性: 在明确动作、时域和支持范围下,预测留出数据中的潜在后果。
- 可解码性: 指定读出器可以从冻结表征恢复标签。
- 可控性: 在预算约束下,动作能够引导预测和执行结果。
- 组合泛化: 熟悉的组成部分能在未见组合中工作。
- 反事实一致性: 配对变化产生正确的敏感性和不变性。
- 因果识别: 在显式干预假设下恢复变量和关系。
- 规划效用: 在固定任务与搜索契约下,学习模型和代价能够改善动作选择。
它们是坐标,不是阶梯。一个坐标不会自动授予另一个;多项正向测试也不会通过投票变成证明。
随机留出的回合不一定具有组合性。真正的组合划分,会留出起点—目标、物体—动作、布局或阶段组合,同时让各个组成部分在其他位置出现。同一轨迹向前 25 步的目标是有用控制任务,却不是任意目标组合。
因果性需要明确命名的变量、有效干预、混杂因素假设、可识别不变量、支持范围控制和替代结构。一个可解码方向加一次改变行为的消融,仍可能存在纠缠或分布外问题。
可能骗过我们的把戏
设想一个查表式导航器,存储许多熟悉的轨迹片段。面对同一轨迹的未来目标时,它经常成功。由于背景和时间都与地点相关,探针能解码位置;最后一帧预测器则会对瞬移产生峰值。
规划效用、可解码性和 VoE 敏感性全都呈阳性。现在随机改变策略速度、替换背景,并要求系统在新布局中使用熟悉动作。它失败了。
这个故事不是在描述 LeWM,而是在证明一个逻辑点:多项诊断可能共享同一捷径。如果不同测试具有不同的失败模式,并且每项测试都能缩小一种特定替代解释,三角验证才最有力。
审计这些常见措辞:
- “位置在表征里面” → “位置可以由这个读出器恢复”;
- “解码器展示了想象未来” → “辅助解码器根据预测潜在状态重建一个视图”;
- “t-SNE 展示了学习到的地图” → “这个样本投影提示了一种邻域模式”;
- “规划器理解控制” → “规划器在该协议下取得了预算约束内的结果”;
- “模型知道瞬移不可能” → “在该扰动下,失配有所增加”。
实验凭据
用五个字段重建每一项主张:
- 能力;
- 测试、指标、基线和干预;
- 模型/论文版本、数据、环境、支持范围、时域、预算和随机种子;
- 结果与证据级别——主要方法事实、作者报告结果、独立复现或教程观测;
- 替代解释和明确不能推出的结论。
使用措辞阶梯。探针测试后说可恢复;在明确的数据偏移后说在接受测试的划分上能够泛化;经过匹配对照的干预后说在该干预下与行为有关。只有在实验设计和假设确实支持时,才使用必要、充分、因果和理解。
LeWorldModel v3 提供了作者报告的证据,涉及动作条件潜在预测、TwoRoom/Reacher/PushT/OGBench-Cube 中的预算约束规划、选定变量探针、定性潜在视图、PushT 直线化和对接受测试的瞬移干预的敏感性。冻结提交 8edfeb3 并不包含每项分析的完整脚本。所有这些结果合在一起,仍不能确立完整状态、广泛组合能力、校准后的未来、因果物理、现实世界可靠性或类人理解。
快速检查
- 为什么七种能力是坐标,而不是阶段?
- 什么能使一项数据划分真正具有组合性?
- 五字段科学主张为何优于仅把“证明”替换成“提示”?