课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 预测接下来应该出现什么?
- 只改变一件事颜色、状态或支持范围。
- 测量失配峰值代表敏感性,不代表信念。

一个小故事
一只球消失在幕布后,又出现在舞台另一侧。孩子倒吸一口气,运动检测器也被触发。二者都作出了响应,但可能只有一个响应涉及物理预期。
违反预期(Violation-of-Expectation,VoE)测试先产生预期中的后续,施加干预,再测量预测与观测之间的失配。瞬移产生更大的峰值,首先只意味着被测事件与模型预测更加不符。它并不表示模型已经知道瞬移不可能发生。
真正规则
使用具有相同前史、动作、干预时刻和评估窗口的配对三元组:
- 未扰动的后续;
- 外观干预;
- 瞬移等状态不连续事件。
LeWM v3 报告了三个环境中的这类设计:
- TwoRoom:智能体颜色变化与智能体瞬移;
- PushT:物块颜色变化与智能体、物块同时瞬移;
- OGBench-Cube:立方体颜色变化与立方体瞬移。
PushT 显然不是单因素的“颜色与物理”测试:瞬移分支改变了两个物体及其关系,而颜色分支只改变一个物体的外观。
论文报告,在配对检验阈值低于 0.01 时,三个环境中的瞬移都产生了显著更高的惊讶值;主图中的颜色效应则更弱且不显著。严谨表述是:在作者的协议下,LeWM 的失配信号对这些瞬移干预比对这些颜色干预更敏感。
冻结的公共仓库没有提供足够的 VoE 代码来恢复作者的精确归约方式。课程实现可以定义一个教学标量——预测下一潜在状态与冻结编码器为真实下一观测产生的潜在状态之间的逐坐标均方差——但必须标为教程诊断。
可能骗过我们的把戏
一个“最后一帧”预测器会直接把当前潜在状态复制到未来,并忽略动作。普通的缓慢运动只产生中等误差,瞬移产生较大峰值,很小的颜色变化则产生较小峰值。即使没有学习接触动力学,它也通过了最弱的排序检验。
加入下列对照,主动攻击这种解释:
- 每个分支之后使用相同动作;
- 让图像变化幅度重叠;
- 使用支持范围内的快速运动,以及支持范围匹配的重置;
- 采用位移匹配的单物体和双物体干预;
- 最后一帧、静止潜在状态、动作打乱、仅外观和持续性基线。
检查完整时间曲线。干预之前就出现响应,说明可能存在泄漏或对齐错误。单步峰值随后恢复与持续平台不同,但二者都不能自行诊断原因。新观测可以重新锚定预测;持续误差则可能意味着不受支持的重置或自反馈漂移。
预先注册干预强度、支持范围分箱、失配归约方式、固定时间或峰值统计量、排除规则和回合级统计单位。不要在看过瞬移测试的峰值之后再拟合归一化。
实验凭据
归档最后一段干净历史、动作块、干预帧、干预前后观测、受影响物体、模拟器重置状态、策略、随机种子、检查点、连接位置和聚合规则。虚线表示的预测潜在状态必须与实线表示的编码观测明确区分。除非协议明确用解码图像定义误差,否则它只是另一个独立读出器。
后续的 ACPC v1 向干净历史和视觉扰动历史提供同一动作序列,并测量滚动展开的分歧。它引入 Invariance Radius(IR)和 Separation Rate(SR),给出了把分歧与多步预测误差联系起来的逐样本界;在共享候选池假设下,还把分歧与规划器代价变化联系起来。作者在四项任务上报告了每个条件三个随机种子的趋势,并公开代码 90d4276。筛选器使用观察到的源任务成功标签,并只测试一种模糊/缩放强度;它没有证明使用 ACPC 选择计划能够改善控制。
VoE 支持的是明确协议下的扰动敏感性。它本身不能证明物体恒存、因果物理、类人认知、规划器利用或对未见违规事件的泛化。
快速检查
- VoE 三元组中的哪些部分必须配对?
- 为什么 PushT 的颜色与瞬移比较不是单因素物理测试?
- 哪个简单基线也可能对瞬移表现出“惊讶”?