课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
全局图景
- 一个问题点名一种失败,并给出一个预测。
- 一个小实验在沙盒中只改变一个机制。
- 一种输法在看到分数前先写下证伪条件。
一个小故事:十二条船
港口里停着十二条船。有的测试规划几何,有的测试不确定性,有的测试表示结构,还有的测试搜索或迁移。没有一条船是“冠军”。每条船都携带一张简短的启航卡:问题、唯一改动的部分、测量项,以及一个会让它返港的条件。

这些是实验计划,不是新的实验结果。泊位相同并不表示它们的难度、前景或证据相同。
技术背包:十二张启航卡
所有卡片都从一个冻结的 LeWM 基线出发,使用回合不重叠的数据、明确声明的随机种子、匹配的训练与规划预算、原始日志,并同时报告正/零/负结果。只要仿真器状态、最短路径、奖励、深度或语言注释被用于训练或评估组件,就要将它们标记为特权信息。
| # | 项目 | 改动与测量 | 会削弱该想法的结果 |
|---|---|---|---|
| 1 | 潜在距离与真实最短路径 | 在 TwoRoom 中计算潜在点对距离与预言机测地距离的相关性;按同室/隔墙和近/远点对分层 | 在留出布局上相关性消失,或更好的相关性并未改善候选排序 |
| 2 | 有向可达性 | 从轨迹偏移和构造的负样本中学习一个预算条件有序分数;测试留出方向和视界 | 分数是对称的、跟随数据集频率,或无法匹配预言机预算排序 |
| 3 | 预测不确定性校准 | 预测分布宽度或误差分箱,并将信心度与之后的自我馈入滚动误差比较 | 信心度很尖锐却未校准,或它只在跟踪视界长度 |
| 4 | 集成认知不确定性 | 训练随机种子匹配或 bootstrap 的多个模型;比较支持内外的分歧 | 成员在不受支持的错误捷径上保持一致,或分歧只反映优化噪声 |
| 5 | 多步训练 | 在保持推理方式和预算不变的前提下,增加一个明确声明的滚动一致性或多视界损失 | 单步损失改善,但长滚动/规划变差,或增益来自额外更新 |
| 6 | 时间层次潜在变量 | 学习粗粒度状态或动作块,并审计重建、复用、支持和两层代价 | 高层误差、不受支持的子目标,或额外开销超过节省的低层计算 |
| 7 | 局部高斯结构、全局拓扑 | 对局部邻域或子空间正则化,同时分别测量全局展开程度和门口连续性 | 抗崩塌能力变弱,或去掉额外容量后拓扑收益消失 |
| 8 | 动作可控子空间 | 将动作敏感变化与内容分开;测试干预、干扰变化和弱控制变量 | “控制”空间编码背景/任务 ID,或丢失缓慢但任务关键的状态 |
| 9 | 反事实动力学探针 | 在匹配状态下,将对已记录动作和留出动作的预测与仿真器转移比较 | 分支分离存在但后果不正确,或只有已记录动作是准确的 |
| 10 | 受支持约束的 CEM | 惩罚支持距离,或在经验动作/宏动作锚点附近搜索;报告约束强度 | 严格门控阻止了有效的新绕行,而宽松门控仍然放进模型漏洞 |
| 11 | 从目标图像到语言目标 | 增加一个明确声明的语言到目标接口;留出物体—关系组合,并与预言机目标编码比较 | 成功依赖记忆语句或成对目标泄漏,而非组合能力 |
| 12 | 跨环境潜在对齐 | 使用成对锚点对齐环境,然后测试留出动力学、视角和任务 | 对齐改善了探针,却损害任一世界中的转移预测或规划 |
项目 1–2 区分距离与有向、有预算的可行性。项目 3–4 区分预测宽度、集成分歧、支持距离和实际误差。项目 5–6 区分更长训练目标与层次结构。项目 7–9 询问动作真正需要什么表示结构。项目 10–12 将压力转移到搜索、目标和迁移。在每张卡片分别赢得自己的测试之前就把它们组合起来,会摧毁诊断性。
尝试推翻这个想法
受支持约束的 CEM 是一种很好的自我攻击。在一个 TwoRoom 布局中,不受约束的优化器采取了不可能的捷径。适度的支持规则引导它穿过门口。然后,再引入一条训练轨迹中没有出现过、但真实可行的新绕行。过于严格的规则会挡住唯一能够成功的路径。
扫描支持惩罚,并展示两类失败。预言机可行路线标签只能用于评估。如果最佳阈值随目标类型而变,就报告这种交互;不要把它隐藏在一个平均值里。即使不存在普适阈值,该项目在科学上仍然成功,因为它已经绘制出模型漏洞与搜索过度保守之间的取舍。
每张卡都需要一项移除测试:对几何问题拆除墙面;对可控性问题拉平动作覆盖;对不确定性问题注入受控的超支持样本;对定基问题打乱特权标签;对对齐问题移除成对锚点;对组合问题留出语言组合。一个只能在简单条件下站住的结果,还配不上宽泛的声明。
实验凭据与证据边界
- 这些卡片是教程生成的假设,而不是已报告的改进。直接灵感来源包括 LeWorldModel v3、RC-aux、TRM、Sub-JEPA、SMWM、VLWM、Temporal-Distance JEPA、Fast-LeWM、Hi-LeWM 和 PSG-JEPA。
- 后续诊断与决策路线包括 TwoRoom 复现、VIScore、ACPC、Objective Bottleneck、Traj-LeWM、SCALE、AC-MTM 和 DA-LeWM。除明确限定的 TwoRoom 重新实现外,它们的评估均为作者自报。
- 已找到 LeWM、RC-aux、Temporal-Distance JEPA、Sub-JEPA、Fast-LeWM、Hi-LeWM、stable-worldmodel、passive-identifiability、SMWM、PSG-JEPA、tinylab、VIScore、ACPC、Traj-LeWM 和 AC-MTM 的公开固定实现。截止时未找到 TRM、VLWM、SCALE、DA-LeWM、PhyLatent、TC-LeWM、QQWorld、ProWorld、controlled-identifiability 或 2024 年“HWM”课程简称路线的实现。公开代码不等于独立复现。
- 来源版本时间从 2024-06-01 到 2026-08-19 的 DA-LeWM v1;证据截止时间为 2026-08-20,Asia/Tokyo。允许的动词是“测试”、“假设”、“证伪条件”和“在该锁定设置下受到支持”——而不是“将会改善”、“解决不确定性”、在特权标签训练模型时仍声称“仅像素”,或“证明了组合理解”。
三个快问快答
- 哪五个字段能把一个研究想法变成可执行的启航卡?
- 为什么集成分歧和实际滚动误差是两种不同的仪器?
- 支持约束如何可能同时帮助和伤害同一个规划器?