JEPA4Japan · 教程

第 29 章——怎样严谨讨论“理解世界”

1,358字 3分钟阅读 #LeWorldModel#世界模型#JEPA

用可预测性、可解码性、可控性、泛化、反事实一致性、因果性和规划效用测试,代替宽泛主张。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 当前课程

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 说清能力预测?解码?控制?
  2. 说清测试指标、基线、干预。
  3. 说清条件数据、支持范围、预算、随机种子。
  4. 说清边界仍然无法推出什么?
用一个可证伪的动词,替换一个负担过重的名词。

七位证人提供不同证据,无法共同代言一个笼统的“理解”主张。

一个小故事

七位证人都说:“模型理解了世界。”一位看见较低预测误差,一位解码出位置,一位改变了动作,一位测试了新组合,一位看到瞬移峰值,一位执行了因果干预,另一位看到规划器成功。

他们报告的可能都是真实观测,但并不是同一种能力。

真正规则

使用七个彼此独立的坐标:

  1. 可预测性: 在明确动作、时域和支持范围下,预测留出数据中的潜在后果。
  2. 可解码性: 指定读出器可以从冻结表征恢复标签。
  3. 可控性: 在预算约束下,动作能够引导预测和执行结果。
  4. 组合泛化: 熟悉的组成部分能在未见组合中工作。
  5. 反事实一致性: 配对变化产生正确的敏感性和不变性。
  6. 因果识别: 在显式干预假设下恢复变量和关系。
  7. 规划效用: 在固定任务与搜索契约下,学习模型和代价能够改善动作选择。

它们是坐标,不是阶梯。一个坐标不会自动授予另一个;多项正向测试也不会通过投票变成证明。

随机留出的回合不一定具有组合性。真正的组合划分,会留出起点—目标、物体—动作、布局或阶段组合,同时让各个组成部分在其他位置出现。同一轨迹向前 25 步的目标是有用控制任务,却不是任意目标组合。

因果性需要明确命名的变量、有效干预、混杂因素假设、可识别不变量、支持范围控制和替代结构。一个可解码方向加一次改变行为的消融,仍可能存在纠缠或分布外问题。

可能骗过我们的把戏

设想一个查表式导航器,存储许多熟悉的轨迹片段。面对同一轨迹的未来目标时,它经常成功。由于背景和时间都与地点相关,探针能解码位置;最后一帧预测器则会对瞬移产生峰值。

规划效用、可解码性和 VoE 敏感性全都呈阳性。现在随机改变策略速度、替换背景,并要求系统在新布局中使用熟悉动作。它失败了。

这个故事不是在描述 LeWM,而是在证明一个逻辑点:多项诊断可能共享同一捷径。如果不同测试具有不同的失败模式,并且每项测试都能缩小一种特定替代解释,三角验证才最有力。

审计这些常见措辞:

  • “位置在表征里面” → “位置可以由这个读出器恢复”;
  • “解码器展示了想象未来” → “辅助解码器根据预测潜在状态重建一个视图”;
  • “t-SNE 展示了学习到的地图” → “这个样本投影提示了一种邻域模式”;
  • “规划器理解控制” → “规划器在该协议下取得了预算约束内的结果”;
  • “模型知道瞬移不可能” → “在该扰动下,失配有所增加”。

实验凭据

用五个字段重建每一项主张:

  1. 能力;
  2. 测试、指标、基线和干预;
  3. 模型/论文版本、数据、环境、支持范围、时域、预算和随机种子;
  4. 结果与证据级别——主要方法事实、作者报告结果、独立复现或教程观测;
  5. 替代解释和明确不能推出的结论。

使用措辞阶梯。探针测试后说可恢复;在明确的数据偏移后说在接受测试的划分上能够泛化;经过匹配对照的干预后说在该干预下与行为有关。只有在实验设计和假设确实支持时,才使用必要、充分、因果和理解。

LeWorldModel v3 提供了作者报告的证据,涉及动作条件潜在预测、TwoRoom/Reacher/PushT/OGBench-Cube 中的预算约束规划、选定变量探针、定性潜在视图、PushT 直线化和对接受测试的瞬移干预的敏感性。冻结提交 8edfeb3 并不包含每项分析的完整脚本。所有这些结果合在一起,仍不能确立完整状态、广泛组合能力、校准后的未来、因果物理、现实世界可靠性或类人理解。

快速检查

  1. 为什么七种能力是坐标,而不是阶段?
  2. 什么能使一项数据划分真正具有组合性?
  3. 五字段科学主张为何优于仅把“证明”替换成“提示”?