JEPA4Japan · 教程

第 37 章——设计一项可信的 LeWM 改进实验

1,425字 4分钟阅读 #LeWorldModel#世界模型#JEPA

用反例、匹配的容量和计算量、消融、预言机条件,以及对负结果的诚实报告,隔离一种失败机制。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 当前课程
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

全局图景

  1. 只指出一个故障写下预测的失败模式。
  2. 只改一个部件锁定数据、预算和评估。
  3. 保留所有结果正结果、零结果和负结果都算数。
当一项干预真正检验了某个机制,而且存在可以让该解释落败的证伪条件时,这项改进才值得信任。

一个小故事:什么都换了的机修师

一辆车总往左偏。机修师同时更换了轮胎、转向系统、发动机、道路地图和司机,随后车子果然走直了。其中某些改动起了作用——但这次修理几乎没有教会我们任何东西。

世界模型系统也有同样可分离的部件:数据与预处理、表示、动作条件动力学、规划代价、CEM 搜索,以及执行/评估。如果它们全部一起改变,更高的成功数字就无法告诉我们究竟是哪个想法奏效了。

一个 LeWM 控制系统将表示、动力学、搜索和执行全部锁定,只改变代价模块。

一次锁定的比较可以将声明定位到局部。它不能证明同一种修复方法在每个环境中都有效。

技术背包

在运行实验前先写下声明:

  1. 失败机制: 例如,终端欧氏代价把隔墙终点过分优先地排在前面。
  2. 预测交互: 感知可达性的代价,对隔墙目标的帮助应该大于对匹配开阔房间目标的帮助。
  3. 证伪条件: 拆除墙后收益仍然同样大;改用预言机动力学后收益消失;或收益只来自额外的 CEM 预算。
  4. 锁定契约: 数据集/哈希、预处理、编码器、预测器、检查点规则、随机种子、起点/目标、动作预算、CEM 种群/精英/细化次数、执行前缀、回合数和指标。

使用一架消融梯:基线 → 添加所提组件 → 移除该组件 → 打乱或随机化其信号 → 扫描其强度。尽可能同时匹配参数量和计算量。训练预算和规划预算是两种不同的货币;额外训练轮数不能悄悄支付更少的候选计划,额外 CEM 候选项也不能被称为表示增益。

预言机替换可以定位瓶颈:

动力学代价该单元在询问什么
学习学习完整系统能否工作?
预言机学习消除滚动误差后,失败是否仍然存在?
学习预言机更好的排序能否拯救同一个模型?
预言机预言机在已知仿真器信息时,搜索/执行本身是否成为限制?

预言机状态、最短路径或动力学,都是仅限仿真器的诊断工具。预言机增益表明存在提升空间,不表示所学替代物一定可以达到这一水平。

尝试推翻这个想法

使用匹配的 TwoRoom 布局:其中一个有分隔墙和门口;另一个则拆除这面墙。重复使用相同的起点、目标、候选库、模型检查点和预算。拓扑代价假设预测,改进在有墙情况下应当更大。如果这个“修复”在开放空间里获得同样的收益,它可能只是重新缩放了分数,或改变了优化过程。

报告跨随机种子和目标类型的分布,不要只报告一次最佳运行。保存代表性轨迹,并将失败分类:编码器混叠、预测对动作不敏感、自我馈入滚动漂移、错误的代价排序、CEM 未命中,或执行不匹配。零结果意味着“在这些条件下没有获得受支持的收益”,而不是“这个想法永远不可能成功”。当负结果符合预测的失败边界时,它可能是最有力的线索。

实验凭据与证据边界

  • 为诊断提供动机的来源:LeWorldModel v3、RC-aux v1、TwoRoom 复现 v1、VIScore v2、ACPC v1、Objective Bottleneck v1、DA-LeWM v1 和 stable-worldmodel v1。
  • 固定的公开快照:LeWM 8edfeb3,RC-aux ecb4496,tinylab efa9e5d,VIScore bbb60fc,ACPC 90d4276,stable-worldmodel addbab4,发布版 0.1.1。未找到 DA-LeWM 代码。
  • 引用的诊断版本日期从 2026-08-10 到 2026-08-19;截止时间为 2026-08-20,Asia/Tokyo。除明确声明的 TwoRoom 重新实现外,来源评估均为作者自报。在真正有人执行之前,本文提出的实验仍是教程构造。
  • 允许的结论是“在该设计内隔离”、“在锁定条件下支持该机制”,或“在此处未能改善”。应避免“证明了原因”、“学到了通用可达性”、“平台保证公平”,或“TwoRoom 确立了机器人泛化”。

三个快问快答

  1. 为什么同时改变表示、预测器和规划器,在科学上很薄弱?
  2. 四个预言机单元分别隔离了哪些不同瓶颈?
  3. 在拆墙测试中,什么结果会削弱拓扑解释?