JEPA4Japan · 教程

第 22 章——第一个实验:TwoRoom 冒烟测试

1,440字 4分钟阅读 #LeWorldModel#世界模型#JEPA

训练一个小模型,测试崩塌以及单步与多步预测,运行 CEM,并可视化跨房间规划失败。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 当前课程
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 数据回合和动作真实吗?
  2. 状态有用差异保留下来了吗?
  3. 未来固定动作滚动展开会留在正轨吗?
  4. 规划代价、搜索和执行能利用它吗?
TwoRoom 是整条管线的烟雾报警器,而不是通用智能合格证。

七道关卡从数据一路通往闭环执行,每次失败都要停下。

一个小故事

测试烟雾报警器时,使用一小股烟雾即可,不必点燃整座房子。TwoRoom 就是这股小烟。

它包含两个连续空间房间、一堵隔墙、一个门口、一个移动智能体,以及墙另一侧的目标。论文报告了 10,000 个回合,平均每个回合 92 个环境步。带噪声的启发式策略先朝门口移动,再朝目标移动。因此数据形成的是一条支持范围走廊,并不是对每个位置和动作的均匀调查。

通过这项测试,说明组装后的“数据到规划”路径能在一个透明环境下工作;却不能证明接触物理、真实机器人安全性、广泛泛化能力或论文的精确复现。

真正规则

调参之前,先冻结产物和回合划分。验证时间顺序、动作/图像对齐、穿门过程、支持范围、frame skip,并确保没有窗口跨越回合边界。

然后按顺序通过七道关卡:

  1. 数据: 有效回合、动作、取值范围和支持范围。
  2. 表征: 分布宽度、协方差谱、重复项、最近邻和动作敏感性。
  3. 单步: 留出数据中的记录转移,以及动作交换。
  4. 自反馈: 固定记录动作,并按时域检查滚动误差。
  5. 代价: 候选终点能够区分,墙壁拓扑不会被错误排序。
  6. 搜索: CEM 提议和精英确实发生变化。
  7. 闭环: 反归一化动作能够到达环境;新观测会触发重规划。

在第一个失败关卡停下,并保留检查点和回合。“第一个可观察到的断点”比“唯一真正原因”更稳妥,因为更深层的故障可能同时存在。

论文卡片写着训练 10 个 epoch、TwoRoom history 为 1,以及非 PushT CEM 优化 10 轮。冻结代码卡片则写着最多 100 个 epoch、全局 history 为 3 且 TwoRoom 没有覆盖,以及共享 CEM 优化 30 轮。接受检查的官方检查点也记录 history 为 3。可以进行小规模运行,但必须标为 TEACHING SMOKE TEST,并披露参数、更新次数或 epoch、batch/history、精度、设备、耗时和数据暴露量。

可能骗过我们的把戏

假设平均单步误差很低,只是因为大多数转移都发生在开阔地面。把起点和目标放在墙壁两侧,彼此靠近。终端潜在距离也许会偏爱一条被环境阻挡的直线路径。

进行下列受控替换:

  • 预言机最短路径代价 + 学习动力学;
  • 预言机动力学 + 学习代价;
  • 强制经过门口的航点;
  • 在不引入新搜索随机性的情况下,重放选定动作。

一次撞墙本身无法诊断动力学。若预言机代价能够修复,问题更可能在几何或排序;若预言机动力学能够修复,问题更可能在滚动展开;航点只说明人为提供的拓扑会有帮助。动作缩放、稀疏门口数据和有限搜索仍然可能是原因。

对 SIGReg 也要保持同样谨慎。LeWM v3 报告 TwoRoom 规划弱于命名的基线,并提出一种可能解释:低多样性、低内在维度数据与高维等方高斯目标之间存在张力。这是与结果相符的假设,而不是独立验证的因果发现。

实验凭据

接受检查的官方数据版本为 6903a2d。冻结评估卡片使用 50 个回合、同一轨迹上向前 25 个环境步的目标、50 步动作预算、每个时域和执行间隔各五个模型动作块,以及每个块中的五个原始动作。共享求解器卡片使用 300 个候选、30 个精英、初始方差 1 和 30 轮优化。当 (H=K=5) 时,要等完整的 25 步计划片段执行完才获得反馈。

独立的 TwoRoom 复现 报告,在相同回合上,其检查点成功率为 94%,发布检查点为 84%,每项配置只有一个训练随机种子。它还报告,在三个检查点之间,单步误差无法排序长时域成功率。其对 100/150 的讨论指旧版 LeWM v1/v2;v3 现在采用仓库的 25/50 目标/预算卡片。

请记录数据版本、划分、检查点、论文/代码/运行卡片、七关轨迹、所有随机种子和确切动作单位。全局潜在点云健康,或有一条路线成功,仍不能证明所有区域都有有用拓扑。

快速检查

  1. 为什么穿门启发式会限制数据的支持范围?
  2. 为什么固定动作滚动展开必须先于规划器选择动作的滚动展开?
  3. 撞墙能够诊断什么,又不能诊断什么?