JEPA4Japan · 教程

第 23 章——第二个实验:复现 PushT

1,467字 4分钟阅读 #LeWorldModel#世界模型#JEPA

通过数据准备、模型训练、目标图像规划、指标与失败分类,从几何导航走向接触动力学。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 当前课程
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 查看历史正在接近还是正在分离?
  2. 保持接触在哪里、以什么方式碰到?
  3. 想象滑动、旋转,还是丢失接触?
  4. 规划选择受数据支持的推动方式。
PushT 需要与接触相关的状态,而不仅仅是识别出一个 T。

在不同接触点施加的三次推动,可以让同一个 T 形物块滑动或旋转。

一个小故事

推动钢琴中心附近,它可能平移;推动角落附近,它可能旋转。一张照片可能无法显示搬运者正在接近、保持接触,还是正在分离。

PushT 把这个故事变成一项模拟任务。蓝色智能体可以推、却不能拉一个 T 形物块,使其到达目标姿态。只有位置还不够:朝向、接触侧、接近方向,以及是否能够实施下一次有效推动都很重要。模拟回合成功,只能证明在这个设置和预算下能够控制——并不能证明掌握通用刚体物理,或拥有安全的机器人技能。

真正规则

论文报告 20,000 个专家回合,平均每个回合 196 个环境步,并训练 10 个 epoch。“专家”不代表覆盖了每一种有用接触模式。应从冻结产物建立一份支持范围图谱:接触位置、接近方向、物块位置与角度、动作幅度与方向、接触持续时间与丢失接触,以及回合边界。“稀疏”表示“记录证据很少”,而不是“物理上不可能”。

采用回合互斥的数据划分。记录产物版本和哈希、解压或转换、加载器、图像预处理、动作/状态归一化、history、frame skip 和动作宽度。冻结训练 YAML 指定 pusht_expert_train.lance;官方公开版本 655cd44 包含压缩 HDF5,而 README 和评估路径也描述 HDF5。

应区分四种复现目标:

  1. 检查点能够载入,并产生有限输出;
  2. 检查点能够运行锁定的评估;
  3. 新模型能够完成训练并进入该评估;
  4. 多个训练随机种子能够产生预先定义的统计结果。

论文卡片使用 history 3、10 个 epoch,并在没有另行说明时使用 SIGReg 权重 0.1。冻结代码也使用 history 3,但最多训练 100 个 epoch,权重为 0.09。这里检查的官方检查点版本是 22b330c。

可能骗过我们的把戏

构造两段短历史,它们的最后一帧几乎相同。一段中,推动者刚刚向内接触,并开始造成旋转;另一段中,它正在滑过物块并与之分离。为二者施加相同的下一动作。

如果完整历史产生符合实际的不同预测,说明近期视觉上下文有帮助。如果预测不同却与真实结果不符,则动力学错误。如果滚动展开有用,CEM 却选择了糟糕接触,应检查代价或搜索。故意把两段历史都替换为最后一帧,则是在测试可观测性的缺失。

应分类第一次分歧,而不只是最终图像:没有接触、从错误一侧接触、平移/旋转混淆、丢失接触、虚假进度、利用支持范围漏洞,或代价失败。解码器可以生成貌似合理的画面,却隐藏角度误差;探针可以解码角度,却不能证明预测器或代价会使用角度。

预言机代价加学习动力学测试排序;预言机动力学加学习代价测试滚动展开;两个预言机与同一个有限 CEM 预算结合,则测试搜索和动作参数化。这些是使用特权信息的教程诊断工具,不是可部署的 LeWM 基准。

实验凭据

目标并非任意选择。协议从记录轨迹中选取起点,并把 25 个环境步之后的状态作为目标,同时给出 50 步动作预算。规划使用五个模型动作块,每个块包含五个环境动作,并在重规划前执行五个块。CEM 使用 300 个候选、30 个精英、30 轮优化和初始方差 1。因此一份计划横跨 25 个环境步——冻结执行间隔也同样长。

LeWM v3 在相同的 50 条轨迹上报告了三个训练随机种子:

方法作者报告的 PushT 成功率
LeWM96.0 ± 2.83
DINO-WM92.0 ± 1.63
PLDM78.0 ± 5.0

在该协议下,它们分别相差 4 和 18 个百分点,而不是普遍的百分比改进。图注把随附数值称为“variance”;只有 ± 记号本身,不足以把它改称 SD、SE 或 CI。成功率还应与位置和朝向误差、重叠度或任务指标、最近接近与反转、动作/重规划次数、带硬件信息的耗时记录及首次失败共同报告。

DINO-WM 使用预训练 DINOv2 编码器;原始 LeWM 则在任务轨迹上端到端训练视觉编码器。应始终明确显示预训练与模态来源。

快速检查

  1. 为什么两张相似的 PushT 图像可能需要不同的下一步预测?
  2. 支持范围图谱中的稀疏单元格意味着什么?
  3. 为什么 96.0 ± 2.83 必须始终与确切协议绑定?