JEPA4Japan · 教程

第 5 章——轨迹数据:对模型而言,世界不是图像集合

1,232字 3分钟阅读 #LeWorldModel#世界模型#JEPA

把观测与动作表示成离线、无奖励的回合,并把数据覆盖范围视为可靠想象的边界。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 当前课程
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 看见此刻的观测
  2. 执行对齐的动作块
  3. 再看一次观察到的后果
动力学证据,是同一幕回合内按顺序发生的“看见 → 执行 → 再看见”转移。

同一组图片只有在顺序和动作保持关联时,才能教授动力学。

一个小故事

用同一次 TwoRoom 旅程制作两本相册。第一本保留每一帧的顺序,并在帧之间写下控制动作。第二本把相同图片随机打乱,还丢掉了控制记录。两本相册都能展示房间长什么样,但只有第一本能说明执行某个动作之后发生了什么。

回合边界同样重要。把一次运行的最后一帧与下一次运行的第一帧拼起来,会教给模型一次虚假的瞬移。世界模型需要的是转移,而不只是一份视觉清单。

真正规则

LeWM 的世界模型训练是离线且无奖励的。它回放记录下来的回合,基础目标中不使用任务奖励或目标。这并不意味着部署时不需要动作和目标,也不意味着模型可以无限外推。

冻结的数据配置设定 frameskip=5。一个模型转移会把连续五个底层环境动作合并为一个稠密动作块;它不是只保留最后一个动作,也不是把同一个动作重复五次。train.py 会对包括 action 在内的非像素列进行 z-score 标准化,而动作编码器宽度则由程序设为:

frameskip × environment action dimension

冻结默认值为 history_size=3 和 num_preds=1,因此一个采样窗口包含四个观测位置。前三个潜在状态构成因果上下文,向后平移一位的序列则提供三个单步目标:

z0 -> z1
z1 -> z2
z2 -> z3

num_preds=1 表示偏移量,而不是“只使用最后一对”。v3 论文报告 TwoRoom 的 history 为一,PushT/OGBench-Cube 为三;冻结的全局配置则使用三。请记录一次运行究竟遵循哪个来源。

数据覆盖不只是一张 x-y 热力图。一次转移取决于看见的内容、近期运动或接触,以及提出的动作。即使缓慢访问过每一个位置,也没有覆盖高速穿门的运动。即使看到 PushT 物体静止在某个角度,也没有覆盖碰撞期间外观相同的图像。在这些联合支持范围之外,哪怕预测十分流畅,仍然缺乏数据支持。

容易骗过我们的把戏

采集者 A 记录了数百万张漂亮图像,却始终绕着一个房间转圈。采集者 B 的帧数更少,但它接近过两扇门,发生过碰撞和停顿,从两个方向穿过门口,并且改变过速度。A 拥有更多图像;B 却可能包含好得多的跨房间动力学证据。

现在把 B 的动作日志错移一个时间索引。它的访问热力图仍然看起来非常优秀,但每个后果都与错误的控制动作配对。或者让训练窗口跨过一次重置:模型将学会瞬移。单靠形状检查可能发现不了这两种错误。

训练之前,应当回放完整回合,检查时间戳和动作块,统计完整的穿门次数,按区域和运动状态查看条件动作直方图,并列出缺失的组合。

证据凭据

LeWorldModel v3、冻结的 train.py 和冻结的 TwoRoom 数据配置,支持这里所述的轨迹接口与配置事实。论文报告了 10,000 个 TwoRoom 回合,平均每个回合 92 个环境步,数据由带噪声的穿门启发式策略收集。这是数据集描述,不是通用最低要求,也不能证明覆盖完整。

独立的 TwoRoom 复现 指出,稠密动作采集、运行时动作宽度、ImageNet 像素标准化和动作 z-score,是复现成败的关键约定,而这些约定并非都能只从 YAML 看出来。这仍然只是一个单随机种子的环境。

快速检查

  1. 为什么打乱相同帧的顺序后,无法再学习动作条件动力学?
  2. 当窗口跨过回合重置时,会出现什么虚假事件?
  3. 为什么完整的 x-y 访问仍不能证明转移覆盖充分?