JEPA4Japan · 教程

第 6 章——视觉编码器:为每一帧签发“状态护照”

1,218字 3分钟阅读 #LeWorldModel#世界模型#JEPA

跟踪图像经过 patch、Vision Transformer、[CLS] 摘要、投影与归一化的过程,以及最终潜在向量的形状。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 当前课程
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 图像帧224 × 224 像素
  2. 图块256 个视觉片段
  3. [CLS]一个摘要载体
  4. 通行证含 192 个数的潜变量
编码器为每一帧签发紧凑通行证,却不保证通行证究竟记住了什么。

一帧图像变成图块、CLS 摘要和一个投影后的潜在通行证。

一个小故事

摄像头画面太大,无法随身带进数百个想象动作方案。于是 LeWM 为每一帧签发一份小小的“状态通行证”。预测器让这份通行证沿时间移动,比重新绘制整个场景便宜得多。

真实通行证之所以有效,是因为人们已经约定了哪些字段重要。LeWM 没有得到这样的字段清单;训练施加的压力决定什么会被保留下来。它可能保留门口,也可能只保留一种与门口偶然相关、但更容易学习的墙壁颜色。

技术背包

冻结的入口首先采用 ImageNet 统计量进行预处理,并把图像缩放为 224×224。默认 ViT-Tiny 将图像划分为 14×14 大小的图块。因为 224 / 14 = 16,所以共有 16×16 = 256 个图块 token。再加入一个学习得到的 [CLS] token,序列长度就变成 257。

默认骨干网络宽度为 192,包含 12 层 Transformer 和 3 个注意力头。注意力使空间片段能够交换信息。一个图块并不是被单独识别出的物体,[CLS] 也不会神奇地获得语义;只有训练目标才能让它逐渐变得有用。

视觉编码器独立处理每一帧。它先展平 batch 和时间维,用共享权重处理 B×T 张图像,再恢复时间维。时间推理属于后续的动力学预测器。

[B,T,3,224,224]
  -> [B×T,3,224,224]
  -> [B×T,257,192]
  -> take [CLS]: [B×T,192]
  -> projector: [B×T,192]
  -> restore time: [B,T,192]

投影器并不是简单的降维器。冻结代码通过线性层、BatchNorm 和 GELU,把 192 → 2048 → 192。论文所说的“1-layer MLP”与代码里的两个线性映射,可以稳妥地描述为单隐藏层投影 MLP。它的输出就是用于预测和 SIGReg 的潜在状态。

LayerNorm 在单个 token 内部对特征进行归一化。投影器的 BatchNorm 则针对每个特征,使用展平后 batch-time 样本的统计量。SIGReg 是一个独立的群体损失。说“归一化会让表征变成高斯分布”,错误地混淆了三种机制。

原始 v3 设置 pretrained: false:ViT、投影器、动作路径和动力学模型全部从离线轨迹中联合学习。

容易骗过我们的把戏

假设训练数据中,墙壁颜色能够完美预测哪扇门开着。编码器便可以储存颜色,而忽略细小的门缝。在不移动门的情况下重刷墙壁,通行证会变化过多;保持颜色不变而移动门,通行证又变化过少。

可以测试三组受控样本:固定几何结构而改变纹理;匹配纹理而改变几何结构;只交换干扰因素,然后运行冻结的规划器。编码紧凑、方差非零,或重建良好,都不能证明模型保留了正确事实。

机械性的断言仍然重要。不要把时间维变成通道维,不要忘记恢复时间轴,也不要在每帧只应产生一个状态的位置传入图块级输出。形状能揭示错误实现,但形状本身永远不能证明表征良好。

证据凭据

LeWorldModel v3、冻结的 jepa.py、模型配置 和冻结的投影模块,支持这条精确的默认路径。论文还报告了 ResNet-18 消融实验,因此 ViT-Tiny 只是基准选择,并不是 LeWM 的定义。

允许的表述是:[CLS] 加投影器构成了 LeWM 优化的潜在信息载体。不要把它称为完整的世界状态,不要说 BatchNorm 强制实现了 SIGReg 的高斯目标,也不要从紧凑性推断物理规律。

快速检查

  1. 为什么边长 224 像素、图块大小 14 会产生 256 个图块?
  2. 各帧被独立编码后,由哪个组件处理时间关系?
  3. 怎样揭示一个只追随墙壁颜色而忽略门口几何的通行证?