JEPA4Japan · 教程

第 11 章——SIGReg 的直觉:让表示空间“呼吸”

1,207字 3分钟阅读 #LeWorldModel#世界模型#JEPA

借助各向同性高斯目标、随机投影和 Epps–Pulley 统计量,理解无需负样本或教师网络的防崩塌机制。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 当前课程
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 潜在状态人群同一时刻,多个样本
  2. 投下影子随机一维方向
  3. 提取指纹余弦 + 正弦探针
  4. 比较标准高斯
SIGReg 检查的是一个群体的形状,并不会读取任何一个点的物理含义。

通过许多随机的一维投影,检查高维潜在点云。

一个小故事

“不要让所有人住在同一个地址”这条要求太模糊。一座城市可以避开单点,却把所有居民挤在同一条路上;也可以沿某个方向无限拉长,或排成简单统计量看似健康的 X 形。

SIGReg——Sketched Isotropic Gaussian Regularization(草图式等方高斯正则化)——为这群人提供了一个参考形状。它要求嵌入群体在许多一维方向上的投影,类似等方标准高斯的投影。

技术背包

对于每个相对时间位置,冻结的 LeWM 会把 B 个嵌入视为一个群体,不会把时间混入其中。一个随机单位向量会把每个 D=192 维嵌入投影为一个有符号标量。对许多方向重复这个过程,再将每个一维样本与解析形式的高斯“指纹”比较。

这里的每个高斯术语都很重要:

  • 标准(standard): 每个单位方向上的投影都以零为中心,尺度为一;
  • 等方(isotropic): 参考分布没有偏好的方向;
  • 高斯(Gaussian): 它不是均匀球体。密度在原点达到峰值,而高维径向概率质量大致集中在半径 sqrt(D) 附近。

Epps–Pulley 构造使用经验特征函数。在有限的频率探针上,它会对余弦和正弦响应取平均,再与已知的标准高斯响应比较。LeWM 最小化的是一个平滑差异;它不会计算 p-value,也不会宣布某个 batch“通过了正态性检验”。

[T,B,D]
  -> for each time: B-point cloud
  -> random 1D projections
  -> cosine/sine responses at finite knots
  -> gap to analytic N(0,1) fingerprint
  -> average across directions and time

冻结代码每次调用采样 1,024 个方向,并使用从 0 到 3 的 17 个节点及高斯加权窗口。方向会被重新采样,因此训练数值具有随机性。该类被标记为仅支持单 GPU,也不会跨设备汇聚全局群体。论文附录以不同方式展示了示意性积分;应当区分论文描述与可执行代码事实。

Cramér–Wold 原理指出,如果所有一维投影都匹配,就可以确定多元分布。冻结训练只有有限 batch、有限方向和有限节点。这是一种近似,并不是高斯性的合格证。

容易骗过我们的把戏

只检查 X 形点云的水平轴和垂直轴,两个方向上的投影都可能看起来无害,而对角线投影却会暴露依赖关系。随机视角能减少永久盲区,但有限的 1,024 个视角仍可能漏掉狭窄缺陷。

再来看一段真实走廊轨迹。狭窄点云也许反映了世界真正具有低维结构,而不是编码器发生故障。强迫它匹配 192 维等方目标,可能造成冲突。LeWM 论文提出,这种失配可能是 TwoRoom 问题的原因之一;这是作者假设,并不是已经确定的原因。

增加投影并不会创造更多观测。从一千个角度观察一小群人,并不会让它变成一大群人。batch 大小和投影数量处理的是不同类型的不确定性。

证据凭据

这一机制来自 LeWorldModel v3、冻结的 SIGReg、LeJEPA v3、Epps–Pulley 论文 和 Cramér–Wold。

SIGReg 需要 batch 中的多个样本,却不需要有标签的负样本,也不需要学习得到的教师,因为其参考分布是解析的。在理想目标下,匹配该参考分布会排除完全相同的常量表征。它不能证明物理规律、动作敏感性、可达性或有限运行中的成功。

快速检查

  1. 为什么非零方差和单位协方差仍是不完整的检查?
  2. 为什么有限随机投影不能把 Cramér–Wold 变成证明?
  3. SIGReg 用什么取代了负样本对或 EMA 教师?