JEPA4Japan · 教程

第 32 章——各向同性高斯先验何时过强?

1,680字 4分钟阅读 #LeWorldModel#世界模型#JEPA

研究低维几何、邻域扭曲和时间漂移,以及作为 SIGReg 替代方案提出的子空间、时间中心化与尾部匹配方法。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 当前课程
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

全局图景

  1. 缩成一点表示很容易崩塌。
  2. 把它撑开SIGReg 要求投影像高斯分布。
  3. 检查路线圆润的云团仍可能隐藏门的位置。
约束整体分布形状,可以阻止所有状态变得完全相同。但单凭这一点,无法让潜在距离自动等同于物理距离、拓扑关系或可达性。

一个小故事:圆形城市

一位市长发现,所有居民都被挤在同一个广场里。解决办法是建造一座宽敞、圆润,且没有偏爱方向的城市。拥挤消失了——但真实的国家其实是两座由一座桥相连的岛屿。一个完美的圆,并不会自动成为有用的旅行地图。

这正是原始 LeWorldModel v3 中的张力所在。SIGReg 会取一批嵌入的许多一维投影,并将它们与标准各向同性高斯分布比较。恒定不变的表示无法满足这个目标,因此该规则能施加很强的抗崩塌压力。但 高斯 和 各向同性 描述的是整个样本群体的形状;它们并不会标出位置、速度、门口,或一条通过动作真正可行的路线。

三幅示意图分别展示全局形状不匹配、缓慢的任务漂移,以及一个被轻微矫正的尾部样本。

“高斯不匹配”这一个说法,可能掩盖几种截然不同的机制。图中只是教学用的构造,不是对嵌入的实测,也不是因果证明。

技术背包

下面三项检查必须始终分开:

  • 展开程度: 均值、协方差、有效秩和投影尾部,用来询问样本群体是否已经崩塌。
  • 局部有用性: 时间相邻状态、动作分支、门口排序和滚动预测,用来询问邻近结构是否有助于预测与规划。
  • 决策有用性: 闭环成功率用来询问模型、终端代价、CEM 搜索和动作执行能否协同工作。

低内在维度并不自动意味着崩塌。即使 TwoRoom 的像素维度很高,其有效变化也可能主要来自智能体的位置和近期运动。LeWM v3 报告了在其评估设置中较弱的 TwoRoom 规划表现,并提出数据多样性低、内在维度低,以及它们与高维高斯目标之间的张力,可能是原因。这是作者的假设,不是已证明的因果关系。后来的独立 TwoRoom 审计发现协议细节很重要,其后续研究则在特定检查点和协议下发现了终端度量瓶颈。这两项结果都不能普遍地为 SIGReg 脱责,也不能将其定罪。

后续论文测试了不同的修复方案;它们都不属于原始 v3:

后续路线它改变了什么它没有证明什么
Sub-JEPA有限个固定的随机正交子空间未见过的联合几何或拓扑
TC-LeWM对时间居中后的残差施加 SIGReg慢变信息没有用;它的证据来自 LIBERO 行为克隆,而非基线 MPC
QQWorld将排序后的投影样本与高斯分位数匹配;可选的跨批次分离队列全局高斯形状与任务一致,或原始 LeWM 分离了目标
SMWM将逆动作回归用作抗崩塌目标每一个任务变量都能被保留
AC-MTM在批次内对比识别动作它覆盖了重复、空操作、隐变量、随机、离散、混合或不受支持的动作

系数 lambda 决定 SIGReg 相对于预测损失的“音量”。当同一个群体目标看起来有用,只是声音太大或太小时,可以调节它。只有当受控证据指向某种具体不匹配时,才应改变结构:全空间压力、缓慢的任务漂移、尾部矫正,或不合适的边缘分布目标。

尝试推翻这个想法

为同一条环形轨迹构建两张潜在地图。地图 A 保留了每个时间邻居及路线的顺序,但它只位于一张很薄的二维曲面上。地图 B 则在打乱各点后,拥有漂亮的球形高斯总体。

如果地图 B 只在分布检查上获胜,而地图 A 在动作条件滚动预测和规划检查上获胜,那么“更像高斯分布”并不意味着“更有用”。现在固定数据、编码器、预测器、优化器、规划器、随机种子和预算;先扫描 lambda,然后每次只更换一个正则化器。同时测量崩塌程度、局部连续性、门口排序、多步预测与闭环规划。如果最佳结果出现在中间的 lambda,它支持的只是该设置下存在取舍,而非关于内在维度的普遍定律。

实验凭据与证据边界

  • 基线:LeWorldModel v3,修订于 2026-06-03;固定代码 8edfeb3。它的共享编码器是端到端训练的:没有停止梯度的目标、EMA 教师,也没有预训练视觉编码器。
  • 后续方案:Sub-JEPA v1、SMWM v1、TC-LeWM v2、QQWorld v1 和 AC-MTM v1。在证据截止日前,已确认 Sub-JEPA、SMWM 和 AC-MTM 的公开快照;TC-LeWM 和 QQWorld 则没有。
  • 审计:TwoRoom 复现 v1、其目标函数后续研究,以及 tinylab efa9e5d。独立性只对该 TwoRoom 重新实现及协议成立,不延伸到后续正则化器或整套基准。
  • 日期:Sub-JEPA 2026-05-10;SMWM 2026-06-18;QQWorld 2026-07-30;TC-LeWM v2 2026-07-31;复现研究 2026-08-10;目标函数后续研究 2026-08-13;AC-MTM 2026-08-18。证据截止时间:2026-08-20,Asia/Tokyo。除非明确标注,所有后续实验结果均仍是作者自报。

三个快问快答

  1. 为什么一个没有崩塌的高斯云团,仍可能是糟糕的规划地图?
  2. 哪些测量可以区分合理的低内在维度与破坏性崩塌?
  3. 在 lambda 扫描能支持因果解释之前,哪些因素必须保持不变?