JEPA4Japan · 教程

第 36 章——理论边界:何时能辨识真实状态?

1,541字 4分钟阅读 #LeWorldModel#世界模型#JEPA

用受假设约束的可辨识性结果指导实验,同时明确标出平稳性、加性噪声、线性、可观测性与多模态。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 当前课程

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

全局图景

  1. 在假设之内定理给出一个精确承诺。
  2. 旋转后的答案世界可能只能在正交坐标意义下被恢复。
  3. 海岸之外定理在那里保持沉默,不会神奇地自动为真或为假。
可识别性是一份“如果—那么”契约。一个探针、漂亮的损失或基准分数,都不能抹去其中的“如果”。

一个小故事:两张诚实的地图

两位制图师绘制同一座岛屿。其中一人把纸旋转了 90 度。每一段距离和每一次转移仍然一致,但“向上”已经不再意味着向北。两张地图都可以是正确的。

这就是为什么“在正交变换意义下可识别”是有意义、但有限的结论。学到的坐标通过旋转或反射,与隐藏坐标呈线性关系;单个坐标轴不必获得人类可读的名称。这比任意非线性扭曲更强,却比在第 1 个坐标中恢复“x 位置”更弱。

一座岛屿标出了线性、高斯、平稳、完全可观测、精确约束且维度匹配的总体设置;实际案例则位于它的海岸线之外。

“位于外部”意味着“这些定理没有直接覆盖”,而不是“不可能学会”。

技术背包

When Does LeJEPA Learn a World Model? 中的被动结果,是针对一个明确类别的总体/全局最优声明:可通过指定观测映射观测的状态、平稳的加性噪声动力学、高斯潜在结构、精确高斯表示约束,以及匹配的潜在/表示维度。在它的分离条件下,可以在正交坐标意义下线性恢复状态。它的规划声明还额外要求变换后的动力学保持一致,且代价函数尊重正交歧义。但编码器定理本身并不说明模型学到了动作条件转移。

受控 v2 论文有一份不同、也更强的契约:可逆观测;具有独立高斯噪声的平稳线性受控潜在动力学;状态/动作行为联合高斯;精确高斯表示;匹配维度;表达力足够强的连续预测器;总体优化;以及正的状态条件动作激发。在这些条件下,它能在一个公共正交变换意义下,识别状态和受控条件均值转移。它不会恢复每一个随机未来。

三种常见假设缺口彼此不同:

  • 部分可观测: 两个隐藏状态可能产生同一幅当前图像。只有当隐藏变量留下过痕迹时,历史才能帮上忙。
  • 多模态未来: 平方误差点预测可能落在多个真实模式之间;条件均值不是完整的未来分布。
  • 缺失干预: 总体上同时看到向左和向右并不足够;如果每个动作都只在一种状态中发生,反事实动作分支仍无约束。

有限网络中的 SIGReg 对有限小批次、采样投影和数值节点施加压力,使其接近高斯目标。这不是精确的总体约束。那篇独立的自由能论文假设编码器噪声恒定,且精确各向同性高斯约束已成功实现;它不是可识别性定理,并将经验验证留给了未来工作。

尝试推翻这个想法

构造两个状态。在状态 A 中,行为策略总是选择向右;在状态 B 中,它总是选择向左。整个数据集中两种动作的出现次数完全一样,但每个状态内都没有同时出现两条分支。预测器可以拟合每一条记录转移,却能对 A+Left 或 B+Right 随意编造结果。

再加入第二个数据集:两个状态中都同时包含两种动作,其余观测、状态分布、模型和更新次数全部保持不变。同时加入一个预言机状态条件。如果在预言机观测下,未见动作误差仍然存在,那么在这个构造中,问题在于转移覆盖,而非表示歧义。该测试支持的是条件激发机制;它不会诊断所有 LeWM 失败。

在引用一条定理之前,询问:观测是否具有足够的可逆性?转移/噪声族是否匹配?平稳性、维度、高斯约束和全局最优是否真的可用?在以状态为条件后,所需的每个动作方向是否都在变化?答案未知,意味着“将其作为指导”,而不是“声称已被覆盖”。

实验凭据与证据边界

三个快问快答

  1. 正交歧义会保留什么,又会改变哪些语义名称?
  2. 为什么边缘动作多样性弱于状态条件动作激发?
  3. 当一个基准位于某条定理的假设之外时,正确的结论是什么?