JEPA4Japan · 教程

第 12 章——只保留最少却足够的数学

1,270字 4分钟阅读 #LeWorldModel#世界模型#JEPA

只推导阅读完整目标所需的预测与 SIGReg 机制,包括损失权衡系数的准确作用。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 当前课程
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 动力学仪表下一潜在状态一致吗?
  2. 群体仪表点云崩塌了吗?
  3. lambda平衡两股压力
两只仪表检查同一个共享模型的不同性质,但都不知道门口在哪里。

预测损失与 SIGReg 分别提交报告,共同进入一个训练目标。

一个小故事

一位工坊检查员负责检查:以动作为条件的猜测,是否匹配现实中下一步的潜在状态。另一位检查员则检查:观测嵌入构成的人群,是否已经收缩成一种简单的退化形状。

只听第一位的话,每个观测都可能变成同一个常量答案。只听第二位的话,点云可以分布得十分漂亮,却忘记哪个动作能到达门口。两位检查员评判的不是同一件事。

技术背包

预测项是针对保持连接的下一观测嵌入计算的逐坐标均方误差:

z = shared_encoder(observation_window)
z_hat = action_conditioned_predictor(z_context, recorded_actions)
L_pred = mean((z_hat - z_next_connected)^2)

因为目标由共享且可训练的编码器产生,并且没有被 detach,L_pred 可以更新预测器、动作路径、上下文表征和目标表征。

SIGReg 作用于每个相对时间位置上的观测嵌入。随机单位方向产生一维投影;有限的余弦/正弦指纹再与解析形式的标准高斯指纹比较。它直接更新视觉编码器和编码器投影器,而不是动作编码器或动力学预测器。

完整目标为:

L_total = L_pred + lambda * L_SIGReg

lambda 是控制群体分布压力的音量旋钮。它不会改变 SIGReg 测量的内容,不会选择潜在宽度、设定投影数量、调整优化器,也不会控制规划时域。音量太小,会让平凡捷径继续可用;音量太大,则可能偏爱全局高斯形状,而牺牲转移之间的关系。

版本标签也是数学定义的一部分:

来源数值稳妥解读
LeWM v3 方法0.1论文中声明的默认值
冻结 YAML0.09已提交代码中的可执行设置
PushT 附录 G 扫描在 0.09 附近达峰;测试的 0.01–0.2 范围内 >80%;在 0.5 急跌作者在该设置下报告的结果

论文把投影数量和正则化权重称为两个新增设置,并在报告投影消融之后,将 lambda 称作唯一真正有效的待调参数。这并不意味着模型、优化器、数据和规划器总共只有一个超参数。

冻结的 SIGReg 使用 1,024 个投影和从 0 到 3 的 17 个节点。batch 大小控制每个经验投影中的样本数,投影数量则控制有多少个方向检查同一批样本。二者不能相互替代。

容易骗过我们的把戏

训练三组其余条件匹配的模型:不使用 SIGReg;使用明确标注来源的论文或代码权重;使用一个故意大到压倒一切的权重。分别记录原始 L_pred 和 L_SIGReg,而不只是它们的加权和;同时记录方差、有效秩、最近邻、动作交换、单步误差和随时域变化的自回归误差。

预期机制都是有条件的。移除 SIGReg 会让常量一致性与目标函数兼容,但一次运行未必真的崩塌。过强的 SIGReg 可能损害动力学,但不存在由此推出的通用阈值。点云分布广泛、预测却听不见动作,不是全局崩塌,而是动力学较弱。训练仪表良好但规划糟糕,说明问题可能出在后续链路,例如滚动展开、代价或搜索。

证据凭据

LeWorldModel v3、冻结的 train.py、冻结的 SIGReg 和冻结的 lewm.yaml,支持这个双项目标及各来源特有的数值。LeJEPA v3 提供了带明确假设边界的高斯动机,而不是通用物理状态保证。

允许的表述是:理想的高斯匹配会排除完全相同的常量表征,而预测则提供时间和动作关系。较低总损失既不能证明物理规律,也不能证明规划能力。

快速检查

  1. 每只仪表分别抵抗或约束哪一种捷径?
  2. 为什么增大 lambda 可能改善群体形状,却损害动力学?
  3. 为什么 0.1 和 0.09 都是正确事实,却不能互换?