JEPA4Japan · 教程

第 16 章——潜在欧氏距离:方便,但未必可靠

1,124字 3分钟阅读 #LeWorldModel#世界模型#JEPA

测试视觉相似性和欧氏距离何时无法表示有向可达性、障碍物、路线长度或可信规划代价。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 当前课程
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 编码形成两个潜在点。
  2. 测量间距越小看起来越好。
  3. 检查短直线可能被墙挡住。
  4. 测试排序会偏爱真实可行的路线吗?
潜在距离是一把直尺,不会自动变成路线图。

一把短直尺穿过墙壁,而可行路线要绕过门口。

一个小故事

两个孩子隔着一堵墙,站得非常近。直尺说:“距离好短!”双脚却说:“先去找门。”

原始 LeWorldModel v3 使用一把同样简单的规划直尺。它比较最终想象潜在状态 (z_H) 与单独编码的目标潜在状态 (z_g):

[ J = \lVert zH-z_g\rVert_2^2 = \sum_i (z{H,i}-z_{g,i})^2 . ]

这把直尺速度快,不需要奖励标签,还能为每个候选计划给出一个分数。这些都是优秀的基准性质,却不能让该分数自动变成最短路径长度、行程时间、成功概率、安全性或任务进度。

真正规则

  • 目标由终端代价使用;它并不是偷偷输入动力学预测器的未来观测。
  • 对非负欧氏间距取平方,在固定表征内不会改变排序;但忠于来源的 LeWM 准则是求和后的平方间距。
  • 欧氏距离具有对称性:(d(A,B)=d(B,A))。可达性却可能有方向,或取决于动作预算。
  • 原始代价尺度取决于潜在维度和坐标尺度。跨模型比较未经处理的数值前,应先在一个明确命名的检查点内部比较排序。
  • SIGReg 可以让群体大致呈高斯分布,却不能让相邻潜在点自动通过有效动作相连。

规划器真正需要的是一种排序:当候选 A 是更好的决策时,它的代价应低于候选 B。在简单样本对上得到较高的平均相关性,仍可能掩盖墙壁或接触边界附近少量却决定性的反序。

可能骗过我们的把戏

构造四组直线距离相同的起点—目标对:

  1. 两点都在同一个开放房间;
  2. 两点隔着墙,彼此很近;
  3. 两点与门口对齐;
  4. 两点位于不同房间,并且都离门很远。

只把模拟器几何用作评估预言机。比较潜在状态排序、最短可行路线、预算约束下的可达性、固定 CEM 预算下选出的第一个动作,以及真实执行结果。

先为真实编码的终点打分,再为模型生成的终点打分。如果采用预言机动力学时排序就已出错,应检查表征或代价几何;如果只在滚动展开后出错,应检查动力学漂移;如果排序良好而计划失败,责任可能在搜索、支持范围、动作转换或执行。

实验凭据

基准主张来自 LeWorldModel v3 和冻结的作者提交 8edfeb3。它只支持这样一种范围有限的表述:LeWM 用简单、对称的平方距离为终端潜在状态排序,而该距离是否符合路线长度或可达性,必须通过实验检验。

后续的 Objective Bottleneck 研究报告称,在一个独立实现的 TwoRoom 系统中,潜在 L2 与空间距离对齐较弱,替换代价后行为也发生了变化。它是同一系统的后续工作,并不是第二次独立复现,也不是通用可达性度量。

应记录检查点、预处理、潜在宽度、样本对生成器、预言机定义、动作预算、CEM 预算和随机种子。墙壁示意图是教程反例,并不能证明每个 LeWM 检查点都会在这里失败。

快速检查

  1. 为什么平方潜在距离是一个有用的基准?
  2. 对称的终点直尺本身永远无法表达什么?
  3. 哪种预言机替换可以区分错误的代价排序和错误的滚动展开?