JEPA4Japan · 教程

第 10 章——预测损失:模型怎样学习下一步

1,275字 3分钟阅读 #LeWorldModel#世界模型#JEPA

理解下一潜在状态 MSE、它对规划的局限,以及准确的教师强制单步与不稳定长滚动之间的差距。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 当前课程
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 猜测下一潜在状态
  2. 编码现实中真正发生的下一步
  3. 测量坐标差的平方
  4. 牢记只是一把局部直尺
较小的单步潜在误差是有用证据,但不是整个规划器的合格证。

一条经过检查的预测链路,后面还有彼此独立的表征、滚动展开、代价、搜索和执行链路。

一个小故事

驾驶学员可以准确完成许多单独转弯,却仍然选择一条横跨城市的错误路线。LeWM 的预测损失就像测量一次局部转弯的直尺。它会问:下一潜在状态的猜测,是否接近共享编码器对记录中下一观测给出的表征?

这把直尺不可或缺。没有它,预测器就没有直接理由遵循记录下来的转移。但它的坐标是学习得到的,并不是米、角度或速度。

技术背包

冻结实现采用均方误差:

observed_states = encode(recorded_frames)
guesses = predict(observed_states_without_last, recorded_actions_without_last)
targets = observed_states_without_first       # still connected
L_pred = mean((guesses - targets)^2)

平方可以防止正负差距相互抵消;取平均则合并 batch、时间位置和潜在坐标。如果一个重要物理变量根本不在表征中,MSE 就没有能够对它提出异议的坐标。

目标是学习得到的。它不是预言机状态、EMA 教师,也不是停止梯度的固定答案。预测梯度会通过上下文侧和目标侧的使用路径到达共享编码器。这种灵活性也允许常量编码的崩塌捷径,因此 SIGReg 承担另一项不同的工作。

采用冻结的四观测默认设置时,所有移位样本对都参与计算:

context/actions:  z0+a0   z1+a1   z2+a2
predictions:      p1      p2      p3
targets:          z1      z2      z3

它们是不同上下文位置上的三个单步目标,并不是从同一个起点直接滚动一、二、三步得到的结果。num_preds=1 设定偏移量。frameskip=5 时,“一个模型步”横跨五个环境动作。论文报告 TwoRoom 的 history 为一,而冻结的全局默认值为三。

使用教师强制时,每一个上下文状态都来自记录观测。规划时,预测状态会被追加,并成为下一次预测的输入。最初的一点小偏移可以改变后续预测。误差可能增大、缩小、旋转、抵消或饱和,并不一定单调上升。

容易骗过我们的把戏

构建一个包含 95 次直行转移和 5 次罕见门口转弯的数据集。预测器可以处理好绝大多数样本,却忽略转弯动作,同时仍报告看起来不错的平均值。

不要抛弃 MSE,而要把它拆开检查:

  1. 按区域和预测位置报告留出数据上的教师强制单步误差;
  2. 以自回归方式重放记录动作,并绘制误差随时域的变化;
  3. 针对相同目标,比较教师强制上下文和自回归上下文;
  4. 固定历史并交换数据支持范围内的动作;
  5. 只在明确限制的前提下使用特权状态探针;
  6. 分别报告代价排序和闭环成功率。

训练 MSE 和终端规划代价都可能包含潜在状态差距的平方,但它们使用不同张量和归约方式。前者是在移位转移上取平均,后者则是每条候选序列的终端求和分数。两者的原始数值不能互换。

证据凭据

LeWorldModel v3、冻结的 train.py 和冻结的 JEPA.rollout,支持教师强制单步训练和自回归规划。

在一次单随机种子的 TwoRoom 复现中,三个检查点的单步准确率能够排序短时域行为,却无法排序长时域规划成功率。这支持在该协议下分别测量后续链路;但它既不能建立普遍定律,也无法指出原因。

允许的表述是:较低的连通单步 MSE 表明,在接受评估的转移上存在局部潜在一致性。不要把它提升为有意义的状态、可达性、稳定滚动展开、有效 CEM 或成功控制的证据。

快速检查

  1. 为什么编码后的下一观测虽不是固定真值,却仍然有用?
  2. 教师强制上下文与自回归上下文之间发生了什么变化?
  3. 哪项指标可以揭示被平均值掩盖的罕见动作相关失败?