JEPA4Japan · 教程

附录 A——最低限度的必需数学工具箱

1,934字 5分钟阅读 #LeWorldModel#世界模型#JEPA

复习向量、批次、协方差、高斯几何、随机投影、梯度、MSE、自回归误差、蒙特卡洛估计和 CEM 概率。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 当前课程
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

全局图景

  1. 为轴命名谁、何时、什么?
  2. 检查点云中心、离散、形状
  3. 度量偏差只是一把局部尺子
  4. 搜索未来采样、保留、收窄
数学是一只小工具箱。每件工具只回答一个问题,从不包办所有问题。

张量轴就像货物上的目的地标签。

一个口袋故事

想象一间装有十台仪器的控制室。一台给箱子贴标签,三台描述人群,一台打光观察投影,一台追踪责任流向,一台测量偏差,一台观察误差如何走向未来,一台向抽样证人提问,最后一台派出搜索队。

即使十台仪器全都亮绿灯,智能体仍可能选择一条穿墙而过的不可能捷径。这正是本附录的教训:一项正确的测量也可能回答错问题。相信一个数字之前,先问:“这个工具负责什么工作?它又不可能知道什么?”

技术背包

1. 先贴标签,再做运算

一个向量是一张状态卡;一个矩阵是一张卡片表;一个张量则增加了更多有标签的轴。[B,T,D] 表示批次、记录时间和潜在特征。规划时,[B,N,H,D] 表示环境批次、候选、模型视界和潜在特征。两个张量可以包含相同数量的值,却会在一次轴交换后讲出完全不同的故事。请把每条轴的名字都说出来。

2. 描述人群的三种摘要

对于潜在向量 z1 ... zn,均值是这群点的中心:

mean = (z1 + ... + zn) / n

方差衡量单个坐标方向上的离散程度。协方差询问不同坐标是否一起变化;它的谱则显示变化铺展在许多方向上,还是只落在一张薄片里。这些指标是警报器,而不是意义证书。一个特征可能只因为亮度变化才变化;两个点云也可能拥有相同的均值和协方差,却在空洞、分支或罕见接触状态上完全不同。

SIGReg 把总体推向各向同性标准高斯:以零为中心、广泛铺展,而且没有特权方向。这样可以排除“所有输入都用同一个编码”的精确崩塌,却不能证明门口、位置或物理量获得了有用坐标。在高维空间里,密度在原点最高,但大部分径向概率质量落在一个宽壳层中;“高斯”并不等于“每个点都停在零点”。

3. 投影与梯度

随机投影把高维点云变成一维影子。Cramér–Wold 思想指出:如果一个分布在每个方向上都一致,就能识别这个分布。实际的 SIGReg 只能看到有限方向、有限小批次和有限数值积分。它是一种反复施加的压力,而不是高斯性证书。

梯度是一条局部的责任路径。在原始 LeWM v3 中,只有一个共享且可训练的视觉编码器。下一观测目标仍连接在计算图上:没有加入停止梯度、EMA 教师或预训练冻结编码器。因此,预测损失会同时到达预测分支和移位后的目标分支;SIGReg 则到达投影后的观测嵌入。路径存在,不代表信号一定足够强、尺度合适或真正有帮助。lambda 只负责平衡总体形状压力与预测压力。

4. 尺子、踏脚石与证人

均方误差比较对应坐标,并对更大的坐标差施加更强惩罚:

MSE = mean((predicted_next_latent - connected_next_latent)^2)

它只说明指定向量在这把尺子下很接近。它并不说明潜在表示没有崩塌、动作确实起作用、滚动能够稳定,或目标可达。即使可行路线很长,终点距离的平方也可能把墙两侧的两个状态排成“很近”。

教师强制的单步预测踩在已记录观测上。自回归滚动则把下一块踏脚石放在模型自己生成的石头上。误差可能累积、抵消、饱和,也可能在门口或接触边界附近触发分支切换;不存在一条普适的增长曲线。

当枚举成本过高时,蒙特卡洛估计会向抽样证人提问。更多合适且独立的样本可以降低采样噪声,却无法修复模型偏差、数据支持域缺口或错误的代价函数。

5. CEM 是搜索队

start with a broad action proposal
repeat for a configured number of rounds:
    sample candidate action sequences
    imagine endpoints with the frozen world model
    rank endpoints with the configured cost
    refit the proposal toward the elite candidates
return the configured output (paper Appendix B prose: final proposal mean)

CEM 改变的是动作提议分布,而不是编码器或预测器权重。从未被采样的候选不可能成为精英;提议分布也可能过早收窄;更强的搜索还可能更有效地利用模型或代价中的漏洞。有限轮次的 CEM 不是全局最优证书。

CEM 对路线采样,保留精英,再收窄提议分布。

骗过我们的把戏

假设均值、方差、协方差、抽样投影和单步 MSE 看起来都很健康,CEM 也尖锐地收敛了。现在却发现:TwoRoom 墙体两侧在潜在空间中是邻居,因此终点距离会奖励穿墙。

仪表盘上的任何一项计算都不必出错。总体统计描述的是全局形状;MSE 描述的是已记录的局部转移;CEM 优化的是冻结模型与所选代价。它们都没有直接测试路线可达性。

一个有用的实验会把这些问题拆开。固定一组门口案例,记录总体几何、动作互换、单步误差、按视界划分的自馈误差、预测路线、代价排序和真实执行结果。如果增加 CEM 样本只让不可能的捷径更稳定地获胜,那么在继续扩大搜索前,应先调查模型支持域与代价几何。

证据凭据

LeWorldModel v3 以及冻结在 8edfeb336732b5f3ce7b8b210d0ba370a09e2cac 的官方代码支持共享编码器连通计算图及其规划角色。LeJEPA v3、Epps–Pulley 检验和 Cramér–Wold 定理支持这一受假设约束的投影动机。

允许的说法是:在具名假设下,这些工具描述张量含义、总体摘要、局部预测间隙、随机估计和有限搜索。不允许的说法是:健康的统计量证明了语义状态恢复;有限投影证明了高斯性;低 MSE 证明了可达性;增加样本能够修复错误模型;CEM 证明了全局最优。本节并未建立独立复现。

快速检查

  1. 为什么一次保持形状不变的轴交换仍可能破坏系统?
  2. 为什么一个看起来像高斯的潜在点云仍可能忘掉门口?
  3. 如果 CEM 很自信地选择了一条不可能路线,接下来你会把哪些测量拆开?