JEPA4Japan · 教程

附录 A——最低限度数学工具箱

1,913字 5分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

复习向量、MSE、高斯、随机投影、特征函数、Cramér–Wold、FLOPs 与梯度。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 当前课程
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

把公式拆成一只小工具箱

  1. 向量一张数字地址卡
  2. 距离两张卡差多远
  3. 投影从一个方向看影子
  4. 高斯不偏爱任何方向
  5. 梯度告诉参数往哪走
读懂 LeVJEPA 用不着先搬来整本高等数学;先弄清每个符号在检查谁。

假设每段视频都会得到一张 256 格的“地址卡”。两扇窗看见同一段视频,地址应该接近;不同视频的所有地址又不能挤在同一个邮箱里。前一条规则用距离表达,后一条规则用很多随机方向上的“人群形状”表达。

这一附录只收纳完成这两件事所需的数学。每遇到公式,先问三个问题:输入是谁、沿哪个维度平均、结果约束一对样本还是整个 batch(批次)?

1. 数字地址与两点距离

嵌入 z = [z1, z2, ..., zK] 是一个 K 维向量,可以把它看成有 K 个数字的地址。LeVJEPA 的公开配方使用 K=256 的投影空间。两个向量的平方欧氏距离,就是把各坐标差的平方加起来:

||a - b||² = Σ_k (a_k - b_k)²

代码里的 .pow(2).mean() 还会对视图、batch 和坐标取平均,所以数值尺度不等于上式的单样本“求和”版本。LeVJEPA 的不变性项可读作:

L_inv = 所有样本、所有视图、所有坐标上的 (global_z - view_z)² 平均值

它让同一时间窗口的局部摘要靠近全局摘要。若单独最小化它,让所有输入都输出同一个常量就能得到零损失;这就是为什么还需要 SIGReg。

2. batch 是一群人,不是一袋无关配对

不变性损失比较配对样本;SIGReg 检查的是群体分布。若一个 batch 有 B 段视频、每段有 V+1 个视图、投影维数为 K,SIGReg 接收的逻辑形状是:

[V+1, B, K]

它对每个视图位置分别查看 B 个向量。在分布式训练中,官方实现先对各 worker 的经验特征函数做一次 all-reduce,从而让统计量对应全局 batch。小 batch 会让“人群照片”更嘈杂;增加随机投影数量并不能凭空增加人群数量。

3. “标准、各向同性、高斯”拆开读

一维标准高斯写作 N(0,1):中心为 0,方差为 1。K 维各向同性标准高斯写作 N(0,I_K):每个方向使用相同尺度,没有预设的偏爱方向。

这幅图并非“点均匀涂满一个球面”。高斯在原点附近密度较高,而高维概率质量的典型半径大约是 sqrt(K)。只看每个坐标的均值和方差也不够:相同的一、二阶矩仍可能藏着弯曲、分叉或 X 形依赖。

LeJEPA 对高斯最优性的论证只在论文分析的下游风险与假设下成立。它不是“所有物理世界都天然是高斯”的定律。

4. 用手电筒理解随机投影

单位向量 a 像一支手电筒。高维点 z 在该方向上的一维影子是内积:

s = <z, a> = Σ_k z_k a_k

Cramér–Wold 原理告诉我们:若两个高维概率分布在所有一维方向上的投影分布都相同,那么高维分布相同。SIGReg 把这个原则变成可训练近似:每一步随机取 M=1024 个方向,而不是检查无穷多个方向。

因此,安全说法是“随机投影给出了可扩展的分布约束”;不安全说法是“1024 个方向证明这一批数据已经完全高斯”。有限 batch、有限方向与有限积分节点都留下近似误差。

5. 给分布验一枚“频率指纹”

概率分布的特征函数可写成:

φ(t) = E[exp(i·t·s)] = E[cos(t·s)] + i·E[sin(t·s)]

对标准高斯,这个指纹有解析形式 exp(-t²/2)。Epps–Pulley 统计量比较样本投影的经验指纹与这条解析曲线。官方实现用 t∈[0,3] 的 17 个节点做梯形积分,并用高斯窗口加权。余弦和正弦有界,所以这个目标及其梯度不会被单个极大离群值无限放大。

6. 两项损失怎样一起推参数

L = L_inv + λ · L_SIGReg,    λ = 0.02

λ 是两项损失的权衡参数,也是论文所说的“目标函数唯一超参数”。这句话只描述目标式;学习率、batch、视图数量和丢弃率等训练配置仍然存在。

全局和局部嵌入都没有 detach,所以不变性项会沿两条分支反传;SIGReg 也会更新共享编码器与 projector。训练完成后丢弃 projector,下游使用编码器输出。

7. FLOPs 量工作,不直接量秒数

FLOPs 近似统计浮点运算量,适合比较算法计算预算;墙钟时间还会受 GPU 型号、kernel、I/O、通信和实现质量影响。Transformer 的注意力对序列长度含近似二次项,MLP 含近似线性项,所以把 3136 个 patch token 随机减到约 157 个,会大幅降低一步训练的计算与显存,但不能简单宣称所有部分都恰好快 20 倍。

两分钟,把两股力算出来

给定全局嵌入 g=[1,0],两个局部嵌入 l1=[0,0]、l2=[1,1]:

  1. 两个平方距离都为 1;平均配对误差为 1。
  2. 若把三者全改成 [0,0],不变性误差变为 0。
  3. 但整个数据集中所有嵌入都为 [0,0] 时,任何方向的影子都没有方差,与 N(0,1) 显著不同,SIGReg 会反对这条捷径。

这个例子展示的是目标的角色分工,不代表三个样本足以稳定估计高斯分布。

这些工具从哪里来

LeVJEPA arXiv v1 给出两项损失、λ=0.02 与实现近似;LeJEPA arXiv v3 给出 SIGReg 与受假设约束的下游风险论证;固定快照中的 SIGReg 实现 定义 1024 个方向、17 个节点和分布式聚合。Epps–Pulley 原论文与 Cramér–Wold 原理是统计工具的来源。

工具箱里别落下这三件

  1. 不变性约束配对样本,SIGReg 约束一群嵌入。
  2. 随机投影是对“所有方向”的有限近似,不是高斯证书。
  3. λ=0.02 是目标权重,不是整个训练唯一的设置。

合上工具箱前

  1. 为什么只检查每维均值和方差还不够?
  2. 增加投影数与增加 batch 大小解决的是同一问题吗?
  3. 为什么低 SIGReg 不能直接证明模型理解了运动?
逐件核对
  1. 一、二阶矩相同的联合分布仍可能有完全不同的依赖和形状。
  2. 不是。前者增加观察方向,后者增加每个经验分布中的样本;两种误差来源不同。
  3. SIGReg 只约束嵌入群体形状,不检查时间对应、动作、物体身份或下游可用性。