课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
把公式拆成一只小工具箱
- 向量一张数字地址卡
- 距离两张卡差多远
- 投影从一个方向看影子
- 高斯不偏爱任何方向
- 梯度告诉参数往哪走
假设每段视频都会得到一张 256 格的“地址卡”。两扇窗看见同一段视频,地址应该接近;不同视频的所有地址又不能挤在同一个邮箱里。前一条规则用距离表达,后一条规则用很多随机方向上的“人群形状”表达。
这一附录只收纳完成这两件事所需的数学。每遇到公式,先问三个问题:输入是谁、沿哪个维度平均、结果约束一对样本还是整个 batch(批次)?
1. 数字地址与两点距离
嵌入 z = [z1, z2, ..., zK] 是一个 K 维向量,可以把它看成有 K 个数字的地址。LeVJEPA 的公开配方使用 K=256 的投影空间。两个向量的平方欧氏距离,就是把各坐标差的平方加起来:
||a - b||² = Σ_k (a_k - b_k)²
代码里的 .pow(2).mean() 还会对视图、batch 和坐标取平均,所以数值尺度不等于上式的单样本“求和”版本。LeVJEPA 的不变性项可读作:
L_inv = 所有样本、所有视图、所有坐标上的 (global_z - view_z)² 平均值
它让同一时间窗口的局部摘要靠近全局摘要。若单独最小化它,让所有输入都输出同一个常量就能得到零损失;这就是为什么还需要 SIGReg。
2. batch 是一群人,不是一袋无关配对
不变性损失比较配对样本;SIGReg 检查的是群体分布。若一个 batch 有 B 段视频、每段有 V+1 个视图、投影维数为 K,SIGReg 接收的逻辑形状是:
[V+1, B, K]
它对每个视图位置分别查看 B 个向量。在分布式训练中,官方实现先对各 worker 的经验特征函数做一次 all-reduce,从而让统计量对应全局 batch。小 batch 会让“人群照片”更嘈杂;增加随机投影数量并不能凭空增加人群数量。
3. “标准、各向同性、高斯”拆开读
一维标准高斯写作 N(0,1):中心为 0,方差为 1。K 维各向同性标准高斯写作 N(0,I_K):每个方向使用相同尺度,没有预设的偏爱方向。
这幅图并非“点均匀涂满一个球面”。高斯在原点附近密度较高,而高维概率质量的典型半径大约是 sqrt(K)。只看每个坐标的均值和方差也不够:相同的一、二阶矩仍可能藏着弯曲、分叉或 X 形依赖。
LeJEPA 对高斯最优性的论证只在论文分析的下游风险与假设下成立。它不是“所有物理世界都天然是高斯”的定律。
4. 用手电筒理解随机投影
单位向量 a 像一支手电筒。高维点 z 在该方向上的一维影子是内积:
s = <z, a> = Σ_k z_k a_k
Cramér–Wold 原理告诉我们:若两个高维概率分布在所有一维方向上的投影分布都相同,那么高维分布相同。SIGReg 把这个原则变成可训练近似:每一步随机取 M=1024 个方向,而不是检查无穷多个方向。
因此,安全说法是“随机投影给出了可扩展的分布约束”;不安全说法是“1024 个方向证明这一批数据已经完全高斯”。有限 batch、有限方向与有限积分节点都留下近似误差。
5. 给分布验一枚“频率指纹”
概率分布的特征函数可写成:
φ(t) = E[exp(i·t·s)] = E[cos(t·s)] + i·E[sin(t·s)]
对标准高斯,这个指纹有解析形式 exp(-t²/2)。Epps–Pulley 统计量比较样本投影的经验指纹与这条解析曲线。官方实现用 t∈[0,3] 的 17 个节点做梯形积分,并用高斯窗口加权。余弦和正弦有界,所以这个目标及其梯度不会被单个极大离群值无限放大。
6. 两项损失怎样一起推参数
L = L_inv + λ · L_SIGReg, λ = 0.02
λ 是两项损失的权衡参数,也是论文所说的“目标函数唯一超参数”。这句话只描述目标式;学习率、batch、视图数量和丢弃率等训练配置仍然存在。
全局和局部嵌入都没有 detach,所以不变性项会沿两条分支反传;SIGReg 也会更新共享编码器与 projector。训练完成后丢弃 projector,下游使用编码器输出。
7. FLOPs 量工作,不直接量秒数
FLOPs 近似统计浮点运算量,适合比较算法计算预算;墙钟时间还会受 GPU 型号、kernel、I/O、通信和实现质量影响。Transformer 的注意力对序列长度含近似二次项,MLP 含近似线性项,所以把 3136 个 patch token 随机减到约 157 个,会大幅降低一步训练的计算与显存,但不能简单宣称所有部分都恰好快 20 倍。
两分钟,把两股力算出来
给定全局嵌入 g=[1,0],两个局部嵌入 l1=[0,0]、l2=[1,1]:
- 两个平方距离都为 1;平均配对误差为 1。
- 若把三者全改成
[0,0],不变性误差变为 0。 - 但整个数据集中所有嵌入都为
[0,0]时,任何方向的影子都没有方差,与N(0,1)显著不同,SIGReg 会反对这条捷径。
这个例子展示的是目标的角色分工,不代表三个样本足以稳定估计高斯分布。
这些工具从哪里来
LeVJEPA arXiv v1 给出两项损失、λ=0.02 与实现近似;LeJEPA arXiv v3 给出 SIGReg 与受假设约束的下游风险论证;固定快照中的 SIGReg 实现 定义 1024 个方向、17 个节点和分布式聚合。Epps–Pulley 原论文与 Cramér–Wold 原理是统计工具的来源。
工具箱里别落下这三件
- 不变性约束配对样本,SIGReg 约束一群嵌入。
- 随机投影是对“所有方向”的有限近似,不是高斯证书。
λ=0.02是目标权重,不是整个训练唯一的设置。
合上工具箱前
- 为什么只检查每维均值和方差还不够?
- 增加投影数与增加 batch 大小解决的是同一问题吗?
- 为什么低 SIGReg 不能直接证明模型理解了运动?
逐件核对
- 一、二阶矩相同的联合分布仍可能有完全不同的依赖和形状。
- 不是。前者增加观察方向,后者增加每个经验分布中的样本;两种误差来源不同。
- SIGReg 只约束嵌入群体形状,不检查时间对应、动作、物体身份或下游可用性。