JEPA4Japan · 教程

第 7 章——SIGReg:从许多影子检查一团点云

1,137字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

用随机一维投影、特征函数和高斯参考,直观理解 LeJEPA 带来的防坍塌机制。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 当前课程
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

看不清点云,就先看影子

  1. 一团点高维嵌入
  2. 换方向照随机单位向量
  3. 检查影子像不像钟形
  4. 重复多次逼近圆润点云
SIGReg 不直接巡视高维宇宙,而是从许多方向检查它投下的一维影子。

桌上有一团形状难辨的积木。从不同方向打光:某个方向的影子若缩成一点,积木团在那个方向上就被压扁了;许多方向都留下平滑、居中的钟形影子,才更像一团没有挤进窄缝的积木。

当然,一下午只能试有限个灯位,桌上也只是这一小批积木。没碰见扁影,只能增加信心,并不等于穷尽了所有方向。

从手电筒走到 SIGReg

每个视频视图会得到一个 K 维嵌入,许多样本合起来形成高维点云。SIGReg 全称 Sketched Isotropic Gaussian Regularization(速写式各向同性高斯正则化):sketched 指借助低维“速写”检查分布,目标是让点云接近标准各向同性高斯 N(0, I)。这种分布以零为中心,各个单位方向尺度相同,没有哪个方向被压成零方差。

理论桥梁是 Cramér–Wold 思想:若高维随机变量在所有一维方向上的投影分布都与标准正态一致,那么其联合分布就是标准各向同性高斯。实现先随机采样单位方向 a_m,把每个嵌入 z_i 压成标量内积 <z_i, a_m>;再用经验特征函数——一组由样本算出的正弦、余弦“指纹”——与标准正态的解析指纹比较。论文采用 Epps–Pulley 型统计量,用数值求积近似积分,最后汇总多个方向和各个视图的损失。

为什么这能抓坍塌?若所有嵌入相同,总能看到几乎没有宽度的影子,与方差为 1 的正态影子相差很大;若点云只活在低维平面,垂直方向也会暴露零方差。SIGReg 直接通过嵌入把梯度传回 projector 与 encoder,不需要构造负样本或一个教师分支。

论文定理与代码实现各自回答不同尺度的问题。定理描述理想分布约束及其假设;一次训练只看到有限 batch(批次,即同时送入的一组样本)、有限随机方向和有限求积节点,结果还受优化是否收敛影响。因此代码得到的是随机有限近似。某一步 SIGReg 很低,支持的是“这次检查没有发现明显退化”,还不足以证明总体在每个方向都精确高斯,更推不出坐标已经对应真实物理状态。

画一团会骗人的点

在纸上画一条横线上的十个点。从水平方向看影子很宽,从竖直方向看全落在一点。这个例子说明只查一个方向会漏掉维度坍塌;增加随机方向会提高发现机会,但有限检查仍不是穷尽证明。

公式和实现的来路

把三束光带走

  1. SIGReg 用随机一维投影检查高维嵌入是否接近各向同性高斯。
  2. 常量点与低维扁平点云会在某些方向留下不正常的影子。
  3. 有限 batch、方向和求积只是理论目标的近似,低损失不是完整分布证明。

换个方向照照看

  1. sketched 在这里是什么意思?
  2. 为什么只看水平方向可能漏掉坍塌?
  3. SIGReg 很低是否证明模型学会物理规律?
影子告诉了我们什么
  1. 用随机低维投影给高维分布做速写。
  2. 点云可能在未检查的垂直方向被压扁。
  3. 不证明;它只支持分布没有按该检查退化。