JEPA4Japan · 教程

第 6 章——两张卡要相同,但不能全变成白纸

1,017字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

理解不变性目标为何有用,又为何会允许常量输出和维度坍塌。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 当前课程
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

一张得满分的白卷

  1. 狗的大窗写一张卡
  2. 狗耳小窗卡片要靠近
  3. 偷懒答案全部写“东西”
  4. 坍塌相同却没信息
“同一视频的两张卡相同”是好规则;“所有视频都用同一张卡”是坏捷径。

老师只检查每段视频自己的大小两张卡是否相同。一个满分捷径马上出现了:无论猫、火车还是倒水,全部写数字 0。每一对卡当然完全一致,误差也是零,可谁也无法再从卡片分辨视频。

训练程序并没有坏;是题目本身容许这种答案。于是,“让同片靠近”之后自然跟着第二问:怎样让整班卡片仍有差别?

坍塌其实有两种

**不变性(invariance)**表示我们希望表征不随某些无关变化而改变。LeVJEPA 比较全局嵌入 z_0 与每个局部嵌入 z_v 的平方距离。裁剪范围和颜色即使不同,只要仍来自同一 16 帧窗口,摘要就应接近。距离两端都参与求梯度,所以全局和局部更像一起移动的同学,而非老师和学生。

若只最小化这个距离,常量函数 z(x) = c 是精确解:任意两视图的差都是零。这叫完全坍塌。还有更隐蔽的维度坍塌:向量看似很长,实际只有少数方向变化,其余坐标恒定或互相重复;下游可用信息仍可能很少。

常见方法会用负样本、方差/协方差约束,或 EMA 教师、predictor 与 stop-gradient 封住这条捷径。LeVJEPA 选择 SIGReg:它检查一批嵌入组成的点云,推动点云接近均值为零、各方向方差相同且无相关偏斜的标准各向同性高斯。一个点或一条扁线自然过不了这项形状检查。

因此两项损失分工明确:不变性告诉单个视频的不同视图“彼此是什么关系”,SIGReg 检查许多样本共同形成的“班级形状”。只看第一项可能全相同;只看第二项则点云可以很漂亮,却未必把同一视频的视图放在一起。LeVJEPA 用固定权重把两股压力相加。

防住坍塌只是排除了一类退化答案。编码器仍可能记住背景、拍摄设备或别的捷径;这些问题要靠数据审计与下游评估发现。

在纸上摆四个点

写四个二维点:(0,0)、(0,0)、(0,0)、(0,0)。它们能让任何同片配对距离为零,却在横纵方向都没有变化。再写 (−1,0)、(1,0)、(0,−1)、(0,1):至少点云展开了,但仍不能仅凭形状断言点的含义正确。

这道“防作弊题”的依据

从白卷里学到的三件事

  1. 不变性损失单独使用时,所有输入输出同一常量也能得零分。
  2. SIGReg 约束整批嵌入的分布,用来排除完全与维度坍塌。
  3. 不坍塌只说明表示没有退化,不等于已经理解世界。

找出那条捷径

  1. 为什么常量编码器能骗过不变性损失?
  2. 全局分支是否停止梯度?
  3. 点云展开能否单独证明学到了动作语义?
为什么会这样
  1. 因为任意配对的两个常量输出完全相等。
  2. 不停止,两端都接收梯度。
  3. 不能;还要用针对动作信息的评估。