JEPA4Japan · 教程

第 5 章——保留意思,不重画每个像素

1,033字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

比较像素重建、特征预测与视图不变性,弄清 LeVJEPA 实际预测了什么、没有预测什么。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 当前课程
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

三份看似相近的作业

  1. 补像素把空格画回来
  2. 猜特征预测隐藏区域含义
  3. 对摘要同片视图靠近
LeVJEPA 走第三条路:它比较视图摘要,不负责把被丢掉的像素或 token 补回来。

老师把“狗追球”的画面遮住一半。第一位学生得把每根草和每片阴影画回来;第二位只猜遮住区域的高层线索;第三位拿到一张全景和一张只露狗头的裁图,要为它们写出相近的故事卡。叶子怎样抖可以略过,“这是同一段追逐”最好留下。

三份作业都能从无标签数据产生,但它们优化的对象不同,不能只因为都用了遮挡或裁剪就叫成同一种方法。

顺着“答案张量”找区别

**像素重建(pixel reconstruction)**以颜色数值为答案。VideoMAE 一类方法隐藏大部分时空 patch(小块),再用 decoder(解码器)重建;连续视频很容易从邻帧抄到像素,所以结构化 tube mask(让同一空间位置沿时间一起被遮住)有其任务理由。

**特征预测(feature prediction)**把答案换成学习到的表示。I-JEPA 和 V-JEPA 让 context encoder(上下文编码器)与 predictor(预测器)猜目标区域的编码表示;V-JEPA 的目标来自停梯度的 EMA target encoder。纹理无需逐笔重画,但计算图里确实有“预测被遮目标”这一步。

**LeVJEPA 的视图不变性(view invariance)**问的是第三个问题。一个全局视图与多个局部视图都由同一 encoder 和 projector 处理,损失只读取每个视图的 [CLS] 嵌入,让局部摘要靠近全局摘要。由于答案不是要补回某个缺口,这里用不上 decoder;predictor、target encoder 与 stop-gradient 也不在目标图里。全局摘要会随梯度一起更新,并非固定标签。

这也解释了为何 token dropping(直接丢弃 token)和“掩码预测”不是一回事:LeVJEPA 随机丢弃的 patch token 根本不进编码器,目标也没有恢复它们这一项。模型当次只看到保留下来的稀疏 token;这一操作主要改变计算量与观察难度。

“保留意思”仍要谨慎。目标鼓励裁剪和外观扰动下的共同信息,不会列出哪些因素一定是语义、哪些一定应忽略。若下游任务关心细微运动,而稀疏观察常把运动线索删掉,表征也可能受损。是否有用要靠冻结探针、检索或密集任务逐项检验。

一个很可靠的诊断问题

看到一个损失时问:“答案张量从哪里来?”若答案是原像素,它是重建;若来自另一编码器分支的隐藏块,它是特征预测;若只是同片全局与局部 [CLS] 的距离,它才符合 LeVJEPA 的视图不变性。

三类作业的原始出处

别把三份作业混成一份

  1. 像素重建、隐藏特征预测和视图摘要匹配是三种不同训练题。
  2. LeVJEPA 不预测被丢 token,也不重建像素。
  3. 它让同片 [CLS] 嵌入靠近,但“语义好不好”仍需下游证据。

沿着答案张量走

  1. LeVJEPA 为什么不需要 decoder?
  2. 被随机丢弃的 token 是否有重建损失?
  3. V-JEPA 与 LeVJEPA 的训练图最显眼的差别是什么?
答案在哪里
  1. 因为它不重建像素。
  2. 没有。
  3. V-JEPA 有 predictor、EMA target 与停梯度;LeVJEPA 的目标使用共享 encoder/projector 与 SIGReg。