JEPA4Japan · 教程

第 13 章——为什么扔掉 95% 反而更会看

1,054字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

区分随机 token dropping 与结构化 tube mask,并同时理解计算节省、数据增强和动作线索损失。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 当前课程
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

从会动的拼图里只抓一小把

  1. 铺满拼图3136 块
  2. 随机抽块每次位置不同
  3. 只送 5%157 块
  4. 猜整段意思不是补像素
被丢掉的 token 不进入 Transformer;模型不是填空,而是从稀疏观察中写出稳定摘要。

桌上摊着一册会动的连环画。闭眼抓一小把方块:这次拿到车轮和路灯,下次拿到司机和天空。每次可见的位置都变,机器只能练习从零散线索概括整段故事。若每一帧都固定挖走同一块位置,待在那里的主角可能从头到尾没有露面。

这便是“随机 dropping”和“tube mask”的直观区别。这里的拼图类比到“稀疏阅读”为止:LeVJEPA 没有 mask token、decoder 或重建目标,所以它并不负责把拼图补齐。

代码究竟拿走了什么

token 在 patch embedding 之后才被抽样。对每个样本,代码为完整时空网格里的每个 patch 生成随机数,再保留最小的一组;[CLS] 随后才加入,因此始终存在。dropping 只在 training 模式生效,评估和推理读取完整序列。

视图丢弃前 patch95% 后 patch加 [CLS] 后
16 帧、224、patch 163136157158
16 帧、96、patch 165762930

论文作者报告的受控消融显示:ImageNet-1K 从不丢 token 时的 33.9,随丢弃率增加到 95% 时升至 47.6;90% 与 95% 分别是 47.4 和 47.6。论文给出两层解释:一是每步要处理的 token 更少,二是不断变化的稀疏观察像一种数据增强,迫使摘要从不同线索中形成。式子 1 / (1 - ρ) = 20 描述的是 ρ=0.95 时前馈层的理论降本因子;端到端训练还包含其他算子与开销,因此不能直接写成墙钟时间快 20 倍。

结构也重要。随机保留与每帧保留相同空间位置的 tube 方案相比,作者报告 ImageNet 为 50.7 对 39.6;在指定的 tubelet=2 设置下,SSv2 为 28.8 对 26.4。但高稀疏度不是全赢:短训练中,SSv2 在丢弃率超过 0.3 后下降;论文说延长训练可缓解,并把保留运动对应关系的稀疏方案留作开放问题。

论文第 4 节总说明写“frozen attentive probe”,arXiv v1 图 4 图注却写“linear probing”,项目页又写 attentive probing。鉴于这处协议文字并不一致,上述 sweep 最稳妥的用途是比较同一张图里的趋势;跨表比较绝对数时,还需先确认探针协议。

画出 random 与 tube

算一遍 round(3136×0.05)=157 与 round(576×0.05)=29。然后画四帧、每帧四格:随机方案每帧圈不同格;tube 方案每帧圈同一格。问自己:哪一种可能把同一物体所在区域在所有帧永久遮掉?答案是 tube。

数值、图注与实现

95% 之后真正留下什么

  1. dropping 是训练期的真实删减:被丢 token 不进入编码器,也没有重建任务。
  2. 95% 时全局/局部保留 157/29 个 patch token,[CLS] 另算且不丢。
  3. 作者报告它有利于 ImageNet 和计算效率,但短训练的运动指标会受损。

稀疏阅读小测

  1. 被丢掉的位置会不会换成 mask token?
  2. 95% dropping 后全局序列含 [CLS] 共多少 token?
  3. 能否据 ImageNet 趋势断言 95% 对所有运动任务都最好?
从 keep-set 找答案
  1. 不会,它们直接不进入 Transformer。
  2. 158。
  3. 不能;论文明确报告短训练下 SSv2 在高丢弃率时下降。