JEPA4Japan · 教程

第 16 章——四组消融究竟回答了什么

1,124字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

逐项读懂丢弃率、随机与管状模式、局部视图数量、tubelet 和注意力拓扑的受控比较。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 当前课程
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

一次只换一根横档

  1. 固定地基数据与模型
  2. 只动一钮一次一个问题
  3. 同一考试冻结探针
  4. 记录差值不混表
  5. 守住范围不是普遍定理
消融像爬梯子:先固定其余条件,再换一根横档,才能知道变化来自哪里。

纸飞机为什么要一次只改一处

想让纸飞机飞远,如果同时换纸、剪翅膀、加配重,即使飞远了也不知道是谁的功劳。先固定纸和投法,每次只改一处,结果才有可解释的归因。LeVJEPA 第 4 节做的正是这种“单问实验”:少看多少、怎样少看、开几扇小窗、几帧合成 token,以及是否允许看未来。

先钉住两套“默认”

名称数据与时长关键设置能回答什么
论文受控消融默认ViT-B/16,20% K710;第 4 节 unless stated otherwiseV=4、随机 dropping;冻结 attentive probe 的 IN1K top-1(v1 图 4 图注曾写 linear)论文内部的局部设计比较
官方仓库运行默认Walking Tours,26 epochs,约 10k optimizer stepsViT-B/16、V=10、95%、tubelet=1、block causal、batch 3072一套公开可运行配方,不等于论文 240/1085-epoch 比较

两套配方共享许多零件,但数据和训练时长不同。直接运行仓库默认,得到的是另一张实验收据,并不会自动复现论文表格。

沿五个问题逐级往上爬

以下数值全是 arXiv v1 的作者报告,应在各自行的协议里阅读。

问题只改什么报告结果最窄的可靠结论
少看是否只是近似?丢弃率 0 → 95%IN1K 33.9 → 47.6;90% 为 47.4在该 sweep 中越稀疏,IN1K 不降反升
随机还是 tube?保留位置结构随机/tube:IN1K 50.7/39.6;SSv2 28.8/26.4(后者为 tubelet=2 设置)不做填空时,永久遮同一区域较差
几个 local view?V=4 → 10 → 1247.6 → 50.2 → 49.8到 10 个改善,随后在该范围饱和;每个 local 约多 29 个保留 patch
两帧先合并吗?τ=2,ρ=.90 对 τ=1,ρ=.95,匹配 token/评估时槽IN1K 47.4/50.7;SSv2 28.8/30.4此目标不依赖输入端时间聚合
必须双向看未来吗?full 对 block causalIN1K 50.7/51.2特定冻结探针中未见因果遮罩的可测代价

这不是一条能把各行最佳数相加的“升级菜单”。不同横档可能来自不同子设置;例如 motion 对高丢弃率更敏感,短 schedule 下 ρ>0.3 的 SSv2 会下降。受控消融告诉我们“在检查过的邻域里发生了什么”,不保证换数据、规模或任务仍同序。

给一句夸张标题补回条件

评审一句话:“95% dropping 在所有任务上都最好,因为 47.6 高于 33.9。”请找出两处错误:这组数字是 ImageNet 的同图趋势,不覆盖所有任务;论文恰好报告短 schedule 的 SSv2 在高丢弃率下降。把它改成:“在论文指定的 IN1K 消融中,作者报告 95% 最好;运动任务存在条件性代价。”

每根横档的出处

消融表的读法

  1. 论文消融默认与仓库运行默认是两套不同实验身份。
  2. 数字连着被改变的旋钮、固定条件、数据和探针一起读,才知道差值来自哪里。
  3. 消融支持局部经验结论,不自动成为跨数据、规模和任务的普遍定理。

判断结论能走出多远

  1. 论文受控比较默认几个 local view?
  2. 仓库默认 26 epochs 能否直接复现论文 240-epoch 表格?
  3. 51.2 对 50.7 能否证明 block-causal attention 在所有任务都更好?
查看答案
  1. V=4,除非另有说明。
  2. 不能;数据、schedule 和用途均不同。
  3. 不能;它只是在指定 IN1K 冻结探针协议下的作者报告。