JEPA4Japan · 教程

第 18 章——ImageNet、K400、SSv2 各考什么

1,003字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

理解外观、动作与运动基准,以及冻结编码器、线性探针和 attentive probe 的证据范围。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 当前课程
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

三间考场,冻住的是谁

  1. 认物体ImageNet-1K
  2. 认动作Kinetics-400
  3. 辨运动Something-v2
  4. 冻住大脑只训练考官
三个考场问不同问题;“冻结”表示编码器不改,但探针仍会用带标签数据学习。

冻结学生,不冻结考官

同一个孩子参加三场考试:看照片说“这是什么”,看视频说“在做什么”,再区分“把杯子放上桌”和“从桌上拿走杯子”。孩子全程不再补课,但每个考场都会训练一位很小的翻译员,把他已有的想法翻成类别。成绩反映信息是否藏在表征里,却不等于孩子零样本就会报答案。

三张卷子、两种探针

基准论文赋予的角色v1 使用的读出能支持的证据
ImageNet-1K(IN1K)静态物体、偏外观frozen attentive probe编码器是否保留可被小探针取出的物体信息
Something-Something-v2(SSv2)时间顺序和运动关系frozen attentive probe表征中的运动/时序信息;不是完整物理理解证明
Kinetics-400(K400)动作识别冻结 token 均值池化 + linear probe动作类别信息;协议弱于 attentive probe

frozen 的准确含义是 encoder 参数固定,探针和分类器仍在下游训练集上学习,所以不是 zero-shot。也不是端到端 fine-tuning;若解冻 encoder,模型能适配多少是另一项实验。

attentive probe 不只是线性层。论文附录写得很具体:一枚可学习 query 经单层 cross-attention 读取冻结 encoder 的全部输出 token;结果与 query 残差相加,再过两层 MLP、GELU、LayerNorm,最后线性分类。它能学习“该从哪些 token 取信息”,所以衡量的是表征所含信息,而非信息是否已经线性排好。

K400 数据规模较大,论文为控制探针成本,改用所有输出 token 的均值和一个线性分类器,并称其为严格更弱的适配。因此 FLOP-matched 表中 IN1K/SSv2 与 K400 用的是不同容量的读出,横向看分数时要把这项差别留在表头。跨视频方法比较时,论文还调整输入的时间长度,使不同 tubelet 设置在探针端看到相同数量的 token;静态 ImageNet 图像则沿时间轴重复后送进视频 encoder。

“IN1K 高”不自动说明动作好,“SSv2 高”也不证明会规划。三张卷子一起看,才会看到 LeVJEPA 的形状:FLOP-match 中外观和 K400 强,而 SSv2 仍落后该表最佳值。

给四种评估贴标签

给四句话贴标签:冻结探针、零样本、微调或无效主张。①编码器冻结,训练 cross-attention 与分类器;②编码器也更新;③不训练任何分类头直接回答;④SSv2 高所以机器人会规划。答案依次是冻结探针、微调、零样本、无效主张。

三张考卷的考纲

交卷前核对

  1. IN1K 偏外观,SSv2 偏运动/顺序,K400 考动作类别,三者提供互补证据。
  2. frozen probe 仍用标签训练小读出,不是 zero-shot,也不是 encoder 微调。
  3. IN1K/SSv2 用 attentive probe,K400 用均值池化后的 linear probe。

分清谁在学习

  1. 冻结评估会不会更新 encoder?
  2. attentive probe 是否只有一个线性分类层?
  3. 为什么 K400 与 IN1K 不能按同一种读出来解释?
查看答案
  1. 不会,只更新探针和分类器。
  2. 不是;它含 cross-attention、残差、两层 MLP、GELU、LayerNorm 和分类层。
  3. K400 用均值池化 + linear probe,而 IN1K 用 attentive probe。