课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
三间考场,冻住的是谁
- 认物体ImageNet-1K
- 认动作Kinetics-400
- 辨运动Something-v2
- 冻住大脑只训练考官
冻结学生,不冻结考官
同一个孩子参加三场考试:看照片说“这是什么”,看视频说“在做什么”,再区分“把杯子放上桌”和“从桌上拿走杯子”。孩子全程不再补课,但每个考场都会训练一位很小的翻译员,把他已有的想法翻成类别。成绩反映信息是否藏在表征里,却不等于孩子零样本就会报答案。
三张卷子、两种探针
| 基准 | 论文赋予的角色 | v1 使用的读出 | 能支持的证据 |
|---|---|---|---|
| ImageNet-1K(IN1K) | 静态物体、偏外观 | frozen attentive probe | 编码器是否保留可被小探针取出的物体信息 |
| Something-Something-v2(SSv2) | 时间顺序和运动关系 | frozen attentive probe | 表征中的运动/时序信息;不是完整物理理解证明 |
| Kinetics-400(K400) | 动作识别 | 冻结 token 均值池化 + linear probe | 动作类别信息;协议弱于 attentive probe |
frozen 的准确含义是 encoder 参数固定,探针和分类器仍在下游训练集上学习,所以不是 zero-shot。也不是端到端 fine-tuning;若解冻 encoder,模型能适配多少是另一项实验。
attentive probe 不只是线性层。论文附录写得很具体:一枚可学习 query 经单层 cross-attention 读取冻结 encoder 的全部输出 token;结果与 query 残差相加,再过两层 MLP、GELU、LayerNorm,最后线性分类。它能学习“该从哪些 token 取信息”,所以衡量的是表征所含信息,而非信息是否已经线性排好。
K400 数据规模较大,论文为控制探针成本,改用所有输出 token 的均值和一个线性分类器,并称其为严格更弱的适配。因此 FLOP-matched 表中 IN1K/SSv2 与 K400 用的是不同容量的读出,横向看分数时要把这项差别留在表头。跨视频方法比较时,论文还调整输入的时间长度,使不同 tubelet 设置在探针端看到相同数量的 token;静态 ImageNet 图像则沿时间轴重复后送进视频 encoder。
“IN1K 高”不自动说明动作好,“SSv2 高”也不证明会规划。三张卷子一起看,才会看到 LeVJEPA 的形状:FLOP-match 中外观和 K400 强,而 SSv2 仍落后该表最佳值。
给四种评估贴标签
给四句话贴标签:冻结探针、零样本、微调或无效主张。①编码器冻结,训练 cross-attention 与分类器;②编码器也更新;③不训练任何分类头直接回答;④SSv2 高所以机器人会规划。答案依次是冻结探针、微调、零样本、无效主张。
三张考卷的考纲
交卷前核对
- IN1K 偏外观,SSv2 偏运动/顺序,K400 考动作类别,三者提供互补证据。
- frozen probe 仍用标签训练小读出,不是 zero-shot,也不是 encoder 微调。
- IN1K/SSv2 用 attentive probe,K400 用均值池化后的 linear probe。
分清谁在学习
- 冻结评估会不会更新 encoder?
- attentive probe 是否只有一个线性分类层?
- 为什么 K400 与 IN1K 不能按同一种读出来解释?
查看答案
- 不会,只更新探针和分类器。
- 不是;它含 cross-attention、残差、两层 MLP、GELU、LayerNorm 和分类层。
- K400 用均值池化 + linear probe,而 IN1K 用 attentive probe。