课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
从会动的拼图里只抓一小把
- 铺满拼图3136 块
- 随机抽块每次位置不同
- 只送 5%157 块
- 猜整段意思不是补像素
桌上摊着一册会动的连环画。闭眼抓一小把方块:这次拿到车轮和路灯,下次拿到司机和天空。每次可见的位置都变,机器只能练习从零散线索概括整段故事。若每一帧都固定挖走同一块位置,待在那里的主角可能从头到尾没有露面。
这便是“随机 dropping”和“tube mask”的直观区别。这里的拼图类比到“稀疏阅读”为止:LeVJEPA 没有 mask token、decoder 或重建目标,所以它并不负责把拼图补齐。
代码究竟拿走了什么
token 在 patch embedding 之后才被抽样。对每个样本,代码为完整时空网格里的每个 patch 生成随机数,再保留最小的一组;[CLS] 随后才加入,因此始终存在。dropping 只在 training 模式生效,评估和推理读取完整序列。
| 视图 | 丢弃前 patch | 95% 后 patch | 加 [CLS] 后 |
|---|---|---|---|
| 16 帧、224、patch 16 | 3136 | 157 | 158 |
| 16 帧、96、patch 16 | 576 | 29 | 30 |
论文作者报告的受控消融显示:ImageNet-1K 从不丢 token 时的 33.9,随丢弃率增加到 95% 时升至 47.6;90% 与 95% 分别是 47.4 和 47.6。论文给出两层解释:一是每步要处理的 token 更少,二是不断变化的稀疏观察像一种数据增强,迫使摘要从不同线索中形成。式子 1 / (1 - ρ) = 20 描述的是 ρ=0.95 时前馈层的理论降本因子;端到端训练还包含其他算子与开销,因此不能直接写成墙钟时间快 20 倍。
结构也重要。随机保留与每帧保留相同空间位置的 tube 方案相比,作者报告 ImageNet 为 50.7 对 39.6;在指定的 tubelet=2 设置下,SSv2 为 28.8 对 26.4。但高稀疏度不是全赢:短训练中,SSv2 在丢弃率超过 0.3 后下降;论文说延长训练可缓解,并把保留运动对应关系的稀疏方案留作开放问题。
论文第 4 节总说明写“frozen attentive probe”,arXiv v1 图 4 图注却写“linear probing”,项目页又写 attentive probing。鉴于这处协议文字并不一致,上述 sweep 最稳妥的用途是比较同一张图里的趋势;跨表比较绝对数时,还需先确认探针协议。
画出 random 与 tube
算一遍 round(3136×0.05)=157 与 round(576×0.05)=29。然后画四帧、每帧四格:随机方案每帧圈不同格;tube 方案每帧圈同一格。问自己:哪一种可能把同一物体所在区域在所有帧永久遮掉?答案是 tube。
数值、图注与实现
95% 之后真正留下什么
- dropping 是训练期的真实删减:被丢 token 不进入编码器,也没有重建任务。
- 95% 时全局/局部保留 157/29 个 patch token,
[CLS]另算且不丢。 - 作者报告它有利于 ImageNet 和计算效率,但短训练的运动指标会受损。
稀疏阅读小测
- 被丢掉的位置会不会换成 mask token?
- 95% dropping 后全局序列含
[CLS]共多少 token? - 能否据 ImageNet 趋势断言 95% 对所有运动任务都最好?
从 keep-set 找答案
- 不会,它们直接不进入 Transformer。
- 158。
- 不能;论文明确报告短训练下 SSv2 在高丢弃率时下降。