课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
一次只换一根横档
- 固定地基数据与模型
- 只动一钮一次一个问题
- 同一考试冻结探针
- 记录差值不混表
- 守住范围不是普遍定理
纸飞机为什么要一次只改一处
想让纸飞机飞远,如果同时换纸、剪翅膀、加配重,即使飞远了也不知道是谁的功劳。先固定纸和投法,每次只改一处,结果才有可解释的归因。LeVJEPA 第 4 节做的正是这种“单问实验”:少看多少、怎样少看、开几扇小窗、几帧合成 token,以及是否允许看未来。
先钉住两套“默认”
| 名称 | 数据与时长 | 关键设置 | 能回答什么 |
|---|---|---|---|
| 论文受控消融默认 | ViT-B/16,20% K710;第 4 节 unless stated otherwise | V=4、随机 dropping;冻结 attentive probe 的 IN1K top-1(v1 图 4 图注曾写 linear) | 论文内部的局部设计比较 |
| 官方仓库运行默认 | Walking Tours,26 epochs,约 10k optimizer steps | ViT-B/16、V=10、95%、tubelet=1、block causal、batch 3072 | 一套公开可运行配方,不等于论文 240/1085-epoch 比较 |
两套配方共享许多零件,但数据和训练时长不同。直接运行仓库默认,得到的是另一张实验收据,并不会自动复现论文表格。
沿五个问题逐级往上爬
以下数值全是 arXiv v1 的作者报告,应在各自行的协议里阅读。
| 问题 | 只改什么 | 报告结果 | 最窄的可靠结论 |
|---|---|---|---|
| 少看是否只是近似? | 丢弃率 0 → 95% | IN1K 33.9 → 47.6;90% 为 47.4 | 在该 sweep 中越稀疏,IN1K 不降反升 |
| 随机还是 tube? | 保留位置结构 | 随机/tube:IN1K 50.7/39.6;SSv2 28.8/26.4(后者为 tubelet=2 设置) | 不做填空时,永久遮同一区域较差 |
| 几个 local view? | V=4 → 10 → 12 | 47.6 → 50.2 → 49.8 | 到 10 个改善,随后在该范围饱和;每个 local 约多 29 个保留 patch |
| 两帧先合并吗? | τ=2,ρ=.90 对 τ=1,ρ=.95,匹配 token/评估时槽 | IN1K 47.4/50.7;SSv2 28.8/30.4 | 此目标不依赖输入端时间聚合 |
| 必须双向看未来吗? | full 对 block causal | IN1K 50.7/51.2 | 特定冻结探针中未见因果遮罩的可测代价 |
这不是一条能把各行最佳数相加的“升级菜单”。不同横档可能来自不同子设置;例如 motion 对高丢弃率更敏感,短 schedule 下 ρ>0.3 的 SSv2 会下降。受控消融告诉我们“在检查过的邻域里发生了什么”,不保证换数据、规模或任务仍同序。
给一句夸张标题补回条件
评审一句话:“95% dropping 在所有任务上都最好,因为 47.6 高于 33.9。”请找出两处错误:这组数字是 ImageNet 的同图趋势,不覆盖所有任务;论文恰好报告短 schedule 的 SSv2 在高丢弃率下降。把它改成:“在论文指定的 IN1K 消融中,作者报告 95% 最好;运动任务存在条件性代价。”
每根横档的出处
消融表的读法
- 论文消融默认与仓库运行默认是两套不同实验身份。
- 数字连着被改变的旋钮、固定条件、数据和探针一起读,才知道差值来自哪里。
- 消融支持局部经验结论,不自动成为跨数据、规模和任务的普遍定理。
判断结论能走出多远
- 论文受控比较默认几个 local view?
- 仓库默认 26 epochs 能否直接复现论文 240-epoch 表格?
- 51.2 对 50.7 能否证明 block-causal attention 在所有任务都更好?
查看答案
V=4,除非另有说明。- 不能;数据、schedule 和用途均不同。
- 不能;它只是在指定 IN1K 冻结探针协议下的作者报告。