课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
一本翻页书,几种裁法
- 同取 16 帧时间一格不换
- 全局 224场景大窗
- 局部 96细节小窗
- 组成一组共同送入共享网络
老师用 16 张连续照片做一本翻页书。她先印出一份能看到整张桌子的“大版”,再做几份只围住杯子、手或桌角的“小版”,并让小版稍微变亮、变灰。无论做多少份,所有版本都必须翻同样的 16 页。若某个小版本从第 9 页才开始,它已经在回答另一道题。
一组合法视图是怎样做出来的
对每个训练 clip,LeVJEPA 先固定一个包含 16 帧的时间区间,再生成 1 + V 个视图。全局视图(global view) x_0 的输入大小为 224 × 224,覆盖较大的空间范围;局部视图(local view) x_1 ... x_V 为 96 × 96,来自更紧的空间裁剪,并接受光度增强,也就是亮度、颜色一类外观扰动。全局视图覆盖最大且没有局部式光度扰动,因此适合做参照;它仍是可训练分支,而非标签文件。
V 是实验设置,并非方法名称里暗藏的常数。论文的主要受控比较在未另行说明时使用 4 个局部视图,并报告增加到 10 个会提高该设置下的 ImageNet 探针结果、到 12 个附近趋于饱和;官方 Walking Tours 默认配置则使用 10 个局部裁剪。复现实验时要把实际 V 记入配方,仓库默认值与所有论文实验并不能画等号。
为什么小窗有用?若大窗与小窗的 [CLS] 摘要要接近,编码器就不能只依赖某个固定坐标或完整背景;它要从局部线索恢复同片共享内容。为什么还需要大窗?只有小窗彼此对齐时,可能缺少稳定的宽场景参照。二者构成信息量不同但时间身份相同的配对。
这里“相同时间窗口”比“帧数相同”更严格。两段都恰好 16 帧,只要起点不同,动作阶段就可能已经变了。LeVJEPA 配的是同一个窗口里的全局与局部视图,并非用前 16 帧预测后 16 帧。帧间只能看过去的块因果注意力发生在编码器内部,也不会改变这条配对规则。
视图生成之后,每一份输入会独立完成 patch embedding(把图像小块变成 token),再随机丢掉一部分 token;它们都调用同一个 encoder/projector。随机保留集合可以不同;共享的是源时间窗口和网络参数,并不要求留下同一批空间 patch。
做一组合法样本
设原视频帧号为 101–116。写出一组合法输入:全局视图取 101–116 的 224 × 224 裁剪,三个局部视图也都取 101–116,但各裁成不同的 96 × 96 区域。把其中一个局部改为 117–132,即使仍有 16 帧,也应判为不合法配对。
裁剪参数的出处
固定住这扇时间窗
- 全局
224 × 224与局部96 × 96视图共享完全相同的 16 帧窗口。 - 局部视图数量是实验设置;论文比较和仓库默认值不必相同。
- 各视图可独立裁剪、增强和丢 token,但共享同一 encoder/projector 参数。
哪一组还能配对?
- 两段各 16 帧但起点不同,能否组成正配对?
- 官方默认局部视图数是否等于所有实验的固定常数?
- 全局视图是不是停梯度教师?
逐项核对
- 不能。
- 不是;必须记录具体实验的
V。 - 不是,它与局部分支一起反向传播。