JEPA4Japan · 教程

第 9 章——全局视图与局部视图怎样配对

1,130字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

构造一个 224 像素全局视图与多个 96 像素局部视图,并守住相同 16 帧时间窗口。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 当前课程
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

一本翻页书,几种裁法

  1. 同取 16 帧时间一格不换
  2. 全局 224场景大窗
  3. 局部 96细节小窗
  4. 组成一组共同送入共享网络
同一训练组可以换裁剪、颜色和大小;16 帧的时间身份始终不换。

老师用 16 张连续照片做一本翻页书。她先印出一份能看到整张桌子的“大版”,再做几份只围住杯子、手或桌角的“小版”,并让小版稍微变亮、变灰。无论做多少份,所有版本都必须翻同样的 16 页。若某个小版本从第 9 页才开始,它已经在回答另一道题。

一组合法视图是怎样做出来的

对每个训练 clip,LeVJEPA 先固定一个包含 16 帧的时间区间,再生成 1 + V 个视图。全局视图(global view) x_0 的输入大小为 224 × 224,覆盖较大的空间范围;局部视图(local view) x_1 ... x_V 为 96 × 96,来自更紧的空间裁剪,并接受光度增强,也就是亮度、颜色一类外观扰动。全局视图覆盖最大且没有局部式光度扰动,因此适合做参照;它仍是可训练分支,而非标签文件。

V 是实验设置,并非方法名称里暗藏的常数。论文的主要受控比较在未另行说明时使用 4 个局部视图,并报告增加到 10 个会提高该设置下的 ImageNet 探针结果、到 12 个附近趋于饱和;官方 Walking Tours 默认配置则使用 10 个局部裁剪。复现实验时要把实际 V 记入配方,仓库默认值与所有论文实验并不能画等号。

为什么小窗有用?若大窗与小窗的 [CLS] 摘要要接近,编码器就不能只依赖某个固定坐标或完整背景;它要从局部线索恢复同片共享内容。为什么还需要大窗?只有小窗彼此对齐时,可能缺少稳定的宽场景参照。二者构成信息量不同但时间身份相同的配对。

这里“相同时间窗口”比“帧数相同”更严格。两段都恰好 16 帧,只要起点不同,动作阶段就可能已经变了。LeVJEPA 配的是同一个窗口里的全局与局部视图,并非用前 16 帧预测后 16 帧。帧间只能看过去的块因果注意力发生在编码器内部,也不会改变这条配对规则。

视图生成之后,每一份输入会独立完成 patch embedding(把图像小块变成 token),再随机丢掉一部分 token;它们都调用同一个 encoder/projector。随机保留集合可以不同;共享的是源时间窗口和网络参数,并不要求留下同一批空间 patch。

做一组合法样本

设原视频帧号为 101–116。写出一组合法输入:全局视图取 101–116 的 224 × 224 裁剪,三个局部视图也都取 101–116,但各裁成不同的 96 × 96 区域。把其中一个局部改为 117–132,即使仍有 16 帧,也应判为不合法配对。

裁剪参数的出处

固定住这扇时间窗

  1. 全局 224 × 224 与局部 96 × 96 视图共享完全相同的 16 帧窗口。
  2. 局部视图数量是实验设置;论文比较和仓库默认值不必相同。
  3. 各视图可独立裁剪、增强和丢 token,但共享同一 encoder/projector 参数。

哪一组还能配对?

  1. 两段各 16 帧但起点不同,能否组成正配对?
  2. 官方默认局部视图数是否等于所有实验的固定常数?
  3. 全局视图是不是停梯度教师?
逐项核对
  1. 不能。
  2. 不是;必须记录具体实验的 V。
  3. 不是,它与局部分支一起反向传播。