JEPA4Japan · 教程

第 1 章——同一段视频,两扇不同的窗

1,040字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

用一个孩子看街景的故事,建立全局视图、局部视图、相同时间窗口与共同表征的第一直觉。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 当前课程
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

两扇窗,得对准同一刻

  1. 取 16 帧同一小段时间
  2. 开大窗看见完整场景
  3. 开小窗只看局部细节
  4. 对摘要同一故事应相近
窗框可以改变“看哪里”,正样本配对却要守住“看的是哪一刻”。

一辆滑板车从街角经过。落地窗里有车、人和道路,纸筒里只露出转动的轮子。两边像素差得很远,讲的却是同一次经过。若纸筒晚了三秒,镜头里可能已经换成一只狗;此时再把两张摘要卡硬拉到一起,教给模型的关系就错了。

这正是 LeVJEPA 配对视图的要点:空间可以不同,时间身份不能偷换。“同一视频”还不够精确,必须是从同一视频里抽出的同一个 16 帧时间窗口。

把这幅图换成三个术语

**视图(view)**是一段视频经过裁剪和颜色变化后得到的输入版本;**编码器(encoder)**把大量像素整理成数字特征;**嵌入(embedding)**则是便于比较的短数字摘要。先把这三个词和“大窗、读者、摘要卡”一一对应,后面的公式就不会显得突然。

对一个 16 帧 clip,LeVJEPA 构造 V + 1 个视图:一个较大的全局视图 x_0,以及 V 个空间裁得更小、外观扰动更强的局部视图 x_1 ... x_V。它们都保留同一组 16 个时刻。每个视图都走过参数完全相同的编码器 E 和投影头 h,最后读取 [CLS] 得到 z_v。所谓“共享”,不是复制出几台恰好长得一样的网络,而是这些分支引用同一组参数,更新一次便一起改变。

训练让每个局部摘要靠近全局摘要,比较到这里便结束:局部图无需重画全景,前后两个 16 帧窗口也不互相预测,另设 predictor 猜目标表征同样不是这道题。全局视图覆盖更大空间,并且不接受局部视图那样的光度扰动,所以适合做配对参照;它仍然携带梯度,与冻结的教师答案是两回事。SIGReg 同时检查所有摘要的总体分布,防止整批视频最后只剩一张通用卡片。

这个任务鼓励模型忽略裁剪和颜色造成的偶然差别,同时保留跨窗口共享的内容。但若局部窗恰好只剩无关背景,配对信号会变弱;“来自同一时段”是必要条件,不保证每次裁剪都同样有信息。

亲手画一次时间轴

画一条 16 格时间轴,再画两扇窗。让两扇窗在纵向位置和大小上不同,但横向都覆盖同样的第 1–16 格。若把小窗平移到第 9–24 格,请圈出错误:它不再是 LeVJEPA 所要求的同一时间窗口配对。

图和代码从哪里核对

窗框之外,留下这三点

  1. 全局与局部视图必须来自同一个 16 帧时间窗口。
  2. 不同视图共享编码器、投影头与 [CLS] 读出路径。
  3. 全局摘要是有梯度的配对参照,不是教师网络给出的冻结答案。

把窗挪一挪,再判断

  1. 局部视图可以来自同一视频的另一分钟吗?
  2. “共享编码器”意味着什么?
  3. 这一章的任务是否要求重建被裁掉的像素?
核对思路
  1. 不可以;它必须与全局视图共享同一 16 帧窗口。
  2. 所有视图使用同一组可训练参数。
  3. 不要求;损失比较的是 [CLS] 投影后的摘要。