JEPA4Japan · 教程

第 3 章——别被名字绕晕:JEPA 家族树

1,101字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

区分 JEPA 蓝图、I-JEPA、V-JEPA、V-JEPA 2、LeJEPA、LeVJEPA 与 LeWorldModel 的计算图和用途。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 当前课程

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

同姓,并不共用一套零件

  1. JEPA共同蓝图
  2. I-JEPA图像块预测
  3. V-JEPA视频特征预测
  4. LeJEPASIGReg 防坍塌
  5. LeVJEPA精简视频编码
姓氏相同不代表零件相同;判断一个模型,要看输入、预测对象、梯度和用途。

工作台上摆着拼图板、录像机、整理卡和路线沙盘,标签里都写着“JEPA”。光看姓氏,很容易拿整理卡去开车。认清它们有个朴素办法:依次问吃什么、比较什么、哪些零件参与训练、成品能做什么。四个问题比死记缩写可靠。

按计算图来认亲

**JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)**是一类思想:在学习得到的表示空间中,根据一部分信息约束或预测另一部分信息。这个家族名本身并不指定某一种编码器、遮罩或防坍塌办法。

I-JEPA 面向静态图像:上下文编码器与 predictor 根据可见上下文,预测由目标编码器产生的若干图像块表示。V-JEPA 面向视频:上下文编码器和 predictor 预测被遮时空区域的目标表示,并用 EMA target encoder 与 stop-gradient 构成非对称训练图。V-JEPA 2 扩大视频预训练;它的动作less 编码器/预测器与后来用机器人轨迹训练的 V-JEPA 2-AC 应分开,规划证据属于后者的动作条件预测与 MPC 链路。

LeJEPA 里的 “Le” 并非 “large”。论文将它展开为 Latent-Euclidean JEPA(潜在欧氏 JEPA),同时用 lean(精简)形容这套配方。它把同源视图的表示匹配与 SIGReg 组合,用显式分布约束排除坍塌,因此省去了教师—学生式的不对称结构。LeVJEPA 把这条精简目标用于视频:全局和局部视图都通过同一个 encoder(编码器)与 projector(投影头),比较 [CLS] 嵌入。target encoder、predictor、stop-gradient 和 masked-token reconstruction 都不参与这项目标。训练代码维护的 EMA 编码器只供评估检查点使用,应画在目标分支之外。

**LeWorldModel(LeWM)**则把视觉表征接到动作条件潜在动力学和规划循环。它回答“采取动作后会怎样”,LeVJEPA 回答“怎样把当前视频编码得有用”。二者可以衔接,却不是简单的版本升级关系。因果视频 encoder 只保证某帧表征不读取未来帧;动作条件模型和规划回路仍是另外的组件。

用计算图检查名字最稳妥:若图里有被遮目标 token、predictor 和 EMA 教师,更像 V-JEPA;若只有共享 encoder/projector、同片 [CLS] 匹配与 SIGReg,才是本系列的 LeVJEPA。

修一张贴错标签的图

有人画出“在线编码器 → predictor → 停梯度 EMA 教师”,标题却写 LeVJEPA。请改图:删掉 predictor 和目标分支,让所有视图进入同一 encoder/projector;从 [CLS] 计算不变性与 SIGReg;把 EMA 移到图外并标注“evaluation checkpoint only”。

家谱原件

三张不会再贴错的标签

  1. JEPA 是表示空间预测的蓝图,不是一张固定计算图。
  2. LeVJEPA 的训练目标只有共享 encoder/projector 分支、[CLS] 匹配与 SIGReg。
  3. V-JEPA 2-AC 或 LeWM 的规划链路不能算到 LeVJEPA 头上。

看名字,也看零件

  1. LeJEPA 的 “Le” 是不是 “large”?
  2. LeVJEPA 训练图里有没有 predictor?
  3. 块因果注意力是否足以让编码器成为规划器?
展开核对
  1. 不是。论文将 LeJEPA 展开为 Latent-Euclidean JEPA;“lean”是对配方精简性的描述。
  2. 没有。
  3. 不足;规划还需要动作条件动力学、目标或代价以及搜索与控制。