课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
同姓,并不共用一套零件
- JEPA共同蓝图
- I-JEPA图像块预测
- V-JEPA视频特征预测
- LeJEPASIGReg 防坍塌
- LeVJEPA精简视频编码
工作台上摆着拼图板、录像机、整理卡和路线沙盘,标签里都写着“JEPA”。光看姓氏,很容易拿整理卡去开车。认清它们有个朴素办法:依次问吃什么、比较什么、哪些零件参与训练、成品能做什么。四个问题比死记缩写可靠。
按计算图来认亲
**JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)**是一类思想:在学习得到的表示空间中,根据一部分信息约束或预测另一部分信息。这个家族名本身并不指定某一种编码器、遮罩或防坍塌办法。
I-JEPA 面向静态图像:上下文编码器与 predictor 根据可见上下文,预测由目标编码器产生的若干图像块表示。V-JEPA 面向视频:上下文编码器和 predictor 预测被遮时空区域的目标表示,并用 EMA target encoder 与 stop-gradient 构成非对称训练图。V-JEPA 2 扩大视频预训练;它的动作less 编码器/预测器与后来用机器人轨迹训练的 V-JEPA 2-AC 应分开,规划证据属于后者的动作条件预测与 MPC 链路。
LeJEPA 里的 “Le” 并非 “large”。论文将它展开为 Latent-Euclidean JEPA(潜在欧氏 JEPA),同时用 lean(精简)形容这套配方。它把同源视图的表示匹配与 SIGReg 组合,用显式分布约束排除坍塌,因此省去了教师—学生式的不对称结构。LeVJEPA 把这条精简目标用于视频:全局和局部视图都通过同一个 encoder(编码器)与 projector(投影头),比较 [CLS] 嵌入。target encoder、predictor、stop-gradient 和 masked-token reconstruction 都不参与这项目标。训练代码维护的 EMA 编码器只供评估检查点使用,应画在目标分支之外。
**LeWorldModel(LeWM)**则把视觉表征接到动作条件潜在动力学和规划循环。它回答“采取动作后会怎样”,LeVJEPA 回答“怎样把当前视频编码得有用”。二者可以衔接,却不是简单的版本升级关系。因果视频 encoder 只保证某帧表征不读取未来帧;动作条件模型和规划回路仍是另外的组件。
用计算图检查名字最稳妥:若图里有被遮目标 token、predictor 和 EMA 教师,更像 V-JEPA;若只有共享 encoder/projector、同片 [CLS] 匹配与 SIGReg,才是本系列的 LeVJEPA。
修一张贴错标签的图
有人画出“在线编码器 → predictor → 停梯度 EMA 教师”,标题却写 LeVJEPA。请改图:删掉 predictor 和目标分支,让所有视图进入同一 encoder/projector;从 [CLS] 计算不变性与 SIGReg;把 EMA 移到图外并标注“evaluation checkpoint only”。
家谱原件
- I-JEPA 论文与 Meta 研究页
- V-JEPA 论文与 Meta 研究页
- V-JEPA 2 论文与 Meta 官方项目页
- LeJEPA arXiv v3
- LeVJEPA arXiv v1 与 官方仓库快照
- LeWorldModel arXiv v3
三张不会再贴错的标签
- JEPA 是表示空间预测的蓝图,不是一张固定计算图。
- LeVJEPA 的训练目标只有共享 encoder/projector 分支、
[CLS]匹配与 SIGReg。 - V-JEPA 2-AC 或 LeWM 的规划链路不能算到 LeVJEPA 头上。
看名字,也看零件
- LeJEPA 的 “Le” 是不是 “large”?
- LeVJEPA 训练图里有没有 predictor?
- 块因果注意力是否足以让编码器成为规划器?
展开核对
- 不是。论文将 LeJEPA 展开为 Latent-Euclidean JEPA;“lean”是对配方精简性的描述。
- 没有。
- 不足;规划还需要动作条件动力学、目标或代价以及搜索与控制。