JEPA4Japan · 教程

第 0 章——开始之前:这门课承诺什么

1,053字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

确认论文版本、证据截止时间、三条阅读路线和最终能够解释、运行与质疑的内容。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 当前课程
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

先把整台机器摊在桌上

  1. 看同一片一大窗,几小窗
  2. 写摘要共享一台编码器
  3. 同片靠近意思保持一致
  4. 保留差别别把万物写成同一句
这门课讲怎样从无标签视频学到有用的内部表示;机器人驾驶还需要另一整套零件。

拿一本没有片名的短视频相册。老师不给“猫”“汽车”这样的答案,只把同一段视频从一扇大窗和几扇小窗里各放一遍,请孩子写几张摘要卡。同一段视频的卡片理应相近。可要是每张都写“有东西”,卡片虽然一致,也就什么都没说。

LeVJEPA 就在解决这两个相反要求:**同一片要认得出来,所有片又不能被写成同一个答案。**前者由不变性损失负责,后者由 SIGReg 负责。后面的章节会逐个拆开这些新词。

机器里究竟装了什么

本系列以 LeVJEPA arXiv v1 为基准。它在 2026-08-27 发布,截至本章日期仍是预印本——也就是公开供同行阅读、尚未完成正式同行评审的论文版本。训练时,一段 16 帧视频产生一个全局视图和若干局部视图;它们共享同一段时间,只在空间裁剪和外观增强上变化。所有视图经过同一个可训练编码器和同一个小投影头,损失读取各自的 [CLS] 摘要 token(可训练的整段视频摘要位)。

先把三条边界画清,后面就不容易把相似的模型混在一起:

  • 目标函数由共享编码器分支构成,全局和局部分支都接收梯度;target encoder、predictor 和 stop-gradient 不在这张训练图中。
  • 官方训练另行维护编码器的 Polyak/EMA 参数副本并保存为评估检查点。它只为评估提供较平滑的权重,不生成训练目标,也不扮演教师网络。
  • 训练得到的是视频编码器。动作条件动力学、代价函数和搜索器仍需另建,所以“可作为世界模型地基”是研究方向,还不是一套已经能规划的系统。

所谓“只有一个目标权重”,特指总损失里固定为 λ = 0.02 的权衡系数;数据、优化器和模型结构照样有各自配置。教程会先建立直觉,再看公式、张量、代码和实验。实验结果一律注明“作者报告”,因为公开代码和权重证明的是材料可查,并不能替代一次独立复现。

两分钟贴便签

把下面四张便签分到“训练目标里”和“训练目标外”:共享编码器、SIGReg、EMA 评估副本、动作规划器。正确分法是:前两张在目标里;EMA 只服务评估;规划器根本不属于 LeVJEPA。

查证入口

合上这一页前

  1. LeVJEPA v1 是 2026-08-27 发布的视频表征预训练方法。
  2. 它用共享编码器、共享投影头和 [CLS],目标里没有教师、预测器或停梯度。
  3. 评估用 EMA 不等于 EMA 教师;编码器也不等于规划器。

现在能说清吗?

  1. 这门课所说的“两股力”分别是什么?
  2. EMA 参数副本会不会给训练分支制造目标?
  3. 拿到 LeVJEPA 编码器后,能否不加任何模块就让机器人规划?
答案与理由
  1. 同片视图靠近的不变性损失,以及防止表征坍塌的 SIGReg。
  2. 不会;它只作为评估检查点。
  3. 不能;还缺动作条件预测、目标或代价、搜索与闭环控制。