JEPA4Japan · 教程

第 2 章——沿着 Yann LeCun 的科研路线走一遍

1,122字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

从能量模型和自监督学习,走到 2022 年 AMI 架构、JEPA、I-JEPA、V-JEPA、LeJEPA 与 LeVJEPA。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 当前课程
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

从高处看这条路

  1. 2006 能量合不合拍?
  2. 2022 蓝图感知、预测、行动
  3. 2023 图像I-JEPA
  4. 2024–25 视频V-JEPA 系列
  5. 2025–26 精简LeJEPA → LeVJEPA
这不是一条“模型越来越大”的直线,而是一条“怎样在抽象空间学习、预测并最终行动”的问题链。

想象 LeCun 多年来在搭一座会思考的积木城。最早的一块积木是“打分尺”:真实相配的东西给低能量,不相配的给高能量。后来他画出整座城市的蓝图:眼睛负责看,世界模型负责想象,目标与代价告诉系统什么更好,行动模块再作选择。I-JEPA、V-JEPA 等工作是在测试其中的“学会有意义的内部表示”这块地基;它们并不等于整座城市。

五个路标,五个不同问题

2006:能量学习。 **能量函数(energy function)**为输入与候选答案的相容程度打分:低能量表示更匹配,高能量表示更不匹配。这样一来,系统可以直接比较抽象表示,不必总为每个像素建立概率生成模型。

**2022:AMI 路线图。**AMI 指 autonomous machine intelligence,即“自主机器智能”。LeCun 的立场论文把感知、世界模型、短期记忆、actor(动作选择模块)、内在代价与 configurator(按任务调节其他模块的机制)放进一个分层架构,并把 JEPA 作为在表示空间做预测的思路。它提出的是研究蓝图,而非一台已经装好所有模块的单模型。

**2023–2025:从图片走向视频和行动。**I-JEPA 从图像上下文预测被遮目标区域的表示;V-JEPA 把特征预测带到视频;V-JEPA 2 将无动作的大规模视频预训练与后续的动作条件模型 V-JEPA 2-AC 区分开来,后者才把预测接入机器人规划。名称接近,计算图和证据范围却不同。

**2025–2026:把防坍塌写进损失。**LeJEPA v3 论证各向同性高斯目标并提出 SIGReg,以分布约束替代教师—学生等防坍塌结构。LeVJEPA 再把这套目标带到视频:单个共享编码器加小投影头,以不变性和 SIGReg 学表征。其 arXiv v1 于 2026-08-27 发布。

因此,这条路线可概括为:先学会给“相容”打分,再在高层表示里预测,再为无标签图像和视频寻找稳定训练法,最后才可能把表征接到动作条件预测与规划。LeVJEPA 位于“高效视频感知地基”这一站;它的因果注意力不自动补出动作、代价和搜索。

给四张卡排队

给下面四张卡排序:LeJEPA/SIGReg、AMI 蓝图、I-JEPA 图像实验、LeVJEPA 视频精简目标。答案按公开时间是:AMI(2022)→ I-JEPA(2023)→ LeJEPA(2025)→ LeVJEPA(2026)。再在最后一张旁写上“编码器,不是完整 agent”。

沿途的一手路标

走完以后,地图上应留下什么

  1. LeCun 的长期路线是从表征与预测走向能推理和规划的 agent。
  2. JEPA 是蓝图家族名,I-JEPA、V-JEPA、LeJEPA 和 LeVJEPA 是不同实例。
  3. LeVJEPA 目前完成的是视频编码地基;长期愿景里的动作与规划仍在后面的路段。

你站在哪一站?

  1. 2006 年的能量函数在问什么?
  2. 2022 AMI 文档是完整产品说明还是研究蓝图?
  3. V-JEPA 2 的机器人规划能力来自哪一步?
沿时间线核对
  1. 输入与候选答案是否相容。
  2. 是研究蓝图。
  3. 来自后续动作条件训练的 V-JEPA 2-AC,而非仅靠无动作视频编码器。