课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
名字是标签,不是备用零件袋
- 家族名JEPA 是蓝图,不是一套固定零件
- 方法名I、V、Le、LeV 各有边界
- 版本日期不会自动提高证据
- 证据论文、代码、权重、复现分开记
锤子、螺丝刀和电钻都可以属于“木工工具”,却不能因为同属一家,就说锤子里面一定有电池。JEPA 也是一个研究蓝图和方法家族;不同成员会使用不同的编码器、目标分支、预测器、正则化和数据。
最常见的误读往往不是公式算错,而是把 I-JEPA 的 EMA 目标编码器、V-JEPA 的 predictor、V-JEPA 2-AC 的动作模型,一并塞进 LeVJEPA。所以下面每个词除了释义,还配有一条“边界提醒”。
先看铭牌怎么写
- 官方写法是 LeVJEPA;
LEVJEPA、Le-VJEPA和V-JEPA 3都不是论文采用的名称。 - LeJEPA 论文将名称解释为 Latent-Euclidean JEPA;它提供通用目标与 SIGReg。
- LeVJEPA 论文没有给出可自行展开的正式长名。贴近原文的说法是“使用 LeJEPA 目标训练的视频编码器”。
- 这些工作均由多人合作完成。“符合 Yann LeCun 的科研路线”指思想关联,不意味着其余作者只是实现者。
随手可查的术语表
| 术语 | 一句话解释 | 直观类比 | 容易混淆的边界 |
|---|---|---|---|
| JEPA | 在表征空间建立上下文与目标的预测/兼容关系的架构思想 | 猜地图上的意义,不重画每块砖 | 不规定唯一损失或防坍塌配方 |
| I-JEPA | 从图像上下文预测被遮目标块表征的方法 | 看拼图边缘猜中间是什么 | 是静态图像方法,不会规划 |
| V-JEPA | 把潜在特征预测扩展到视频时空块 | 看几帧猜被遮的一段 | 使用 predictor 与 EMA 目标路线,不等于 LeVJEPA |
| V-JEPA 2 | 大规模视频 JEPA 表征模型 | 看过海量录像的观察者 | action-free 预训练本身不控制机器人 |
| V-JEPA 2-AC | 在冻结编码器之上训练动作条件预测器 | 给观察者加一个“如果这样动”沙盘 | 是 V-JEPA 2 的后训练阶段,不是 LeVJEPA 组件 |
| LeJEPA | 将 JEPA 配对目标与 SIGReg 结合的通用精简训练法 | 一边让同题答案接近,一边禁止全班交白卷 | 理论结论带假设,不是视频专属方法 |
| LeVJEPA | 把 LeJEPA 防坍塌目标用于视频编码器的方法 | 从大小窗看同一电影,并写兼容摘要 | 是编码器预训练,不是动作世界模型 |
| LeWorldModel | 用 next-embedding prediction、SIGReg 与动作条件动力学训练控制世界模型 | 真正能试动作的小沙盘 | 与 LeVJEPA 是相邻分支,不能互换名字 |
| self-supervised | 从数据内部构造训练信号 | 视频自己出题、自己给配对 | 不等于没有目标函数,也不等于不需人工选择数据 |
| representation / embedding | 模型为输入写出的数字向量 | 数字地址卡 | 单个维度通常没有人工命名 |
| encoder | 把像素变成 token 和表征的网络 | 读视频并写摘要的人 | LeVJEPA 编码器没有内置分类答案 |
| global view | 同一 clip 的大范围、近完整空间视图 | 大窗 | 仍是裁剪后的训练输入,不等于原视频全貌 |
| local view | 同一时间窗口的小空间裁剪与光度增强 | 小窗 | 不能换成另一个时间段,否则配对语义变了 |
| augmentation | 在不改核心身份的前提下制造视图差异 | 换亮度、裁一角 | 太强会删掉任务所需信息 |
| invariance | 同一 clip 的不同视图应有接近表征 | 从大小窗认出同一场表演 | 单独使用允许常量答案 |
| complete collapse | 所有输入几乎得到同一向量 | 全班都交同一张白纸 | 训练损失低也可能发生 |
| dimensional collapse | 表征只挤在低维子空间 | 256 条街只住一条巷子 | 每个样本不同也可能坍塌 |
| SIGReg | 用随机投影的正态性差异约束嵌入分布 | 从很多方向看城市影子 | 不检查物理意义或动作可控性 |
| isotropic Gaussian | 中心、尺度一致且不偏爱方向的高斯参考 | 没有特权方向的云团 | 不是均匀球面,也不是世界真实拓扑 |
| random projection | 用随机单位向量把高维点映成标量 | 手电筒照出一维影子 | 有限方向只是近似 |
| characteristic function | 用复指数期望唯一描述概率分布的函数 | 分布的频率指纹 | 代码只在有限节点比较 |
| Epps–Pulley statistic | 比较经验特征函数与高斯特征函数的平滑统计量 | 比较两枚指纹 | 训练 loss 不是一次正式的“通过/失败”检验 |
| patch | 一帧中的 16×16 像素块 | 马赛克小砖 | 还不是 transformer token,需先嵌入 |
| token | patch 经线性/卷积映射后的向量 | 写着位置的积木 | 训练时 95% patch token 会被丢弃 |
| tubelet | 在空间 patch 上再跨若干帧聚合 | 把连续几帧同位置装成管 | LeVJEPA 默认 τ=1,不做时间聚合 |
[CLS] | 汇总整段 clip 的可学习 token | 摘要卡 | patch token 不读取 CLS,避免未来回流 |
| projector | 把 CLS 映到 SIGReg 使用的 256 维空间 | 训练专用翻译台 | 预训练后丢弃,不是下游分类头 |
| LayerNorm | 对每个 token 的特征做归一化 | 把每张卡压到受限表面 | 正因约束输出几何,SIGReg 放在 projector 后 |
| RoPE | 在注意力中编码相对时空位置的旋转表示 | 给积木刻上时、行、列坐标 | 不是让模型自动懂因果 |
| block-causal attention | 帧内双向、跨帧只看当前与过去 | 同页互看,不能翻未来页 | CLS 可读全 clip,但 patch 不能读 CLS |
| target encoder | 专门产生训练目标表征的分支 | 另一位出题老师 | LeVJEPA 训练目标里没有它 |
| stop-gradient | 阻止一条分支接受反向梯度 | 单向阀门 | LeVJEPA 的全局和局部分支都反传 |
| predictor | 从上下文表征估计目标表征的网络 | 猜答案的人 | LeVJEPA 无 predictor;相似性由共享编码器直接得到 |
| Polyak/EMA weights | 对训练权重做滑动平均的评估副本 | 记一份平滑成绩单 | 官方实现有它,但它不出题、不参与 loss |
| frozen probe | 冻结编码器,只训练小读出头 | 不改课本,只考能否查到信息 | 可解码不等于编码器主动使用 |
| attentive probe | 用学习查询对 token 做注意力池化再分类 | 学会挑重点的阅卷员 | 比纯线性均值池化更强,分数不可随意横比 |
| epoch | 对定义的数据集走一轮 | 翻完一遍练习册 | 不同方法每个样本的计算成本不同 |
| FLOPs | 浮点运算预算的估计 | 记工作量的工分 | 不等于墙钟时间或耗电量 |
| world model | 预测世界状态如何演化的模型 | 脑内沙盘 | 因果编码器只是可能的地基 |
| MPC | 规划一段、执行少量、重新观察再规划 | 走一步再看地图 | LeVJEPA 本身没有 MPC |
这是一棵树,不是一列版本号
| 时间 | 一手工作 | 它推进了什么 | 它没有证明什么 |
|---|---|---|---|
| 2006 | 能量式学习教程 | 用低能量表示兼容配置、高能量表示不兼容配置 | 不是 JEPA 或视频训练配方 |
| 2022-06-27 | A Path Towards Autonomous Machine Intelligence v0.9.2 | 提出感知、可配置世界模型、代价、Actor、记忆与层次 JEPA 的整体愿景 | 是立场/工作论文,不是完成的 AMI 系统 |
| 2023 | I-JEPA | 在静态图像中预测大目标块的表征 | 不含动作与规划 |
| 2024 | V-JEPA | 把潜在特征预测带到视频时空块 | 仍以短视频表征为主 |
| 2025-06 | V-JEPA 2 / 2-AC | 规模化观察预训练,并另加动作条件后训练和 MPC | 不是通用长期自主智能 |
| 2025-11 | LeJEPA | 用 SIGReg 给 JEPA 一条显式、可扩展的防坍塌路线 | 受假设理论不等于所有任务全局最优 |
| 2026-03 | V-JEPA 2.1 | 沿原 V-JEPA 分支加强密集 token 表征 | 没有改成 LeJEPA/SIGReg 路线 |
| 2026-03 | LeWorldModel | 沿 LeJEPA 分支加入动作条件潜在动力学和规划 | 小规模控制证据不能替代真实世界验证 |
| 2026-08-27 | LeVJEPA v1 | 沿 LeJEPA 分支简化视频编码器预训练,并加入稀疏观察与块因果注意力 | 不是动作预测器或规划系统 |
这不是“旧版自动升级成新版”的单行时间轴。V-JEPA 2.1 继续非对称特征预测路线;LeWorldModel 和 LeVJEPA 都借助 LeJEPA/SIGReg,却分别面向动作动力学与通用视频表征。正确的图更像一棵树。
再给每句话贴上证据标签
| 标签 | 能支持的说法 | 不能自动支持的说法 |
|---|---|---|
| 方法定义 | 论文明确写出某个计算图或目标 | 实现无 bug、效果可复现 |
| 作者报告 | 作者在指定协议下报告结果 | 独立团队也会得到同样数字 |
| 作者代码 | 可检查具体接口和默认配置 | 与论文每项设置完全一致 |
| 公开权重 | 可运行特征提取与下游评估 | 训练过程已被第三方复现 |
| 独立复现 | 第三方在说明的范围内重复结果 | 所有模型、数据与任务都成立 |
| 受假设理论 | 在列明假设下成立的结论 | 不受条件限制的现实保证 |
截至本系列证据截止时间 2026-09-05(Asia/Tokyo),LeVJEPA 仍是刚发布的 v1 预印本,结果应写成“作者报告”;本系列未发现足以把它升级为“独立复现”的公开证据。
家谱的一手档案
主线由 LeCun 2022 AMI 工作论文、I-JEPA CVPR 页面、V-JEPA TMLR/OpenReview、V-JEPA 2 官方论文页、LeJEPA arXiv v3 与 LeVJEPA arXiv v1交叉核对。时间顺序表示公开日期,不表示证据强弱排名。
把标签留在抽屉上
- JEPA 是家族蓝图,具体成员的计算图必须逐篇核对。
- LeVJEPA 没有官方长名称可供自行发挥;它是采用 LeJEPA 目标的视频编码器。
- 时间更新、代码公开和独立复现是三件不同的事。
指出是哪台机器
- 为什么不能把 V-JEPA 的 predictor 画进 LeVJEPA?
- 官方实现有 EMA 权重时,为什么仍可说“没有 EMA 目标编码器”?
- LeVJEPA 与 LeWorldModel 最核心的任务边界是什么?
按计算图核对
- 它们采用不同训练计算图;LeVJEPA 由共享编码器直接对齐全局/局部 CLS,并用 SIGReg 防坍塌。
- 该 EMA 只是保存用于评估的平滑权重,不前向产生目标,也不进入损失。
- 前者学习通用视频表征;后者显式学习动作条件的下一潜在状态,并把它用于规划。