JEPA4Japan · 教程

附录 C——术语表与论文时间线

2,983字 7分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

用一句话、一个类比和一个常见误解解释术语,并记录 JEPA 路线的一手来源和版本。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 当前课程
  4. 34 附录 D——复现与审阅检查清单 已发布

名字是标签,不是备用零件袋

  1. 家族名JEPA 是蓝图,不是一套固定零件
  2. 方法名I、V、Le、LeV 各有边界
  3. 版本日期不会自动提高证据
  4. 证据论文、代码、权重、复现分开记
术语表不是背单词比赛;它的作用是阻止一个名字偷偷带入另一篇论文的计算图。

锤子、螺丝刀和电钻都可以属于“木工工具”,却不能因为同属一家,就说锤子里面一定有电池。JEPA 也是一个研究蓝图和方法家族;不同成员会使用不同的编码器、目标分支、预测器、正则化和数据。

最常见的误读往往不是公式算错,而是把 I-JEPA 的 EMA 目标编码器、V-JEPA 的 predictor、V-JEPA 2-AC 的动作模型,一并塞进 LeVJEPA。所以下面每个词除了释义,还配有一条“边界提醒”。

先看铭牌怎么写

  • 官方写法是 LeVJEPA;LEVJEPA、Le-VJEPA 和 V-JEPA 3 都不是论文采用的名称。
  • LeJEPA 论文将名称解释为 Latent-Euclidean JEPA;它提供通用目标与 SIGReg。
  • LeVJEPA 论文没有给出可自行展开的正式长名。贴近原文的说法是“使用 LeJEPA 目标训练的视频编码器”。
  • 这些工作均由多人合作完成。“符合 Yann LeCun 的科研路线”指思想关联,不意味着其余作者只是实现者。

随手可查的术语表

术语一句话解释直观类比容易混淆的边界
JEPA在表征空间建立上下文与目标的预测/兼容关系的架构思想猜地图上的意义,不重画每块砖不规定唯一损失或防坍塌配方
I-JEPA从图像上下文预测被遮目标块表征的方法看拼图边缘猜中间是什么是静态图像方法,不会规划
V-JEPA把潜在特征预测扩展到视频时空块看几帧猜被遮的一段使用 predictor 与 EMA 目标路线,不等于 LeVJEPA
V-JEPA 2大规模视频 JEPA 表征模型看过海量录像的观察者action-free 预训练本身不控制机器人
V-JEPA 2-AC在冻结编码器之上训练动作条件预测器给观察者加一个“如果这样动”沙盘是 V-JEPA 2 的后训练阶段,不是 LeVJEPA 组件
LeJEPA将 JEPA 配对目标与 SIGReg 结合的通用精简训练法一边让同题答案接近,一边禁止全班交白卷理论结论带假设,不是视频专属方法
LeVJEPA把 LeJEPA 防坍塌目标用于视频编码器的方法从大小窗看同一电影,并写兼容摘要是编码器预训练,不是动作世界模型
LeWorldModel用 next-embedding prediction、SIGReg 与动作条件动力学训练控制世界模型真正能试动作的小沙盘与 LeVJEPA 是相邻分支,不能互换名字
self-supervised从数据内部构造训练信号视频自己出题、自己给配对不等于没有目标函数,也不等于不需人工选择数据
representation / embedding模型为输入写出的数字向量数字地址卡单个维度通常没有人工命名
encoder把像素变成 token 和表征的网络读视频并写摘要的人LeVJEPA 编码器没有内置分类答案
global view同一 clip 的大范围、近完整空间视图大窗仍是裁剪后的训练输入,不等于原视频全貌
local view同一时间窗口的小空间裁剪与光度增强小窗不能换成另一个时间段,否则配对语义变了
augmentation在不改核心身份的前提下制造视图差异换亮度、裁一角太强会删掉任务所需信息
invariance同一 clip 的不同视图应有接近表征从大小窗认出同一场表演单独使用允许常量答案
complete collapse所有输入几乎得到同一向量全班都交同一张白纸训练损失低也可能发生
dimensional collapse表征只挤在低维子空间256 条街只住一条巷子每个样本不同也可能坍塌
SIGReg用随机投影的正态性差异约束嵌入分布从很多方向看城市影子不检查物理意义或动作可控性
isotropic Gaussian中心、尺度一致且不偏爱方向的高斯参考没有特权方向的云团不是均匀球面,也不是世界真实拓扑
random projection用随机单位向量把高维点映成标量手电筒照出一维影子有限方向只是近似
characteristic function用复指数期望唯一描述概率分布的函数分布的频率指纹代码只在有限节点比较
Epps–Pulley statistic比较经验特征函数与高斯特征函数的平滑统计量比较两枚指纹训练 loss 不是一次正式的“通过/失败”检验
patch一帧中的 16×16 像素块马赛克小砖还不是 transformer token,需先嵌入
tokenpatch 经线性/卷积映射后的向量写着位置的积木训练时 95% patch token 会被丢弃
tubelet在空间 patch 上再跨若干帧聚合把连续几帧同位置装成管LeVJEPA 默认 τ=1,不做时间聚合
[CLS]汇总整段 clip 的可学习 token摘要卡patch token 不读取 CLS,避免未来回流
projector把 CLS 映到 SIGReg 使用的 256 维空间训练专用翻译台预训练后丢弃,不是下游分类头
LayerNorm对每个 token 的特征做归一化把每张卡压到受限表面正因约束输出几何,SIGReg 放在 projector 后
RoPE在注意力中编码相对时空位置的旋转表示给积木刻上时、行、列坐标不是让模型自动懂因果
block-causal attention帧内双向、跨帧只看当前与过去同页互看,不能翻未来页CLS 可读全 clip,但 patch 不能读 CLS
target encoder专门产生训练目标表征的分支另一位出题老师LeVJEPA 训练目标里没有它
stop-gradient阻止一条分支接受反向梯度单向阀门LeVJEPA 的全局和局部分支都反传
predictor从上下文表征估计目标表征的网络猜答案的人LeVJEPA 无 predictor;相似性由共享编码器直接得到
Polyak/EMA weights对训练权重做滑动平均的评估副本记一份平滑成绩单官方实现有它,但它不出题、不参与 loss
frozen probe冻结编码器,只训练小读出头不改课本,只考能否查到信息可解码不等于编码器主动使用
attentive probe用学习查询对 token 做注意力池化再分类学会挑重点的阅卷员比纯线性均值池化更强,分数不可随意横比
epoch对定义的数据集走一轮翻完一遍练习册不同方法每个样本的计算成本不同
FLOPs浮点运算预算的估计记工作量的工分不等于墙钟时间或耗电量
world model预测世界状态如何演化的模型脑内沙盘因果编码器只是可能的地基
MPC规划一段、执行少量、重新观察再规划走一步再看地图LeVJEPA 本身没有 MPC

这是一棵树,不是一列版本号

时间一手工作它推进了什么它没有证明什么
2006能量式学习教程用低能量表示兼容配置、高能量表示不兼容配置不是 JEPA 或视频训练配方
2022-06-27A Path Towards Autonomous Machine Intelligence v0.9.2提出感知、可配置世界模型、代价、Actor、记忆与层次 JEPA 的整体愿景是立场/工作论文,不是完成的 AMI 系统
2023I-JEPA在静态图像中预测大目标块的表征不含动作与规划
2024V-JEPA把潜在特征预测带到视频时空块仍以短视频表征为主
2025-06V-JEPA 2 / 2-AC规模化观察预训练,并另加动作条件后训练和 MPC不是通用长期自主智能
2025-11LeJEPA用 SIGReg 给 JEPA 一条显式、可扩展的防坍塌路线受假设理论不等于所有任务全局最优
2026-03V-JEPA 2.1沿原 V-JEPA 分支加强密集 token 表征没有改成 LeJEPA/SIGReg 路线
2026-03LeWorldModel沿 LeJEPA 分支加入动作条件潜在动力学和规划小规模控制证据不能替代真实世界验证
2026-08-27LeVJEPA v1沿 LeJEPA 分支简化视频编码器预训练,并加入稀疏观察与块因果注意力不是动作预测器或规划系统

这不是“旧版自动升级成新版”的单行时间轴。V-JEPA 2.1 继续非对称特征预测路线;LeWorldModel 和 LeVJEPA 都借助 LeJEPA/SIGReg,却分别面向动作动力学与通用视频表征。正确的图更像一棵树。

再给每句话贴上证据标签

标签能支持的说法不能自动支持的说法
方法定义论文明确写出某个计算图或目标实现无 bug、效果可复现
作者报告作者在指定协议下报告结果独立团队也会得到同样数字
作者代码可检查具体接口和默认配置与论文每项设置完全一致
公开权重可运行特征提取与下游评估训练过程已被第三方复现
独立复现第三方在说明的范围内重复结果所有模型、数据与任务都成立
受假设理论在列明假设下成立的结论不受条件限制的现实保证

截至本系列证据截止时间 2026-09-05(Asia/Tokyo),LeVJEPA 仍是刚发布的 v1 预印本,结果应写成“作者报告”;本系列未发现足以把它升级为“独立复现”的公开证据。

家谱的一手档案

主线由 LeCun 2022 AMI 工作论文、I-JEPA CVPR 页面、V-JEPA TMLR/OpenReview、V-JEPA 2 官方论文页、LeJEPA arXiv v3 与 LeVJEPA arXiv v1交叉核对。时间顺序表示公开日期,不表示证据强弱排名。

把标签留在抽屉上

  1. JEPA 是家族蓝图,具体成员的计算图必须逐篇核对。
  2. LeVJEPA 没有官方长名称可供自行发挥;它是采用 LeJEPA 目标的视频编码器。
  3. 时间更新、代码公开和独立复现是三件不同的事。

指出是哪台机器

  1. 为什么不能把 V-JEPA 的 predictor 画进 LeVJEPA?
  2. 官方实现有 EMA 权重时,为什么仍可说“没有 EMA 目标编码器”?
  3. LeVJEPA 与 LeWorldModel 最核心的任务边界是什么?
按计算图核对
  1. 它们采用不同训练计算图;LeVJEPA 由共享编码器直接对齐全局/局部 CLS,并用 SIGReg 防坍塌。
  2. 该 EMA 只是保存用于评估的平滑权重,不前向产生目标,也不进入损失。
  3. 前者学习通用视频表征;后者显式学习动作条件的下一潜在状态,并把它用于规划。