JEPA4Japan · 教程
所有教程

课程

LeVJEPA:让视频自己教会模型

沿着 Yann LeCun 的 JEPA 路线,用直观图解、必要的数学和可复现实验,读懂单编码器、SIGReg、随机丢 token 与块因果注意力。

模块
7 模块
课
34 课
预计时长
预计 18 小时
适合
适合: 第一次接触自监督视频学习的读者,以及希望核对论文、代码、训练配方和证据边界的工程师与研究者。
从第 1 课开始

先看一张五格地图

  1. 同片多窗一扇大窗,几扇小窗
  2. 共享读者一台编码器写摘要
  3. 拉近同一段视频应该相像
  4. 撑开SIGReg 让点云保持舒展
  5. 稀疏守时丢 95%,也不偷看未来
LeVJEPA 没有靠堆叠分支取胜。它给一台编码器两条清楚的学习规则:同片同义,同时保留差别。

想象一个孩子从两扇窗看同一场街头表演:一扇窗很大,另一扇只露出鼓手的手。孩子应当知道它们属于同一段故事;但如果他给所有表演都写成“东西在动”,答案就失去了用途。

LeVJEPA 用不变性损失让同一视频的全局与局部摘要靠近,再用 SIGReg(速写式各向同性高斯正则化)阻止所有摘要挤成一个点。训练时只保留少量随机视频 token,并让每一帧只读取现在和过去。计算图很短,容易漏看的条件却不少;这套教程会把它们放回数据、模型、损失和证据各自的位置。

按你的目的选路

四本账,读到数字时别丢

  1. **名称账。**LeVJEPA 是 2026 年的视频表征方法,与 LeJEPA、V-JEPA 2、LeWorldModel 各有不同计算图。
  2. **零件账。**训练目标由共享 encoder/projector 构成;Polyak/EMA 权重位于目标图外,只作为评估检查点。target encoder、predictor 和 stop-gradient 属于别的配方。
  3. 数字账。“更省”“更准”只有连同数据集、模型大小、训练轮数或 FLOP 预算、探针协议一起写,才是一条完整结论。
  4. **边界账。**因果视频编码器可以成为流式感知和世界模型的地基;要走到行动规划,还需动作条件预测器、代价函数和规划器。

开课前,先分一次零件

把 共享编码器、SIGReg、EMA 评估副本、动作规划器 写在四张纸上,分成“LeVJEPA 训练目标内”“实现里但目标外”“尚需另建”三堆。

核对分法
  • **目标内:**共享编码器、SIGReg。
  • **实现里但目标外:**EMA 评估副本。
  • **尚需另建:**动作规划器。

证据更新到哪一天

本系列以 2026-09-05(Asia/Tokyo) 为证据截止时间。核心事实来自 LeVJEPA arXiv v1、官方项目页、官方仓库固定快照 3ea0dda 与 固定版本的公开模型卡;SIGReg 的理论背景按 LeJEPA arXiv v3 核对。LeVJEPA 论文发布于 2026-08-27,在截止日仍是预印本。系列中的实验数字均标作作者报告;公开代码与权重让复查成为可能,但还不能充当独立复现。

课程进度

课程大纲

已发布 34/34 课

第 0 部分——先拿到地图

先辨认 LeVJEPA 的名字、任务边界与历史位置,再选择适合自己的阅读路线。

  1. 01 第 0 章——开始之前:这门课承诺什么 确认论文版本、证据截止时间、三条阅读路线和最终能够解释、运行与质疑的内容。 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 用一个孩子看街景的故事,建立全局视图、局部视图、相同时间窗口与共同表征的第一直觉。 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 从能量模型和自监督学习,走到 2022 年 AMI 架构、JEPA、I-JEPA、V-JEPA、LeJEPA 与 LeVJEPA。 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 区分 JEPA 蓝图、I-JEPA、V-JEPA、V-JEPA 2、LeJEPA、LeVJEPA 与 LeWorldModel 的计算图和用途。 已发布

第 1 部分——为什么简单目标会学会看视频

从无标签学习、表征预测与坍塌问题出发,建立 LeVJEPA 两项损失之间的张力。

  1. 05 第 4 章——视频可以自己出题 理解无标签视频如何提供同一物体、动作与时间连续性的监督信号,以及它不能自动保证什么。 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 比较像素重建、特征预测与视图不变性,弄清 LeVJEPA 实际预测了什么、没有预测什么。 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 理解不变性目标为何有用,又为何会允许常量输出和维度坍塌。 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 用随机一维投影、特征函数和高斯参考,直观理解 LeJEPA 带来的防坍塌机制。 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 拆开不变性损失与 SIGReg,解释唯一目标权重 λ=0.02、双向梯度和理论结论的适用边界。 已发布

第 2 部分——把一段视频送进单编码器

沿着真实张量和计算图,走过多视图、token、ViT、投影头、稀疏观察与因果注意力。

  1. 10 第 9 章——全局视图与局部视图怎样配对 构造一个 224 像素全局视图与多个 96 像素局部视图,并守住相同 16 帧时间窗口。 已发布
  2. 11 第 10 章——把视频切成时空小方块 跟踪 16 帧视频经过 16×16 patch、逐帧 tubelet 与位置编码后得到的 token 数量和形状。 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 理解共享 ViT、[CLS] 与两层 projector 的分工,以及 LayerNorm 为什么让投影空间成为必要接口。 已发布
  4. 13 第 12 章——一次完整前向传播 从一个批次追踪全局和局部视图、拼接嵌入、两项损失、梯度流与训练后丢弃的组件。 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 区分随机 token dropping 与结构化 tube mask,并同时理解计算节省、数据增强和动作线索损失。 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 读懂帧内双向、帧间因果、[CLS] 特例与无未来泄漏的注意力拓扑。 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 理解三维旋转位置、tubelet=1 的意义,以及只有 [CLS] 监督时 patch 表征为何仍值得检查。 已发布

第 3 部分——会读实验,才算读懂论文

把消融、预算、公平比较、探针和作者报告拆开,避免被一个漂亮数字带走。

  1. 17 第 16 章——四组消融究竟回答了什么 逐项读懂丢弃率、随机与管状模式、局部视图数量、tubelet 和注意力拓扑的受控比较。 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 区分 epoch-matched 与 FLOP-matched,理解为什么高效方法能在同一预算里看更多批次。 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 理解外观、动作与运动基准,以及冻结编码器、线性探针和 attentive probe 的证据范围。 已发布
  4. 20 第 19 章——把论文结果记成一本账 核对 5.6–20.8×、61.0、40.4、44.6、69.5 与 55.0 等数字对应的模型、数据和预算。 已发布
  5. 21 第 20 章——哪些结论现在还不能说 标记预印本、作者报告、未独立复现、有限规模、运动短板、密集任务空白与理论近似。 已发布

第 4 部分——从官方仓库到自己的实验

先用公开权重确认接口,再按资源逐级进入数据、训练、诊断与自定义评估。

  1. 22 第 21 章——官方仓库地图 定位 main.py、module.py、data/loader.py、Hydra 配置、两个 notebook、许可证与固定代码快照。 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 理解下载、15 fps 抽帧、Lance 存储、episode 边界、随机 clip 与数据成本。 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 区分论文比较配方与公开仓库默认配方,逐项解释 batch、学习率、warmup、EMA 检查点和命令行覆盖。 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 设计小批次过拟合、双视图一致性、SIGReg 统计、因果泄漏与内存检查,并定位常见故障。 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 安全使用 Hugging Face 权重、正确归一化和张量布局,并避免改错注意力模式或误认分类输出。 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 建立线性探针、attentive probe、检索与密集特征检查,并使用防止数据泄漏的切分。 已发布

第 5 部分——把表征接回世界模型路线

把 LeVJEPA 放回 LeCun 的长期目标中,分清已经完成的编码器与仍需构建的预测、行动和规划模块。

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 区分视频编码、动作条件动力学、代价、搜索与闭环控制,避免把因果注意力写成因果世界模型。 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 以明确的新增模块连接动作预测器、潜在滚动、不确定性、层次时间尺度与 MPC,并设计逐层证伪。 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 围绕运动友好采样、流式缓存、SIGReg、密集任务、数据缩放、世界模型接口与可复现性提出可执行课题。 已发布

附录——随用随查的技术背包

把数学、形状、术语、历史版本和复现凭据放在主学习路线旁边。

  1. 31 附录 A——最低限度数学工具箱 复习向量、MSE、高斯、随机投影、特征函数、Cramér–Wold、FLOPs 与梯度。 已发布
  2. 32 附录 B——完整张量形状表 从 [B,T,C,H,W] 到全局/局部视图、稀疏 token、[CLS]、projector 与 SIGReg 输入逐项核对。 已发布
  3. 33 附录 C——术语表与论文时间线 用一句话、一个类比和一个常见误解解释术语,并记录 JEPA 路线的一手来源和版本。 已发布
  4. 34 附录 D——复现与审阅检查清单 保存代码哈希、环境、数据、预算、随机种子、指标、失败案例、许可证和主张等级。 已发布