课程
LeVJEPA:让视频自己教会模型
沿着 Yann LeCun 的 JEPA 路线,用直观图解、必要的数学和可复现实验,读懂单编码器、SIGReg、随机丢 token 与块因果注意力。
- 模块
- 7 模块
- 课
- 34 课
- 预计时长
- 预计 18 小时
- 适合
- 适合: 第一次接触自监督视频学习的读者,以及希望核对论文、代码、训练配方和证据边界的工程师与研究者。
先看一张五格地图
- 同片多窗一扇大窗,几扇小窗
- 共享读者一台编码器写摘要
- 拉近同一段视频应该相像
- 撑开SIGReg 让点云保持舒展
- 稀疏守时丢 95%,也不偷看未来
想象一个孩子从两扇窗看同一场街头表演:一扇窗很大,另一扇只露出鼓手的手。孩子应当知道它们属于同一段故事;但如果他给所有表演都写成“东西在动”,答案就失去了用途。
LeVJEPA 用不变性损失让同一视频的全局与局部摘要靠近,再用 SIGReg(速写式各向同性高斯正则化)阻止所有摘要挤成一个点。训练时只保留少量随机视频 token,并让每一帧只读取现在和过去。计算图很短,容易漏看的条件却不少;这套教程会把它们放回数据、模型、损失和证据各自的位置。
按你的目的选路
- **只想听懂:**读第 0–8、13–14、19–20、27 章。你会得到完整直觉与证据边界。
- **准备动手:**继续读第 9–15、21–26 章,再用附录 B、D 做逐项核对。
- **准备研究:**完整阅读,并把第 16–20 章的公平比较方法带进第 28–29 章。
四本账,读到数字时别丢
- **名称账。**LeVJEPA 是 2026 年的视频表征方法,与 LeJEPA、V-JEPA 2、LeWorldModel 各有不同计算图。
- **零件账。**训练目标由共享 encoder/projector 构成;Polyak/EMA 权重位于目标图外,只作为评估检查点。target encoder、predictor 和 stop-gradient 属于别的配方。
- 数字账。“更省”“更准”只有连同数据集、模型大小、训练轮数或 FLOP 预算、探针协议一起写,才是一条完整结论。
- **边界账。**因果视频编码器可以成为流式感知和世界模型的地基;要走到行动规划,还需动作条件预测器、代价函数和规划器。
开课前,先分一次零件
把 共享编码器、SIGReg、EMA 评估副本、动作规划器 写在四张纸上,分成“LeVJEPA 训练目标内”“实现里但目标外”“尚需另建”三堆。
核对分法
- **目标内:**共享编码器、SIGReg。
- **实现里但目标外:**EMA 评估副本。
- **尚需另建:**动作规划器。
证据更新到哪一天
本系列以 2026-09-05(Asia/Tokyo) 为证据截止时间。核心事实来自 LeVJEPA arXiv v1、官方项目页、官方仓库固定快照 3ea0dda 与 固定版本的公开模型卡;SIGReg 的理论背景按 LeJEPA arXiv v3 核对。LeVJEPA 论文发布于 2026-08-27,在截止日仍是预印本。系列中的实验数字均标作作者报告;公开代码与权重让复查成为可能,但还不能充当独立复现。
课程进度
课程大纲
第 0 部分——先拿到地图
先辨认 LeVJEPA 的名字、任务边界与历史位置,再选择适合自己的阅读路线。
- 01 第 0 章——开始之前:这门课承诺什么 确认论文版本、证据截止时间、三条阅读路线和最终能够解释、运行与质疑的内容。 已发布
- 02 第 1 章——同一段视频,两扇不同的窗 用一个孩子看街景的故事,建立全局视图、局部视图、相同时间窗口与共同表征的第一直觉。 已发布
- 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 从能量模型和自监督学习,走到 2022 年 AMI 架构、JEPA、I-JEPA、V-JEPA、LeJEPA 与 LeVJEPA。 已发布
- 04 第 3 章——别被名字绕晕:JEPA 家族树 区分 JEPA 蓝图、I-JEPA、V-JEPA、V-JEPA 2、LeJEPA、LeVJEPA 与 LeWorldModel 的计算图和用途。 已发布
第 1 部分——为什么简单目标会学会看视频
从无标签学习、表征预测与坍塌问题出发,建立 LeVJEPA 两项损失之间的张力。
- 05 第 4 章——视频可以自己出题 理解无标签视频如何提供同一物体、动作与时间连续性的监督信号,以及它不能自动保证什么。 已发布
- 06 第 5 章——保留意思,不重画每个像素 比较像素重建、特征预测与视图不变性,弄清 LeVJEPA 实际预测了什么、没有预测什么。 已发布
- 07 第 6 章——两张卡要相同,但不能全变成白纸 理解不变性目标为何有用,又为何会允许常量输出和维度坍塌。 已发布
- 08 第 7 章——SIGReg:从许多影子检查一团点云 用随机一维投影、特征函数和高斯参考,直观理解 LeJEPA 带来的防坍塌机制。 已发布
- 09 第 8 章——只用一行目标函数读懂 LeVJEPA 拆开不变性损失与 SIGReg,解释唯一目标权重 λ=0.02、双向梯度和理论结论的适用边界。 已发布
第 2 部分——把一段视频送进单编码器
沿着真实张量和计算图,走过多视图、token、ViT、投影头、稀疏观察与因果注意力。
- 10 第 9 章——全局视图与局部视图怎样配对 构造一个 224 像素全局视图与多个 96 像素局部视图,并守住相同 16 帧时间窗口。 已发布
- 11 第 10 章——把视频切成时空小方块 跟踪 16 帧视频经过 16×16 patch、逐帧 tubelet 与位置编码后得到的 token 数量和形状。 已发布
- 12 第 11 章——一台编码器、一个投影头、一张摘要卡 理解共享 ViT、[CLS] 与两层 projector 的分工,以及 LayerNorm 为什么让投影空间成为必要接口。 已发布
- 13 第 12 章——一次完整前向传播 从一个批次追踪全局和局部视图、拼接嵌入、两项损失、梯度流与训练后丢弃的组件。 已发布
- 14 第 13 章——为什么扔掉 95% 反而更会看 区分随机 token dropping 与结构化 tube mask,并同时理解计算节省、数据增强和动作线索损失。 已发布
- 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 读懂帧内双向、帧间因果、[CLS] 特例与无未来泄漏的注意力拓扑。 已发布
- 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 理解三维旋转位置、tubelet=1 的意义,以及只有 [CLS] 监督时 patch 表征为何仍值得检查。 已发布
第 3 部分——会读实验,才算读懂论文
把消融、预算、公平比较、探针和作者报告拆开,避免被一个漂亮数字带走。
- 17 第 16 章——四组消融究竟回答了什么 逐项读懂丢弃率、随机与管状模式、局部视图数量、tubelet 和注意力拓扑的受控比较。 已发布
- 18 第 17 章——相同轮数不等于相同花费 区分 epoch-matched 与 FLOP-matched,理解为什么高效方法能在同一预算里看更多批次。 已发布
- 19 第 18 章——ImageNet、K400、SSv2 各考什么 理解外观、动作与运动基准,以及冻结编码器、线性探针和 attentive probe 的证据范围。 已发布
- 20 第 19 章——把论文结果记成一本账 核对 5.6–20.8×、61.0、40.4、44.6、69.5 与 55.0 等数字对应的模型、数据和预算。 已发布
- 21 第 20 章——哪些结论现在还不能说 标记预印本、作者报告、未独立复现、有限规模、运动短板、密集任务空白与理论近似。 已发布
第 4 部分——从官方仓库到自己的实验
先用公开权重确认接口,再按资源逐级进入数据、训练、诊断与自定义评估。
- 22 第 21 章——官方仓库地图 定位 main.py、module.py、data/loader.py、Hydra 配置、两个 notebook、许可证与固定代码快照。 已发布
- 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 理解下载、15 fps 抽帧、Lance 存储、episode 边界、随机 clip 与数据成本。 已发布
- 24 第 23 章——读懂默认配置并启动训练 区分论文比较配方与公开仓库默认配方,逐项解释 batch、学习率、warmup、EMA 检查点和命令行覆盖。 已发布
- 25 第 24 章——先跑一个不会骗人的冒烟测试 设计小批次过拟合、双视图一致性、SIGReg 统计、因果泄漏与内存检查,并定位常见故障。 已发布
- 26 第 25 章——不用训练:加载公开权重提取特征 安全使用 Hugging Face 权重、正确归一化和张量布局,并避免改错注意力模式或误认分类输出。 已发布
- 27 第 26 章——在自己的视频上做冻结评估 建立线性探针、attentive probe、检索与密集特征检查,并使用防止数据泄漏的切分。 已发布
第 5 部分——把表征接回世界模型路线
把 LeVJEPA 放回 LeCun 的长期目标中,分清已经完成的编码器与仍需构建的预测、行动和规划模块。
附录——随用随查的技术背包
把数学、形状、术语、历史版本和复现凭据放在主学习路线旁边。