JEPA4Japan · 教程

第 19 章——把论文结果记成一本账

1,398字 4分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

核对 5.6–20.8×、61.0、40.4、44.6、69.5 与 55.0 等数字对应的模型、数据和预算。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 当前课程
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

先把数字留在账本里

  1. 抄数字先别下结论
  2. 贴协议数据、预算
  3. 贴探针冻结怎么读
  4. 贴来源作者报告
  5. 才可引用边界一起带走
单独的 61.0 没有意义;“谁、在哪些数据、花多少计算、用什么探针得到 61.0”才是一条完整收据。

三个响亮数字,没有一张收据

三个人分别喊出“61.0”“20.8 倍”“69.5”,却没人说考了什么。翻开账本,为每个数字留出四栏:训练数据、计算预算、评估探针和报告者。四栏补齐以后,数字才有可以解释的含义。

先盖上“作者报告”这枚章

下列全部是 LeVJEPA arXiv v1(2026-08-27)的作者报告预印本结果,本教程没有独立重跑这些大型训练,公开 checkpoint 也只是作者发布的产物。每张表的协议不同;若把各表最高值剪下来拼在一起,得到的模型其实从未运行过。

账一:相同数据轮数,计算花费不同

所有方法由作者用官方实现和推荐超参,在相同 20% K710 上重训 240 epochs、有效 batch 3072,并在评估端匹配 token 数。

模型规模作者报告的 LeVJEPA 对 V-JEPA 2 结论随数字同行的条件
ViT-S总预训练计算低 20.8×,精度可比或更高epoch-matched,不是 FLOP-matched
ViT-B4.8 vs 36.4 ExaFLOPs,精度差不足 1 点相同 240 epochs 与数据
ViT-L计算低 **5.6×**且 IN1K 高 1.9 点同一受控语境;LeVJEPA-L 计算还少于 V-JEPA 2-S 的一半

所以“5.6–20.8×”是跨 S/B/L 的总预训练计算优势范围,不是速度、显存或所有任务准确率的倍数。

账二:相同总 FLOPs

这里固定 ViT-B、20% K710 和总预训练计算。较低单样本成本让 LeVJEPA 训练 1085 epochs、V=10。IN1K 与 SSv2 是 frozen attentive-probe top-1;K400 是冻结 token 均值池化后的 linear-probe top-1。

方法IN1KSSv2K400
VideoMAEv253.443.637.4
V-JEPA 251.642.540.7
LeVJEPA61.040.444.6

因此 61.0 比该表下一高的 53.4 高 7.6 个百分点,K400 也最高;SSv2 则比最佳 43.6 低 3.2 点。“保持运动竞争力”比“运动全面最好”准确。

账三:视频预训练对图像预训练

作者用相同源视频帧、相同总 FLOPs 比较 ViT-B。DINOv2 依官方实现对单帧训练,共 11.7M frame samples、11,400 optimizer steps;LeVJEPA 是 240-epoch 设置。两者均用 frozen attentive probe。

方法IN1KSSv2
DINOv253.816.9
LeVJEPA50.730.4

这里的直接读法是:DINOv2 的 IN1K 高 3.1 点,LeVJEPA 的 SSv2 约为其 1.8 倍。两种方法各赢一张卷子,而两张卷子本身也覆盖不了一般世界理解。

账四:消费级与 VideoMix 扩展

实验配方作者报告结论边界
消费级ViT-Tiny;单 RTX 5080 16GB;12 小时;8 段 Walking Tours,约 620k 帧、处理约 5M clips冻结 IN1K 从初始化 8.9 → 25.2;batch 128 用不到 8GB,同尺寸 V-JEPA 在 batch 28 已占满这是可行性示例,不是与集群实验等价的 SOTA 比较
VideoMixViT-L/16;100 epochs;K710 + SSv2 + Walking Tours + PE-Video;模型卡记载 1,806,869 clipsarXiv v1、仓库 README 与模型卡均记 IN1K 69.5、SSv2 55.0,frozen attentive probe数据更多且混合,无法与 20% K710 表作单变量归因

这里还有一张勘误卡:截至 2026-09-05,官方项目页正文显示 67.5/55.0,与 arXiv v1、官方仓库 README 和模型卡的 69.5/55.0 不一致。本系列锚定 arXiv v1,因此正文采用 69.5,同时把冲突留在账本上。

论文还展示了 patch PCA 与查询相似度的定性结果;它们说明值得研究的语义/空间组织,不属于分割、跟踪的量化成绩。所有账目也都不包含动作条件预测或规划实验。

给 61.0 补齐八格收据

试着给“LeVJEPA 得到 61.0”补齐收据:作者报告;arXiv v1;ViT-B;20% K710;相同总 FLOPs;1085 epochs;V=10;IN1K frozen attentive probe top-1。少了其中一格,61.0 指向的就可能是另一项实验。

四本账的原始记录

合上账本时留下什么

  1. 所有结果是预印本作者报告;本教程没有宣称独立复现。
  2. 61.0/40.4/44.6 属于 FLOP-matched 表,69.5/55.0 属于更大 VideoMix 的 ViT-L。
  3. 最强外观或 K400 结果不等于最强 SSv2,更不等于已经会规划。

看数字能否对上收据

  1. 61.0、40.4、44.6 是否来自同一种 probe?
  2. 69.5/55.0 使用的是 20% K710 单一数据吗?
  3. 本教程能否把这些表称为自己的独立复现?
查看答案
  1. 不是;前两项用 attentive probe,K400 用均值池化 linear probe。
  2. 不是;来自 K710、SSv2、Walking Tours、PE-Video 的 VideoMix。
  3. 不能;它们是 arXiv v1 的作者报告。