JEPA4Japan · 教程

第 17 章——相同轮数不等于相同花费

901字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

区分 epoch-matched 与 FLOP-matched,理解为什么高效方法能在同一预算里看更多批次。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 当前课程
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

圈数和油钱是两本账

  1. 同跑圈数epoch matched
  2. 油耗不同每样本 FLOPs
  3. 同给预算FLOP matched
  4. 省油多跑1085 epochs
相同 epoch 控制“看过多少轮数据”;相同 FLOPs 控制“总共花了多少计算”。两问都重要,答案却不同。

两辆校车,两种公平

两辆校车都绕城市 240 圈,一辆每圈烧一桶油,另一辆烧八桶。它们路程相同,花费不相同。若改成各给同样多的油,省油车便能多绕很多圈。比较视频预训练也是如此:epoch 记录数据被走过几轮,FLOPs 记录计算账单,两者回答的是不同问题。

先写清楚固定了什么

粗略地说,总训练计算约等于“样本次数 × 每样本计算”。LeVJEPA 在训练期只编码稀疏 token,而且没有 target-encoder 与 predictor 前向,所以每个样本较便宜。

协议固定项允许变化论文 v1 的确切设置
epoch-matched相同数据、epoch、有效 batch、评估协议总 FLOPs20% K710,240 epochs,batch 3072;基线用官方实现和推荐超参重训
FLOP-matched相同数据、模型规模、总预训练 FLOPs、冻结评估epoch 与视图预算ViT-B、20% K710;LeVJEPA 获得 1085 epochs,V=10

在 epoch-matched 图中,作者报告 LeVJEPA 对 V-JEPA 2 的计算优势随规模为 5.6–20.8×。ViT-B 两者精度相差不足 1 点,但总计算是 4.8 对 36.4 ExaFLOPs;ViT-L 则以 5.6× 更少计算高 1.9 点。这回答“看同样 240 轮,谁更省”。

在 FLOP-matched 表中,省下的单样本计算被换成更长训练,LeVJEPA 用 1085 epochs 与 10 个 local view;作者报告 IN1K 61.0、SSv2 40.4、K400 44.6。这回答“花同样账单,谁学得更好”。1085 epochs 之所以可行,正是因为每次样本展示较便宜;更多的数据展示次数本身也是协议的一部分。

还要把官方仓库默认单独放置:它是 Walking Tours、26 epochs、V=10、约 10k optimizer steps、有效 batch 3072。它借用了核心架构配方,但既非 20% K710 的 240-epoch 对照,也非 1085-epoch FLOP-match。训练 dropping 也不推出推理变快 20×:评估时恢复全部 token,块因果缓存才是另一项可能的流式收益。

两个 7.6,别拿错单位

计算 36.4 ÷ 4.8 ≈ 7.6:这是 ViT-B epoch-matched 的计算比。FLOP-matched 表里也有一个 7.6,但单位是 LeVJEPA 在 IN1K 领先最佳基线的百分点。给实验卡写齐数据、epoch、总 FLOPs 和 probe,两个同名数字就不会串账。

计算账从哪里来

合上账本之前

  1. 同 epoch 是相同数据轮数,不是相同计算账单。
  2. 同 FLOPs 下,LeVJEPA 的低单步成本换来了 1085 epochs 与 V=10。
  3. 仓库 26-epoch Walking Tours 默认有自己的数据与时长,是第三种协议。

帮三张收据归档

  1. 240 epochs、batch 3072 属于哪种比较?
  2. FLOP-matched 的 LeVJEPA 训练多少 epochs?
  3. 95% 训练 dropping 是否意味着评估只读 5% token?
查看答案
  1. epoch-matched。
  2. 1085 epochs,并使用 V=10。
  3. 不意味着;评估和推理读取完整 token 集。