课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
圈数和油钱是两本账
- 同跑圈数epoch matched
- 油耗不同每样本 FLOPs
- 同给预算FLOP matched
- 省油多跑1085 epochs
两辆校车,两种公平
两辆校车都绕城市 240 圈,一辆每圈烧一桶油,另一辆烧八桶。它们路程相同,花费不相同。若改成各给同样多的油,省油车便能多绕很多圈。比较视频预训练也是如此:epoch 记录数据被走过几轮,FLOPs 记录计算账单,两者回答的是不同问题。
先写清楚固定了什么
粗略地说,总训练计算约等于“样本次数 × 每样本计算”。LeVJEPA 在训练期只编码稀疏 token,而且没有 target-encoder 与 predictor 前向,所以每个样本较便宜。
| 协议 | 固定项 | 允许变化 | 论文 v1 的确切设置 |
|---|---|---|---|
| epoch-matched | 相同数据、epoch、有效 batch、评估协议 | 总 FLOPs | 20% K710,240 epochs,batch 3072;基线用官方实现和推荐超参重训 |
| FLOP-matched | 相同数据、模型规模、总预训练 FLOPs、冻结评估 | epoch 与视图预算 | ViT-B、20% K710;LeVJEPA 获得 1085 epochs,V=10 |
在 epoch-matched 图中,作者报告 LeVJEPA 对 V-JEPA 2 的计算优势随规模为 5.6–20.8×。ViT-B 两者精度相差不足 1 点,但总计算是 4.8 对 36.4 ExaFLOPs;ViT-L 则以 5.6× 更少计算高 1.9 点。这回答“看同样 240 轮,谁更省”。
在 FLOP-matched 表中,省下的单样本计算被换成更长训练,LeVJEPA 用 1085 epochs 与 10 个 local view;作者报告 IN1K 61.0、SSv2 40.4、K400 44.6。这回答“花同样账单,谁学得更好”。1085 epochs 之所以可行,正是因为每次样本展示较便宜;更多的数据展示次数本身也是协议的一部分。
还要把官方仓库默认单独放置:它是 Walking Tours、26 epochs、V=10、约 10k optimizer steps、有效 batch 3072。它借用了核心架构配方,但既非 20% K710 的 240-epoch 对照,也非 1085-epoch FLOP-match。训练 dropping 也不推出推理变快 20×:评估时恢复全部 token,块因果缓存才是另一项可能的流式收益。
两个 7.6,别拿错单位
计算 36.4 ÷ 4.8 ≈ 7.6:这是 ViT-B epoch-matched 的计算比。FLOP-matched 表里也有一个 7.6,但单位是 LeVJEPA 在 IN1K 领先最佳基线的百分点。给实验卡写齐数据、epoch、总 FLOPs 和 probe,两个同名数字就不会串账。
计算账从哪里来
- LeVJEPA arXiv v1:epoch-matched 与 FLOP-matched 协议
- 官方项目页:两种预算及 1085 epochs
- 官方配置快照:Walking Tours 的 26-epoch 默认
合上账本之前
- 同 epoch 是相同数据轮数,不是相同计算账单。
- 同 FLOPs 下,LeVJEPA 的低单步成本换来了 1085 epochs 与
V=10。 - 仓库 26-epoch Walking Tours 默认有自己的数据与时长,是第三种协议。
帮三张收据归档
- 240 epochs、batch 3072 属于哪种比较?
- FLOP-matched 的 LeVJEPA 训练多少 epochs?
- 95% 训练 dropping 是否意味着评估只读 5% token?
查看答案
- epoch-matched。
- 1085 epochs,并使用
V=10。 - 不意味着;评估和推理读取完整 token 集。