课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
先把数字留在账本里
- 抄数字先别下结论
- 贴协议数据、预算
- 贴探针冻结怎么读
- 贴来源作者报告
- 才可引用边界一起带走
三个响亮数字,没有一张收据
三个人分别喊出“61.0”“20.8 倍”“69.5”,却没人说考了什么。翻开账本,为每个数字留出四栏:训练数据、计算预算、评估探针和报告者。四栏补齐以后,数字才有可以解释的含义。
先盖上“作者报告”这枚章
下列全部是 LeVJEPA arXiv v1(2026-08-27)的作者报告预印本结果,本教程没有独立重跑这些大型训练,公开 checkpoint 也只是作者发布的产物。每张表的协议不同;若把各表最高值剪下来拼在一起,得到的模型其实从未运行过。
账一:相同数据轮数,计算花费不同
所有方法由作者用官方实现和推荐超参,在相同 20% K710 上重训 240 epochs、有效 batch 3072,并在评估端匹配 token 数。
| 模型规模 | 作者报告的 LeVJEPA 对 V-JEPA 2 结论 | 随数字同行的条件 |
|---|---|---|
| ViT-S | 总预训练计算低 20.8×,精度可比或更高 | epoch-matched,不是 FLOP-matched |
| ViT-B | 4.8 vs 36.4 ExaFLOPs,精度差不足 1 点 | 相同 240 epochs 与数据 |
| ViT-L | 计算低 **5.6×**且 IN1K 高 1.9 点 | 同一受控语境;LeVJEPA-L 计算还少于 V-JEPA 2-S 的一半 |
所以“5.6–20.8×”是跨 S/B/L 的总预训练计算优势范围,不是速度、显存或所有任务准确率的倍数。
账二:相同总 FLOPs
这里固定 ViT-B、20% K710 和总预训练计算。较低单样本成本让 LeVJEPA 训练 1085 epochs、V=10。IN1K 与 SSv2 是 frozen attentive-probe top-1;K400 是冻结 token 均值池化后的 linear-probe top-1。
| 方法 | IN1K | SSv2 | K400 |
|---|---|---|---|
| VideoMAEv2 | 53.4 | 43.6 | 37.4 |
| V-JEPA 2 | 51.6 | 42.5 | 40.7 |
| LeVJEPA | 61.0 | 40.4 | 44.6 |
因此 61.0 比该表下一高的 53.4 高 7.6 个百分点,K400 也最高;SSv2 则比最佳 43.6 低 3.2 点。“保持运动竞争力”比“运动全面最好”准确。
账三:视频预训练对图像预训练
作者用相同源视频帧、相同总 FLOPs 比较 ViT-B。DINOv2 依官方实现对单帧训练,共 11.7M frame samples、11,400 optimizer steps;LeVJEPA 是 240-epoch 设置。两者均用 frozen attentive probe。
| 方法 | IN1K | SSv2 |
|---|---|---|
| DINOv2 | 53.8 | 16.9 |
| LeVJEPA | 50.7 | 30.4 |
这里的直接读法是:DINOv2 的 IN1K 高 3.1 点,LeVJEPA 的 SSv2 约为其 1.8 倍。两种方法各赢一张卷子,而两张卷子本身也覆盖不了一般世界理解。
账四:消费级与 VideoMix 扩展
| 实验 | 配方 | 作者报告 | 结论边界 |
|---|---|---|---|
| 消费级 | ViT-Tiny;单 RTX 5080 16GB;12 小时;8 段 Walking Tours,约 620k 帧、处理约 5M clips | 冻结 IN1K 从初始化 8.9 → 25.2;batch 128 用不到 8GB,同尺寸 V-JEPA 在 batch 28 已占满 | 这是可行性示例,不是与集群实验等价的 SOTA 比较 |
| VideoMix | ViT-L/16;100 epochs;K710 + SSv2 + Walking Tours + PE-Video;模型卡记载 1,806,869 clips | arXiv v1、仓库 README 与模型卡均记 IN1K 69.5、SSv2 55.0,frozen attentive probe | 数据更多且混合,无法与 20% K710 表作单变量归因 |
这里还有一张勘误卡:截至 2026-09-05,官方项目页正文显示 67.5/55.0,与 arXiv v1、官方仓库 README 和模型卡的 69.5/55.0 不一致。本系列锚定 arXiv v1,因此正文采用 69.5,同时把冲突留在账本上。
论文还展示了 patch PCA 与查询相似度的定性结果;它们说明值得研究的语义/空间组织,不属于分割、跟踪的量化成绩。所有账目也都不包含动作条件预测或规划实验。
给 61.0 补齐八格收据
试着给“LeVJEPA 得到 61.0”补齐收据:作者报告;arXiv v1;ViT-B;20% K710;相同总 FLOPs;1085 epochs;V=10;IN1K frozen attentive probe top-1。少了其中一格,61.0 指向的就可能是另一项实验。
四本账的原始记录
- LeVJEPA arXiv v1:比较表与扩展实验
- 官方项目页:实验表及当前 67.5 文本
- 官方仓库 README 快照:69.5/55.0、消费级与默认配方
- 冻结 VideoMix 模型版本:1,806,869 clips 与发布权重
合上账本时留下什么
- 所有结果是预印本作者报告;本教程没有宣称独立复现。
- 61.0/40.4/44.6 属于 FLOP-matched 表,69.5/55.0 属于更大 VideoMix 的 ViT-L。
- 最强外观或 K400 结果不等于最强 SSv2,更不等于已经会规划。
看数字能否对上收据
- 61.0、40.4、44.6 是否来自同一种 probe?
- 69.5/55.0 使用的是 20% K710 单一数据吗?
- 本教程能否把这些表称为自己的独立复现?
查看答案
- 不是;前两项用 attentive probe,K400 用均值池化 linear probe。
- 不是;来自 K710、SSv2、Walking Tours、PE-Video 的 VideoMix。
- 不能;它们是 arXiv v1 的作者报告。