JEPA4Japan · 教程

第 20 章——哪些结论现在还不能说

1,413字 4分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

标记预印本、作者报告、未独立复现、有限规模、运动短板、密集任务空白与理论近似。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 当前课程

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

纸船能漂多远,证据说了算

  1. 可以说协议内观察
  2. 要带条件作者报告
  3. 证据到此下一段还没测
  4. 继续验证复现与新任务
好研究不是把句子写大,而是让每句话刚好装得下它的证据。

从浴缸到太平洋差哪些证据

一艘纸船在浴缸里漂得很好,直接结论是“它在这缸水、这份载重下漂起来了”。横渡太平洋还多出风浪、距离和耐久性,这些条件并未出现在浴缸实验里。写清水温、载重和实验者,读者自然知道证据走到了哪里,下一步该测什么。

把一句话缩到实验大小

截至 2026-09-05,LeVJEPA 仍是 arXiv v1,代码和权重也来自作者团队。下面左栏是直接证据,右栏则列出尚未做过、却常被一句话跨过去的实验。

主题现有证据直接支持仍缺少的证据
发表状态“arXiv v1 作者报告”“已经同行评审确认”或“已被独立复现”
简化训练图目标中无 target encoder、predictor、stop-gradient;EMA 只作评估权重“完全没有 EMA”或把评估 EMA 画成训练教师
计算效率20% K710、240 epochs 下,作者报告相对 V-JEPA 2 为 5.6–20.8× 更少总预训练 FLOPs“所有硬件都快 20.8×”“推理也省同样倍数”
因果注意力指定 IN1K frozen probe 中 block causal 为 51.2、full 为 50.7;patch 不读未来“所有任务无损”“模型因此懂因果或已经会规划”
运动能力FLOP-match 的 SSv2 为 40.4,接近但低于最佳 43.6;长训练缓解高 dropping 的损失“运动指标全面第一”
密集特征若干 PCA/余弦相似度图显示语义与空间组织“分割、检测、跟踪已经验证”;论文明确说尚未评估分割/跟踪
数据/规模受控实验到 ViT-L、受限 K710;另有 1.806M-clip VideoMix 扩展“已证明 internet-scale 或更大 batch/model 同样成立”
世界模型因果 encoder 可作为流式感知、未来世界模型的地基“LeVJEPA 是动作条件世界模型、控制器或规划器”

三个容易漏掉的细边界

**理论边界。**论文援引 LeJEPA 在其假设下关于各向同性高斯与防坍塌的结论;实际 SIGReg 每步用有限随机投影和数值积分近似。官方设置为 1024 个方向、区间 [0,3] 上 17 个节点。因此直接结论是“这是有理论动机的防坍塌目标”;有限 batch 是否精确高斯,仍受样本、方向和积分节点近似影响。

**配方边界。**论文受控默认是 20% K710、V=4;epoch-match 是 240 epochs/batch 3072,FLOP-match 的 LeVJEPA 才是 1085 epochs/V=10。仓库默认是 Walking Tours、26 epochs/V=10。三者的数据、时长或预算不同,各自对应一张独立收据。

**版本边界。**arXiv v1、仓库 README 和模型卡给 VideoMix 的 IN1K 为 69.5,项目页当前正文为 67.5。本系列既然锚定 v1,就报告 69.5 并注明冲突;未来修订应同时保存版本、commit 和访问日期。

论文自己列出的空白决定了下一步实验:短 schedule 下激进 dropping 会损失运动线索;保留时间对应关系的高稀疏采样仍待研究;超越受限语料和 ViT-L 的行为、大模型/大 batch 下 SIGReg 的相互作用尚未知;密集下游任务没有量化评估。公开 checkpoint 证明文件可取用;独立复现还需要第三方重建训练与评估协议。

把一条广告改回研究句

把这句宣传语改成研究句:“LeVJEPA 证明视频模型能无损理解因果并规划。”一种合格改写是:“作者在 arXiv v1 的指定 IN1K 冻结探针中观察到块因果 encoder 不低于 full attention;该模型未训练动作条件动力学或规划器,规划用途仍是未来方向。”

给边界画线的材料

让结论停在岸边

  1. 这是一组作者报告的预印本结果,不是本教程的独立复现,也不是同行评审定论。
  2. 因果 patch 表征不是因果理解,更不是动作预测、控制或规划。
  3. 运动、internet-scale、超大模型/batch 和密集任务仍有明确证据空白。

看看纸船有没有被写成轮船

  1. 下载到公开权重是否等于复现了预训练结果?
  2. block-causal encoder 是否已经包含动作条件 predictor?
  3. patch PCA 清晰时,能否宣称跟踪任务已通过?
查看答案
  1. 不等于;取用作者权重与独立重训、核验曲线是两件事。
  2. 不包含;LeVJEPA 没有动作输入、动力学预测器或规划器。
  3. 不能;论文只有定性结构,尚未评估分割与跟踪。