JEPA4Japan · 教程

第 29 章——十个从入门到论文级的研究项目

1,894字 5分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

围绕运动友好采样、流式缓存、SIGReg、密集任务、数据缩放、世界模型接口与可复现性提出可执行课题。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 当前课程

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

先给点子画一条终点线

  1. 问题只问一件事
  2. 最小基线先画起跑线
  3. 指标预先写怎么算
  4. 证伪条件怎样算想法失败
  5. 资源账时间、卡数、数据
好课题会提前写明怎样算赢,也允许点子干干净净地输。

“试十种聪明改法,留下跑得最快的一个”还算不上研究计划。动代码前,先写清要和哪双旧鞋比、跑哪条路、计时几次、预算是多少;再写一句,出现什么结果就放弃这个想法。有了这条终点线,随手试验才变成可解释的实验。

下面十题由小到大排列,全部是提议项目,不是 LeVJEPA v1 已报告结果。资源级别:S = CPU 或单张消费 GPU 数小时;M = 单 GPU 约 1–3 天;L = 4–8 GPU 多日;XL = 受控论文规模或机器人设施。

十张项目卡

1. 因果 mask 单元测试库(S)

  • **问题:**各种 T、分辨率和随机 keep-set 下是否都无未来泄漏?
  • **最小基线:**冻结 build_block_causal_mask;整前缀重算作为真值。
  • **指标:**早期 patch 最大绝对差、随机 100 例通过率。
  • **证伪条件:**只改未来便令任一过去 patch 差值超过预设 1e-5,或 patch 可读取 [CLS]。

2. 真正的流式 KV cache(键值缓存,M)

  • **问题:**缓存过去能否保持数值等价并降低延迟?
  • **最小基线:**每来一帧便重编码完整 16 帧前缀。
  • **指标:**token cosine/最大误差、首帧与增量延迟、峰值显存。
  • **证伪条件:**输出超容差,或同硬件长序列吞吐与显存均无改善。公开代码当前没有成品 cache,因此实现本身也是贡献。

3. SIGReg 有限近似预算(M)

  • **问题:**默认 1,024 projections、17 knots 是否可以更省?
  • **最小基线:**冻结配置的 num_proj=1024, knots=17, λ=.02;只改一项。
  • **指标:**每步时间、embedding 均值/协方差谱、held-out 随机投影检验、冻结 probe。
  • **证伪条件:**省下的计算不足 10%,或 probe/谱稳定性超出预注册容差。有限随机投影只是可计算检验,不能把一次低 loss 当“证明全分布为高斯”。

4. 运动友好的 95% dropping(L)

  • **问题:**成对保留跨帧位置或光流引导采样,能否保住运动线索?
  • **最小基线:**95% uniform random dropping,并加入无 dropping 上界;总 FLOPs 对齐。
  • **指标:**SSv2 与 K400 frozen probe、ImageNet、总 FLOPs、每秒 clips。
  • **证伪条件:**多 seed 下 SSv2 无显著增益,或提升来自更多 token/计算且 ImageNet 明显退化。

5. 同时间窗口到底多重要(M)

  • **问题:**local view 偏移 1、2、4 帧会学到更强运动,还是破坏同义性?
  • **最小基线:**官方 global/local 共用完全相同 16 帧窗口。
  • **指标:**不变性/SIGReg、时间顺序识别、SSv2 probe 与静态 ImageNet probe。
  • **证伪条件:**时间任务无提升,或表示坍塌、外观能力下降超过预注册阈值。不要把偏移实验仍称为官方 LeVJEPA 目标。

6. 无密集监督的 patch 到底会什么(M)

  • **问题:**仅 [CLS] 受监督后,patch 是否足够做分割或跟踪?
  • **最小基线:**冻结发布 encoder;比较随机初始化同架构与简单颜色/光流特征。
  • **指标:**线性分割 mIoU、DAVIS J&F 或点跟踪误差,外加 query-patch 可视化。
  • **证伪条件:**定量指标不胜简单基线,或只在挑选的漂亮样例有效。论文明确把 dense task 评估列为未完成方向。

7. 数据多样性还是数据时长(L)

  • **问题:**固定 clip 数与 FLOPs 时,多来源短片是否优于少数小时级漫步?
  • **最小基线:**Walking Tours-only;构造相同 1.8M 或更小、但可负担的 balanced mixture。
  • **指标:**IN1K/SSv2/K400 frozen probes、跨域检索、重复帧率和训练吞吐。
  • **证伪条件:**混合数据优势在严格去重或 matched-FLOP 后消失。记录许可与采样权重,不能把公开默认误写成 VideoMix 配方。

8. 小领域继续预训练是否值得(M)

  • **问题:**在医疗、工业或运动相机视频上继续 LeVJEPA 训练,是否优于直接冻结迁移?
  • **最小基线:**发布 ViT-L 冻结 probe;再加从随机初始化训练作为成本基线。
  • **指标:**领域 probe、原通用 probe 保留率、embedding 谱、GPU-hours。
  • **证伪条件:**领域提升未超过 seed 方差,或通用能力灾难性遗忘;敏感数据还需先通过治理审查。

9. 动作是否真的进入潜在动力学(L)

  • **问题:**冻结 LeVJEPA 后的小 predictor 会利用动作,而非只复制视频惯性吗?
  • **最小基线:**copy-last、去掉动作、打乱动作三组;相同离线轨迹训练。
  • **指标:**one/multi-step latent error、动作反事实可分性、校准误差。
  • **证伪条件:**真实动作模型不胜去动作/乱动作基线,或 horizon 增长立即发散。此项目新增 action-conditioned predictor,不是 LeVJEPA 原生结果。

10. 从表征到闭环 MPC 的预注册复现(XL)

  • **问题:**LeVJEPA 表征能否在固定模拟任务中提高样本效率或规划成功率?
  • **最小基线:**相同 predictor、数据、CEM 候选数和 horizon 下,比较 random encoder、copy dynamics,以及一个公开视觉 encoder;先在模拟器,不直接上实体机器人。
  • **指标:**50+ episodes 的成功率与置信区间、碰撞/约束违反、规划秒/动作、GPU-hours、五个 seed。
  • **证伪条件:**成功率区间不优于最强基线,动作搜索对模型替换不敏感,或收益以显著更多规划计算换取。安全门通过后才考虑实体实验。

上游 paper.md 的 Push-T 表仍是 TODO。第 9、10 题必须从零生成自己的协议与结果,不能填一个想象数字进空表。每个项目都应保存冻结提交、解析后 Hydra 配置、数据清单、seed、硬件、原始日志和失败运行;只报最好一次就失去证伪意义。

十张卡背后的原始记录

实验本扉页上的三行字

  1. 每个课题都要同时写最小基线、指标、失败条件和资源预算。
  2. matched epochs、matched samples 与 matched FLOPs 回答不同问题,不能混账。
  3. 世界模型和 Push-T 项目是待验证提案;LeVJEPA v1 没有可引用的规划成功率。

这项实验可以批准吗?

  1. 为什么研究计划必须提前写证伪条件?
  2. motion-aware dropping 若用了更多 token,能否直接与 95% random 比精度?
  3. 上游 Push-T 空表能否作为 baseline 数字来源?
批准前的核对结果
  1. 防止看到结果后移动目标,让负结果也有信息。
  2. 不能;至少要对齐总 FLOPs,或明确画出精度—计算曲线。
  3. 不能;它有 TODO,没有完整实验结果与协议。