课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
先给点子画一条终点线
- 问题只问一件事
- 最小基线先画起跑线
- 指标预先写怎么算
- 证伪条件怎样算想法失败
- 资源账时间、卡数、数据
“试十种聪明改法,留下跑得最快的一个”还算不上研究计划。动代码前,先写清要和哪双旧鞋比、跑哪条路、计时几次、预算是多少;再写一句,出现什么结果就放弃这个想法。有了这条终点线,随手试验才变成可解释的实验。
下面十题由小到大排列,全部是提议项目,不是 LeVJEPA v1 已报告结果。资源级别:S = CPU 或单张消费 GPU 数小时;M = 单 GPU 约 1–3 天;L = 4–8 GPU 多日;XL = 受控论文规模或机器人设施。
十张项目卡
1. 因果 mask 单元测试库(S)
- **问题:**各种 T、分辨率和随机 keep-set 下是否都无未来泄漏?
- **最小基线:**冻结
build_block_causal_mask;整前缀重算作为真值。 - **指标:**早期 patch 最大绝对差、随机 100 例通过率。
- **证伪条件:**只改未来便令任一过去 patch 差值超过预设
1e-5,或 patch 可读取[CLS]。
2. 真正的流式 KV cache(键值缓存,M)
- **问题:**缓存过去能否保持数值等价并降低延迟?
- **最小基线:**每来一帧便重编码完整 16 帧前缀。
- **指标:**token cosine/最大误差、首帧与增量延迟、峰值显存。
- **证伪条件:**输出超容差,或同硬件长序列吞吐与显存均无改善。公开代码当前没有成品 cache,因此实现本身也是贡献。
3. SIGReg 有限近似预算(M)
- **问题:**默认 1,024 projections、17 knots 是否可以更省?
- **最小基线:**冻结配置的
num_proj=1024, knots=17, λ=.02;只改一项。 - **指标:**每步时间、embedding 均值/协方差谱、held-out 随机投影检验、冻结 probe。
- **证伪条件:**省下的计算不足 10%,或 probe/谱稳定性超出预注册容差。有限随机投影只是可计算检验,不能把一次低 loss 当“证明全分布为高斯”。
4. 运动友好的 95% dropping(L)
- **问题:**成对保留跨帧位置或光流引导采样,能否保住运动线索?
- **最小基线:**95% uniform random dropping,并加入无 dropping 上界;总 FLOPs 对齐。
- **指标:**SSv2 与 K400 frozen probe、ImageNet、总 FLOPs、每秒 clips。
- **证伪条件:**多 seed 下 SSv2 无显著增益,或提升来自更多 token/计算且 ImageNet 明显退化。
5. 同时间窗口到底多重要(M)
- **问题:**local view 偏移 1、2、4 帧会学到更强运动,还是破坏同义性?
- **最小基线:**官方 global/local 共用完全相同 16 帧窗口。
- **指标:**不变性/SIGReg、时间顺序识别、SSv2 probe 与静态 ImageNet probe。
- **证伪条件:**时间任务无提升,或表示坍塌、外观能力下降超过预注册阈值。不要把偏移实验仍称为官方 LeVJEPA 目标。
6. 无密集监督的 patch 到底会什么(M)
- **问题:**仅
[CLS]受监督后,patch 是否足够做分割或跟踪? - **最小基线:**冻结发布 encoder;比较随机初始化同架构与简单颜色/光流特征。
- **指标:**线性分割 mIoU、DAVIS J&F 或点跟踪误差,外加 query-patch 可视化。
- **证伪条件:**定量指标不胜简单基线,或只在挑选的漂亮样例有效。论文明确把 dense task 评估列为未完成方向。
7. 数据多样性还是数据时长(L)
- **问题:**固定 clip 数与 FLOPs 时,多来源短片是否优于少数小时级漫步?
- **最小基线:**Walking Tours-only;构造相同 1.8M 或更小、但可负担的 balanced mixture。
- **指标:**IN1K/SSv2/K400 frozen probes、跨域检索、重复帧率和训练吞吐。
- **证伪条件:**混合数据优势在严格去重或 matched-FLOP 后消失。记录许可与采样权重,不能把公开默认误写成 VideoMix 配方。
8. 小领域继续预训练是否值得(M)
- **问题:**在医疗、工业或运动相机视频上继续 LeVJEPA 训练,是否优于直接冻结迁移?
- **最小基线:**发布 ViT-L 冻结 probe;再加从随机初始化训练作为成本基线。
- **指标:**领域 probe、原通用 probe 保留率、embedding 谱、GPU-hours。
- **证伪条件:**领域提升未超过 seed 方差,或通用能力灾难性遗忘;敏感数据还需先通过治理审查。
9. 动作是否真的进入潜在动力学(L)
- **问题:**冻结 LeVJEPA 后的小 predictor 会利用动作,而非只复制视频惯性吗?
- **最小基线:**copy-last、去掉动作、打乱动作三组;相同离线轨迹训练。
- **指标:**one/multi-step latent error、动作反事实可分性、校准误差。
- **证伪条件:**真实动作模型不胜去动作/乱动作基线,或 horizon 增长立即发散。此项目新增 action-conditioned predictor,不是 LeVJEPA 原生结果。
10. 从表征到闭环 MPC 的预注册复现(XL)
- **问题:**LeVJEPA 表征能否在固定模拟任务中提高样本效率或规划成功率?
- **最小基线:**相同 predictor、数据、CEM 候选数和 horizon 下,比较 random encoder、copy dynamics,以及一个公开视觉 encoder;先在模拟器,不直接上实体机器人。
- **指标:**50+ episodes 的成功率与置信区间、碰撞/约束违反、规划秒/动作、GPU-hours、五个 seed。
- **证伪条件:**成功率区间不优于最强基线,动作搜索对模型替换不敏感,或收益以显著更多规划计算换取。安全门通过后才考虑实体实验。
上游 paper.md 的 Push-T 表仍是 TODO。第 9、10 题必须从零生成自己的协议与结果,不能填一个想象数字进空表。每个项目都应保存冻结提交、解析后 Hydra 配置、数据清单、seed、硬件、原始日志和失败运行;只报最好一次就失去证伪意义。
十张卡背后的原始记录
- LeVJEPA v1 的消融、受控比较与开放问题
- 官方项目页与冻结实现
3ea0dda - LeJEPA arXiv v3 / SIGReg 原始论文
- V-JEPA 2-AC 与 LeWorldModel arXiv v3 作为动作世界模型参照
实验本扉页上的三行字
- 每个课题都要同时写最小基线、指标、失败条件和资源预算。
- matched epochs、matched samples 与 matched FLOPs 回答不同问题,不能混账。
- 世界模型和 Push-T 项目是待验证提案;LeVJEPA v1 没有可引用的规划成功率。
这项实验可以批准吗?
- 为什么研究计划必须提前写证伪条件?
- motion-aware dropping 若用了更多 token,能否直接与 95% random 比精度?
- 上游 Push-T 空表能否作为 baseline 数字来源?
批准前的核对结果
- 防止看到结果后移动目标,让负结果也有信息。
- 不能;至少要对齐总 FLOPs,或明确画出精度—计算曲线。
- 不能;它有 TODO,没有完整实验结果与协议。