JEPA4Japan · 教程

第 14 章——块因果注意力:同一帧互看,未来不能偷看

1,001字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

读懂帧内双向、帧间因果、[CLS] 特例与无未来泄漏的注意力拓扑。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 当前课程
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

一眼看懂这张遮罩

  1. 同帧互看空间双向
  2. 回看过去时间因果
  3. 不偷未来patch 守门
  4. CLS 收信只进不出
每帧 patch 可以讨论当前画面和历史;[CLS] 看完整段,却不能把未来消息送回 patch。

总收件箱为什么只能收信

把每一帧想成一间教室。同一间教室的孩子可以自由讨论,也可以阅读前面教室留下的笔记,却不能向未来教室打电话。走廊尽头有个总收件箱 [CLS],它能收全楼的信,写整栋楼的总结;但任何教室都不能从它取信。若能取,最后一间教室先把答案投进去,第一间下一层再取出来,“未来禁令”就被绕过了。

把走廊规则写成矩阵

对第 t 帧的 patch query 与第 s 帧的 patch key,块因果规则是 s ≤ t。所以同一时刻 s=t 的所有空间 patch 双向互看;更早帧可读;更晚帧不可读。

谁在查询可以读取不可以读取原因
第 t 帧 patch第 1…t 帧所有保留 patch第 t+1…末帧保证逐帧表示无未来信息
[CLS]全部 patch 与自身—它是整段 clip 的汇总
任意 patch其他允许的 patch[CLS]防止 [CLS] 成为跨层未来中继站

因此,“因果”只准确描述每帧 patch 表示。clip 级 [CLS] 本来就看完整段;若把它叫作时刻 t 的在线状态,未来帧的信息也会被一并算进去。随机 dropping 后,代码不是按保留序列的新顺序猜时间,而是用原始 token_ids 还原每个 patch 的 frame id,再造遮罩。

论文作者在受控设置中比较了全双向与块因果:ViT-B/16、20% K710、tubelet=1、ρ=0.95、V=4、随机 dropping,冻结 attentive probe 的 ImageNet top-1 分别是 50.7 与 51.2。这支持“在该协议下未观察到可测精度代价”,不证明所有数据集、模型和下游任务都无损。

块因果还允许流式系统缓存过去的 key/value,而无需每来一帧都重新编码历史;这是架构性质与未来用途。论文并未训练动作条件动力学、代价函数或规划器,所以它提供的是“流式地基”的可能性,尚未构成规划能力。

亲手找出一条未来泄漏

画一个 3×3 的帧级 attention 表:行是 query,列是 key。把对角线和左下角涂绿,右上角涂红。再加一行一列 [CLS]:[CLS] 那一行全绿;patch 指向 [CLS] 的那一列全红。若你把该列涂绿,请用两层网络演示“未来 → CLS → 过去”的泄漏路径。

遮罩的原始凭据

走出教室前

  1. patch 在帧内双向、跨帧只看现在与过去。
  2. [CLS] 看全片,而 patch 不读取 [CLS];这正是阻断跨层未来回流的关键。
  3. 51.2 对 50.7 是特定冻结探针协议的作者报告,不是通用无损定理,更不是规划证据。

检查谁能给谁写信

  1. 第 3 帧 patch 能读第 3 帧的其他 patch 吗?
  2. 为什么 patch 不能读 [CLS]?
  3. [CLS] 能否作为只含前三帧信息的在线状态?
查看答案
  1. 能,同一帧内是双向注意力。
  2. 因为 [CLS] 已读完整段,允许回读会把未来信息传回早期 patch。
  3. 不能直接这样说;训练中的 [CLS] 读取了整段 clip。