课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
一眼看懂这张遮罩
- 同帧互看空间双向
- 回看过去时间因果
- 不偷未来patch 守门
- CLS 收信只进不出
总收件箱为什么只能收信
把每一帧想成一间教室。同一间教室的孩子可以自由讨论,也可以阅读前面教室留下的笔记,却不能向未来教室打电话。走廊尽头有个总收件箱 [CLS],它能收全楼的信,写整栋楼的总结;但任何教室都不能从它取信。若能取,最后一间教室先把答案投进去,第一间下一层再取出来,“未来禁令”就被绕过了。
把走廊规则写成矩阵
对第 t 帧的 patch query 与第 s 帧的 patch key,块因果规则是 s ≤ t。所以同一时刻 s=t 的所有空间 patch 双向互看;更早帧可读;更晚帧不可读。
| 谁在查询 | 可以读取 | 不可以读取 | 原因 |
|---|---|---|---|
第 t 帧 patch | 第 1…t 帧所有保留 patch | 第 t+1…末帧 | 保证逐帧表示无未来信息 |
[CLS] | 全部 patch 与自身 | — | 它是整段 clip 的汇总 |
| 任意 patch | 其他允许的 patch | [CLS] | 防止 [CLS] 成为跨层未来中继站 |
因此,“因果”只准确描述每帧 patch 表示。clip 级 [CLS] 本来就看完整段;若把它叫作时刻 t 的在线状态,未来帧的信息也会被一并算进去。随机 dropping 后,代码不是按保留序列的新顺序猜时间,而是用原始 token_ids 还原每个 patch 的 frame id,再造遮罩。
论文作者在受控设置中比较了全双向与块因果:ViT-B/16、20% K710、tubelet=1、ρ=0.95、V=4、随机 dropping,冻结 attentive probe 的 ImageNet top-1 分别是 50.7 与 51.2。这支持“在该协议下未观察到可测精度代价”,不证明所有数据集、模型和下游任务都无损。
块因果还允许流式系统缓存过去的 key/value,而无需每来一帧都重新编码历史;这是架构性质与未来用途。论文并未训练动作条件动力学、代价函数或规划器,所以它提供的是“流式地基”的可能性,尚未构成规划能力。
亲手找出一条未来泄漏
画一个 3×3 的帧级 attention 表:行是 query,列是 key。把对角线和左下角涂绿,右上角涂红。再加一行一列 [CLS]:[CLS] 那一行全绿;patch 指向 [CLS] 的那一列全红。若你把该列涂绿,请用两层网络演示“未来 → CLS → 过去”的泄漏路径。
遮罩的原始凭据
走出教室前
- patch 在帧内双向、跨帧只看现在与过去。
[CLS]看全片,而 patch 不读取[CLS];这正是阻断跨层未来回流的关键。- 51.2 对 50.7 是特定冻结探针协议的作者报告,不是通用无损定理,更不是规划证据。
检查谁能给谁写信
- 第 3 帧 patch 能读第 3 帧的其他 patch 吗?
- 为什么 patch 不能读
[CLS]? [CLS]能否作为只含前三帧信息的在线状态?
查看答案
- 能,同一帧内是双向注意力。
- 因为
[CLS]已读完整段,允许回读会把未来信息传回早期 patch。 - 不能直接这样说;训练中的
[CLS]读取了整段 clip。