课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
录像自己出题,考试另算
- 视频来到没有人工标签
- 自己出题同片做多种视图
- 自己作答编码成摘要
- 另行考试冻结后再测能力
幼儿园没有人为一万段录像逐帧写说明。老师改用一个便宜办法:从同一段录像剪出大画面和小画面,问孩子“它们是不是在讲同一件事?”录像自己提供了配对关系,因而不需要“这是倒水”“那是开门”的人工标签。
可孩子也可能只记住墙纸颜色,依旧说不清杯子为何倒下。题目来得便宜,答案里是否包含因果、物体或动作,则是另一回事。
学习信号藏在哪里
**监督信号(supervision signal)**就是一条可计算的规则,用来告诉参数朝哪个方向改。传统监督学习由人给视频类别;自监督学习则从数据结构里生成规则。LeVJEPA 从一个 16 帧 clip(短视频片段)构造同时间的全局与局部视图,把“它们来自同一 clip”作为正配对,再比较共享编码器产生的 [CLS] 嵌入。类别文本、人工框和动作标签都不参与预训练,也无需专门指定别的视频作为负样本。
视频比单张图多出时间连续性:同一物体会换位置,手和工具会接触,动作有先后。两种视图共享整个时间窗口时,这些变化可能成为跨视图都可用的线索。不过,LeVJEPA 的训练损失只要求同片摘要一致,并用 SIGReg 保持整批表示的丰富分布;光流、物体轨迹和因果关系并没有被逐项写进答案。最后学到什么,仍取决于数据、裁剪、稀疏 token、网络容量与优化过程。
还要分清“训练题”和“毕业考试”。预训练不看 ImageNet、Kinetics-400 或 Something-Something-v2 的类别答案;训练结束后冻结编码器,再训练轻量探针(只负责读取固定特征的小模型),才能衡量其中有多少外观或运动信息。探针分数支持的是“这些特征在这套协议下可用”,范围到此为止,人的常识和行动规划仍需各自的证据。
LeVJEPA 的块因果注意力让某帧 token 只依赖当前和过去帧,这有利于流式编码。被动观看提供的却仍是“发生了什么”,而非“如果我执行动作 A 会怎样”;后一个问题需要动作条件数据与预测器,属于后续世界模型工作。
不写标签,做一组训练样本
选一段 2 秒视频,不写类别名。复制两份:一份保留较大画面,一份只裁出手部,但让两份都使用完全相同的 16 个时刻。这就是一个自监督配对。若第二份改成另一段视频,即使都出现手,也不能作为 LeVJEPA 的同片正配对。
题目与考试的出处
把“自监督”说完整
- 自监督的“答案”来自数据结构,而不是人工类别。
- LeVJEPA 使用同一 16 帧窗口的多视图配对,并不显式监督光流或因果。
- 冻结探针分数是特定任务证据,不是通用理解或规划证明。
训练题还是毕业考试?
- LeVJEPA 预训练需要动作类别标签吗?
- 同片一致性是否保证模型学会因果关系?
- 为什么要把预训练和冻结评估分开说?
看看是否分清了
- 不需要。
- 不保证,它只提供可能利用的时空结构。
- 因为前者学习表征,后者才在固定协议下测量表征里有什么信息。