课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
一张得满分的白卷
- 狗的大窗写一张卡
- 狗耳小窗卡片要靠近
- 偷懒答案全部写“东西”
- 坍塌相同却没信息
老师只检查每段视频自己的大小两张卡是否相同。一个满分捷径马上出现了:无论猫、火车还是倒水,全部写数字 0。每一对卡当然完全一致,误差也是零,可谁也无法再从卡片分辨视频。
训练程序并没有坏;是题目本身容许这种答案。于是,“让同片靠近”之后自然跟着第二问:怎样让整班卡片仍有差别?
坍塌其实有两种
**不变性(invariance)**表示我们希望表征不随某些无关变化而改变。LeVJEPA 比较全局嵌入 z_0 与每个局部嵌入 z_v 的平方距离。裁剪范围和颜色即使不同,只要仍来自同一 16 帧窗口,摘要就应接近。距离两端都参与求梯度,所以全局和局部更像一起移动的同学,而非老师和学生。
若只最小化这个距离,常量函数 z(x) = c 是精确解:任意两视图的差都是零。这叫完全坍塌。还有更隐蔽的维度坍塌:向量看似很长,实际只有少数方向变化,其余坐标恒定或互相重复;下游可用信息仍可能很少。
常见方法会用负样本、方差/协方差约束,或 EMA 教师、predictor 与 stop-gradient 封住这条捷径。LeVJEPA 选择 SIGReg:它检查一批嵌入组成的点云,推动点云接近均值为零、各方向方差相同且无相关偏斜的标准各向同性高斯。一个点或一条扁线自然过不了这项形状检查。
因此两项损失分工明确:不变性告诉单个视频的不同视图“彼此是什么关系”,SIGReg 检查许多样本共同形成的“班级形状”。只看第一项可能全相同;只看第二项则点云可以很漂亮,却未必把同一视频的视图放在一起。LeVJEPA 用固定权重把两股压力相加。
防住坍塌只是排除了一类退化答案。编码器仍可能记住背景、拍摄设备或别的捷径;这些问题要靠数据审计与下游评估发现。
在纸上摆四个点
写四个二维点:(0,0)、(0,0)、(0,0)、(0,0)。它们能让任何同片配对距离为零,却在横纵方向都没有变化。再写 (−1,0)、(1,0)、(0,−1)、(0,1):至少点云展开了,但仍不能仅凭形状断言点的含义正确。
这道“防作弊题”的依据
从白卷里学到的三件事
- 不变性损失单独使用时,所有输入输出同一常量也能得零分。
- SIGReg 约束整批嵌入的分布,用来排除完全与维度坍塌。
- 不坍塌只说明表示没有退化,不等于已经理解世界。
找出那条捷径
- 为什么常量编码器能骗过不变性损失?
- 全局分支是否停止梯度?
- 点云展开能否单独证明学到了动作语义?
为什么会这样
- 因为任意配对的两个常量输出完全相等。
- 不停止,两端都接收梯度。
- 不能;还要用针对动作信息的评估。