课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
三份看似相近的作业
- 补像素把空格画回来
- 猜特征预测隐藏区域含义
- 对摘要同片视图靠近
老师把“狗追球”的画面遮住一半。第一位学生得把每根草和每片阴影画回来;第二位只猜遮住区域的高层线索;第三位拿到一张全景和一张只露狗头的裁图,要为它们写出相近的故事卡。叶子怎样抖可以略过,“这是同一段追逐”最好留下。
三份作业都能从无标签数据产生,但它们优化的对象不同,不能只因为都用了遮挡或裁剪就叫成同一种方法。
顺着“答案张量”找区别
**像素重建(pixel reconstruction)**以颜色数值为答案。VideoMAE 一类方法隐藏大部分时空 patch(小块),再用 decoder(解码器)重建;连续视频很容易从邻帧抄到像素,所以结构化 tube mask(让同一空间位置沿时间一起被遮住)有其任务理由。
**特征预测(feature prediction)**把答案换成学习到的表示。I-JEPA 和 V-JEPA 让 context encoder(上下文编码器)与 predictor(预测器)猜目标区域的编码表示;V-JEPA 的目标来自停梯度的 EMA target encoder。纹理无需逐笔重画,但计算图里确实有“预测被遮目标”这一步。
**LeVJEPA 的视图不变性(view invariance)**问的是第三个问题。一个全局视图与多个局部视图都由同一 encoder 和 projector 处理,损失只读取每个视图的 [CLS] 嵌入,让局部摘要靠近全局摘要。由于答案不是要补回某个缺口,这里用不上 decoder;predictor、target encoder 与 stop-gradient 也不在目标图里。全局摘要会随梯度一起更新,并非固定标签。
这也解释了为何 token dropping(直接丢弃 token)和“掩码预测”不是一回事:LeVJEPA 随机丢弃的 patch token 根本不进编码器,目标也没有恢复它们这一项。模型当次只看到保留下来的稀疏 token;这一操作主要改变计算量与观察难度。
“保留意思”仍要谨慎。目标鼓励裁剪和外观扰动下的共同信息,不会列出哪些因素一定是语义、哪些一定应忽略。若下游任务关心细微运动,而稀疏观察常把运动线索删掉,表征也可能受损。是否有用要靠冻结探针、检索或密集任务逐项检验。
一个很可靠的诊断问题
看到一个损失时问:“答案张量从哪里来?”若答案是原像素,它是重建;若来自另一编码器分支的隐藏块,它是特征预测;若只是同片全局与局部 [CLS] 的距离,它才符合 LeVJEPA 的视图不变性。
三类作业的原始出处
- VideoMAE 论文:像素重建与 tube masking
- I-JEPA 论文:图像表示空间中的块预测
- V-JEPA 论文:视频表示预测
- LeVJEPA arXiv v1:视图级
[CLS]不变性目标
别把三份作业混成一份
- 像素重建、隐藏特征预测和视图摘要匹配是三种不同训练题。
- LeVJEPA 不预测被丢 token,也不重建像素。
- 它让同片
[CLS]嵌入靠近,但“语义好不好”仍需下游证据。
沿着答案张量走
- LeVJEPA 为什么不需要 decoder?
- 被随机丢弃的 token 是否有重建损失?
- V-JEPA 与 LeVJEPA 的训练图最显眼的差别是什么?
答案在哪里
- 因为它不重建像素。
- 没有。
- V-JEPA 有 predictor、EMA target 与停梯度;LeVJEPA 的目标使用共享 encoder/projector 与 SIGReg。