课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
两扇窗,得对准同一刻
- 取 16 帧同一小段时间
- 开大窗看见完整场景
- 开小窗只看局部细节
- 对摘要同一故事应相近
一辆滑板车从街角经过。落地窗里有车、人和道路,纸筒里只露出转动的轮子。两边像素差得很远,讲的却是同一次经过。若纸筒晚了三秒,镜头里可能已经换成一只狗;此时再把两张摘要卡硬拉到一起,教给模型的关系就错了。
这正是 LeVJEPA 配对视图的要点:空间可以不同,时间身份不能偷换。“同一视频”还不够精确,必须是从同一视频里抽出的同一个 16 帧时间窗口。
把这幅图换成三个术语
**视图(view)**是一段视频经过裁剪和颜色变化后得到的输入版本;**编码器(encoder)**把大量像素整理成数字特征;**嵌入(embedding)**则是便于比较的短数字摘要。先把这三个词和“大窗、读者、摘要卡”一一对应,后面的公式就不会显得突然。
对一个 16 帧 clip,LeVJEPA 构造 V + 1 个视图:一个较大的全局视图 x_0,以及 V 个空间裁得更小、外观扰动更强的局部视图 x_1 ... x_V。它们都保留同一组 16 个时刻。每个视图都走过参数完全相同的编码器 E 和投影头 h,最后读取 [CLS] 得到 z_v。所谓“共享”,不是复制出几台恰好长得一样的网络,而是这些分支引用同一组参数,更新一次便一起改变。
训练让每个局部摘要靠近全局摘要,比较到这里便结束:局部图无需重画全景,前后两个 16 帧窗口也不互相预测,另设 predictor 猜目标表征同样不是这道题。全局视图覆盖更大空间,并且不接受局部视图那样的光度扰动,所以适合做配对参照;它仍然携带梯度,与冻结的教师答案是两回事。SIGReg 同时检查所有摘要的总体分布,防止整批视频最后只剩一张通用卡片。
这个任务鼓励模型忽略裁剪和颜色造成的偶然差别,同时保留跨窗口共享的内容。但若局部窗恰好只剩无关背景,配对信号会变弱;“来自同一时段”是必要条件,不保证每次裁剪都同样有信息。
亲手画一次时间轴
画一条 16 格时间轴,再画两扇窗。让两扇窗在纵向位置和大小上不同,但横向都覆盖同样的第 1–16 格。若把小窗平移到第 9–24 格,请圈出错误:它不再是 LeVJEPA 所要求的同一时间窗口配对。
图和代码从哪里核对
窗框之外,留下这三点
- 全局与局部视图必须来自同一个 16 帧时间窗口。
- 不同视图共享编码器、投影头与
[CLS]读出路径。 - 全局摘要是有梯度的配对参照,不是教师网络给出的冻结答案。
把窗挪一挪,再判断
- 局部视图可以来自同一视频的另一分钟吗?
- “共享编码器”意味着什么?
- 这一章的任务是否要求重建被裁掉的像素?
核对思路
- 不可以;它必须与全局视图共享同一 16 帧窗口。
- 所有视图使用同一组可训练参数。
- 不要求;损失比较的是
[CLS]投影后的摘要。