课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
三枚坐标章,一张意外地图
- 三把指南针时间、高、宽
- 一帧一片tubelet = 1
- 只批摘要监督 [CLS]
- 小块会分组定性现象
先别急着把热图叫成绩
给每块视频拼图盖三枚章:“第几帧、从上数第几格、从左数第几格”。机器比较两块时,就能知道相对方向。若把相邻两页先粘成一页,时间会更粗;LeVJEPA 默认不粘,每帧各自产生 patch。奇妙的是,老师只给整本书的摘要卡打分,小拼图仍逐渐把狐狸、沙发和背景分成不同颜色的小组。
最后一句只是论文可视化观察,不是“已经通过分割考试”。
三种机制,各自负责什么
**第一,factorized 3D RoPE。**每个 attention head 的维度被分成三组,分别按时间、竖直、水平坐标旋转;论文附录说明不使用绝对位置嵌入。相对位置编码让同一 encoder 接受 224 与 96 两种网格时无需为绝对位置表做插值。
**第二,tubelet=1。**空间 patch 是 16×16,时间跨度不是两帧,而是一帧。于是 16 帧的 224 视图产生 16 × 14 × 14 = 3136 个 patch,96 视图产生 16 × 6 × 6 = 576 个。tubelet=2 会先把两帧聚成一个时槽。论文在相同训练 token 预算和 8 个评估时槽下作受控比较:
| patch 方式 | dropping | IN1K | SSv2 |
|---|---|---|---|
tubelet=2 | 90% | 47.4 | 28.8 |
tubelet=1 | 95% | 50.7 | 30.4 |
这些是作者报告的冻结 attentive-probe top-1;它说明在该协议下不必靠输入端两帧聚合。换了数据、模型或预算,排序仍要重新测量。
第三,密集特征。训练损失只直接作用于 [CLS],patch token 没有辅助 patch loss。论文和项目页展示 patch PCA 以及查询 patch 对其他 patch 的余弦相似度:同一物体区域在图中聚在一起,并能随视频保持对应。这是有价值的定性证据。分割和跟踪还没有量化评估,因此漂亮热图回答的是“看起来有结构”,并没有回答“任务分数是多少”。
给一枚 token 办身份证
分别计算 16 帧下 tubelet=1 与 tubelet=2 的时间槽:16 与 8。再给某 token 写坐标 (t=5,y=3,x=9),说明 3D RoPE 的三组旋转各读取哪一个数字。最后把“PCA 能分出物体”改写成严谨句子:“作者发布的若干可视化显示语义组织;分割/跟踪充分性未知。”
坐标与密集特征的出处
- LeVJEPA arXiv v1:架构、3D RoPE 与逐帧 token
- arXiv v1:tubelet 受控比较
- arXiv v1:涌现的 token 结构及限制
- 冻结模型版本:完整输出为 CLS + 3136 patch
收好三枚章
- 三维 RoPE 分别编码时间、竖直和水平相对位置,不使用绝对位置表。
- 默认
tubelet=1,所以一枚 token 只跨一帧,224 全局视图共有 3136 个 patch。 - patch 组织是定性涌现现象;分割或跟踪任务尚无量化结果,证据仍停在可视化层。
看看标签有没有贴错
tubelet=1会不会在输入端把相邻两帧合并?- 为什么 3D RoPE 能区分“何时、何处”?
- patch PCA 很清晰是否等于分割准确率已被验证?
查看答案
- 不会,每个 token 的时间跨度是一帧。
- attention head 的维度分成时间、竖直、水平三组,按相应坐标旋转。
- 不等于;那是定性可视化,论文未评估分割或跟踪。