JEPA4Japan · 教程

第 15 章——RoPE、逐帧 token 与意外长出的密集特征

1,024字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

理解三维旋转位置、tubelet=1 的意义,以及只有 [CLS] 监督时 patch 表征为何仍值得检查。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 当前课程

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

三枚坐标章,一张意外地图

  1. 三把指南针时间、高、宽
  2. 一帧一片tubelet = 1
  3. 只批摘要监督 [CLS]
  4. 小块会分组定性现象
位置由三维 RoPE 标记,输入不先合并相邻帧;patch 特征虽未直接监督,却出现了可见结构。

先别急着把热图叫成绩

给每块视频拼图盖三枚章:“第几帧、从上数第几格、从左数第几格”。机器比较两块时,就能知道相对方向。若把相邻两页先粘成一页,时间会更粗;LeVJEPA 默认不粘,每帧各自产生 patch。奇妙的是,老师只给整本书的摘要卡打分,小拼图仍逐渐把狐狸、沙发和背景分成不同颜色的小组。

最后一句只是论文可视化观察,不是“已经通过分割考试”。

三种机制,各自负责什么

**第一,factorized 3D RoPE。**每个 attention head 的维度被分成三组,分别按时间、竖直、水平坐标旋转;论文附录说明不使用绝对位置嵌入。相对位置编码让同一 encoder 接受 224 与 96 两种网格时无需为绝对位置表做插值。

**第二,tubelet=1。**空间 patch 是 16×16,时间跨度不是两帧,而是一帧。于是 16 帧的 224 视图产生 16 × 14 × 14 = 3136 个 patch,96 视图产生 16 × 6 × 6 = 576 个。tubelet=2 会先把两帧聚成一个时槽。论文在相同训练 token 预算和 8 个评估时槽下作受控比较:

patch 方式droppingIN1KSSv2
tubelet=290%47.428.8
tubelet=195%50.730.4

这些是作者报告的冻结 attentive-probe top-1;它说明在该协议下不必靠输入端两帧聚合。换了数据、模型或预算,排序仍要重新测量。

第三,密集特征。训练损失只直接作用于 [CLS],patch token 没有辅助 patch loss。论文和项目页展示 patch PCA 以及查询 patch 对其他 patch 的余弦相似度:同一物体区域在图中聚在一起,并能随视频保持对应。这是有价值的定性证据。分割和跟踪还没有量化评估,因此漂亮热图回答的是“看起来有结构”,并没有回答“任务分数是多少”。

给一枚 token 办身份证

分别计算 16 帧下 tubelet=1 与 tubelet=2 的时间槽:16 与 8。再给某 token 写坐标 (t=5,y=3,x=9),说明 3D RoPE 的三组旋转各读取哪一个数字。最后把“PCA 能分出物体”改写成严谨句子:“作者发布的若干可视化显示语义组织;分割/跟踪充分性未知。”

坐标与密集特征的出处

收好三枚章

  1. 三维 RoPE 分别编码时间、竖直和水平相对位置,不使用绝对位置表。
  2. 默认 tubelet=1,所以一枚 token 只跨一帧,224 全局视图共有 3136 个 patch。
  3. patch 组织是定性涌现现象;分割或跟踪任务尚无量化结果,证据仍停在可视化层。

看看标签有没有贴错

  1. tubelet=1 会不会在输入端把相邻两帧合并?
  2. 为什么 3D RoPE 能区分“何时、何处”?
  3. patch PCA 很清晰是否等于分割准确率已被验证?
查看答案
  1. 不会,每个 token 的时间跨度是一帧。
  2. attention head 的维度分成时间、竖直、水平三组,按相应坐标旋转。
  3. 不等于;那是定性可视化,论文未评估分割或跟踪。