JEPA4Japan · 教程

第 4 章——视频可以自己出题

1,125字 3分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

理解无标签视频如何提供同一物体、动作与时间连续性的监督信号,以及它不能自动保证什么。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 当前课程
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 已发布
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

录像自己出题,考试另算

  1. 视频来到没有人工标签
  2. 自己出题同片做多种视图
  3. 自己作答编码成摘要
  4. 另行考试冻结后再测能力
“自监督”只说明题目来自数据本身;模型究竟学会了什么,还要另设考试。

幼儿园没有人为一万段录像逐帧写说明。老师改用一个便宜办法:从同一段录像剪出大画面和小画面,问孩子“它们是不是在讲同一件事?”录像自己提供了配对关系,因而不需要“这是倒水”“那是开门”的人工标签。

可孩子也可能只记住墙纸颜色,依旧说不清杯子为何倒下。题目来得便宜,答案里是否包含因果、物体或动作,则是另一回事。

学习信号藏在哪里

**监督信号(supervision signal)**就是一条可计算的规则,用来告诉参数朝哪个方向改。传统监督学习由人给视频类别;自监督学习则从数据结构里生成规则。LeVJEPA 从一个 16 帧 clip(短视频片段)构造同时间的全局与局部视图,把“它们来自同一 clip”作为正配对,再比较共享编码器产生的 [CLS] 嵌入。类别文本、人工框和动作标签都不参与预训练,也无需专门指定别的视频作为负样本。

视频比单张图多出时间连续性:同一物体会换位置,手和工具会接触,动作有先后。两种视图共享整个时间窗口时,这些变化可能成为跨视图都可用的线索。不过,LeVJEPA 的训练损失只要求同片摘要一致,并用 SIGReg 保持整批表示的丰富分布;光流、物体轨迹和因果关系并没有被逐项写进答案。最后学到什么,仍取决于数据、裁剪、稀疏 token、网络容量与优化过程。

还要分清“训练题”和“毕业考试”。预训练不看 ImageNet、Kinetics-400 或 Something-Something-v2 的类别答案;训练结束后冻结编码器,再训练轻量探针(只负责读取固定特征的小模型),才能衡量其中有多少外观或运动信息。探针分数支持的是“这些特征在这套协议下可用”,范围到此为止,人的常识和行动规划仍需各自的证据。

LeVJEPA 的块因果注意力让某帧 token 只依赖当前和过去帧,这有利于流式编码。被动观看提供的却仍是“发生了什么”,而非“如果我执行动作 A 会怎样”;后一个问题需要动作条件数据与预测器,属于后续世界模型工作。

不写标签,做一组训练样本

选一段 2 秒视频,不写类别名。复制两份:一份保留较大画面,一份只裁出手部,但让两份都使用完全相同的 16 个时刻。这就是一个自监督配对。若第二份改成另一段视频,即使都出现手,也不能作为 LeVJEPA 的同片正配对。

题目与考试的出处

把“自监督”说完整

  1. 自监督的“答案”来自数据结构,而不是人工类别。
  2. LeVJEPA 使用同一 16 帧窗口的多视图配对,并不显式监督光流或因果。
  3. 冻结探针分数是特定任务证据,不是通用理解或规划证明。

训练题还是毕业考试?

  1. LeVJEPA 预训练需要动作类别标签吗?
  2. 同片一致性是否保证模型学会因果关系?
  3. 为什么要把预训练和冻结评估分开说?
看看是否分清了
  1. 不需要。
  2. 不保证,它只提供可能利用的时空结构。
  3. 因为前者学习表征,后者才在固定协议下测量表征里有什么信息。