JEPA4Japan · 教程

第 27 章——重要边界:LeVJEPA 不是规划器

1,320字 4分钟阅读 #LeVJEPA#JEPA#视频自监督学习#SIGReg

区分视频编码、动作条件动力学、代价、搜索与闭环控制,避免把因果注意力写成因果世界模型。

课程进度 课程大纲 已发布 34/34 课

第 0 部分——先拿到地图

  1. 01 第 0 章——开始之前:这门课承诺什么 已发布
  2. 02 第 1 章——同一段视频,两扇不同的窗 已发布
  3. 03 第 2 章——沿着 Yann LeCun 的科研路线走一遍 已发布
  4. 04 第 3 章——别被名字绕晕:JEPA 家族树 已发布

第 1 部分——为什么简单目标会学会看视频

  1. 05 第 4 章——视频可以自己出题 已发布
  2. 06 第 5 章——保留意思,不重画每个像素 已发布
  3. 07 第 6 章——两张卡要相同,但不能全变成白纸 已发布
  4. 08 第 7 章——SIGReg:从许多影子检查一团点云 已发布
  5. 09 第 8 章——只用一行目标函数读懂 LeVJEPA 已发布

第 2 部分——把一段视频送进单编码器

  1. 10 第 9 章——全局视图与局部视图怎样配对 已发布
  2. 11 第 10 章——把视频切成时空小方块 已发布
  3. 12 第 11 章——一台编码器、一个投影头、一张摘要卡 已发布
  4. 13 第 12 章——一次完整前向传播 已发布
  5. 14 第 13 章——为什么扔掉 95% 反而更会看 已发布
  6. 15 第 14 章——块因果注意力:同一帧互看,未来不能偷看 已发布
  7. 16 第 15 章——RoPE、逐帧 token 与意外长出的密集特征 已发布

第 3 部分——会读实验,才算读懂论文

  1. 17 第 16 章——四组消融究竟回答了什么 已发布
  2. 18 第 17 章——相同轮数不等于相同花费 已发布
  3. 19 第 18 章——ImageNet、K400、SSv2 各考什么 已发布
  4. 20 第 19 章——把论文结果记成一本账 已发布
  5. 21 第 20 章——哪些结论现在还不能说 已发布

第 4 部分——从官方仓库到自己的实验

  1. 22 第 21 章——官方仓库地图 已发布
  2. 23 第 22 章——Walking Tours:十段长视频怎样变成训练数据 已发布
  3. 24 第 23 章——读懂默认配置并启动训练 已发布
  4. 25 第 24 章——先跑一个不会骗人的冒烟测试 已发布
  5. 26 第 25 章——不用训练:加载公开权重提取特征 已发布
  6. 27 第 26 章——在自己的视频上做冻结评估 已发布

第 5 部分——把表征接回世界模型路线

  1. 28 第 27 章——重要边界:LeVJEPA 不是规划器 当前课程
  2. 29 第 28 章——怎样把 LeVJEPA 接到下一代世界模型 已发布
  3. 30 第 29 章——十个从入门到论文级的研究项目 已发布

附录——随用随查的技术背包

  1. 31 附录 A——最低限度数学工具箱 已发布
  2. 32 附录 B——完整张量形状表 已发布
  3. 33 附录 C——术语表与论文时间线 已发布
  4. 34 附录 D——复现与审阅检查清单 已发布

五个方框,LeVJEPA 交付了第一个

  1. Encoder现在看成什么
  2. Action准备做什么
  3. Dynamics做后会怎样
  4. Cost离目标多远
  5. Search + MPC试、执行、再计划
LeVJEPA 公开成果交付的是第一格;后四格需要动作数据、模型与控制环路逐一补上。

一位导游能把街景说得很清楚,还能保证描述这一秒时不偷看下一秒。但若问“左转会不会撞车”,他还需要知道方向盘动作如何改变未来、怎样判断危险、如何比较路线。看懂世界不等于会驾驶。

这就是视频编码器与规划器之间的分界:前者整理看见的内容,后者还要试想动作、评价未来并作出选择。

“因果”这个词在这里有三种含义

LeVJEPA 接收视频并输出 [CLS] 与 patch 表征。block_causal 只规定信息流:某帧 patch 可看当前和过去,不能看未来;[CLS] 是只读汇总槽,可看完整 clip,patch 不反向读取它。这提供时间方向,却没有动作输入,也没有证明干预意义上的因果关系。

被动视频中“灯亮后门打开”可能来自同一个隐藏原因。attention 不看未来,保证的是部署时没有未来信息泄漏;“按这个按钮会不会开门”问的却是干预后的结果。动作条件数据把状态、实际动作和后续状态配成一组,才给 predictor 学习这种差异的机会。即便有了动作,还应借助打乱动作、去动作和反事实测试,检查 predictor 是否真的读取了 action。

可以把三种主张分开写:因果 mask限制信息流,动作条件预测估计给定动作后的未来,因果发现则试图辨认真正的干预关系。

一台规划器还缺哪四样东西

规划至少还需四样新东西:动作 a_t;动作条件动力学 F(z_t, a_t) → z_hat(t+1);目标或代价 C(z_hat, g);候选动作搜索与闭环 MPC(模型预测控制,即计划一段、执行一步、重新观察)。若未来有多种可能,还需不确定性或随机潜变量。下面只是接口清单,不是 LeVJEPA 官方 API:

z_now = encoder(history)             # LeVJEPA 已有
z_next = dynamics(z_now, action)     # 提议新增:需动作轨迹训练
score = cost(z_next, goal)           # 提议新增:需定义与验证
action = search(dynamics, cost)[0]   # 提议新增:执行一步后再规划

两个近邻项目,恰好标出了缺口

V-JEPA 2 的感知模型与 V-JEPA 2-AC 分属两个阶段:后者冻结 encoder,再用不足 62 小时机器人轨迹训练独立的动作条件 predictor,最后以图像目标和 MPC 搜索。LeWorldModel 则从像素端到端联合训练 encoder 与动作条件 predictor。它们很适合说明“还要加什么”,其中的组件与结果却不会倒流成 LeVJEPA 的现有能力。

同样,分类或检索 probe 只说明某些信息能从表征读出;它不保证信息在长滚动中稳定、代价可比较或搜索能找到安全动作。一个合格 planner 主张至少分别报告表示、one-step dynamics、long-horizon rollout、搜索预算和闭环成功,不能用其中一个分数替代整条链。

固定仓库快照的 paper.md 确实写有一段 Push-T 世界模型草案,但结果表仍留着 TODO,episode、seed 与 planner 配置也没有给全。这里能据实记录的是“草案存在、结果尚空”。LeVJEPA v1 已报告的是表征、效率与 probe;“可作为世界模型地基”仍是研究方向。

审一张“会规划”的图

给任何“LeVJEPA 会规划”的图做五项审计:动作张量在哪里?谁预测下一状态?代价怎样定义?谁搜索候选动作?何时读取新观察并重规划?若四项为空,它展示的是 encoder,不是 planner。

分界线的原始依据

把边界留在图上

  1. 块因果注意力限制看信息的方向,不等于学会动作因果。
  2. 规划还要动作条件预测、代价、搜索和闭环重规划。
  3. 上游 Push-T 表格是带 TODO 的草案;不存在可引用的 LeVJEPA Push-T 结果。

指出缺的方框

  1. LeVJEPA 原生输入中有没有机器人动作?
  2. 为何 [CLS] 不能代表每个在线时刻的因果状态?
  3. V-JEPA 2-AC 的规划结果能否归给 LeVJEPA?
逐格核对
  1. 没有。
  2. 它可读取整个输入 clip;逐帧 patch token 才受前缀限制。
  3. 不能;模型、训练阶段和新增动作预测器都不同。