课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
五个方框,LeVJEPA 交付了第一个
- Encoder现在看成什么
- Action准备做什么
- Dynamics做后会怎样
- Cost离目标多远
- Search + MPC试、执行、再计划
一位导游能把街景说得很清楚,还能保证描述这一秒时不偷看下一秒。但若问“左转会不会撞车”,他还需要知道方向盘动作如何改变未来、怎样判断危险、如何比较路线。看懂世界不等于会驾驶。
这就是视频编码器与规划器之间的分界:前者整理看见的内容,后者还要试想动作、评价未来并作出选择。
“因果”这个词在这里有三种含义
LeVJEPA 接收视频并输出 [CLS] 与 patch 表征。block_causal 只规定信息流:某帧 patch 可看当前和过去,不能看未来;[CLS] 是只读汇总槽,可看完整 clip,patch 不反向读取它。这提供时间方向,却没有动作输入,也没有证明干预意义上的因果关系。
被动视频中“灯亮后门打开”可能来自同一个隐藏原因。attention 不看未来,保证的是部署时没有未来信息泄漏;“按这个按钮会不会开门”问的却是干预后的结果。动作条件数据把状态、实际动作和后续状态配成一组,才给 predictor 学习这种差异的机会。即便有了动作,还应借助打乱动作、去动作和反事实测试,检查 predictor 是否真的读取了 action。
可以把三种主张分开写:因果 mask限制信息流,动作条件预测估计给定动作后的未来,因果发现则试图辨认真正的干预关系。
一台规划器还缺哪四样东西
规划至少还需四样新东西:动作 a_t;动作条件动力学 F(z_t, a_t) → z_hat(t+1);目标或代价 C(z_hat, g);候选动作搜索与闭环 MPC(模型预测控制,即计划一段、执行一步、重新观察)。若未来有多种可能,还需不确定性或随机潜变量。下面只是接口清单,不是 LeVJEPA 官方 API:
z_now = encoder(history) # LeVJEPA 已有
z_next = dynamics(z_now, action) # 提议新增:需动作轨迹训练
score = cost(z_next, goal) # 提议新增:需定义与验证
action = search(dynamics, cost)[0] # 提议新增:执行一步后再规划
两个近邻项目,恰好标出了缺口
V-JEPA 2 的感知模型与 V-JEPA 2-AC 分属两个阶段:后者冻结 encoder,再用不足 62 小时机器人轨迹训练独立的动作条件 predictor,最后以图像目标和 MPC 搜索。LeWorldModel 则从像素端到端联合训练 encoder 与动作条件 predictor。它们很适合说明“还要加什么”,其中的组件与结果却不会倒流成 LeVJEPA 的现有能力。
同样,分类或检索 probe 只说明某些信息能从表征读出;它不保证信息在长滚动中稳定、代价可比较或搜索能找到安全动作。一个合格 planner 主张至少分别报告表示、one-step dynamics、long-horizon rollout、搜索预算和闭环成功,不能用其中一个分数替代整条链。
固定仓库快照的 paper.md 确实写有一段 Push-T 世界模型草案,但结果表仍留着 TODO,episode、seed 与 planner 配置也没有给全。这里能据实记录的是“草案存在、结果尚空”。LeVJEPA v1 已报告的是表征、效率与 probe;“可作为世界模型地基”仍是研究方向。
审一张“会规划”的图
给任何“LeVJEPA 会规划”的图做五项审计:动作张量在哪里?谁预测下一状态?代价怎样定义?谁搜索候选动作?何时读取新观察并重规划?若四项为空,它展示的是 encoder,不是 planner。
分界线的原始依据
把边界留在图上
- 块因果注意力限制看信息的方向,不等于学会动作因果。
- 规划还要动作条件预测、代价、搜索和闭环重规划。
- 上游 Push-T 表格是带 TODO 的草案;不存在可引用的 LeVJEPA Push-T 结果。
指出缺的方框
- LeVJEPA 原生输入中有没有机器人动作?
- 为何
[CLS]不能代表每个在线时刻的因果状态? - V-JEPA 2-AC 的规划结果能否归给 LeVJEPA?
逐格核对
- 没有。
- 它可读取整个输入 clip;逐帧 patch token 才受前缀限制。
- 不能;模型、训练阶段和新增动作预测器都不同。