课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
先把整台机器摊在桌上
- 看同一片一大窗,几小窗
- 写摘要共享一台编码器
- 同片靠近意思保持一致
- 保留差别别把万物写成同一句
拿一本没有片名的短视频相册。老师不给“猫”“汽车”这样的答案,只把同一段视频从一扇大窗和几扇小窗里各放一遍,请孩子写几张摘要卡。同一段视频的卡片理应相近。可要是每张都写“有东西”,卡片虽然一致,也就什么都没说。
LeVJEPA 就在解决这两个相反要求:**同一片要认得出来,所有片又不能被写成同一个答案。**前者由不变性损失负责,后者由 SIGReg 负责。后面的章节会逐个拆开这些新词。
机器里究竟装了什么
本系列以 LeVJEPA arXiv v1 为基准。它在 2026-08-27 发布,截至本章日期仍是预印本——也就是公开供同行阅读、尚未完成正式同行评审的论文版本。训练时,一段 16 帧视频产生一个全局视图和若干局部视图;它们共享同一段时间,只在空间裁剪和外观增强上变化。所有视图经过同一个可训练编码器和同一个小投影头,损失读取各自的 [CLS] 摘要 token(可训练的整段视频摘要位)。
先把三条边界画清,后面就不容易把相似的模型混在一起:
- 目标函数由共享编码器分支构成,全局和局部分支都接收梯度;target encoder、predictor 和 stop-gradient 不在这张训练图中。
- 官方训练另行维护编码器的 Polyak/EMA 参数副本并保存为评估检查点。它只为评估提供较平滑的权重,不生成训练目标,也不扮演教师网络。
- 训练得到的是视频编码器。动作条件动力学、代价函数和搜索器仍需另建,所以“可作为世界模型地基”是研究方向,还不是一套已经能规划的系统。
所谓“只有一个目标权重”,特指总损失里固定为 λ = 0.02 的权衡系数;数据、优化器和模型结构照样有各自配置。教程会先建立直觉,再看公式、张量、代码和实验。实验结果一律注明“作者报告”,因为公开代码和权重证明的是材料可查,并不能替代一次独立复现。
两分钟贴便签
把下面四张便签分到“训练目标里”和“训练目标外”:共享编码器、SIGReg、EMA 评估副本、动作规划器。正确分法是:前两张在目标里;EMA 只服务评估;规划器根本不属于 LeVJEPA。
查证入口
合上这一页前
- LeVJEPA v1 是 2026-08-27 发布的视频表征预训练方法。
- 它用共享编码器、共享投影头和
[CLS],目标里没有教师、预测器或停梯度。 - 评估用 EMA 不等于 EMA 教师;编码器也不等于规划器。
现在能说清吗?
- 这门课所说的“两股力”分别是什么?
- EMA 参数副本会不会给训练分支制造目标?
- 拿到 LeVJEPA 编码器后,能否不加任何模块就让机器人规划?
答案与理由
- 同片视图靠近的不变性损失,以及防止表征坍塌的 SIGReg。
- 不会;它只作为评估检查点。
- 不能;还缺动作条件预测、目标或代价、搜索与闭环控制。