课程进度 课程大纲 已发布 34/34 课
第 0 部分——先拿到地图
第 1 部分——为什么简单目标会学会看视频
第 2 部分——把一段视频送进单编码器
第 3 部分——会读实验,才算读懂论文
第 4 部分——从官方仓库到自己的实验
第 5 部分——把表征接回世界模型路线
附录——随用随查的技术背包
从高处看这条路
- 2006 能量合不合拍?
- 2022 蓝图感知、预测、行动
- 2023 图像I-JEPA
- 2024–25 视频V-JEPA 系列
- 2025–26 精简LeJEPA → LeVJEPA
想象 LeCun 多年来在搭一座会思考的积木城。最早的一块积木是“打分尺”:真实相配的东西给低能量,不相配的给高能量。后来他画出整座城市的蓝图:眼睛负责看,世界模型负责想象,目标与代价告诉系统什么更好,行动模块再作选择。I-JEPA、V-JEPA 等工作是在测试其中的“学会有意义的内部表示”这块地基;它们并不等于整座城市。
五个路标,五个不同问题
2006:能量学习。 **能量函数(energy function)**为输入与候选答案的相容程度打分:低能量表示更匹配,高能量表示更不匹配。这样一来,系统可以直接比较抽象表示,不必总为每个像素建立概率生成模型。
**2022:AMI 路线图。**AMI 指 autonomous machine intelligence,即“自主机器智能”。LeCun 的立场论文把感知、世界模型、短期记忆、actor(动作选择模块)、内在代价与 configurator(按任务调节其他模块的机制)放进一个分层架构,并把 JEPA 作为在表示空间做预测的思路。它提出的是研究蓝图,而非一台已经装好所有模块的单模型。
**2023–2025:从图片走向视频和行动。**I-JEPA 从图像上下文预测被遮目标区域的表示;V-JEPA 把特征预测带到视频;V-JEPA 2 将无动作的大规模视频预训练与后续的动作条件模型 V-JEPA 2-AC 区分开来,后者才把预测接入机器人规划。名称接近,计算图和证据范围却不同。
**2025–2026:把防坍塌写进损失。**LeJEPA v3 论证各向同性高斯目标并提出 SIGReg,以分布约束替代教师—学生等防坍塌结构。LeVJEPA 再把这套目标带到视频:单个共享编码器加小投影头,以不变性和 SIGReg 学表征。其 arXiv v1 于 2026-08-27 发布。
因此,这条路线可概括为:先学会给“相容”打分,再在高层表示里预测,再为无标签图像和视频寻找稳定训练法,最后才可能把表征接到动作条件预测与规划。LeVJEPA 位于“高效视频感知地基”这一站;它的因果注意力不自动补出动作、代价和搜索。
给四张卡排队
给下面四张卡排序:LeJEPA/SIGReg、AMI 蓝图、I-JEPA 图像实验、LeVJEPA 视频精简目标。答案按公开时间是:AMI(2022)→ I-JEPA(2023)→ LeJEPA(2025)→ LeVJEPA(2026)。再在最后一张旁写上“编码器,不是完整 agent”。
沿途的一手路标
- LeCun 等:A Tutorial on Energy-Based Learning(2006,作者主页 PDF)
- LeCun:A Path Towards Autonomous Machine Intelligence(2022,OpenReview)
- I-JEPA 论文与 Meta 官方介绍
- V-JEPA 论文与 Meta 官方介绍
- V-JEPA 2 论文与 Meta 官方介绍
- LeJEPA arXiv v3 与 LeVJEPA arXiv v1
走完以后,地图上应留下什么
- LeCun 的长期路线是从表征与预测走向能推理和规划的 agent。
- JEPA 是蓝图家族名,I-JEPA、V-JEPA、LeJEPA 和 LeVJEPA 是不同实例。
- LeVJEPA 目前完成的是视频编码地基;长期愿景里的动作与规划仍在后面的路段。
你站在哪一站?
- 2006 年的能量函数在问什么?
- 2022 AMI 文档是完整产品说明还是研究蓝图?
- V-JEPA 2 的机器人规划能力来自哪一步?
沿时间线核对
- 输入与候选答案是否相容。
- 是研究蓝图。
- 来自后续动作条件训练的 V-JEPA 2-AC,而非仅靠无动作视频编码器。