课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 编码形成上下文编码
- 施加条件加入掩码、时间或动作
- 预测瞄准目标编码
- 说清计算图模型家族不等于具体配方

一个小故事
画家会临摹每一块砖和每一道倒影,制图师则保留道路与路口。为了预测旅行者下一步会走到哪里,制图师只需在地图上推进一个点,而不必把整条街重新画一遍。
这就是“预测含义,而不是图像副本”的有用解释。但学习得到的地图并没有人类制图师为符号命名。第 17 维并没有贴着“门口”的标签。模型可能记住油漆颜色,却忘记单行规则。这里的“含义”指学习到的表征,而它是否有用仍需要证据。
真正规则
模型家族层面的 JEPA 骨架刻意保持中立:
context_code = encode_context(context)
target_code = encode_target(target)
predicted_code = predict(context_code, optional_condition)
loss = compare(predicted_code, target_code)
这段示意并没有规定使用一个还是两个编码器、权重共享还是分离、是否采用 stop-gradient、EMA、负样本或随机潜变量。这些选择属于具体命名的方法。
LeWM v3 对这一思想作了如下具体化:
image-history codes + recorded actions -> next-image code prediction
当前帧和下一帧使用同一个共享且可训练的视觉编码器。动作条件预测器估计下一表征。预测损失通过编码器在上下文侧和目标侧的使用路径保持连接,而 SIGReg 另行施加群体分布形状的约束。原始 v3 没有 EMA 目标教师、目标 stop-gradient,也没有预训练视觉编码器。
自编码器重建输入空间中的目标;生成式视频模型输出帧或视觉 token;对比式目标比较指定的匹配与不匹配样本;LeJEPA 与 LeWM 则在没有负样本对的情况下结合预测和 SIGReg。这些是不同的契约,并不是通用性能排名;原则上,JEPA 也可以用其他损失训练。
容易骗过我们的把戏
固定同一个观测,分别输入两个动作:
up = predict(current, action="up")
right = predict(current, action="right")
check distance(up, right)
如果真实后果明明不同,而两个输出仍几乎一致,模型可能只是在预测常见的后续,并没有理会控制信号。此时 CEM 虽然评估了许多动作序列,却几乎都经过同一条分支。更多搜索无法创造出被预测器抹掉的选择。
非零间距还不能证明动力学正确。应当把变化方向和大小与数据支持范围内记录的后继状态相比较,同时加入一个对照状态:在那个状态下,两个小动作确实应该产生相似效果。
证据凭据
宽泛的架构来自 A Path Towards Autonomous Machine Intelligence v0.9.2。I-JEPA v3 是一种面向图像、带 EMA 目标编码器的特定方案。LeJEPA v3 提出了结合预测与 SIGReg 的动机。LeWorldModel v3 和冻结的 train.py 才是 LeWM 动作条件连接计算图的权威依据。
不要把 I-JEPA 的教师网络移植到 LeWM 的描述中,不要按定义把所有 JEPA 都称为非对比式方法,也不要仅凭架构推断语义。受控探针最多只能支持一个范围明确的主张:某项差异可被解码、可用于预测,或对规划有用。
快速检查
- 为什么“目标表征”不能证明教师网络一定存在?
- LeWM v3 的哪些计算图特征使它有别于 I-JEPA 的方案?
- 为什么良好的平均预测仍可能与无用的 CEM 搜索并存?