JEPA4Japan · 教程

第 0 章——开始之前

1,258字 3分钟阅读 #LeWorldModel#世界模型#JEPA

区分 LeWM 与 LeJEPA,锁定论文和代码基线,分开已确认事实与研究前沿,并预览从 TwoRoom 到 PushT 的学习路线。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 当前课程

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 观察像素 + 动作
  2. 压缩形成潜在状态
  3. 想象尝试动作的未来
  4. 行动搜索、移动、检查
LeWM 是一个学习得来的排练室。它不是摄像头、目标、驾驶员,也不是完美的物理预言机。

摄像头、直接策略和 LeWM 排练沙盒是三种不同的工具。

这门课程只有一条主线:观察 → 压缩 → 想象 → 搜索 → 行动 → 诊断。后面出现的每个模块,都能在这条线上找到自己的位置。

一个小故事

在机器人的工作台上放三种工具。摄像头记录一次真实旅程。**直接策略(direct policy)**可以利用丰富的记忆来选择动作,但在决策时并不会显式搜索许多种未来。**世界模型规划器(world-model planner)**则会先在学习到的模型内部排练候选动作,再作出选择。

LeWorldModel,简称 LeWM,就是第三种工具。它从有序的视觉—动作轨迹中学习。编码器把观测变成紧凑的潜在“通行证”,动作条件预测器让这些通行证随时间向前推进。训练完成后,CEM 在冻结的模型中搜索动作序列,MPC 执行预先设定的序列前缀,然后再次观察现实。

这张通行证并非字面意义上的地图。潜在空间中相近的两个点,在现实里可能位于一堵墙的两侧。一个紧凑状态也可能记住墙纸,却忘掉门口。

真正规则

请区分下面四个名称:

  • **世界模型(world model)**描述的是一项任务:表示足够多的变化,使系统能够推理动作的后果。
  • JEPA 是一种宽泛思想:根据上下文表征,预测一个学习得到的目标表征。
  • LeJEPA 研究结合 SIGReg 与防崩塌机制的预测式表征学习。
  • LeWM 在此基础上加入时间、动作、潜在动力学和规划循环。

本课程以 2026-06-03 修订的 LeWorldModel v3,以及冻结在 2026-05-22 的官方代码提交 8edfeb336732b5f3ce7b8b210d0ba370a09e2cac 为基准。LeJEPA v3 和 JEPA 立场论文 v0.9.2 解释的是相关思想,并不是可互换的实现。

原始 LeWM v3 使用一个共享且可训练的视觉编码器。下一观测的目标表征仍与该编码器保持梯度连接。它在训练时不使用 stop-gradient、EMA 教师或预训练视觉编码器。基准世界模型的训练不需要任务奖励或目标,但一定需要按顺序排列的动作。目标要到之后的规划阶段才会出现。

LEARN:     observations + actions -> latent dynamics + non-collapse pressure
FREEZE:    encoder and predictor
ACT:       current + goal -> CEM plans -> execute a prefix -> observe again
DIAGNOSE:  data -> representation -> dynamics -> cost -> search -> execution

容易骗过我们的把戏

设想一个“听不见”动作的预测器。记录下来的大多数 TwoRoom 行程都沿着同一条门口路线前进,因此只根据历史,也可能预测出常见的后续并得到看起来不错的损失。但到了规划阶段,“向上”“向右”和“停留”却都产生几乎一样的想象未来。此时的 CEM,就像在为一位戴着耳塞的评委举办选拔。

这个反例只能证明一点:仅仅预测常见的时间进程,还不足以构成一个动作条件规划模型。交换动作后得到不同预测,是必要证据;但这仍不能证明变化的方向、大小或长期影响是正确的。

证据凭据

本课程的证据截止日期是 2026-08-20。arXiv:2608.10145v1 独立重实现了一个单随机种子的 TwoRoom 系统,并复现了位置探针和按仓库协议执行的规划;它没有复现 PushT、OGBench-Cube 或多随机种子稳健性。arXiv:2608.12959v1 复用了同一系统,因此它是同一证据链上的后续工作,而不是第二次独立复现。

TwoRoom 让墙壁、绕路和错误代价变得容易观察。PushT 又加入接触、旋转和滑动。两个基准都无法证明模型掌握了通用物理,也不能证明它可安全控制真实机器人。教程里的故事和图示是在解释机制,并不是论文实验结果。

快速检查

  1. 为什么说 LeWM 是排练室,而不是摄像头或策略?
  2. 原始 v3 的哪些事实排除了 EMA 教师结构图?
  3. 为什么无奖励训练的世界模型在行动时仍可能需要目标?