JEPA4Japan · 教程
所有教程

课程

LeWorldModel:从像素到想象

一门以图为先的课程:为机器人打造一间小小的预演室,用它选择动作,并在它想象的世界出错时及时发现。

模块
10 模块
课
48 课
预计时长
预计 24 小时
适合
适合: 希望先读懂简单故事,同时把 Python、数学和证据凭据放在手边的好奇读者。
从第 1 课开始

一张图看完整门课程

  1. 观察 相机 + 动作
  2. 打包 做成小状态
  3. 想象 在内部尝试动作
  4. 行动 选择、移动、再观察
  5. 检查 找到第一个谎言
LeWM 是机器人内部的预演室,而不是水晶球。

想象一个面对墙壁的小机器人。它看到目标在墙的另一侧。直直撞向墙壁很容易;选择门口则需要一个小小的假想世界,让机器人能在真正执行动作前先试一遍。

这就是课程主干:

观察 → 压缩 → 带着动作想象 → 搜索 → 移动一点 → 再次观察 → 诊断

TwoRoom 让错误一目了然。PushT 加入接触和旋转,因此那个简单的迷宫故事不能假装自己足以解释所有控制问题。

三张真相卡

怎样使用这张地图

先读全局图景。需要公式、张量形状、配置或来源时,再打开简短的技术背包。每一种后来的方法都留在研究前沿;它绝不会倒流回去,悄悄改写原始 LeWM v3。

课程进度

课程大纲

已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

明确模型家族、证据边界、阅读路线、教学环境,以及读者最终要构建的完整系统。

  1. 01 第 0 章——开始之前 区分 LeWM 与 LeJEPA,锁定论文和代码基线,分开已确认事实与研究前沿,并预览从 TwoRoom 到 PushT 的学习路线。 已发布

第 1 部分——世界模型:智能体内部的沙盒

建立核心直觉:在潜在空间中预测与决策相关的未来,而不是复现每一个像素。

  1. 02 第 1 章——智能体为什么需要“想象未来” 把未来预测与行动连接起来,对比反应式策略和世界模型,并定位感知、想象与动作选择中的失败。 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 理解像素误差为何可能漏掉与任务相关的结构,以及有用的潜在状态为什么必须在压缩与可预测性之间取得平衡。 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 理解编码器、目标表示和预测器,再将 JEPA 与自编码器、对比学习和生成式视频模型进行比较。 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 在引入公式前,沿着编码器、动力学预测器、SIGReg、CEM 规划器和 MPC 闭环,追踪图像历史与动作。 已发布

第 2 部分——把图像变成状态:LeWM 架构

让有序视觉轨迹穿过编码器和动作条件动力学预测器,从原始张量一直走到预测潜在状态。

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 把观测与动作表示成离线、无奖励的回合,并把数据覆盖范围视为可靠想象的边界。 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 跟踪图像经过 patch、Vision Transformer、[CLS] 摘要、投影与归一化的过程,以及最终潜在向量的形状。 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 通过 AdaLN 和因果上下文让潜在动力学以动作为条件,再比较教师强制训练与自回归规划滚动。 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 在最小示例中依次理解观测编码、动作条件化、目标构造、两项损失、梯度流、钩子和形状断言。 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

解释表示崩塌、由两部分组成的学习目标,以及原始 LeWM v3 完全端到端的训练机制。

  1. 10 第 9 章——最危险的捷径:表示崩塌 理解常量嵌入怎样满足预测损失、崩塌与过拟合有何不同,以及如何用潜在统计和近邻诊断它。 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 理解下一潜在状态 MSE、它对规划的局限,以及准确的教师强制单步与不稳定长滚动之间的差距。 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 借助各向同性高斯目标、随机投影和 Epps–Pulley 统计量,理解无需负样本或教师网络的防崩塌机制。 已发布
  4. 13 第 12 章——只保留最少却足够的数学 只推导阅读完整目标所需的预测与 SIGReg 机制,包括损失权衡系数的准确作用。 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 说明 LeWM v3 为什么既没有停止梯度、EMA 教师,也没有预训练视觉编码器,并把它的训练图与相关 JEPA 方法区分开。 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 把目标函数化为稳定训练流程,涵盖初始化、数据切片、内存、优化、投影、检查点、冒烟测试和必需指标。 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

用学到的动力学做目标条件动作搜索,同时揭示规划代价中隐藏的假设与失败模式。

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 一起编码当前图像和目标图像,滚动候选动作序列,再按终点潜在代价选择计划;训练世界模型时不需要奖励。 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 测试视觉相似性和欧氏距离何时无法表示有向可达性、障碍物、路线长度或可信规划代价。 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 实现反复候选采样、潜在模拟、精英选择和分布更新,同时权衡视界、总体规模与迭代次数。 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 只执行一小段动作,再次观测并重新规划,从而闭合控制回路,限制模型误差和环境扰动。 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 诊断误差累积、模型生成的分布偏移、潜在漂移、隐藏不确定性,以及利用模型漏洞的规划器。 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 构建向量化 CEM 滚动与终点代价,执行第一段动作,与随机和预言机基线比较,并可视化一次失败。 已发布

第 5 部分——工程复现:从论文到可运行系统

复现官方实现,并用透明的数据、计算、规划和失败分析协议评估它。

  1. 22 第 21 章——官方代码仓库与实验环境 浏览官方代码、Hydra 配置、HDF5 轨迹、单 GPU 工作流、检查点,以及从训练到评估的调用图。 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 训练一个小模型,测试崩塌以及单步与多步预测,运行 CEM,并可视化跨房间规划失败。 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 通过数据准备、模型训练、目标图像规划、指标与失败分类,从几何导航走向接触动力学。 已发布
  4. 25 第 24 章——怎样公平评估世界模型 在匹配的数据与计算预算、强基线、多个随机种子和明确条件下,报告单步、多步、闭环和规划指标。 已发布
  5. 26 第 25 章——失败诊断手册 从数据覆盖和潜在崩塌,到被忽略的动作、不稳定统计、误导性代价与停滞规划器,逐层追踪失败。 已发布

第 6 部分——LeWM 究竟学到了什么?

检查潜在表示编码了什么,同时让探针、可视化和惊讶实验留在各自合法的证据边界内。

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 用合适的基线探测位置、速度、角度和目标距离,同时区分可解码性、模型使用、相关性与因果性。 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 检查矩、协方差谱、有效维度、近邻、轨迹连续性和路径几何,同时避免过度解读 t-SNE、UMAP 或解码器。 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 比较正常动力学与受控违背,用潜在预测误差定义惊讶,并说明所得证据能证明什么、不能证明什么。 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 用可预测性、可解码性、可控性、泛化、反事实一致性、因果性和规划效用测试,代替宽泛主张。 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

依据把预测准确度与有用、有支持、长视界控制分隔开的失败机制,组织后续工作。

  1. 31 第 30 章——训练目标与规划目标之间的差距 比较局部 MSE 与全局可达性、有向时间距离、多时间尺度预测和滚动一致性,同时不改写原始 LeWM。 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 测试状态可辨识性、物理不变量和反事实动作敏感性,同时把 PhyLatent 视为较新的诊断提议,而不是 LeWM 基线。 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 研究低维几何、邻域扭曲和时间漂移,以及作为 SIGReg 替代方案提出的子空间、时间中心化与尾部匹配方法。 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 比较动作前缀预测、并行未来、宏动作与层次规划,同时正视不受支持的潜在子目标和分布外搜索。 已发布
  5. 35 第 34 章——从位置距离到任务进度 区分距离、可达性与分阶段任务进度,包括进度感知和双曲方法,同时不把任务先验伪装成一般理解。 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 考察任务身份、视觉变化、潜在漂移、辅助深度、预测器容量、部分可观测性、机器人噪声,以及仿真到现实的证据差距。 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 用受假设约束的可辨识性结果指导实验,同时明确标出平稳性、加性噪声、线性、可观测性与多模态。 已发布

第 8 部分——从复现者到研究者

把已诊断的失败机制转化为受控实验、可执行项目和精确定义的开放问题。

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 用反例、匹配的容量和计算量、消融、预言机条件,以及对负结果的诚实报告,隔离一种失败机制。 已发布
  2. 39 第 38 章——十二个可执行的研究项目 围绕可达性、不确定性、多步目标、时间层次、拓扑、可控性、支持域约束、语言目标和迁移,设计具体研究。 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 准确框定规划几何、防崩塌、多模态未来、分布外想象、层次结构、潜在容量和未来范式中的未决问题。 已发布

附录

把数学、实现、配置、证据、术语、复现和审阅参考资料放在主学习路线手边。

  1. 41 附录 A——最低限度的必需数学工具箱 复习向量、批次、协方差、高斯几何、随机投影、梯度、MSE、自回归误差、蒙特卡洛估计和 CEM 概率。 已发布
  2. 42 附录 B——PyTorch 实现速查 快速查找数据加载、Transformer 输入、因果掩码、AdaLN、SIGReg、向量化滚动、CEM、混合精度和检查点的精炼模式。 已发布
  3. 43 附录 C——完整张量形状表 跟踪张量从 [B,T,C,H,W] 经 [B,T,D] 到 [B,N,H,D] 的变化,包括各维含义、广播规则和常见错误。 已发布
  4. 44 附录 D——实验配置卡 比较 TwoRoom、Reacher、PushT、OGBench-Cube、教学、论文复现和资源受限的单 GPU 配置。 已发布
  5. 45 附录 E——论文时间线与证据等级 追踪每篇论文改动的系统层、目标失败、版本与发布日期、公开代码、证据强度、复现状态和泛化限制。 已发布
  6. 46 附录 F——术语表 用形式化定义、一句话解释、日常类比和常见误解来定义核心术语。 已发布
  7. 47 附录 G——复现检查清单 记录软件、硬件、数据哈希、随机种子、参数量、预算、基线、回合、失败案例、原始日志和检查点。 已发布
  8. 48 附录 H——专家审阅检查清单 审计训练图、变体边界、探针解读、基准泛化、因果语言、理论假设、负结果和代码路径。 已发布