JEPA4Japan · 教程

第 1 章——智能体为什么需要“想象未来”

1,185字 3分钟阅读 #LeWorldModel#世界模型#JEPA

把未来预测与行动连接起来,对比反应式策略和世界模型,并定位感知、想象与动作选择中的失败。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 当前课程
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 看见墙壁 + 门口
  2. 分支尝试多个动作
  3. 比较哪种未来更有帮助?
  4. 重规划再看一次
识别描述的是现在。行动则需要比较不同未来——包括一条起初看似更糟的绕路。

较短的直线撞上墙壁,较长的路线却能穿过门口到达目标。

一个小故事

一个机器人把墙壁、门口和目标都看得一清二楚,却仍然撞上了墙,因为它总选择此刻看起来最接近目标的移动方向。真正有用的路线反而会先远离目标,到达门口,穿过墙壁,再折返回来。

只看见名词还不够。行动需要目的、后果模型以及时间。直接策略同样可以很强大,也可以利用历史;差别在于,世界模型规划器会在决策时显式展开多个候选未来并进行搜索。

真正规则

在本课程中,“想象”指的是条件计算,而不是人类脑海中的电影:

current latent history + proposed action -> predicted next latent

LeWM 的编码器在潜在空间中描述当前情形。它的预测器会问:“如果执行这个动作,接下来会发生什么?”一个有用的决策模拟器需要三样东西:

  • 动作敏感性: 后果不同的动作能够改变预测。
  • 滚动展开(rollout): 预测状态可以被再次向前推进。
  • 决策接口: 一个代价函数能够将想象结果与目标进行比较。

核心模型预测的是潜在状态,而不是未来视频。论文中的辅助解码器用于检查,不是训练目标,也不参与规划。单个确定性预测还可能掩盖多个合理未来;基准接口并不提供经过校准的不确定性分布。

MPC 让计划始终保持暂定:提出序列、想象终点、为其评分、执行预设前缀,然后再次观察。在论文报告的 LeWM v3 设置中,规划时域为五个模型步,并且重规划前会执行完这五步。每个模型步对应五个环境动作,因此要经过 25 个环境步才获得反馈。每执行一个动作就重规划也是有效的 MPC,但那并不是论文报告的时序。

基准的终点分数,是预测终点与编码后目标之间的平方欧氏距离。这是一把方便的潜在空间直尺,并不等同于可达性、路径长度或行程时间。

容易骗过我们的把戏

去掉前瞻能力,贪心智能体就会贴着墙走,因为每次立即朝向目标的移动看起来都不错。去掉反馈,一条起初合理的路线也可能在可观察的障碍出现后失效。加入 MPC 后,智能体也许能改道——但前提是观测、表征、模型、代价和搜索都确实有用。

同一次碰撞可能源自不同位置:

  1. 感知: 潜在状态遗漏了墙壁或运动。
  2. 想象: 预测器穿墙而过,或随时间漂移。
  3. 选择: 代价函数偏爱错误终点,或 CEM 没有找到门口。

如果模型每轮都系统性地重画同一条虚假捷径,重规划也无法修复它。看到最终失败,并不能确定失败原因。

证据凭据

LeWorldModel v3 和冻结的官方仓库 支持以下机制:像素编码器、动作条件潜在预测器、自回归滚动展开、终端潜在代价、CEM 搜索和可配置的 MPC 前缀。仓库将部分规划与评估工作委托给 stable-worldmodel;必须记录实际采用的求解器约定,不能靠猜测。

TwoRoom 绕路、门被堵住的故事以及三段式诊断,都是教学构造。它们说明前瞻和反馈为什么可能重要;并不能证明所有直接策略都会失败,也不能证明所有基于模型的控制器都会成功。

快速检查

  1. 为什么远离目标可能是正确的第一个动作?
  2. 怎样的动作交换结果会警告你:预测器忽略了控制信号?
  3. 即使每次都有新观测,MPC 仍可能反复犯哪一种错误?