JEPA4Japan · 教程

第 39 章——LeWM 研究中的开放问题

1,983字 5分钟阅读 #LeWorldModel#世界模型#JEPA

准确框定规划几何、防崩塌、多模态未来、分布外想象、层次结构、潜在容量和未来范式中的未决问题。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 当前课程

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

全局图景

  1. 已知海岸我们已经能说清可用的流程。
  2. 虚线海岸仍有多种解释与证据相符。
  3. 下一次航行选择一个能区分这些解释的测试。
开放问题不是一张空白愿望清单。它要包含相互竞争的假设,以及一个其结果足以改变我们判断的实验。

一个小故事:尚未完成的地图集

地图集中,船只实测过的海岸画成实线,仍可能呈现多种形状的地方则画成虚线。严谨的制图师不会拿最新旅人最喜欢的一幅图,擅自填满那些虚线区域。

本课程的坚实主干其实很克制:观察像素,把它们压缩成有用的潜在状态,想象以动作为条件的未来,用 CEM/MPC 搜索并行动,然后诊断想象在哪些地方不可靠。前沿问题则在问:什么样的几何、目标、不确定性、层次结构、支持域规则或后继范式最适合服务这条闭环。较新的论文提供候选方案和作者自报的证据;它们并不会把虚线海岸自动变成共识。

十个开放问题环绕课程主干,边界有实线也有虚线,但没有成熟度排名。

这张图用于组织问题,而不是给论文排名,也不预测哪条路线会胜出。

技术背包:十个开放问题

#开放问题相互竞争的假设一个有用的判别实验
1什么几何适合规划?欧氏邻近度、有向可达性、任务进度、轨迹代价或不确定性感知的决策排序,可能分别主导不同任务在开放房间、墙体、接触和预算场景中做匹配扫描,并与预言机排序比较
2防止崩塌是否需要全局分布匹配?完整高斯压力、子空间/局部匹配、时间中心化,或从转移中导出的动作目标可能已经足够等数据量的抗崩塌测试,再加拓扑、慢变量、尾部和规划检查
3应当怎样表示多个可能的未来?条件均值可能足以控制,也可能必须显式表示分支或分布使用校准过的多模态环境,其中均值在物理上并不真实
4怎样知道想象已经超出支持域?集成分歧、预测分布宽度、到最近数据的距离、动作条件一致性或实际误差,可能各自更合适有控制地移除支持域,再比较之后的真实滚动误差
5能否从离线行为中学到可控性?逆动作和动作敏感分支可能识别有用的控制,也可能因缺少状态条件干预而留下歧义固定状态,选择性展示或隐藏动作方向
6长程目标是否需要显式层次结构?前缀预测、采用更好代价的扁平 MPC、学得的动作块或潜在子目标,都可能各自已经足够跨视界匹配模型调用、动作、延迟和支持域预算
7潜在状态应该有多大?更大宽度可能保留罕见差异,也可能浪费容量并与低内在维度冲突在固定计算量下扫描宽度/秩,同时诊断崩塌、滚动和规划
8任务无关与任务有效的表示是否冲突?不变性可能帮助迁移,而任务上下文或特权定基也可能不可或缺分离因素的干扰项/任务干预,以及留出任务组合
9模型怎样才能从预测走向解释?探针和反事实预测可能揭示机制,也可能只有具备因果假设的干预才足以支持解释预注册干预,明确区分相关性、模型使用和因果效应
10什么可能取代或吸收 LeWM 路线?分支预测、统一 JEPA 目标、摊销式/无搜索控制、价值塑形的几何,或其他世界模型范式一套共享压力测试:预测、反事实、支持域、规划、迁移、计算与安全

这些问题彼此相互作用,却不能被压成一个总排行榜。一个模型可以预测得很好,却把计划排得很差;它可以在某个规划器下很有用,却并不具备可辨识性;它可以公开代码,却没有独立复现;它可以在某个单 GPU 预算下更快,却在支持域发生偏移的目标上更弱。

尝试推翻这个想法

构造两个系统 Cedar 和 Comet。它们的平均单步损失相同,平均成功率也相同。Cedar 能完成附近目标,却在每个隔墙目标上失败;Comet 能完成隔墙目标,却在视觉变化后失败。一个平均值让它们看起来完全一样,但它们心中的世界并不一样。

现在把目标类型、视界、支持域、视觉干预、规划器预算和失败轨迹全部公开。下一步实验自然不同:Cedar 需要几何/代价测试,Comet 需要干扰项/表示测试。这就是为什么开放问题需要一个判别实验,而不是再做一个聚合排行榜。

面对任何拟议中的后继方案,在欣赏它的名字之前,先冻结一份压力测试账本:训练信息、目标图、未来表示、动作接口、模型调用、搜索预算、硬件、数据支持域、迁移划分和安全机制。新范式可能在一列获胜,也可能在另一列失败。在声明的证据真正出现之前,“将取代 LeWM”仍只是推测。

实验凭据与证据边界

  • 基线坐标:LeWorldModel v3 与 LeJEPA v3。直接更新包括 TRM、SMWM、VLWM、PSG-JEPA、TwoRoom 复现、VIScore、ACPC、Objective Bottleneck、Traj-LeWM、SCALE、AC-MTM 和 DA-LeWM。
  • 相邻路线包括 Branch-JEPA v3、UniJEPA、Qantara 和 INTACT。它们不是 LeWM 的版本,相邻也不代表已经能够取而代之。
  • LeJEPA v3 修订于 2025-11-14;LeWM v3 修订于 2026-06-03;具名的最新直接更新是 2026-08-19 的 DA-LeWM v1。证据截止时间:2026-08-20,Asia/Tokyo。基线代码冻结在 8edfeb3;其他已检查的修订版本也冻结在附录 E 中,而不是随 main 移动。
  • 已确认基线以及最新条目中的 SMWM、PSG-JEPA、tinylab、VIScore、ACPC、Traj-LeWM、AC-MTM 和 INTACT 有作者关联代码;TRM、VLWM、SCALE 和 DA-LeWM 没有找到此类代码。独立复现只在所述 TwoRoom 环境和协议中成立。其他每项结果都必须保留作者原有的任务、监督、规划器、计算预算与假设边界。

三个快问快答

  1. 什么能把一个宽泛的未知变成科学的开放问题?
  2. 为什么相同的平均损失和成功率可能掩盖不同的世界模型失败?
  3. 一个拟议中的后继方案必须共享哪些证据字段,“更好”这个说法才有意义?