JEPA4Japan · 教程

第 38 章——十二个可执行的研究项目

2,076字 5分钟阅读 #LeWorldModel#世界模型#JEPA

围绕可达性、不确定性、多步目标、时间层次、拓扑、可控性、支持域约束、语言目标和迁移,设计具体研究。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 当前课程
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

全局图景

  1. 一个问题点名一种失败,并给出一个预测。
  2. 一个小实验在沙盒中只改变一个机制。
  3. 一种输法在看到分数前先写下证伪条件。
当一个研究想法拥有锁定基线、可测量的干预、特权信息标记、预算,以及一个可能削弱它的结果时,它才变得可执行。

一个小故事:十二条船

港口里停着十二条船。有的测试规划几何,有的测试不确定性,有的测试表示结构,还有的测试搜索或迁移。没有一条船是“冠军”。每条船都携带一张简短的启航卡:问题、唯一改动的部分、测量项,以及一个会让它返港的条件。

十二条编号项目船组成四支规模相同的舰队,围绕共享诊断浮标分布,没有成熟度排名。

这些是实验计划,不是新的实验结果。泊位相同并不表示它们的难度、前景或证据相同。

技术背包:十二张启航卡

所有卡片都从一个冻结的 LeWM 基线出发,使用回合不重叠的数据、明确声明的随机种子、匹配的训练与规划预算、原始日志,并同时报告正/零/负结果。只要仿真器状态、最短路径、奖励、深度或语言注释被用于训练或评估组件,就要将它们标记为特权信息。

#项目改动与测量会削弱该想法的结果
1潜在距离与真实最短路径在 TwoRoom 中计算潜在点对距离与预言机测地距离的相关性;按同室/隔墙和近/远点对分层在留出布局上相关性消失,或更好的相关性并未改善候选排序
2有向可达性从轨迹偏移和构造的负样本中学习一个预算条件有序分数;测试留出方向和视界分数是对称的、跟随数据集频率,或无法匹配预言机预算排序
3预测不确定性校准预测分布宽度或误差分箱,并将信心度与之后的自我馈入滚动误差比较信心度很尖锐却未校准,或它只在跟踪视界长度
4集成认知不确定性训练随机种子匹配或 bootstrap 的多个模型;比较支持内外的分歧成员在不受支持的错误捷径上保持一致,或分歧只反映优化噪声
5多步训练在保持推理方式和预算不变的前提下,增加一个明确声明的滚动一致性或多视界损失单步损失改善,但长滚动/规划变差,或增益来自额外更新
6时间层次潜在变量学习粗粒度状态或动作块,并审计重建、复用、支持和两层代价高层误差、不受支持的子目标,或额外开销超过节省的低层计算
7局部高斯结构、全局拓扑对局部邻域或子空间正则化,同时分别测量全局展开程度和门口连续性抗崩塌能力变弱,或去掉额外容量后拓扑收益消失
8动作可控子空间将动作敏感变化与内容分开;测试干预、干扰变化和弱控制变量“控制”空间编码背景/任务 ID,或丢失缓慢但任务关键的状态
9反事实动力学探针在匹配状态下,将对已记录动作和留出动作的预测与仿真器转移比较分支分离存在但后果不正确,或只有已记录动作是准确的
10受支持约束的 CEM惩罚支持距离,或在经验动作/宏动作锚点附近搜索;报告约束强度严格门控阻止了有效的新绕行,而宽松门控仍然放进模型漏洞
11从目标图像到语言目标增加一个明确声明的语言到目标接口;留出物体—关系组合,并与预言机目标编码比较成功依赖记忆语句或成对目标泄漏,而非组合能力
12跨环境潜在对齐使用成对锚点对齐环境,然后测试留出动力学、视角和任务对齐改善了探针,却损害任一世界中的转移预测或规划

项目 1–2 区分距离与有向、有预算的可行性。项目 3–4 区分预测宽度、集成分歧、支持距离和实际误差。项目 5–6 区分更长训练目标与层次结构。项目 7–9 询问动作真正需要什么表示结构。项目 10–12 将压力转移到搜索、目标和迁移。在每张卡片分别赢得自己的测试之前就把它们组合起来,会摧毁诊断性。

尝试推翻这个想法

受支持约束的 CEM 是一种很好的自我攻击。在一个 TwoRoom 布局中,不受约束的优化器采取了不可能的捷径。适度的支持规则引导它穿过门口。然后,再引入一条训练轨迹中没有出现过、但真实可行的新绕行。过于严格的规则会挡住唯一能够成功的路径。

扫描支持惩罚,并展示两类失败。预言机可行路线标签只能用于评估。如果最佳阈值随目标类型而变,就报告这种交互;不要把它隐藏在一个平均值里。即使不存在普适阈值,该项目在科学上仍然成功,因为它已经绘制出模型漏洞与搜索过度保守之间的取舍。

每张卡都需要一项移除测试:对几何问题拆除墙面;对可控性问题拉平动作覆盖;对不确定性问题注入受控的超支持样本;对定基问题打乱特权标签;对对齐问题移除成对锚点;对组合问题留出语言组合。一个只能在简单条件下站住的结果,还配不上宽泛的声明。

实验凭据与证据边界

  • 这些卡片是教程生成的假设,而不是已报告的改进。直接灵感来源包括 LeWorldModel v3、RC-aux、TRM、Sub-JEPA、SMWM、VLWM、Temporal-Distance JEPA、Fast-LeWM、Hi-LeWM 和 PSG-JEPA。
  • 后续诊断与决策路线包括 TwoRoom 复现、VIScore、ACPC、Objective Bottleneck、Traj-LeWM、SCALE、AC-MTM 和 DA-LeWM。除明确限定的 TwoRoom 重新实现外,它们的评估均为作者自报。
  • 已找到 LeWM、RC-aux、Temporal-Distance JEPA、Sub-JEPA、Fast-LeWM、Hi-LeWM、stable-worldmodel、passive-identifiability、SMWM、PSG-JEPA、tinylab、VIScore、ACPC、Traj-LeWM 和 AC-MTM 的公开固定实现。截止时未找到 TRM、VLWM、SCALE、DA-LeWM、PhyLatent、TC-LeWM、QQWorld、ProWorld、controlled-identifiability 或 2024 年“HWM”课程简称路线的实现。公开代码不等于独立复现。
  • 来源版本时间从 2024-06-01 到 2026-08-19 的 DA-LeWM v1;证据截止时间为 2026-08-20,Asia/Tokyo。允许的动词是“测试”、“假设”、“证伪条件”和“在该锁定设置下受到支持”——而不是“将会改善”、“解决不确定性”、在特权标签训练模型时仍声称“仅像素”,或“证明了组合理解”。

三个快问快答

  1. 哪五个字段能把一个研究想法变成可执行的启航卡?
  2. 为什么集成分歧和实际滚动误差是两种不同的仪器?
  3. 支持约束如何可能同时帮助和伤害同一个规划器?