JEPA4Japan · 教程

附录 E——论文时间线与证据等级

2,695字 8分钟阅读 #LeWorldModel#世界模型#JEPA

追踪每篇论文改动的系统层、目标失败、版本与发布日期、公开代码、证据强度、复现状态和泛化限制。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 当前课程
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

全局图景

  1. 何时?每个版本都有公开日期。
  2. 哪里?它只改变系统中的某一层。
  3. 什么证据?论文、代码、定理与复现并不相同。
论文更新,只代表它更新——并不自动代表证据更强。每项主张都必须保留其确切版本、改动层级、证据类型、代码状态与复现范围。

一个小故事:有三排书架的图书馆

一位图书管理员把每本书都放在同一排竖直书架上。昨天发布的预印本摆在一条旧定理上方,而“代码公开”的贴纸看起来就像“已复现”的奖章。读者自然会把摆放高度误当成证据强度。

这本账册使用三排彼此独立的书架:时间、系统层级与证据。方法定义可以从原始论文中得到核验,而实验结果仍可能只由作者报告。定理在其假设范围内可以严谨成立,却未必拥有广泛的实证支持。公开作者代码提升了可检查性,但不等于独立复现。

证据截止时间为 2026-08-20, Asia/Tokyo。除非明确标注为代码提交或发布版本,日期均指 arXiv 的提交或修订日期。此处唯一确认的独立复现,是 arXiv:2608.10145v1 中明确陈述的 TwoRoom 重新实现与实验协议。

系统图将数据、正则化、动力学、代价、搜索、层级与评估分别置于不同层。

后来的卡片可以改变某一层或增加一个头部,但它不会穿越回过去,重新绘制最初的 LeWorldModel v3。

基线与理论锚点

公开版本/日期身份与层级证据边界
LeJEPA v3:v1 2025-11-11、v2 11-12、v3 11-14表征目标与 SIGReg 动机原始方法及受假设约束的理论;有公开代码仓库,但此处未固定快照;它不是控制系统,也不是独立复现
LeWorldModel v3:v1 2026-03-13、v2 03-24、v3 06-03基线:动作条件端到端模型,加上潜在空间中的 CEM/MPC冻结代码 8edfeb3,2026-05-22;一个共享的可训练编码器,后继目标保持连接,无 EMA 教师或预训练视觉编码器;基准结果由作者报告
Passive identifiability v1,2026-05-25指定的被动线性/高斯/平稳类别中的总体可辨识性受假设约束的正交恢复;代码 de7503f,2026-05-27;并未覆盖完整基准
Controlled identifiability v2:v1 2026-07-24、v2 07-27具有状态条件动作激励的受控条件均值可辨识性受假设约束的理论;未发现作者关联代码;它不是适用于任意非线性或多模态未来的定理
SIGReg as Variational Free Energy v1,2026-07-15在编码器噪声恒定且精确执行高斯约束时的理论解释不是可辨识性结论;实证验证仍未完成;有限小批量 SIGReg 并非精确约束

直接前沿账本

下表每一行都是后来出现的路线,绝不是被悄悄加进原始 v3 的组成部分。“AR”表示实验结果为作者报告(author-reported);“代码”表示可检查的作者关联实现,而不是独立复现。

版本/日期改动层级与状态
RC-aux v1,2026-05-08预算条件下的有向可达性与多视界预测;AR;代码 ecb4496,2026-07-02;该分数不是逻辑判定器
Latent Geometry Beyond Search v2:v1 05-09、v2 06-05在预训练 LeWM 上摊销得到的目标条件逆动力学规划器;AR 中的 100–130× 与 7/8 比较受实验协议约束;代码 48c45b1
Sub-JEPA v1,2026-05-10冻结的随机正交子空间正则化;AR;代码 ef945ed,2026-07-27;有限个视图无法认证拓扑
stable-worldmodel v1,2026-05-20基础设施/评估层;代码 addbab4,2026-08-18;正式发布版仍为 2026-06-06 的 0.1.1;基础设施本身无法认证公平性
TRM v1,2026-05-21事后计算、与视界匹配的轨迹可达性度量;AR;未发现作者关联代码
Subspace-Decomposed JEPA v1,2026-05-29进展/内容子空间;AR;代码 1cc1210
SMWM v1,2026-06-18用逆动力学回归取代高斯防坍缩机制;AR;代码 9d22bcc,2026-06-30
VLWM v1,2026-06-19可变长度的直接潜在预测;AR 中 13% 的平均提升使用随机种子 3072,并针对每个 (dataset, Δ) 事后选择最佳 P1/P2/P3;未发现代码
Fast-LeWM v1,2026-06-24并行动作前缀视界预测;AR 速度取决于硬件/预算;代码 492752d,2026-08-06;不是多模态预测
Hi-LeWM v2:v1 07-14、v2 07-15在冻结的低层 LeWM 之上加入高层潜在子目标;AR 报告了支持集不匹配导致的失败与有条件的收益;代码 4bb21a2 及 Zenodo
Depth-Regularized JEPA v1,2026-07-15在真实农业视频上使用深度监督与仅训练时容量;AR 离线探针/展开,而非在线规划;未发现代码
Temporal-Distance JEPA v2:v1 07-28、v2 07-29有向时间代价与展开一致性;AR;代码 b4c17ca;后来的分离选择不会重新定义 v3
TC-LeWM v2:v1 07-29、v2 07-31时间居中的 SIGReg;AR 的多任务 LIBERO 行为克隆,而非基线 MPC;未发现代码
INTACT v1,2026-07-28LeWM 任务上的无搜索动作接口;AR;代码 a3a7bf9
QQWorld v1,2026-07-30投影上的分位数匹配,可选用已分离的历史样本队列;AR;未发现代码;其队列不是 v3 的目标分离
ProWorld v1,2026-08-03事后进展顺序、双曲几何与中间代价;AR 存在绕行/回溯限制;未发现代码
PhyLatent v1,2026-08-06模拟器状态对齐与诊断;AR;未发现代码;其中绘制的停止梯度基线不能用于定义原始 v3
PSG-JEPA v1,2026-08-07仅训练时使用本体感知与关节变化对齐;AR 的 Mobile ALOHA 下游策略证据,并非 v3 MPC 或安全性证据;代码 8de96b8,2026-08-14
TwoRoom reproduction v1,2026-08-10独立复现仅限其 TwoRoom 重新实现/实验协议;tinylab efa9e5d;历史上的 100/150 属于 v1/v2,而当前 v3 写的是 25/50
VIScore v2:v1 08-11、v2 08-12Veracity、Influence、Sobriety 三类诊断;AR;代码 bbb60fc
Objective Is the Bottleneck v1,2026-08-13对已审计检查点的后续研究:更改终端代价后,offset-100 的一项结果从 26% 变为 98%;作者分析,受 TwoRoom/实验协议约束
ACPC v1,2026-08-13成对散度、Invariance Radius、Separation Rate 与规划器代价界;AR;代码 90d4276
Traj-LeWM v1,2026-08-14学习得到的目标条件轨迹代价与端点分数;AR;代码 67577fa
SCALE v1,2026-08-17将潜在成对距离与特权状态距离对齐;AR;未发现代码
AC-MTM v1,2026-08-18对比式逆动作防坍缩;在信息充分、可观测的连续动作下提供 AR;代码 43c96f6
DA-LeWM v1,2026-08-19Plan–Real/CEM 阶段排名一致性与决策对齐目标;AR;未发现代码

相邻路线与边界

这项 2024 年的分层 RSSM 研究发表于 2024-06-01;“HWM”是课程中的简称,并非其正式名称或 LeWM 变体。价值引导的 JEPA 规划发表于 2025-12-28。Temporal Straightening v3于 2026-08-11 修订;其公开代码 9efb6fd早于 v3。Qantara、Branch-JEPA v3、UniJEPA、单调规划代价与强化规划都是相邻路线,而非 LeWM 发布版本。

ContactGuard、Calibrated Predictive Safety、UWM-JEPA 与 Policy-Guided World Model Planning 不在这份直接账本中,因为它们并未直接定义或诊断此处审计的基线主张。排除它们是在划定范围,而不是评价其质量。

试着推翻这份目录

论文 A 有公开的作者代码和昨天刚得到的结果。论文 B 有一条更早、且明确列出假设的定理。论文 C 的一项已有记录的结果被另一个团队重复出来。询问哪篇论文“最成熟”并没有唯一答案:A 具备可检查性,B 提供受假设约束的证明,C 则在其协议下拥有独立实证证据。

安全的做法是一套机械流程:识别确切主张;附上版本与改动层级;区分方法定义和实验结果;分别记录作者代码与独立复现;然后收窄表述。代码或复现字段留空,表示“截至截止时间尚未发现”,而不是“其值为假”。

证据收据

上文的论文身份与机制来自一手来源。除非某行明确写明“独立”,实验结果均为作者报告。理论结论仅在其假设内成立。代码可用绝不会把作者报告升级为复现证据。研讨会接收、发布时间较近、一个基准或一条定理,都不能改写原始 v3,也不能成为领域共识。

三个快速问题

  1. 为什么日期、公开代码与独立复现要分别记录在三个不同字段中?
  2. 此处哪一行得到了独立复现,其范围究竟有多窄?
  3. 未来更新在填写一个空白代码字段之前,必须记录哪些信息?