课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
全局图景
- 何时?每个版本都有公开日期。
- 哪里?它只改变系统中的某一层。
- 什么证据?论文、代码、定理与复现并不相同。
一个小故事:有三排书架的图书馆
一位图书管理员把每本书都放在同一排竖直书架上。昨天发布的预印本摆在一条旧定理上方,而“代码公开”的贴纸看起来就像“已复现”的奖章。读者自然会把摆放高度误当成证据强度。
这本账册使用三排彼此独立的书架:时间、系统层级与证据。方法定义可以从原始论文中得到核验,而实验结果仍可能只由作者报告。定理在其假设范围内可以严谨成立,却未必拥有广泛的实证支持。公开作者代码提升了可检查性,但不等于独立复现。
证据截止时间为 2026-08-20, Asia/Tokyo。除非明确标注为代码提交或发布版本,日期均指 arXiv 的提交或修订日期。此处唯一确认的独立复现,是 arXiv:2608.10145v1 中明确陈述的 TwoRoom 重新实现与实验协议。

后来的卡片可以改变某一层或增加一个头部,但它不会穿越回过去,重新绘制最初的 LeWorldModel v3。
基线与理论锚点
| 公开版本/日期 | 身份与层级 | 证据边界 |
|---|---|---|
| LeJEPA v3:v1 2025-11-11、v2 11-12、v3 11-14 | 表征目标与 SIGReg 动机 | 原始方法及受假设约束的理论;有公开代码仓库,但此处未固定快照;它不是控制系统,也不是独立复现 |
| LeWorldModel v3:v1 2026-03-13、v2 03-24、v3 06-03 | 基线:动作条件端到端模型,加上潜在空间中的 CEM/MPC | 冻结代码 8edfeb3,2026-05-22;一个共享的可训练编码器,后继目标保持连接,无 EMA 教师或预训练视觉编码器;基准结果由作者报告 |
| Passive identifiability v1,2026-05-25 | 指定的被动线性/高斯/平稳类别中的总体可辨识性 | 受假设约束的正交恢复;代码 de7503f,2026-05-27;并未覆盖完整基准 |
| Controlled identifiability v2:v1 2026-07-24、v2 07-27 | 具有状态条件动作激励的受控条件均值可辨识性 | 受假设约束的理论;未发现作者关联代码;它不是适用于任意非线性或多模态未来的定理 |
| SIGReg as Variational Free Energy v1,2026-07-15 | 在编码器噪声恒定且精确执行高斯约束时的理论解释 | 不是可辨识性结论;实证验证仍未完成;有限小批量 SIGReg 并非精确约束 |
直接前沿账本
下表每一行都是后来出现的路线,绝不是被悄悄加进原始 v3 的组成部分。“AR”表示实验结果为作者报告(author-reported);“代码”表示可检查的作者关联实现,而不是独立复现。
| 版本/日期 | 改动层级与状态 |
|---|---|
| RC-aux v1,2026-05-08 | 预算条件下的有向可达性与多视界预测;AR;代码 ecb4496,2026-07-02;该分数不是逻辑判定器 |
| Latent Geometry Beyond Search v2:v1 05-09、v2 06-05 | 在预训练 LeWM 上摊销得到的目标条件逆动力学规划器;AR 中的 100–130× 与 7/8 比较受实验协议约束;代码 48c45b1 |
| Sub-JEPA v1,2026-05-10 | 冻结的随机正交子空间正则化;AR;代码 ef945ed,2026-07-27;有限个视图无法认证拓扑 |
| stable-worldmodel v1,2026-05-20 | 基础设施/评估层;代码 addbab4,2026-08-18;正式发布版仍为 2026-06-06 的 0.1.1;基础设施本身无法认证公平性 |
| TRM v1,2026-05-21 | 事后计算、与视界匹配的轨迹可达性度量;AR;未发现作者关联代码 |
| Subspace-Decomposed JEPA v1,2026-05-29 | 进展/内容子空间;AR;代码 1cc1210 |
| SMWM v1,2026-06-18 | 用逆动力学回归取代高斯防坍缩机制;AR;代码 9d22bcc,2026-06-30 |
| VLWM v1,2026-06-19 | 可变长度的直接潜在预测;AR 中 13% 的平均提升使用随机种子 3072,并针对每个 (dataset, Δ) 事后选择最佳 P1/P2/P3;未发现代码 |
| Fast-LeWM v1,2026-06-24 | 并行动作前缀视界预测;AR 速度取决于硬件/预算;代码 492752d,2026-08-06;不是多模态预测 |
| Hi-LeWM v2:v1 07-14、v2 07-15 | 在冻结的低层 LeWM 之上加入高层潜在子目标;AR 报告了支持集不匹配导致的失败与有条件的收益;代码 4bb21a2 及 Zenodo |
| Depth-Regularized JEPA v1,2026-07-15 | 在真实农业视频上使用深度监督与仅训练时容量;AR 离线探针/展开,而非在线规划;未发现代码 |
| Temporal-Distance JEPA v2:v1 07-28、v2 07-29 | 有向时间代价与展开一致性;AR;代码 b4c17ca;后来的分离选择不会重新定义 v3 |
| TC-LeWM v2:v1 07-29、v2 07-31 | 时间居中的 SIGReg;AR 的多任务 LIBERO 行为克隆,而非基线 MPC;未发现代码 |
| INTACT v1,2026-07-28 | LeWM 任务上的无搜索动作接口;AR;代码 a3a7bf9 |
| QQWorld v1,2026-07-30 | 投影上的分位数匹配,可选用已分离的历史样本队列;AR;未发现代码;其队列不是 v3 的目标分离 |
| ProWorld v1,2026-08-03 | 事后进展顺序、双曲几何与中间代价;AR 存在绕行/回溯限制;未发现代码 |
| PhyLatent v1,2026-08-06 | 模拟器状态对齐与诊断;AR;未发现代码;其中绘制的停止梯度基线不能用于定义原始 v3 |
| PSG-JEPA v1,2026-08-07 | 仅训练时使用本体感知与关节变化对齐;AR 的 Mobile ALOHA 下游策略证据,并非 v3 MPC 或安全性证据;代码 8de96b8,2026-08-14 |
| TwoRoom reproduction v1,2026-08-10 | 独立复现仅限其 TwoRoom 重新实现/实验协议;tinylab efa9e5d;历史上的 100/150 属于 v1/v2,而当前 v3 写的是 25/50 |
| VIScore v2:v1 08-11、v2 08-12 | Veracity、Influence、Sobriety 三类诊断;AR;代码 bbb60fc |
| Objective Is the Bottleneck v1,2026-08-13 | 对已审计检查点的后续研究:更改终端代价后,offset-100 的一项结果从 26% 变为 98%;作者分析,受 TwoRoom/实验协议约束 |
| ACPC v1,2026-08-13 | 成对散度、Invariance Radius、Separation Rate 与规划器代价界;AR;代码 90d4276 |
| Traj-LeWM v1,2026-08-14 | 学习得到的目标条件轨迹代价与端点分数;AR;代码 67577fa |
| SCALE v1,2026-08-17 | 将潜在成对距离与特权状态距离对齐;AR;未发现代码 |
| AC-MTM v1,2026-08-18 | 对比式逆动作防坍缩;在信息充分、可观测的连续动作下提供 AR;代码 43c96f6 |
| DA-LeWM v1,2026-08-19 | Plan–Real/CEM 阶段排名一致性与决策对齐目标;AR;未发现代码 |
相邻路线与边界
这项 2024 年的分层 RSSM 研究发表于 2024-06-01;“HWM”是课程中的简称,并非其正式名称或 LeWM 变体。价值引导的 JEPA 规划发表于 2025-12-28。Temporal Straightening v3于 2026-08-11 修订;其公开代码 9efb6fd早于 v3。Qantara、Branch-JEPA v3、UniJEPA、单调规划代价与强化规划都是相邻路线,而非 LeWM 发布版本。
ContactGuard、Calibrated Predictive Safety、UWM-JEPA 与 Policy-Guided World Model Planning 不在这份直接账本中,因为它们并未直接定义或诊断此处审计的基线主张。排除它们是在划定范围,而不是评价其质量。
试着推翻这份目录
论文 A 有公开的作者代码和昨天刚得到的结果。论文 B 有一条更早、且明确列出假设的定理。论文 C 的一项已有记录的结果被另一个团队重复出来。询问哪篇论文“最成熟”并没有唯一答案:A 具备可检查性,B 提供受假设约束的证明,C 则在其协议下拥有独立实证证据。
安全的做法是一套机械流程:识别确切主张;附上版本与改动层级;区分方法定义和实验结果;分别记录作者代码与独立复现;然后收窄表述。代码或复现字段留空,表示“截至截止时间尚未发现”,而不是“其值为假”。
证据收据
上文的论文身份与机制来自一手来源。除非某行明确写明“独立”,实验结果均为作者报告。理论结论仅在其假设内成立。代码可用绝不会把作者报告升级为复现证据。研讨会接收、发布时间较近、一个基准或一条定理,都不能改写原始 v3,也不能成为领域共识。
三个快速问题
- 为什么日期、公开代码与独立复现要分别记录在三个不同字段中?
- 此处哪一行得到了独立复现,其范围究竟有多窄?
- 未来更新在填写一个空白代码字段之前,必须记录哪些信息?