JEPA4Japan · 教程

附录 H——专家审阅检查清单

2,696字 6分钟阅读 #LeWorldModel#世界模型#JEPA

审计训练图、变体边界、探针解读、基准泛化、因果语言、理论假设、负结果和代码路径。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 当前课程

全局图景

  1. 机器对吗?追溯计算图与版本。
  2. 证据对吗?探针、因果、定理与基准测试各不相同。
  3. 范围对吗?明确条件、失败案例与可复现路径。
专家评审会审查:论断中的每一个词,是否都对应于正确的模型、证据类型、条件和可检查路径。

一个小故事:八位检查员

一篇论文行文流畅、图表精美,表格中的小数也排列得整整齐齐。八位检查员仍然拦下了它:一位发现了一个凭空捏造的教师网络;另一位发现有人把后来的预印本偷渡进了 v3;其余人则追问:探针究竟证明了什么、基准测试条件去了哪里、“导致”这一表述是否合理、哪些定理假设适用、失败的随机种子在哪里,以及为什么代码链接指向不断变动的 main。

八位检查员围在同一篇论文周围,各自把守一道独立关卡,分别检查计算图、版本、探针、范围、因果关系、理论、负面证据和可复现路径。

打勾并不等于证据。每一次通过都必须指向一手来源、冻结版本的实现、受控实验、明确假设、原始结果或声明为教程构造的内容。

评审前,应把“LeWM 有效”改写成一个可检验的句子,其中包含主体、机制、模型版本、环境、数据、规划器/预算、证据类型和结论强度。

八道关卡检查清单

H.1 原始训练计算图是否准确?

  • 一个共享的可训练视觉编码器处理上下文观测和移位后的下一时刻观测。
  • 移位后的目标由同一个模型编码,并且不进行梯度分离;预测梯度可以到达两条相连的编码器路径。
  • 动作与状态转移对齐,并作为预测器的条件;SIGReg 对观测嵌入的总体分布进行正则化。
  • 原始 v3 不包含停止梯度目标、EMA 教师或预训练视觉编码器。
  • 目标图像、CEM、奖励、探针和可选解码器均处于基线训练路径之外。

通过这道关卡只能证明计算图的身份及可能的梯度路径,不能证明不会坍塌、学到了物理规律、滚动预测准确或规划成功。

H.2 基线方法与后续路线是否已分开?

  • 为每一种后续方法配备“护照”:标题、精确版本/日期、改动的层、所针对的失败模式、证据等级、代码状态和独立复现状态。
  • 仅在引用处将 LeJEPA 用作动机或理论依据;绝不能把后来的梯度分离、辅助头、代价函数、层级结构或教师模型引入 v3。
  • 区分“定义/提出”“作者报告”“在假设下成立的定理”“已独立复现”和“教程构造”。
  • 将新近程度、论文接收情况和作者公开代码视为彼此独立的事实,而不是一条证据等级阶梯。

H.3 对探针和图像的解读是否克制?

  • 记录探针的类别/容量、训练/测试划分、预处理的拟合方式、对 episode 泄漏的控制、随机打乱标签实验,以及简单基线/原始特征基线。
  • 应表述为“在此协议下可线性解码”,而不是“模型学会了/使用了/理解了该变量”。
  • 将 t-SNE/UMAP、重建图像、潜在轨迹和预期违背(VoE)惊讶度视为条件化视图,而不是语义或直觉物理规律的证明。
  • 如果声称模型使用了某信息或某因素具有因果作用,应增加干预实验,并披露其副作用。

H.4 基准测试论断是否保留了相应条件?

  • 明确附上环境/任务、数据、模型、规划器、动作/搜索/计算预算、预训练、随机种子策略、episode 台账、指标和硬件计时条件。
  • 检查每个速度倍数的分母:模型调用次数、批处理、渲染、候选数量、规划时域、GPU,以及是否计入预训练。
  • 严格区分适用范围:TwoRoom 的拓扑结构、PushT 的二维接触、仿真的 Reacher 和仿真的 OGBench-Cube,本身并不能证明方法适用于通用机器人、具备物理理解能力或具有安全性。
  • 保留作者报告的弱点,并将可能的解释表述为“可能”,而非已经诊断出的原因;检查目标分布和失败分布,而不能只看均值。

H.5 语言表述是否区分相关性与因果性?

  • 圈出诸如“与速度相关,因此使用了速度”或“SIGReg 改变了成功率,因此高斯性导致了物理规律”之类的逻辑跳跃。
  • 挑战最接近的替代解释:在改变外观时保持物理状态不变;在动力学固定时替换代价函数;在代价函数固定时替换动力学;使用预言机单元定位瓶颈。
  • 请记住,一项消融可能同时改变容量、优化、支持集和搜索查询。因果措辞应与干预实际隔离出的因素相匹配。

H.6 定理假设是否已明确附列?

  • 在必要处明确指出平稳性、转移/噪声族、观测充分性/可逆性、高斯/精确约束、维度匹配、预测器表达能力、总体/全局最优、信号分离,以及以状态为条件的动作激励。
  • 将结论保持在有限范围内:正交恢复不会产生由人命名的坐标轴;受控理论识别的是条件均值,而非每一种多模态未来。
  • 单独列出基准测试与理论之间的缺口:非线性、部分可观测性、动作支持缺失、漂移、多模态性、有限数据、近似优化和模型设定错误。
  • 当假设未知或不成立时,表述为“诊断性视角,而非直接覆盖”。

H.7 正面、负面、零结果和缺失结果是否均清晰可见?

  • 展示所有已声明的随机种子或预注册的排除规则、不确定性、逐回合结果、发散/坍塌/超时、未成功的消融,以及依据明确说明的策略选取的代表性失败案例。
  • 对未经测试的情况使用 开放问题,对测得未出现区分的情况使用 在此设置下为零结果,对未达到判据的情况使用 在此设置下失败。
  • 不要将负面结果泛化到其任务、方法、支持集、预算和协议之外,也不要因为它削弱了叙事而将其隐藏。

H.8 每一项实现主张是否都有可复现的路径?

  • 路径应最终指向已冻结的第一方文件/SHA、附带哈希值/格式的固定制品,或明确标注的教程构造及其与原实现的差异。
  • 分别固定依赖项,保存合成后的配置、数据/检查点转换、回合台账和分析修订版本;当 SHA 存在时,避免使用会变化的 main。
  • 运行归档冒烟测试:加载一个检查点,将一个窗口追溯到其所属回合,并重新生成一份汇总。这测试的是交接,而非独立复现。
  • 保留历史脉络:当前的 v3 TwoRoom 是 25/50;复现工作中经审计的论文侧 100/150 属于 v1/v2。

证据是坐标,而非阶梯

可解码性、可预测性、可控性、泛化能力、因果识别和规划效用所询问的是不同问题。被解码出的位置可能被预测器忽略。记录动作上的准确率可以与反事实失败并存。规划器可以利用任务捷径,而无须获得可识别的状态。

六项证据检验占据彼此独立的坐标,仅有有限重叠,并不存在通往理解的自动阶梯。

应询问测试了哪些坐标,以及哪些问题仍然开放。多个间接信号并不会合并成“理解”二字。

尝试推翻该主张

“LeWM 使用 EMA 和停止梯度来稳定其预训练视觉教师,随后通过探针证明其高斯状态理解物理规律,并使 CEM 在所有情况下都更快。”

这句流畅的表述未通过任何一道关卡。计算图是错误的;后续工作中的机制被移植了进来;探针结果被拔高为理解;速度主张丢失了硬件/预算条件;相关性变成了因果性;没有列出任何定理假设;失败结果消失了;也没有提供冻结的复现路径。

危险措辞应触发质询,而非自动否定:证明了理解、保证符合物理规律、在所有情况下都更快、距离就是可达性,以及 消融揭示了原因。只有当操作性定义、替代解释、预算、假设和直接证据都能与强措辞一同经受检验时,这种措辞才站得住脚。

证据凭据

基线身份来自 LeWorldModel v3、已冻结的官方代码,以及用于支撑所引动机的 LeJEPA v3。理论依据来自被动可识别性 v1和受控可识别性 v2。独立证据仅限于 TwoRoom 复现 v1及其有文档记录的协议。LeWM v3 于 2026-06-03 修订,冻结代码的日期为 2026-05-22,本清单的截止日期为 2026-08-20。通过所有关卡意味着这一带日期的主张在归属、适用范围、置信度校准、证据平衡和可核查性方面均准确无误,而不意味着该模型永远正确,也不意味着不再需要专家同行评审。

三个简短问题

  1. 哪些直接事实能揭示 v3 图示中虚构的 EMA 教师?
  2. 为什么性能强劲的探针不足以证明规划器使用了该变量?
  3. 通过全部八道关卡后,能够得出的最强结论是什么?