JEPA4Japan · 教程

第 24 章——怎样公平评估世界模型

1,380字 4分钟阅读 #LeWorldModel#世界模型#JEPA

在匹配的数据与计算预算、强基线、多个随机种子和明确条件下,报告单步、多步、闭环和规划指标。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 当前课程
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 相同任务锁定起点、目标和成功定义。
  2. 公开资源数据、预训练、参数量。
  3. 匹配预算动作、候选、时域、优化轮数。
  4. 展示分布随机种子、回合和失败。
只有当每位选手的赛道和背包都清楚可见,记分牌才称得上公平。

评估阶梯从机械结构和预测,一路上升到代价、搜索、控制和稳健性。

一个小故事

三位选手的成绩分别是 42、48 和 51 秒。其中一位跑的是更短赛道,一位半程骑了自行车,还有一位在热身后才启动计时。每个数字都可能正确,最终排名却毫无意义。

世界模型的分数也需要附带凭据。原始潜在 MSE 取决于维度、尺度、归一化和学习得到的目标。成功率取决于起点、目标、容差、终止条件、动作预算、搜索预算和环境版本。墙钟时间则取决于硬件与批处理方式。

真正规则

应当分开评估各个层次:

  1. 机械结构有效性,以及不跨回合的数据;
  2. 记录上下文上的单步预测;
  3. 按时域划分的固定动作自反馈滚动展开;
  4. 候选代价排序;
  5. 搜索进展;
  6. 闭环控制;
  7. 稳健性和支持范围偏移。

LeWM v3 评估 TwoRoom、Reacher、PushT 和 OGBench-Cube。在其报告协议中,起点取自离线轨迹,目标是同一条轨迹 25 个环境步之后的状态,真实动作预算为 50。这说明该目标在某种行为下曾被记录为可达;并不意味着任意视觉目标都能被解决。

应锁定或披露两种预算。环境预算包括真实动作、终止条件和重规划频率。规划计算预算包括候选数、时域、每个模型动作块中的动作数、精英数、优化轮数、模型调用、batch 形状和并行度。硬件、精度、预热、同步、编译、数据传输和计时区域,也必须与墙钟时间一同说明。

不同的有效比较视角回答不同问题:匹配任务数据、匹配可训练参数量、匹配任务训练计算量、采用各方法原生设置,或比较计算前沿。应明确指出所用视角,而不要抽象地把其中任何一种叫作“公平”。

可能骗过我们的把戏

DINO-WM 带着冻结的预训练 DINOv2 表征参加比较;原始 LeWM 则在任务轨迹上端到端训练视觉编码器。应分别报告任务训练成本和上游来源。还要列出每种输入模态,包括使用本体感觉的设置。

把基线当作诊断工具:

  • 随机策略测试任务偶然成功的容易程度;
  • 目标条件行为克隆测试直接模仿;
  • 预言机代价 + 学习动力学测试排序;
  • 预言机动力学 + 学习代价测试滚动展开;
  • 两个预言机 + 相同有限搜索测试候选覆盖和动作参数化。

预言机会接收特权模拟器信息,它不是可部署的竞争方法。

分开训练随机种子、评估回合和规划器随机种子。同样 50 条轨迹上的三个训练检查点,并不等同于 50 次独立训练。定义每个 ± 记号:SD、SE、bootstrap 区间、置信区间或其他量,并说明其重采样单位。LeWM 的 PushT 图注把该量称为“variance”;不要悄悄作其他解释。

实验凭据

发布每回合身份、随机种子、成功/超时、最终和最佳任务距离、动作数、重规划次数、耗时、首次失败、支持范围切片、崩溃和排除项。均值可能掩盖罕见的灾难性模型利用,也可能掩盖稳定的接近成功。

LeWM v3 报告,在选定设置下,相比基于基础模型的世界模型,规划加速最高可达 48×,图中数值基于 50 次运行取平均。确切的历史硬件凭据并不完整,因此该倍数不是模型固有属性。

后续的 VIScore v2 将 Veracity、Influence 和 Sobriety 相乘。其作者报告,在接受测试的模型池上,跨任务 Spearman 相关系数至少为 0.75。这是关联,而不是确定性的成功预测:常数和校准是根据开发运行选定的,Cube 被排除在汇总校准主张之外,并且该估计器假设滚动误差方向在不同时域间大致稳定。

来源主张仍然必须绑定到 LeWorldModel v3、冻结提交 8edfeb3 和每个命名基线的具体版本。一份完整报告在问“谁赢了?”之前,应先问“在什么资源和协议下?”

快速检查

  1. 为什么两个编码器的原始潜在误差可能无法比较?
  2. 每一次规划器比较都必须公开哪两种预算?
  3. 预言机代价和预言机动力学分别回答什么问题?