课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
先看全景
- 相同任务锁定起点、目标和成功定义。
- 公开资源数据、预训练、参数量。
- 匹配预算动作、候选、时域、优化轮数。
- 展示分布随机种子、回合和失败。

一个小故事
三位选手的成绩分别是 42、48 和 51 秒。其中一位跑的是更短赛道,一位半程骑了自行车,还有一位在热身后才启动计时。每个数字都可能正确,最终排名却毫无意义。
世界模型的分数也需要附带凭据。原始潜在 MSE 取决于维度、尺度、归一化和学习得到的目标。成功率取决于起点、目标、容差、终止条件、动作预算、搜索预算和环境版本。墙钟时间则取决于硬件与批处理方式。
真正规则
应当分开评估各个层次:
- 机械结构有效性,以及不跨回合的数据;
- 记录上下文上的单步预测;
- 按时域划分的固定动作自反馈滚动展开;
- 候选代价排序;
- 搜索进展;
- 闭环控制;
- 稳健性和支持范围偏移。
LeWM v3 评估 TwoRoom、Reacher、PushT 和 OGBench-Cube。在其报告协议中,起点取自离线轨迹,目标是同一条轨迹 25 个环境步之后的状态,真实动作预算为 50。这说明该目标在某种行为下曾被记录为可达;并不意味着任意视觉目标都能被解决。
应锁定或披露两种预算。环境预算包括真实动作、终止条件和重规划频率。规划计算预算包括候选数、时域、每个模型动作块中的动作数、精英数、优化轮数、模型调用、batch 形状和并行度。硬件、精度、预热、同步、编译、数据传输和计时区域,也必须与墙钟时间一同说明。
不同的有效比较视角回答不同问题:匹配任务数据、匹配可训练参数量、匹配任务训练计算量、采用各方法原生设置,或比较计算前沿。应明确指出所用视角,而不要抽象地把其中任何一种叫作“公平”。
可能骗过我们的把戏
DINO-WM 带着冻结的预训练 DINOv2 表征参加比较;原始 LeWM 则在任务轨迹上端到端训练视觉编码器。应分别报告任务训练成本和上游来源。还要列出每种输入模态,包括使用本体感觉的设置。
把基线当作诊断工具:
- 随机策略测试任务偶然成功的容易程度;
- 目标条件行为克隆测试直接模仿;
- 预言机代价 + 学习动力学测试排序;
- 预言机动力学 + 学习代价测试滚动展开;
- 两个预言机 + 相同有限搜索测试候选覆盖和动作参数化。
预言机会接收特权模拟器信息,它不是可部署的竞争方法。
分开训练随机种子、评估回合和规划器随机种子。同样 50 条轨迹上的三个训练检查点,并不等同于 50 次独立训练。定义每个 ± 记号:SD、SE、bootstrap 区间、置信区间或其他量,并说明其重采样单位。LeWM 的 PushT 图注把该量称为“variance”;不要悄悄作其他解释。
实验凭据
发布每回合身份、随机种子、成功/超时、最终和最佳任务距离、动作数、重规划次数、耗时、首次失败、支持范围切片、崩溃和排除项。均值可能掩盖罕见的灾难性模型利用,也可能掩盖稳定的接近成功。
LeWM v3 报告,在选定设置下,相比基于基础模型的世界模型,规划加速最高可达 48×,图中数值基于 50 次运行取平均。确切的历史硬件凭据并不完整,因此该倍数不是模型固有属性。
后续的 VIScore v2 将 Veracity、Influence 和 Sobriety 相乘。其作者报告,在接受测试的模型池上,跨任务 Spearman 相关系数至少为 0.75。这是关联,而不是确定性的成功预测:常数和校准是根据开发运行选定的,Cube 被排除在汇总校准主张之外,并且该估计器假设滚动误差方向在不同时域间大致稳定。
来源主张仍然必须绑定到 LeWorldModel v3、冻结提交 8edfeb3 和每个命名基线的具体版本。一份完整报告在问“谁赢了?”之前,应先问“在什么资源和协议下?”
快速检查
- 为什么两个编码器的原始潜在误差可能无法比较?
- 每一次规划器比较都必须公开哪两种预算?
- 预言机代价和预言机动力学分别回答什么问题?