课程进度 课程大纲 已发布 48/48 课
第 0 部分——阅读指南:我们究竟要学什么?
第 1 部分——世界模型:智能体内部的沙盒
第 2 部分——把图像变成状态:LeWM 架构
第 3 部分——防止模型作弊:预测损失与 SIGReg
第 4 部分——让模型行动起来:在潜在空间中规划
第 5 部分——工程复现:从论文到可运行系统
第 6 部分——LeWM 究竟学到了什么?
第 7 部分——为什么“预测准确”仍可能“规划很差”
第 8 部分——从复现者到研究者
附录
全局图景
- 新布景像素变了,物理规律未必变。
- 新剧目同一幅画面可能对应另一个目标。
- 真实舞台噪声、延迟、接触和安全问题随之而来。
一个小故事:机器人巡回演出
一台机器人反复排练同一出戏:在暖色灯光下,蓝色杯子总是向左移。巡演时,幕布变成了红色,摄像机换了位置,另一出戏还要求把完全相同的杯子向右移。随后,一只手又挡住了接触发生的瞬间。
这次变化究竟只是无害的布景,还是不同的任务、不同的物理状态,或是证据缺失?把四者都称为“域偏移”,会抹掉模型真正需要的答案。多任务训练可以暴露捷径,但也可能制造新捷径:每个任务都可能有自己独特的桌布、镜头或回合长度。

这个矩阵每次只改变一个已知因素。它并没有宣称每一种背景、光照或视角都与任务无关。
技术背包
使用成对控制。重放同一个仿真器状态和动作,每次只改变一个已知不会改变动力学的纹理、光照或相机变量;然后再加入一个确实会改变未来后果的阳性对照。对一切都不变,就是崩塌;对一切都敏感,就是外观捷径。所期望的模式必须有选择性,而且还要经受住闭环规划的检验。
如果同一幅图像属于两个正确动作不同的任务,那么当前帧编码器无法猜出被省略的任务。应该提供目标图像、标记或语言条件;如果缺失变量曾留下痕迹,也可以使用历史。但标记可能成为数据集 ID 捷径,历史也无法恢复从未被观测过的信息。
后续证据必须保留自己的身份:
| 后续路线 | 额外信号或设置 | 狭义边界 |
|---|---|---|
| TC-LeWM v2 | 时间居中 SIGReg;多任务 LIBERO,使用从零开始训练的多视图 ViT-S/16 和任务条件流匹配行为克隆 | 不是基线 CEM/MPC、TwoRoom 或机器人部署 |
| 深度正则化 JEPA v1 | 深度监督和仅限训练时的过参数化;报告了在真实农业机器人视频上训练的 18M 模型 | 离线视觉里程计探针、惊奇度和潜在滚动预测——而非在线规划或安全 |
| PhyLatent v1 | 仿真器物理状态监督 | 属于特权训练,不是仅从像素恢复 |
| PSG-JEPA v1 | 仅限训练时的本体感觉状态和多视界关节变化定基 | 作者自报的 Mobile ALOHA 下游策略证据,不是原始 LeWM MPC,也不是安全证书 |
| stable-worldmodel v1 | 共享数据、训练、求解器、MPC 和评估基础设施 | 基础设施可以暴露选择;它不能证明科学是中立的或已被独立复现 |
原始 LeWM v3 仍然是完全端到端的:没有停止梯度目标、EMA 教师,也没有预训练视觉编码器。后续的辅助头不能重画它的计算图。更大的预测器也只是一个假设:应当在参数量和计算量匹配的宽度下,用多个随机种子比较单步预测、自我馈入滚动预测、动作敏感性、干扰因素不变性和规划。
尝试推翻这个想法
制作两个当前图像与动作历史完全一致的回合。任务 A 要求“杯子向左”;任务 B 要求“杯子向右”。隐藏指令。如果模型始终选择同一边,那暴露的是数据集先验,而不是被恢复的上下文。然后每次只增加一项:目标图像、任务标记、更早的指令帧,以及一个训练时与任务相关、测试时被互换的背景。
对部署而言,要逐级攀爬一架证据梯:原始仿真器 → 受控视觉变化 → 传感器噪声/缺帧 → 延迟且不完美的执行器 → 硬件/物体/标定变化 → 带有中止和恢复规则的安全约束运行。通过某一级并不会自动授予下一级。MPC 反馈限制了对开环的信任,但不会自动让实际执行的那一步变得安全。
实验凭据与证据边界
- 来源:LeWorldModel v3;TC-LeWM v2;深度正则化 JEPA v1;PhyLatent v1;PSG-JEPA v1 及其项目页;stable-worldmodel v1。
- 固定代码:LeWM
8edfeb3;PSG-JEPA8de96b8,日期为 2026-08-14;stable-worldmodeladdbab4,日期为 2026-08-18,而正式发布版仍是 2026-06-06 的0.1.1。未找到 TC-LeWM、深度论文或 PhyLatent 的作者关联代码。 - 日期:深度论文 2026-07-15;TC-LeWM v2 2026-07-31;PhyLatent 2026-08-06;PSG-JEPA 2026-08-07;证据截止时间为 2026-08-20,Asia/Tokyo。
- 这些后续结果都是作者自报;尚未建立对它们或其机器人结果的独立复现。应报告确切的方法、控制器、数据、干预和安全协议。“真实视频”不等于“在线机器人规划”,“机器人策略实验”也不等于“安全部署”。
三个快问快答
- 为什么相机变化不一定是干扰因素?
- “同一帧、相反任务”的例子对缺失上下文证明了什么?
- 在仿真器稳健性声明能够变成机器人安全声明之前,还需要哪些新证据?