JEPA4Japan · 教程

第 35 章——多任务学习、真实机器人与视觉干扰

1,585字 4分钟阅读 #LeWorldModel#世界模型#JEPA

考察任务身份、视觉变化、潜在漂移、辅助深度、预测器容量、部分可观测性、机器人噪声,以及仿真到现实的证据差距。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 当前课程
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

全局图景

  1. 新布景像素变了,物理规律未必变。
  2. 新剧目同一幅画面可能对应另一个目标。
  3. 真实舞台噪声、延迟、接触和安全问题随之而来。
外观、任务身份、隐藏状态和硬件偏移是不同的问题。一个色彩丰富的数据集,不会自动替我们将它们分开。

一个小故事:机器人巡回演出

一台机器人反复排练同一出戏:在暖色灯光下,蓝色杯子总是向左移。巡演时,幕布变成了红色,摄像机换了位置,另一出戏还要求把完全相同的杯子向右移。随后,一只手又挡住了接触发生的瞬间。

这次变化究竟只是无害的布景,还是不同的任务、不同的物理状态,或是证据缺失?把四者都称为“域偏移”,会抹掉模型真正需要的答案。多任务训练可以暴露捷径,但也可能制造新捷径:每个任务都可能有自己独特的桌布、镜头或回合长度。

一座受控剧场保持机器人和物体状态不变,每次只改变一个视觉因素,然后在另一行单独改变物理状态。

这个矩阵每次只改变一个已知因素。它并没有宣称每一种背景、光照或视角都与任务无关。

技术背包

使用成对控制。重放同一个仿真器状态和动作,每次只改变一个已知不会改变动力学的纹理、光照或相机变量;然后再加入一个确实会改变未来后果的阳性对照。对一切都不变,就是崩塌;对一切都敏感,就是外观捷径。所期望的模式必须有选择性,而且还要经受住闭环规划的检验。

如果同一幅图像属于两个正确动作不同的任务,那么当前帧编码器无法猜出被省略的任务。应该提供目标图像、标记或语言条件;如果缺失变量曾留下痕迹,也可以使用历史。但标记可能成为数据集 ID 捷径,历史也无法恢复从未被观测过的信息。

后续证据必须保留自己的身份:

后续路线额外信号或设置狭义边界
TC-LeWM v2时间居中 SIGReg;多任务 LIBERO,使用从零开始训练的多视图 ViT-S/16 和任务条件流匹配行为克隆不是基线 CEM/MPC、TwoRoom 或机器人部署
深度正则化 JEPA v1深度监督和仅限训练时的过参数化;报告了在真实农业机器人视频上训练的 18M 模型离线视觉里程计探针、惊奇度和潜在滚动预测——而非在线规划或安全
PhyLatent v1仿真器物理状态监督属于特权训练,不是仅从像素恢复
PSG-JEPA v1仅限训练时的本体感觉状态和多视界关节变化定基作者自报的 Mobile ALOHA 下游策略证据,不是原始 LeWM MPC,也不是安全证书
stable-worldmodel v1共享数据、训练、求解器、MPC 和评估基础设施基础设施可以暴露选择;它不能证明科学是中立的或已被独立复现

原始 LeWM v3 仍然是完全端到端的:没有停止梯度目标、EMA 教师,也没有预训练视觉编码器。后续的辅助头不能重画它的计算图。更大的预测器也只是一个假设:应当在参数量和计算量匹配的宽度下,用多个随机种子比较单步预测、自我馈入滚动预测、动作敏感性、干扰因素不变性和规划。

尝试推翻这个想法

制作两个当前图像与动作历史完全一致的回合。任务 A 要求“杯子向左”;任务 B 要求“杯子向右”。隐藏指令。如果模型始终选择同一边,那暴露的是数据集先验,而不是被恢复的上下文。然后每次只增加一项:目标图像、任务标记、更早的指令帧,以及一个训练时与任务相关、测试时被互换的背景。

对部署而言,要逐级攀爬一架证据梯:原始仿真器 → 受控视觉变化 → 传感器噪声/缺帧 → 延迟且不完美的执行器 → 硬件/物体/标定变化 → 带有中止和恢复规则的安全约束运行。通过某一级并不会自动授予下一级。MPC 反馈限制了对开环的信任,但不会自动让实际执行的那一步变得安全。

实验凭据与证据边界

  • 来源:LeWorldModel v3;TC-LeWM v2;深度正则化 JEPA v1;PhyLatent v1;PSG-JEPA v1 及其项目页;stable-worldmodel v1。
  • 固定代码:LeWM 8edfeb3;PSG-JEPA 8de96b8,日期为 2026-08-14;stable-worldmodel addbab4,日期为 2026-08-18,而正式发布版仍是 2026-06-06 的 0.1.1。未找到 TC-LeWM、深度论文或 PhyLatent 的作者关联代码。
  • 日期:深度论文 2026-07-15;TC-LeWM v2 2026-07-31;PhyLatent 2026-08-06;PSG-JEPA 2026-08-07;证据截止时间为 2026-08-20,Asia/Tokyo。
  • 这些后续结果都是作者自报;尚未建立对它们或其机器人结果的独立复现。应报告确切的方法、控制器、数据、干预和安全协议。“真实视频”不等于“在线机器人规划”,“机器人策略实验”也不等于“安全部署”。

三个快问快答

  1. 为什么相机变化不一定是干扰因素?
  2. “同一帧、相反任务”的例子对缺失上下文证明了什么?
  3. 在仿真器稳健性声明能够变成机器人安全声明之前,还需要哪些新证据?