JEPA4Japan · 教程

第 34 章——从位置距离到任务进度

1,414字 4分钟阅读 #LeWorldModel#世界模型#JEPA

区分距离、可达性与分阶段任务进度,包括进度感知和双曲方法,同时不把任务先验伪装成一般理解。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 已发布
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 当前课程
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

全局图景

  1. 看起来很近直尺喜欢穿过墙。
  2. 取得进展好路线有时要先走远。
  3. 能否到达规则和预算仍然重要。
距离、任务进度和可达性是三个问题。规划器的代价函数声称在回答哪个问题,就需要哪个问题的证据。

一个小故事:走错的机场航站楼

一名旅客朝着玻璃另一侧画出的登机口径直走去。直尺说旅客离目标更近了;旅程却说他被卡住了。真正有用的动作是先离开目标,绕过隔断,经过安检,再从正确的一侧靠近。

TwoRoom 也有同样的教训:要穿过门口,可能必须先增加直线距离。PushT 又增加了多个阶段——建立接触、旋转、重新定位,然后推动——因此两个与目标距离相同的状态,可能有完全相反的未来。“在潜在空间里更近”并不自动意味着“任务完成得更多”。

一条 TwoRoom 路线先远离近在咫尺的目标,从而能够穿过门口。

这段绕行将直线接近程度与路线完成程度分开了。它是教学案例,不是对每个任务都存在单调进度尺度的证明。

技术背包

请将下面三个标签分开:

  • 距离用某把选定的尺子比较两个点。基线 LeWM 使用预测终点与编码后目标之间的终端平方欧氏距离。
  • 进度按照任务的完成程度对状态排序。它相对于原始距离可能不单调,也可能取决于任务阶段。
  • 可达性询问:在允许的动作和动力学下,一个状态是否可以到达,通常还要限定有方向的时间或动作预算。

ProWorld v1 是后续方案,不属于原始 LeWM v3。它通过事后回顾的时间对构建弱目标条件排序,使用 Lorentz 模型的双曲潜在空间,并同时评分中间进度和终端进度。双曲空间为分支层级提供了逐渐增长的容量,但几何是归纳偏置——不是对真实世界确实拥有该层级的证明。当轨迹回溯、绕行、切换子目标,或包含空闲片段时,时间顺序也会对进度撒谎。

其他后续方法询问了相邻、但不同的问题:RC-aux 学习预算条件下的有向可达性;Temporal-Distance JEPA 通过滚动一致性和启发式跨轨迹负样本,学习有向时间度量;TRM 是一种事后学习、视界匹配的可达性度量;Traj-LeWM 学习一个目标条件轨迹代价,并将其与终点评分一起使用;SCALE 将潜在点对距离与特权状态距离对齐;DA-LeWM 研究预测的决策排序与实际决策排序之间的一致性。不要混淆它们的监督信号、规划器角色或证据。

尝试推翻这个想法

构造两个终端距离相同的 PushT 状态。在其中一个状态里,推动器以有用的角度稳定接触;在另一个状态里,木块被卡住了。再构造一对 TwoRoom 状态,其中按直尺看更远的那个状态,已经对准了门口。

对每个候选评分问三个问题:哪个状态被排得更近?哪个状态可以在同样的动作预算内到达?哪个状态在一个明确声明的任务阶段上走得更远?如果一种方法只报告一个标量,却默默地替三个问题都给出答案,它就没有通过这一课。

对于类似 ProWorld 的监督,加入包含刻意绕行和回溯的轨迹。如果事后回顾时间把错误的状态标记为“进度更大”,这个粗糙的时间代理指标就遇到了自己的证伪条件。特定任务的阶段标签或许能修好这个基准,但此时必须报告这个额外先验;不要把它重新命名为通用的世界理解。

实验凭据与证据边界

  • 基线与方案:LeWorldModel v3,固定代码 8edfeb3;ProWorld v1,发布于 2026-08-03。截止日前未找到 ProWorld 的实现。
  • 相关路线:RC-aux v1,代码 ecb4496;Temporal-Distance JEPA v2,代码 b4c17ca;TRM v1;Traj-LeWM v1,代码 67577fa;SCALE v1;DA-LeWM v1。
  • 日期:RC-aux 2026-05-08;TRM 2026-05-21;Temporal-Distance v2 2026-07-29;ProWorld 2026-08-03;Traj-LeWM 2026-08-14;SCALE 2026-08-17;DA-LeWM 2026-08-19。证据截止时间:2026-08-20,Asia/Tokyo。
  • 所有这些后续结果均为作者自报;此处并未确立独立复现。允许的措辞是“提出”、“弱时间排序”以及“在其测试设置下”——绝不是“真实进度”、“保证可达性”或“双曲几何证明存在层级”。

三个快问快答

  1. 远离目标怎样可能反而是真实的进展?
  2. 可达性声明需要哪些距离本身不需要的信息?
  3. 哪一个绕行实验可以暴露会误导人的时间进度标签?