JEPA4Japan · 教程

第 17 章——CEM:用淘汰赛搜索动作

1,224字 4分钟阅读 #LeWorldModel#世界模型#JEPA

实现反复候选采样、潜在模拟、精英选择和分布更新,同时权衡视界、总体规模与迭代次数。

课程进度 课程大纲 已发布 48/48 课

第 0 部分——阅读指南:我们究竟要学什么?

  1. 01 第 0 章——开始之前 已发布

第 1 部分——世界模型:智能体内部的沙盒

  1. 02 第 1 章——智能体为什么需要“想象未来” 已发布
  2. 03 第 2 章——为什么不直接预测下一张图像? 已发布
  3. 04 第 3 章——JEPA 思想:预测意义,而不是图像的复制品 已发布
  4. 05 第 4 章——用一张图看懂 LeWM 已发布

第 2 部分——把图像变成状态:LeWM 架构

  1. 06 第 5 章——轨迹数据:对模型而言,世界不是图像集合 已发布
  2. 07 第 6 章——视觉编码器:为每一帧签发“状态护照” 已发布
  3. 08 第 7 章——动力学预测器:在头脑中推动时间前进 已发布
  4. 09 第 8 章——一次完整的前向传播:跟随一个批次从头走到尾 已发布

第 3 部分——防止模型作弊:预测损失与 SIGReg

  1. 10 第 9 章——最危险的捷径:表示崩塌 已发布
  2. 11 第 10 章——预测损失:模型怎样学习下一步 已发布
  3. 12 第 11 章——SIGReg 的直觉:让表示空间“呼吸” 已发布
  4. 13 第 12 章——只保留最少却足够的数学 已发布
  5. 14 第 13 章——原始 LeWM 的端到端训练机制 已发布
  6. 15 第 14 章——训练一个不会立即崩塌的模型 已发布

第 4 部分——让模型行动起来:在潜在空间中规划

  1. 16 第 15 章——目标条件规划:从“我在哪里?”到“我要去哪里?” 已发布
  2. 17 第 16 章——潜在欧氏距离:方便,但未必可靠 已发布
  3. 18 第 17 章——CEM:用淘汰赛搜索动作 当前课程
  4. 19 第 18 章——MPC:不要一次信任模型太久 已发布
  5. 20 第 19 章——长视界滚动:小误差怎样滚成大失败 已发布
  6. 21 第 20 章——从零实现一个最小 LeWM 规划器 已发布

第 5 部分——工程复现:从论文到可运行系统

  1. 22 第 21 章——官方代码仓库与实验环境 已发布
  2. 23 第 22 章——第一个实验:TwoRoom 冒烟测试 已发布
  3. 24 第 23 章——第二个实验:复现 PushT 已发布
  4. 25 第 24 章——怎样公平评估世界模型 已发布
  5. 26 第 25 章——失败诊断手册 已发布

第 6 部分——LeWM 究竟学到了什么?

  1. 27 第 26 章——线性探针:潜在状态编码了哪些物理变量? 已发布
  2. 28 第 27 章——为潜在空间做一次“健康检查” 已发布
  3. 29 第 28 章——预期违背:模型会对“不可能事件”感到惊讶吗? 已发布
  4. 30 第 29 章——怎样严谨讨论“理解世界” 已发布

第 7 部分——为什么“预测准确”仍可能“规划很差”

  1. 31 第 30 章——训练目标与规划目标之间的差距 已发布
  2. 32 第 31 章——全局不崩塌不保证保留任务相关动力学 已发布
  3. 33 第 32 章——各向同性高斯先验何时过强? 已发布
  4. 34 第 33 章——长视界规划:预测得更远,还是规划得更聪明? 已发布
  5. 35 第 34 章——从位置距离到任务进度 已发布
  6. 36 第 35 章——多任务学习、真实机器人与视觉干扰 已发布
  7. 37 第 36 章——理论边界:何时能辨识真实状态? 已发布

第 8 部分——从复现者到研究者

  1. 38 第 37 章——设计一项可信的 LeWM 改进实验 已发布
  2. 39 第 38 章——十二个可执行的研究项目 已发布
  3. 40 第 39 章——LeWM 研究中的开放问题 已发布

附录

  1. 41 附录 A——最低限度的必需数学工具箱 已发布
  2. 42 附录 B——PyTorch 实现速查 已发布
  3. 43 附录 C——完整张量形状表 已发布
  4. 44 附录 D——实验配置卡 已发布
  5. 45 附录 E——论文时间线与证据等级 已发布
  6. 46 附录 F——术语表 已发布
  7. 47 附录 G——复现检查清单 已发布
  8. 48 附录 H——专家审阅检查清单 已发布

先看全景

  1. 采样抽取完整动作计划。
  2. 想象让每个计划在冻结模型中滚动展开。
  3. 选择保留代价最低的精英。
  4. 重新拟合移动提议分布并重复。
CEM 花费的是有限选拔预算,并不会尝试每一种计划。

一轮 CEM 会采样计划、想象后果、打分、保留精英,并重新拟合提议分布。

一个小故事

一位导演不可能观看所有舞蹈。于是 300 名舞者分别表演一套完整动作,其中模型预测分数最好的 30 套会影响下一轮选拔。几轮过后,选拔范围会集中到有希望的动作附近。

这就是 LeWM 规划使用的交叉熵方法(Cross-Entropy Method,CEM)。这里的“交叉熵”是采样优化器的名称,不是分类损失。训练好的编码器和预测器保持冻结,改变的只有用于采样动作序列的概率分布。

真正规则

一个候选是完整序列,而不是一个贪心动作。便于理解的形状是 [B, N, H, A]:分别表示环境 batch、候选、规划时域和动作块宽度。

initialize a proposal over complete action sequences
repeat for the declared number of rounds:
  sample candidates
  roll them through the frozen world model
  compute one terminal goal cost per candidate
  keep low-cost elites
  refit the proposal from those elites
return the plan using the declared solver convention

命名的 LeWM 设置使用 300 个候选和 30 个精英。论文通用描述与冻结的共享 YAML 都包含 30 轮优化,而附录 D 写明 PushT 最多使用 30 轮,其他环境使用 10 轮。请分开保留这些来源卡片。

论文为其连续控制任务描述了多元高斯提议分布。具体的裁剪、协方差、平滑和边界处理属于最终解析出的外部求解器版本;LeWM 核心并没有锁定该依赖。一般而言也可以使用类别型离散动作求解器,但冻结基准并未确立这种做法。

可能骗过我们的把戏

设想两条绕过障碍物、质量相同的走廊:一条向左,一条向右。精英分成两组,它们的高斯均值却正好指向障碍物。

因此,应分别记录采样到的最佳计划和最终提议均值。LeWorldModel 附录 B 使用最终均值;算法 2 则允许返回找到的最佳序列,或最终均值的第一个动作。接受检查的两个 stable-worldmodel 版本——标签 0.0.5 和快照 addbab4——都返回最终均值。由于 LeWM 没有锁定其历史依赖,这不能证明作者运行过其中任何一个确切版本。执行 best_seen 是一种有用且应明确标注的变体,而不是可以悄悄替换基准的做法。

更多搜索并不总是更安全。CEM 可能错过狭窄的优质走廊、过早收缩、面对平坦代价、把多个模式求平均、饱和于动作边界,或更高效地发现学习模型中的漏洞。“精英”只表示“这一轮采样中,在该模型和代价下表现最好”,并不意味着它在真实环境中可达或能成功。

实验凭据

记录时域、动作宽度和变换、提议分布随机种子与尺度、群体大小、精英数、轮数、候选和精英代价分布、各时域位置的提议分布宽度、边界比例、支持范围警告、模型调用次数、硬件和耗时。真实动作预算必须与想象中的预测器工作量分开统计。

来源边界是 LeWorldModel v3、冻结配置 8edfeb3,以及另行检查的当前求解器快照。独立的 TwoRoom 重实现 在一个环境中比较了 10 轮和 30 轮;它没有找回历史依赖,也没有验证所有基准。

可辩护的结论很小:CEM 会把有限样本集中到模型预测代价较低的动作序列附近。它既不保证全局最优,也不保证真实成功。

快速检查

  1. CEM 过程中什么会变化,什么保持冻结?
  2. 为什么两组优质精英可能产生一个糟糕的提议均值?
  3. 哪些论文与代码卡片对非 PushT 环境的优化轮数表述不一致?