JEPA4Japan · チュートリアル

第17章 — CEM:勝ち抜き方式で行動を探索する

1,253文字 4分で読めます #LeWorldModel#World Models#JEPA

候補系列のサンプリング、モデル内シミュレーション、エリート選抜、分布更新を繰り返し、探索予算と代表的な失敗を理解します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 現在のレッスン
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 候補を出す行動列を丸ごと引く。
  2. 想像する凍結モデルで全候補を進める。
  3. 選ぶ低コストの elite を残す。
  4. 寄せる提案分布を更新して繰り返す。
CEM は有限のオーディションです。全計画を試すわけではありません。

CEM が候補を出し、想像し、採点し、elite を選び、提案分布を更新します。

小さなお話

監督は、考えられるすべての踊りを見られません。そこで300人に最初から最後まで踊ってもらい、モデル内の点数がよい30人を次のオーディションの参考にします。何回か繰り返すと、有望そうな踊りの近くに候補が集まります。

これが LeWM の計画で使う Cross-Entropy Method(CEM)です。ここでの cross-entropy は分類 loss ではなく、sampling optimizer の名前です。encoder と predictor は凍結したままです。変わるのは行動列を引く提案分布だけです。

本当のルール

候補は、貪欲な1行動ではなく、未来の行動列全体です。概念上の shape [B, N, H, A] は、環境 batch、候補数、計画 horizon、action block 幅を表します。

行動列全体に対する提案分布を初期化
決めた round 数だけ繰り返す:
  候補を sample
  凍結 world model で rollout
  候補ごとに終端 goal cost を1つ計算
  低 cost の elite を残す
  elite から提案分布を fit し直す
宣言した solver 規約で plan を返す

LeWM の設定は 300 candidates と 30 elites です。論文の一般説明と凍結 shared YAML は refinement 30 rounds、Appendix D は PushT が最大30、その他が10と述べます。これらを1つの「公式値」に混ぜてはいけません。

連続制御には multivariate Gaussian proposal が記述されています。clipping、covariance、smoothing、bound 処理の正確な挙動は、解決した外部 solver revision に属します。LeWM core はその依存版を pin していません。離散行動用の categorical CEM は一般には作れますが、この凍結 baseline で動く証拠にはなりません。

だまされる反例

障害物の左と右に、同じくらいよい2本の道を作ります。elite は2群に分かれます。しかし Gaussian の平均は、その真ん中の障害物を指すかもしれません。

そのため、実際に sample された最良候補と、最後の proposal mean を別々に保存します。LeWorldModel Appendix B は final mean、Algorithm 2 は best sequence または final mean の先頭行動を許します。調査した stable-worldmodel の 0.0.5 と addbab4 は、どちらも final mean を返します。ただし LeWM が歴史的依存版を pin していないため、著者がどちらを使ったかの証明ではありません。best_seen 実行は明記した tutorial variant です。

探索を増やせば必ず安全になるわけでもありません。CEM は細い良経路を見逃し、早く縮みすぎ、平らな cost に迷い、2つの mode を平均し、action bound に張り付き、learned model の穴を上手に見つけることがあります。elite は現実の成功者ではありません。

実験のレシート

horizon、action 幅と変換、proposal seed と初期 scale、population、elite、round、cost 分布、horizon 位置ごとの spread、bound 比率、support 警告、model call、hardware、時間を記録します。実行した real action 予算と imagined predictor work は分けます。

根拠は LeWorldModel v3、凍結 config 8edfeb3、別に調査した solver snapshot です。独立 TwoRoom 再実装 は1環境で10と30 roundsを比べましたが、歴史的依存版や全 benchmark を確定しません。

言えるのは「CEM は有限 sample を、モデル内 cost が低い行動列の近くへ集める」までです。global optimum も現実成功も保証しません。

3つのクイック質問

  1. CEM 中に変わるものと、凍結されたままのものは何ですか。
  2. 2つのよい elite 群の平均が悪くなるのはなぜですか。
  3. 非 PushT の refinement 数について、どの source card が食い違いますか。