JEPA4Japan · チュートリアル

第18章 — MPC:モデルを一度に長く信じすぎない

1,118文字 3分で読めます #LeWorldModel#World Models#JEPA

計画の先頭だけを実行し、新しい観測で再符号化・再計画する閉ループと、再計画間隔や外乱の影響を学びます。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 現在のレッスン
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 観測現実の証拠を符号化する。
  2. 計画CEM が H block を想像する。
  3. 実行K block だけ現実で動かす。
  4. もう一度見る古い残りを捨てて計画し直す。
CEM は想像の中を探し、MPC は現実の観測を取り戻します。

内側の CEM 探索が、外側の観測・実行・再計画ループに入っています。

小さなお話

地図は「右へ曲がる」と言いましたが、工事で左へ押し出されました。よいナビなら、もう一度現在地を見て、新しい道を引きます。

Model Predictive Control(MPC)も似ています。有限の未来を想像し、計画の一部を実行し、新しい現実の観測を受け取って、また探します。feedback は予測だけに頼る時間を短くします。ただし encoder、predictor、cost、search が新しい証拠を正しく読む保証はありません。

本当のルール

3つの時計を分けます。

  • (H):候補内で想像する model-level action blocks。
  • (K):次の再計画までに本当に実行する blocks。(K\le H)。
  • 1 action block に入る raw environment timesteps。

論文と凍結 config の LeWM では (H=5)、(K=5)、1 block は5つの連続 environment actions です。つまり25 environment timesteps 分の計画全体を実行してから、次の planning call を行います。episode 全体では MPC ですが、よく描かれる (K=1) feedback ではありません。

学習済み encoder と predictor を凍結
task が続く間:
  real observation history と別の goal を符号化
  H-block 候補を inner CEM で探索
  記録した return 規約で plan を選択
  最初の K blocks を environment で実行
  新しい real observation を受け取り再計画

CEM と MPC は同じ名前ではありません。CEM は1 planning call 内で action proposal を変えます。MPC は外側の observe–plan–execute–observe 方針です。どちらも評価中に LeWM の重みを更新しません。実行しなかった候補は、現実から feedback をもらえません。

だまされる反例

新しい観測を epistemic reset と呼べますが、限界を残します。古い imagined endpoint への依存は切れます。しかし hidden velocity、contact force、privileged simulator state は見えません。壁越しを近いとみなす systematic cost error は毎回くり返せます。

最初の action block 後に、同じ横向きの押しを入れます。次の3条件を比べます。

  1. episode 全体を open loop にする。
  2. tutorial variant の (K=1)。
  3. reported style の (K=5)。

start、goal、checkpoint、action bounds、total real-action budget、seed schedule を固定します。いつ押しを観測したか、次の plan がどう変わったか、planning calls、latency、実行経路を保存します。短い (K) は早く見直せますが、CEM call が増えます。これは feedback–compute trade-off です。

実験のレシート

各 cycle で、選んだ imagined plan、solid な実行 prefix、dashed な未実行 suffix、返った観測、prefix forecast error、replacement plan を保存します。normalized model action と raw environment action の両方を記録します。adapter bug は model failure に見えるからです。

根拠は LeWorldModel v3 と凍結 TwoRoom evaluation config、commit 8edfeb3 です。独立 TwoRoom 再実装 も、自分の system で5-block horizon と5-block execution interval を合わせています。

慎重に言えるのは「ずれが観測可能で、その後の model、cost、search、action path が有効なら、MPC は長い open-loop prediction への依存を減らせる」です。安全証明でも、perfect-state reset でも、短い (K) が常によいという証拠でもありません。

3つのクイック質問

  1. model block と environment timestep を分けて書くのはなぜですか。
  2. 新しい観測が reset するものと、まだ間違い得るものは何ですか。
  3. 内側の CEM clock と外側の MPC clock はどう違いますか。