JEPA4Japan · チュートリアル

第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで

1,100文字 3分で読めます #LeWorldModel#World Models#JEPA

誤差蓄積、モデル生成状態への分布ずれ、潜在状態の漂流、隠れた不確実性、プランナーによるモデル悪用を診断します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 現在のレッスン
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 現実から開始本物の history を符号化。
  2. 予測次の latent を作る。
  3. 戻す予測を次の context にする。
  4. 測るhorizon ごとの drift を追う。
最初のコピーがよくても、コピーのコピーは道から外れます。

コピーを繰り返すほど、元の像から少しずつずれていく鎖。

小さなお話

絵を1回コピーしただけなら、ほとんど同じに見えます。そのコピーを何度もコピーすると、小さなゆがみが大きな違いになります。

LeWM の rollout は autoregressive です。最初は現実の観測を符号化した状態から始まりますが、後の予測は前に予測した latent を context に使います。training や one-step test は、長い planning rollout より多くの real context を見ます。これが train–rollout context gap です。

ただし、誤差がいつも滑らかに増えるとは限りません。dynamics はずれを増幅、回転、相殺、減衰できます。指数的・単調と決めず、実際の曲線を測ります。

本当のルール

同じ held-out episode と同じ recorded action sequence で、2本の lane を作ります。

  • Recorded-context lane: 毎 step、本物の observation を符号化し直す。
  • Self-fed lane: 最初の history 後は、prediction を次の prediction に戻す。

各 predicted latent を、そのとき本当に来た observation の frozen encoder latent と比べます。endpoint だけでなく model horizon ごとに plot し、door crossing、contact onset、contact loss、action magnitude、empirical support に分けます。

元の LeWM v3 が出すのは1つの latent estimate です。calibrated confidence も possible futures の distribution も出しません。deterministic output は、世界が確実だという意味ではありません。

one-step accuracy は大切ですが、答える範囲が小さいだけです。recorded-context prediction がよくても、self-fed rollout、terminal cost、execution adapter が悪いことはあります。

だまされる反例

CEM の仕事は predicted cost が低い候補を見つけることです。data support の外で model が楽観的になる行動列が1つあれば、候補や refinement を増やすほど、その穴を上手に見つける場合があります。

すべての失敗を model exploitation と呼ばず、次を試します。

  1. action sequence bank を固定する。
  2. imagined cost と実行した real outcome を比べる。
  3. action support と horizon をラベルする。
  4. model、task、real-action budget を固定して search budget だけ増やす。

predicted best cost は改善するのに、選ぶ列が support から離れ、real outcome が対になって悪化するなら exploitation が有力です。最後の crash だけでは dynamics、cost、search、support、execution を分けられません。

oracle cost で順位は直るのに endpoint がずれるなら dynamics を調べます。oracle dynamics でも learned cost が悪い道を選ぶなら、cost または representation geometry を調べます。短い horizon は rollout depth を減らしますが、壁越しを好む定規は直しません。

実験のレシート

checkpoint、前処理、最初の real history、aligned recorded actions、action-block semantics、teacher-forced/self-fed latents、horizon 別 error、support labels、全 seed を保存します。最後の醜い frame ではなく、最初の qualitative divergence を印します。

根拠は著者 commit 8edfeb3 の rollout と LeWorldModel v3 の limitation です。model exploitation には隣接研究 Model-Based Planning with Energy-Based Models もあります。

独立 TwoRoom 再実装 は、1環境・各 config 1 training seed の3 checkpoints で、one-step error は short-horizon success の順を作るが long-horizon success の順は作らないと報告しました。原因は未検証で、普遍的 drift や exploitation の証明ではありません。

3つのクイック質問

  1. recorded-context と self-fed prediction では何が変わりますか。
  2. 1つの deterministic latent が calibrated certainty でないのはなぜですか。
  3. model exploitation を有力にする、対になった変化は何ですか。