JEPA4Japan · チュートリアル

第33章 — 長期計画:より遠くを予測するか、より賢く計画するか

1,374文字 4分で読めます #LeWorldModel#World Models#JEPA

行動プレフィックス予測、複数の未来の並列予測、マクロ行動、階層化を比較し、Fast-LeWM、HWM、Hi-LeWMから階層計画が必ず優れるとは結論づけないようにします。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 現在のレッスン
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 遅い鎖次の想像は前の一歩を待ちます。
  2. 大きな一歩prefix や階層が助けるかもしれません。
  3. 間違った行き先長い horizon でも悪い cost は直りません。
「long horizon」には、逐次計算、誤差蓄積、再利用できる時間構造、support 外の subgoal、誤解を招く terminal metric という別々の問題があります。

小さなお話:四つの旅行会社

宅配人が国を横断します。A 社は道を一つずつ描きます。B 社は「最初の 1、2、3、4 個の指示ならどこへ着く?」を並列に尋ねます。C 社は再利用できる列車区間で計画します。D 社は、goal に近く見えるのに線路が一本もない魔法の駅を発明します。

どれも「長距離計画」を名乗れますが、直す場所は違います。baseline LeWorldModel v3 は latent state を autoregressive に進めます。candidate plan は横に並べられても、各 plan の時間は逐次的です。後の prediction は前の predicted state を入力にするため、計算と model error が積み重なりえます。

同じ行動列を、自分の予測を次に渡す鎖と、観測した開始点から複数の action prefix を予測する扇として比べます。

扇型は prediction interface を変えます。複数の確率的未来を作ること、calibration、action search の不要化を意味しません。

技術のリュック

ルート正確な介入必ず残す境界
Baseline v3CEM/MPC 内の one-step self-fed latent rolloutcandidate 並列化は時間依存を消しません
Fast-LeWM観測 anchor から複数の prefix horizon を並列予測“multiple futures” は複数時点で、multimodal outcome ではありません。encoding、sampling、scoring、model error は残ります
VLWM, Beyond the Next Stepchunk schedule を用いる variable-length direct predictionFast-LeWM ではありません。報告 13% 平均は training seed 3072 と各 (dataset, Δ) での事後的 best P1/P2/P3 選択です
2024 hierarchical RSSM study粗い時間階層と abstract action を学習“HWM” は本教材の略称で、論文の正式 method 名でも LeWM variant でもありません
Hi-LeWM凍結した low-level LeWM の上で high-level CEM が latent subgoal を提案制約なし macro-action と subgoal は training support 外へ出られます。階層は自動的に優れません

役立つ階層には、再利用できる chunk、高レベル化で節約する量より誤差が遅く増える high-level model、low-level controller が本当に到達できる subgoal、両層の十分な search budget が要ります。empirical-macro search は観測 anchor の近くに提案を置けますが、data に近いことは reachability や safety の証明ではありません。

horizon を増やす前に terminal metric を検査してください。独立 TwoRoom follow-up は、監査した checkpoint と protocol で cost だけを変えると遠い goal の結果が大きく改善したと報告します。これはその条件で planner interface の bottleneck を示しますが、すべての long-horizon failure が cost 原因だとは証明しません。

壊してみる

完璧な low-level driver に、不可能な high-level station を与えます。その駅は latent Euclidean distance では goal に近いのに、encoded macro-action 集合の外で壁の向こうです。high-level horizon と CEM population を増やします。不可能な駅をもっと自信満々に選べば、強い探索が support mismatch を増幅しました。

次の四条件を固定比較します。baseline rollout、prefix prediction、自由な latent subgoal を持つ階層、empirical macro-action に制約した階層です。data、encoder、low-level model、action budget、candidate accounting、goal、seed を同じにします。wall-clock、model call、rollout error、support distance、subgoal feasibility、closed-loop success を記録します。hardware と budget を合わせない speedup は持ち運べる倍率ではなく、到達可能 subgoal を確認しない成功差は階層の証拠ではありません。

実験レシートと証拠の境界

3つのクイック質問

  1. candidate を vectorize しても、baseline rollout のどこが逐次のままですか?
  2. 到達できそうな latent subgoal が、なぜ low-level controller には使えないことがありますか?
  3. 長い horizon に計算費を払う前に、何を診断しますか?