JEPA4Japan · チュートリアル

第30章 — 訓練目的と計画目的のあいだにある亀裂

1,067文字 4分で読めます #LeWorldModel#World Models#JEPA

局所予測と大域到達のずれを分析し、到達可能性、有向時間距離、多時間尺度予測、ロールアウト整合性をRC-auxなどの研究フロンティアと比較します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 現在のレッスン
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. predictこの action の次は何か。
  2. rankどの ending を好むべきか。
  3. searchCEM はどの plan を見たか。
  4. executeworld で何が起きたか。
正しい local forecast と、役立つ plan ranking は別の仕事です。

local step を正しく予測しても、wall を突き抜ける goal ranking は間違えられます。

小さなお話

courier は小さな一歩を全部正しく予測します。goal は壁越しに近いので、planner はずっと「goal へ歩く」を選びます。doorway へ一度離れず、壁を押し続けます。

この話に bad next-step prediction は不要です。training は「この action の次 latent は正しいか」、planning は「どの行動列を好むか」を聞きます。元の LeWM v3 は2つ目を terminal squared latent Euclidean distance で答えます。forecast と route judgment は別物です。

本当のルール

low mean squared prediction error がよい ordering を保証しない理由:

  • common local motion が rare doorway/contact decision を隠す。
  • nearby transition を予測できても wall-separated endpoints の配置は悪い。
  • planning は recorded context だけでなく self-fed model-generated state を採点。
  • Euclidean cost は symmetric で、direction、budget、support、uncertainty 引数がない。

全部を変える前に oracle substitution を行います。

oracle rollout + learned cost でも ranking が悪い
  → cost または representation geometry
learned rollout + oracle cost が失敗
  → multi-step dynamics と support
両 oracle は成功、deployed planner は失敗
  → search、observation、action conversion、execution

oracle は privileged simulator access を持つ laboratory instrument で、deployable pixels-only component ではありません。

後続2案は別の仕事を変えます。RC-aux は original one-step term を、step 1 も含む weighted multi-horizon open-loop prediction に置換し、budget-conditioned reachability head を加えます。Temporal-Distance JEPA は directed temporal cost と、(H=5) で各 predicted latent を recorded future の stop-gradient encoding に合わせる rollout-consistency loss を別々に学びます。この detach は later method のもので、original v3 target は connected です。

trajectory offset は behavior が実際にかけた時間で、oracle shortest time ではありません。cross-trajectory negative も false になれます。

だまされる反例

最初は定規だけ交換します。fixed TwoRoom candidate bank の exact simulator endpoint を使い、straight-line distance と wall-respecting graph distance で順位を付けます。wall を消して繰り返します。

wall が detour を作るときだけ graph distance が ranking を変えるなら、topological-cost explanation はこの toy removal test を生き残ります。exact endpoint でも両 cost が失敗すれば candidate coverage/task definition を調べます。その後 learned encoding、reverse direction、budget variation、最後に learned rollout を加えます。

later methods を全部同じ “planning-aware objective” と呼びません。

  • Objective Bottleneck:1つの TwoRoom representation/predictor を freeze し planner cost を交換。
  • Traj-LeWM:goal-conditioned latent trajectory cost、synthetic ranking negatives、各 epoch 後の failed endpoint-only execution mining。
  • Decision-Metric Alignment:Plan–Real/CEM-stage Spearman を測り、training-only inverse-dynamics/goal-action heads を追加しつつ Euclidean MPC cost を維持。

それぞれ ruler、path、representation geometry を変えます。

実験のレシート

Objective Bottleneck follow-up は latent L2 vs true distance (r=0.426)、position ridge probe (R^2=0.9922) を報告します。自分の checkpoint の offset-100 success は temporal cost で26%→98%、released checkpoint は14%→34%、privileged decoded-position cost は70%。1環境、1 seed/checkpoint、非 v3 default long-goal protocol です。

Traj-LeWM は自分の LeWM comparison に対し PushT/Cube/Reacher/TwoRoom で3、14、7、7 percentage points gain、3 evaluation seeds の平均を報告します。failure mining があるため pure offline-data training ではありません。

Decision-Metric Alignment は各 config 1 training run、3 seeds は evaluation variation。rank diagnostic は simulator rollout が必要です。author-reported で independent reproduction ではありません。

baseline source は LeWorldModel v3、commit 8edfeb3。later stop-gradient、reachability、temporal、action-head objective を v3 へさかのぼらせません。

3つのクイック質問

  1. oracle dynamics でも TwoRoom planning が悪くなるのはなぜですか。
  2. multi-horizon prediction と reachability score は何を別々にしますか。
  3. predictor より ruler を先に変えるべきだと示す oracle cell はどれですか。