JEPA4Japan · チュートリアル

第29章 — 「世界を理解する」を厳密に語るには

1,008文字 4分で読めます #LeWorldModel#World Models#JEPA

予測可能性、デコード可能性、可制御性、構成的汎化、反実仮想整合性、因果同定、計画有用性を別々の検証可能な主張として扱います。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 現在のレッスン

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. capability を名付けるpredict、decode、control のどれか。
  2. test を名付けるmetric、baseline、intervention。
  3. condition を名付けるdata、support、budget、seeds。
  4. 境界を名付けるまだ何が言えないか。
意味を詰め込みすぎた名詞を、反証できる動詞へ置き換えます。

7人の witness は違う evidence を持ち、1つの universal “understanding” claim を代表できません。

小さなお話

7人の witness が「model は world を理解した」と言います。1人は low prediction error、1人は position decode、1人は action change、1人は unseen combination、1人は teleport spike、1人は causal intervention、1人は planner success を見ました。

どれも本当の observation かもしれません。しかし同じ capability を見てはいません。

本当のルール

7つの coordinate に分けます。

  1. Predictability: named actions、horizons、support で held-out latent consequence を予測。
  2. Decodability: 指定 readout が frozen representation から label を回収。
  3. Controllability: action が budget 内で predicted/executed outcome を動かす。
  4. Compositional generalization: familiar parts が unseen combination で働く。
  5. Counterfactual consistency: paired change に正しい sensitivity/invariance。
  6. Causal identification: explicit intervention assumptions の下で variables/relations を回収。
  7. Planning utility: fixed task/search contract 下で action choice を改善。

これは ladder ではなく coordinates です。1つが他を自動で与えず、positive tests の多数決も証明になりません。

random held-out episode は compositional とは限りません。本物の composition split は、parts を別の場所で残しながら start–goal、object–action、layout、phase combination を hold out します。同じ trajectory の25 steps 先 goal は有用な control task ですが、arbitrary-goal composition ではありません。

causality には named variables、valid interventions、confounder assumptions、identifying invariances、support controls、alternative structures が必要です。decodable direction と behavior-changing ablation だけでも、entangled/OOD かもしれません。

だまされる反例

familiar trajectory fragments を大量に保存する lookup navigator を想像します。同じ trajectory の future goal でよく成功します。background/time と場所が相関するので probe は position を decode します。last-frame predictor は teleport で spike します。

planning utility、decodability、VoE sensitivity は全部 positive です。しかし policy speed を randomize、background を変更し、新 layout で familiar actions を組み合わせると失敗します。

これは LeWM の説明ではありません。複数 diagnostics が同じ shortcut を共有できるという論理的反例です。triangulation は、tests の failure mode が違い、各 test が1つの alternative を狭めるときに強くなります。

よくある表現を監査します。

  • “position is inside” → “この readout で position が recoverable”。
  • “decoder shows imagined future” → “auxiliary decoder が predicted latent から view を reconstruct”。
  • “t-SNE shows learned map” → “sampled projection が neighborhood pattern を示唆”。
  • “planner understands control” → “この protocol の budgeted result”。
  • “model knows teleport is impossible” → “この perturbation で mismatch が増加”。

実験のレシート

claim を5 fields で作り直します。

  1. capability。
  2. test、metric、baseline、intervention。
  3. model/paper version、data、environment、support、horizon、budgets、seeds。
  4. result と evidence level—primary method fact、author-reported、independent reproduction、tutorial observation。
  5. alternatives と explicit non-implications。

wording ladder も守ります。probe 後は recoverable、declared shift 後は generalizes across the tested split、matched controls 後は behaviorally implicated under this intervention。necessary、sufficient、causal、understands は対応する design/assumption があるときだけです。

LeWorldModel v3 は action-conditioned latent prediction、TwoRoom/Reacher/PushT/OGBench-Cube の budgeted planning、selected-variable probes、qualitative latent views、PushT straightening、tested teleport sensitivity の author-reported evidence を出します。frozen commit 8edfeb3 には全 analysis scripts がありません。全部を合わせても complete state、broad composition、calibrated futures、causal physics、real-world reliability、human-like understanding は確立しません。

3つのクイック質問

  1. 7 capabilities が stage ではなく coordinate なのはなぜですか。
  2. genuine compositional split は何を変えますか。
  3. five-field claim は “proves” を “suggests” に変えるだけより、なぜよいですか。