JEPA4Japan · チュートリアル

第36章 — 理論的な境界:真の状態はいつ同定できるのか

1,309文字 4分で読めます #LeWorldModel#World Models#JEPA

線形動力学、定常分布、加法ノイズなどの仮定下にある同定可能性の結果を学び、非線形・部分観測・多峰的な未来へ無条件に外挿しません。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 現在のレッスン

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 仮定の内側theorem は正確な約束をします。
  2. 回転した答えorthogonal coordinate までは回復できるかも。
  3. 岸の外theorem は沈黙します。自動で真偽は決まりません。
identifiability は if–then の契約です。probe、良い loss、benchmark score で “if” を消すことはできません。

小さなお話:二枚の正直な地図

二人の地図職人が同じ島を描きます。一人は紙を 90 度回しました。すべての距離と transition は一致しますが、“上” はもう北ではありません。二枚とも正しくなれます。

だから “identified up to an orthogonal transformation” は有意義で、同時に限定的です。learned coordinate は rotation / reflection を通した linear relation で hidden coordinate と結ばれますが、個々の軸に人間の名前は付きません。arbitrary nonlinear warping より強く、「coordinate 1 が x position」より弱い結論です。

linear、Gaussian、stationary、fully observed、exact constraint、matched dimension の population setting を島にし、実用例を岸の外に置いた図。

外側は「これらの theorem が直接 cover しない」であり、「学習不可能」ではありません。

技術のリュック

When Does LeJEPA Learn a World Model? の passive result は、指定された class の population/global-optimum statement です。規定された observation map を通した observable state、stationary additive-noise dynamics、Gaussian latent structure、exact Gaussian representation constraint、matched latent/representation dimension を仮定します。separation condition の下で orthogonal coordinate までの linear recovery を与えます。planning statement にはさらに、変換後 dynamics の整合と orthogonal ambiguity を尊重する cost が必要です。encoder theorem だけでは action-conditioned transition の学習を示しません。

controlled v2 paper は別の、より強い契約です。invertible observation、independent Gaussian noise を持つ stationary linear controlled latent dynamics、jointly Gaussian state/action behavior、exact Gaussian representation、matched dimension、十分 expressive な continuous predictor、population optimization、正の state-conditioned action excitation を仮定します。その条件では state と controlled conditional-mean transition を共通 orthogonal change まで identify します。すべての stochastic future を回復するわけではありません。

よくある三つの assumption gap は別物です。

  • Partial observability: 二つの hidden state が同じ current image を作れます。history が助けるのは hidden variable が痕跡を残すときだけです。
  • Multimodal futures: squared-error point prediction は real mode の間に落ちえます。conditional mean は full future distribution ではありません。
  • Missing interventions: dataset 全体で Left と Right を見ても、各 action が一状態でしか起きなければ足りません。counterfactual action branch は制約されません。

有限 network の SIGReg は、有限 minibatch、sampled projection、数値 knot を Gaussian target へ押します。exact population enforcement ではありません。別の free-energy paper は constant encoder noise と exact isotropic-Gaussian enforcement の成功を仮定します。identifiability theorem ではなく、empirical validation は将来課題です。

壊してみる

二状態を作ります。State A では behavior policy が常に Right、State B では常に Left を選びます。dataset 全体には両 action が同数ありますが、どちらの state にも両 branch はありません。predictor は recorded transition を全部 fit しながら、A+Left と B+Right を好きに発明できます。

observation、state distribution、model、update を固定し、両 state で両 action が起きる第二 dataset を足します。oracle-state condition も入れます。oracle observation でも withheld-action error が残れば、この構成では representation ambiguity ではなく transition coverage が問題です。この test は conditional-excitation mechanism を支持できますが、全 LeWM failure を診断しません。

theorem を引用する前に尋ねます。observation は十分 invertible か。transition/noise family は一致するか。stationarity、dimension、Gaussian constraint、global optimum は本当にあるか。state で条件付けた後、必要な action direction はすべて変化するか。不明なら「設計指針として使う」であり、「coverage を主張する」ではありません。

実験レシートと証拠の境界

3つのクイック質問

  1. orthogonal ambiguity は何を保存し、どんな意味上の名前を変えられますか?
  2. marginal action diversity が state-conditioned action excitation より弱いのはなぜですか?
  3. benchmark が theorem の仮定外にあるとき、正しい結論は何ですか?