JEPA4Japan · チュートリアル

第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない

1,061文字 4分で読めます #LeWorldModel#World Models#JEPA

外観と動力学状態、状態の同定可能性、反実仮想の行動応答を調べます。PhyLatentは最近の診断的提案として扱い、オリジナルLeWMの学習時の計算グラフを説明する根拠には用いません。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 現在のレッスン
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. appearance を変えるphysical transition は固定。
  2. physics を変えるappearance はほぼ固定。
  3. action を変えるfull history は固定。
representation は、間違った理由で広く spread できます。

同じように spread した2つの latent cloud が、appearance または action consequence で observation を整理します。

小さなお話

passport office が全員に違う card を作ります。archive は collapse しません。しかし card には shirt color と wallpaper だけがあり、motion direction や通れる gate がありません。

latent も同じです。background texture が多くの dimension を満たし、小さな velocity/contact variable が消えます。global variance、rank、pretty projection は一部 failure を除きますが、task-relevant dynamics の保存を証明しません。

本当のルール

matched intervention を使います。

  • simulator state/transition を固定し、environment が dynamically irrelevant と保証する appearance factor だけ変更。
  • appearance をほぼ固定し、next outcome を変えると分かっている physical variable だけ変更。
  • complete observable history を固定し、proposed action だけ変更。simulator を reset し、各 predicted branch と matching real transition を比較。

appearance は自動的に nuisance ではありません。traffic-light color、shadow、texture は real control state を示す場合があります。intuition ではなく experiment が invariance を保証します。

observation sufficiency が先です。identical render の opposite velocities は1 frame から読めません。representation failure と言う前に、motion が observable になるだけの history を与えます。history に clue があるのに latent/predicted future が collide すれば、より強い test です。

action sensitivity には3段階あります。output が変わるか、正しい方向へ変わるか、state–action interaction に依存するか。shuffled、zero、opposing、withheld actions は役立ちますが OOD pair も作れます。nonzero response だけで correct dynamics ではありません。

だまされる反例

同じ PushT pose を3つの harmless floor texture で描きます。次に、appearance はほぼ同じで opposite motion/different contact の view を作ります。harmless texture の方が prediction を大きく変えるなら、この controlled environment では wrong distinction を優先しています。

PhyLatent は3つの operational failure を名付けます。

  1. physical invariance collapse: appearance-only movement が selected physical transition を上回る。
  2. physical identifiability collapse: selected physical variables で遠い states が latent で近い。
  3. counterfactual dynamics collapse: materially different action consequences が圧縮される。

1 paper 内の定義で、universal taxonomy や theorem-level identification ではありません。threshold、simulator variable、scale、observability、pair selection が必要です。PhyLatent の baseline description は stopped future target を使い、original connected-target LeWM v3 と違います。提案 training も privileged physical targets を使います。

実験のレシート

later LeWM-family proposals は違う supervision を買います。

  • PSG-JEPA:LeWM forward loss/SIGReg に training-only proprioceptive-state head と multi-horizon joint-angle change (q_{t+k}-q_t) head。privileged labels は test にない。
  • SCALE:(1-\mathrm{corr}(d_z,d_q)) を加え、squared latent pair distance と standardized selected simulator-state distance を align。同じ labels の regression control は pairwise geometry を形づくらない。authors report 15/15 task–solver averages 改善。各 training config は1 seed、evaluation sets は episode sampling。
  • AC-MTM:SIGReg を除き、connected forward MSE + training-only Action-NCE inverse head。in-batch actions から recorded continuous-action block を識別。target network、stop-gradient、pretrained encoder、reconstruction loss なし。inverse head は test で破棄。matched 3-training-seed study は4 standard tasks average で SIGReg と同等、PushT で下回り、OGBench Visual Scene trajectory-goal stress test は80% vs 58%。random 52% は1回の50-episode run。

PSG-JEPA/SCALE は privileged simulator labels、AC-MTM は informative action variation/observable consequence を必要とします。どれも original v3 ingredient ではなく、本レビューで independent reproduction はありません。

各 diagnostic で simulator reset state、history、intervention、real outcomes、appearance control、support、checkpoint、threshold、seeds を保存します。representation improvement を fixed-planner ranking/success と交差させます。よい probe を cost が読まない場合があります。

3つのクイック質問

  1. globally non-collapsed representation が control variable を失うのはなぜですか。
  2. appearance change を irrelevant と呼ぶ前に何が必要ですか。
  3. action branch を matching real outcome と比べるのはなぜですか。