JEPA4Japan · チュートリアル

第22章 — 最初の実験:TwoRoomのスモークテスト

1,127文字 4分で読めます #LeWorldModel#World Models#JEPA

小さなモデルを訓練し、表現崩壊、1ステップ予測、複数ステップロールアウト、CEM計画、部屋をまたぐ軌跡を順番に検査します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 現在のレッスン
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. dataepisode と action は正しいか。
  2. state必要な違いが残っているか。
  3. future固定 action の rollout は道を外れないか。
  4. plancost、search、execution が使えるか。
TwoRoom は pipeline 全体の煙探知器です。万能知能の証明書ではありません。

data から closed-loop execution まで7つの gate が並び、各 failure で止まります。

小さなお話

煙探知器を試すなら、家を燃やさず、小さな煙を使います。TwoRoom はその小さな煙です。

連続した2部屋、中央の壁、1つのドア、動く agent、壁の向こうの goal があります。論文は 10,000 episodes、平均92 environment steps を報告します。noisy heuristic は、まずドアへ、その後 goal へ向かいます。data はドアを通る細い support corridor に集まり、すべての位置と action を一様に調べてはいません。

pass して示せるのは、1つの透明な environment で data-to-planning path が動いたことです。contact physics、real-robot safety、広い generalization、exact paper reproduction は示しません。

本当のルール

tuning 前に artifact と episode split を凍結します。時間順、action/image alignment、door crossing、support、frame skip、window が episode boundary をまたがないことを確認します。

次の7 gate を順番に進みます。

  1. Data: episode、action、range、support。
  2. Representation: spread、covariance spectrum、duplicates、neighbors、action sensitivity。
  3. One step: held-out recorded transitions と action swap。
  4. Self-fed: fixed recorded actions と horizon 別 rollout error。
  5. Cost: candidate endpoint が分かれ、wall topology を誤順位しない。
  6. Search: CEM proposal と elites が本当に変わる。
  7. Closed loop: denormalized action が environment に届き、新観測で replan する。

最初に失敗した gate で止まり、checkpoint と episode を保存します。深い failure は共存できるので、「最初に観測できた break」は「唯一の真因」より安全です。

paper card は10 epochs、TwoRoom history 1、非 PushT CEM refinements 10。frozen-code card は maximum 100 epochs、global history 3、shared refinements 30。調査した official checkpoint も history 3 です。小さい run はよいですが TEACHING SMOKE TEST と書き、parameters、updates/epochs、batch/history、precision、device、time、data exposure を公開します。

だまされる反例

平均 one-step error が低いとします。多くの transition が open floor にあるからかもしれません。start と goal を壁の両側ですぐ近くに置くと、terminal latent distance は environment が止める直線を好む場合があります。

次の controlled replacements を行います。

  • learned dynamics + oracle shortest-path cost。
  • oracle dynamics + learned cost。
  • 強制 doorway waypoint。
  • 新しい search randomness を入れず selected actions を replay。

wall collision だけでは dynamics を診断できません。oracle-cost repair は geometry/ranking、oracle-dynamics repair は rollout を疑わせます。waypoint は topology を与えれば動けることしか示しません。action rescaling、sparse doorway data、finite search も残ります。

SIGReg も同じです。LeWM v3 は named baselines より弱い TwoRoom planning を報告し、low-diversity/low-intrinsic-dimensional data と high-dimensional isotropic Gaussian target の緊張を可能性として挙げます。因果を分離した結果ではありません。

実験のレシート

調査した official data revision は 6903a2d。frozen evaluation card は50 episodes、同じ trajectory の25 environment steps 先を goal、action budget 50、horizon と execution interval は各5 model blocks、1 block は5 raw actions です。shared solver card は300 candidates、30 elites、initial variance 1、30 refinements。(H=K=5) なので、feedback は25-step planned segment 全体の後です。

独立 TwoRoom reproduction は identical episodes 上で自分の checkpoint 94%、released checkpoint 84% を、各 config 1 training seed で報告します。3 checkpoints の one-step error は long-horizon success を順序づけません。100/150 の議論は旧 v1/v2 で、v3 は repository の 25/50 goal/budget card です。

data revision、split、checkpoint、paper/code/run cards、seven-gate traces、全 seed、正確な action unit を保存します。global latent cloud が健康でも、1本の route が成功しても、すべての場所で topology が有用とは限りません。

3つのクイック質問

  1. doorway heuristic は data support をどう狭めますか。
  2. planner-selected rollout より fixed-action rollout を先に試すのはなぜですか。
  3. wall collision から分かること、分からないことは何ですか。