JEPA4Japan · チュートリアル

第1章 — なぜエージェントには「未来を想像する」力が必要なのか

1,361文字 4分で読めます #LeWorldModel#World Models#JEPA

反応型方策と世界モデルを比較し、動画予測から意思決定シミュレーション、MPC、知覚・予測・選択の失敗までを学びます。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 現在のレッスン
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 見る壁と出入口
  2. 分岐する複数の行動を試す
  3. 比べるどの未来がよい?
  4. 計画し直すもう一度見る
認識が説明するのは現在です。行動には、最初は悪く見える迂回も含めた未来の比較が必要です。

短い直線は壁で止まり、長い経路は出入口を通って目標へ届きます。

小さなお話

ロボットが壁、出入口、目標を完璧に見分けても、壁へ突進することがあります。「今すぐ目標に近づく行動」だけを選ぶからです。本当に役立つ経路は、いったん目標から離れ、出入口を通り、向こう側で戻ります。

名詞が見えるだけでは足りません。行動には目的、結果のモデル、そして時間が必要です。直接方策も履歴を使う強力な仕組みになれます。違いは、世界モデル付きプランナーが意思決定時に候補未来を明示的にロールアウトして探索することです。

本当のルール

このコースでの「想像」は人間の心の映画ではなく、条件付き計算です。

現在の潜在履歴 + 提案行動 -> 次の潜在状態の予測

LeWMのエンコーダーは現在の状況を潜在空間で表し、予測器は「この行動なら次に何が起きるか」を問います。意思決定用シミュレーターには3つが必要です。

  • 行動感度:現実の結果が違う行動なら予測も変わること。
  • ロールアウト:予測状態をもう一度先へ進められること。
  • 意思決定口:想像した結果を目標やコストと比べられること。

中核モデルが予測するのは潜在状態であり、未来動画ではありません。論文の補助decoderは観察用で、学習対象でもプランナーでもありません。1本の決定論的予測は複数の可能な未来を隠し得ます。baseline interfaceには較正済み不確実性分布がありません。

MPCは計画を仮のものにします。行動系列を提案し、終端を想像し、評価し、設定された先頭部分だけ実行して、もう一度観測します。LeWM v3の報告設定ではhorizonは5 model stepsで、5つすべてを実行してから再計画します。1 model stepに5 environment actionsが入るため、feedbackは25 environment steps後です。1行動ごとのループもMPCですが、この報告設定の再現ではありません。

baselineの終端scoreはencoded goalへのsquared Euclidean distanceです。便利な潜在定規ですが、到達可能性、経路長、移動時間そのものではありません。

だまされる仕掛け

先読みを外すと、greedy agentは目標へ近づこうとして壁に沿い続けます。feedbackを外すと、最初は妥当だった経路が、観測可能な障害の出現後も古いまま残ります。MPCを加えれば迂回できる場合がありますが、それは観測、表現、モデル、コスト、探索が役立つ場合だけです。

同じ衝突でも、始まりは別々です。

  1. 知覚:潜在表現が壁や動きを落とした。
  2. 想像:予測器が壁を通る、または長期でdriftした。
  3. 選択:コストが誤った終端を好む、またはCEMが出入口を見つけない。

同じ偽の近道を毎回描くモデルは、再計画しても直りません。最終的な失敗だけでは原因を特定できません。

実験レシート

LeWorldModel v3と固定公式リポジトリは、pixel encoder、action-conditioned latent predictor、autoregressive rollout、terminal latent cost、CEM探索、設定可能なMPC prefixを裏づけます。repositoryはplanning/evaluationの一部をstable-worldmodelへ委ねるため、solver conventionは推測せず記録する必要があります。

TwoRoomの迂回、閉じた出入口、3段階の診断は教材用です。先読みとfeedbackが重要になり得る理由を示しますが、すべての直接方策が失敗することや、すべてのmodel-based controllerが成功することは証明しません。

3問クイックチェック

  1. なぜ目標から離れる動きが正しい最初の行動になり得るのでしょうか。
  2. どのようなaction-swap結果なら、予測器が行動を無視している疑いがありますか。
  3. MPCが新しい観測を得ても繰り返し得る誤りは何でしょうか。