JEPA4Japan · チュートリアル

第0章 — はじめる前に

1,494文字 4分で読めます #LeWorldModel#World Models#JEPA

LeWM、LeJEPA、世界モデルの関係を整理し、使用する資料、エビデンスレベル、学習ルート、TwoRoomとPushT、最終成果物を確認します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 現在のレッスン

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 見る画像と行動
  2. 圧縮する潜在状態へ
  3. 想像する行動ごとの未来
  4. 動く探して、試して、見る
LeWMは学習されたリハーサル室です。カメラ、目標、運転手、完全な物理オラクルではありません。

カメラ、直接方策、LeWMのリハーサル空間は別々の道具です。

このコースの背骨は1本です。観察 → 圧縮 → 想像 → 探索 → 行動 → 診断。この先の部品は、すべてこの線上に置けます。

小さなお話

ロボットの作業台に3つの道具を置きます。カメラは実際に起きた1本の旅を記録します。直接方策は、豊かな記憶を使う場合もありますが、意思決定時に複数の未来を明示的に探索せず行動を選びます。世界モデル付きプランナーは、選ぶ前に学習済みモデルの中で候補行動をリハーサルします。

LeWorldModel、略してLeWMは3つ目の道具です。順序付きの視覚–行動軌跡から学び、エンコーダーが観測を小さな潜在「パスポート」にし、行動条件付き予測器がそのパスポートを時間方向へ進めます。学習後は、凍結したモデル内でCEMが行動系列を探索し、MPCが設定済みの先頭部分だけを実行してから、もう一度現実を見ます。

ただし、パスポートは文字どおりの地図ではありません。潜在空間で近い2点が、現実では壁の反対側にあるかもしれません。壁紙を覚え、出入口を忘れた圧縮もあり得ます。

本当のルール

4つの名前を分けて覚えます。

  • World modelは仕事の名前です。結果を考えられるだけの変化を表します。
  • JEPAは、文脈表現から学習された対象表現を予測する広い考え方です。
  • LeJEPAはSIGRegを用いた予測表現学習と非崩壊を扱います。
  • LeWMは時間、行動、潜在ダイナミクス、プランニングを加えます。

本コースの基準は、2026年6月3日改訂のLeWorldModel v3と、2026年5月22日の公式コード 8edfeb336732b5f3ce7b8b210d0ba370a09e2cacです。LeJEPA v3とJEPA position paper v0.9.2は近縁の考え方を説明しますが、同じ実装ではありません。

オリジナルのLeWM v3は、1つの共有された学習可能な視覚エンコーダーを使います。次観測の対象表現もそのエンコーダーへ接続されたままです。学習時のstop-gradient、EMA教師、事前学習済み視覚エンコーダーは使いません。基盤世界モデルの学習にはタスク報酬も目標も不要ですが、順序付きの行動は不可欠です。目標は後のプランニングで登場します。

学ぶ:    観測 + 行動 -> 潜在ダイナミクス + 崩壊防止
凍結:    エンコーダーと予測器
動く:    現在 + 目標 -> CEM -> 先頭を実行 -> 再観測
診断:    データ -> 表現 -> ダイナミクス -> コスト -> 探索 -> 実行

だまされる仕掛け

行動を聞けない予測器を考えます。TwoRoomの記録の多くが同じ出入口を通るなら、履歴だけでも普通の続きは予測でき、損失はよく見えるかもしれません。しかしプランニング時には「上」「右」「停止」のどれも、ほぼ同じ未来になります。CEMは、耳栓をした審査員の前でオーディションをしているのです。

この反例が示すのは、よくある時間的続きの予測だけでは、行動条件付きプランニングモデルにならないということです。行動を入れ替えて予測が変わることは必要な証拠ですが、その向き、量、長期結果まで正しいとは証明しません。

実験レシート

証拠の締切日は2026年8月20日です。arXiv:2608.10145v1はsingle-seedのTwoRoomシステムを独立再実装し、位置probeとrepository protocolでのプランニングを再現しましたが、PushT、OGBench-Cube、多seedの頑健性は再現していません。arXiv:2608.12959v1は同じシステムを再利用した追試であり、2本目の独立再現ではありません。

TwoRoomは壁、迂回、悪いコストを見やすくします。PushTは接触、回転、滑りを加えます。どちらも一般物理や実ロボットの安全を証明しません。物語と図は仕組みを教える教材であり、論文の実験結果ではありません。

3問クイックチェック

  1. LeWMはなぜカメラや方策ではなく、リハーサル室なのでしょうか。
  2. EMA教師の図を否定するoriginal v3の事実は何でしょうか。
  3. 報酬なしで学習した世界モデルが、行動時には目標を必要とするのはなぜでしょうか。