コース進捗 コース目次 48レッスン中 48件を公開中
第0部 読み方ガイド:私たちは何を学ぶのか
第1部 世界モデル:エージェントの頭の中にある実験場
第2部 画面を状態に変える:LeWMのモデル構造
第3部 モデルの抜け道を防ぐ:予測損失とSIGReg
第4部 モデルを行動に使う:潜在空間での計画
第5部 エンジニアリング再現:論文から動くシステムへ
第6部 LeWMは何を学んだのか
第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか
第8部 再現者から研究者へ
付録 数学・実装・再現・査読のための参照資料
まず大きな絵
- 見る画像と行動
- 圧縮する潜在状態へ
- 想像する行動ごとの未来
- 動く探して、試して、見る

このコースの背骨は1本です。観察 → 圧縮 → 想像 → 探索 → 行動 → 診断。この先の部品は、すべてこの線上に置けます。
小さなお話
ロボットの作業台に3つの道具を置きます。カメラは実際に起きた1本の旅を記録します。直接方策は、豊かな記憶を使う場合もありますが、意思決定時に複数の未来を明示的に探索せず行動を選びます。世界モデル付きプランナーは、選ぶ前に学習済みモデルの中で候補行動をリハーサルします。
LeWorldModel、略してLeWMは3つ目の道具です。順序付きの視覚–行動軌跡から学び、エンコーダーが観測を小さな潜在「パスポート」にし、行動条件付き予測器がそのパスポートを時間方向へ進めます。学習後は、凍結したモデル内でCEMが行動系列を探索し、MPCが設定済みの先頭部分だけを実行してから、もう一度現実を見ます。
ただし、パスポートは文字どおりの地図ではありません。潜在空間で近い2点が、現実では壁の反対側にあるかもしれません。壁紙を覚え、出入口を忘れた圧縮もあり得ます。
本当のルール
4つの名前を分けて覚えます。
- World modelは仕事の名前です。結果を考えられるだけの変化を表します。
- JEPAは、文脈表現から学習された対象表現を予測する広い考え方です。
- LeJEPAはSIGRegを用いた予測表現学習と非崩壊を扱います。
- LeWMは時間、行動、潜在ダイナミクス、プランニングを加えます。
本コースの基準は、2026年6月3日改訂のLeWorldModel v3と、2026年5月22日の公式コード 8edfeb336732b5f3ce7b8b210d0ba370a09e2cacです。LeJEPA v3とJEPA position paper v0.9.2は近縁の考え方を説明しますが、同じ実装ではありません。
オリジナルのLeWM v3は、1つの共有された学習可能な視覚エンコーダーを使います。次観測の対象表現もそのエンコーダーへ接続されたままです。学習時のstop-gradient、EMA教師、事前学習済み視覚エンコーダーは使いません。基盤世界モデルの学習にはタスク報酬も目標も不要ですが、順序付きの行動は不可欠です。目標は後のプランニングで登場します。
学ぶ: 観測 + 行動 -> 潜在ダイナミクス + 崩壊防止
凍結: エンコーダーと予測器
動く: 現在 + 目標 -> CEM -> 先頭を実行 -> 再観測
診断: データ -> 表現 -> ダイナミクス -> コスト -> 探索 -> 実行
だまされる仕掛け
行動を聞けない予測器を考えます。TwoRoomの記録の多くが同じ出入口を通るなら、履歴だけでも普通の続きは予測でき、損失はよく見えるかもしれません。しかしプランニング時には「上」「右」「停止」のどれも、ほぼ同じ未来になります。CEMは、耳栓をした審査員の前でオーディションをしているのです。
この反例が示すのは、よくある時間的続きの予測だけでは、行動条件付きプランニングモデルにならないということです。行動を入れ替えて予測が変わることは必要な証拠ですが、その向き、量、長期結果まで正しいとは証明しません。
実験レシート
証拠の締切日は2026年8月20日です。arXiv:2608.10145v1はsingle-seedのTwoRoomシステムを独立再実装し、位置probeとrepository protocolでのプランニングを再現しましたが、PushT、OGBench-Cube、多seedの頑健性は再現していません。arXiv:2608.12959v1は同じシステムを再利用した追試であり、2本目の独立再現ではありません。
TwoRoomは壁、迂回、悪いコストを見やすくします。PushTは接触、回転、滑りを加えます。どちらも一般物理や実ロボットの安全を証明しません。物語と図は仕組みを教える教材であり、論文の実験結果ではありません。
3問クイックチェック
- LeWMはなぜカメラや方策ではなく、リハーサル室なのでしょうか。
- EMA教師の図を否定するoriginal v3の事実は何でしょうか。
- 報酬なしで学習した世界モデルが、行動時には目標を必要とするのはなぜでしょうか。