コース
LeWorldModel: From Pixels to Imagination
ロボットの頭に小さなリハーサル室を作り、行動を選び、想像の間違いを見つけるまでを大きな絵で学ぶコースです。
- モジュール
- 10 モジュール
- レッスン
- 48 レッスン
- 目安
- 目安 24時間
- 対象
- 対象: まずやさしい物語で全体をつかみ、必要なときだけPython・数式・証拠の控えを開きたい方。
コース全体を一枚で見る
- 見る 画像と行動
- 小さくする 状態カードを作る
- 想像する 頭の中で行動を試す
- 動く 少し進み、また見る
- 確かめる 最初の間違いを探す
小さなロボットが壁の向こうのゴールを見ています。まっすぐ走れば壁にぶつかります。入口を選ぶには、現実で動く前に、頭の中のお試し世界で行動を比べる必要があります。
コースの背骨は一本です。
観測する → 圧縮する → 行動つきで想像する → 探す → 少し動く → もう一度見る → 診断する
TwoRoomでは間違いを目で追えます。PushTでは接触と回転が加わり、迷路だけでは説明できない制御の難しさが見えてきます。
3枚の真実カード
- 元のモデル: LeWM v3は、共有エンコーダーと予測器をprediction lossとSIGRegで端から端まで学習します。stop-gradient、EMA教師、事前学習済み視覚エンコーダーは使いません。
- プランナー: 学習後のモデルは固定します。CEMが行動列を試し、MPCが決めた先頭部分だけを実行してから、もう一度観測します。
- 安全線: 非崩壊は物理理解ではなく、潜在空間の近さは到達可能性ではなく、一回の成功は「理解」の証明ではありません。
この地図の歩き方
まず大きな絵だけを読みましょう。式、テンソル形状、設定値、出典が必要になったときだけ、短い技術バックパックを開きます。後続手法はすべて研究フロンティアに置き、オリジナルLeWM v3の説明へこっそり混ぜません。
コース進捗
コース目次
第0部 読み方ガイド:私たちは何を学ぶのか
モデル、資料、エビデンスの境界を最初に整理し、コース全体を安全に読み進めるための共通基盤を作ります。
第1部 世界モデル:エージェントの頭の中にある実験場
行動の前に未来を試すという世界モデルの役割と、ピクセルではなく意味を予測するJEPAの発想を身につけます。
- 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 反応型方策と世界モデルを比較し、動画予測から意思決定シミュレーション、MPC、知覚・予測・選択の失敗までを学びます。 公開中
- 03 第2章 — なぜ次の画像をそのまま予測しないのか ピクセル誤差とタスク誤差の違いを手がかりに、潜在空間への圧縮と、圧縮・予測可能性のトレードオフを考えます。 公開中
- 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する Joint-Embedding Predictive Architectureの役割分担を理解し、自動符号化器、対照学習、生成型動画モデルとの違いを整理します。 公開中
- 05 第4章 — 1枚の図でLeWMを理解する 観測と行動から、エンコーダー、潜在動力学、SIGReg、プランナー、MPCへ至る訓練時と計画時のデータフローを俯瞰します。 公開中
第2部 画面を状態に変える:LeWMのモデル構造
軌跡データを潜在状態へ変換し、行動条件付きの予測器で時間を進めるLeWMの構造を、テンソル形状とともに追います。
- 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 観測、行動、時刻、エピソードから成るオフライン軌跡を理解し、状態空間のカバレッジが想像可能な世界の境界を決めることを確認します。 公開中
- 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 画像パッチ、ViT、[CLS]トークン、プロジェクター、正規化を通じ、画像テンソルが潜在ベクトルへ変わる過程をPyTorchで追跡します。 公開中
- 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 行動をAdaLNで条件付ける因果Transformerを学び、教師強制による訓練と自回帰ロールアウトによる計画の差を理解します。 公開中
- 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 観測の符号化、行動条件、次状態予測、予測対象表現の構成、2つの損失、勾配の流れを、最小構成と形状検査で結び付けます。 公開中
第3部 モデルの抜け道を防ぐ:予測損失とSIGReg
予測誤差だけでは生じうる表現崩壊を理解し、SIGRegの直感、数学、エンドツーエンド訓練、実務上の安定化を段階的に扱います。
- 10 第9章 — 最も危険な近道:表現崩壊 すべての入力を同じベクトルへ写す平凡解を、過学習と区別しながら、分散、共分散、有効ランク、最近傍で診断します。 公開中
- 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 潜在状態のMSEが制約するものを明確にし、低い一歩予測誤差が長期ロールアウトや高い計画成功率を保証しない理由を検討します。 公開中
- 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 等方ガウス目標、ランダム方向への射影、Epps–Pulley統計量、Cramér–Woldの直感から、教師や負例を使わず表現崩壊を抑える仕組みを学びます。 公開中
- 13 第12章 — 必要最小限の数学 予測損失、標準ガウス制約、1次元射影、検定統計量、完全な目的関数を導き、λが2つの損失の重みであることを正確に理解します。 公開中
- 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み LeWM v3がstop-gradient、EMA教師、事前訓練済み視覚モデルを使わず、エンコーダーと予測器を一体で適応させる学習時の計算グラフを確認します。 公開中
- 15 第14章 — すぐに表現崩壊しないモデルを訓練する 初期化、データ正規化、系列長、最適化、SIGReg射影数、混合精度、チェックポイント、スモークテスト、必須ログを実践的に整えます。 公開中
第4部 モデルを行動に使う:潜在空間での計画
目標画像を潜在空間上のコストへ変換し、CEMとMPCで行動を探索しながら、長期rolloutの誤差と、プランナーがモデルの欠陥を利用する現象を診断します。
- 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 現在画像と目標画像を同じ潜在空間へ符号化し、候補行動をrolloutして終端コストが最小の系列を選ぶ流れを学びます。 公開中
- 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 見た目の近さ、直線距離、有向の到達可能性を区別し、潜在距離を計画コストとして使えるかを実験で検証します。 公開中
- 18 第17章 — CEM:勝ち抜き方式で行動を探索する 候補系列のサンプリング、モデル内シミュレーション、エリート選抜、分布更新を繰り返し、探索予算と代表的な失敗を理解します。 公開中
- 19 第18章 — MPC:モデルを一度に長く信じすぎない 計画の先頭だけを実行し、新しい観測で再符号化・再計画する閉ループと、再計画間隔や外乱の影響を学びます。 公開中
- 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 誤差蓄積、モデル生成状態への分布ずれ、潜在状態の漂流、隠れた不確実性、プランナーによるモデル悪用を診断します。 公開中
- 21 第20章 — 最小のLeWMプランナーをゼロから実装する 候補行動の一括生成とベクトル化ロールアウト、終端コスト、CEM更新、部分実行を整理し、実軌跡・想像軌跡・ベースラインを比較します。 公開中
第5部 エンジニアリング再現:論文から動くシステムへ
公式リポジトリを主要な実装上の基準として、TwoRoomとPushTの訓練・計画・評価を再現可能な手順へ落とし込みます。
- 22 第21章 — 公式リポジトリと実験環境 公式コードの構造、Hydra設定、HDF5軌跡、単一GPU訓練、チェックポイント、評価スクリプトの関係を確認し、第三者実装との混同を避けます。 公開中
- 23 第22章 — 最初の実験:TwoRoomのスモークテスト 小さなモデルを訓練し、表現崩壊、1ステップ予測、複数ステップロールアウト、CEM計画、部屋をまたぐ軌跡を順番に検査します。 公開中
- 24 第23章 — 2つ目の実験:PushTを再現する 接触動力学を含むPushTでデータ、訓練、目標画像計画、成功率と距離指標、失敗分類を扱い、TwoRoomとの差を比較します。 公開中
- 25 第24章 — 世界モデルを公平に評価する方法 1ステップ・複数ステップ・閉ループ指標、成功率、データ量、モデル規模、行動・計算予算、ベースライン、複数の乱数シード、失敗分布を条件付きで報告します。 公開中
- 26 第25章 — 失敗診断マニュアル 損失、表現、ロールアウト、CEM、行動条件、SIGReg、バッチ、データのカバレッジを層別に点検し、モデルの失敗と実装バグを切り分けます。 公開中
第6部 LeWMは何を学んだのか
プローブ、表現統計、軌跡解析、期待違反実験をエビデンスの強さに応じて読み、「理解」という主張を検証可能な命題へ分解します。
- 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 位置、速度、角度、目標距離を線形・MLPプローブで調べ、デコード可能性と実際の利用を区別し、漏洩や因果の過剰解釈を防ぎます。 公開中
- 28 第27章 — 潜在空間を「健康診断」する 平均、分散、共分散スペクトル、有効次元、最近傍、時間的連続性を測り、t-SNE、UMAP、観察用デコーダーの限界を明示します。 公開中
- 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 通常の動力学と物体の瞬間移動を対照し、潜在予測誤差による驚き信号を設計しつつ、それが人間的な物理理解を証明しないことを確認します。 公開中
- 30 第29章 — 「世界を理解する」を厳密に語るには 予測可能性、デコード可能性、可制御性、構成的汎化、反実仮想整合性、因果同定、計画有用性を別々の検証可能な主張として扱います。 公開中
第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか
後続研究を発表順ではなく失敗機構ごとに整理し、オリジナルLeWMの説明と、診断・拡張としての研究フロンティアを明確に分けます。
- 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 局所予測と大域到達のずれを分析し、到達可能性、有向時間距離、多時間尺度予測、ロールアウト整合性をRC-auxなどの研究フロンティアと比較します。 公開中
- 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 外観と動力学状態、状態の同定可能性、反実仮想の行動応答を調べます。PhyLatentは最近の診断的提案として扱い、オリジナルLeWMの学習時の計算グラフを説明する根拠には用いません。 公開中
- 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 低い内在次元と局所幾何の歪みを検討し、Sub-JEPA、TC-LeWM、QQWorldを、追加の独立再現を要する後続研究として扱います。 公開中
- 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 行動プレフィックス予測、複数の未来の並列予測、マクロ行動、階層化を比較し、Fast-LeWM、HWM、Hi-LeWMから階層計画が必ず優れるとは結論づけないようにします。 公開中
- 35 第34章 — 位置の距離からタスクの進捗へ 障害物や操作段階で非単調になる進捗を考え、進捗を考慮した表現、双曲空間、ProWorld、到達可能性との違いを検討します。 公開中
- 36 第35章 — マルチタスク、実ロボット、視覚的外乱 背景、照明、カメラ、タスク識別、深度補助、予測器の過剰パラメータ化、ノイズ、部分観測性を扱い、シミュレーションから実環境へのエビデンスの隔たりを示します。 公開中
- 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 線形動力学、定常分布、加法ノイズなどの仮定下にある同定可能性の結果を学び、非線形・部分観測・多峰的な未来へ無条件に外挿しません。 公開中
第8部 再現者から研究者へ
失敗機構を切り分ける実験設計から、実行可能な研究課題、LeWM研究の未解決問題までを一つの研究実践として組み立てます。
付録 数学・実装・再現・査読のための参照資料
本文を支える最低限の数学、PyTorch実装、テンソル形状、実験設定、エビデンス記録、用語、再現性、専門家査読の実務資料です。
- 41 付録A — 最低限必要な数学ツールキット ベクトル、行列、バッチ次元、統計量、ガウス分布、ランダム射影、勾配降下、MSE、誤差伝播、モンテカルロ推定、CEMの確率的見方を復習します。 公開中
- 42 付録B — PyTorch実装クイックリファレンス Dataset、DataLoader、Transformer入力、因果マスク、AdaLN、SIGReg、ベクトル化rollout、CEM、混合精度、チェックポイントを参照実装としてまとめます。 公開中
- 43 付録C — テンソル形状の完全一覧 [B,T,C,H,W]から[B,T,D]、さらに候補計画時の[B,N,H,D]まで、各次元、ブロードキャスト規則、代表的な誤りを追跡します。 公開中
- 44 付録D — 実験設定カード TwoRoom、Reacher、PushT、OGBench-Cubeの各環境設定に加え、最小教材用、論文再現用、単一GPU・資源制約用の設定を整理します。 公開中
- 45 付録E — 論文タイムラインとエビデンスレベル 各研究が変更する層、対象とする失敗機構、論文バージョンと公開日、エビデンスの強さ、著者による報告にとどまるか、公開コードと独立再現の有無、外挿できない結論を時系列で記録します。 公開中
- 46 付録F — 用語集 表現崩壊、潜在状態、ロールアウト、到達可能性、同定可能性などを、正式定義、一文説明、生活上の比喩、よくある誤解の4層で説明します。 公開中
- 47 付録G — 再現チェックリスト ソフトウェア・ハードウェア、データハッシュ、乱数シード、パラメータ数、訓練・計画予算、ベースライン、評価エピソード、失敗例、ログとチェックポイントを点検します。 公開中
- 48 付録H — 専門家査読チェックリスト オリジナルの学習時の計算グラフ、後続の派生モデルとの区別、プローブの解釈、ベンチマークの一般化、因果、理論仮定、負の結果、再現に使うコードの場所を監査します。 公開中