JEPA4Japan · チュートリアル

第39章 — LeWM研究の未解決問題

1,494文字 5分で読めます #LeWorldModel#World Models#JEPA

計画に適した表現幾何、表現崩壊の回避、多様な未来、分布外想像、可制御性、階層、潜在次元、説明能力、次の研究パラダイムを問い直します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 現在のレッスン

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 分かった海岸working pipeline は名指せます。
  2. 点線の海岸複数の説明がまだ残ります。
  3. 次の航海説明を分ける test を選びます。
open question は空っぽの願いではありません。competing hypothesis と、結果によって考えを変えられる experiment を含みます。

小さなお話:未完成の地図帳

地図帳では、船が測った海岸は実線、複数の形がありうる場所は点線です。慎重な地図職人は、最新の旅行者が好きな絵で点線を埋めません。

この course の実線の spine は控えめです。pixel を observe し、useful latent state に compress し、action-conditioned future を imagine し、CEM/MPC で search/act し、imagination が unreliable な場所を diagnose します。frontier は、どの geometry、target、uncertainty、hierarchy、support rule、successor paradigm がこの loop に合うかを問います。新しい paper は candidate と author-reported evidence を出しますが、点線を consensus にしません。

course spine の周囲に十の open question を置き、solid/dotted boundary はあるが maturity ranking はない atlas。

この map は question を整理します。paper を順位付けせず、どの route が勝つかも予言しません。

技術のリュック:十の open question

#Open questionCompeting hypothesis役立つ discriminator
1planning に適した geometry は?Euclidean proximity、directed reachability、task progress、trajectory cost、uncertainty-aware decision ranking が task ごとに優位かもmatched open-room、wall、contact、budget sweep と oracle ranking
2non-collapse に global distribution matching は必要?full Gaussian pressure、subspace/local matching、temporal centering、transition-derived action objective のどれでも足りるかもequal-data anti-collapse test と topology、slow-variable、tail、planning check
3複数の可能な future をどう表す?conditional mean で control に十分か、explicit branch/distribution が必要かmean が物理的に存在しない calibrated multimodal environment
4imagination が support 外だとどう知る?ensemble disagreement、predictive spread、nearest-data distance、action-conditional consistency、realized error のどれがよいかcontrolled support removal と後の ground-truth rollout error
5offline behavior から controllability を学べる?inverse action / action-sensitive branch で十分か、state-conditioned intervention 欠如が ambiguity を残すかstate を固定し、action direction を見せる/隠す
6long goal に explicit hierarchy は必要?prefix prediction、良い cost の flat MPC、learned chunk、latent subgoal のどれでも足りるかもhorizon 間で model-call、action、latency、support budget を match
7latent state はどれほど大きくすべき?wide latent が rare distinction を守るか、capacity を浪費して low intrinsic dimension と衝突するかcompute-fixed width/rank sweep と collapse、rollout、planning diagnostic
8task-agnostic と task-effective representation は衝突する?invariance が transfer を助けるか、task context / privileged grounding が必須かfactor-isolated nuisance/task intervention と held-out task composition
9predicting から explaining へどう進む?probe/counterfactual prediction で mechanism が見えるか、causal assumption を持つ intervention だけが説明を支えるかcorrelation、use、causal effect を分ける preregistered intervention
10何が LeWM line を置換・吸収する?branching prediction、unified JEPA objective、amortized/search-free control、value-shaped geometry、別 world-model paradigmprediction、counterfactual、support、planning、transfer、compute、safety の共通 load test

question は相互作用しますが、一つの scoreboard に潰せません。model はよく predict して plan ranking を誤れます。一 planner で useful でも identifiable とは限りません。public code があっても independently reproduced とは限りません。一 GPU budget で速くても support-shifted goal に弱いかもしれません。

壊してみる

Cedar と Comet という二 system を作ります。average one-step loss と average success は同じです。Cedar は近い goal に成功して across-wall goal に全敗します。Comet は across-wall goal に成功しますが visual change 後に失敗します。一平均では同じでも、二つの world は違います。

goal type、horizon、support、visual intervention、planner budget、failure trajectory を開示します。次 experiment は別です。Cedar には geometry/cost test、Comet には nuisance/representation test が要ります。だから open question には aggregate leaderboard の追加ではなく discriminator が要ります。

proposed successor ごとに、名前を褒める前に load-test ledger を凍結します。training information、target graph、future representation、action interface、model call、search budget、hardware、data support、transfer split、safety mechanism です。新 paradigm は一列に勝ち別列に負けられます。“LeWM を置き換える” は宣言した evidence が出るまで speculation です。

実験レシートと証拠の境界

  • Baseline coordinate: LeWorldModel v3 と LeJEPA v3。direct update は TRM、SMWM、VLWM、PSG-JEPA、TwoRoom reproduction、VIScore、ACPC、Objective Bottleneck、Traj-LeWM、SCALE、AC-MTM、DA-LeWM です。
  • Neighboring route は Branch-JEPA v3、UniJEPA、Qantara、INTACT です。LeWM version ではなく、隣にあるだけで replacement にはなりません。
  • LeJEPA v3 は 2025-11-14、LeWM v3 は 2026-06-03 改訂。最新の named direct update は DA-LeWM v1 の 2026-08-19。evidence cutoff は 2026-08-20、Asia/Tokyo。baseline code は 8edfeb3 に凍結し、他の inspected revision も動く main ではなく Appendix E の記録に固定します。
  • baseline と最新項目のうち SMWM、PSG-JEPA、tinylab、VIScore、ACPC、Traj-LeWM、AC-MTM、INTACT で author-linked code を確認し、TRM、VLWM、SCALE、DA-LeWM では未確認です。independent reproduction は明記した TwoRoom environment と protocol だけです。他の result は各 author の task、supervision、planner、compute、assumption を保ちます。

3つのクイック質問

  1. broad unknown を scientific open question に変えるものは何ですか?
  2. equal average loss/success が異なる world-model failure を隠せるのはなぜですか?
  3. proposed successor 同士で “better” を意味ある語にするには、どの evidence field を共有すべきですか?