JEPA4Japan · チュートリアル

第38章 — 実行可能な12の研究課題

1,589文字 5分で読めます #LeWorldModel#World Models#JEPA

到達可能性、不確実性、多ステップ学習目標、時間階層、局所ガウス、行動可制御部分空間、サポート制約付きCEM、言語目標、環境間転移を研究計画へ変えます。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 現在のレッスン
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 質問を一つfailure と prediction を名指します。
  2. 小さな test を一つsandbox で mechanism を一つ変えます。
  3. 負け方を一つscore より先に falsifier を書きます。
research idea は、locked baseline、測れる intervention、privileged-information label、budget、idea を弱めうる結果を持つと実行可能になります。

小さなお話:十二隻の船

港に十二隻の船があります。planning geometry、uncertainty、representation structure、search/transfer を試す船です。どれも「優勝者」ではありません。それぞれが小さな出航カード、つまり question、一つの変更、measurement、港へ戻る condition を持ちます。

十二の番号付き project boat を四 fleet に等しく置き、共通 diagnostic buoy を囲ませた research map。成熟度順位はありません。

これは experiment plan で、新しい result ではありません。同じ berth は difficulty、promise、evidence が同じという意味ではありません。

技術のリュック:十二枚の出航カード

全 card は frozen LeWM baseline、episode-disjoint data、宣言した seed、matched training/planning budget、raw log、positive/null/negative reporting から始めます。simulator state、shortest path、reward、depth、language annotation が component の training/evaluation に入るときは privileged と明記します。

#Project変更と測定idea を弱める結果
1Latent distance vs true shortest pathTwoRoom で latent pair distance と oracle geodesic distance を相関。same-room/across-wall、near/far に層別化held-out layout で相関が消える、または相関改善が candidate ranking を改善しない
2Directed reachabilitytrajectory offset と constructed negative から budget-conditioned ordered score を学び、withheld direction/horizon を testscore が symmetric、dataset frequency 追随、または matched oracle-budget ranking に失敗
3Predictive uncertainty calibrationspread/error bin を予測し、confidence と後の self-fed rollout error を比較confidence が鋭いが uncalibrated、または horizon length だけを追う
4Ensemble epistemic uncertaintymatched-seed / bootstrap model を学習し、support 内外の disagreement を比較member が同じ unsupported shortcut に誤って同意、または disagreement が optimization noise だけを表す
5Multi-step traininginference と budget を固定し、宣言した rollout-consistency / multi-horizon loss を一つ追加one-step loss は改善するが long rollout/planning は悪化、または extra update 由来の gain
6Temporally hierarchical latentscoarse state / action chunk を学び、reconstruction、reuse、support、two-level cost を監査high-level error、unsupported subgoal、overhead が節約 low-level compute を上回る
7Local Gaussian structure, global topologylocal neighborhood / subspace を regularize し、global spread と doorway continuity を別測定anti-collapse が弱まる、または extra capacity なしでは topology gain が消える
8Action-controllable subspaceaction-sensitive change と content を分け、intervention、nuisance change、弱く controlled な variable を test“control” space が background/task ID を encode、または遅い task-critical state を捨てる
9Counterfactual-dynamics probesmatched state で recorded/withheld action の prediction を simulator transition と比較branch separation はあるが consequence が誤る、または recorded action だけ正確
10Support-constrained CEMsupport distance を penalty にするか empirical action/macro-action anchor 近くを探索し、constraint strength を報告strict gate が valid novel detour を塞ぎ、loose gate は model exploit を許す
11Goal images to language goals宣言した language-to-goal interface を追加。object–relation combination を hold out し、oracle goal encoding と比較success が composition でなく memorized phrase / paired-goal leakage に依存
12Cross-environment latent alignmentpaired anchor で environment 間を align し、held-out dynamics、view、task を testalignment は probe を改善するが、どちらかの world の transition prediction/planning を悪化

Project 1–2 は distance と directed budgeted feasibility、3–4 は predictive spread、ensemble disagreement、support distance、actual error、5–6 は長い training target と hierarchy、7–9 は action に必要な representation structure、10–12 は search、goal、transfer を分けます。各 card が自分の test に勝つ前に結合すると、診断を壊します。

壊してみる

Support-constrained CEM はよい自己攻撃です。一つの TwoRoom layout で、unconstrained optimizer は不可能な shortcut を取ります。中程度の support rule は doorway へ導きます。次に training trajectory にない valid novel detour を入れます。厳しすぎる rule は唯一の成功 path を塞ぎます。

support penalty を sweep し、両 failure family を見せます。oracle feasible-route label は evaluation だけに使います。best threshold が goal type で変わるなら、interaction を報告し、一平均に隠しません。universal threshold がなくても project は科学的に成功できます。model exploitation と over-conservative search の trade-off を地図化したからです。

全 card に removal test が要ります。geometry では wall を除き、controllability では action coverage を均し、uncertainty では controlled out-of-support sample を注入し、grounding では privileged label を shuffle し、alignment では paired anchor を除き、composition では language combination を hold out します。easy condition だけを生き残る result は広い claim を得ません。

実験レシートと証拠の境界

  • これらは tutorial-generated hypothesis で、報告済み improvement ではありません。直接の inspiration は LeWorldModel v3、RC-aux、TRM、Sub-JEPA、SMWM、VLWM、Temporal-Distance JEPA、Fast-LeWM、Hi-LeWM、PSG-JEPA です。
  • 後の diagnostic/decision route は TwoRoom reproduction、VIScore、ACPC、Objective Bottleneck、Traj-LeWM、SCALE、AC-MTM、DA-LeWM です。明確に限定した TwoRoom 再実装以外の evaluation は author-reported です。
  • LeWM、RC-aux、Temporal-Distance JEPA、Sub-JEPA、Fast-LeWM、Hi-LeWM、stable-worldmodel、passive-identifiability、SMWM、PSG-JEPA、tinylab、VIScore、ACPC、Traj-LeWM、AC-MTM では凍結 public implementation を確認しました。cutoff までに TRM、VLWM、SCALE、DA-LeWM、PhyLatent、TC-LeWM、QQWorld、ProWorld、controlled-identifiability、2024 “HWM” 教材略称 route では未確認です。public code は independent reproduction ではありません。
  • source version は 2024-06-01 から DA-LeWM v1 の 2026-08-19 まで、evidence cutoff は 2026-08-20、Asia/Tokyo。許される動詞は “test”“hypothesis”“falsifier”“この locked setting で支持” です。“改善するはず”“uncertainty を解決”“privileged label で学習して pixels-only”“compositional understanding を証明” は避けます。

3つのクイック質問

  1. research idea を executable launch card にする五つの field は何ですか?
  2. ensemble disagreement と actual rollout error が別 instrument なのはなぜですか?
  3. support constraint は同じ planner をどう助け、どう害せますか?