JEPA4Japan · チュートリアル

第24章 — 世界モデルを公平に評価する方法

1,052文字 4分で読めます #LeWorldModel#World Models#JEPA

1ステップ・複数ステップ・閉ループ指標、成功率、データ量、モデル規模、行動・計算予算、ベースライン、複数の乱数シード、失敗分布を条件付きで報告します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 現在のレッスン
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 同じ taskstart、goal、success を固定。
  2. 資源を見せるdata、pretraining、parameters。
  3. 予算を合わせるactions、candidates、horizon、refinements。
  4. 分布を見せるseeds、episodes、failures。
全 runner の course と backpack が見えて初めて、scoreboard を比べられます。

mechanics と prediction から cost、search、control、robustness へ評価を積み上げます。

小さなお話

3人の走者が42、48、51秒を出しました。しかし1人は短い track、1人は途中まで自転車、1人は warm-up 後に時計を始めました。数字が全部正しくても、順位は1つの競走を表しません。

world-model score にも receipt が必要です。raw latent MSE は dimension、scale、normalization、learned target に依存します。success rate は start、goal、tolerance、termination、action budget、search budget、environment version に依存します。wall time は hardware と batching に依存します。

本当のルール

evaluation layer を分けます。

  1. mechanical validity と episode-safe data。
  2. recorded context の one-step prediction。
  3. fixed-action self-fed rollout を horizon ごと。
  4. candidate cost ranking。
  5. search progress。
  6. closed-loop control。
  7. robustness と support shift。

LeWM v3 は TwoRoom、Reacher、PushT、OGBench-Cube を評価します。reported protocol では offline trajectory から start を取り、同じ trajectory の25 environment steps 後を goal にし、real-action budget は50です。その behavior で到達記録がある goal ですが、任意の visual goal が解ける意味ではありません。

2つの予算を固定または公開します。environment budget は real actions、termination、replanning frequency。planning-compute budget は candidates、horizon、actions/model block、elites、refinements、model calls、batch shape、parallelism。wall time には hardware、precision、warm-up、synchronization、compilation、transfer、timed region も付けます。

比較の見方は別の問いです。matched task data、matched trainable parameters、matched task-training compute、native method settings、compute frontier のどれかを明記します。1つを抽象的に “fair” と呼びません。

だまされる反例

DINO-WM は frozen pretrained DINOv2 representation を持って task training に来ます。元の LeWM は task trajectories から visual encoder を end-to-end training します。task-training cost と upstream provenance を別々に報告します。proprioception を含む input modality もすべて書きます。

baseline は診断器です。

  • random policy:偶然でも簡単な task か。
  • goal-conditioned behavior cloning:直接 imitation で足りるか。
  • oracle cost + learned dynamics:ranking の bottleneck か。
  • oracle dynamics + learned cost:rollout の bottleneck か。
  • 両 oracle + same finite search:candidate coverage/action parameterization か。

oracle は privileged simulator information を受けます。deployable competitor ではありません。

training seed、evaluation episode、planner seed を分けます。同じ50 trajectories 上の3 checkpoints は、50 independent training runs ではありません。すべての ± を SD、SE、bootstrap interval、CI、その他のどれかと resampling unit まで定義します。LeWM PushT caption は quantity を “variance” と呼ぶので、勝手に解釈し直しません。

実験のレシート

episode identity、seeds、success/timeout、final/best task distance、actions、replans、time、first failure、support slice、crash、exclusion を公開します。mean は rare catastrophic exploitation と、いつも惜しい failure を同じに見せます。

LeWM v3 は selected setup で foundation-model-based world models より planning speed が**最大48×**と報告し、figure は50 runs の平均です。歴史的 hardware receipt が不完全なので intrinsic property ではありません。

後続 VIScore v2 は Veracity、Influence、Sobriety を掛けます。著者は tested pools で cross-task Spearman correlation 0.75 以上を報告します。deterministic success prediction ではありません。constants/calibration は development runs で選ばれ、Cube は pooled calibration claim から除外され、rollout-error direction が horizon 間でおおむね安定するという仮定があります。

source claim は LeWorldModel v3、frozen commit 8edfeb3、各 baseline version に結び付けます。「誰が勝ったか」の前に「どの資源と protocol か」を聞きます。

3つのクイック質問

  1. 2つの encoder の raw latent error をそのまま比べられないのはなぜですか。
  2. planner 比較で公開すべき2つの予算は何ですか。
  3. oracle cost と oracle dynamics は何を別々に試しますか。