JEPA4Japan · チュートリアル

第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない

1,274文字 3分で読めます #LeWorldModel#World Models#JEPA

見た目の近さ、直線距離、有向の到達可能性を区別し、潜在距離を計画コストとして使えるかを実験で検証します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 現在のレッスン
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 符号化2枚の絵を潜在点にする。
  2. 測る近い点ほどよさそうに見える。
  3. 確かめる短い直線を壁がふさぐかもしれない。
  4. 試す本当の通り道を正しく選べるか。
潜在距離は定規であって、自動的に道路地図になるわけではありません。

短い定規は壁を横切りますが、実際の経路はドアを回ります。

小さなお話

2人の子どもが、壁の両側に立っています。定規は「すぐ近く」と言いますが、足で行くならドアを探さなければなりません。

元の LeWorldModel v3 も、計画時に単純な定規を使います。最後に想像した潜在状態 (z_H) と、別に符号化したゴール (z_g) を比べます。

[ J = \lVert zH-z_g\rVert_2^2 = \sum_i (z{H,i}-z_{g,i})^2 . ]

この定規は速く、報酬ラベルも不要で、候補ごとに1つの点数を返します。しかし、その点数が最短経路、所要時間、成功確率、安全性、作業の進み具合を表すとは限りません。

本当のルール

  • ゴールは終端コストで使います。ダイナミクス予測器に未来の正解として入れるものではありません。
  • 同じ表現内なら、非負の距離を二乗しても順位は変わりません。ただし元の LeWM が使うのは座標ごとの二乗差の総和です。
  • ユークリッド距離は (d(A,B)=d(B,A)) という対称な量です。到達可能性は方向や行動予算で変わりえます。
  • 生の値は潜在次元と座標スケールに依存します。違う checkpoint の裸の数値より、同じ checkpoint 内の順位を先に比べます。
  • SIGReg が集団を広くガウス形にしても、近い点同士を有効な行動で結べるとは保証しません。

計画器が必要なのは「候補AとBのどちらを先に選ぶべきか」という順位です。簡単な組だけで高い相関を出しても、壁や接触の近くにある少数の重要な逆転を隠せます。

だまされる反例

直線距離が同じ4組を作ります。

  1. 同じ部屋の、何もない場所。
  2. 壁をはさんですぐ近く。
  3. ドアの正面。
  4. 別の部屋で、ドアから遠い場所。

シミュレータの幾何は評価用 oracle にだけ使います。潜在距離の順位、実行可能な最短経路、予算内到達可能性、同じ CEM 予算で選ぶ最初の行動、実行結果を並べます。

まず実際の観測から符号化した終点を採点し、次にモデルがロールアウトした終点を採点します。oracle dynamics でも順位が悪ければ、表現かコストを疑います。ロールアウト後だけ悪化するなら dynamics drift を疑います。順位がよいのに失敗するなら、探索、データ支持、行動変換、実行を調べます。

実験のレシート

ベースラインの根拠は LeWorldModel v3 と、著者の凍結 commit 8edfeb3 です。言えるのは「LeWM は対称な二乗終端距離で候補を並べ、その距離が経路長や到達可能性と合うかは別に検証が必要」という範囲です。

後続の Objective Bottleneck は、独自実装した1つの TwoRoom 系で、潜在 L2 と空間距離の弱い整合、およびコスト差し替え後の行動変化を報告しました。同じ系を使う追試であり、2件目の独立再現でも、万能な到達可能性尺度でもありません。

checkpoint、前処理、潜在幅、組の作り方、oracle の定義、行動予算、CEM 予算、seed を保存します。壁の図は教材用の反例で、すべての LeWM checkpoint が失敗する証拠ではありません。

3つのクイック質問

  1. 二乗潜在距離が便利なベースラインなのはなぜですか。
  2. 対称な終端距離だけでは表せない情報は何ですか。
  3. 悪いコスト順位と悪いロールアウトを分ける oracle 交換はどれですか。