JEPA4Japan · チュートリアル

付録A — 最低限必要な数学ツールキット

2,225文字 5分で読めます #LeWorldModel#World Models#JEPA

ベクトル、行列、バッチ次元、統計量、ガウス分布、ランダム射影、勾配降下、MSE、誤差伝播、モンテカルロ推定、CEMの確率的見方を復習します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 現在のレッスン
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 軸に名札誰・いつ・何?
  2. 雲を観察中心・広がり・形
  3. ずれを測る局所的な定規
  4. 未来を探す試す・残す・絞る
数学は小さな道具箱。どの道具も一つの問いに答えるだけで、全問題は解けない。

テンソルの軸は荷物の行き先タグのように働く。

ポケットの中の小さな物語

10 個の計器がある管制室を想像しましょう。1 個は箱に名札を付け、3 個は人混みを説明します。1 個は光を当てて影を見、1 個は「どこに修正を送るか」をたどります。その他は、ずれを測り、未来への誤差を見張り、抽出した証人に聞き、探索隊を送ります。

10 個すべてが緑でも、エージェントが壁を貫通する不可能な近道を選ぶことはあります。ここでの主役は、その道具は何を測り、何を知らないのかと問う習慣です。

技術バッグ

1. 計算より先に名札

ベクトルは 1 枚の状態カード、行列はカードの表、テンソルはさらに名前付きの軸を足したものです。[B,T,D] はバッチ、記録時刻、潜在特徴。計画時の [B,N,H,D] は環境バッチ、候補、モデルホライズン、潜在特徴です。軸を入れ替えても値の個数は同じですが、物語は壊れます。必ず軸名を声に出しましょう。

2. 集団を見る 3 つの要約

潜在ベクトル z1 ... zn の平均は、集団の中心です。

mean = (z1 + ... + zn) / n

分散はある座標方向の広がり、共分散は複数の座標が一緒に動くかを測ります。共分散のスペクトルを見れば、ばらつきが多くの方向を使うか、薄い面に閉じているかが分かります。でも、これらは警報器であり、意味の証明書ではありません。

SIGReg は集団を等方的な標準ガウス分布へ押します。中心があり、広がり、特定方向だけを特別扱いしない形です。これは全観測を同じ 1 コードにする完全崩壊を排除しますが、「開口部や物理が使いやすく表現された」とは証明しません。高次元では原点の密度が最大でも、質量の大部分はある広い殻にあります。

3. 影と勾配

ランダム投影は高次元の雲を 1 次元の影にします。Cramér–Wold の考えでは、あらゆる方向で一致すれば分布を同定できます。実際の SIGReg が見るのは、有限の方向、有限のミニバッチ、有限の数値積分だけです。繰り返し加える圧力であり、ガウス性の証明ではありません。

勾配は計算グラフの中をたどる、局所的な責任の線です。オリジナル LeWM v3 では、1 つの共有された学習可能な視覚エンコーダを使います。次観測ターゲットは切り離されず、stop-gradient、EMA teacher、事前学習済み凍結エンコーダは追加されません。予測損失は予測側と、シフトしたターゲット側の両方に届き、SIGReg は投影された観測埋め込みに届きます。lambda はこの 2 つの圧力の音量を調整するだけです。

4. 定規、足場、証人

平均二乗誤差は対応する座標を比べ、大きなずれをより重く扱います。

MSE = mean((predicted_next_latent - connected_next_latent)^2)

これが言えるのは「この定規でベクトル同士が近い」だけです。ロールアウトの安定性や到達可能性までは分かりません。TwoRoom では壁の両側が直線距離で近くても、実際の経路は長くなります。

teacher forcing の 1 ステップ予測は記録された観測の上に立ちます。自己回帰ロールアウトは、モデルが自分で置いた足場に次を置きます。誤差は増えることも、打ち消し合うことも、飽和することも、分岐を変えることもあります。普遍的な増加曲線はありません。

Monte Carlo 推定は、全列挙が高価なときに抽出した証人に聞きます。適切で独立なサンプルを増やせば抽出ノイズは減らせますが、モデルの偏り、データサポートの欠落、間違ったコストは直せません。

5. CEM は探索隊

広い行動提案から始める
設定された回数だけ繰り返す:
    候補行動列をサンプルする
    凍結した世界モデルで終点を想像する
    設定されたコストで順位を付ける
    エリート候補に向けて提案を再適合する
設定された出力を返す(paper Appendix B 本文では最終提案分布の平均)

CEM が変えるのは行動提案であり、エンコーダや予測器の重みではありません。抽出されなかった候補はエリートになれず、提案は局所解の周りに早すぎる収縮をすることもあります。有限 CEM は大域最適性の証明ではありません。

CEM は経路をサンプルし、エリートを残し、提案を絞る。

だまされる仕掛け

平均、分散、共分散、抽出した影、1 ステップ MSE がすべて良好で、CEM も鋭く収束したとします。そこで、TwoRoom の壁の両側が潜在空間で隣同士だと明かします。終端距離は壁を貫く近道を褒めていたのです。

計器が間違った必要はありません。集団統計は全体形状、MSE は記録上の局所運動、CEM は凍結モデルと選んだコストの最適化を説明しただけです。どれも経路到達性を直接は調べません。

開口部を含む固定事例で、集団幾何、行動入れ替え、1 ステップ誤差、ホライズンごとの自己回帰誤差、予測経路、コスト順位、実実行を分けて記録しましょう。サンプルを増やして不可能な近道がより安定して勝つなら、さらに探索を大きくする前にモデルサポートとコスト幾何を調べます。

実験のレシート

LeWorldModel v3 と凍結した 公式コード 8edfeb336732b5f3ce7b8b210d0ba370a09e2cac が、接続された共有エンコーダのグラフと計画上の役割を裏付けます。LeJEPA v3、Epps–Pulley 検定、Cramér–Wold の定理 は、仮定の範囲に限定した投影の動機を支えます。

許される主張は、これらが名前付きテンソル、集団の要約、局所的な予測ずれ、確率的推定、有限探索を、明示した仮定の下で説明することです。許されないのは、健全な統計が意味を証明する、有限投影がガウス性を証明する、低 MSE が到達可能性を証明する、CEM が大域最適解を証明する、という主張です。ここで独立再現は確立していません。

3 問だけ確認

  1. 値の個数を保つ軸入れ替えが、なぜシステムを壊せるのでしょう?
  2. ガウス分布らしい潜在雲が、なぜ開口部を忘れられるのでしょう?
  3. CEM が自信たっぷりに不可能な経路を選んだら、次にどの測定を分離しますか?