JEPA4Japan · チュートリアル

第34章 — 位置の距離からタスクの進捗へ

1,339文字 4分で読めます #LeWorldModel#World Models#JEPA

障害物や操作段階で非単調になる進捗を考え、進捗を考慮した表現、双曲空間、ProWorld、到達可能性との違いを検討します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 現在のレッスン
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 近く見える定規は壁を気にしません。
  2. 前へ進む良い道は最初に遠ざかることがあります。
  3. 届くか規則と budget がまだ必要です。
distance、task progress、reachability は三つの質問です。planner の cost が何を答えると言うのか、その質問に合う証拠が必要です。

小さなお話:間違った空港ターミナル

旅行者が、ガラスの向こうに描かれた gate へ真っすぐ歩きます。定規では近づきましたが、旅としては行き止まりです。役立つ一歩は、いったん遠ざかり、仕切りを回り、保安検査を通り、正しい側から近づくことです。

TwoRoom でも、doorway を通るには直線距離が一度増えることがあります。PushT には、接触、回転、位置直し、押し込みという stage があります。goal distance が同じ二状態でも、未来は正反対になれます。「latent space で近い」は自動的に「完了に近い」ではありません。

TwoRoom の経路は、doorway を通るために近い goal からいったん遠ざかります。

detour は直線的な近さと経路の進行を分けます。全タスクに一つの monotone progress 尺度があるという証明ではありません。

技術のリュック

次の名前を混ぜないでください。

  • Distance は選んだ定規で二点を比べます。baseline LeWM は predicted endpoint と encoded goal の terminal squared Euclidean distance を使います。
  • Progress は task completion に向けて状態を並べます。raw distance に対して non-monotone で、task stage に依存しえます。
  • Reachability は、許された action と dynamics で、しばしば方向付き time/action budget 内に到達できるかを問います。

ProWorld v1 は後続提案で、original LeWM v3 の一部ではありません。hindsight temporal pair から弱い goal-conditioned order を作り、Lorentz-model hyperbolic latent space を使い、terminal だけでなく intermediate progress も score します。hyperbolic space は枝分かれ階層に広がる余地を与えますが、geometry は inductive bias であり、世界が本当にその階層を持つ証明ではありません。軌道が backtrack、detour、subgoal switch、idle を含むと、時間順序は progress について嘘をつけます。

他の後続 method は隣接する別の質問を扱います。RC-aux は budget-conditioned directed reachability、Temporal-Distance JEPA は rollout consistency と heuristic cross-trajectory negative を伴う directed temporal metric、TRM は post-hoc horizon-matched reachability metric、Traj-LeWM は endpoint score と併用する goal-conditioned trajectory cost、SCALE は latent pair distance と privileged state distance の整合、DA-LeWM は予測と実現の decision ranking agreement を扱います。supervision、planner role、evidence を一つに混ぜてはいけません。

壊してみる

terminal distance が同じ二つの PushT 状態を作ります。一方は役立つ角度で安定接触し、もう一方は block が挟まっています。さらに TwoRoom で、定規では遠い方がすでに doorway に向いている組を作ります。

各 candidate score に三つを尋ねます。どちらが近いか。同じ action budget でどちらへ届くか。宣言した task phase でどちらが進んでいるか。一つの scalar で三問すべてに黙って答えるなら、この章のテストに失敗です。

ProWorld 型 supervision には、意図的な detour と backtracking の軌道を足します。hindsight time が誤った状態を「より進んだ」とラベルするなら、粗い temporal proxy の falsifier です。task-specific phase label で benchmark を直せても、追加 prior を報告してください。general world understanding と呼び替えてはいけません。

実験レシートと証拠の境界

  • Baseline と提案: LeWorldModel v3、凍結 code 8edfeb3。ProWorld v1、2026-08-03 公開。cutoff までに ProWorld implementation は未確認です。
  • 関連ルート: RC-aux v1、code ecb4496。Temporal-Distance JEPA v2、code b4c17ca。TRM v1。Traj-LeWM v1、code 67577fa。SCALE v1。DA-LeWM v1。
  • 日付: RC-aux 2026-05-08、TRM 2026-05-21、Temporal-Distance v2 2026-07-29、ProWorld 2026-08-03、Traj-LeWM 2026-08-14、SCALE 2026-08-17、DA-LeWM 2026-08-19。証拠 cutoff は 2026-08-20、Asia/Tokyo。
  • 後続結果はすべて著者報告で、独立 reproduction はここでは確立していません。許される表現は「提案する」「弱い時間順序」「テストした設定で」です。「真の progress」「保証された reachability」「hyperbolic geometry が階層を証明」は避けます。

3つのクイック質問

  1. goal から遠ざかる動きが、どうして本当の progress になれますか?
  2. reachability の主張には、distance にないどんな情報が要りますか?
  3. 誤解を招く temporal progress label を暴く detour 実験は何ですか?