JEPA4Japan · チュートリアル

第35章 — マルチタスク、実ロボット、視覚的外乱

1,320文字 4分で読めます #LeWorldModel#World Models#JEPA

背景、照明、カメラ、タスク識別、深度補助、予測器の過剰パラメータ化、ノイズ、部分観測性を扱い、シミュレーションから実環境へのエビデンスの隔たりを示します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 現在のレッスン
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 公開中
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 新しい舞台pixel は変わっても物理は同じかも。
  2. 新しい芝居同じ画像でも goal が違うかも。
  3. 本物の舞台noise、delay、contact、safety が来ます。
appearance、task identity、hidden state、hardware shift は別々の問題です。色鮮やかな dataset が自動で切り分けてくれるわけではありません。

小さなお話:ロボットの巡業

ロボットが一つの芝居を練習します。暖かい照明の下では、青い cup はいつも左へ運びます。巡業先では curtain が赤くなり、camera が動き、別の芝居では同じ cup を右へ運びます。さらに手が contact の瞬間を隠します。

変化は無害な scenery、別 task、別 physical state、見えなかった証拠のどれでしょうか。全部を “domain shift” と呼ぶと、model が必要とする答えを消します。multi-task training は shortcut を暴けますが、task ごとの tablecloth、camera、episode length という新しい shortcut も作れます。

robot と object state を固定して visual factor を一つだけ変え、別の行で physics を変える controlled theater。

この matrix は既知の factor を一度に一つ変えます。background、light、viewpoint が常に無関係だとは宣言しません。

技術のリュック

paired control を使います。同じ simulator state と action を replay し、dynamics を変えないと分かっている texture、light、camera variable だけを変えます。次に future consequence を本当に変える positive control を入れます。すべてに invariant なら collapse、すべてに sensitive なら appearance shortcut です。望ましいのは選択的な反応で、closed-loop planning でも確かめます。

一枚の image が正しい action の異なる二 task に属するなら、current-frame encoder は省かれた task を当てられません。goal image、token、language condition を渡すか、欠けた変数が痕跡を残すなら history を使います。token は dataset-ID shortcut になれますし、history は一度も観測されない情報を復元できません。

後続 evidence は身份を保ちます。

後続ルート追加 signal / setting狭い境界
TC-LeWM v2temporally centered SIGReg。from-scratch multi-view ViT-S/16 と task-conditioned flow-matching behavior cloning による multi-task LIBERObaseline CEM/MPC、TwoRoom、robot deployment ではありません
Depth-regularized JEPA v1depth supervision と training-only overparameterization。real agricultural-robot video 上の報告 18M modeloffline visual-odometry probe、surprise、latent rollout で、online planning や safety ではありません
PhyLatent v1simulator physical-state supervisionprivileged training で、pixels-only recovery ではありません
PSG-JEPA v1training-only proprioceptive-state と multi-horizon joint-change grounding著者報告の Mobile ALOHA downstream policy evidence で、original-LeWM MPC や safety certificate ではありません
stable-worldmodel v1data、training、solver、MPC、evaluation の共通 plumbinginfrastructure は choice を見せますが、中立性や独立 reproduction を保証しません

Original LeWM v3 は fully end-to-end のままです。stop-gradient target、EMA teacher、pretrained visual encoder はありません。後続 auxiliary head でその graph を描き替えてはいけません。大きな predictor も仮説にすぎません。parameter-matched と compute-matched の width、複数 seed、one-step prediction、self-fed rollout、action sensitivity、nuisance invariance、planning を比べます。

壊してみる

current image と action history が同じ二 episode を作ります。Task A は “cup left”、Task B は “cup right” です。instruction を隠します。一方を一貫して選ぶなら、recover した context ではなく dataset prior です。次に goal image、task token、earlier instruction frame、training で task と相関させ test で交換する background を、一つずつ追加します。

deployment では evidence ladder を上ります。original simulator → controlled visual change → sensor noise / missing frame → delayed / imperfect actuation → hardware・object・calibration variation → abort と recovery rule を持つ safety-constrained run です。一段を通っても次段の許可証にはなりません。MPC feedback は open-loop trust を短くしますが、実行した一歩を安全にはしません。

実験レシートと証拠の境界

  • Source: LeWorldModel v3、TC-LeWM v2、depth-regularized JEPA v1、PhyLatent v1、PSG-JEPA v1 と project page、stable-worldmodel v1。
  • 凍結 code: LeWM 8edfeb3。PSG-JEPA 8de96b8、2026-08-14。stable-worldmodel addbab4、2026-08-18。ただし formal release は 2026-06-06 の 0.1.1 のままです。TC-LeWM、depth paper、PhyLatent の author-linked code は未確認です。
  • 日付: depth 2026-07-15、TC-LeWM v2 2026-07-31、PhyLatent 2026-08-06、PSG-JEPA 2026-08-07。証拠 cutoff は 2026-08-20、Asia/Tokyo。
  • 後続結果は著者報告で、これらの method や robot result の独立 reproduction は確立していません。method、controller、data、intervention、safety protocol を正確に報告します。“real video” は “online robot planning” ではなく、“robot policy experiment” は “safe deployment” ではありません。

3つのクイック質問

  1. camera change が自動的に nuisance ではないのはなぜですか?
  2. identical-frame / opposite-task の例は missing context について何を示しますか?
  3. simulator robustness claim を robot safety claim にする前に、どんな新しい evidence が要りますか?