JEPA4Japan · チュートリアル

付録D — 実験設定カード

1,911文字 6分で読めます #LeWorldModel#World Models#JEPA

TwoRoom、Reacher、PushT、OGBench-Cubeの各環境設定に加え、最小教材用、論文再現用、単一GPU・資源制約用の設定を整理します。

コース進捗 コース目次 48レッスン中 48件を公開中

第0部 読み方ガイド:私たちは何を学ぶのか

  1. 01 第0章 — はじめる前に 公開中

第1部 世界モデル:エージェントの頭の中にある実験場

  1. 02 第1章 — なぜエージェントには「未来を想像する」力が必要なのか 公開中
  2. 03 第2章 — なぜ次の画像をそのまま予測しないのか 公開中
  3. 04 第3章 — JEPAの発想:画面の複製ではなく意味を予測する 公開中
  4. 05 第4章 — 1枚の図でLeWMを理解する 公開中

第2部 画面を状態に変える:LeWMのモデル構造

  1. 06 第5章 — 軌跡データ:モデルにとって世界は画像集ではない 公開中
  2. 07 第6章 — 視覚エンコーダー:各フレームに「状態パスポート」を発行する 公開中
  3. 08 第7章 — 動力学予測器:頭の中で時間を前へ進める 公開中
  4. 09 第8章 — 完全な順伝播:1バッチを最初から最後まで追う 公開中

第3部 モデルの抜け道を防ぐ:予測損失とSIGReg

  1. 10 第9章 — 最も危険な近道:表現崩壊 公開中
  2. 11 第10章 — 予測損失:モデルはどのように次の一歩を学ぶのか 公開中
  3. 12 第11章 — SIGRegの直感:表現空間に「呼吸」をさせる 公開中
  4. 13 第12章 — 必要最小限の数学 公開中
  5. 14 第13章 — オリジナルLeWMのエンドツーエンド学習の仕組み 公開中
  6. 15 第14章 — すぐに表現崩壊しないモデルを訓練する 公開中

第4部 モデルを行動に使う:潜在空間での計画

  1. 16 第15章 — 目標条件付き計画:「今いる場所」から「行きたい場所」へ 公開中
  2. 17 第16章 — 潜在ユークリッド距離:便利だが、常に信頼できるとは限らない 公開中
  3. 18 第17章 — CEM:勝ち抜き方式で行動を探索する 公開中
  4. 19 第18章 — MPC:モデルを一度に長く信じすぎない 公開中
  5. 20 第19章 — 長期ロールアウト:小さな誤差が大事故へ育つまで 公開中
  6. 21 第20章 — 最小のLeWMプランナーをゼロから実装する 公開中

第5部 エンジニアリング再現:論文から動くシステムへ

  1. 22 第21章 — 公式リポジトリと実験環境 公開中
  2. 23 第22章 — 最初の実験:TwoRoomのスモークテスト 公開中
  3. 24 第23章 — 2つ目の実験:PushTを再現する 公開中
  4. 25 第24章 — 世界モデルを公平に評価する方法 公開中
  5. 26 第25章 — 失敗診断マニュアル 公開中

第6部 LeWMは何を学んだのか

  1. 27 第26章 — 線形プローブ:潜在状態にはどの物理量が含まれるのか 公開中
  2. 28 第27章 — 潜在空間を「健康診断」する 公開中
  3. 29 第28章 — 期待違反:モデルは「あり得ない出来事」に驚くのか 公開中
  4. 30 第29章 — 「世界を理解する」を厳密に語るには 公開中

第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか

  1. 31 第30章 — 訓練目的と計画目的のあいだにある亀裂 公開中
  2. 32 第31章 — 大域的には表現崩壊していなくても、タスクに必要な動力学が保たれるとは限らない 公開中
  3. 33 第32章 — 等方ガウス事前分布はいつ強すぎるのか 公開中
  4. 34 第33章 — 長期計画:より遠くを予測するか、より賢く計画するか 公開中
  5. 35 第34章 — 位置の距離からタスクの進捗へ 公開中
  6. 36 第35章 — マルチタスク、実ロボット、視覚的外乱 公開中
  7. 37 第36章 — 理論的な境界:真の状態はいつ同定できるのか 公開中

第8部 再現者から研究者へ

  1. 38 第37章 — 信頼できるLeWM改良実験を設計する 公開中
  2. 39 第38章 — 実行可能な12の研究課題 公開中
  3. 40 第39章 — LeWM研究の未解決問題 公開中

付録 数学・実装・再現・査読のための参照資料

  1. 41 付録A — 最低限必要な数学ツールキット 公開中
  2. 42 付録B — PyTorch実装クイックリファレンス 公開中
  3. 43 付録C — テンソル形状の完全一覧 公開中
  4. 44 付録D — 実験設定カード 現在のレッスン
  5. 45 付録E — 論文タイムラインとエビデンスレベル 公開中
  6. 46 付録F — 用語集 公開中
  7. 47 付録G — 再現チェックリスト 公開中
  8. 48 付録H — 専門家査読チェックリスト 公開中

まず大きな絵

  1. 世界に名前task・data・revision
  2. 時計に名前tick・step・horizon
  3. 予算に名前train・search・evaluate
  4. 出典のスタンプpaper ≠ code ≠ run
score には passport が必要。条件がなければ、別の実験へ持ち込めない。

4 つの benchmark passport は異なる task 圧力を見えるままにする。

小さな物語

4 つの team が「世界モデルをテストした」と言います。1 つは開口部を通り、1 つは 2 関節アームを動かし、1 つは T 字を押し、1 つは cube を拾いました。文は真実ですが、比較には小さすぎます。

configuration passport には、世界、artifact、observation、action grouping、history、training、planning、execution、goal、metric、seed、compute を記録します。確認できない欄には not verified と書きます。空欄は調査を促しますが、推測値は証拠を捏造します。

configuration バッグ

4 つの benchmark passport

世界Paper カードFrozen-code カード圧力と境界
TwoRoom10,000 episodes、平均 92 environment steps、noisy door-then-goal heuristic、10 epochs、history 1、non-PushT CEM は最大 10 refinementstworoom.h5、pixels/actions/proprioception、frame skip 5、global history 3、最大 100 epochs、評価 50 episodes、goal offset 25、action budget 50、horizon 5、executed prefix 5、shared CEM 30 refinements開口部の topology は直線潜在近道を露呈させる。簡単な 2-D sandbox は全 world modeling の代表ではない。
Reacher10,000 episodes × 200 steps、Soft Actor-Critic で収集、10 epochs、paper history は引用文で明示的に確認できないreacher.h5、pixels/actions/observation、frame skip 5、global history 3、swm/ReacherDMControl-v0、qpos_match、評価 50、offset 25、budget 50、horizon/prefix 5/5シミュレーション関節制御であり、一般的 robotics の証拠ではない。success tolerance と全環境動作には resolved platform revision が必要。
PushT20,000 expert episodes、平均 196 steps、10 epochs、history 3、300 candidates、30 elites、initial variance 1、horizon 5、最大 30 CEM refinementsglobal history 3、最大 100 epochs、SIGReg weight 0.09、YAML は pusht_expert_train.lance、調査した公開 artifact/README は compressed HDF5、評価 offset 25、budget 50、horizon/prefix 5/5、frame skip 5contact 位置、姿勢、押せるが引けない履歴が重要。score は実 robot に移せない。
OGBench-Cube10,000 episodes × 200 steps、benchmark heuristic、10 epochs、history 3、non-PushT CEM は最大 10 refinementsogbench/cube_single_expert.h5、pixels/actions/observations、frame skip 5、swm/OGBCube-v0、single cube、224-pixel rendering、評価 50、offset 25、budget 50、horizon/prefix 5/5、shared CEM 303-D motion と grasping は「PushT in 3-D」ではない。privileged field は環境 goal を設定するが、オリジナル LeWM training が privileged state を受け取る証拠ではない。success tolerance は revision-bound。

これらの凍結カードでは、1 model step が 5 environment actions をまとめます。だから horizon 5 は 25 environment actions 分です。同じカードは、5 model steps 全てを実行してから replan します。これは 1 つの MPC timing であり、LeWM の普遍定数ではありません。

TwoRoom には version-history の罠もあります。独立再現は paper 側 offset 100、budget 150 と repository の 25/50 を監査しました。100/150 は LeWM v1/v2 の履歴で、現行 v3 Appendix F.1 は 25/50 です。その再現は TwoRoom 再実装に限定し、各 frame-skip block の全 action を集める、action-encoder input width を programmatically 導く、ImageNet pixel normalization を使う、action を z-score すると報告します。これを全 benchmark のルールにしてはいけません。

paper と code を平均しない

フィールドPaper v3 ラベルFrozen-code ラベル
training duration4 つの名前付き task で 10 epochsglobal maximum 100
TwoRoom history1global default 3、data override なし
SIGReg trade-off指定なしの default 0.10.09
non-PushT CEM refinements最大 10shared solver 30
PushT data name/formatDINO-WM に従う trajectory 説明Lance filename、調査した公開 artifact は compressed HDF5

どちらかが自動的に「勝つ」わけではありません。paper は報告された条件、frozen repository はその revision が追加 override なしで解決する値を説明します。実行は 3 番目のラベル resolved run を追加し、全継承値を表示・保管します。オリジナル LeWM v3 の method card は、1 つの共有学習可能 encoder、connected target、stop-gradient なし、EMA teacher なし、pretraining なしとも言っています。変更したら run passport に書きます。

Teaching、paper、frozen-code の passport を分けて保つ。

役に立つ 3 種類の run カード

Teaching run は安く透明な mechanism check です。開口部通過や多様な contact を残した episode-disjoint slice を使い、必要なら capacity や budget を短くし、action-swap、latent-spread、one-step、self-fed rollout、CEM trace、execution 診断を残します。変更欄には TEACHING と書き、PAPER とは書きません。

teaching purpose を 1 つ選ぶ
data slice、episode IDs、revisions、seed を凍結する
全 inherited value を解決する
data -> forward -> rollout -> search -> execution gate の順に実行する
resolved card を logs と outputs と一緒に保管する

Paper reproduction は、引用した task、data、history、training、model、planner、baseline、seed、evaluation を lock し、全 discrepancy を記録します。3 段階を分けます。(1) pinned artifact を読み finite output を得る、(2) locked episodes と planner budget で評価する、(3) 申告した seed で再学習し統計を比べる。段階 1 の合格は段階 3 を意味しません。Hydra は今日の config を合成できても、保管されていない過去の override、dependency、GPU stack、conversion は復元できません。

Single-GPU adaptation は最初に GPU/memory、software、precision、wall-clock、storage、latency を記録します。training budget、model-evaluation budget、planning budget を分けます。小さい batch は SIGReg の batch 統計、少ない projection は近似、短い history は情報、少ない CEM candidate/refinement は探索、短い horizon は制御問題を変えます。これらは同値な節約ではなく、変更したカードは paper score を継承できません。

だまされる仕掛け

Run A は pretrained encoder、300 candidates、30 refinements、5 seeds、same-trajectory goals を使います。Run B は end-to-end 学習、64 candidates、5 refinements、1 seed、broader-split goals です。両方とも 80% と報告します。これらは意図的な仮想カードで、オリジナル LeWM v3 の説明ではありません。

artifact、episode IDs、preprocessing、goal rule、success definition、time abstraction、model、training compute、action/search budget、seeds、statistic を lock し、名前を付けた 1 因子だけを変えます。score が同じでも mechanism の一致は証明できません。rollout、cost ranking、failure distribution を見ます。

実験のレシート

LeWorldModel v3 の Appendices D–F と、凍結した 公式コード 8edfeb336732b5f3ce7b8b210d0ba370a09e2cac が paper/code カードを支えます。TwoRoom independent reproduction v1 とその tinylab artifact が支えるのは、そこで明記された TwoRoom audit だけです。証拠カットオフは 2026-08-20、Asia/Tokyo です。

許される主張は、4 task が広い pipeline を共有しながら、異なる圧力、provenance、出典限定の設定を持ち、記録済み paper/code discrepancy があることです。complete-suite の独立再現、普遍 hyperparameter、score transfer は確立していません。

3 問だけ確認

  1. paper、frozen-code、resolved-run の history を、なぜ別々の箱に保つべきでしょう?
  2. 引用した frozen timing で、5 environment ticks、horizon 5、executed prefix 5 はどう関連しますか?
  3. 2 つの同じ success rate を比較可能にする前に、何を lock すべきでしょう?