コース進捗 コース目次 48レッスン中 48件を公開中
第0部 読み方ガイド:私たちは何を学ぶのか
第1部 世界モデル:エージェントの頭の中にある実験場
第2部 画面を状態に変える:LeWMのモデル構造
第3部 モデルの抜け道を防ぐ:予測損失とSIGReg
第4部 モデルを行動に使う:潜在空間での計画
第5部 エンジニアリング再現:論文から動くシステムへ
第6部 LeWMは何を学んだのか
第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか
第8部 再現者から研究者へ
付録 数学・実装・再現・査読のための参照資料
まず大きな絵
- 軸に名札誰・いつ・何?
- 雲を観察中心・広がり・形
- ずれを測る局所的な定規
- 未来を探す試す・残す・絞る

ポケットの中の小さな物語
10 個の計器がある管制室を想像しましょう。1 個は箱に名札を付け、3 個は人混みを説明します。1 個は光を当てて影を見、1 個は「どこに修正を送るか」をたどります。その他は、ずれを測り、未来への誤差を見張り、抽出した証人に聞き、探索隊を送ります。
10 個すべてが緑でも、エージェントが壁を貫通する不可能な近道を選ぶことはあります。ここでの主役は、その道具は何を測り、何を知らないのかと問う習慣です。
技術バッグ
1. 計算より先に名札
ベクトルは 1 枚の状態カード、行列はカードの表、テンソルはさらに名前付きの軸を足したものです。[B,T,D] はバッチ、記録時刻、潜在特徴。計画時の [B,N,H,D] は環境バッチ、候補、モデルホライズン、潜在特徴です。軸を入れ替えても値の個数は同じですが、物語は壊れます。必ず軸名を声に出しましょう。
2. 集団を見る 3 つの要約
潜在ベクトル z1 ... zn の平均は、集団の中心です。
mean = (z1 + ... + zn) / n
分散はある座標方向の広がり、共分散は複数の座標が一緒に動くかを測ります。共分散のスペクトルを見れば、ばらつきが多くの方向を使うか、薄い面に閉じているかが分かります。でも、これらは警報器であり、意味の証明書ではありません。
SIGReg は集団を等方的な標準ガウス分布へ押します。中心があり、広がり、特定方向だけを特別扱いしない形です。これは全観測を同じ 1 コードにする完全崩壊を排除しますが、「開口部や物理が使いやすく表現された」とは証明しません。高次元では原点の密度が最大でも、質量の大部分はある広い殻にあります。
3. 影と勾配
ランダム投影は高次元の雲を 1 次元の影にします。Cramér–Wold の考えでは、あらゆる方向で一致すれば分布を同定できます。実際の SIGReg が見るのは、有限の方向、有限のミニバッチ、有限の数値積分だけです。繰り返し加える圧力であり、ガウス性の証明ではありません。
勾配は計算グラフの中をたどる、局所的な責任の線です。オリジナル LeWM v3 では、1 つの共有された学習可能な視覚エンコーダを使います。次観測ターゲットは切り離されず、stop-gradient、EMA teacher、事前学習済み凍結エンコーダは追加されません。予測損失は予測側と、シフトしたターゲット側の両方に届き、SIGReg は投影された観測埋め込みに届きます。lambda はこの 2 つの圧力の音量を調整するだけです。
4. 定規、足場、証人
平均二乗誤差は対応する座標を比べ、大きなずれをより重く扱います。
MSE = mean((predicted_next_latent - connected_next_latent)^2)
これが言えるのは「この定規でベクトル同士が近い」だけです。ロールアウトの安定性や到達可能性までは分かりません。TwoRoom では壁の両側が直線距離で近くても、実際の経路は長くなります。
teacher forcing の 1 ステップ予測は記録された観測の上に立ちます。自己回帰ロールアウトは、モデルが自分で置いた足場に次を置きます。誤差は増えることも、打ち消し合うことも、飽和することも、分岐を変えることもあります。普遍的な増加曲線はありません。
Monte Carlo 推定は、全列挙が高価なときに抽出した証人に聞きます。適切で独立なサンプルを増やせば抽出ノイズは減らせますが、モデルの偏り、データサポートの欠落、間違ったコストは直せません。
5. CEM は探索隊
広い行動提案から始める
設定された回数だけ繰り返す:
候補行動列をサンプルする
凍結した世界モデルで終点を想像する
設定されたコストで順位を付ける
エリート候補に向けて提案を再適合する
設定された出力を返す(paper Appendix B 本文では最終提案分布の平均)
CEM が変えるのは行動提案であり、エンコーダや予測器の重みではありません。抽出されなかった候補はエリートになれず、提案は局所解の周りに早すぎる収縮をすることもあります。有限 CEM は大域最適性の証明ではありません。

だまされる仕掛け
平均、分散、共分散、抽出した影、1 ステップ MSE がすべて良好で、CEM も鋭く収束したとします。そこで、TwoRoom の壁の両側が潜在空間で隣同士だと明かします。終端距離は壁を貫く近道を褒めていたのです。
計器が間違った必要はありません。集団統計は全体形状、MSE は記録上の局所運動、CEM は凍結モデルと選んだコストの最適化を説明しただけです。どれも経路到達性を直接は調べません。
開口部を含む固定事例で、集団幾何、行動入れ替え、1 ステップ誤差、ホライズンごとの自己回帰誤差、予測経路、コスト順位、実実行を分けて記録しましょう。サンプルを増やして不可能な近道がより安定して勝つなら、さらに探索を大きくする前にモデルサポートとコスト幾何を調べます。
実験のレシート
LeWorldModel v3 と凍結した 公式コード 8edfeb336732b5f3ce7b8b210d0ba370a09e2cac が、接続された共有エンコーダのグラフと計画上の役割を裏付けます。LeJEPA v3、Epps–Pulley 検定、Cramér–Wold の定理 は、仮定の範囲に限定した投影の動機を支えます。
許される主張は、これらが名前付きテンソル、集団の要約、局所的な予測ずれ、確率的推定、有限探索を、明示した仮定の下で説明することです。許されないのは、健全な統計が意味を証明する、有限投影がガウス性を証明する、低 MSE が到達可能性を証明する、CEM が大域最適解を証明する、という主張です。ここで独立再現は確立していません。
3 問だけ確認
- 値の個数を保つ軸入れ替えが、なぜシステムを壊せるのでしょう?
- ガウス分布らしい潜在雲が、なぜ開口部を忘れられるのでしょう?
- CEM が自信たっぷりに不可能な経路を選んだら、次にどの測定を分離しますか?