コース進捗 コース目次 48レッスン中 48件を公開中
第0部 読み方ガイド:私たちは何を学ぶのか
第1部 世界モデル:エージェントの頭の中にある実験場
第2部 画面を状態に変える:LeWMのモデル構造
第3部 モデルの抜け道を防ぐ:予測損失とSIGReg
第4部 モデルを行動に使う:潜在空間での計画
第5部 エンジニアリング再現:論文から動くシステムへ
第6部 LeWMは何を学んだのか
第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか
第8部 再現者から研究者へ
付録 数学・実装・再現・査読のための参照資料
まず大きな絵
- 符号化2枚の絵を潜在点にする。
- 測る近い点ほどよさそうに見える。
- 確かめる短い直線を壁がふさぐかもしれない。
- 試す本当の通り道を正しく選べるか。

小さなお話
2人の子どもが、壁の両側に立っています。定規は「すぐ近く」と言いますが、足で行くならドアを探さなければなりません。
元の LeWorldModel v3 も、計画時に単純な定規を使います。最後に想像した潜在状態 (z_H) と、別に符号化したゴール (z_g) を比べます。
[ J = \lVert zH-z_g\rVert_2^2 = \sum_i (z{H,i}-z_{g,i})^2 . ]
この定規は速く、報酬ラベルも不要で、候補ごとに1つの点数を返します。しかし、その点数が最短経路、所要時間、成功確率、安全性、作業の進み具合を表すとは限りません。
本当のルール
- ゴールは終端コストで使います。ダイナミクス予測器に未来の正解として入れるものではありません。
- 同じ表現内なら、非負の距離を二乗しても順位は変わりません。ただし元の LeWM が使うのは座標ごとの二乗差の総和です。
- ユークリッド距離は (d(A,B)=d(B,A)) という対称な量です。到達可能性は方向や行動予算で変わりえます。
- 生の値は潜在次元と座標スケールに依存します。違う checkpoint の裸の数値より、同じ checkpoint 内の順位を先に比べます。
- SIGReg が集団を広くガウス形にしても、近い点同士を有効な行動で結べるとは保証しません。
計画器が必要なのは「候補AとBのどちらを先に選ぶべきか」という順位です。簡単な組だけで高い相関を出しても、壁や接触の近くにある少数の重要な逆転を隠せます。
だまされる反例
直線距離が同じ4組を作ります。
- 同じ部屋の、何もない場所。
- 壁をはさんですぐ近く。
- ドアの正面。
- 別の部屋で、ドアから遠い場所。
シミュレータの幾何は評価用 oracle にだけ使います。潜在距離の順位、実行可能な最短経路、予算内到達可能性、同じ CEM 予算で選ぶ最初の行動、実行結果を並べます。
まず実際の観測から符号化した終点を採点し、次にモデルがロールアウトした終点を採点します。oracle dynamics でも順位が悪ければ、表現かコストを疑います。ロールアウト後だけ悪化するなら dynamics drift を疑います。順位がよいのに失敗するなら、探索、データ支持、行動変換、実行を調べます。
実験のレシート
ベースラインの根拠は LeWorldModel v3 と、著者の凍結 commit 8edfeb3 です。言えるのは「LeWM は対称な二乗終端距離で候補を並べ、その距離が経路長や到達可能性と合うかは別に検証が必要」という範囲です。
後続の Objective Bottleneck は、独自実装した1つの TwoRoom 系で、潜在 L2 と空間距離の弱い整合、およびコスト差し替え後の行動変化を報告しました。同じ系を使う追試であり、2件目の独立再現でも、万能な到達可能性尺度でもありません。
checkpoint、前処理、潜在幅、組の作り方、oracle の定義、行動予算、CEM 予算、seed を保存します。壁の図は教材用の反例で、すべての LeWM checkpoint が失敗する証拠ではありません。
3つのクイック質問
- 二乗潜在距離が便利なベースラインなのはなぜですか。
- 対称な終端距離だけでは表せない情報は何ですか。
- 悪いコスト順位と悪いロールアウトを分ける oracle 交換はどれですか。