コース進捗 コース目次 48レッスン中 48件を公開中
第0部 読み方ガイド:私たちは何を学ぶのか
第1部 世界モデル:エージェントの頭の中にある実験場
第2部 画面を状態に変える:LeWMのモデル構造
第3部 モデルの抜け道を防ぐ:予測損失とSIGReg
第4部 モデルを行動に使う:潜在空間での計画
第5部 エンジニアリング再現:論文から動くシステムへ
第6部 LeWMは何を学んだのか
第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか
第8部 再現者から研究者へ
付録 数学・実装・再現・査読のための参照資料
まず大きな絵
- 点が一つ崩壊は簡単です。
- 広げるSIGReg はガウス型の影を求めます。
- 道も確かめる丸い雲でも扉を隠せます。
小さなお話:丸い町
町長が、全住民が一つの広場に押し込まれているのを見つけます。そこで、特別な方向のない丸く広い町を作りました。混雑は解消しました。でも本当の国は、一本の橋で結ばれた二つの島です。きれいな円が、そのまま役立つ旅行地図とは限りません。
これが original LeWorldModel v3 の緊張関係です。SIGReg は、バッチ中の埋め込みを多くの一次元方向へ投影し、標準等方ガウス分布と比べます。定数表現はこの目標を満たせないため、強い anti-collapse 圧力になります。しかし Gaussian と isotropic が述べるのは集団の形です。位置、速度、出入口、行動で通れる経路に意味を付ける規則ではありません。

「ガウス不一致」という一言には、別々の仕組みが隠れます。これは教材用の図であり、測定済み埋め込みでも因果証明でもありません。
技術のリュック
次の三つは分けて調べます。
- 広がり: 平均、共分散、有効ランク、投影後の裾は、集団が潰れたかを問います。
- 局所的な役立ち方: 時間的近傍、行動分岐、出入口の順位、rollout は、近さが予測と計画に役立つかを問います。
- 意思決定での役立ち方: closed-loop 成功は、モデル、terminal cost、CEM 探索、実行が一緒に働くかを問います。
低い intrinsic dimension は自動的に collapse ではありません。TwoRoom は大きな画像でも、主な変化はエージェント位置と最近の動きだけかもしれません。LeWM v3 は評価設定で TwoRoom の計画が弱かったと報告し、低い多様性、低い内在次元、高次元ガウス目標との緊張を候補に挙げました。これは著者の仮説であり、証明済み原因ではありません。後の独立 TwoRoom 監査は protocol の影響を示し、follow-up はその checkpoint と protocol で terminal metric の bottleneck を報告しました。どちらも SIGReg 全般の無罪・有罪を決めません。
後続論文は異なる修理を試します。どれも original v3 の部品ではありません。
| 後続ルート | 変えるもの | 証明しないもの |
|---|---|---|
| Sub-JEPA | 有限個の固定ランダム直交部分空間 | 見ていない同時分布やトポロジー |
| TC-LeWM | 時間中心化した残差への SIGReg | 遅い情報が不要であること。根拠は LIBERO behavior cloning で、baseline MPC ではありません |
| QQWorld | 投影サンプルを並べ、ガウス分位点と対応。任意の detached cross-batch queue | 全体ガウス形状がタスクに正しいこと、original LeWM が target を detach すること |
| SMWM | anti-collapse として inverse-action 回帰 | 全タスク変数の保存 |
| AC-MTM | バッチ内の対照的 action identification | 重複、no-op、隠れた作用、確率的・離散・hybrid・support 外 action の coverage |
係数 lambda は、prediction loss に対して SIGReg が話す音量を変えます。同じ集団目標が役立つが強すぎる/弱すぎるなら調整します。full-space 圧力、遅い task drift、tail 補正、または marginal target の不適合を対照実験が示したときだけ、構造を変えます。
壊してみる
同じ輪状軌道について二つの潜在地図を作ります。地図 A は時間的な隣接と経路をすべて保ちますが、薄い二次元シート上にあります。地図 B は点をシャッフルした後、とても美しい球状ガウス集団になります。
B が分布検査だけに勝ち、A が action-conditioned rollout と計画検査に勝つなら、「よりガウス的」は「より役立つ」ではありません。次に data、encoder、predictor、optimizer、planner、seed、budget を固定し、lambda を sweep してから regularizer だけを一つ変えます。collapse、局所連続性、出入口順位、multi-step prediction、closed-loop planning を一緒に測ります。中間の lambda が最良でも、それは その設定 の trade-off を支持するだけです。
実験レシートと証拠の境界
- Baseline: LeWorldModel v3、2026-06-03 改訂。凍結 code は
8edfeb3。shared encoder は end-to-end で、stopped target、EMA teacher、pretrained visual encoder はありません。 - 後続提案: Sub-JEPA v1、SMWM v1、TC-LeWM v2、QQWorld v1、AC-MTM v1。cutoff までに Sub-JEPA、SMWM、AC-MTM の公開 snapshot を確認し、TC-LeWM と QQWorld では確認していません。
- 監査: TwoRoom reproduction v1、その objective follow-up、tinylab
efa9e5d。独立性が確立しているのは、その TwoRoom 再実装と protocol だけで、後続 regularizer や全 suite ではありません。 - 日付: Sub-JEPA 2026-05-10、SMWM 2026-06-18、QQWorld 2026-07-30、TC-LeWM v2 2026-07-31、reproduction 2026-08-10、objective follow-up 2026-08-13、AC-MTM 2026-08-18。証拠 cutoff は 2026-08-20、Asia/Tokyo。明記しない限り、後続実験は著者報告です。
3つのクイック質問
- collapse していないガウス雲でも、なぜ悪い計画地図になれますか?
- 正当な低内在次元と破壊的 collapse を分けるには、何を測りますか?
lambdasweep から因果説明を支える前に、何を固定すべきですか?