コース進捗 コース目次 48レッスン中 48件を公開中
第0部 読み方ガイド:私たちは何を学ぶのか
第1部 世界モデル:エージェントの頭の中にある実験場
第2部 画面を状態に変える:LeWMのモデル構造
第3部 モデルの抜け道を防ぐ:予測損失とSIGReg
第4部 モデルを行動に使う:潜在空間での計画
第5部 エンジニアリング再現:論文から動くシステムへ
第6部 LeWMは何を学んだのか
第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか
第8部 再現者から研究者へ
付録 数学・実装・再現・査読のための参照資料
まず大きな絵
- 仮定の内側theorem は正確な約束をします。
- 回転した答えorthogonal coordinate までは回復できるかも。
- 岸の外theorem は沈黙します。自動で真偽は決まりません。
小さなお話:二枚の正直な地図
二人の地図職人が同じ島を描きます。一人は紙を 90 度回しました。すべての距離と transition は一致しますが、“上” はもう北ではありません。二枚とも正しくなれます。
だから “identified up to an orthogonal transformation” は有意義で、同時に限定的です。learned coordinate は rotation / reflection を通した linear relation で hidden coordinate と結ばれますが、個々の軸に人間の名前は付きません。arbitrary nonlinear warping より強く、「coordinate 1 が x position」より弱い結論です。

外側は「これらの theorem が直接 cover しない」であり、「学習不可能」ではありません。
技術のリュック
When Does LeJEPA Learn a World Model? の passive result は、指定された class の population/global-optimum statement です。規定された observation map を通した observable state、stationary additive-noise dynamics、Gaussian latent structure、exact Gaussian representation constraint、matched latent/representation dimension を仮定します。separation condition の下で orthogonal coordinate までの linear recovery を与えます。planning statement にはさらに、変換後 dynamics の整合と orthogonal ambiguity を尊重する cost が必要です。encoder theorem だけでは action-conditioned transition の学習を示しません。
controlled v2 paper は別の、より強い契約です。invertible observation、independent Gaussian noise を持つ stationary linear controlled latent dynamics、jointly Gaussian state/action behavior、exact Gaussian representation、matched dimension、十分 expressive な continuous predictor、population optimization、正の state-conditioned action excitation を仮定します。その条件では state と controlled conditional-mean transition を共通 orthogonal change まで identify します。すべての stochastic future を回復するわけではありません。
よくある三つの assumption gap は別物です。
- Partial observability: 二つの hidden state が同じ current image を作れます。history が助けるのは hidden variable が痕跡を残すときだけです。
- Multimodal futures: squared-error point prediction は real mode の間に落ちえます。conditional mean は full future distribution ではありません。
- Missing interventions: dataset 全体で Left と Right を見ても、各 action が一状態でしか起きなければ足りません。counterfactual action branch は制約されません。
有限 network の SIGReg は、有限 minibatch、sampled projection、数値 knot を Gaussian target へ押します。exact population enforcement ではありません。別の free-energy paper は constant encoder noise と exact isotropic-Gaussian enforcement の成功を仮定します。identifiability theorem ではなく、empirical validation は将来課題です。
壊してみる
二状態を作ります。State A では behavior policy が常に Right、State B では常に Left を選びます。dataset 全体には両 action が同数ありますが、どちらの state にも両 branch はありません。predictor は recorded transition を全部 fit しながら、A+Left と B+Right を好きに発明できます。
observation、state distribution、model、update を固定し、両 state で両 action が起きる第二 dataset を足します。oracle-state condition も入れます。oracle observation でも withheld-action error が残れば、この構成では representation ambiguity ではなく transition coverage が問題です。この test は conditional-excitation mechanism を支持できますが、全 LeWM failure を診断しません。
theorem を引用する前に尋ねます。observation は十分 invertible か。transition/noise family は一致するか。stationarity、dimension、Gaussian constraint、global optimum は本当にあるか。state で条件付けた後、必要な action direction はすべて変化するか。不明なら「設計指針として使う」であり、「coverage を主張する」ではありません。
実験レシートと証拠の境界
- When Does LeJEPA Learn a World Model? v1、2026-05-25 公開。公開 snapshot
de7503f。 - On the Identifiability of Controlled World Models v2、2026-07-27 改訂。cutoff までに author-linked implementation は未確認です。
- The SIGReg Objective as Variational Free Energy v1、2026-07-15 公開。LeWorldModel v3、凍結 code
8edfeb3は practical baseline boundary のためだけに参照します。 - 証拠 cutoff は 2026-08-20、Asia/Tokyo。theoretical evidence は assumption-bounded、実演がある場合は author-reported、independent reproduction はここでは確立していません。orthogonal recovery を named physical coordinate に、probe を identifiability に、linear conditional-mean theorem を guaranteed nonlinear planning に変えてはいけません。
3つのクイック質問
- orthogonal ambiguity は何を保存し、どんな意味上の名前を変えられますか?
- marginal action diversity が state-conditioned action excitation より弱いのはなぜですか?
- benchmark が theorem の仮定外にあるとき、正しい結論は何ですか?