コース進捗 コース目次 48レッスン中 48件を公開中
第0部 読み方ガイド:私たちは何を学ぶのか
第1部 世界モデル:エージェントの頭の中にある実験場
第2部 画面を状態に変える:LeWMのモデル構造
第3部 モデルの抜け道を防ぐ:予測損失とSIGReg
第4部 モデルを行動に使う:潜在空間での計画
第5部 エンジニアリング再現:論文から動くシステムへ
第6部 LeWMは何を学んだのか
第7部 「予測が正確」でも「計画がうまくいかない」のはなぜか
第8部 再現者から研究者へ
付録 数学・実装・再現・査読のための参照資料
まず大きな絵
- 近く見える定規は壁を気にしません。
- 前へ進む良い道は最初に遠ざかることがあります。
- 届くか規則と budget がまだ必要です。
小さなお話:間違った空港ターミナル
旅行者が、ガラスの向こうに描かれた gate へ真っすぐ歩きます。定規では近づきましたが、旅としては行き止まりです。役立つ一歩は、いったん遠ざかり、仕切りを回り、保安検査を通り、正しい側から近づくことです。
TwoRoom でも、doorway を通るには直線距離が一度増えることがあります。PushT には、接触、回転、位置直し、押し込みという stage があります。goal distance が同じ二状態でも、未来は正反対になれます。「latent space で近い」は自動的に「完了に近い」ではありません。

detour は直線的な近さと経路の進行を分けます。全タスクに一つの monotone progress 尺度があるという証明ではありません。
技術のリュック
次の名前を混ぜないでください。
- Distance は選んだ定規で二点を比べます。baseline LeWM は predicted endpoint と encoded goal の terminal squared Euclidean distance を使います。
- Progress は task completion に向けて状態を並べます。raw distance に対して non-monotone で、task stage に依存しえます。
- Reachability は、許された action と dynamics で、しばしば方向付き time/action budget 内に到達できるかを問います。
ProWorld v1 は後続提案で、original LeWM v3 の一部ではありません。hindsight temporal pair から弱い goal-conditioned order を作り、Lorentz-model hyperbolic latent space を使い、terminal だけでなく intermediate progress も score します。hyperbolic space は枝分かれ階層に広がる余地を与えますが、geometry は inductive bias であり、世界が本当にその階層を持つ証明ではありません。軌道が backtrack、detour、subgoal switch、idle を含むと、時間順序は progress について嘘をつけます。
他の後続 method は隣接する別の質問を扱います。RC-aux は budget-conditioned directed reachability、Temporal-Distance JEPA は rollout consistency と heuristic cross-trajectory negative を伴う directed temporal metric、TRM は post-hoc horizon-matched reachability metric、Traj-LeWM は endpoint score と併用する goal-conditioned trajectory cost、SCALE は latent pair distance と privileged state distance の整合、DA-LeWM は予測と実現の decision ranking agreement を扱います。supervision、planner role、evidence を一つに混ぜてはいけません。
壊してみる
terminal distance が同じ二つの PushT 状態を作ります。一方は役立つ角度で安定接触し、もう一方は block が挟まっています。さらに TwoRoom で、定規では遠い方がすでに doorway に向いている組を作ります。
各 candidate score に三つを尋ねます。どちらが近いか。同じ action budget でどちらへ届くか。宣言した task phase でどちらが進んでいるか。一つの scalar で三問すべてに黙って答えるなら、この章のテストに失敗です。
ProWorld 型 supervision には、意図的な detour と backtracking の軌道を足します。hindsight time が誤った状態を「より進んだ」とラベルするなら、粗い temporal proxy の falsifier です。task-specific phase label で benchmark を直せても、追加 prior を報告してください。general world understanding と呼び替えてはいけません。
実験レシートと証拠の境界
- Baseline と提案: LeWorldModel v3、凍結 code
8edfeb3。ProWorld v1、2026-08-03 公開。cutoff までに ProWorld implementation は未確認です。 - 関連ルート: RC-aux v1、code
ecb4496。Temporal-Distance JEPA v2、codeb4c17ca。TRM v1。Traj-LeWM v1、code67577fa。SCALE v1。DA-LeWM v1。 - 日付: RC-aux 2026-05-08、TRM 2026-05-21、Temporal-Distance v2 2026-07-29、ProWorld 2026-08-03、Traj-LeWM 2026-08-14、SCALE 2026-08-17、DA-LeWM 2026-08-19。証拠 cutoff は 2026-08-20、Asia/Tokyo。
- 後続結果はすべて著者報告で、独立 reproduction はここでは確立していません。許される表現は「提案する」「弱い時間順序」「テストした設定で」です。「真の progress」「保証された reachability」「hyperbolic geometry が階層を証明」は避けます。
3つのクイック質問
- goal から遠ざかる動きが、どうして本当の progress になれますか?
- reachability の主張には、distance にないどんな情報が要りますか?
- 誤解を招く temporal progress label を暴く detour 実験は何ですか?