コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
小さな目から、考える砂場へ
- 視覚を固定まず基準を守る
- 動作を加える何をしたかも記録
- 未来を転がす潜在状態を予測
- 費用を測る目標と危険を比較
- 一歩ずつ進むMPC で見直す
目、想像、道選びを一度に直さない
積み木を押すロボットを作るとします。まず「何が見えるか」を書く辞書を固定し、小さな砂場だけに「この状態で右へ押したら、次はどうなるか」を教えます。全部を一度に学び直すと、失敗したときに目が悪いのか、未来予測が悪いのか、道の選び方が悪いのか分かりません。
この切り分け方は慎重ですが、反証しやすい研究になります。
最初の世界モデル
第一段階では公開エンコーダーを凍結します。観測履歴は [B,3,T,224,224]。区間全体を読める [CLS] ではなく、現在時刻までに対応するパッチ状態 z_t:[B,N,D] を使います。軌跡には実行した動作 a:[B,H,A] も必要です。
新しい動作条件付き因果予測器に z_t と a を渡し、将来の潜在状態 z_hat:[B,H,N,D] を順に出させます。正解側は、実際の後続フレームを凍結エンコーダーへ入れた表現です。1段先と複数段先の誤差を測ります。予測器、動作データ、予測損失はすべて新設であり、LeVJEPA の元の目的関数ではありません。
空間トークンの対応も先に決めます。同じカメラ、切り抜き、フレーム率、格子なら第 i パッチ同士を比べられます。カメラが動く、物体が隠れる、格子をまたいで移動する場合は、全パッチ、見える部分、集約状態のどれを予測するのか明記します。
最小損失を次状態の潜在 MSE にしても、現在状態をそのままコピーする基準方式と必ず比べます。隣り合うフレームはよく似るからです。静かな背景と可動物体の誤差も分けます。背景だけを上手に写す予測器は、平均誤差だけなら優秀に見えます。
目標までの道を試す
目標画像 g を z_goal に符号化します。CEM などの探索器が K 本の動作列を作り、予測器が潜在空間で未来を展開します。目標距離、衝突、制約違反を費用にまとめ、最良列の最初の一手だけ実行します。そこで新しい観測を読み、また計画します。これがモデル予測制御(MPC)です。
# 拡張案の擬似コード。上流リポジトリの関数ではない。
while not done:
z0 = encode_causal(observation_history)
candidates = cem.sample(K, horizon=H)
futures = dynamics.rollout(z0, candidates) # [K,H,N,D]
scores = cost(futures, z_goal, constraints)
env.step(candidates[scores.argmin(), 0])
一手だけ実行するのは、予測誤差や思わぬ外乱を新しい観測で直すためです。長い計画を最後まで盲目的に実行する仕組みとは違います。
六段の通行証
ロボット成功率へ一足飛びに行かず、次の段を順に通します。
- 形と未来漏洩の単体試験に合格する。
- 1ステップ先予測が「現在状態をそのままコピーする基準方式」と「動作を無視する基準方式」の両方を上回る。
- 予測距離ごとの誤差曲線と、不確実性の校正を示す。
- 反事実の動作を入れると、区別できる未来が出る。
- 模擬環境でデータ、計算量、CEM 条件を固定し、無作為方式やモデルなし方式と比べる。
- 停止条件、人工介入、分布外状況を決めてから閉ループ実機試験へ進む。
どこかで失敗したら、そこで止めて原因を調べます。未来が複数ある課題では、決定論的 MSE だけで平均的なぼやけた未来へ逃げないよう、複数モデル、確率的潜在変数、エネルギーで順位付けする候補などを比較し、被覆率と校正誤差を測ります。
エンコーダーを解凍する場合は、元の凍結プローブの成績と埋め込みのスペクトルを並行して監視します。少量の制御データへ合わせた結果、一般視覚が忘却したり表現が潰れたりする可能性があるからです。
論文はブロック因果構造なら過去を保存できると述べますが、固定した公開実装と Transformers の配布インターフェースには、完成した逐次 KV キャッシュ機能がありません。自作するなら、毎回全履歴を再計算した結果とトークンごとに照合します。
設計の足場
砂場に立てる三本旗
- 世界モデル化には、動作条件付き予測器、費用、探索、MPC を明示的に追加します。
- まず視覚を凍結し、段ごとに基準へ勝てるか確かめてから、同時学習や長期計画へ進みます。
- 理論上保存できることと、公開インターフェースに検証済みの逐次キャッシュがあることは別です。
次の一手を選ぶ三問
- 最小の動作予測器が必ず受け取る二種類の入力は何ですか。
- なぜ「現在状態をそのままコピーする」基準方式と比べますか。
- MPC が計画列の最初の一手だけを実行する理由は何ですか。
答えを読む
- 現在または履歴の潜在状態と、候補動作です。
- 近い時刻は元から似ており、その基準に勝てなければ有用な力学を学んだと言えないからです。
- 新しい観測でモデル誤差と外乱を直し、残りを再計画するためです。