コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
見る機械と、動く機械の間
- 観察する今を潜在状態に
- 動作を入れる次に何をするか
- 先を予測するしたら何が起きるか
- 良し悪しを測る目標と危険
- 選んで見直す探索と MPC
道案内と運転は別の仕事
街角を正確に説明できる案内人がいます。今の角を話すとき、次の角を盗み見もしません。それでも「ここで右へ切ったら壁に当たるか」と聞かれれば、ハンドル操作が未来をどう変えるか、危険をどう測るか、何通りを比べるかが必要です。見えることと運転できることの間には、まだ橋があります。
「因果」という三つの言葉
LeVJEPA の block_causal は、情報が流れる向きの規則です。ある時刻のパッチは同じ時刻と過去を読めますが、未来は読めません。[CLS] は区間全体を読む要約枠で、パッチ側からは読まれません。この規則は未来情報の漏洩を防ぎますが、介入の原因と結果を学んだ証明にはなりません。
受動動画で「明かりの後に扉が開く」と何度見ても、共通の別原因があるかもしれません。「ボタンを押したら扉が開く」を調べるには、観測、実際の動作、その後の観測を結んだ軌跡が要ります。そして動作を乱す、外す、反事実の動作へ替える試験で、予測器が動作を無視していないことを確かめます。
したがって、次の三つは別物です。
- **因果マスク:**未来を参照しない注意の接続。
- **動作条件付き予測:**動作を入力して次の潜在状態を予測する学習。
- **因果発見:**観察や介入から因果構造を同定する主張。
計画に足りない四部品
LeVJEPA が返すのは [CLS] とパッチの表現です。計画器にするなら、少なくとも動作 a_t、動作条件付き力学 F(z_t,a_t)、目標または費用 C(z,g)、候補動作の探索と閉ループ制御を新しく用意します。未来が一通りでなければ、不確実性も表す必要があります。
z_now = encoder(history) # LeVJEPA にある
z_next = dynamics(z_now, action) # 新設:動作軌跡で学ぶ
score = cost(z_next, goal) # 新設:目標と危険を測る
action = search(dynamics, cost)[0] # 新設:1ステップ進み、また観測する
これは部品の境界を示す擬似コードで、公式 API ではありません。
V-JEPA 2 の観察事前学習と V-JEPA 2-ACも分けて読みます。後者はエンコーダーを凍結し、62時間未満のロボット軌跡で別の動作条件付き予測器を学び、画像目標と MPC を組み合わせました。LeWorldModel は画素側からエンコーダーと動作条件付き予測器を同時学習します。どちらも「橋には何が要るか」を示す先例であり、LeVJEPA に最初から入っている機能ではありません。
分類や検索のプローブで情報を読み出せても、長い予測で状態が保たれる、費用を比較できる、安全な動作を探索できる、とは限りません。計画の主張をするなら、表現、1ステップ先予測、長区間の展開、探索量、閉ループ成功を別々に測ります。
固定した公式リポジトリの paper.md には Push-T 世界モデルの草案がありますが、結果表は TODO のままです。エピソード数、乱数種、計画条件もそろっていません。空欄から成功率を作ることはできません。v1 が報告したのは動画表現、計算効率、プローブ評価です。
五つの空欄を探す
「LeVJEPA が計画する」という図を見たら、動作テンソルはどこか、誰が次状態を予測するか、費用は何か、誰が候補を探索するか、新しい観測でいつ再計画するかを尋ねます。最初の観察以外が空欄なら、それは計画器ではなくエンコーダーの図です。
境界を確かめた資料
橋の手前で覚えること
- ブロック因果注意は情報の向きを制限します。動作の因果を学んだ証明ではありません。
- 計画には動作条件付き予測、費用、探索、再観測して行う閉ループ制御が要ります。
- 上流の Push-T 表は
TODOを含む草案で、引用できる LeVJEPA の成功率はありません。
境界線クイズ
- LeVJEPA の元の入力にロボット動作は含まれますか。
[CLS]を各時刻のオンライン状態として使えないのはなぜですか。- V-JEPA 2-AC の計画結果を LeVJEPA の成果として書けますか。
答えを見る
- 含まれません。
[CLS]は入力区間全体を読めるからです。各時刻までに限った表現は、その時刻のパッチから作ります。- 書けません。モデル、学習段階、追加された動作予測器が異なります。