JEPA4Japan · チュートリアル

第27章―大事な境界:LeVJEPA は計画器ではない

1,622文字 4分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

動画符号化、行動条件付き力学、コスト、探索、閉ループ制御を分け、因果注意を因果世界モデルと呼ばない理由を示します。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 現在のレッスン
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

見る機械と、動く機械の間

  1. 観察する今を潜在状態に
  2. 動作を入れる次に何をするか
  3. 先を予測するしたら何が起きるか
  4. 良し悪しを測る目標と危険
  5. 選んで見直す探索と MPC
LeVJEPA が公開したのは最初の箱です。未来を隠して見るだけでは、残りの四箱は生まれません。

道案内と運転は別の仕事

街角を正確に説明できる案内人がいます。今の角を話すとき、次の角を盗み見もしません。それでも「ここで右へ切ったら壁に当たるか」と聞かれれば、ハンドル操作が未来をどう変えるか、危険をどう測るか、何通りを比べるかが必要です。見えることと運転できることの間には、まだ橋があります。

「因果」という三つの言葉

LeVJEPA の block_causal は、情報が流れる向きの規則です。ある時刻のパッチは同じ時刻と過去を読めますが、未来は読めません。[CLS] は区間全体を読む要約枠で、パッチ側からは読まれません。この規則は未来情報の漏洩を防ぎますが、介入の原因と結果を学んだ証明にはなりません。

受動動画で「明かりの後に扉が開く」と何度見ても、共通の別原因があるかもしれません。「ボタンを押したら扉が開く」を調べるには、観測、実際の動作、その後の観測を結んだ軌跡が要ります。そして動作を乱す、外す、反事実の動作へ替える試験で、予測器が動作を無視していないことを確かめます。

したがって、次の三つは別物です。

  • **因果マスク:**未来を参照しない注意の接続。
  • **動作条件付き予測:**動作を入力して次の潜在状態を予測する学習。
  • **因果発見:**観察や介入から因果構造を同定する主張。

計画に足りない四部品

LeVJEPA が返すのは [CLS] とパッチの表現です。計画器にするなら、少なくとも動作 a_t、動作条件付き力学 F(z_t,a_t)、目標または費用 C(z,g)、候補動作の探索と閉ループ制御を新しく用意します。未来が一通りでなければ、不確実性も表す必要があります。

z_now = encoder(history)              # LeVJEPA にある
z_next = dynamics(z_now, action)      # 新設:動作軌跡で学ぶ
score = cost(z_next, goal)            # 新設:目標と危険を測る
action = search(dynamics, cost)[0]    # 新設:1ステップ進み、また観測する

これは部品の境界を示す擬似コードで、公式 API ではありません。

V-JEPA 2 の観察事前学習と V-JEPA 2-ACも分けて読みます。後者はエンコーダーを凍結し、62時間未満のロボット軌跡で別の動作条件付き予測器を学び、画像目標と MPC を組み合わせました。LeWorldModel は画素側からエンコーダーと動作条件付き予測器を同時学習します。どちらも「橋には何が要るか」を示す先例であり、LeVJEPA に最初から入っている機能ではありません。

分類や検索のプローブで情報を読み出せても、長い予測で状態が保たれる、費用を比較できる、安全な動作を探索できる、とは限りません。計画の主張をするなら、表現、1ステップ先予測、長区間の展開、探索量、閉ループ成功を別々に測ります。

固定した公式リポジトリの paper.md には Push-T 世界モデルの草案がありますが、結果表は TODO のままです。エピソード数、乱数種、計画条件もそろっていません。空欄から成功率を作ることはできません。v1 が報告したのは動画表現、計算効率、プローブ評価です。

五つの空欄を探す

「LeVJEPA が計画する」という図を見たら、動作テンソルはどこか、誰が次状態を予測するか、費用は何か、誰が候補を探索するか、新しい観測でいつ再計画するかを尋ねます。最初の観察以外が空欄なら、それは計画器ではなくエンコーダーの図です。

境界を確かめた資料

橋の手前で覚えること

  1. ブロック因果注意は情報の向きを制限します。動作の因果を学んだ証明ではありません。
  2. 計画には動作条件付き予測、費用、探索、再観測して行う閉ループ制御が要ります。
  3. 上流の Push-T 表は TODO を含む草案で、引用できる LeVJEPA の成功率はありません。

境界線クイズ

  1. LeVJEPA の元の入力にロボット動作は含まれますか。
  2. [CLS] を各時刻のオンライン状態として使えないのはなぜですか。
  3. V-JEPA 2-AC の計画結果を LeVJEPA の成果として書けますか。
答えを見る
  1. 含まれません。
  2. [CLS] は入力区間全体を読めるからです。各時刻までに限った表現は、その時刻のパッチから作ります。
  3. 書けません。モデル、学習段階、追加された動作予測器が異なります。