JEPA4Japan · チュートリアル

第3章―名前に迷わないための JEPA 家系図

1,339文字 4分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

JEPA、I-JEPA、V-JEPA、V-JEPA 2、LeJEPA、LeVJEPA、LeWorldModel の計算グラフと役割を見分けます。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 現在のレッスン

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

五枚の名札

  1. JEPA共通の考え方
  2. I-JEPA画像領域
  3. V-JEPA動画特徴
  4. LeJEPASIGReg
  5. LeVJEPA簡潔な動画符号化
同じ姓でも中の部品は違います。入力、比較対象、勾配、用途の四つを見ます。

工具箱の取り違え

学校には名前の似た道具があります。絵のパズル板、動画予測器、カード整理機、経路を試す砂場です。名札の「JEPA」だけを見れば、カード整理機で車を動かそうとしてしまいます。そこで毎回、四つだけ尋ねます。何を入力する?何と何を比べる?どの部品を学習する?最後に何ができる?略語を暗記するより確実な方法です。

家族ごとの計算グラフ

JEPA は、学習した表現空間で、一部の情報から別の情報を制約または予測する大きな考え方です。エンコーダー、マスク、崩壊防止策は一つに決まりません。

I-JEPA は静止画向けです。文脈エンコーダーと予測器が、目標エンコーダーの作った画像領域表現を予測します。V-JEPA は動画向けで、隠した時空間領域の目標表現を文脈エンコーダーと予測器が当てます。EMA 目標エンコーダーと勾配停止を含む、非対称な学習グラフです。V-JEPA 2 の行動なしエンコーダー/予測器と、ロボット軌跡で追加学習した V-JEPA 2-AC も分けて考えます。MPC 計画の証拠は後者にあります。

LeJEPA の Le は large ではありません。論文では Latent-Euclidean JEPA と展開され、その仕組みを lean とも形容しています。同じ出所のビューを合わせ、SIGReg の明示的な分布制約で崩壊を防ぎます。教師–生徒の非対称性は要りません。

LeVJEPA はその簡潔な目的を動画へ持ち込みます。大域・局所ビューは同じエンコーダーと投影器を通り、[CLS] 埋め込みを比べます。目標エンコーダー、予測器、勾配停止、マスクトークン再構成は目的にありません。学習コードの EMA エンコーダーは評価用チェックポイントで、目標枝ではありません。

LeWorldModel(LeWM) は、視覚表現を行動条件付き潜在力学と計画ループへ接続します。「その動作を実行したら何が起きるか」を扱います。一方、LeVJEPA が扱うのは「いまの動画をどう役立つ形にするか」です。両者は前後の版ではありません。因果動画エンコーダーが保証するのは、ある時刻の特徴が未来フレームを読まないことです。それだけで動作が出るわけではありません。

迷ったら図を見ます。マスクされた目標、予測器、EMA 教師があれば V-JEPA 型です。共有エンコーダー/投影器、同じ動画窓の [CLS] 照合、SIGReg だけなら、このチュートリアルで扱う LeVJEPA です。

間違った図を直す

「オンラインエンコーダー → 予測器 → 勾配停止 EMA 教師」という図に LeVJEPA と題が付いていたら、予測器と目標枝を消します。全ビューを一つのエンコーダー/投影器へ入れ、[CLS] から不変性と SIGReg を計算します。EMA は枠外へ移し、「評価用チェックポイントのみ」と書きます。

出典

この章の三本線

  1. JEPA は表現空間予測の設計思想で、固定された一枚の計算グラフではありません。
  2. LeVJEPA の目的は共有エンコーダー/投影器、[CLS] 照合、SIGReg でできています。
  3. V-JEPA 2-AC や LeWM の計画能力を LeVJEPA の成果に足してはいけません。

名札テスト

  1. LeJEPA の Le は large の意味ですか。
  2. LeVJEPA の学習グラフに予測器はありますか。
  3. ブロック因果注意だけで計画器になりますか。
答え
  1. 違います。正式には Latent-Euclidean JEPA です。lean は簡潔さを表す形容です。
  2. ありません。
  3. なりません。行動条件付き力学、目的またはコスト、探索、制御が必要です。