コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
五枚の名札
- JEPA共通の考え方
- I-JEPA画像領域
- V-JEPA動画特徴
- LeJEPASIGReg
- LeVJEPA簡潔な動画符号化
工具箱の取り違え
学校には名前の似た道具があります。絵のパズル板、動画予測器、カード整理機、経路を試す砂場です。名札の「JEPA」だけを見れば、カード整理機で車を動かそうとしてしまいます。そこで毎回、四つだけ尋ねます。何を入力する?何と何を比べる?どの部品を学習する?最後に何ができる?略語を暗記するより確実な方法です。
家族ごとの計算グラフ
JEPA は、学習した表現空間で、一部の情報から別の情報を制約または予測する大きな考え方です。エンコーダー、マスク、崩壊防止策は一つに決まりません。
I-JEPA は静止画向けです。文脈エンコーダーと予測器が、目標エンコーダーの作った画像領域表現を予測します。V-JEPA は動画向けで、隠した時空間領域の目標表現を文脈エンコーダーと予測器が当てます。EMA 目標エンコーダーと勾配停止を含む、非対称な学習グラフです。V-JEPA 2 の行動なしエンコーダー/予測器と、ロボット軌跡で追加学習した V-JEPA 2-AC も分けて考えます。MPC 計画の証拠は後者にあります。
LeJEPA の Le は large ではありません。論文では Latent-Euclidean JEPA と展開され、その仕組みを lean とも形容しています。同じ出所のビューを合わせ、SIGReg の明示的な分布制約で崩壊を防ぎます。教師–生徒の非対称性は要りません。
LeVJEPA はその簡潔な目的を動画へ持ち込みます。大域・局所ビューは同じエンコーダーと投影器を通り、[CLS] 埋め込みを比べます。目標エンコーダー、予測器、勾配停止、マスクトークン再構成は目的にありません。学習コードの EMA エンコーダーは評価用チェックポイントで、目標枝ではありません。
LeWorldModel(LeWM) は、視覚表現を行動条件付き潜在力学と計画ループへ接続します。「その動作を実行したら何が起きるか」を扱います。一方、LeVJEPA が扱うのは「いまの動画をどう役立つ形にするか」です。両者は前後の版ではありません。因果動画エンコーダーが保証するのは、ある時刻の特徴が未来フレームを読まないことです。それだけで動作が出るわけではありません。
迷ったら図を見ます。マスクされた目標、予測器、EMA 教師があれば V-JEPA 型です。共有エンコーダー/投影器、同じ動画窓の [CLS] 照合、SIGReg だけなら、このチュートリアルで扱う LeVJEPA です。
間違った図を直す
「オンラインエンコーダー → 予測器 → 勾配停止 EMA 教師」という図に LeVJEPA と題が付いていたら、予測器と目標枝を消します。全ビューを一つのエンコーダー/投影器へ入れ、[CLS] から不変性と SIGReg を計算します。EMA は枠外へ移し、「評価用チェックポイントのみ」と書きます。
出典
- I-JEPA 論文とMeta 研究ページ
- V-JEPA 論文とMeta 研究ページ
- V-JEPA 2 論文と公式ページ
- LeJEPA v3
- LeVJEPA v1と固定した公式リポジトリ
- LeWorldModel v3
この章の三本線
- JEPA は表現空間予測の設計思想で、固定された一枚の計算グラフではありません。
- LeVJEPA の目的は共有エンコーダー/投影器、
[CLS]照合、SIGReg でできています。 - V-JEPA 2-AC や LeWM の計画能力を LeVJEPA の成果に足してはいけません。
名札テスト
- LeJEPA の
Leは large の意味ですか。 - LeVJEPA の学習グラフに予測器はありますか。
- ブロック因果注意だけで計画器になりますか。
答え
- 違います。正式には Latent-Euclidean JEPA です。lean は簡潔さを表す形容です。
- ありません。
- なりません。行動条件付き力学、目的またはコスト、探索、制御が必要です。