コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
名前を替えると部品も替わる
- 家族名JEPA は設計思想
- 方式名I・V・Le・LeV
- 版と日付新しさと強さは別
- 証拠の種類論文・実装・重み・追試
同じ工具箱でも、中身は違う
金づち、ねじ回し、電動ドリルはどれも大工道具です。しかし、同じ棚にあるから金づちにも電池が入っている、とは言えません。JEPA も研究思想と方式の家族名です。家族ごとに、入力、目標枝、予測器、正則化、用途が違います。
ありがちな誤りは、I-JEPA の EMA 目標エンコーダー、V-JEPA の予測器、V-JEPA 2-AC の動作モデルを LeVJEPA の箱へ全部入れることです。名前より計算グラフを見ます。
表記を先に固定する
- 公式表記は LeVJEPAです。
LEVJEPA、Le-VJEPA、V-JEPA 3とは書きません。 - LeJEPAは論文中で Latent-Euclidean JEPAと展開され、一般目的と SIGReg を提示します。
- LeVJEPAには、著者が定めた展開形がありません。「LeJEPA の目的で学ぶ動画エンコーダー」が安全な説明です。
- どの仕事も共同研究です。「Yann LeCun の研究路線に置く」とは思想の連なりを読むことで、他の著者を実装担当へ縮めることではありません。
用語の部品票
| 用語 | 短い説明 | 子ども向けの絵 | 持ち込まない誤解 |
|---|---|---|---|
| JEPA | 表現空間で文脈と目標の予測・適合関係を作る設計思想 | 地図の意味を予想し、れんがを一枚ずつ描かない | 損失や崩壊防止法は一種類ではない |
| I-JEPA | 画像の文脈から隠れた目標領域の表現を予測する方式 | 周りのパズル片から中央を当てる | 静止画方式で、計画器ではない |
| V-JEPA | 隠れた動画時空領域の潜在表現を予測する方式 | 見えない動画片の意味を当てる | 予測器と EMA 目標枝を使い、LeVJEPA とは別 |
| V-JEPA 2 | 大規模な動画観察で学ぶ JEPA 表現モデル | 大量の録画を見た観察者 | 動作なしの事前学習だけではロボットを制御しない |
| V-JEPA 2-AC | 凍結エンコーダー上に動作条件付き予測器を学ぶ段階 | 観察者に「こう動かしたら」の砂場を足す | LeVJEPA の部品ではない |
| LeJEPA | JEPA の対応損失と SIGReg を組み合わせる簡潔な一般学習法 | 同じ問題の答えを寄せ、全員の白紙回答を禁じる | 理論は仮定付きで、動画専用ではない |
| LeVJEPA | LeJEPA の崩壊防止目的を動画エンコーダーに使う方式 | 同じ映画を大小の窓から見て近い要約を書く | 動作世界モデルや計画器ではない |
| LeWorldModel | 次埋め込み予測、SIGReg、動作条件付き力学を使う制御世界モデル | 動作を試せる頭の中の砂場 | LeVJEPA の新版ではなく隣の研究枝 |
| 自己教師あり学習 | データ内部から学習信号を作ること | 動画が自分で問題を作る | 人がデータや変換を選ばなくてよい、ではない |
| 表現・埋め込み | 入力を表す数値ベクトル | 数字で書いた住所札 | 一座標に人間の単語が付くとは限らない |
| エンコーダー | 画素をトークンと表現へ変えるネットワーク | 動画を読み、要約札を書く人 | 分類答えや動作を内蔵しない |
| 大域視点 | 同じ動画窓を広く覆う空間切り抜き | 大きな窓 | 元動画の全解像度そのものではない |
| 局所視点 | 同じ時間窓の小さな空間切り抜き | 紙筒から見る小窓 | 別時刻へずらすと元の正例ではない |
| データ拡張 | 核となる同一性を保って見え方を変える処理 | 明るさを変え、角を切る | 強すぎれば必要情報も消える |
| 不変性 | 同じ動画窓の異なる視点を近い表現にする性質 | 大小の窓でも同じ演奏と分かる | これだけなら定数出力を許す |
| 完全崩壊 | ほぼすべての入力が同一ベクトルになること | 全員が同じ白紙を出す | 損失が低くても起こり得る |
| 次元崩壊 | 表現が低次元部分空間へ押し込まれること | 256本の通りが一本の路地になる | 標本ごとに値が違っても起こり得る |
| SIGReg | 無作為な一次元射影で埋め込みの正規性との差を測る正則化 | 雲を多方向の影から検品する | 物理的意味や動作可能性を調べない |
| 等方正規分布 | 中心と尺度がそろい、特別な方向を持たない正規分布 | どちらもひいきしない雲 | 球面上一様分布ではない |
| ランダム射影 | 無作為な単位方向へ高次元点を写すこと | 懐中電灯で一次元の影を作る | 有限方向は全方向の近似にすぎない |
| 特性関数 | 複素指数の期待値で確率分布を一意に表す関数 | 分布の周波数指紋 | 実装は有限個の積分点だけを見る |
| Epps–Pulley 統計量 | 経験特性関数と正規分布の特性関数を滑らかに比較する量 | 二枚の指紋を重ねる | 学習損失は形式的な合否検定ではない |
| パッチ | 一フレームから切った16×16画素の小片 | モザイクの一枚 | 埋め込み前なので、まだトークンではない |
| トークン | パッチを線形・畳み込み写像したベクトル | 座標付きの積み木 | 学習時はパッチトークンの95%を落とす |
| チューブレット | 空間パッチを複数時刻へ伸ばした小管 | 同じ場所の連続写真を束ねる | LeVJEPA は τ=1 で時刻を束ねない |
[CLS] | 動画区間をまとめる学習可能な要約トークン | 一枚のあらすじ札 | パッチは [CLS] を読まず、未来が逆流しない |
| 投影器 | [CLS] を SIGReg 用の256次元へ移す二層ネットワーク | 学習中だけ使う整理台 | 事前学習後は外し、分類頭でもない |
| LayerNorm | 各トークンの特徴軸を正規化する処理 | 一枚ごとの目盛りをそろえる | 出力幾何を制約するので SIGReg は投影器後に置く |
| RoPE | 回転を使って注意へ相対的な時空位置を入れる表現 | 積み木に時・行・列の刻印を付ける | 因果を自動的に理解させない |
| ブロック因果注意 | 同一フレーム内は相互参照、フレーム間は現在と過去だけ参照 | 同じページは相談でき、未来ページは開けない | [CLS] は全区間を読むが、パッチはそれを読まない |
| 目標エンコーダー | 教師側の目標表現を作る専用枝 | 別の出題先生 | LeVJEPA の学習目的にはない |
| 勾配停止 | 一枝へ逆伝播を流さない操作 | 一方向弁 | LeVJEPA の大小視点は両方とも逆伝播する |
| 予測器 | 文脈表現から目標表現を推定するネットワーク | 隠れた答えを当てる人 | LeVJEPA は大小の要約を直接合わせる |
| Polyak / EMA 重み | 学習重みの指数移動平均による評価用複製 | ぶれをならした成績表 | 公式実装にはあるが、目標を作らず損失に入らない |
| 凍結プローブ | エンコーダーを固定し、小さな読み出し器だけ学ぶ評価 | 教科書を変えず索引だけ作る | 読み出せる情報をモデルが能動的に使うとは限らない |
| 注意機構付きプローブ | 学習可能な問いで全トークンを注意集約する読み出し器 | 大事な場所を探す採点者 | 線形プローブより強く、数値を無条件に横並びにしない |
| 周回(epoch) | 定義したデータを一巡すること | 練習帳を一周読む | 1サンプルの計算量が違えば同じ費用ではない |
| FLOPs | 浮動小数点演算量の概算 | 計算仕事の工数 | 実時間、消費電力、記憶量とは別 |
| 世界モデル | 世界状態がどう変わるかを予測するモデル | 頭の中の砂場 | 因果エンコーダーは土台候補にすぎない |
| MPC | 短い計画を立て、一部を実行し、再観測して計画し直す制御 | 一歩ごとに地図を見る | LeVJEPA 自体にはない |
一本の主線から枝が分かれる
| 公開時期 | 一次資料 | 進めた問い | まだ言えないこと |
|---|---|---|---|
| 2006 | エネルギーベース学習のチュートリアル | 適合する組を低エネルギー、不適合を高エネルギーにする | JEPA や動画の学習設定そのものではない |
| 2022-06-27 | A Path Towards Autonomous Machine Intelligence v0.9.2 | 知覚、構成可能な世界モデル、費用、行為器、記憶、階層 JEPA の構想 | 完成した自律知能システムではない |
| 2023 | I-JEPA | 静止画の文脈から大きな目標領域の表現を予測 | 動作や計画は含まない |
| 2024 | V-JEPA | 潜在特徴予測を動画の時空間領域へ広げる | 主に短い動画の表現学習 |
| 2025-06 | V-JEPA 2 / 2-AC | 観察事前学習を大規模化し、別段で動作予測と MPC を加える | 一般的な長期自律知能ではない |
| 2025-11 | LeJEPA v3 | SIGReg による明示的で拡張可能な崩壊防止 | 仮定付き理論は全課題の大域最適性を保証しない |
| 2026-03 | V-JEPA 2.1 | V-JEPA 系で密なトークン表現を強化 | LeJEPA / SIGReg 系へ変わったのではない |
| 2026-03 | LeWorldModel v3 | LeJEPA 系に動作条件付き潜在力学と計画を加える | 小規模制御実験は実世界全体の保証ではない |
| 2026-08-27 | LeVJEPA v1 | LeJEPA の目的で動画事前学習を簡潔化し、疎な観測とブロック因果注意を使う | 動作予測器や計画器ではない |
これは旧版が順番に自動更新される一本線ではありません。V-JEPA 2.1 は非対称な特徴予測枝を進み、LeWorldModel と LeVJEPA は LeJEPA / SIGReg を共有しつつ、前者は動作力学、後者は一般動画表現を扱います。年表には分岐があります。
証拠にも名札を付ける
| 名札 | そこまでなら支えられる | 自動的には支えられない |
|---|---|---|
| 方法の定義 | 論文が明記した計算グラフや目的 | 実装に不具合がなく結果を再現できること |
| 著者報告 | 著者が指定手順で得た数値 | 独立チームも同値を得ること |
| 著者実装 | 特定版の処理と既定値 | 論文の全条件と完全に同じこと |
| 公開重み | 特徴抽出や下流評価を実行できること | 学習過程を第三者が再現したこと |
| 独立再現 | 第三者が明記した範囲を再実行できたこと | 全規模、全データ、全課題で成立すること |
| 仮定付き理論 | 列挙した仮定の内側での結論 | 条件のない現実世界の保証 |
本シリーズの証拠締切は **2026-09-05(Asia/Tokyo)**です。この時点で LeVJEPA は arXiv v1 の予稿であり、数値は著者報告です。公開実装と重みは検査可能性を高めますが、それだけで独立再現にはなりません。
年表を照合した一次資料
- LeCun 2022 AMI 構想
- I-JEPA の CVPR 論文ページ
- V-JEPA の TMLR / OpenReview ページ
- V-JEPA 2 の公式論文ページ
- LeJEPA v3とLeVJEPA v1
名札から持ち帰る三文
- JEPA は家族の設計思想で、各方式の計算グラフは論文ごとに確かめます。
- LeVJEPA に公式な長い名称を作らず、LeJEPA の目的を使う動画エンコーダーと説明します。
- 新しい版、公開コード、独立再現は、それぞれ別の証拠です。
取り違え防止テスト
- V-JEPA の予測器を LeVJEPA の図へ入れてはいけないのはなぜですか。
- EMA 重みがあるのに「EMA 目標エンコーダーはない」と言えるのはなぜですか。
- LeVJEPA と LeWorldModel のいちばん大きな仕事の違いは何ですか。
名札を裏返す
- 学習の計算グラフが異なり、LeVJEPA は共有エンコーダーで大小の
[CLS]を直接合わせ、SIGReg で崩壊を防ぐからです。 - EMA は評価用の平滑化した複製で、目標を前向き計算せず、損失にも入りません。
- LeVJEPA は一般動画表現を学び、LeWorldModel は動作条件付きの次潜在状態を予測して計画へ使います。