JEPA4Japan · チュートリアル

第2章―Yann LeCun の研究路線をたどる

1,314文字 4分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

エネルギーベース学習から2022年の AMI 構想、JEPA、I-JEPA、V-JEPA、LeJEPA、LeVJEPA へ進みます。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 現在のレッスン
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

長い道を五つの標識で

  1. 2006 エネルギー相性を測る
  2. 2022 構想見る・予測・動く
  3. 2023 画像I-JEPA
  4. 2024–25 動画V-JEPA 系
  5. 2025–26 軽量化LeJEPA → LeVJEPA
「モデルを大きくする」だけの一本道ではありません。抽象空間で学び、予測し、いつか行動するための問いが連なっています。

積み木の町はまだ建設中

LeCun が長年、考える積み木の町を造っているとしましょう。初期の部品は「相性の物差し」です。本当に合う組には低いエネルギー、合わない組には高いエネルギーを与えます。やがて町全体の設計図も描きます。知覚器が周囲を捉え、世界モデルが先を思い描き、目的とコストが好ましさを示し、行為器が行動を選びます。I-JEPA や V-JEPA が試したのは、その中の「役立つ内部表現を学ぶ土台」です。町全体ではありません。

年表の中身

**2006:エネルギーベース学習(Energy-Based Learning)。**入力と答えの候補がどれほど適合するかを採点します。エネルギーが低ければよく合い、高ければ合いません。抽象表現どうしを比較でき、全画素の確率生成モデルを必須にしない考え方です。

**2022:AMI の研究構想。**LeCun の立場論文は、知覚、世界モデル、短期記憶、行為器、内発的コスト、構成器を階層構造に置き、表現空間で予測する JEPA を提案しました。これは研究の設計図であり、すべてを一度に動かした単一モデルではありません。

**2023–2025:画像から動画、そして行動へ。**I-JEPA は画像文脈から隠れた目標領域の表現を予測します。V-JEPA は特徴予測を動画へ移します。V-JEPA 2 では、行動なしの大規模動画事前学習と、後段の行動条件付き V-JEPA 2-AC を分けなければなりません。ロボット計画の証拠は後者に属します。

**2025–2026:崩壊対策を損失へ。**LeJEPA は等方正規分布を目標とする考え方を論じ、SIGReg を導入しました。教師–生徒の仕掛けではなく、分布制約で崩壊を防ぎます。LeVJEPA はこの目的を動画へ運び、共有エンコーダーと小さな投影器、不変性と SIGReg で表現を学びます。arXiv v1 の公開日は 2026-08-27 です。

一本にまとめるなら、適合度を採点する考え方から始まり、高位表現での予測、ラベルなし画像・動画の安定した学習へ進み、その後で初めて行動条件付き予測や計画につながります。LeVJEPA がいるのは「効率的な動画知覚の土台」の駅です。因果注意だけで、動作、コスト、探索が自然に加わるわけではありません。

カードを年代順に

LeJEPA/SIGReg、AMI 構想、I-JEPA 画像実験、LeVJEPA の簡潔な動画目的 を並べてみましょう。AMI(2022)→ I-JEPA(2023)→ LeJEPA(2025)→ LeVJEPA(2026)の順です。最後の札の横には「エンコーダー。完全な行為主体ではない」と書きます。

一次資料の道標

三行で持ち帰る

  1. LeCun の長期路線は、表現と予測から推論・計画のできる行為主体を目指します。
  2. JEPA は家族名で、I-JEPA、V-JEPA、LeJEPA、LeVJEPA は別の実装です。
  3. LeVJEPA が完成させたのは動画エンコーダーの土台で、長期構想全体ではありません。

道順クイズ

  1. 2006年のエネルギー関数は何を尋ねますか。
  2. 2022年の AMI 文書は、完成品の仕様書ですか、研究構想ですか。
  3. V-JEPA 2 のロボット計画はどの段階から来ますか。
解答
  1. 入力と答えの候補がどれほど適合するかです。
  2. 研究構想です。
  3. 後からロボット軌跡で学習した、行動条件付きの V-JEPA 2-AC です。行動なしの動画エンコーダーだけではありません。