JEPA4Japan · チュートリアル

第0章―始める前に:この講座でできるようになること

1,242文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

論文の版、証拠の締切、三つの読書コース、最後に説明・実行・批判できる範囲を確認します。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 現在のレッスン
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

まず全体像を見よう

  1. 同じ場面大窓と小窓
  2. 一台で要約エンコーダーを共有
  3. 同じなら近く意味をそろえる
  4. 全員は離す同じ答えは禁止
扱うのは、ラベルのない動画から役立つ表現を学ぶ方法です。ロボットの運転そのものではありません。

名前のない動画アルバム

みちるの手元には、題名のない短い動画が山ほどあります。先生は「猫」「自動車」と答えを教えません。同じ動画を広い窓といくつかの小窓から見せ、短い要約札を書かせます。同じ動画の札は近くてかまいません。けれど、全部に「何かがある」と書けば、正解らしく見えても何の役にも立ちません。

LeVJEPA が解くのは、この綱引きです。**同じ場面は同じだと気づく。でも、別の場面まで同じ答えにしない。**前半を不変性損失、後半を SIGReg が受け持ちます。聞き慣れない言葉は、これから一つずつ見ていきましょう。

最初に荷物検査

基準にするのは LeVJEPA arXiv v1 です。公開日は 2026-08-27で、本稿の基準日(2026-09-05)時点でも査読前のプレプリントです。学習では、一つの16フレーム動画窓から1つの大域ビューと複数の局所ビューを作ります。時間窓は同じで、空間的な切り抜きと見た目のデータ拡張だけが異なります。全ビューを同じ学習可能なエンコーダーと小さな投影器に通し、それぞれの [CLS] 要約トークンから損失を計算します。

最初から外してはいけない境界が三つあります。

  • 目的関数に目標エンコーダー、予測器、勾配停止はありません。大域枝にも局所枝にも勾配が流れます。
  • 公式の学習コードはエンコーダーの Polyak/EMA コピーを更新し、評価用チェックポイントとして保存します。ただし、目標を作る教師ネットワークではありません。
  • 出来上がるのは動画エンコーダーです。行動条件付き力学、費用、探索は持たず、計画器ではありません。「世界モデルの土台にできる」は将来の使い道であって、完成済みの機能ではありません。

「目的の重みが一つ」とは、総損失の係数 λ = 0.02 が一つという意味です。データ、最適化器、モデル構造まで設定不要になるわけではありません。本編では、直感から式、テンソル、コード、実験へと少しずつ進みます。結果はすべて「著者報告」として扱い、公開コードや重みを独立再現と取り違えません。

30秒仕分け

共有エンコーダー、SIGReg、評価用 EMA コピー、行動計画器 の四枚を「学習目標の中」と「外」に分けてみましょう。中に入るのは最初の二枚です。EMA は評価専用で、計画器は LeVJEPA の部品ではありません。

確認に使った一次資料

ポケットに入れる三文

  1. LeVJEPA v1 は2026-08-27公開の動画表現事前学習法です。
  2. 共有エンコーダー、共有投影器、[CLS] を使い、目的内に教師・予測器・勾配停止はありません。
  3. 評価用 EMA は EMA 教師ではありません。エンコーダーも計画器ではありません。

小テスト

  1. 二つの「引っ張る力」は何ですか。
  2. EMA コピーは学習枝の目標を作りますか。
  3. エンコーダーだけでロボットに計画させられますか。
答えを見る
  1. 同一場面のビューを近づける不変性損失と、崩壊を防ぐ SIGReg です。
  2. 作りません。評価用チェックポイントにだけ使います。
  3. できません。行動条件付き予測、目標または費用、探索、閉ループ制御が必要です。