JEPA4Japan · チュートリアル

第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札

1,047文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

共有 ViT、[CLS]、二層投影器の役割と、LayerNorm が投影空間を必要にする理由を学びます。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 現在のレッスン
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

三つの役割

  1. 動画の小片パッチトークン
  2. 一台の ViT全視点で共有
  3. 要約札`[CLS]`
  4. 仮設の部屋256次元へ
エンコーダーは見る力を学び、`[CLS]` は一動画窓をまとめ、投影器は損失用の場所を整えます。

一人の司書と仮設整理室

司書が、本の全ページ写真と部分拡大を同時に読みます。写真ごとに別人を雇わず、同じ頭で読み、それぞれに短い要約を書きます。ところが、司書の最後の筆記規則は札を球面へ押し込めます。分布検査には扱いにくい。そこで一時的な整理室を増設し、検査向けの形式へ変えます。卒業時に整理室は撤去し、司書だけを残します。

共有 ViT、[CLS]、投影器の関係はこれです。

部品表

部品入力 → 出力学習中の仕事学習後
共有動画 ViT Eθ各視点のトークン → 同じ幅のトークン全視点が同じパラメータを使う下流エンコーダーとして残す
[CLS]列の先頭に置く学習可能トークン動画窓を要約。損失が直接読む。削減しない動画窓の要約に使える
二層投影器 hφd → 2048 → K、K=256Linear → BatchNorm → GELU → Linear。全視点共有捨てる

一つの視点の学習埋め込みは:

z_v = hφ(Eθ(x_v)[CLS]) ∈ R^256

なぜエンコーダー出力へ直接 SIGReg を掛けないのでしょう。ViT 最終層の LayerNorm は [CLS] の尺度を制限し、表現を制約された球面幾何へ置きます。論文は、その空間では SIGReg が等方正規分布へ十分に最適化しにくいと説明します。投影器は、その制約から離れた学習用空間を作ります。

これは V-JEPA の予測器ではありません。一方の枝から他方を予測せず、目標エンコーダーも勾配停止もありません。

公開実装と付録では ViT-B の d=768。まず [B, V+1, 768] の要約を得て、[B, V+1, 256] へ投影します。下流課題が読むのは元のエンコーダー表現で、投影器は持ち出しません。

箱と矢印を描く

大域と局所の二本を、同じ Eθ 箱へ入れます。各 [CLS] から同じ hφ へ進めます。「二台目の EMA 目標」「予測器」「勾配停止」は外です。B=8、V=4、d=768 なら [8,5,768] → [8,5,256] と書けます。

部品表の出典

三行の部品メモ

  1. 全視点が一台の ViT を通り、それぞれの [CLS] から動画窓の要約を読みます。
  2. 投影器は d → 2048 → 256 の学習用ヘッドで、LayerNorm に制約された空間を SIGReg から切り離します。
  3. 投影器は学習後に捨てます。予測器ではなく、目標エンコーダーもありません。

点検

  1. 大域と局所に別々の ViT パラメータがありますか。
  2. 投影器を挟む理由は何ですか。
  3. 下流評価でも256次元投影器を使いますか。
解答
  1. ありません。同じ一組を共有します。
  2. 最終 LayerNorm の幾何制約を離れ、SIGReg を最適化できる空間を作るためです。
  3. 使いません。投影器は捨て、エンコーダー表現を読みます。