JEPA4Japan · チュートリアル

第8章―一行の目的関数で LeVJEPA を読む

1,170文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

不変性損失と SIGReg、唯一の重み λ=0.02、双方向の勾配、理論の適用範囲を分解します。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 現在のレッスン

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

一行に二つの約束

  1. 共有するエンコーダー + 投影器
  2. 同じを寄せる不変性
  3. 全体を広げるSIGReg
  4. 0.02重みは一つ
同じ動画の組は近づけ、サンプル全体の分布は潰しません。目的関数の仕事はこの二つです。

二項目の通信簿

一項目目は対応する組ごとに見ます。同じ録画の大札と小札が似ているかを調べます。二項目目はサンプル集団を見ます。札が一つの答えに山積みになっていないかを調べます。二項目目の音量を 0.02 にして足します。裏で模範解答を配る先生はいません。両側が同じ総点を見て直ります。

式をゆっくり読む

一回の前向き計算を最短で書くと、次のようになります。

z_v = projector(shared_encoder(view_v)[CLS])
L_total = L_inv + 0.02 * L_SIGReg

view_0 は大域、view_1 ... view_V は同一16フレーム時間窓の局所ビューです。論文の不変性項は次の形です。

L_inv = (1 / (V + 1)) * sum_{v=0..V} ||z_0 - z_v||²

v = 0 の項はゼロです。実質的には、各局所埋め込みを大域埋め込みへ寄せます。二乗距離の両端が計算グラフにつながり、同じエンコーダー/投影器パラメータを両方から更新します。

L_SIGReg は各視点の埋め込みを無作為射影し、標準正規分布と異なる影を罰します。目的関数で唯一のバランス用ハイパーパラメータが λ = 0.02 です。論文は全学習でこの既定値を使い、実験ごとの調整はしていないと述べています。「唯一」とは、二つの損失間の重みについてだけです。学習率、バッチサイズ、切り抜き数、トークン削減率、モデル規模は別に設定します。

図に入るのは、共有 Vision Transformer エンコーダー、小さな共有投影器、各視点の [CLS] 読み出しです。エンコーダー最終 LayerNorm がもたらす球面制約から離れた空間を SIGReg に与えるため、投影器があります。事前学習後は投影器を捨て、下流ではエンコーダー表現を使います。

図に入らないものも重要です。目標エンコーダー、予測器、勾配停止、マスクトークン再構成はありません。公式コードは更新後に Polyak/EMA エンコーダーを保ち、state_dict_ema を評価用に保存しますが、z_v も損失も作りません。目的の枠外へ描きます。

そして式には、動作 a_t、未来状態予測、報酬、コスト、探索がありません。この短い式から計画器を読み出してはいけません。

暗算してみる

L_inv = 0.30、L_SIGReg = 5.0 なら、L_total = 0.30 + 0.02 × 5.0 = 0.40 です。0.02 × L_inv + L_SIGReg と計算したなら、つまみを逆側に付けています。

根拠

最後に三行

  1. 総目的は L_inv + 0.02 × L_SIGReg です。
  2. 大域・局所枝はエンコーダー/投影器を共有し、両端に勾配が流れます。
  3. EMA は評価チェックポイント用です。目的に教師、予測器、勾配停止、計画器はありません。

式の小テスト

  1. λ = 0.02 はどの項に掛かりますか。
  2. 投影器は下流でも残しますか。
  3. EMA ファイルがあるのに「EMA 教師なし」と言えるのはなぜですか。
解答
  1. SIGReg 項です。
  2. 捨てます。下流にはエンコーダーを使います。
  3. EMA は目標を生成せず損失にも入らず、評価用に保存されるだけだからです。