JEPA4Japan · チュートリアル

第12章―一回の前向き計算を端から端まで

1,109文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

バッチ、多視点、連結埋め込み、二つの損失、勾配、学習後に捨てる部品を一巡します。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 現在のレッスン
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

一回の往復

  1. 同じ動画窓1大 + V小
  2. 5%だけ無作為に保持
  3. 共有エンコーダー`[CLS]` を取る
  4. 二つの損失寄せて、広げる
  5. 一緒に更新両枝へ勾配
隠れた教師枝はありません。多視点を同じ機械へ入れ、二損失の勾配を戻します。

サッカー中継の編集室

一つの試合映像から、全体映像を1つ、クローズアップ映像を数本作ります。機械は各映像の断片を少しだけ拾い、要約を書きます。一人は「同じ試合の札を近づけて」と言い、もう一人は「全試合を同じ一文にしないで」と言います。二人の赤入れが同じ道を戻り、全体像の札も直ります。変更禁止の印はありません。

テンソルの駅を順番に

V の文脈を先に書きます。論文の統制比較は既定 V=4。Walking Tours の公開設定は V=10 です。

駅大域各局所備考
入力16×224×22416×96×96同一時間窓
削減前のパッチ313657616×14×14 と 16×6×6
95%削減後15729round(N×0.05)
[CLS] 後15830[CLS] は残す
エンコーダー要約[B,1,d]合わせて [B,V,d]局所視点はバッチ軸へまとめて計算
投影器出力[B,V+1,256]同じテンソル全要約を連結後に投影

コードは大域埋め込みを V+1 個へブロードキャストし、全埋め込みとの差の平均二乗を取ります。大域自身との項は常にゼロです。SIGReg は [ビュー, バッチ, 256] へ並べ替え、視点ごとにサンプル集合の分布を調べます。総損失は MSE + 0.02 × SIGReg です。勾配は大域・局所から共有エンコーダーと投影器へ流れます。

学習グラフはここで終わります。学習用の目標エンコーダー、マスクされた問いを扱う予測器、勾配停止はありません。別に Polyak 重みのコピーがあり、減衰率 0.9999 で最適化の32ステップごとに更新されますが、評価用の重みとして保存するだけです。前向き計算には使わず、目標も損失も作りません。学習後に投影器を捨て、論文と公開重みの評価にはエンコーダーの EMA コピーを使います。

B=2、V=4 なら

視点要約は 2×5=10 個。投影器後は [2,5,256]。31番目の最適化ステップを終えた直後なら、次の32ステップ目の EMA 更新はまだです。EMA から損失へ向かう矢印を描いたら消します。

前向き計算の領収書

三つの検算値

  1. 95%削減後、大域/局所は157/29パッチ。各々へ [CLS] を一枚足します。
  2. 不変性と SIGReg は [B,V+1,256] を使い、両枝へ勾配を返します。
  3. 0.9999、32ステップごとの EMA は評価用で、学習目標エンコーダーではありません。

出口テスト

  1. 削減前の224大域視点にはパッチがいくつありますか。
  2. 大域要約を勾配停止しますか。
  3. EMA 複製は学習前向き計算に参加しますか。
答え
  1. 16 × 14 × 14 = 3136。
  2. しません。両側に勾配が流れます。
  3. 参加しません。周期的に平均して評価チェックポイントとして保存します。