JEPA4Japan · チュートリアル

第13章―95%捨てると、なぜかよく見える

1,305文字 4分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

無作為トークン削減と構造化チューブマスクを分け、計算節約、拡張効果、動きの手掛かりの損失を考えます。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 現在のレッスン
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

3136枚から157枚だけ

  1. 全部並べる3136パッチ
  2. 毎回くじ引き場所を変える
  3. 5%を送る157パッチ
  4. 意味をまとめる穴埋めではない
落としたトークンは Transformer に入りません。疎な手掛かりから安定した要約を作ります。

目を閉じて一つかみ

動く漫画を机にばらし、目を閉じて少数のマスだけ拾います。今回は車輪と街灯、次は運転手と空。場所が毎回変わるので、断片から同じ話を読み取る必要があります。もし全フレームで同じ縦列だけを隠したら、その列を通る主役は一度も見えないかもしれません。

ここに無作為削減とチューブマスクの違いがあります。ただし「画素の穴埋め」という話ではありません。LeVJEPA にはマスクトークン、復号器、再構成目的がありません。

何を本当に落としているか

標本化はパッチ埋め込みの後です。各標本の完全な時空間格子に乱数を振り、小さい順に必要数を残します。[CLS] はその後に追加するので落ちません。削減は学習モードだけで働き、評価と推論は全列を読みます。

視点削減前95%削減後[CLS] を含む列長
16フレーム、224、パッチ163136157158
16フレーム、96、パッチ165762930

論文のアブレーション(ほかを固定して一要素だけ変える比較)では、ImageNet-1K の著者報告値が削減なしの 33.9 から95%で 47.6 へ上がります。90%と95%は47.4対47.6です。著者は、1ステップの計算を減らしつつ無作為なデータ拡張のように働き、異なる疎な観測から要約を安定させると説明します。式 1 / (1 - ρ) = 20 はフィードフォワード層の理論的削減係数です。全演算や処理全体の実行時間が必ず20分の1になる、という意味ではありません。

残す位置の選び方も効きます。一様無作為に残す方式と、全フレームで同じ空間位置を残すチューブ方式の著者報告は、ImageNet で 50.7 対 39.6 です。指定された tubelet=2 条件の SSv2 は 28.8 対 26.4 です。しかし、疎なら常に勝つわけではありません。短い学習では SSv2 が削減率0.3を超えると低下し、長く学習するとその悪化が和らぐ、と論文は述べています。動きの対応関係を保つ疎化は未解決問題です。

評価手順の但し書きもあります。第4節本文は frozen attentive probe、arXiv v1 の図4説明は linear probing、プロジェクトページは注意機構付きプローブと記しています。したがって、この一連の条件変更は同一図内の傾向として読むのが安全です。別表の絶対値と直接比べません。

4×4の落書き

round(3136×0.05)=157、round(576×0.05)=29 を計算します。4フレームに4マスずつ描き、無作為方式では別々のマス、チューブ方式では同じマスを丸で囲みます。同じ物体を全時刻で隠しやすいのはチューブ方式です。

出典

三枚の付箋

  1. 削減は本当にトークンを削ります。エンコーダーに入らず、再構成もしません。
  2. 95%では大域/局所が157/29パッチ。[CLS] は別に足し、落としません。
  3. ImageNet と計算効率には著者報告の利点がありますが、短い学習の運動指標は傷みます。

くじ引きテスト

  1. 落とした位置をマスクトークンに置き換えますか。
  2. 95%削減後の大域列は [CLS] 込みで何トークンですか。
  3. ImageNet の傾向だけで、95%は全運動課題に最適と言えますか。
答え
  1. 置き換えません。Transformer に入りません。
  2. 158です。
  3. 言えません。短い学習の SSv2 は高い削減率で悪化します。