JEPA4Japan · チュートリアル

第16章―五段のアブレーションが答えること

1,372文字 4分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

削減率、無作為方式とチューブ方式、局所視点数、チューブレット、注意の接続構造を一項ずつ比べます。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 現在のレッスン
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

一度に一つだけ変える

  1. 土台を固定データとモデル
  2. つまみは一つ問いも一つ
  3. 同じ試験凍結プローブ
  4. 差を記録表を混ぜない
  5. 範囲を守る普遍則ではない
アブレーションは梯子です。ほかを固定して横木を一本だけ替えると、差の出所が見えます。

紙飛行機の調整

紙、翼、重り、投げ方を全部替えて遠くへ飛んでも、どれが効いたか分かりません。まず紙と投げ方を固定し、つまみを一つずつ動かします。LeVJEPA 第4節も、観測をどれだけ減らすか、どう減らすか、小窓の数、何フレームで一トークンにするか、未来を見せるかを別々に尋ねます。

「既定値」は二組ある

名前データと長さ主な設定分かること
論文の比較実験の既定値ViT-B/16、K710の20%。第4節は特記なしの場合V=4、無作為削減。IN1K の凍結エンコーダー上の注意機構付きプローブ top-1(v1図4の説明は線形プローブと記載)論文内の設計比較
公式コードの実行既定Walking Tours、26周、約10k最適化ステップViT-B/16、V=10、95%、tubelet=1、ブロック因果注意、実効バッチサイズ3072公開された実行設定。240/1085周の表の再現ではない

共通部品は多くても、リポジトリ既定値を一度走らせて「論文表を再現した」とは言えません。

五段の梯子

以下はすべて arXiv v1 の著者報告で、それぞれの条件内で読みます。

問い変えたもの報告値言える範囲
少なく見るだけの近似か削減率0 → 95%IN1K 33.9 → 47.6、90%は47.4この一連の条件では、疎にしても IN1K は下がらず上がった
無作為かチューブか残す位置の構造IN1K 50.7/39.6、SSv2 28.8/26.4(後者は tubelet=2 条件)穴埋めをしない目的では、同じ領域を恒常的に隠す方が悪かった
局所視点は何個かV=4 → 10 → 1247.6 → 50.2 → 49.810まで改善し、この範囲では飽和。局所1個は約29保持パッチ
二フレームを先に束ねるかτ=2,ρ=.90 対 τ=1,ρ=.95、トークン/評価時刻数を対応IN1K 47.4/50.7、SSv2 28.8/30.4この目的に入力段の時間集約は必須でなかった
未来を見せる必要があるか全注意 対 ブロック因果注意IN1K 50.7/51.2指定されたプローブでは、因果マスクによる測定可能な精度低下が見えなかった

各行の最高値を寄せ集められる改良メニューではありません。細かな条件が行ごとに違うことがあります。運動は高い削減率に敏感で、短い学習期間の ρ>0.3 では SSv2 が低下します。統制実験が示すのは調べた近傍の出来事です。データ、規模、課題を替えた先の順序までは保証しません。

誇張を削る練習

「47.6は33.9より高いから、95%削減は全課題で最善」。誤りは二つです。数字は IN1K の同一図内の傾向にすぎません。短い学習期間の SSv2 は高い削減率で悪化します。「指定された IN1K アブレーションでは、著者報告で95%が最高だった。運動課題には条件付きの代償がある」なら、証拠の範囲に収まります。

照合先

梯子の三原則

  1. 論文のアブレーション既定値とリポジトリの実行既定値は、別の実験です。
  2. 数字には、動かしたつまみ、固定条件、データ、プローブを付けます。
  3. アブレーションが示すのは、調べた条件内の実験結果です。課題をまたぐ定理ではありません。

三つの確認

  1. 論文の統制比較は既定で何個の局所視点を使いますか。
  2. リポジトリの26周で論文の240周表を直接再現できますか。
  3. 51.2対50.7からブロック因果注意は全課題で優れると言えますか。
答え
  1. 特記がなければ V=4。
  2. できません。データ、学習期間、目的が違います。
  3. 言えません。指定された IN1K 凍結プローブ条件での著者報告だけです。