JEPA4Japan · チュートリアル

第18章―ImageNet、K400、SSv2 は何を試すか

1,364文字 4分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

見た目、動作、運動のベンチマークと、凍結エンコーダー、線形プローブ、注意機構付きプローブの証拠範囲を学びます。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 現在のレッスン
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

三つの試験会場

  1. 物は何?ImageNet-1K
  2. 何をしてる?Kinetics-400
  3. どう動いた?Something-v2
  4. 本体は凍結プローブだけ学ぶ
試験ごとに問いが違います。「凍結」はエンコーダーを更新しないという意味で、評価用プローブはラベルから学びます。

同じ生徒、三人の通訳

一人の生徒が三試験を受けます。写真を見て物体を答える。動画を見て動作を答える。「コップを机に置く」と「机から取る」を区別する。生徒自身への追試授業は禁止ですが、会場ごとに小さな通訳を訓練し、頭の中の特徴をクラスへ訳します。成績は情報が表現から読めるかを示します。ゼロショットで答えたわけではありません。

問題用紙と読み出し方

試験論文での役割v1 の読み出し支える証拠
ImageNet-1K(IN1K)静的物体、外観寄り凍結した本体 + 注意機構付きプローブ小さなプローブで物体情報を取り出せるか
Something-Something-v2(SSv2)時間順序と運動関係凍結した本体 + 注意機構付きプローブ運動・時系列情報。物理理解全体ではない
Kinetics-400(K400)動作認識凍結トークンの平均プーリング + 線形プローブ動作クラス情報。注意機構付きプローブより弱い適応

凍結とはエンコーダーのパラメータを固定することです。プローブと分類器は下流のラベル付き学習集合で学ぶため、ゼロショットではありません。エンコーダーも更新するエンドツーエンド微調整とも違います。

注意機構付きプローブは、単一の線形層ではありません。付録の構造では、一つの学習可能な問いベクトルが一層の交差注意で凍結エンコーダーの全出力トークンを読み、問いへの残差を加え、二層 MLP、GELU、LayerNorm、最後の線形分類器へ進みます。「どのトークンから情報を取るか」まで学べるため、情報がすでに線形に並んでいるかだけを見る試験ではありません。

K400 は規模が大きいため、プローブの計算費用を抑える目的で、全出力トークンの平均と線形分類器を使います。これは、表現力を意図的に抑えた読み出し方法です。したがって FLOPs 一致表の IN1K/SSv2 と K400 は同じ読み出し方法ではありません。動画モデルどうしを比べる際は、チューブレット幅が違ってもプローブが見るトークン数をそろえられるよう、入力の時間長を調整します。静止画の ImageNet は時間軸方向へ複製して動画エンコーダーへ渡します。

IN1K が高くても動作が強いとは限りません。SSv2 が高くても計画は証明しません。三試験を合わせると、FLOPs 一致の LeVJEPA は外観と K400 が強く、SSv2 は表の最高値に届かない形が見えます。

四枚の札を分類

① エンコーダーを凍結し、交差注意と分類器を学ぶ。② エンコーダーも更新する。③ 読み出しを一切学ばず答える。④ SSv2 が高いのでロボット計画もできると述べる。順に、凍結プローブ評価、微調整、ゼロショット、証拠のない主張です。

試験要項

三つの採点規則

  1. IN1K は外観、SSv2 は運動/順序、K400 は動作クラス寄りで、互いの代わりにはなりません。
  2. 凍結プローブ評価では、ラベル付きデータで小さな読み出し器を学びます。ゼロショットでもエンコーダー微調整でもありません。
  3. IN1K/SSv2 は注意機構付きプローブ、K400 は平均プーリングと線形プローブです。

採点者への三問

  1. 凍結評価はエンコーダーを更新しますか。
  2. 注意機構付きプローブは線形分類器一枚だけですか。
  3. K400 と IN1K の数字を「同じ読み出し」と呼べない理由は。
解答
  1. 更新しません。プローブと分類器だけを更新します。
  2. 違います。交差注意、残差、二層 MLP、GELU、LayerNorm、分類器を含みます。
  3. K400 は平均プーリングと線形分類器、IN1K は注意機構付きプローブだからです。