コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
三つの試験会場
- 物は何?ImageNet-1K
- 何をしてる?Kinetics-400
- どう動いた?Something-v2
- 本体は凍結プローブだけ学ぶ
同じ生徒、三人の通訳
一人の生徒が三試験を受けます。写真を見て物体を答える。動画を見て動作を答える。「コップを机に置く」と「机から取る」を区別する。生徒自身への追試授業は禁止ですが、会場ごとに小さな通訳を訓練し、頭の中の特徴をクラスへ訳します。成績は情報が表現から読めるかを示します。ゼロショットで答えたわけではありません。
問題用紙と読み出し方
| 試験 | 論文での役割 | v1 の読み出し | 支える証拠 |
|---|---|---|---|
| ImageNet-1K(IN1K) | 静的物体、外観寄り | 凍結した本体 + 注意機構付きプローブ | 小さなプローブで物体情報を取り出せるか |
| Something-Something-v2(SSv2) | 時間順序と運動関係 | 凍結した本体 + 注意機構付きプローブ | 運動・時系列情報。物理理解全体ではない |
| Kinetics-400(K400) | 動作認識 | 凍結トークンの平均プーリング + 線形プローブ | 動作クラス情報。注意機構付きプローブより弱い適応 |
凍結とはエンコーダーのパラメータを固定することです。プローブと分類器は下流のラベル付き学習集合で学ぶため、ゼロショットではありません。エンコーダーも更新するエンドツーエンド微調整とも違います。
注意機構付きプローブは、単一の線形層ではありません。付録の構造では、一つの学習可能な問いベクトルが一層の交差注意で凍結エンコーダーの全出力トークンを読み、問いへの残差を加え、二層 MLP、GELU、LayerNorm、最後の線形分類器へ進みます。「どのトークンから情報を取るか」まで学べるため、情報がすでに線形に並んでいるかだけを見る試験ではありません。
K400 は規模が大きいため、プローブの計算費用を抑える目的で、全出力トークンの平均と線形分類器を使います。これは、表現力を意図的に抑えた読み出し方法です。したがって FLOPs 一致表の IN1K/SSv2 と K400 は同じ読み出し方法ではありません。動画モデルどうしを比べる際は、チューブレット幅が違ってもプローブが見るトークン数をそろえられるよう、入力の時間長を調整します。静止画の ImageNet は時間軸方向へ複製して動画エンコーダーへ渡します。
IN1K が高くても動作が強いとは限りません。SSv2 が高くても計画は証明しません。三試験を合わせると、FLOPs 一致の LeVJEPA は外観と K400 が強く、SSv2 は表の最高値に届かない形が見えます。
四枚の札を分類
① エンコーダーを凍結し、交差注意と分類器を学ぶ。② エンコーダーも更新する。③ 読み出しを一切学ばず答える。④ SSv2 が高いのでロボット計画もできると述べる。順に、凍結プローブ評価、微調整、ゼロショット、証拠のない主張です。
試験要項
三つの採点規則
- IN1K は外観、SSv2 は運動/順序、K400 は動作クラス寄りで、互いの代わりにはなりません。
- 凍結プローブ評価では、ラベル付きデータで小さな読み出し器を学びます。ゼロショットでもエンコーダー微調整でもありません。
- IN1K/SSv2 は注意機構付きプローブ、K400 は平均プーリングと線形プローブです。
採点者への三問
- 凍結評価はエンコーダーを更新しますか。
- 注意機構付きプローブは線形分類器一枚だけですか。
- K400 と IN1K の数字を「同じ読み出し」と呼べない理由は。
解答
- 更新しません。プローブと分類器だけを更新します。
- 違います。交差注意、残差、二層 MLP、GELU、LayerNorm、分類器を含みます。
- K400 は平均プーリングと線形分類器、IN1K は注意機構付きプローブだからです。