コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
三種類の宿題
- 画素を埋める絵を描き直す
- 特徴を当てる隠れた領域
- 要約を合わせる同じ動画窓
犬とボールの絵
「犬がボールを追う」画面の半分を先生が隠しました。一人目は草一本、影一つまで描き戻します。二人目は隠れた領域の高位特徴を当てます。みちるの課題は違います。全景と犬の頭だけの切り抜きを見て、近い物語札を書きます。葉の揺れは忘れてもかまいませんが、「同じ追跡場面」は残したいところです。
どれもラベルなしデータから作れる宿題ですが、採点対象は別物です。
答えのテンソルはどこから来る?
画素再構成では色の値が正解です。VideoMAE 系は時空間パッチの大部分を隠し、復号器で元に戻します。動画は隣のフレームから画素を写しやすいため、全時刻で同じ空間位置を隠すチューブマスクに意味があります。
特徴予測は正解を学習表現に替えます。I-JEPA と V-JEPA は文脈エンコーダーと予測器で、目標エンコーダーが出した領域表現を当てます。V-JEPA の目標は、勾配停止した EMA エンコーダーから来ます。画素を描かなくても、「隠れた目標を予測する」計算グラフはあります。
LeVJEPA の視点不変性は、もう一度問いを替えます。一つの大域ビューと複数の局所ビューを同じエンコーダー/投影器に通し、各 [CLS] 埋め込みだけを比べます。予測器、目標エンコーダー、勾配停止、復号器はありません。大域要約も勾配で動くので、固定ラベルではありません。
したがって、トークン削減をマスク予測と呼んではいけません。落としたパッチトークンはエンコーダーに入らず、復元損失もありません。残った疎なトークンだけが、その前向き計算でモデルに見える世界です。削減は計算量と観測の難しさを変えます。
「意味を残す」ことも保証ではありません。目的は、切り抜きや見た目の変更に共通する情報を残すよう促しますが、何が意味的で何を捨てるべきかまでは列挙しません。下流課題が細かな動きを必要とし、疎な観測がその手掛かりを消せば、性能は弱くなります。凍結プローブ、検索、密な予測課題で確かめる必要があります。
見分ける一問
損失を見たら「正解テンソルはどこから来ますか」と尋ねます。元の画素なら再構成、別のエンコーダー枝が出す隠れ領域の表現なら特徴予測、同じ動画窓の大域・局所 [CLS] 間の距離だけなら LeVJEPA の視点不変性です。
参照した論文
三つだけ固定する
- 画素再構成、隠れ特徴予測、ビュー要約照合は別の学習課題です。
- LeVJEPA は落としたトークンも画素も復元しません。
- 同一動画窓の
[CLS]を近づけますが、表現の意味は下流の証拠で測ります。
確認問題
- LeVJEPA に復号器が要らないのはなぜですか。
- 無作為に落としたトークンに再構成損失はありますか。
- V-JEPA と LeVJEPA の計算グラフで最も目立つ違いは何ですか。
解答を見る
- 画素を再構成しないからです。
- ありません。
- V-JEPA には予測器、EMA 目標、勾配停止があります。LeVJEPA は共有エンコーダー/投影器と SIGReg を使います。