JEPA4Japan · チュートリアル

第5章―全ピクセルではなく、意味を残す

1,210文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

画素再構成、特徴予測、視点不変性を比べ、LeVJEPA が何を予測し、何を予測しないかを整理します。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 現在のレッスン
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

三種類の宿題

  1. 画素を埋める絵を描き直す
  2. 特徴を当てる隠れた領域
  3. 要約を合わせる同じ動画窓
LeVJEPA は三番目です。捨てた画素やトークンを復元する仕事ではありません。

犬とボールの絵

「犬がボールを追う」画面の半分を先生が隠しました。一人目は草一本、影一つまで描き戻します。二人目は隠れた領域の高位特徴を当てます。みちるの課題は違います。全景と犬の頭だけの切り抜きを見て、近い物語札を書きます。葉の揺れは忘れてもかまいませんが、「同じ追跡場面」は残したいところです。

どれもラベルなしデータから作れる宿題ですが、採点対象は別物です。

答えのテンソルはどこから来る?

画素再構成では色の値が正解です。VideoMAE 系は時空間パッチの大部分を隠し、復号器で元に戻します。動画は隣のフレームから画素を写しやすいため、全時刻で同じ空間位置を隠すチューブマスクに意味があります。

特徴予測は正解を学習表現に替えます。I-JEPA と V-JEPA は文脈エンコーダーと予測器で、目標エンコーダーが出した領域表現を当てます。V-JEPA の目標は、勾配停止した EMA エンコーダーから来ます。画素を描かなくても、「隠れた目標を予測する」計算グラフはあります。

LeVJEPA の視点不変性は、もう一度問いを替えます。一つの大域ビューと複数の局所ビューを同じエンコーダー/投影器に通し、各 [CLS] 埋め込みだけを比べます。予測器、目標エンコーダー、勾配停止、復号器はありません。大域要約も勾配で動くので、固定ラベルではありません。

したがって、トークン削減をマスク予測と呼んではいけません。落としたパッチトークンはエンコーダーに入らず、復元損失もありません。残った疎なトークンだけが、その前向き計算でモデルに見える世界です。削減は計算量と観測の難しさを変えます。

「意味を残す」ことも保証ではありません。目的は、切り抜きや見た目の変更に共通する情報を残すよう促しますが、何が意味的で何を捨てるべきかまでは列挙しません。下流課題が細かな動きを必要とし、疎な観測がその手掛かりを消せば、性能は弱くなります。凍結プローブ、検索、密な予測課題で確かめる必要があります。

見分ける一問

損失を見たら「正解テンソルはどこから来ますか」と尋ねます。元の画素なら再構成、別のエンコーダー枝が出す隠れ領域の表現なら特徴予測、同じ動画窓の大域・局所 [CLS] 間の距離だけなら LeVJEPA の視点不変性です。

参照した論文

三つだけ固定する

  1. 画素再構成、隠れ特徴予測、ビュー要約照合は別の学習課題です。
  2. LeVJEPA は落としたトークンも画素も復元しません。
  3. 同一動画窓の [CLS] を近づけますが、表現の意味は下流の証拠で測ります。

確認問題

  1. LeVJEPA に復号器が要らないのはなぜですか。
  2. 無作為に落としたトークンに再構成損失はありますか。
  3. V-JEPA と LeVJEPA の計算グラフで最も目立つ違いは何ですか。
解答を見る
  1. 画素を再構成しないからです。
  2. ありません。
  3. V-JEPA には予測器、EMA 目標、勾配停止があります。LeVJEPA は共有エンコーダー/投影器と SIGReg を使います。