JEPA4Japan · チュートリアル

第9章―大域ビューと局所ビューの作り方

1,246文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

224画素の大域視点と複数の96画素局所視点を、同じ16フレーム時間窓から作ります。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 現在のレッスン
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

大窓と小窓の約束

  1. 同じ16枚時刻は替えない
  2. 大域 224場面を広く
  3. 局所 96細部を狭く
  4. 一組にする同じネットワークへ
切り取る場所、色、大きさは変えます。時間窓だけは、同じ組の中で替えません。

16ページのぱらぱら漫画

先生が16枚の連続写真を綴じました。机全体が入る大判を一冊。コップ、手、机の角だけを囲う小型版を数冊。小型版は少し明るくしたり、灰色にしたりします。それでも、どの版も同じ16ページをめくります。9ページ目から始まる小型版が混じったら、もう別の問題です。

実際の切り抜き条件

一つの学習動画窓について、最初に16フレームの時間区間を固定し、1 + V 個の視点を作ります。大域視点 x_0 は 224 × 224 で広い範囲を覆います。局所視点 x_1 ... x_V は 96 × 96。より狭く切り抜き、光度変換も強めです。大域側は最も広く、局所側の強い外観変換を受けない参照ですが、学習可能な枝です。ラベルファイルや教師ではありません。

V は方法に埋め込まれた定数ではありません。論文の主な比較実験では、特記がなければ局所視点を4個使います。この設定では10個まで増やすと ImageNet プローブの精度が伸び、12個付近で飽和したと報告しています。一方、Walking Tours の公開既定設定は局所視点10個です。実験記録には実際の V を書き、リポジトリ既定値を全実験共通値と呼ばないようにします。

小窓を合わせると、エンコーダーは固定座標や背景全体だけに頼りにくくなります。局所的な手掛かりから、同じ場面に共通する内容を拾う必要があるからです。広い窓は安定した文脈を供給します。情報量は違っても、時間の身元は同じです。

「16枚ずつ」だけでは足りません。開始時刻が違えば動作の段階も違います。前の16枚から後の16枚を当てる課題でもありません。両方とも同じ時間窓です。フレーム間のブロック因果注意はエンコーダー内部の規則で、この対応条件を変えません。

ビュー生成後は、それぞれ独立にパッチ埋め込みと無作為トークン削減を行い、同じエンコーダー/投影器を呼びます。保持集合は違ってかまいません。共有するのは時間窓とネットワークのパラメータで、残す空間パッチの番号ではありません。

フレーム番号で検算

元動画の101–116番を選びます。大域は101–116の 224 × 224 切り抜き、局所三つも101–116から別々の 96 × 96 を切れば正しい組です。一つを117–132番に替えたら、16枚あっても正例にはなりません。

証拠の置き場所

三点メモ

  1. 大域 224 × 224 と局所 96 × 96 は、まったく同じ16フレーム窓から作ります。
  2. 局所視点数は実験条件で、論文比較とリポジトリ既定値は一致しなくても不思議ではありません。
  3. 切り抜き、データ拡張、トークン保持集合は別々でも、エンコーダー/投影器パラメータは共有します。

仕上げの三問

  1. 開始点の違う二つの16フレームを正例にできますか。
  2. 公開既定の局所数は、全論文実験の固定値ですか。
  3. 大域視点は勾配停止教師ですか。
答え
  1. できません。
  2. 違います。実験ごとの V を記録します。
  3. 違います。局所枝と一緒に逆伝播されます。