JEPA4Japan · チュートリアル

第1章―同じ動画を、二つの窓から見る

1,221文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

街角を見る子どもの話から、大域視点、局所視点、同一時間窓、共有表現の感覚をつかみます。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 現在のレッスン
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

同じ場面を二つの窓から

  1. 16フレーム同じ短い時間
  2. 広い窓場面全体
  3. 小さな窓一部だけ
  4. 札を比べる同じ話なら近い
変えてよいのは「どこを見るか」です。別の時間にすり替えてはいけません。

キックボードが通る

一台のキックボードが角を曲がります。大きな窓からは、人も道も車体も見えます。紙筒をのぞく弟には、回る車輪だけが見えます。画素はずいぶん違っても、同じ一度の通過です。ところが弟が三秒遅れてのぞけば、もう犬しかいないかもしれません。その二つを無理に同じ要約へ寄せるのは不自然です。

LeVJEPA のビューペアを作る要点はここにあります。見る場所は違ってもよい。ただし、時間窓は変えない。「同じ動画ファイル」というだけでは粗すぎます。まったく同じ16フレームの時間窓から切り出します。

仕組みを少し正確に

**ビュー(視点)**は切り抜きや色変換を施した入力のバリエーション、エンコーダーは大量の画素を特徴へ変える機械、埋め込みは比較できる短い数値の札です。

16フレームの動画窓から V + 1 個のビューを作ります。広い大域ビュー x_0 が1つ、切り抜く範囲が狭く、見た目の変換が強い局所ビュー x_1 ... x_V が V 個です。どれも同じ16時刻を含みます。全ビューは、まったく同じパラメータを持つエンコーダー E と投影器 h を通り、[CLS] から z_v を得ます。「共有」とは、似た機械を複製することではありません。一組のパラメータを全枝が参照し、一度の更新で一緒に変わることです。

各局所要約を大域要約へ近づけます。局所画像から全景を描き直すわけでも、後半16フレームから前半を予測するわけでも、別の予測器で目標表現を当てるわけでもありません。大域ビューが基準になるのは、空間を広く覆い、局所側ほど強い光度変換を受けないからです。勾配停止した教師だからではありません。さらに全要約へ SIGReg を掛け、バッチ全体が一枚の札になるのを防ぎます。

この課題は、切り抜きや色の偶然を捨て、窓の間で共通する内容を残すよう促します。ただし、局所切り抜きが背景だけを拾えば信号は弱くなります。同じ時刻であることは必要条件ですが、どの切り抜きも同じほど有益とは限りません。

紙に描く実験

16マスの時間軸と二つの窓を描きます。窓の高さや大きさは変えてよいですが、横方向は両方とも1–16番を覆わせます。小窓を9–24番へずらしたら、そこを赤丸で囲みましょう。LeVJEPA が求める同一時間窓の組ではなくなった箇所です。

根拠をたどる

忘れない三点

  1. 大域・局所ビューは同一の16フレーム時間窓から取ります。
  2. すべてのビューがエンコーダー、投影器、[CLS] 読み出しを共有します。
  3. 大域要約にも勾配が流れます。凍結教師の答えではありません。

すぐ答えられる?

  1. 局所ビューを同じ動画の一分後から取ってもよいですか。
  2. 「共有エンコーダー」は何を共有しますか。
  3. 切り抜きで消えた画素を再構成する課題ですか。
答え合わせ
  1. いけません。大域ビューと同じ16フレーム窓が必要です。
  2. 全ビューが一組の学習可能パラメータを使います。
  3. 違います。投影器後の [CLS] 要約を比べます。