JEPA4Japan · チュートリアル

第10章―動画を時空間の小片に切る

1,107文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

16フレームが16×16パッチ、フレームごとのチューブレット、位置表現を経るときの個数と形を追います。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 現在のレッスン
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

動画を小銭に替える

  1. 16フレーム短い動画
  2. 16×16各フレームを区切る
  3. トークン化一区画一枚
  4. 住所を付ける時・縦・横
  5. `[CLS]`動画窓の要約係
既定では一枚のパッチトークンがまたぐのは一フレームだけです。

方眼紙を16枚

16ページのぱらぱら漫画に同じ方眼を引きます。各マスを数値の小銭へ替え、「何ページ、上から何段、左から何列」と刻みます。袋の入口には特別な [CLS] 要約札があり、一冊分の情報を集めます。Transformer が扱うのは、生の画素ではなく時空間の住所を持つトークン列です。

数を数える

バッチと RGB チャンネルは、いったん脇へ置きます。既定の空間パッチは 16 × 16、tubelet の時間幅は τ = 1 です。三次元畳み込みは一度に1フレームだけをまたぎます。入力段階で隣り合う二枚を一トークンへ混ぜません。

16フレーム、224 × 224 の大域ビューなら:

1 frame = (224 / 16) × (224 / 16) = 14 × 14 = 196
1 clip  = 16 × 196 = 3136 patch tokens

16フレーム、96 × 96 の局所ビューなら:

1 frame = (96 / 16) × (96 / 16) = 6 × 6 = 36
1 clip  = 16 × 36 = 576 patch tokens

パッチ埋め込みは各小片をモデル幅 d へ写し、形は [T × Hpatch × Wpatch, d] になります。公開 ViT-L の設定では、分解型三次元 RoPE で相対的な時間・高さ・幅を表します。そのため同じエンコーダーが224と96の格子を扱う際、固定した絶対位置表を補間しません。RoPE はクエリとキーの位置表現を変えますが、未来を過去へ流すかどうかは注意マスクが決めます。

学習時はパッチ埋め込み後、時空間格子全体から95%を一様無作為に落とします。固定コードの丸めでは、3136枚から約157枚、576枚から約29枚が残ります。その後、決して落とさない学習可能な [CLS] を先頭へ足します。損失が直接読むのは投影器後の [CLS] だけです。パッチトークンへの直接の教師信号も、落とした内容を戻す復号器もありません。評価・推論時は削減を切り、すべてのトークンを見ます。

τ = 1 は論文と公開 ViT-L モデルの既定であり、動画 Transformer 全体の法則ではありません。τ = 2 なら16フレームは8時間区画です。トークンは半分になりますが、入力ですでに二枚をまとめています。比較には保持率と評価時の列長も併記します。

手計算

8フレーム、128 × 128、パッチ 16 × 16、τ = 1 なら、各フレームは 8 × 8 = 64、計 8 × 64 = 512 パッチトークン。[CLS] を足して513です。95%削減の対象に [CLS] は入れません。

元帳

覚える計算

  1. τ = 1 では、一トークンは一フレーム内の 16 × 16 パッチから来ます。
  2. 16フレームの大域は3136、局所は576パッチトークン。[CLS] は別です。
  3. 学習では95%を落とすだけで復元しません。評価時は全トークンを使います。

三問だけ

  1. τ = 1 は何を意味しますか。
  2. 3136 はどこから来ますか。
  3. [CLS] も無作為削減されますか。
答えを見る
  1. 一トークンの時間幅が一フレームです。
  2. 16 × 14 × 14 = 3136。
  3. されません。常に残り、動画窓全体の要約を担います。