JEPA4Japan · チュートリアル

第15章―RoPE、1フレーム tubelet、思いがけない密特徴

1,246文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

三次元回転位置表現、チューブレット幅1、[CLS] だけを教師にしてもパッチ特徴を調べる価値がある理由を学びます。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 現在のレッスン

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

三枚のスタンプ

  1. 時・縦・横3D RoPE
  2. 一枚ずつtubelet = 1
  3. 採点は要約`[CLS]` のみ
  4. パッチも整う定性的な観察
位置は3方向で記し、入力で隣接フレームを混ぜません。直接採点しないパッチにも構造が現れます。

パズル片に住所印

動画の各パッチに「何フレーム目、上から何段、左から何列」と三つの印を押します。二つを比べると相対方向が分かります。隣の二ページを先に貼り合わせれば時間は粗くなりますが、LeVJEPA の既定は貼りません。面白いことに、先生が本全体の要約だけを採点しても、小片は狐、ソファ、背景ごとに色分けされるような構造を見せます。

最後は可視化での観察です。「領域分割の試験に合格した」ではありません。

混ぜない三項目

**1. 分解型三次元 RoPE。**各注意ヘッドの次元を時間、垂直、水平の三群に分け、それぞれの座標で回転させます。論文付録によれば絶対位置埋め込みは使いません。224と96の異なる格子を同じエンコーダーへ入れても、固定位置表を補間せずに済みます。

**2. tubelet=1。**空間パッチは16×16、時間幅は一フレームです。16フレームの224視点は 16 × 14 × 14 = 3136 パッチ、96視点は 16 × 6 × 6 = 576 パッチ。tubelet=2 は入力で二フレームを一時間区画にまとめます。論文は同じ学習トークン予算と、8個の評価時間区画で次を比較しています。

時間方向のパッチ化削減IN1KSSv2
tubelet=290%47.428.8
tubelet=195%50.730.4

数値は、凍結エンコーダー上の注意機構付きプローブによる著者報告の top-1 です。この手順では入力側で2フレームをまとめる必要がなかった、と読めます。tubelet=1 が常に最善とは言えません。

3. 密特徴。学習損失が直接触るのは [CLS] だけで、パッチ補助損失はありません。論文とプロジェクトページはパッチ PCA と、クエリパッチから他のパッチへの余弦類似度を示します。同じ物体領域がまとまり、動画中でも対応して見えます。価値ある定性的証拠です。しかし、領域分割や追跡など本当の密予測課題は未評価だと著者も明記しています。きれいなヒートマップを課題成績に言い換えてはいけません。

三つを手で確かめる

16フレームで tubelet=1 と2の時間区画数は16と8。トークン (t=5,y=3,x=9) なら、三次元 RoPE の三群は順に5、3、9を読みます。そして「PCA が物体を分ける」を、「公開された数例の可視化には意味的なまとまりが見える。領域分割や追跡に十分かは不明」と書き直します。

証拠

三つの境界

  1. 三次元 RoPE は時間・垂直・水平の相対位置を分けて符号化し、絶対位置表は使いません。
  2. 既定 tubelet=1 では一トークンは一フレーム。224視点は3136パッチです。
  3. パッチのまとまりは定性的な創発現象で、領域分割や追跡の結果ではありません。

どこまで言える?

  1. tubelet=1 は隣接二フレームを入力で結合しますか。
  2. 三次元 RoPE はどう「いつ・どこ」を分けますか。
  3. 鮮明なパッチ PCA は領域分割精度の検証ですか。
答え
  1. 結合しません。一トークンは一フレーム幅です。
  2. 注意ヘッドの次元を時間・垂直・水平へ分け、各座標で回転させます。
  3. 違います。定性的可視化で、領域分割と追跡は未評価です。