JEPA4Japan · チュートリアル

第14章―ブロック因果注意:同じ時刻は見える、未来は見えない

1,232文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

フレーム内双方向、フレーム間因果、[CLS] の例外、未来漏洩のない接続を読みます。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 現在のレッスン
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

現在は相談、未来は封印

  1. 同じフレーム自由に相談
  2. 過去読み返せる
  3. 未来まだ読めない
  4. `[CLS]`受け取るだけ
パッチは現在と過去を読めます。`[CLS]` は全編を読みますが、パッチへ未来を返しません。

廊下の教室と総合ポスト

各フレームを一教室と考えます。同じ教室の子は自由に話し、前の教室のノートも読めます。未来の教室へ電話はできません。廊下の端には総合ポスト [CLS] があり、全教室から手紙を受け取って校舎全体を要約します。ただし、教室側はポストから手紙を取り出せません。最後の教室が答えを入れ、最初の教室が次の層で取り出せたら、未来禁止を抜けられるからです。

可視性を表にする

第 t フレームの問い合わせ側パッチと、第 s フレームの参照側パッチの規則は s ≤ t。s=t の空間パッチは互いに双方向で、過去は読め、未来は読めません。

読む側読めるもの読めないもの理由
フレーム t のパッチフレーム 1…t の保持パッチフレーム t+1…末尾フレーム表現に未来を入れない
[CLS]全パッチと自身—動画窓全体の要約
任意のパッチマスクが許すパッチ[CLS][CLS] を未来の中継点にしない

したがって「因果的」と正確に呼べるのは各フレームのパッチ表現です。動画窓全体の [CLS] は最初から全編を読み、時刻 t のオンライン状態ではありません。無作為削減後も、コードは短くなった列位置から時刻を推測せず、元の token_ids でフレーム番号を戻してマスクを作ります。

条件をそろえた比較では、全双方向注意とブロック因果注意を比べています。ViT-B/16、K710の20%、tubelet=1、ρ=0.95、V=4、無作為削減、凍結エンコーダー上の注意機構付きプローブで、著者報告の ImageNet top-1 は 50.7 対 51.2 です。この手順では測定できる精度低下が見えなかった、と言えます。すべてのデータセット、モデル、課題で損失がないという定理ではありません。

ブロック因果なら過去の鍵と値をキャッシュし、新フレームのたびに過去を再符号化しない逐次処理システムを考えられます。これは構造から考えられる将来用途です。LeVJEPA は動作条件付き力学、費用、計画器を学習していません。

3×3 マスクを塗る

行を問い合わせ側フレーム、列を参照側フレームとした3×3表を描き、対角と左下を緑、右上を赤にします。[CLS] の行は全緑。パッチから [CLS] へ向かう列は全赤です。そこを緑にしたら、二層を経て future → CLS → past が起きます。

根拠

机に残す三行

  1. パッチはフレーム内双方向、フレーム間では現在と過去だけを読みます。
  2. [CLS] は全動画窓を見ますが、パッチは [CLS] を読めません。未来漏洩を防ぐためです。
  3. 51.2対50.7は限定手順の著者報告で、一般定理でも計画証拠でもありません。

赤か緑か

  1. 第3フレームのパッチは、同じフレームの別パッチを読めますか。
  2. パッチが [CLS] を読めない理由は何ですか。
  3. 学習中の [CLS] を「最初の3フレームだけのオンライン状態」と呼べますか。
解答
  1. 読めます。フレーム内は双方向です。
  2. [CLS] は全編を読んでおり、そこから未来が過去へ漏れるからです。
  3. 呼べません。[CLS] は動画窓全体を読んでいます。