コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
現在は相談、未来は封印
- 同じフレーム自由に相談
- 過去読み返せる
- 未来まだ読めない
- `[CLS]`受け取るだけ
廊下の教室と総合ポスト
各フレームを一教室と考えます。同じ教室の子は自由に話し、前の教室のノートも読めます。未来の教室へ電話はできません。廊下の端には総合ポスト [CLS] があり、全教室から手紙を受け取って校舎全体を要約します。ただし、教室側はポストから手紙を取り出せません。最後の教室が答えを入れ、最初の教室が次の層で取り出せたら、未来禁止を抜けられるからです。
可視性を表にする
第 t フレームの問い合わせ側パッチと、第 s フレームの参照側パッチの規則は s ≤ t。s=t の空間パッチは互いに双方向で、過去は読め、未来は読めません。
| 読む側 | 読めるもの | 読めないもの | 理由 |
|---|---|---|---|
フレーム t のパッチ | フレーム 1…t の保持パッチ | フレーム t+1…末尾 | フレーム表現に未来を入れない |
[CLS] | 全パッチと自身 | — | 動画窓全体の要約 |
| 任意のパッチ | マスクが許すパッチ | [CLS] | [CLS] を未来の中継点にしない |
したがって「因果的」と正確に呼べるのは各フレームのパッチ表現です。動画窓全体の [CLS] は最初から全編を読み、時刻 t のオンライン状態ではありません。無作為削減後も、コードは短くなった列位置から時刻を推測せず、元の token_ids でフレーム番号を戻してマスクを作ります。
条件をそろえた比較では、全双方向注意とブロック因果注意を比べています。ViT-B/16、K710の20%、tubelet=1、ρ=0.95、V=4、無作為削減、凍結エンコーダー上の注意機構付きプローブで、著者報告の ImageNet top-1 は 50.7 対 51.2 です。この手順では測定できる精度低下が見えなかった、と言えます。すべてのデータセット、モデル、課題で損失がないという定理ではありません。
ブロック因果なら過去の鍵と値をキャッシュし、新フレームのたびに過去を再符号化しない逐次処理システムを考えられます。これは構造から考えられる将来用途です。LeVJEPA は動作条件付き力学、費用、計画器を学習していません。
3×3 マスクを塗る
行を問い合わせ側フレーム、列を参照側フレームとした3×3表を描き、対角と左下を緑、右上を赤にします。[CLS] の行は全緑。パッチから [CLS] へ向かう列は全赤です。そこを緑にしたら、二層を経て future → CLS → past が起きます。
根拠
机に残す三行
- パッチはフレーム内双方向、フレーム間では現在と過去だけを読みます。
[CLS]は全動画窓を見ますが、パッチは[CLS]を読めません。未来漏洩を防ぐためです。- 51.2対50.7は限定手順の著者報告で、一般定理でも計画証拠でもありません。
赤か緑か
- 第3フレームのパッチは、同じフレームの別パッチを読めますか。
- パッチが
[CLS]を読めない理由は何ですか。 - 学習中の
[CLS]を「最初の3フレームだけのオンライン状態」と呼べますか。
解答
- 読めます。フレーム内は双方向です。
[CLS]は全編を読んでおり、そこから未来が過去へ漏れるからです。- 呼べません。
[CLS]は動画窓全体を読んでいます。