コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
三つの役割
- 動画の小片パッチトークン
- 一台の ViT全視点で共有
- 要約札`[CLS]`
- 仮設の部屋256次元へ
一人の司書と仮設整理室
司書が、本の全ページ写真と部分拡大を同時に読みます。写真ごとに別人を雇わず、同じ頭で読み、それぞれに短い要約を書きます。ところが、司書の最後の筆記規則は札を球面へ押し込めます。分布検査には扱いにくい。そこで一時的な整理室を増設し、検査向けの形式へ変えます。卒業時に整理室は撤去し、司書だけを残します。
共有 ViT、[CLS]、投影器の関係はこれです。
部品表
| 部品 | 入力 → 出力 | 学習中の仕事 | 学習後 |
|---|---|---|---|
共有動画 ViT Eθ | 各視点のトークン → 同じ幅のトークン | 全視点が同じパラメータを使う | 下流エンコーダーとして残す |
[CLS] | 列の先頭に置く学習可能トークン | 動画窓を要約。損失が直接読む。削減しない | 動画窓の要約に使える |
二層投影器 hφ | d → 2048 → K、K=256 | Linear → BatchNorm → GELU → Linear。全視点共有 | 捨てる |
一つの視点の学習埋め込みは:
z_v = hφ(Eθ(x_v)[CLS]) ∈ R^256
なぜエンコーダー出力へ直接 SIGReg を掛けないのでしょう。ViT 最終層の LayerNorm は [CLS] の尺度を制限し、表現を制約された球面幾何へ置きます。論文は、その空間では SIGReg が等方正規分布へ十分に最適化しにくいと説明します。投影器は、その制約から離れた学習用空間を作ります。
これは V-JEPA の予測器ではありません。一方の枝から他方を予測せず、目標エンコーダーも勾配停止もありません。
公開実装と付録では ViT-B の d=768。まず [B, V+1, 768] の要約を得て、[B, V+1, 256] へ投影します。下流課題が読むのは元のエンコーダー表現で、投影器は持ち出しません。
箱と矢印を描く
大域と局所の二本を、同じ Eθ 箱へ入れます。各 [CLS] から同じ hφ へ進めます。「二台目の EMA 目標」「予測器」「勾配停止」は外です。B=8、V=4、d=768 なら [8,5,768] → [8,5,256] と書けます。
部品表の出典
三行の部品メモ
- 全視点が一台の ViT を通り、それぞれの
[CLS]から動画窓の要約を読みます。 - 投影器は
d → 2048 → 256の学習用ヘッドで、LayerNorm に制約された空間を SIGReg から切り離します。 - 投影器は学習後に捨てます。予測器ではなく、目標エンコーダーもありません。
点検
- 大域と局所に別々の ViT パラメータがありますか。
- 投影器を挟む理由は何ですか。
- 下流評価でも256次元投影器を使いますか。
解答
- ありません。同じ一組を共有します。
- 最終 LayerNorm の幾何制約を離れ、SIGReg を最適化できる空間を作るためです。
- 使いません。投影器は捨て、エンコーダー表現を読みます。