コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
動画を小銭に替える
- 16フレーム短い動画
- 16×16各フレームを区切る
- トークン化一区画一枚
- 住所を付ける時・縦・横
- `[CLS]`動画窓の要約係
方眼紙を16枚
16ページのぱらぱら漫画に同じ方眼を引きます。各マスを数値の小銭へ替え、「何ページ、上から何段、左から何列」と刻みます。袋の入口には特別な [CLS] 要約札があり、一冊分の情報を集めます。Transformer が扱うのは、生の画素ではなく時空間の住所を持つトークン列です。
数を数える
バッチと RGB チャンネルは、いったん脇へ置きます。既定の空間パッチは 16 × 16、tubelet の時間幅は τ = 1 です。三次元畳み込みは一度に1フレームだけをまたぎます。入力段階で隣り合う二枚を一トークンへ混ぜません。
16フレーム、224 × 224 の大域ビューなら:
1 frame = (224 / 16) × (224 / 16) = 14 × 14 = 196
1 clip = 16 × 196 = 3136 patch tokens
16フレーム、96 × 96 の局所ビューなら:
1 frame = (96 / 16) × (96 / 16) = 6 × 6 = 36
1 clip = 16 × 36 = 576 patch tokens
パッチ埋め込みは各小片をモデル幅 d へ写し、形は [T × Hpatch × Wpatch, d] になります。公開 ViT-L の設定では、分解型三次元 RoPE で相対的な時間・高さ・幅を表します。そのため同じエンコーダーが224と96の格子を扱う際、固定した絶対位置表を補間しません。RoPE はクエリとキーの位置表現を変えますが、未来を過去へ流すかどうかは注意マスクが決めます。
学習時はパッチ埋め込み後、時空間格子全体から95%を一様無作為に落とします。固定コードの丸めでは、3136枚から約157枚、576枚から約29枚が残ります。その後、決して落とさない学習可能な [CLS] を先頭へ足します。損失が直接読むのは投影器後の [CLS] だけです。パッチトークンへの直接の教師信号も、落とした内容を戻す復号器もありません。評価・推論時は削減を切り、すべてのトークンを見ます。
τ = 1 は論文と公開 ViT-L モデルの既定であり、動画 Transformer 全体の法則ではありません。τ = 2 なら16フレームは8時間区画です。トークンは半分になりますが、入力ですでに二枚をまとめています。比較には保持率と評価時の列長も併記します。
手計算
8フレーム、128 × 128、パッチ 16 × 16、τ = 1 なら、各フレームは 8 × 8 = 64、計 8 × 64 = 512 パッチトークン。[CLS] を足して513です。95%削減の対象に [CLS] は入れません。
元帳
覚える計算
τ = 1では、一トークンは一フレーム内の16 × 16パッチから来ます。- 16フレームの大域は3136、局所は576パッチトークン。
[CLS]は別です。 - 学習では95%を落とすだけで復元しません。評価時は全トークンを使います。
三問だけ
τ = 1は何を意味しますか。- 3136 はどこから来ますか。
[CLS]も無作為削減されますか。
答えを見る
- 一トークンの時間幅が一フレームです。
16 × 14 × 14 = 3136。- されません。常に残り、動画窓全体の要約を担います。