コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
一回の往復
- 同じ動画窓1大 + V小
- 5%だけ無作為に保持
- 共有エンコーダー`[CLS]` を取る
- 二つの損失寄せて、広げる
- 一緒に更新両枝へ勾配
サッカー中継の編集室
一つの試合映像から、全体映像を1つ、クローズアップ映像を数本作ります。機械は各映像の断片を少しだけ拾い、要約を書きます。一人は「同じ試合の札を近づけて」と言い、もう一人は「全試合を同じ一文にしないで」と言います。二人の赤入れが同じ道を戻り、全体像の札も直ります。変更禁止の印はありません。
テンソルの駅を順番に
V の文脈を先に書きます。論文の統制比較は既定 V=4。Walking Tours の公開設定は V=10 です。
| 駅 | 大域 | 各局所 | 備考 |
|---|---|---|---|
| 入力 | 16×224×224 | 16×96×96 | 同一時間窓 |
| 削減前のパッチ | 3136 | 576 | 16×14×14 と 16×6×6 |
| 95%削減後 | 157 | 29 | round(N×0.05) |
[CLS] 後 | 158 | 30 | [CLS] は残す |
| エンコーダー要約 | [B,1,d] | 合わせて [B,V,d] | 局所視点はバッチ軸へまとめて計算 |
| 投影器出力 | [B,V+1,256] | 同じテンソル | 全要約を連結後に投影 |
コードは大域埋め込みを V+1 個へブロードキャストし、全埋め込みとの差の平均二乗を取ります。大域自身との項は常にゼロです。SIGReg は [ビュー, バッチ, 256] へ並べ替え、視点ごとにサンプル集合の分布を調べます。総損失は MSE + 0.02 × SIGReg です。勾配は大域・局所から共有エンコーダーと投影器へ流れます。
学習グラフはここで終わります。学習用の目標エンコーダー、マスクされた問いを扱う予測器、勾配停止はありません。別に Polyak 重みのコピーがあり、減衰率 0.9999 で最適化の32ステップごとに更新されますが、評価用の重みとして保存するだけです。前向き計算には使わず、目標も損失も作りません。学習後に投影器を捨て、論文と公開重みの評価にはエンコーダーの EMA コピーを使います。
B=2、V=4 なら
視点要約は 2×5=10 個。投影器後は [2,5,256]。31番目の最適化ステップを終えた直後なら、次の32ステップ目の EMA 更新はまだです。EMA から損失へ向かう矢印を描いたら消します。
前向き計算の領収書
三つの検算値
- 95%削減後、大域/局所は157/29パッチ。各々へ
[CLS]を一枚足します。 - 不変性と SIGReg は
[B,V+1,256]を使い、両枝へ勾配を返します。 0.9999、32ステップごとの EMA は評価用で、学習目標エンコーダーではありません。
出口テスト
- 削減前の224大域視点にはパッチがいくつありますか。
- 大域要約を勾配停止しますか。
- EMA 複製は学習前向き計算に参加しますか。
答え
16 × 14 × 14 = 3136。- しません。両側に勾配が流れます。
- 参加しません。周期的に平均して評価チェックポイントとして保存します。