コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
一行に二つの約束
- 共有するエンコーダー + 投影器
- 同じを寄せる不変性
- 全体を広げるSIGReg
- 0.02重みは一つ
二項目の通信簿
一項目目は対応する組ごとに見ます。同じ録画の大札と小札が似ているかを調べます。二項目目はサンプル集団を見ます。札が一つの答えに山積みになっていないかを調べます。二項目目の音量を 0.02 にして足します。裏で模範解答を配る先生はいません。両側が同じ総点を見て直ります。
式をゆっくり読む
一回の前向き計算を最短で書くと、次のようになります。
z_v = projector(shared_encoder(view_v)[CLS])
L_total = L_inv + 0.02 * L_SIGReg
view_0 は大域、view_1 ... view_V は同一16フレーム時間窓の局所ビューです。論文の不変性項は次の形です。
L_inv = (1 / (V + 1)) * sum_{v=0..V} ||z_0 - z_v||²
v = 0 の項はゼロです。実質的には、各局所埋め込みを大域埋め込みへ寄せます。二乗距離の両端が計算グラフにつながり、同じエンコーダー/投影器パラメータを両方から更新します。
L_SIGReg は各視点の埋め込みを無作為射影し、標準正規分布と異なる影を罰します。目的関数で唯一のバランス用ハイパーパラメータが λ = 0.02 です。論文は全学習でこの既定値を使い、実験ごとの調整はしていないと述べています。「唯一」とは、二つの損失間の重みについてだけです。学習率、バッチサイズ、切り抜き数、トークン削減率、モデル規模は別に設定します。
図に入るのは、共有 Vision Transformer エンコーダー、小さな共有投影器、各視点の [CLS] 読み出しです。エンコーダー最終 LayerNorm がもたらす球面制約から離れた空間を SIGReg に与えるため、投影器があります。事前学習後は投影器を捨て、下流ではエンコーダー表現を使います。
図に入らないものも重要です。目標エンコーダー、予測器、勾配停止、マスクトークン再構成はありません。公式コードは更新後に Polyak/EMA エンコーダーを保ち、state_dict_ema を評価用に保存しますが、z_v も損失も作りません。目的の枠外へ描きます。
そして式には、動作 a_t、未来状態予測、報酬、コスト、探索がありません。この短い式から計画器を読み出してはいけません。
暗算してみる
L_inv = 0.30、L_SIGReg = 5.0 なら、L_total = 0.30 + 0.02 × 5.0 = 0.40 です。0.02 × L_inv + L_SIGReg と計算したなら、つまみを逆側に付けています。
根拠
最後に三行
- 総目的は
L_inv + 0.02 × L_SIGRegです。 - 大域・局所枝はエンコーダー/投影器を共有し、両端に勾配が流れます。
- EMA は評価チェックポイント用です。目的に教師、予測器、勾配停止、計画器はありません。
式の小テスト
λ = 0.02はどの項に掛かりますか。- 投影器は下流でも残しますか。
- EMA ファイルがあるのに「EMA 教師なし」と言えるのはなぜですか。
解答
- SIGReg 項です。
- 捨てます。下流にはエンコーダーを使います。
- EMA は目標を生成せず損失にも入らず、評価用に保存されるだけだからです。