コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
3136枚から157枚だけ
- 全部並べる3136パッチ
- 毎回くじ引き場所を変える
- 5%を送る157パッチ
- 意味をまとめる穴埋めではない
目を閉じて一つかみ
動く漫画を机にばらし、目を閉じて少数のマスだけ拾います。今回は車輪と街灯、次は運転手と空。場所が毎回変わるので、断片から同じ話を読み取る必要があります。もし全フレームで同じ縦列だけを隠したら、その列を通る主役は一度も見えないかもしれません。
ここに無作為削減とチューブマスクの違いがあります。ただし「画素の穴埋め」という話ではありません。LeVJEPA にはマスクトークン、復号器、再構成目的がありません。
何を本当に落としているか
標本化はパッチ埋め込みの後です。各標本の完全な時空間格子に乱数を振り、小さい順に必要数を残します。[CLS] はその後に追加するので落ちません。削減は学習モードだけで働き、評価と推論は全列を読みます。
| 視点 | 削減前 | 95%削減後 | [CLS] を含む列長 |
|---|---|---|---|
| 16フレーム、224、パッチ16 | 3136 | 157 | 158 |
| 16フレーム、96、パッチ16 | 576 | 29 | 30 |
論文のアブレーション(ほかを固定して一要素だけ変える比較)では、ImageNet-1K の著者報告値が削減なしの 33.9 から95%で 47.6 へ上がります。90%と95%は47.4対47.6です。著者は、1ステップの計算を減らしつつ無作為なデータ拡張のように働き、異なる疎な観測から要約を安定させると説明します。式 1 / (1 - ρ) = 20 はフィードフォワード層の理論的削減係数です。全演算や処理全体の実行時間が必ず20分の1になる、という意味ではありません。
残す位置の選び方も効きます。一様無作為に残す方式と、全フレームで同じ空間位置を残すチューブ方式の著者報告は、ImageNet で 50.7 対 39.6 です。指定された tubelet=2 条件の SSv2 は 28.8 対 26.4 です。しかし、疎なら常に勝つわけではありません。短い学習では SSv2 が削減率0.3を超えると低下し、長く学習するとその悪化が和らぐ、と論文は述べています。動きの対応関係を保つ疎化は未解決問題です。
評価手順の但し書きもあります。第4節本文は frozen attentive probe、arXiv v1 の図4説明は linear probing、プロジェクトページは注意機構付きプローブと記しています。したがって、この一連の条件変更は同一図内の傾向として読むのが安全です。別表の絶対値と直接比べません。
4×4の落書き
round(3136×0.05)=157、round(576×0.05)=29 を計算します。4フレームに4マスずつ描き、無作為方式では別々のマス、チューブ方式では同じマスを丸で囲みます。同じ物体を全時刻で隠しやすいのはチューブ方式です。
出典
三枚の付箋
- 削減は本当にトークンを削ります。エンコーダーに入らず、再構成もしません。
- 95%では大域/局所が157/29パッチ。
[CLS]は別に足し、落としません。 - ImageNet と計算効率には著者報告の利点がありますが、短い学習の運動指標は傷みます。
くじ引きテスト
- 落とした位置をマスクトークンに置き換えますか。
- 95%削減後の大域列は
[CLS]込みで何トークンですか。 - ImageNet の傾向だけで、95%は全運動課題に最適と言えますか。
答え
- 置き換えません。Transformer に入りません。
- 158です。
- 言えません。短い学習の SSv2 は高い削減率で悪化します。