コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
三枚のスタンプ
- 時・縦・横3D RoPE
- 一枚ずつtubelet = 1
- 採点は要約`[CLS]` のみ
- パッチも整う定性的な観察
パズル片に住所印
動画の各パッチに「何フレーム目、上から何段、左から何列」と三つの印を押します。二つを比べると相対方向が分かります。隣の二ページを先に貼り合わせれば時間は粗くなりますが、LeVJEPA の既定は貼りません。面白いことに、先生が本全体の要約だけを採点しても、小片は狐、ソファ、背景ごとに色分けされるような構造を見せます。
最後は可視化での観察です。「領域分割の試験に合格した」ではありません。
混ぜない三項目
**1. 分解型三次元 RoPE。**各注意ヘッドの次元を時間、垂直、水平の三群に分け、それぞれの座標で回転させます。論文付録によれば絶対位置埋め込みは使いません。224と96の異なる格子を同じエンコーダーへ入れても、固定位置表を補間せずに済みます。
**2. tubelet=1。**空間パッチは16×16、時間幅は一フレームです。16フレームの224視点は 16 × 14 × 14 = 3136 パッチ、96視点は 16 × 6 × 6 = 576 パッチ。tubelet=2 は入力で二フレームを一時間区画にまとめます。論文は同じ学習トークン予算と、8個の評価時間区画で次を比較しています。
| 時間方向のパッチ化 | 削減 | IN1K | SSv2 |
|---|---|---|---|
tubelet=2 | 90% | 47.4 | 28.8 |
tubelet=1 | 95% | 50.7 | 30.4 |
数値は、凍結エンコーダー上の注意機構付きプローブによる著者報告の top-1 です。この手順では入力側で2フレームをまとめる必要がなかった、と読めます。tubelet=1 が常に最善とは言えません。
3. 密特徴。学習損失が直接触るのは [CLS] だけで、パッチ補助損失はありません。論文とプロジェクトページはパッチ PCA と、クエリパッチから他のパッチへの余弦類似度を示します。同じ物体領域がまとまり、動画中でも対応して見えます。価値ある定性的証拠です。しかし、領域分割や追跡など本当の密予測課題は未評価だと著者も明記しています。きれいなヒートマップを課題成績に言い換えてはいけません。
三つを手で確かめる
16フレームで tubelet=1 と2の時間区画数は16と8。トークン (t=5,y=3,x=9) なら、三次元 RoPE の三群は順に5、3、9を読みます。そして「PCA が物体を分ける」を、「公開された数例の可視化には意味的なまとまりが見える。領域分割や追跡に十分かは不明」と書き直します。
証拠
- LeVJEPA v1:構造、三次元 RoPE、フレーム単位トークン
- LeVJEPA v1:tubelet 統制比較
- LeVJEPA v1:創発したトークン構造と限界
- 固定版モデルカード:
[CLS]と3136パッチの完全出力
三つの境界
- 三次元 RoPE は時間・垂直・水平の相対位置を分けて符号化し、絶対位置表は使いません。
- 既定
tubelet=1では一トークンは一フレーム。224視点は3136パッチです。 - パッチのまとまりは定性的な創発現象で、領域分割や追跡の結果ではありません。
どこまで言える?
tubelet=1は隣接二フレームを入力で結合しますか。- 三次元 RoPE はどう「いつ・どこ」を分けますか。
- 鮮明なパッチ PCA は領域分割精度の検証ですか。
答え
- 結合しません。一トークンは一フレーム幅です。
- 注意ヘッドの次元を時間・垂直・水平へ分け、各座標で回転させます。
- 違います。定性的可視化で、領域分割と追跡は未評価です。