コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
一度に一つだけ変える
- 土台を固定データとモデル
- つまみは一つ問いも一つ
- 同じ試験凍結プローブ
- 差を記録表を混ぜない
- 範囲を守る普遍則ではない
紙飛行機の調整
紙、翼、重り、投げ方を全部替えて遠くへ飛んでも、どれが効いたか分かりません。まず紙と投げ方を固定し、つまみを一つずつ動かします。LeVJEPA 第4節も、観測をどれだけ減らすか、どう減らすか、小窓の数、何フレームで一トークンにするか、未来を見せるかを別々に尋ねます。
「既定値」は二組ある
| 名前 | データと長さ | 主な設定 | 分かること |
|---|---|---|---|
| 論文の比較実験の既定値 | ViT-B/16、K710の20%。第4節は特記なしの場合 | V=4、無作為削減。IN1K の凍結エンコーダー上の注意機構付きプローブ top-1(v1図4の説明は線形プローブと記載) | 論文内の設計比較 |
| 公式コードの実行既定 | Walking Tours、26周、約10k最適化ステップ | ViT-B/16、V=10、95%、tubelet=1、ブロック因果注意、実効バッチサイズ3072 | 公開された実行設定。240/1085周の表の再現ではない |
共通部品は多くても、リポジトリ既定値を一度走らせて「論文表を再現した」とは言えません。
五段の梯子
以下はすべて arXiv v1 の著者報告で、それぞれの条件内で読みます。
| 問い | 変えたもの | 報告値 | 言える範囲 |
|---|---|---|---|
| 少なく見るだけの近似か | 削減率0 → 95% | IN1K 33.9 → 47.6、90%は47.4 | この一連の条件では、疎にしても IN1K は下がらず上がった |
| 無作為かチューブか | 残す位置の構造 | IN1K 50.7/39.6、SSv2 28.8/26.4(後者は tubelet=2 条件) | 穴埋めをしない目的では、同じ領域を恒常的に隠す方が悪かった |
| 局所視点は何個か | V=4 → 10 → 12 | 47.6 → 50.2 → 49.8 | 10まで改善し、この範囲では飽和。局所1個は約29保持パッチ |
| 二フレームを先に束ねるか | τ=2,ρ=.90 対 τ=1,ρ=.95、トークン/評価時刻数を対応 | IN1K 47.4/50.7、SSv2 28.8/30.4 | この目的に入力段の時間集約は必須でなかった |
| 未来を見せる必要があるか | 全注意 対 ブロック因果注意 | IN1K 50.7/51.2 | 指定されたプローブでは、因果マスクによる測定可能な精度低下が見えなかった |
各行の最高値を寄せ集められる改良メニューではありません。細かな条件が行ごとに違うことがあります。運動は高い削減率に敏感で、短い学習期間の ρ>0.3 では SSv2 が低下します。統制実験が示すのは調べた近傍の出来事です。データ、規模、課題を替えた先の順序までは保証しません。
誇張を削る練習
「47.6は33.9より高いから、95%削減は全課題で最善」。誤りは二つです。数字は IN1K の同一図内の傾向にすぎません。短い学習期間の SSv2 は高い削減率で悪化します。「指定された IN1K アブレーションでは、著者報告で95%が最高だった。運動課題には条件付きの代償がある」なら、証拠の範囲に収まります。
照合先
梯子の三原則
- 論文のアブレーション既定値とリポジトリの実行既定値は、別の実験です。
- 数字には、動かしたつまみ、固定条件、データ、プローブを付けます。
- アブレーションが示すのは、調べた条件内の実験結果です。課題をまたぐ定理ではありません。
三つの確認
- 論文の統制比較は既定で何個の局所視点を使いますか。
- リポジトリの26周で論文の240周表を直接再現できますか。
- 51.2対50.7からブロック因果注意は全課題で優れると言えますか。
答え
- 特記がなければ
V=4。 - できません。データ、学習期間、目的が違います。
- 言えません。指定された IN1K 凍結プローブ条件での著者報告だけです。