コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
「うまくいかなかった」を先に書く
- 問い一度に一つ
- 比較相手出発線を固定
- 測り方見る前に決める
- 失敗条件案が負ける場所
- 資源時間・機器・データ
十足の靴を同時に褒めない
新しい靴を試すなら、走る道、古い靴、計時回数、遅ければ負けとする幅を先に決めます。「いろいろ走らせ、よさそうな数字を探す」だけでは、靴がよいのか偶然なのか分かりません。
以下は小さな単体試験から閉ループ制御まで並べた研究案です。LeVJEPA v1 が報告した成果ではありません。資源の目安は、S=CPU または消費者向け GPU で数時間、M=単一 GPU で1〜3日、L=4〜8 GPU で数日、XL=論文規模の統制学習またはロボット設備、とします。
1 因果マスクの単体試験集(S)
- **問い:**時間長、解像度、無作為な保持集合が変わっても未来漏洩はないか。
- **基準:**固定版
build_block_causal_maskと、全履歴を毎回計算する実装。 - **指標:**過去パッチの最大絶対差、100個の無作為例の合格率。
- **失敗条件:**未来だけを変えて過去パッチが所定の
1e-5を超えて変わる、またはパッチが[CLS]を読める。
2 逐次 KV キャッシュ(M)
- **問い:**過去を保存して、数値を保ったまま遅延を減らせるか。
- **基準:**新しいフレームごとに16フレーム履歴を丸ごと再符号化する。
- **指標:**トークン余弦類似度、最大差、初回と増分の遅延、最大記憶量。
- **失敗条件:**許容誤差を超える、または同じ機器・長系列で速度と記憶量のどちらも改善しない。公開コードに完成品はないので、実装そのものが成果になります。
3 SIGReg の有限近似をどこまで削れるか(M)
- **問い:**既定の1024射影、17積分点を減らしても表現を保てるか。
- 基準:
num_proj=1024、knots=17、λ=0.02。一度に一項だけ変える。 - **指標:**1ステップの所要時間、埋め込みの平均と共分散スペクトル、別の無作為射影による検査、凍結プローブ。
- **失敗条件:**計算削減が10%未満、またはプローブの成績やスペクトルが事前の許容幅を外れる。有限射影で損失が小さくても、同時分布が完全な正規分布だとは証明できません。
4 運動を残す95%トークン削減(L)
- **問い:**時刻をまたぐ対応点や光学フローを用いた保持で、細かな運動を守れるか。
- **基準:**95%一様無作為削減と、削減なしの上限。総 FLOPs をそろえる。
- **指標:**SSv2、K400、ImageNet の凍結プローブ、総 FLOPs、毎秒の動画窓数。
- **失敗条件:**複数乱数種で SSv2 が改善しない、計算増だけで伸びる、または ImageNet が事前の幅を超えて悪化する。
5 同じ時間窓である必要はどれほど強いか(M)
- **問い:**局所視点を1、2、4フレームずらすと運動に強くなるか、正例の意味が壊れるか。
- **基準:**大域・局所が完全に同じ16時刻を使う公式条件。
- **指標:**不変性、SIGReg、順序識別、SSv2、静止画 ImageNet のプローブ評価。
- **失敗条件:**時間課題が伸びない、表現が潰れる、または外観能力が事前の幅を超えて落ちる。時間をずらした実験を公式 LeVJEPA の目的とは呼びません。
6 [CLS] だけで育ったパッチは何を知るか(M)
- **問い:**密な教師なしで育ったパッチが、分割や追跡に使えるか。
- **基準:**公開エンコーダーを凍結し、無作為初期化の同型モデル、色、単純な運動特徴と比べる。
- **指標:**線形分割 mIoU、DAVIS J&F、点追跡誤差、問い–パッチの可視化。
- **失敗条件:**定量値が単純な基準を上回らない、または選んだきれいな例でしか効かない。v1 は密な課題の定量評価を将来課題にしています。
7 長さと多様性のどちらが効くか(L)
- **問い:**標本数と FLOPs を固定したとき、多数の短い動画は少数の長い散歩動画よりよいか。
- **基準:**Walking Tours のみ。比較側も同数の動画窓で、出所の比率をそろえる。
- **指標:**IN1K、SSv2、K400 の凍結プローブ、領域横断検索、重複率、学習処理量。
- **失敗条件:**厳密な重複除去や計算量一致の後に混合データの差が消える。許諾と抽出比率も記録します。
8 小さな専門領域で追加学習する価値(M)
- **問い:**医療、工場、スポーツ視点の動画で追加事前学習すると、凍結転移よりよくなるか。
- **基準:**公開 ViT-L の凍結プローブと、無作為初期化からの学習。
- **指標:**領域固有のプローブ、一般プローブの成績保持率、埋め込みスペクトル、GPU 時間。
- **失敗条件:**領域内の差が乱数種のばらつきを超えない、または一般能力が大きく忘却される。機微データでは実験前に管理審査が必要です。
9 動作を本当に使う潜在力学(L)
- **問い:**凍結 LeVJEPA の上に置いた小予測器は、動画の惰性を写すだけでなく動作を使うか。
- **基準:**現在状態をそのままコピーする方式、動作を入力しない方式、動作を乱す方式。すべて同じ軌跡で学習する。
- **指標:**1段・多段潜在誤差、反事実動作の識別性、校正誤差。
- **失敗条件:**真の動作モデルが動作なし・乱し基準に勝てない、または予測距離を伸ばすとすぐ発散する。これは新しい動作予測器を加える研究です。
10 表現から閉ループ MPC までの事前登録(XL)
- **問い:**LeVJEPA 表現は、固定した模擬課題で標本効率や計画成功率を上げるか。
- **基準:**同じ予測器、データ、CEM の候補数、計画長で、無作為エンコーダー、単純複写力学、別の公開視覚エンコーダーと比べる。
- **指標:**50回以上の試行による成功率と信頼区間、衝突・制約違反、1動作の計画秒数、GPU 時間、5乱数種。
- **失敗条件:**成功率区間が最強基準を上回らない、探索がエンコーダー交換に反応しない、または計画計算を大幅に増やしただけで伸びる。安全審査後にだけ実機へ進みます。
固定リポジトリの paper.md にある Push-T 表は TODO のままです。第9・10案は独自の手順と結果を一から作る必要があり、空欄へ想像の数字を入れてはいけません。どの案でも、コードの固定点、解決済み Hydra 設定、データ一覧、乱数種、機器、全ログ、失敗した実行まで保存します。
課題カードの出典
- LeVJEPA v1:アブレーション、統制比較、未解決点
- 公式プロジェクトページと固定実装
3ea0dda - LeJEPA / SIGReg
- V-JEPA 2 / 2-ACとLeWorldModel v3
研究机に貼る三文
- 問い、最小基準、指標、失敗条件、資源を一組で書きます。
- 周回数、標本数、FLOPs のどれをそろえたかで、答えられる問いが変わります。
- 世界モデルと Push-T は未検証の拡張案で、LeVJEPA v1 の計画結果ではありません。
計画書の点検
- 失敗条件を結果を見る前に書くのはなぜですか。
- 運動を意識した保持法がトークンを多く使ったら、95%無作為削減と精度だけを比べられますか。
- 上流の Push-T 空欄を比較基準の数値にできますか。
点検結果
- 結果を見てから成功の定義を動かさず、負の結果にも意味を残すためです。
- 比べられません。総 FLOPs をそろえるか、精度と計算量の曲線を併記します。
- できません。
TODOであり、結果も完全な手順もありません。