JEPA4Japan · チュートリアル

第29章―入門から論文まで、10の研究プロジェクト

2,433文字 6分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

運動を保つ標本化、逐次キャッシュ、SIGReg、密な課題、データ規模の拡大、世界モデルへの接続、再現性を研究課題にします。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 現在のレッスン

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

「うまくいかなかった」を先に書く

  1. 問い一度に一つ
  2. 比較相手出発線を固定
  3. 測り方見る前に決める
  4. 失敗条件案が負ける場所
  5. 資源時間・機器・データ
よい研究計画は、自分の案が負ける試合も作ります。勝敗を見てからゴールを動かしません。

十足の靴を同時に褒めない

新しい靴を試すなら、走る道、古い靴、計時回数、遅ければ負けとする幅を先に決めます。「いろいろ走らせ、よさそうな数字を探す」だけでは、靴がよいのか偶然なのか分かりません。

以下は小さな単体試験から閉ループ制御まで並べた研究案です。LeVJEPA v1 が報告した成果ではありません。資源の目安は、S=CPU または消費者向け GPU で数時間、M=単一 GPU で1〜3日、L=4〜8 GPU で数日、XL=論文規模の統制学習またはロボット設備、とします。

1 因果マスクの単体試験集(S)

  • **問い:**時間長、解像度、無作為な保持集合が変わっても未来漏洩はないか。
  • **基準:**固定版 build_block_causal_mask と、全履歴を毎回計算する実装。
  • **指標:**過去パッチの最大絶対差、100個の無作為例の合格率。
  • **失敗条件:**未来だけを変えて過去パッチが所定の 1e-5 を超えて変わる、またはパッチが [CLS] を読める。

2 逐次 KV キャッシュ(M)

  • **問い:**過去を保存して、数値を保ったまま遅延を減らせるか。
  • **基準:**新しいフレームごとに16フレーム履歴を丸ごと再符号化する。
  • **指標:**トークン余弦類似度、最大差、初回と増分の遅延、最大記憶量。
  • **失敗条件:**許容誤差を超える、または同じ機器・長系列で速度と記憶量のどちらも改善しない。公開コードに完成品はないので、実装そのものが成果になります。

3 SIGReg の有限近似をどこまで削れるか(M)

  • **問い:**既定の1024射影、17積分点を減らしても表現を保てるか。
  • 基準:num_proj=1024、knots=17、λ=0.02。一度に一項だけ変える。
  • **指標:**1ステップの所要時間、埋め込みの平均と共分散スペクトル、別の無作為射影による検査、凍結プローブ。
  • **失敗条件:**計算削減が10%未満、またはプローブの成績やスペクトルが事前の許容幅を外れる。有限射影で損失が小さくても、同時分布が完全な正規分布だとは証明できません。

4 運動を残す95%トークン削減(L)

  • **問い:**時刻をまたぐ対応点や光学フローを用いた保持で、細かな運動を守れるか。
  • **基準:**95%一様無作為削減と、削減なしの上限。総 FLOPs をそろえる。
  • **指標:**SSv2、K400、ImageNet の凍結プローブ、総 FLOPs、毎秒の動画窓数。
  • **失敗条件:**複数乱数種で SSv2 が改善しない、計算増だけで伸びる、または ImageNet が事前の幅を超えて悪化する。

5 同じ時間窓である必要はどれほど強いか(M)

  • **問い:**局所視点を1、2、4フレームずらすと運動に強くなるか、正例の意味が壊れるか。
  • **基準:**大域・局所が完全に同じ16時刻を使う公式条件。
  • **指標:**不変性、SIGReg、順序識別、SSv2、静止画 ImageNet のプローブ評価。
  • **失敗条件:**時間課題が伸びない、表現が潰れる、または外観能力が事前の幅を超えて落ちる。時間をずらした実験を公式 LeVJEPA の目的とは呼びません。

6 [CLS] だけで育ったパッチは何を知るか(M)

  • **問い:**密な教師なしで育ったパッチが、分割や追跡に使えるか。
  • **基準:**公開エンコーダーを凍結し、無作為初期化の同型モデル、色、単純な運動特徴と比べる。
  • **指標:**線形分割 mIoU、DAVIS J&F、点追跡誤差、問い–パッチの可視化。
  • **失敗条件:**定量値が単純な基準を上回らない、または選んだきれいな例でしか効かない。v1 は密な課題の定量評価を将来課題にしています。

7 長さと多様性のどちらが効くか(L)

  • **問い:**標本数と FLOPs を固定したとき、多数の短い動画は少数の長い散歩動画よりよいか。
  • **基準:**Walking Tours のみ。比較側も同数の動画窓で、出所の比率をそろえる。
  • **指標:**IN1K、SSv2、K400 の凍結プローブ、領域横断検索、重複率、学習処理量。
  • **失敗条件:**厳密な重複除去や計算量一致の後に混合データの差が消える。許諾と抽出比率も記録します。

8 小さな専門領域で追加学習する価値(M)

  • **問い:**医療、工場、スポーツ視点の動画で追加事前学習すると、凍結転移よりよくなるか。
  • **基準:**公開 ViT-L の凍結プローブと、無作為初期化からの学習。
  • **指標:**領域固有のプローブ、一般プローブの成績保持率、埋め込みスペクトル、GPU 時間。
  • **失敗条件:**領域内の差が乱数種のばらつきを超えない、または一般能力が大きく忘却される。機微データでは実験前に管理審査が必要です。

9 動作を本当に使う潜在力学(L)

  • **問い:**凍結 LeVJEPA の上に置いた小予測器は、動画の惰性を写すだけでなく動作を使うか。
  • **基準:**現在状態をそのままコピーする方式、動作を入力しない方式、動作を乱す方式。すべて同じ軌跡で学習する。
  • **指標:**1段・多段潜在誤差、反事実動作の識別性、校正誤差。
  • **失敗条件:**真の動作モデルが動作なし・乱し基準に勝てない、または予測距離を伸ばすとすぐ発散する。これは新しい動作予測器を加える研究です。

10 表現から閉ループ MPC までの事前登録(XL)

  • **問い:**LeVJEPA 表現は、固定した模擬課題で標本効率や計画成功率を上げるか。
  • **基準:**同じ予測器、データ、CEM の候補数、計画長で、無作為エンコーダー、単純複写力学、別の公開視覚エンコーダーと比べる。
  • **指標:**50回以上の試行による成功率と信頼区間、衝突・制約違反、1動作の計画秒数、GPU 時間、5乱数種。
  • **失敗条件:**成功率区間が最強基準を上回らない、探索がエンコーダー交換に反応しない、または計画計算を大幅に増やしただけで伸びる。安全審査後にだけ実機へ進みます。

固定リポジトリの paper.md にある Push-T 表は TODO のままです。第9・10案は独自の手順と結果を一から作る必要があり、空欄へ想像の数字を入れてはいけません。どの案でも、コードの固定点、解決済み Hydra 設定、データ一覧、乱数種、機器、全ログ、失敗した実行まで保存します。

課題カードの出典

研究机に貼る三文

  1. 問い、最小基準、指標、失敗条件、資源を一組で書きます。
  2. 周回数、標本数、FLOPs のどれをそろえたかで、答えられる問いが変わります。
  3. 世界モデルと Push-T は未検証の拡張案で、LeVJEPA v1 の計画結果ではありません。

計画書の点検

  1. 失敗条件を結果を見る前に書くのはなぜですか。
  2. 運動を意識した保持法がトークンを多く使ったら、95%無作為削減と精度だけを比べられますか。
  3. 上流の Push-T 空欄を比較基準の数値にできますか。
点検結果
  1. 結果を見てから成功の定義を動かさず、負の結果にも意味を残すためです。
  2. 比べられません。総 FLOPs をそろえるか、精度と計算量の曲線を併記します。
  3. できません。TODO であり、結果も完全な手順もありません。