コース
LeVJEPA:動画を先生にする
Yann LeCun の JEPA 構想から出発し、共有エンコーダー、SIGReg、ランダムなトークン削減、ブロック因果注意を、図と小さな実験で学ぶ。
- モジュール
- 7 モジュール
- レッスン
- 34 レッスン
- 目安
- 目安 18時間
- 対象
- 対象: 自己教師あり動画学習が初めての人と、論文・実装・学習条件・主張の根拠まで確かめたいエンジニアや研究者。
まずは一枚絵
- 同じ動画大きな窓と小さな窓
- 同じ機械短い要約にする
- 近づける同じ場面は似る
- 広げる全部を一点にしない
- 少しだけ見るトークンを95%落とす
- 時を守る未来はのぞかない
道ばたの演奏を、子どもが二つの窓から見ています。広い窓には楽団全体が映り、細い筒からはドラマーの手だけが見えます。それでも「同じ演奏だ」と分かってほしいところです。だからといって、どの動画にも「何かが動く」とだけ書けば、要約札は役に立ちません。
LeVJEPA は、同じ動画から作った大域・局所視点の要約を不変性損失で近づけます。一方、SIGRegが、全要約が一点へ潰れるのを防ぎます。学習時には動画トークンの95%を無作為に捨て、各フレームは現在と過去しか読めません。計算グラフは短いものです。しかし、短いことと雑なことは違います。この講座では、短い線の一本一本まで確かめます。
どこから読むか
- **まず話が分かればよい:**第0–8、13–14、19–20、27章を読めば、直感と証拠の境界を一周できます。
- **手を動かしたい:**さらに第9–15、21–26章へ進み、付録BとDを脇に置いて照合します。
- **研究につなげたい:**全章を読み、第16–20章の比較作法を第28–29章へ持ち込みます。
この講座の四つの約束
- **名前をごまかしません。**LeVJEPA は2026年の動画表現法であり、LeJEPA、V-JEPA 2、LeWorldModel とは別物です。
- **計算グラフをごまかしません。**目的関数に目標エンコーダー、予測器、勾配停止はありません。公式実装の Polyak/EMA 重みは評価用チェックポイントであり、教師枝ではありません。
- 数字から条件を切り離しません。「速い」「高精度」には、データ集合、モデル規模、周回数または FLOP 予算、プローブの評価手順を添えます。
- **将来像を実験結果にしません。**因果的な動画エンコーダーは逐次知覚や世界モデルの土台になり得ます。しかし、LeVJEPA 自体には行動条件付き予測器、費用、計画器がありません。
証拠の締切
本シリーズが確認した情報は **2026-09-05(Asia/Tokyo)**までです。中心となる一次資料は LeVJEPA arXiv v1、公式プロジェクトページ、固定した公式リポジトリ 3ea0dda、固定版モデルカード e831a03 です。論文は2026-08-27公開の予稿です。本シリーズの数値は著者報告として扱います。コードと重みが公開されていても、第三者による再現の代わりにはなりません。
コース進捗
コース目次
第0部―まず地図を広げる
名前と守備範囲、研究史の中の位置を押さえ、自分に合う読み方を選びます。
- 01 第0章―始める前に:この講座でできるようになること 論文の版、証拠の締切、三つの読書コース、最後に説明・実行・批判できる範囲を確認します。 公開中
- 02 第1章―同じ動画を、二つの窓から見る 街角を見る子どもの話から、大域視点、局所視点、同一時間窓、共有表現の感覚をつかみます。 公開中
- 03 第2章―Yann LeCun の研究路線をたどる エネルギーベース学習から2022年の AMI 構想、JEPA、I-JEPA、V-JEPA、LeJEPA、LeVJEPA へ進みます。 公開中
- 04 第3章―名前に迷わないための JEPA 家系図 JEPA、I-JEPA、V-JEPA、V-JEPA 2、LeJEPA、LeVJEPA、LeWorldModel の計算グラフと役割を見分けます。 公開中
第1部―簡単な目的で、なぜ動画が分かるのか
ラベルなし学習、表現の照合、表現崩壊を順に見て、二つの損失が引っ張り合う理由を学びます。
- 05 第4章―動画は自分で問題を作れる 同じ物体、動き、時間の連続性がどう教師になるか、逆に何を保証しないかを学びます。 公開中
- 06 第5章―全ピクセルではなく、意味を残す 画素再構成、特徴予測、視点不変性を比べ、LeVJEPA が何を予測し、何を予測しないかを整理します。 公開中
- 07 第6章―二枚は同じに。でも全部を白紙にはしない 不変性が役立つ理由と、定数出力や次元崩壊を許してしまう理由を理解します。 公開中
- 08 第7章―SIGReg:点の雲を影から調べる 無作為な一次元射影、特性関数、ガウス参照から、LeJEPA 由来の崩壊防止機構をつかみます。 公開中
- 09 第8章―一行の目的関数で LeVJEPA を読む 不変性損失と SIGReg、唯一の重み λ=0.02、双方向の勾配、理論の適用範囲を分解します。 公開中
第2部―一本の動画を一台のエンコーダーへ
実際のテンソルを追い、多視点、トークン、ViT、投影ヘッド、疎な観測、因果注意を結びます。
- 10 第9章―大域ビューと局所ビューの作り方 224画素の大域視点と複数の96画素局所視点を、同じ16フレーム時間窓から作ります。 公開中
- 11 第10章―動画を時空間の小片に切る 16フレームが16×16パッチ、フレームごとのチューブレット、位置表現を経るときの個数と形を追います。 公開中
- 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 共有 ViT、[CLS]、二層投影器の役割と、LayerNorm が投影空間を必要にする理由を学びます。 公開中
- 13 第12章―一回の前向き計算を端から端まで バッチ、多視点、連結埋め込み、二つの損失、勾配、学習後に捨てる部品を一巡します。 公開中
- 14 第13章―95%捨てると、なぜかよく見える 無作為トークン削減と構造化チューブマスクを分け、計算節約、拡張効果、動きの手掛かりの損失を考えます。 公開中
- 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない フレーム内双方向、フレーム間因果、[CLS] の例外、未来漏洩のない接続を読みます。 公開中
- 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 三次元回転位置表現、チューブレット幅1、[CLS] だけを教師にしてもパッチ特徴を調べる価値がある理由を学びます。 公開中
第3部―実験を読めてこそ、論文を読んだと言える
アブレーション、計算予算、公平な比較、評価用プローブ、著者報告を分け、一つの派手な数字に振り回されない読み方を学びます。
- 17 第16章―五段のアブレーションが答えること 削減率、無作為方式とチューブ方式、局所視点数、チューブレット、注意の接続構造を一項ずつ比べます。 公開中
- 18 第17章―同じ周回数は、同じ費用ではない 周回数一致と FLOPs 一致を分け、効率のよい方法が同じ予算で多く学べる理由を考えます。 公開中
- 19 第18章―ImageNet、K400、SSv2 は何を試すか 見た目、動作、運動のベンチマークと、凍結エンコーダー、線形プローブ、注意機構付きプローブの証拠範囲を学びます。 公開中
- 20 第19章―論文の結果を帳簿にする 5.6–20.8×、61.0、40.4、44.6、69.5、55.0 が、どのモデル・データ・予算を指すか照合します。 公開中
- 21 第20章―まだ言ってはいけない結論 査読前の予稿、著者報告、未追試、限られた規模、運動の弱点、密な課題の空白、理論近似を明記します。 公開中
第4部―公式リポジトリから自分の実験へ
公開重みで入口を確かめ、使える資源に合わせてデータ、学習、診断、独自評価へ進みます。
- 22 第21章―公式リポジトリの見取り図 main.py、module.py、data/loader.py、Hydra 設定、二つのノートブック、ライセンス、固定コミットを探します。 公開中
- 23 第22章―Walking Tours:10本の長編を学習データにするまで 取得、15 fpsでの抽出、Lanceへの保存、エピソード境界、無作為な動画窓、データ費用を追います。 公開中
- 24 第23章―既定設定を読み、学習を始める 論文の比較条件と公開コードの既定値を区別し、実効バッチサイズ、学習率を徐々に上げる区間、EMA チェックポイント、設定の上書きを読み解きます。 公開中
- 25 第24章―うそをつかない小さな動作確認から始める 小さなバッチへの過学習、視点の整合、SIGReg 統計、因果漏洩、記憶使用量を検査し、よくある故障を切り分けます。 公開中
- 26 第25章―学習なしで公開重みから特徴を出す Hugging Face 重み、正しい正規化とテンソル配置を使い、注意モードや出力の取り違えを防ぎます。 公開中
- 27 第26章―自分の動画を凍結評価する 線形プローブ、注意機構付きプローブ、検索、密な特徴の検査を作り、データ漏洩を防ぐ分割を用います。 公開中
第5部―表現を世界モデル構想へ戻す
LeCun の長期構想に置き直し、完成したエンコーダーと、これから必要な予測・行動・計画を分けます。
付録―必要なときに開く技術リュック
数式、形、用語、歴史、再現の証拠を、本編の隣にまとめます。