コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
まず全体像を見よう
- 同じ場面大窓と小窓
- 一台で要約エンコーダーを共有
- 同じなら近く意味をそろえる
- 全員は離す同じ答えは禁止
名前のない動画アルバム
みちるの手元には、題名のない短い動画が山ほどあります。先生は「猫」「自動車」と答えを教えません。同じ動画を広い窓といくつかの小窓から見せ、短い要約札を書かせます。同じ動画の札は近くてかまいません。けれど、全部に「何かがある」と書けば、正解らしく見えても何の役にも立ちません。
LeVJEPA が解くのは、この綱引きです。**同じ場面は同じだと気づく。でも、別の場面まで同じ答えにしない。**前半を不変性損失、後半を SIGReg が受け持ちます。聞き慣れない言葉は、これから一つずつ見ていきましょう。
最初に荷物検査
基準にするのは LeVJEPA arXiv v1 です。公開日は 2026-08-27で、本稿の基準日(2026-09-05)時点でも査読前のプレプリントです。学習では、一つの16フレーム動画窓から1つの大域ビューと複数の局所ビューを作ります。時間窓は同じで、空間的な切り抜きと見た目のデータ拡張だけが異なります。全ビューを同じ学習可能なエンコーダーと小さな投影器に通し、それぞれの [CLS] 要約トークンから損失を計算します。
最初から外してはいけない境界が三つあります。
- 目的関数に目標エンコーダー、予測器、勾配停止はありません。大域枝にも局所枝にも勾配が流れます。
- 公式の学習コードはエンコーダーの Polyak/EMA コピーを更新し、評価用チェックポイントとして保存します。ただし、目標を作る教師ネットワークではありません。
- 出来上がるのは動画エンコーダーです。行動条件付き力学、費用、探索は持たず、計画器ではありません。「世界モデルの土台にできる」は将来の使い道であって、完成済みの機能ではありません。
「目的の重みが一つ」とは、総損失の係数 λ = 0.02 が一つという意味です。データ、最適化器、モデル構造まで設定不要になるわけではありません。本編では、直感から式、テンソル、コード、実験へと少しずつ進みます。結果はすべて「著者報告」として扱い、公開コードや重みを独立再現と取り違えません。
30秒仕分け
共有エンコーダー、SIGReg、評価用 EMA コピー、行動計画器 の四枚を「学習目標の中」と「外」に分けてみましょう。中に入るのは最初の二枚です。EMA は評価専用で、計画器は LeVJEPA の部品ではありません。
確認に使った一次資料
ポケットに入れる三文
- LeVJEPA v1 は2026-08-27公開の動画表現事前学習法です。
- 共有エンコーダー、共有投影器、
[CLS]を使い、目的内に教師・予測器・勾配停止はありません。 - 評価用 EMA は EMA 教師ではありません。エンコーダーも計画器ではありません。
小テスト
- 二つの「引っ張る力」は何ですか。
- EMA コピーは学習枝の目標を作りますか。
- エンコーダーだけでロボットに計画させられますか。
答えを見る
- 同一場面のビューを近づける不変性損失と、崩壊を防ぐ SIGReg です。
- 作りません。評価用チェックポイントにだけ使います。
- できません。行動条件付き予測、目標または費用、探索、閉ループ制御が必要です。