JEPA4Japan · チュートリアル

第4章―動画は自分で問題を作れる

1,370文字 3分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

同じ物体、動き、時間の連続性がどう教師になるか、逆に何を保証しないかを学びます。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 現在のレッスン
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

動画が出す問題

  1. 動画だけ人のラベルなし
  2. 自分で出題同じ動画窓の別視点
  3. 要約する特徴へ変える
  4. あとで試験凍結して測る
自己教師ありとは、問題をデータから作ることです。何でも自然に身に付く、という意味ではありません。

一万本に字幕は付けられない

保育園の録画一万本に、先生が一コマずつ説明を書くのは無理です。代わりに同じ録画から広い画面と小さな画面を切り出し、「同じ出来事を見ていますね」と問題にします。録画そのものが組み合わせを教えるので、「水を注ぐ」「扉を開ける」という人手ラベルは要りません。

ただし、子どもが壁紙の色だけを覚え、コップがなぜ倒れたかは分からないこともあります。問題を無料で作れても、答えに物体・動作・因果が必ず入るわけではありません。

何が教師になるのか

教師信号は、パラメータをどちらへ動かすかを決める、計算可能な規則です。通常の教師あり学習では人がクラスを付けます。自己教師あり学習はデータの構造から規則を作ります。LeVJEPA は16フレーム動画窓の同一時刻から大域・局所視点を作り、「同じ動画窓由来」を正例ペアとして共有エンコーダーの [CLS] 埋め込みを比べます。クラス名、物体枠、動作ラベルはなく、別動画を負例サンプルと指定する必要もありません。

静止画と違い、動画には時間の連続があります。同じ物体が動き、手が道具に触れ、動作には順序があります。同じ時間窓を丸ごと共有すれば、その変化が両視点に共通する手掛かりになり得ます。ただし、損失は光学フロー、追跡、因果性を直接計算しません。同じ場面の要約を合わせ、SIGReg でサンプル集合の表現分布を豊かに保つだけです。何を学ぶかは、データ、切り抜き、疎なトークン、モデル容量、最適化にも左右されます。

「練習問題」と「卒業試験」も分けます。事前学習は ImageNet、Kinetics-400、Something-Something-v2 の正解クラスを見ません。後でエンコーダーを凍結し、小さな**プローブ(読み出し器)**だけを学習して、外観や運動情報を測ります。プローブの得点は、その手順に役立つ特徴があるという証拠です。人間の常識や計画の証明ではありません。

ブロック因果注意により、各フレームのトークンは現在と過去だけに依存できます。逐次処理には都合のよい構造です。しかし、受動観察だけでは「動作 A をしたら何が起こるか」は得られません。動作付きデータと動作条件付き予測器は、次の世界モデル段階で加えます。

台所で作れる正例

2秒の動画を選び、クラス名は書きません。複製し、一方は広く、もう一方は手元だけを切り抜きます。二本とも同じ16時刻を使えば、自己教師ありの正例ペアになります。二本目を別動画へ替えたら、どちらにも手が映っていても LeVJEPA の正例ではありません。

照合先

覚えるのは三つ

  1. 自己教師ありの答えは、人手で付けたクラスではなくデータ構造から来ます。
  2. LeVJEPA は同じ16フレームの多視点を使いますが、光学フローや因果性を直接の教師にはしません。
  3. 凍結プローブは特定課題の証拠で、万能な理解や計画の証拠ではありません。

三問

  1. 事前学習に動作クラスラベルは要りますか。
  2. 同じ動画窓の一致だけで因果性が学べると保証できますか。
  3. 事前学習と凍結評価を分けて述べるのはなぜですか。
答えを開く
  1. 要りません。
  2. できません。利用できる時空構造を与えるだけです。
  3. 前者は表現を学び、後者は固定した手順で表現中の情報を測るからです。