コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
動画が出す問題
- 動画だけ人のラベルなし
- 自分で出題同じ動画窓の別視点
- 要約する特徴へ変える
- あとで試験凍結して測る
一万本に字幕は付けられない
保育園の録画一万本に、先生が一コマずつ説明を書くのは無理です。代わりに同じ録画から広い画面と小さな画面を切り出し、「同じ出来事を見ていますね」と問題にします。録画そのものが組み合わせを教えるので、「水を注ぐ」「扉を開ける」という人手ラベルは要りません。
ただし、子どもが壁紙の色だけを覚え、コップがなぜ倒れたかは分からないこともあります。問題を無料で作れても、答えに物体・動作・因果が必ず入るわけではありません。
何が教師になるのか
教師信号は、パラメータをどちらへ動かすかを決める、計算可能な規則です。通常の教師あり学習では人がクラスを付けます。自己教師あり学習はデータの構造から規則を作ります。LeVJEPA は16フレーム動画窓の同一時刻から大域・局所視点を作り、「同じ動画窓由来」を正例ペアとして共有エンコーダーの [CLS] 埋め込みを比べます。クラス名、物体枠、動作ラベルはなく、別動画を負例サンプルと指定する必要もありません。
静止画と違い、動画には時間の連続があります。同じ物体が動き、手が道具に触れ、動作には順序があります。同じ時間窓を丸ごと共有すれば、その変化が両視点に共通する手掛かりになり得ます。ただし、損失は光学フロー、追跡、因果性を直接計算しません。同じ場面の要約を合わせ、SIGReg でサンプル集合の表現分布を豊かに保つだけです。何を学ぶかは、データ、切り抜き、疎なトークン、モデル容量、最適化にも左右されます。
「練習問題」と「卒業試験」も分けます。事前学習は ImageNet、Kinetics-400、Something-Something-v2 の正解クラスを見ません。後でエンコーダーを凍結し、小さな**プローブ(読み出し器)**だけを学習して、外観や運動情報を測ります。プローブの得点は、その手順に役立つ特徴があるという証拠です。人間の常識や計画の証明ではありません。
ブロック因果注意により、各フレームのトークンは現在と過去だけに依存できます。逐次処理には都合のよい構造です。しかし、受動観察だけでは「動作 A をしたら何が起こるか」は得られません。動作付きデータと動作条件付き予測器は、次の世界モデル段階で加えます。
台所で作れる正例
2秒の動画を選び、クラス名は書きません。複製し、一方は広く、もう一方は手元だけを切り抜きます。二本とも同じ16時刻を使えば、自己教師ありの正例ペアになります。二本目を別動画へ替えたら、どちらにも手が映っていても LeVJEPA の正例ではありません。
照合先
覚えるのは三つ
- 自己教師ありの答えは、人手で付けたクラスではなくデータ構造から来ます。
- LeVJEPA は同じ16フレームの多視点を使いますが、光学フローや因果性を直接の教師にはしません。
- 凍結プローブは特定課題の証拠で、万能な理解や計画の証拠ではありません。
三問
- 事前学習に動作クラスラベルは要りますか。
- 同じ動画窓の一致だけで因果性が学べると保証できますか。
- 事前学習と凍結評価を分けて述べるのはなぜですか。
答えを開く
- 要りません。
- できません。利用できる時空構造を与えるだけです。
- 前者は表現を学び、後者は固定した手順で表現中の情報を測るからです。