コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
同じ場面を二つの窓から
- 16フレーム同じ短い時間
- 広い窓場面全体
- 小さな窓一部だけ
- 札を比べる同じ話なら近い
キックボードが通る
一台のキックボードが角を曲がります。大きな窓からは、人も道も車体も見えます。紙筒をのぞく弟には、回る車輪だけが見えます。画素はずいぶん違っても、同じ一度の通過です。ところが弟が三秒遅れてのぞけば、もう犬しかいないかもしれません。その二つを無理に同じ要約へ寄せるのは不自然です。
LeVJEPA のビューペアを作る要点はここにあります。見る場所は違ってもよい。ただし、時間窓は変えない。「同じ動画ファイル」というだけでは粗すぎます。まったく同じ16フレームの時間窓から切り出します。
仕組みを少し正確に
**ビュー(視点)**は切り抜きや色変換を施した入力のバリエーション、エンコーダーは大量の画素を特徴へ変える機械、埋め込みは比較できる短い数値の札です。
16フレームの動画窓から V + 1 個のビューを作ります。広い大域ビュー x_0 が1つ、切り抜く範囲が狭く、見た目の変換が強い局所ビュー x_1 ... x_V が V 個です。どれも同じ16時刻を含みます。全ビューは、まったく同じパラメータを持つエンコーダー E と投影器 h を通り、[CLS] から z_v を得ます。「共有」とは、似た機械を複製することではありません。一組のパラメータを全枝が参照し、一度の更新で一緒に変わることです。
各局所要約を大域要約へ近づけます。局所画像から全景を描き直すわけでも、後半16フレームから前半を予測するわけでも、別の予測器で目標表現を当てるわけでもありません。大域ビューが基準になるのは、空間を広く覆い、局所側ほど強い光度変換を受けないからです。勾配停止した教師だからではありません。さらに全要約へ SIGReg を掛け、バッチ全体が一枚の札になるのを防ぎます。
この課題は、切り抜きや色の偶然を捨て、窓の間で共通する内容を残すよう促します。ただし、局所切り抜きが背景だけを拾えば信号は弱くなります。同じ時刻であることは必要条件ですが、どの切り抜きも同じほど有益とは限りません。
紙に描く実験
16マスの時間軸と二つの窓を描きます。窓の高さや大きさは変えてよいですが、横方向は両方とも1–16番を覆わせます。小窓を9–24番へずらしたら、そこを赤丸で囲みましょう。LeVJEPA が求める同一時間窓の組ではなくなった箇所です。
根拠をたどる
忘れない三点
- 大域・局所ビューは同一の16フレーム時間窓から取ります。
- すべてのビューがエンコーダー、投影器、
[CLS]読み出しを共有します。 - 大域要約にも勾配が流れます。凍結教師の答えではありません。
すぐ答えられる?
- 局所ビューを同じ動画の一分後から取ってもよいですか。
- 「共有エンコーダー」は何を共有しますか。
- 切り抜きで消えた画素を再構成する課題ですか。
答え合わせ
- いけません。大域ビューと同じ16フレーム窓が必要です。
- 全ビューが一組の学習可能パラメータを使います。
- 違います。投影器後の
[CLS]要約を比べます。