コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
数式を小さな道具箱へほどく
- ベクトル数字の住所札
- 距離二枚の札の隔たり
- 射影一方向の影
- 正規分布偏らない雲
- 勾配直す向きを示す
動画へ数字の住所を付ける
一つの動画に256個の数字からなる住所札を付けるとします。同じ場面を大小の窓から見た札は近くしたい。一方、すべての動画を同じ住所へ集めたくはありません。前者は距離、後者はたくさんの方向から見た集団の形で測れます。
式に出会ったら、まず三点を尋ねます。入力は誰か。どの軸で平均するか。1サンプルを縛るのか、サンプル集合を縛るのか。
1 ベクトル、長さ、平均二乗誤差
埋め込み z=[z1,z2,...,zK] は K 次元ベクトルです。公開されている設定では、投影空間は K=256。二つのベクトルの二乗ユークリッド距離は、各座標の差を二乗して足したものです。
||a - b||² = Σ_k (a_k - b_k)²
実装の .pow(2).mean() は、視点、サンプル、座標にわたって平均します。そのため、1サンプルで和を取る上式と数値の尺度は違います。不変性項は次のように読めます。
L_inv = 同じ動画の大域要約と各視点要約の差²を、全軸で平均
この項だけなら、どの入力にも同じ定数を書くと誤差ゼロです。だから集団の形を調べる SIGReg が要ります。
2 標本集合を見る
不変性項は対応する標本同士を比べます。SIGReg は標本集合の分布を調べます。標本数 B、各動画の視点数 V+1、投影次元 K なら、SIGReg が論理的に受け取る形は [V+1,B,K] です。各視点位置ごとに、異なる B 本の動画を一つの集合として見ます。
分散学習では、各計算ノードが求めた経験特性関数を全体集約し、全標本の統計にします。標本数が少ないと集合の形が揺れます。射影方向を増やしても、標本数そのものは増えません。
3 標準・等方・正規とは
一変量の標準正規分布は N(0,1)、K 次元の等方標準正規分布は N(0,I_K) と書きます。中心は0、どの方向も同じ尺度で、特別扱いされる方向がありません。
これは球面上へ一様に点を置くことではありません。正規分布の密度は原点付近で高く、高次元で典型的な半径はおよそ sqrt(K) です。また、各座標の平均と分散が正しく見えても、座標同士が曲線やX字に依存する同時分布は隠せます。
LeJEPA の正規性に関する最適性は、論文が置く下流損失などの仮定の下での主張です。「現実世界の表現は必ず正規分布になる」という自然法則ではありません。
4 ランダム射影と Cramér–Wold
単位ベクトル a を懐中電灯の向きと考えます。高次元点 z がその向きに落とす一次元の影は内積です。
s = <z, a> = Σ_k z_k a_k
Cramér–Wold の定理は、二つの高次元確率分布がすべての一次元方向で同じ射影分布を持てば、元の分布も同じだと述べます。SIGReg は無限方向を検査できないので、各ステップで M=1024 個の無作為方向を使います。
したがって「計算可能な分布制約」とは言えますが、「1024方向でこのサンプル集合が完全な正規分布だと証明した」とは言えません。方向数、サンプル数、数値積分点はいずれも有限です。
5 特性関数は分布の指紋
確率分布の特性関数は次の形です。
φ(t) = E[exp(i·t·s)]
= E[cos(t·s)] + i·E[sin(t·s)]
標準正規分布なら指紋は exp(-t²/2)。Epps–Pulley 統計量は、標本から得た経験特性関数をこの曲線と比べます。公開実装は t∈[0,3] の17点を使って台形則で数値積分し、正規窓で重み付けします。正弦と余弦は有界なので、極端な一点が目的と勾配を無限に大きくすることはありません。
6 二つの損失と勾配
L = L_inv + λ · L_SIGReg, λ = 0.02
λ は二項の釣り合いを決め、論文が「目的関数で唯一のハイパーパラメータ」と呼ぶ値です。学習率、標本数、視点数、削減率まで不要という意味ではありません。
大域・局所のどちらにも detach はなく、不変性項の勾配は両方へ流れます。SIGReg も共有エンコーダーと投影器を更新します。事前学習後は投影器を外し、下流ではエンコーダーの出力を使います。
7 FLOPs は仕事量、秒は所要時間
FLOPs は浮動小数点演算回数の概算で、計算予算を比べる物差しです。実時間は GPU、カーネル、入出力、通信、実装にも左右されます。Transformer の注意は系列長におおむね二次、MLP 部分はおおむね一次で増えるため、3,136パッチを約157へ減らすと、1ステップあたりの計算量と記憶使用量は大きく下がります。ただし、すべての部分がちょうど20倍速くなるわけではありません。
二分でできる手計算
大域埋め込み g=[1,0]、二つの局所埋め込み l1=[0,0]、l2=[1,1] を考えます。
- 二つの二乗距離はどちらも1で、対応誤差の平均も1です。
- 三者をすべて
[0,0]にすれば、不変性誤差は0です。 - しかし全データの埋め込みが
[0,0]なら、どの方向の影にも分散がなく、N(0,1)と大きく違うので SIGReg が反対します。
これは役割分担を見るおもちゃの例です。3サンプルで正規分布を安定に推定できるという意味ではありません。
数式の原本
道具箱の三点
- 不変性項は対応標本を、SIGReg は埋め込み集団の同時分布を縛ります。
- 無作為射影は全方向の有限近似で、正規性の証明書ではありません。
λ=0.02は損失の重みで、学習全体に設定が一つしかないという意味ではありません。
数式を閉じる前に
- 各次元の平均と分散だけでは、なぜ足りませんか。
- 射影数を増やすことと標本数を増やすことは、同じ誤差を減らしますか。
- SIGReg が小さければ、運動を理解したと結論できますか。
答えを照合する
- 同じ一次・二次モーメントでも、座標間の依存や分布の形はまったく異なり得るからです。
- 異なります。前者は観察方向、後者は各経験分布を作る標本を増やします。
- できません。SIGReg は集団の形を縛るだけで、時間対応、動作、物体の同一性、下流での有用性を直接測りません。