JEPA4Japan · チュートリアル

付録A―これだけは要る数学道具箱

2,256文字 6分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

ベクトル、MSE、ガウス分布、無作為射影、特性関数、Cramér–Wold、FLOPs、勾配を復習します。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 公開中
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 現在のレッスン
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

数式を小さな道具箱へほどく

  1. ベクトル数字の住所札
  2. 距離二枚の札の隔たり
  3. 射影一方向の影
  4. 正規分布偏らない雲
  5. 勾配直す向きを示す
数式は飾りではありません。「誰と誰を近づけ、どの集団の形を調べるか」を短く書いた作業票です。

動画へ数字の住所を付ける

一つの動画に256個の数字からなる住所札を付けるとします。同じ場面を大小の窓から見た札は近くしたい。一方、すべての動画を同じ住所へ集めたくはありません。前者は距離、後者はたくさんの方向から見た集団の形で測れます。

式に出会ったら、まず三点を尋ねます。入力は誰か。どの軸で平均するか。1サンプルを縛るのか、サンプル集合を縛るのか。

1 ベクトル、長さ、平均二乗誤差

埋め込み z=[z1,z2,...,zK] は K 次元ベクトルです。公開されている設定では、投影空間は K=256。二つのベクトルの二乗ユークリッド距離は、各座標の差を二乗して足したものです。

||a - b||² = Σ_k (a_k - b_k)²

実装の .pow(2).mean() は、視点、サンプル、座標にわたって平均します。そのため、1サンプルで和を取る上式と数値の尺度は違います。不変性項は次のように読めます。

L_inv = 同じ動画の大域要約と各視点要約の差²を、全軸で平均

この項だけなら、どの入力にも同じ定数を書くと誤差ゼロです。だから集団の形を調べる SIGReg が要ります。

2 標本集合を見る

不変性項は対応する標本同士を比べます。SIGReg は標本集合の分布を調べます。標本数 B、各動画の視点数 V+1、投影次元 K なら、SIGReg が論理的に受け取る形は [V+1,B,K] です。各視点位置ごとに、異なる B 本の動画を一つの集合として見ます。

分散学習では、各計算ノードが求めた経験特性関数を全体集約し、全標本の統計にします。標本数が少ないと集合の形が揺れます。射影方向を増やしても、標本数そのものは増えません。

3 標準・等方・正規とは

一変量の標準正規分布は N(0,1)、K 次元の等方標準正規分布は N(0,I_K) と書きます。中心は0、どの方向も同じ尺度で、特別扱いされる方向がありません。

これは球面上へ一様に点を置くことではありません。正規分布の密度は原点付近で高く、高次元で典型的な半径はおよそ sqrt(K) です。また、各座標の平均と分散が正しく見えても、座標同士が曲線やX字に依存する同時分布は隠せます。

LeJEPA の正規性に関する最適性は、論文が置く下流損失などの仮定の下での主張です。「現実世界の表現は必ず正規分布になる」という自然法則ではありません。

4 ランダム射影と Cramér–Wold

単位ベクトル a を懐中電灯の向きと考えます。高次元点 z がその向きに落とす一次元の影は内積です。

s = <z, a> = Σ_k z_k a_k

Cramér–Wold の定理は、二つの高次元確率分布がすべての一次元方向で同じ射影分布を持てば、元の分布も同じだと述べます。SIGReg は無限方向を検査できないので、各ステップで M=1024 個の無作為方向を使います。

したがって「計算可能な分布制約」とは言えますが、「1024方向でこのサンプル集合が完全な正規分布だと証明した」とは言えません。方向数、サンプル数、数値積分点はいずれも有限です。

5 特性関数は分布の指紋

確率分布の特性関数は次の形です。

φ(t) = E[exp(i·t·s)]
     = E[cos(t·s)] + i·E[sin(t·s)]

標準正規分布なら指紋は exp(-t²/2)。Epps–Pulley 統計量は、標本から得た経験特性関数をこの曲線と比べます。公開実装は t∈[0,3] の17点を使って台形則で数値積分し、正規窓で重み付けします。正弦と余弦は有界なので、極端な一点が目的と勾配を無限に大きくすることはありません。

6 二つの損失と勾配

L = L_inv + λ · L_SIGReg,    λ = 0.02

λ は二項の釣り合いを決め、論文が「目的関数で唯一のハイパーパラメータ」と呼ぶ値です。学習率、標本数、視点数、削減率まで不要という意味ではありません。

大域・局所のどちらにも detach はなく、不変性項の勾配は両方へ流れます。SIGReg も共有エンコーダーと投影器を更新します。事前学習後は投影器を外し、下流ではエンコーダーの出力を使います。

7 FLOPs は仕事量、秒は所要時間

FLOPs は浮動小数点演算回数の概算で、計算予算を比べる物差しです。実時間は GPU、カーネル、入出力、通信、実装にも左右されます。Transformer の注意は系列長におおむね二次、MLP 部分はおおむね一次で増えるため、3,136パッチを約157へ減らすと、1ステップあたりの計算量と記憶使用量は大きく下がります。ただし、すべての部分がちょうど20倍速くなるわけではありません。

二分でできる手計算

大域埋め込み g=[1,0]、二つの局所埋め込み l1=[0,0]、l2=[1,1] を考えます。

  1. 二つの二乗距離はどちらも1で、対応誤差の平均も1です。
  2. 三者をすべて [0,0] にすれば、不変性誤差は0です。
  3. しかし全データの埋め込みが [0,0] なら、どの方向の影にも分散がなく、N(0,1) と大きく違うので SIGReg が反対します。

これは役割分担を見るおもちゃの例です。3サンプルで正規分布を安定に推定できるという意味ではありません。

数式の原本

道具箱の三点

  1. 不変性項は対応標本を、SIGReg は埋め込み集団の同時分布を縛ります。
  2. 無作為射影は全方向の有限近似で、正規性の証明書ではありません。
  3. λ=0.02 は損失の重みで、学習全体に設定が一つしかないという意味ではありません。

数式を閉じる前に

  1. 各次元の平均と分散だけでは、なぜ足りませんか。
  2. 射影数を増やすことと標本数を増やすことは、同じ誤差を減らしますか。
  3. SIGReg が小さければ、運動を理解したと結論できますか。
答えを照合する
  1. 同じ一次・二次モーメントでも、座標間の依存や分布の形はまったく異なり得るからです。
  2. 異なります。前者は観察方向、後者は各経験分布を作る標本を増やします。
  3. できません。SIGReg は集団の形を縛るだけで、時間対応、動作、物体の同一性、下流での有用性を直接測りません。