JEPA4Japan · チュートリアル

第19章―論文の結果を帳簿にする

1,674文字 5分で読めます #LeVJEPA#JEPA#自己教師あり動画学習#SIGReg

5.6–20.8×、61.0、40.4、44.6、69.5、55.0 が、どのモデル・データ・予算を指すか照合します。

コース進捗 コース目次 34レッスン中 34件を公開中

第0部―まず地図を広げる

  1. 01 第0章―始める前に:この講座でできるようになること 公開中
  2. 02 第1章―同じ動画を、二つの窓から見る 公開中
  3. 03 第2章―Yann LeCun の研究路線をたどる 公開中
  4. 04 第3章―名前に迷わないための JEPA 家系図 公開中

第1部―簡単な目的で、なぜ動画が分かるのか

  1. 05 第4章―動画は自分で問題を作れる 公開中
  2. 06 第5章―全ピクセルではなく、意味を残す 公開中
  3. 07 第6章―二枚は同じに。でも全部を白紙にはしない 公開中
  4. 08 第7章―SIGReg:点の雲を影から調べる 公開中
  5. 09 第8章―一行の目的関数で LeVJEPA を読む 公開中

第2部―一本の動画を一台のエンコーダーへ

  1. 10 第9章―大域ビューと局所ビューの作り方 公開中
  2. 11 第10章―動画を時空間の小片に切る 公開中
  3. 12 第11章―一台のエンコーダー、一つの投影ヘッド、一枚の要約札 公開中
  4. 13 第12章―一回の前向き計算を端から端まで 公開中
  5. 14 第13章―95%捨てると、なぜかよく見える 公開中
  6. 15 第14章―ブロック因果注意:同じ時刻は見える、未来は見えない 公開中
  7. 16 第15章―RoPE、1フレーム tubelet、思いがけない密特徴 公開中

第3部―実験を読めてこそ、論文を読んだと言える

  1. 17 第16章―五段のアブレーションが答えること 公開中
  2. 18 第17章―同じ周回数は、同じ費用ではない 公開中
  3. 19 第18章―ImageNet、K400、SSv2 は何を試すか 公開中
  4. 20 第19章―論文の結果を帳簿にする 現在のレッスン
  5. 21 第20章―まだ言ってはいけない結論 公開中

第4部―公式リポジトリから自分の実験へ

  1. 22 第21章―公式リポジトリの見取り図 公開中
  2. 23 第22章―Walking Tours:10本の長編を学習データにするまで 公開中
  3. 24 第23章―既定設定を読み、学習を始める 公開中
  4. 25 第24章―うそをつかない小さな動作確認から始める 公開中
  5. 26 第25章―学習なしで公開重みから特徴を出す 公開中
  6. 27 第26章―自分の動画を凍結評価する 公開中

第5部―表現を世界モデル構想へ戻す

  1. 28 第27章―大事な境界:LeVJEPA は計画器ではない 公開中
  2. 29 第28章―LeVJEPA を次の世界モデルへつなぐ 公開中
  3. 30 第29章―入門から論文まで、10の研究プロジェクト 公開中

付録―必要なときに開く技術リュック

  1. 31 付録A―これだけは要る数学道具箱 公開中
  2. 32 付録B―完全テンソル形状表 公開中
  3. 33 付録C―用語集と論文年表 公開中
  4. 34 付録D―再現とレビューのチェックリスト 公開中

数字に四枚の荷札を付ける

  1. 数値まだ結論にしない
  2. 条件データ・計算予算
  3. プローブどう読んだか
  4. 報告者著者報告
  5. 引用できる境界も一緒に
「61.0」だけでは空欄です。誰が、何を、いくら学習し、どう測った61.0かまでが一件の記録です。

数字だけが三つ届いた

封筒には「61.0」「20.8倍」「69.5」とだけあります。何の試験か分かりません。そこで帳簿に、学習データ、計算予算、評価用プローブ、報告者の四欄を作ります。全部埋まるまで、数字は結論欄へ移しません。

帳簿の表紙

以下はすべて LeVJEPA arXiv v1(2026-08-27)の予稿にある著者報告です。本講座は大型学習を独立に再実行していません。公開チェックポイントの取得も独立再現ではありません。表ごとに条件が違い、最高値を切り貼りした「架空の一モデル」を作ってはいけません。

1冊目:同じ240周、異なる計算量

著者は各方式の公式実装と推奨ハイパーパラメータを使い、同じ K710の20%、240周、実効バッチサイズ 3,072で再学習し、評価側のトークン数も合わせています。

規模LeVJEPA 対 V-JEPA 2 の著者報告条件
ViT-S総事前学習計算が 20.8×少なく、精度は同等以上周回数一致。FLOPs 一致ではない
ViT-B4.8 対 36.4 ExaFLOPs、精度差1点未満同じ240周とデータ
ViT-L5.6×少ない計算で IN1K 1.9ポイント高い同じ統制条件。LeVJEPA-L は V-JEPA 2-S の半分未満の計算

「5.6–20.8×」はS/B/Lにわたる総事前学習 FLOPs の比です。実時間、VRAM、全課題の正解率の倍率ではありません。

2冊目:同じ総 FLOPs

ViT-B、K710の20%、総事前学習計算を固定します。1サンプルあたりの節約を長い学習へ回し、LeVJEPA は 1085周、V=10。IN1K/SSv2 は注意機構付きの凍結プローブによる top-1、K400 は凍結トークンの平均プーリングと線形プローブによる top-1 です。

方式IN1KSSv2K400
VideoMAEv253.443.637.4
V-JEPA 251.642.540.7
LeVJEPA61.040.444.6

61.0は次点53.4より 7.6ポイント高く、K400も最高です。SSv2 は最高43.6より 3.2ポイント低い。「運動でも競争力がある」はよくても、「運動ですべて首位」は帳簿に反します。

3冊目:動画学習と静止画学習

同じ元動画のフレーム、同じ総 FLOPs、ViT-B で比較します。DINOv2 は公式実装で単一フレームを学び、11.7Mフレーム標本、11,400最適化ステップ。LeVJEPA は240周条件です。どちらも注意機構付きの凍結プローブで評価します。

方式IN1KSSv2
DINOv253.816.9
LeVJEPA50.730.4

DINOv2 は IN1K が3.1ポイント高い。LeVJEPA の SSv2 は約1.8倍です。動画が全軸で勝ったとも、二つの試験から一般的な世界理解を得たとも言えません。

4冊目:消費者向け GPU と VideoMix

実験条件著者報告制限
消費者向けViT-Tiny、RTX 5080 16GB一枚、12時間、Walking Tours 8本、約620kフレーム、約5M動画窓を処理凍結 IN1K が初期値 8.9 → 25.2。バッチサイズ128で8GB未満、同規模 V-JEPA はバッチサイズ28で満杯実行可能性の例。計算クラスタ実験と同等の最先端比較ではない
VideoMixViT-L/16、100周、K710 + SSv2 + Walking Tours + PE-Video。モデルカードは 1,806,869動画窓arXiv v1、README、モデルカードは IN1K 69.5、SSv2 55.0、注意機構付きの凍結プローブ多くの混合データ。K710 20%表との差を一変数へ帰属できない

ここには重要な不一致があります。2026-09-05時点で、公式プロジェクトページは VideoMix を 67.5/55.0と表示する一方、arXiv v1、固定 README、モデルカードは 69.5/55.0です。本シリーズは宣言した arXiv v1 を軸に69.5を採用し、食い違いを明記します。都合よく数字を選んだのではありません。

パッチ PCA と問い–パッチ類似度は定性的結果で、領域分割や追跡の点数ではありません。どの帳簿にも動作条件付き予測や計画実験はありません。

61.0の完全な一行

「著者報告、arXiv v1、ViT-B、K710の20%、同じ総 FLOPs、1085周、V=10、IN1K の注意機構付き凍結プローブで top-1 が61.0」。これだけ付ければ数字を外へ持ち出せます。

元帳の原本

三行の監査メモ

  1. 数値はすべて予稿の著者報告で、本講座の独立再現ではありません。
  2. 61.0/40.4/44.6 は FLOPs 一致、69.5/55.0 は大規模 VideoMix ViT-L です。
  3. 外観やK400の首位はSSv2の首位でもなく、計画の証拠でもありません。

帳簿テスト

  1. 61.0、40.4、44.6は同じプローブで測りましたか。
  2. 69.5/55.0はK710 20%だけで学習しましたか。
  3. この表を本講座の独立再現と呼べますか。
解答
  1. 違います。前二つは注意機構付きプローブ、K400は平均プーリングと線形プローブです。
  2. 違います。K710、SSv2、Walking Tours、PE-Video の VideoMix です。
  3. 呼べません。arXiv v1 の著者報告です。