コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
数字に四枚の荷札を付ける
- 数値まだ結論にしない
- 条件データ・計算予算
- プローブどう読んだか
- 報告者著者報告
- 引用できる境界も一緒に
数字だけが三つ届いた
封筒には「61.0」「20.8倍」「69.5」とだけあります。何の試験か分かりません。そこで帳簿に、学習データ、計算予算、評価用プローブ、報告者の四欄を作ります。全部埋まるまで、数字は結論欄へ移しません。
帳簿の表紙
以下はすべて LeVJEPA arXiv v1(2026-08-27)の予稿にある著者報告です。本講座は大型学習を独立に再実行していません。公開チェックポイントの取得も独立再現ではありません。表ごとに条件が違い、最高値を切り貼りした「架空の一モデル」を作ってはいけません。
1冊目:同じ240周、異なる計算量
著者は各方式の公式実装と推奨ハイパーパラメータを使い、同じ K710の20%、240周、実効バッチサイズ 3,072で再学習し、評価側のトークン数も合わせています。
| 規模 | LeVJEPA 対 V-JEPA 2 の著者報告 | 条件 |
|---|---|---|
| ViT-S | 総事前学習計算が 20.8×少なく、精度は同等以上 | 周回数一致。FLOPs 一致ではない |
| ViT-B | 4.8 対 36.4 ExaFLOPs、精度差1点未満 | 同じ240周とデータ |
| ViT-L | 5.6×少ない計算で IN1K 1.9ポイント高い | 同じ統制条件。LeVJEPA-L は V-JEPA 2-S の半分未満の計算 |
「5.6–20.8×」はS/B/Lにわたる総事前学習 FLOPs の比です。実時間、VRAM、全課題の正解率の倍率ではありません。
2冊目:同じ総 FLOPs
ViT-B、K710の20%、総事前学習計算を固定します。1サンプルあたりの節約を長い学習へ回し、LeVJEPA は 1085周、V=10。IN1K/SSv2 は注意機構付きの凍結プローブによる top-1、K400 は凍結トークンの平均プーリングと線形プローブによる top-1 です。
| 方式 | IN1K | SSv2 | K400 |
|---|---|---|---|
| VideoMAEv2 | 53.4 | 43.6 | 37.4 |
| V-JEPA 2 | 51.6 | 42.5 | 40.7 |
| LeVJEPA | 61.0 | 40.4 | 44.6 |
61.0は次点53.4より 7.6ポイント高く、K400も最高です。SSv2 は最高43.6より 3.2ポイント低い。「運動でも競争力がある」はよくても、「運動ですべて首位」は帳簿に反します。
3冊目:動画学習と静止画学習
同じ元動画のフレーム、同じ総 FLOPs、ViT-B で比較します。DINOv2 は公式実装で単一フレームを学び、11.7Mフレーム標本、11,400最適化ステップ。LeVJEPA は240周条件です。どちらも注意機構付きの凍結プローブで評価します。
| 方式 | IN1K | SSv2 |
|---|---|---|
| DINOv2 | 53.8 | 16.9 |
| LeVJEPA | 50.7 | 30.4 |
DINOv2 は IN1K が3.1ポイント高い。LeVJEPA の SSv2 は約1.8倍です。動画が全軸で勝ったとも、二つの試験から一般的な世界理解を得たとも言えません。
4冊目:消費者向け GPU と VideoMix
| 実験 | 条件 | 著者報告 | 制限 |
|---|---|---|---|
| 消費者向け | ViT-Tiny、RTX 5080 16GB一枚、12時間、Walking Tours 8本、約620kフレーム、約5M動画窓を処理 | 凍結 IN1K が初期値 8.9 → 25.2。バッチサイズ128で8GB未満、同規模 V-JEPA はバッチサイズ28で満杯 | 実行可能性の例。計算クラスタ実験と同等の最先端比較ではない |
| VideoMix | ViT-L/16、100周、K710 + SSv2 + Walking Tours + PE-Video。モデルカードは 1,806,869動画窓 | arXiv v1、README、モデルカードは IN1K 69.5、SSv2 55.0、注意機構付きの凍結プローブ | 多くの混合データ。K710 20%表との差を一変数へ帰属できない |
ここには重要な不一致があります。2026-09-05時点で、公式プロジェクトページは VideoMix を 67.5/55.0と表示する一方、arXiv v1、固定 README、モデルカードは 69.5/55.0です。本シリーズは宣言した arXiv v1 を軸に69.5を採用し、食い違いを明記します。都合よく数字を選んだのではありません。
パッチ PCA と問い–パッチ類似度は定性的結果で、領域分割や追跡の点数ではありません。どの帳簿にも動作条件付き予測や計画実験はありません。
61.0の完全な一行
「著者報告、arXiv v1、ViT-B、K710の20%、同じ総 FLOPs、1085周、V=10、IN1K の注意機構付き凍結プローブで top-1 が61.0」。これだけ付ければ数字を外へ持ち出せます。
元帳の原本
- LeVJEPA v1:比較表と規模拡張実験
- 公式プロジェクトページ:現時点の67.5表記
- 固定 README:69.5/55.0、一般向けの実行条件
- 固定版 VideoMix モデルカード:1,806,869本と公開重み
三行の監査メモ
- 数値はすべて予稿の著者報告で、本講座の独立再現ではありません。
- 61.0/40.4/44.6 は FLOPs 一致、69.5/55.0 は大規模 VideoMix ViT-L です。
- 外観やK400の首位はSSv2の首位でもなく、計画の証拠でもありません。
帳簿テスト
- 61.0、40.4、44.6は同じプローブで測りましたか。
- 69.5/55.0はK710 20%だけで学習しましたか。
- この表を本講座の独立再現と呼べますか。
解答
- 違います。前二つは注意機構付きプローブ、K400は平均プーリングと線形プローブです。
- 違います。K710、SSv2、Walking Tours、PE-Video の VideoMix です。
- 呼べません。arXiv v1 の著者報告です。