コース進捗 コース目次 34レッスン中 34件を公開中
第0部―まず地図を広げる
第1部―簡単な目的で、なぜ動画が分かるのか
第2部―一本の動画を一台のエンコーダーへ
第3部―実験を読めてこそ、論文を読んだと言える
第4部―公式リポジトリから自分の実験へ
第5部―表現を世界モデル構想へ戻す
付録―必要なときに開く技術リュック
大窓と小窓の約束
- 同じ16枚時刻は替えない
- 大域 224場面を広く
- 局所 96細部を狭く
- 一組にする同じネットワークへ
16ページのぱらぱら漫画
先生が16枚の連続写真を綴じました。机全体が入る大判を一冊。コップ、手、机の角だけを囲う小型版を数冊。小型版は少し明るくしたり、灰色にしたりします。それでも、どの版も同じ16ページをめくります。9ページ目から始まる小型版が混じったら、もう別の問題です。
実際の切り抜き条件
一つの学習動画窓について、最初に16フレームの時間区間を固定し、1 + V 個の視点を作ります。大域視点 x_0 は 224 × 224 で広い範囲を覆います。局所視点 x_1 ... x_V は 96 × 96。より狭く切り抜き、光度変換も強めです。大域側は最も広く、局所側の強い外観変換を受けない参照ですが、学習可能な枝です。ラベルファイルや教師ではありません。
V は方法に埋め込まれた定数ではありません。論文の主な比較実験では、特記がなければ局所視点を4個使います。この設定では10個まで増やすと ImageNet プローブの精度が伸び、12個付近で飽和したと報告しています。一方、Walking Tours の公開既定設定は局所視点10個です。実験記録には実際の V を書き、リポジトリ既定値を全実験共通値と呼ばないようにします。
小窓を合わせると、エンコーダーは固定座標や背景全体だけに頼りにくくなります。局所的な手掛かりから、同じ場面に共通する内容を拾う必要があるからです。広い窓は安定した文脈を供給します。情報量は違っても、時間の身元は同じです。
「16枚ずつ」だけでは足りません。開始時刻が違えば動作の段階も違います。前の16枚から後の16枚を当てる課題でもありません。両方とも同じ時間窓です。フレーム間のブロック因果注意はエンコーダー内部の規則で、この対応条件を変えません。
ビュー生成後は、それぞれ独立にパッチ埋め込みと無作為トークン削減を行い、同じエンコーダー/投影器を呼びます。保持集合は違ってかまいません。共有するのは時間窓とネットワークのパラメータで、残す空間パッチの番号ではありません。
フレーム番号で検算
元動画の101–116番を選びます。大域は101–116の 224 × 224 切り抜き、局所三つも101–116から別々の 96 × 96 を切れば正しい組です。一つを117–132番に替えたら、16枚あっても正例にはなりません。
証拠の置き場所
三点メモ
- 大域
224 × 224と局所96 × 96は、まったく同じ16フレーム窓から作ります。 - 局所視点数は実験条件で、論文比較とリポジトリ既定値は一致しなくても不思議ではありません。
- 切り抜き、データ拡張、トークン保持集合は別々でも、エンコーダー/投影器パラメータは共有します。
仕上げの三問
- 開始点の違う二つの16フレームを正例にできますか。
- 公開既定の局所数は、全論文実験の固定値ですか。
- 大域視点は勾配停止教師ですか。
答え
- できません。
- 違います。実験ごとの
Vを記録します。 - 違います。局所枝と一緒に逆伝播されます。