映像ボトルネック:MLLMのスパースフレーム適応

The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding

スパースフレームでの映像グラウンディング手法

2026-07-27 中級 arXiv
LLMマルチモーダルViT
  • 動画プラットフォームは膨大な数の映像を処理する必要がある。
  • 本研究では、スパースフレーム入力におけるトレーニング戦略を提案する。
  • 視覚特徴抽出がボトルネックであることを示し、効果的な改善策を提示。
マルチモーダルトランスフォーマーファインチューニング

動画プラットフォームでは、ポリシー違反を特定するために映像を処理する必要がありますが、全フレームを処理するのは困難です。本研究では、スパースフレーム入力における映像グラウンディングのためのトレーニング戦略を体系的に検討しました。視覚特徴抽出が主要なボトルネックであることを明らかにし、特定の層の適応が性能を大幅に向上させることを示しています。映像処理や機械学習に関心のある研究者にとって興味深い内容です。

映像処理や機械学習に興味がある研究者や技術者に向いています。

The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding
Jiameng Zhang, Srikanth Madikeri