VisualRouter: クエリに基づく長動画理解のための視覚サンプリング

VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding

クエリに応じた動画フレーム選択手法

2026-07-30 中級 arXiv
LLMマルチモーダル画像認識
  • 長動画の理解は視覚トークンの多さから困難です。
  • VisualRouterは、クエリに基づいた視覚サンプリング手法を提案します。
  • この手法は、情報の重複を避けつつ、時間的なカバレッジを保つことが特徴です。
動画理解視覚サンプリングクエリベース

近年の大規模視覚言語モデルは動画理解において進展を見せていますが、長動画の処理は依然として課題です。そこで本研究では、クエリに応じた視覚サンプリング手法VisualRouterを提案し、情報の重複を避けつつ、必要なフレームを効果的に選択します。実験結果は、この手法が従来の方法よりも優れた性能を示すことを示しています。動画理解に興味がある研究者や開発者にとって、注目すべき内容です。

動画理解や視覚処理に関心のある研究者やエンジニアに向いています。

VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding
Haiyue Zhang, Yi Bin, Xun Jiang, Zeyu Ma, Duo Peng, Guoqing Wang ほか