視覚検索のための新しいトークン手法ReToken
ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
視覚と言語のモデルを改善する手法
この論文を3行でいうと
- 視覚と言語モデルは長い視覚コンテキストに課題がある。
- ReTokenは、クエリに関連する視覚トークンを選択する学習可能な埋め込みを提案。
- 軽量設計により、トレーニングと長動画の推論が効率的に行える。
キーワード
視覚認識マルチモーダル軽量化
もう少しだけ中身を見る
視覚と言語モデルは、視覚コンテキストが長くなると性能が低下するという課題があります。本論文では、クエリに関連する視覚トークンを選択するための新しい手法ReTokenを提案します。この手法は、少量のデータでトレーニングされ、さまざまなベンチマークで一貫した性能向上を示しています。視覚と言語の研究に興味がある方に特におすすめです。
こんな人に向いていそう
視覚と言語モデルに関心のある研究者やエンジニアに向いています。
元論文はこちら
関連論文