視覚検索のための新しいトークン手法ReToken

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

視覚と言語のモデルを改善する手法

2026-07-30 中級 arXiv
LLMマルチモーダル軽量化
  • 視覚と言語モデルは長い視覚コンテキストに課題がある。
  • ReTokenは、クエリに関連する視覚トークンを選択する学習可能な埋め込みを提案。
  • 軽量設計により、トレーニングと長動画の推論が効率的に行える。
視覚認識マルチモーダル軽量化

視覚と言語モデルは、視覚コンテキストが長くなると性能が低下するという課題があります。本論文では、クエリに関連する視覚トークンを選択するための新しい手法ReTokenを提案します。この手法は、少量のデータでトレーニングされ、さまざまなベンチマークで一貫した性能向上を示しています。視覚と言語の研究に興味がある方に特におすすめです。

視覚と言語モデルに関心のある研究者やエンジニアに向いています。

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem