InferScale: GPUネイティブな個人化LLMサービングのためのKV注入

InferScale: GPU-Native KV Injection for Personalized LLM Serving

GPUを活用した新しいLLMメモリシステム

2026-07-29 中級 arXiv
LLM推論高速化
  • 大規模言語モデルは個人化された文脈を共有している。
  • InferScaleは、再利用可能なKV状態を用いてメモリを効率的に処理する。
  • TTFTを大幅に削減し、サービングの効率を向上させる新手法を提案。
大規模言語モデルGPUメモリ最適化

大規模言語モデルは、ユーザーのリクエストに応じて個人化された文脈を持つことが求められています。そこで本論文では、InferScaleという新しいGPUネイティブなメモリシステムを提案し、再利用可能なKV状態を活用して効率的なサービングを実現します。特に、TTFTを大幅に削減しつつ、アプリケーションの品質を保つことができる点が注目されます。機械学習や自然言語処理に関心のある研究者やエンジニアにとって、興味深い内容となっています。

機械学習や自然言語処理に興味がある研究者やエンジニアに向いています。

InferScale: GPU-Native KV Injection for Personalized LLM Serving
Peter Li, Prashant Pandey