ハイブリッド視覚拡散トランスフォーマーChimeraの設計とスケーリング

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

高効率な視覚生成モデルを提案

2026-07-30 中級 arXiv
マルチモーダル画像生成Diffusion
  • 視覚生成は高解像度画像や長動画を必要とする。
  • Chimeraはテキスト、画像、動画を統合的に処理する新しいモデル。
  • 計算効率が高く、長い文脈を扱える点が革新的。
視覚生成マルチモーダル拡散

視覚生成のニーズが高まる中、Chimeraは高解像度画像や長い動画を効率的に生成するためのハイブリッドモデルです。このモデルは、テキスト、画像、動画を一つのストリームで処理し、計算効率を大幅に向上させる新しいアプローチを採用しています。特に、長い文脈を扱う能力と、計算リソースを最適化する手法が注目されます。視覚生成やマルチモーダル処理に興味のある研究者やエンジニアにとって、非常に有用な内容です。

視覚生成やマルチモーダル技術に関心のある研究者や開発者に向いています。

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers
Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen ほか