内視鏡検査のための報告に基づく視覚言語モデル

A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports

内視鏡画像と言語の関連性を強化

2026-07-30 中級 arXiv
LLMマルチモーダル画像認識
  • 内視鏡検査の報告は豊富な情報を含むが、画像との関連が弱い。
  • EndoCLIPという新しいモデルを開発し、画像と言語のペアを用いて学習した。
  • このモデルは、専門家のパフォーマンスに近い結果を示し、臨床の効率化に寄与する可能性がある。
内視鏡視覚言語モデル臨床分類

内視鏡検査の報告には多くの専門的な記述が含まれていますが、画像との関連が薄いのが現状です。本研究では、125,756の病変レベルの画像と言語ペアを用いてEndoCLIPというモデルを開発しました。このモデルは、専門家に匹敵する分類精度を達成し、臨床現場での文書化を効率化する可能性を示唆しています。医療分野でのAI活用に興味がある研究者や実務者にとって、注目すべき内容です。

医療分野でのAI技術に関心がある研究者や実務者に向いています。

A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports
Jia Yu, Yan Zhu, Yili He, Zilong Wang, Xinyang Jiang, Peiyao Fu ほか