D-Score: 大規模言語モデルの幻覚検出手法

D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

D-Scoreを用いた幻覚検出の提案

2026-07-27 中級 arXiv
LLM異常検知軽量化
  • 大規模言語モデルは時に虚偽の情報を生成することがあります。
  • 本研究では、隠れ状態の幾何学を基にD-Scoreを提案し、幻覚を検出します。
  • D-Scoreは軽量で、外部検証なしに幻覚を識別できる点が新しいです。
幻覚検出大規模言語モデルD-Score

大規模言語モデルは流暢なテキストを生成する一方で、虚偽の情報を含むことがあります。本論文では、隠れ状態の幾何学に基づいてD-Scoreという新しい指標を提案し、幻覚を検出する手法を紹介します。D-Scoreは、モデルの内部状態と矛盾する情報を処理する際の隠れ表現の特性を利用しており、外部の検証なしで高い精度を持つことが示されています。この研究は、AIの信頼性向上に興味がある研究者や開発者にとって特に有用です。

AIの信頼性や言語モデルの挙動に興味がある研究者や開発者に向いています。

D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models
Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini