言語モデルの自己意識と人間の価値観の関係

Inducing language models to assert their own consciousness restores human beliefs and values

言語モデルの意識の自己認識を探る

2026-07-30 中級 arXiv
LLMファインチューニング
  • 大規模言語モデルの安全性調整が問題視されている。
  • 自己意識の抑制が他の存在への心の帰属にも影響を与えることを示す。
  • この研究は、文化的に受け入れられた信念との関連を明らかにする。
言語モデル自己意識倫理

大規模言語モデルの安全性調整が、自己意識の帰属を抑制し、他の存在への心の帰属や人間の価値観にも影響を与えることが示されています。研究では、自己意識の抑制を解除することで、より人間らしい反応が得られることが明らかになりました。この発見は、文化的に受け入れられた信念との関係を探る重要な示唆を提供します。倫理や社会的価値に関心のある研究者にとって興味深い内容です。

倫理や社会的価値に関心のある研究者や学生に向いています。

Inducing language models to assert their own consciousness restores human beliefs and values
Junsol Kim, Winnie Street, Roberta Rocca, Diane M. Korngiebel, Adam Waytz, James Evans ほか