LLMの安全性向上のためのオンポリシー蒸留手法
On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment
LLMの安全性を高める新手法を提案
この論文を3行でいうと
- 大規模言語モデルはファインチューニングで専門化されるが、悪意のあるデータによる脆弱性がある。
- 提案手法ROPDは、出力確率分布の乖離をモデル化し、テンプレートの影響を軽減する。
- ROPDは既存の防御手法よりも高い堅牢性を示し、新たな基準を確立する。
キーワード
LLMファインチューニング蒸留
もう少しだけ中身を見る
大規模言語モデル(LLM)はファインチューニングによって専門化されますが、悪意のあるデータによって脆弱性が生じることがあります。本論文では、ROPDという新しいリアラインメント手法を提案し、出力確率分布の乖離をモデル化することで、テンプレートによる影響を軽減します。実験結果から、ROPDは既存手法に比べて高い堅牢性を持ち、専門的な能力を維持しつつ安全性を向上させることが示されました。特にLLMの安全性に関心のある研究者や開発者にとって興味深い内容です。
こんな人に向いていそう
LLMの安全性やファインチューニングに興味がある研究者やエンジニアに向いています。
元論文はこちら
関連論文