LLMの安全性向上のためのオンポリシー蒸留手法

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

LLMの安全性を高める新手法を提案

2026-07-29 中級 arXiv
LLMファインチューニング蒸留
  • 大規模言語モデルはファインチューニングで専門化されるが、悪意のあるデータによる脆弱性がある。
  • 提案手法ROPDは、出力確率分布の乖離をモデル化し、テンプレートの影響を軽減する。
  • ROPDは既存の防御手法よりも高い堅牢性を示し、新たな基準を確立する。
LLMファインチューニング蒸留

大規模言語モデル(LLM)はファインチューニングによって専門化されますが、悪意のあるデータによって脆弱性が生じることがあります。本論文では、ROPDという新しいリアラインメント手法を提案し、出力確率分布の乖離をモデル化することで、テンプレートによる影響を軽減します。実験結果から、ROPDは既存手法に比べて高い堅牢性を持ち、専門的な能力を維持しつつ安全性を向上させることが示されました。特にLLMの安全性に関心のある研究者や開発者にとって興味深い内容です。

LLMの安全性やファインチューニングに興味がある研究者やエンジニアに向いています。

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment
Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen