オンライン強化学習におけるQ関数の事前学習の必要性

Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?

Q関数の事前学習の効果を検証

2026-07-29 中級 arXiv
強化学習ファインチューニング
  • 強化学習では事前学習が一般的な手法です。
  • 本研究ではQ関数の事前学習が有効かを調査しました。
  • 意外にも、ランダム初期化の方が効果的であることが示されました。
強化学習ファインチューニングQ関数

強化学習において、事前学習とファインチューニングは重要な手法ですが、Q関数の事前学習が本当に必要か疑問が残ります。本研究では、Q関数の事前学習がオンラインファインチューニングにどのように影響するかを体系的に調査しました。驚くべきことに、単純な初期化の方がパフォーマンスが向上することが分かりました。強化学習やQ関数に興味がある研究者にとって、興味深い知見を提供します。

強化学習やQ関数に関心のある研究者や学生に向いています。新しいアプローチを探している方にもおすすめです。

Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
Perry Dong, Ron Polonsky, Dorsa Sadigh, Chelsea Fin