自己検証による適応的テスト時間計算の強化

SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute

自己検証を用いた強化学習手法を提案

2026-07-30 中級 arXiv
LLM強化学習
  • テスト時間の計算をスケールアップすることが言語モデルの推論を改善することが知られています。
  • 本研究では、自己検証を利用した強化学習フレームワークSVRを提案します。
  • SVRは、外部フィードバックなしで計算制御を行う新しいアプローチを示しています。
強化学習言語モデル自己検証

言語モデルの推論を向上させるためには、テスト時間の計算を効果的にスケールアップする必要があります。そこで本研究では、自己検証を用いた新しい強化学習フレームワークSVRを提案し、計算制御を行います。興味深い点は、外部の正解情報を使用せずに自己検証を学習し、適応的に計算資源を配分できる点です。この研究は、言語モデルの推論精度向上に関心のある研究者や実務者に役立つでしょう。

言語モデルや強化学習に興味がある研究者やエンジニアに向いています。

SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute
Hongyu Chen, Liang Lin, Guangrun Wang