ORCA-bench: 言語モデルエージェントのオンコール準備状況

ORCA-bench: How Ready Are Language Model Agents for Oncall?

言語モデルのオンコール能力を評価

2026-07-30 中級 arXiv
LLMAgentベンチマーク
  • 大規模言語モデルはコードの生成や修正が可能ですが、オンコールの根本原因分析には異なるスキルが求められます。
  • 本論文では、ORCA-benchというベンチマークを提案し、実際のシステムでのRCAタスクを評価します。
  • 特に、フロンティアエージェントの性能が実際の運用環境でどの程度かを示す興味深い結果が得られました。
言語モデルオンコールベンチマーク

大規模言語モデルは多くのタスクをこなせますが、オンコールの根本原因分析には特有の課題があります。本研究では、実際のマイクロサービスシステムを用いたORCA-benchを提案し、1,079のRCAタスクを評価しました。特に、フロンティアエージェントの性能が期待に反して低いことが示され、実運用における信頼性向上にはさらなる工夫が必要であることが明らかになりました。機械学習やシステム運用に興味がある研究者やエンジニアにとって、興味深い示唆を提供します。

機械学習やシステム運用に興味がある研究者やエンジニアに向いています。

ORCA-bench: How Ready Are Language Model Agents for Oncall?
Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal ほか