プレプリント
J-GLOBAL ID:202502202978303690   整理番号:25P0267169

層化GRPO:LLM探索エージェントの強化学習における構造的異種性の取り扱い【JST機械翻訳】

Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
arXiv掲載論文の撤回有無については、一次情報をご確認下さい。
著者 (5件): ,  ,  ,  , 
資料名:
発行年: 2025年10月07日  プレプリントサーバーでの情報更新日: 2025年10月08日
JST資料番号: O7000B  資料種別: プレプリント
記事区分: プレプリント  言語: 英語 (EN)
抄録/ポイント:
抄録/ポイント
文献の概要を数百字程度の日本語でまとめたものです。
部分表示の続きは、JDreamⅢ(有料)でご覧頂けます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。
大規模言語モデル(LLM)エージェントは,複雑な多段階問題を解くために検索エンジンのような外部ツールにますます依存し,強化学習(RL)はそれらを訓練するための鍵となるパラダイムになっている。しかし,検索エージェントの軌道は構造的に不均一であり,検索コールの数,配置,および結果における変動は,基本的に異なる回答方向と報酬分布につながる。単一のグローバルベースラインを用いる標準ポリシー勾配法は,クロスストレートバイアスとして識別し定式化するものから苦しむ-異種軌道の「リンゴからオレンジへの」比較このクロスストレートバイアスはクレジット割当を歪め,複雑な多段階探索戦略の探索を妨げる。これに取り組むために,著者らは,その中心成分,層化優位正規化(SAN),構造特性に基づく均一な地層への分割軌道,各地層内で局所的に利点を計算する層化GRPOを提案した。これにより,真のピアに対してのみ軌道が評価されることが保証される。筆者らの解析は,SANがクロスストレートバイアスを除去し,各階層内で条件付き不偏単位分散推定を生成し,標準正規化により享受される大域的不偏性と単位分散特性を保持し,より純粋でスケール安定な学習信号をもたらすことを証明した。有限サンプル体制の下で実用的な安定性を改善するために,著者らはさらにグローバル推定量とSANを線形に混合した。多様な単一ホップおよびマルチホップ質問応答ベンチマーク上での包括的実験により,層化GRPOがGRPOを11.3点まで一貫して実質的に凌ぎ,より高い訓練報酬,より大きな訓練安定性およびより効果的な探索ポリシーを達成することを示した。これらの結果は,LLM探索エージェントのためのRLにおける構造的異種性に対する原理的改善策として層化を確立した。【JST機械翻訳】
シソーラス用語:
シソーラス用語/準シソーラス用語
文献のテーマを表すキーワードです。
部分表示の続きはJDreamⅢ(有料)でご覧いただけます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。
,  ,  ,  ,  ,  ,  ,  ,  ,  ,  ,  ,  ,  , 
分類 (1件):
分類
JSTが定めた文献の分類名称とコードです
人工知能 

前のページに戻る