特許
J-GLOBAL ID:202403002724367211

強化学習プログラム、強化学習方法、および情報処理装置

発明者:
出願人/特許権者:
代理人 (1件): 弁理士法人扶桑国際特許事務所
公報種別:公開公報
出願番号(国際出願番号):特願2023-061163
公開番号(公開出願番号):特開2024-148223
出願日: 2023年04月05日
公開日(公表日): 2024年10月18日
要約:
【課題】強化学習に用いるパラメータの適切な値を容易に取得できるようにする。 【解決手段】情報処理装置10は、複数の候補値ごとの強化学習をモデル2に対して実施する。その際、情報処理装置10は、複数の候補値それぞれを、強化学習の対象となる問題に対応するモデル2に適用する方策の更新前後でモデル2から得られる行動確率分布3a,3bの差の上限とする。次に情報処理装置10は、複数の候補値ごとの強化学習を、所定の指標値に基づいて、報酬の収束を待たずに終了させる。そして情報処理装置10は、所定の指標値に基づいて、複数の候補値から少なくとも1つの候補値を選択する。 【選択図】図1
請求項(抜粋):
複数の候補値それぞれを、強化学習の対象となる問題に対応するモデルに適用する方策の更新前後で前記モデルから得られる行動確率分布の差の上限として、前記複数の候補値ごとの前記強化学習を前記モデルに対して実施し、 前記複数の候補値ごとの前記強化学習を、所定の指標値に基づいて、報酬の収束を待たずに終了させ、 前記所定の指標値に基づいて、前記複数の候補値から少なくとも1つの候補値を選択する、 処理をコンピュータに実行させる強化学習プログラム。
IPC (1件):
G06N 20/00
FI (1件):
G06N20/00
引用特許:
出願人引用 (4件)
全件表示

前のページに戻る