特許
J-GLOBAL ID:202403007429601999
強化学習プログラム、情報処理装置および強化学習方法
発明者:
,
,
,
出願人/特許権者:
代理人 (1件):
弁理士法人酒井国際特許事務所
公報種別:公開公報
出願番号(国際出願番号):特願2023-024535
公開番号(公開出願番号):特開2024-118220
出願日: 2023年02月20日
公開日(公表日): 2024年08月30日
要約:
【課題】学習データにはない文章入力に対しても、認識精度を向上させる。
【解決手段】情報処理装置1は、強化学習におけるポリシーの最適化問題において、信頼領域を設定してポリシーの更新を行う際に、更新前後のポリシーの差を観測し、観測した差が信頼領域のある範囲内に留まるように、ポリシーの更新に至るアルゴリズムの動作に応じて、前記信頼領域の閾値を調整する。かかる情報処理装置1の処理は、例えば、携帯基地局の通信品質を担保しながら、省電力を行う制約条件付きのCPOに適用することができる。
【選択図】図1
請求項(抜粋):
強化学習におけるポリシーの最適化問題において、
信頼領域を設定してポリシーの更新を行う際に、更新前後のポリシーの差を観測し、
観測した差が信頼領域のある範囲内に留まるように、ポリシーの更新に至るアルゴリズムの動作に応じて、前記信頼領域の閾値を調整する
処理をコンピュータに実行させることを特徴とする強化学習プログラム。
IPC (1件):
FI (1件):
引用特許:
前のページに戻る