特許
J-GLOBAL ID:202503000105760230

学習プログラム、情報処理装置および学習方法

発明者: ,  ,  , 
出願人/特許権者:
代理人 (1件): 弁理士法人酒井国際特許事務所
公報種別:公開公報
出願番号(国際出願番号):特願2023-143184
公開番号(公開出願番号):特開2025-035871
出願日: 2023年09月04日
公開日(公表日): 2025年03月14日
要約:
【課題】制約条件付きマルチエージェント強化学習において、システム全体の制約条件を考慮した学習を行う。 【解決手段】情報処理装置1は、複数のエージェントが存在する制約条件付き制御問題において、第1のエージェントについて、複数のエージェントの関係性に基づいて、行動する際に用いる状態の優先度を決定し、状態の優先度に応じて、第1の方策パラメータに入力する値を選択し、値が入力された第1の方策パラメータを用いて、所定の更新順に従って、第1のエージェントの制約条件に対する第1の影響度と、前の順となる第2のエージェントが更新した第2の方策パラメータによる第2の影響度に基づいた、システム全体の制約条件に対する第3の影響度と、を決定し、第1の影響度と第3の影響度とに応じた、制約条件を満たす方策パラメータの範囲を決定する。かかる情報処理装置1の処理は、例えば、基地局(BS)における停波制御に適用できる。 【選択図】図2
請求項(抜粋):
複数のエージェントが存在する制約条件付き制御問題において、 前記複数のエージェントの中の第1のエージェントについて、前記複数のエージェントの関係性に基づいて、行動する際に用いる状態の優先度を決定し、 前記第1のエージェントについて、前記状態の優先度に応じて、第1の方策パラメータに入力する値として真値または代替値を選択し、 前記第1のエージェントについて、前記値が入力された前記第1の方策パラメータを用いて、所定の更新順に従って、前記第1のエージェントの制約条件に対する第1の影響度と、更新順の前の順となる第2のエージェントが更新した第2の方策パラメータによる第2の影響度に基づいた、システム全体の制約条件に対する第3の影響度と、を決定し、 前記第1の影響度と前記第3の影響度とに応じた、制約条件を満たす方策パラメータの範囲を決定する 処理をコンピュータに実行させることを特徴とする学習プログラム。
IPC (2件):
G06N 20/00 ,  G06N 3/092
FI (2件):
G06N20/00 ,  G06N3/092
引用特許:
出願人引用 (3件)

前のページに戻る