抄録/ポイント:
抄録/ポイント
文献の概要を数百字程度の日本語でまとめたものです。
部分表示の続きは、JDreamⅢ(有料)でご覧頂けます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。
ロボットが効率的にタスクを達成するため,エキスパートによるデモンストレーションから得られた軌道を強化学習によって補正する手法が提案されている.しかし,従来手法のエキスパートの軌道は一つを想定しており,複雑なタスクではエキスパートが複数のポリシーを利用する場合が考えられる.本稿では,エキスパートのデモンストレーションから複数のエキスパートポリシーを学習し,強化学習によって補正を行うResidual Reinforcement Learningを提案する.実験では物体の整列タスクにより,複数のエキスパートポリシーを活用することで,エキスパートによる軌道のみを用いた場合よりも高精度な整列が可能となることを示す.(著者抄録)