×
科目A|基礎理論
強化学習は、エージェントと呼ばれる主体が、現在の状態を観測し、選択可能な行動の中から一つを実行することで、環境から得られる将来の「累積報酬」を最大化するような意思決定の戦略(方策)を自律的に学習する手法です。教師データのように一歩一歩の「正解の行動」が直接与えられるわけではなく、一連の行動の結果として最終的に得られる「報酬(スコア)」のフィードバックのみを頼りに学習を進めます。エージェントは、すでに効果的だとわかっている行動を繰り返す「利用(Exploitation)」と、まだ試したことのない新しい行動に挑戦する「探索(Exploration)」のトレードオフを制御しながら、試行錯誤を通じて最適な行動パターン(Q学習やDQNなど)を獲得します。ロボットの歩行制御、自動運転の経路探索、ゲームでの対戦戦略などに広く応用されています。

試験でのポイント