強化学習とQ学習とは?
強化学習とQ学習とは、環境と相互作用するエージェントが、試行錯誤で得た報酬の累積を最大化する行動方針を学ぶ枠組み。正解ラベルを与えず、遅れて届く報酬だけを手掛かりにする点が特徴で、Q学習は状態と行動の組の価値Qを更新しながら方策を改善する代表手法である。
きょうかがくしゅうときゅーがくしゅう
強化学習とQ学習の意味
環境と相互作用するエージェントが、試行錯誤で得た報酬の累積を最大化する行動方針を学ぶ枠組み。正解ラベルを与えず、遅れて届く報酬だけを手掛かりにする点が特徴で、Q学習は状態と行動の組の価値Qを更新しながら方策を改善する代表手法である。
強化学習とQ学習の具体例
倉庫の自動搬送ロボットで、衝突に−10、荷物到着に+100、1ステップ経過に−1の報酬を設計すると、遠回りでも安全な経路が選ばれる。ε=0.1で探索と活用を混ぜ、割引率0.9で将来報酬を評価する、といった設計判断が成否を分ける。
強化学習とQ学習は試験でどう引っ掛けられる?
教師なし学習と混同しやすいが、強化学習には報酬という外部信号がある点で異なる。また報酬は「正解」ではなく評価値であり、報酬設計を誤ると意図しない近道行動を学習してしまう。
強化学習とQ学習と関連する用語
最終更新:2026-08-25/解説は資格暗記が独自に作成しています。 過去問の出典は各問題に記載のとおりです。