1.1標準
ロボットが環境内で行動し、結果に応じて報酬を受け取る。
長期的な報酬を高める行動方針を学習させる。
強化学習に関する説明として適切なものを2つ選べ。
× 不正解
強化学習はエージェントが環境と相互作用し、報酬を基に方策を改善する。教師あり学習とは学習信号が異なる。
詳細解説
正しいエージェントが環境へ行動し、報酬を受け取る
強化学習はエージェントと環境の相互作用を通じて学ぶ。
強化学習はエージェントと環境の相互作用を通じて学ぶ。
問題の要件では、エージェントが環境へ行動し、報酬を受け取るが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい方策は状態に対して選ぶ行動の方針を表す
方策は状況から行動を選ぶ戦略である。
方策は状況から行動を選ぶ戦略である。
問題の要件では、方策は状態に対して選ぶ行動の方針を表すが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り必ず正解ラベル付きの教師データだけを使う
報酬を通じて学習するため、教師あり学習と同一ではない。
報酬を通じて学習するため、教師あり学習と同一ではない。
問題の要件では、必ず正解ラベル付きの教師データだけを使うが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り報酬がなくても目的関数は常に決まる
報酬設計が目的や学習信号となる。
報酬設計が目的や学習信号となる。
問題の要件では、報酬がなくても目的関数は常に決まるが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01ガイドDomain 1.1の強化学習用語を確認する。期待される結果
エージェント、環境、行動、報酬、方策の関係を説明できる。理解のポイント
- エージェント
- 報酬
- 方策
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
エージェント
環境を観測し、行動を選択する学習主体。
方策
状態や観測から行動を選ぶ規則・戦略。
問題IDAWS-AIF-064
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告