1.1基礎
エージェントが環境で行動し、結果に応じて報酬を受ける。
学習要素を対応付ける。
説明として適切なものを2つ選べ。
× 不正解
強化学習はエージェントが環境との相互作用で行動し、報酬を手掛かりに将来を含む累積報酬を高める方策を学ぶ。
詳細解説
正しいエージェントは状態を観測し、行動を選び、報酬を得る
環境との相互作用で方策を改善する。
環境との相互作用で方策を改善する。
問題の要件では、エージェントは状態を観測し、行動を選び、報酬を得るが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい報酬は望ましい行動を増やす方向のフィードバックとして使われる
将来の報酬も考慮する。
将来の報酬も考慮する。
問題の要件では、報酬は望ましい行動を増やす方向のフィードバックとして使われるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り強化学習は正解ラベルを一件ずつ与える教師あり学習と同じである
報酬による評価でありラベル分類とは異なる。
報酬による評価でありラベル分類とは異なる。
問題の要件では、強化学習は正解ラベルを一件ずつ与える教師あり学習と同じであるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り報酬を常に最大にするため将来の影響を無視する
累積報酬を考える。
累積報酬を考える。
問題の要件では、報酬を常に最大にするため将来の影響を無視するが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 1.1の強化学習、エージェント、環境、報酬を確認する。期待される結果
強化学習と教師あり学習の違い、報酬と方策の関係を説明できる。理解のポイント
- エージェント
- 環境
- 報酬
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
エージェント
環境を観測し行動を選ぶ学習主体。
方策
状態から次に取る行動を決める規則や確率分布。
問題IDAWS-AIF-413
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告