1.3基礎
エージェントが環境で行動し、結果に応じて報酬を受け取る。
試行錯誤で方策を改善する。
説明として正しいものを2つ選べ。
× 不正解
強化学習は環境との相互作用から報酬を最大化する方策を学び、探索と利用、報酬設計の影響を管理する。
詳細解説
正しい強化学習は状態・行動・報酬を通じて方策を学ぶ
結果の良さを報酬信号で評価する。
結果の良さを報酬信号で評価する。
問題の要件では、強化学習は状態・行動・報酬を通じて方策を学ぶが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい探索と既知の良い行動の利用のバランスが必要である
未知の行動を試すことと、得た知識を使うことを調整する。
未知の行動を試すことと、得た知識を使うことを調整する。
問題の要件では、探索と既知の良い行動の利用のバランスが必要であるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り正解ラベル付きの教師あり学習と同じである
報酬と環境との相互作用が中心である。
報酬と環境との相互作用が中心である。
問題の要件では、正解ラベル付きの教師あり学習と同じであるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り報酬を設計しなくても目的と無関係に安全な方策になる
報酬の設計が望ましくない行動を誘発し得る。
報酬の設計が望ましくない行動を誘発し得る。
問題の要件では、報酬を設計しなくても目的と無関係に安全な方策になるが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 1.3の強化学習、報酬、機械学習方法を確認する。期待される結果
強化学習を教師あり学習と区別し、報酬設計の影響を説明できる。理解のポイント
- 状態
- 行動
- 報酬
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
強化学習
エージェントが環境で行動し、報酬を通じて方策を改善する学習。
探索と利用
新しい行動を試すことと、既知の良い行動を選ぶことのトレードオフ。
問題IDAWS-AIF-235
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告