3.3標準
新しい推薦モデルを評価する。
実験データの精度と、実ユーザーの行動・安全性を別に見る。
評価として適切なものを2つ選べ。
× 不正解
オフラインでは候補を固定条件で比較し、本番では遅延・エラー・利用者影響・安全性を監視する。両者は代替ではない。
詳細解説
正しいオフラインの固定データで精度・再現率・安全性を比較する
全量展開前に候補の品質を比較できる。
全量展開前に候補の品質を比較できる。
問題の要件では、オフラインの固定データで精度・再現率・安全性を比較するが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい本番では遅延、エラー、利用継続、苦情、偏りなどの影響指標を監視する
実際の利用影響と運用品質を確認できる。
実際の利用影響と運用品質を確認できる。
問題の要件では、本番では遅延、エラー、利用継続、苦情、偏りなどの影響指標を監視するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤りオフライン精度が高ければ本番の利用者影響は測らない
分布や行動が異なり、影響が変わる可能性がある。
分布や行動が異なり、影響が変わる可能性がある。
問題の要件では、オフライン精度が高ければ本番の利用者影響は測らないが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り本番指標を改善するため評価データを都合よく変更する
比較基準と評価の信頼性が損なわれる。
比較基準と評価の信頼性が損なわれる。
問題の要件では、本番指標を改善するため評価データを都合よく変更するが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.3のモデル評価、運用指標、責任あるAIを確認する。期待される結果
開発時指標と本番影響指標を分け、段階展開で確認できる。理解のポイント
- オフライン評価
- 本番監視
- 利用者影響
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
オフライン評価
固定されたデータと条件でモデル候補を比較する評価。
本番指標
実運用での品質、遅延、エラー、利用者影響を表す指標。
問題IDAWS-AIF-244
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告