3.3標準
FAQ回答アプリのモデルを更新する。
更新前後で正確性、関連性、安全性が悪化していないか比較したい。
評価データの準備として最も適切なものはどれか。
× 不正解
生成AIアプリケーションは、代表質問と期待される振る舞いを含む固定評価セットで、更新前後の品質・安全性を比較する。
詳細解説
正しい代表的な質問、期待回答、許容される根拠や禁止出力を含む評価セットを固定する
同じ評価セットを更新前後に使うことで、品質指標を比較し、回帰を検出できる。
同じ評価セットを更新前後に使うことで、品質指標を比較し、回帰を検出できる。
問題の要件では、代表的な質問、期待回答、許容される根拠や禁止出力を含む評価セットを固定するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤りモデルが生成した回答だけを正解として採用する
自己生成結果だけでは正確性や安全性の基準にならない。
自己生成結果だけでは正確性や安全性の基準にならない。
問題の要件では、モデルが生成した回答だけを正解として採用するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り最も簡単な質問を1問だけ繰り返す
実運用の多様な質問、境界条件、拒否すべき入力を代表できない。
実運用の多様な質問、境界条件、拒否すべき入力を代表できない。
問題の要件では、最も簡単な質問を1問だけ繰り返すが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り評価結果を見ずに本番へ切り替える
品質や安全性の回帰を検出できず、利用者への影響が大きくなる。
品質や安全性の回帰を検出できず、利用者への影響が大きくなる。
問題の要件では、評価結果を見ずに本番へ切り替えるが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01ガイドのDomain 3.3とAmazon Bedrockモデル評価の公式説明を確認する。期待される結果
評価セット、正解・許容範囲、禁止出力、更新前後比較の必要性を説明できる。理解のポイント
- 評価セット
- 回帰
- 正確性と安全性
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
評価セット
代表的な入力と、期待する回答・根拠・拒否などを定義した比較用データ。
回帰
モデルやプロンプトの変更後に、以前できていた品質が低下すること。
問題IDAWS-AIF-042
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告