3.3標準
モデル更新のたびに回答品質を比較する。
通常質問、危険入力、拒否すべき質問を含めて回帰を検出する。
評価セットとして適切なものを2つ選べ。
× 不正解
固定評価セットは代表質問と期待根拠を保ち、安全性・拒否・境界例も含める。平均だけでなく重大な個別失敗を確認する。
詳細解説
正しい代表的な通常質問と、業務上重要な正解・根拠を固定して持つ
版をまたいだ品質比較ができる。
版をまたいだ品質比較ができる。
問題の要件では、代表的な通常質問と、業務上重要な正解・根拠を固定して持つが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい安全性、拒否、境界例、言語・長さの異なるケースを含める
通常品質だけでなく失敗と安全性の回帰を検知できる。
通常品質だけでなく失敗と安全性の回帰を検知できる。
問題の要件では、安全性、拒否、境界例、言語・長さの異なるケースを含めるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤りモデル更新ごとに質問と正解を全て変える
比較基準がなくなる。
比較基準がなくなる。
問題の要件では、モデル更新ごとに質問と正解を全て変えるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り平均スコアだけを見て個別の重大失敗を無視する
少数でも影響の大きい失敗を見落とす。
少数でも影響の大きい失敗を見落とす。
問題の要件では、平均スコアだけを見て個別の重大失敗を無視するが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.3の評価データ、品質指標、責任あるAIを確認する。期待される結果
モデル更新を同じ基準で比較し、安全性の回帰も評価できる。理解のポイント
- 固定セット
- 回帰
- 境界例
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
ゴールデンセット
期待する回答や判定を人手で確認した、回帰テスト用の固定評価データ。
回帰
変更後に、以前満たしていた品質や安全性が低下すること。
問題IDAWS-AIF-203
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告