3.4標準
基盤モデルやプロンプトを定期的に比較する。
専門家が確認した期待回答を利用する。
管理として適切なものを2つ選べ。
× 不正解
ゴールデンセットは専門家確認済みの代表・境界・危険・多言語ケースを版管理し、機密・アクセス・変更・汚染を管理する。
詳細解説
正しい代表・境界・危険・多言語ケースと、根拠・期待要件・判定基準を版管理する
同じ条件で品質を比較できる。
同じ条件で品質を比較できる。
問題の要件では、代表・境界・危険・多言語ケースと、根拠・期待要件・判定基準を版管理するが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい評価データの機密性、アクセス、変更承認、汚染・漏えいを管理する
評価の信頼性を守れる。
評価の信頼性を守れる。
問題の要件では、評価データの機密性、アクセス、変更承認、汚染・漏えいを管理するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り期待回答を公開データへ混ぜて学習させる
評価が汚染される。
評価が汚染される。
問題の要件では、期待回答を公開データへ混ぜて学習させるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤りモデル更新ごとにゴールデンセットを捨てる
退行を比較できなくなる。
退行を比較できなくなる。
問題の要件では、モデル更新ごとにゴールデンセットを捨てるが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.4の評価データ、回帰、モデル比較を確認する。期待される結果
信頼できる固定評価セットでモデル・プロンプトの退行を検出できる。理解のポイント
- ゴールデンセット
- 汚染
- 版管理
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
ゴールデンセット
専門家が期待結果や根拠を確認した基準評価データ。
評価汚染
評価データが学習や調整へ混ざり、性能を過大評価できる状態。
問題IDAWS-AIF-381
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告