3.3標準
2つのモデルの回答品質を比較する。
評価者の主観差を抑え、判断理由を記録する。
設計として適切なものを2つ選べ。
× 不正解
比較評価では同じ入力、匿名化、明確な基準と例を使い、勝敗だけでなく条件・理由・評価者一致を記録する。
詳細解説
正しい同じ入力に対する回答を匿名化して、基準に沿って比較する
モデル名や順序による先入観を減らし、同一条件で比較できる。
モデル名や順序による先入観を減らし、同一条件で比較できる。
問題の要件では、同じ入力に対する回答を匿名化して、基準に沿って比較するが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい正確性、関連性、安全性、スタイルなどの評価基準と例を用意する
評価者間の判断を揃え、理由を分析できる。
評価者間の判断を揃え、理由を分析できる。
問題の要件では、正確性、関連性、安全性、スタイルなどの評価基準と例を用意するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り評価者へモデル名と価格を知らせ、好みで選ばせる
ブランドや価格が品質判断へ混入する。
ブランドや価格が品質判断へ混入する。
問題の要件では、評価者へモデル名と価格を知らせ、好みで選ばせるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り勝敗だけを保存し、理由や条件を記録しない
結果の再現・改善・偏り分析ができない。
結果の再現・改善・偏り分析ができない。
問題の要件では、勝敗だけを保存し、理由や条件を記録しないが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01ガイドDomain 3.3の人手評価と生成AI品質評価を確認する。期待される結果
人手比較評価のバイアス抑制と再現性向上を説明できる。理解のポイント
- 匿名化
- 評価基準
- 評価者一致
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
ペア比較評価
同じ入力に対する2つ以上の出力を、基準に沿って比較する人手評価。
評価者一致
複数の評価者が同じ基準で判断した結果の一致度。
問題IDAWS-AIF-145
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告