3.4標準
生成要約を人が評価する。
評価者間のばらつきを抑える。
評価設計として適切なものを2つ選べ。
× 不正解
人手評価は品質観点をルーブリック化し、訓練・盲検・複数評価者・合意手順でばらつきを管理する。
詳細解説
正しい正確性、完全性、根拠、可読性、安全性などを定義したルーブリックを使う
評価の観点をそろえられる。
評価の観点をそろえられる。
問題の要件では、正確性、完全性、根拠、可読性、安全性などを定義したルーブリックを使うが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい評価者訓練、例示、盲検化、複数評価者、合意手順を用意する
主観の偏りを測定・低減できる。
主観の偏りを測定・低減できる。
問題の要件では、評価者訓練、例示、盲検化、複数評価者、合意手順を用意するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り評価者ごとに基準を自由に変える
結果を比較できない。
結果を比較できない。
問題の要件では、評価者ごとに基準を自由に変えるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り平均点だけを保存して理由や不一致を記録しない
改善に必要な情報が失われる。
改善に必要な情報が失われる。
問題の要件では、平均点だけを保存して理由や不一致を記録しないが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.4の人手評価、品質基準、生成AI評価を確認する。期待される結果
評価者間で一貫した品質評価を行い、不一致も改善へ利用できる。理解のポイント
- ルーブリック
- 盲検
- 評価者一致
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
ルーブリック
評価項目と段階ごとの判定基準を定義した表。
盲検評価
モデル版や条件などの先入観を隠して行う評価。
問題IDAWS-AIF-358
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告