3.3標準
要約モデルを比較する。
自動的な文字列一致だけでは、読みやすさや事実性を十分に評価できない。
人手評価で確認すべき項目を2つ選べ。
× 不正解
生成品質は自動指標だけでなく、忠実性、可読性、安全性、指示遵守などを人手で確認する。
詳細解説
正しい要約が元文の重要情報を保っているか
人が内容の忠実性や重要情報の欠落を確認する。
人が内容の忠実性や重要情報の欠落を確認する。
問題の要件では、要約が元文の重要情報を保っているかが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい有害・差別的・機密な出力がないか
安全性や利用方針への適合も人手で評価できる。
安全性や利用方針への適合も人手で評価できる。
問題の要件では、有害・差別的・機密な出力がないかが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤りモデル名のアルファベット順
名称の並びは出力品質の評価指標ではない。
名称の並びは出力品質の評価指標ではない。
問題の要件では、モデル名のアルファベット順が解決する範囲と、別の工程が担う範囲を分けて判断する。
誤りAWSアカウントの請求先住所だけ
請求先情報は要約の品質・安全性を測らない。
請求先情報は要約の品質・安全性を測らない。
問題の要件では、AWSアカウントの請求先住所だけが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01ガイドのDomain 3.3で人手評価と自動評価の役割を確認する。期待される結果
自動指標で測りにくい意味・安全性の評価項目を挙げられる。理解のポイント
- 忠実性
- 安全性
- 人手評価
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
人手評価
評価者が内容の意味、品質、安全性、指示遵守などを直接判断する評価。
自動評価の限界
文字列やスコアだけでは、事実性・文脈・有害性を十分に捉えられない場合がある。
問題IDAWS-AIF-044
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告