3.3標準
要約モデルの評価指標を設計する。
文字列の一致だけでは、事実性や読みやすさを測れない。
方法として適切なものを2つ選べ。
× 不正解
自動指標で広く回帰を検知し、人手で事実性・安全性・有用性を確認する。人手評価は基準と一致度を管理する。
詳細解説
正しい自動指標で大量の回帰を確認し、重要サンプルを人手で評価する
規模と意味品質の両方を扱える。
規模と意味品質の両方を扱える。
問題の要件では、自動指標で大量の回帰を確認し、重要サンプルを人手で評価するが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい人手評価の基準、例、合議、評価者間の差を記録する
主観的な評価を再現・改善しやすくなる。
主観的な評価を再現・改善しやすくなる。
問題の要件では、人手評価の基準、例、合議、評価者間の差を記録するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り文字列の類似度が高ければ事実性は保証される
似た表現でも誤った主張を含み得る。
似た表現でも誤った主張を含み得る。
問題の要件では、文字列の類似度が高ければ事実性は保証されるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り人手評価は一人の印象だけで十分である
評価者の偏りと一貫性を確認できない。
評価者の偏りと一貫性を確認できない。
問題の要件では、人手評価は一人の印象だけで十分であるが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.3の生成AI評価、品質指標、人手レビューを確認する。期待される結果
自動指標と人手評価が測る品質の違いを説明できる。理解のポイント
- 自動評価
- 人手評価
- 評価基準
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
自動評価
一致率やルールなど、機械的に大量の出力を比較する評価。
評価者間一致
複数の評価者が同じ基準で同じ判定をする程度。
問題IDAWS-AIF-213
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告