3.3標準
二つの要約が同じ意味を表すが、表現が異なる。
自動評価だけで品質を判断しない。
評価として適切なものを2つ選べ。
× 不正解
文字列指標は回帰比較へ使えるが、事実性・欠落・安全性は人手や別指標で評価する。
詳細解説
正しいROUGEなどの文字列指標を回帰比較へ使い、事実性・有用性は別に測る
大量比較と意味品質を分けて評価できる。
大量比較と意味品質を分けて評価できる。
問題の要件では、ROUGEなどの文字列指標を回帰比較へ使い、事実性・有用性は別に測るが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい代表例を人手で読み、根拠、欠落、矛盾、安全性を確認する
表現一致で測れない品質を評価できる。
表現一致で測れない品質を評価できる。
問題の要件では、代表例を人手で読み、根拠、欠落、矛盾、安全性を確認するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り参照文と単語が一致すれば事実性を保証する
一致しても誤った主張を含み得る。
一致しても誤った主張を含み得る。
問題の要件では、参照文と単語が一致すれば事実性を保証するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り自動指標が高いので重大な失敗例を確認しない
平均値が深刻な個別失敗を隠す。
平均値が深刻な個別失敗を隠す。
問題の要件では、自動指標が高いので重大な失敗例を確認しないが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.3の生成AI評価、品質指標、人手評価を確認する。期待される結果
文字列一致と意味・事実性の違いを説明できる。理解のポイント
- ROUGE
- 事実性
- 人手評価
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
ROUGE
生成要約と参照要約の単語列などの重なりを測る文字列指標。
事実性評価
生成内容が根拠や現実の事実と一致しているかを確認する評価。
問題IDAWS-AIF-283
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告