生成モデルが作成した要約を、参照要約と比較して評価する。
自動評価の指標の役割を整理する。
参照テキストとの語句の重なりを使って要約や翻訳を評価する指標はどれか。
ROUGEやBLEUは参照テキストとの表現の重なりを使う自動評価指標である。意味の正確さや安全性は別の評価も組み合わせる。
詳細解説
ROUGEは要約、BLEUは機械翻訳などで、参照テキストとのn-gramなどの重なりを評価する指標として使われる。
ROUGEは要約、BLEUは機械翻訳などで、参照テキストとのn-gramなどの重なりを評価する指標として使われる。
問題の条件では、ROUGEやBLEUが担う対象と、ほかの選択肢が担う対象を分けて考える。
CPU使用率は計算資源の利用状況であり、生成文の内容品質を直接評価しない。
CPU使用率は計算資源の利用状況であり、生成文の内容品質を直接評価しない。
問題の条件では、CPU使用率だけが担う対象と、ほかの選択肢が担う対象を分けて考える。
ストレージクラスは保存特性を決めるもので、生成品質の評価指標ではない。
ストレージクラスは保存特性を決めるもので、生成品質の評価指標ではない。
問題の条件では、S3のストレージクラスが担う対象と、ほかの選択肢が担う対象を分けて考える。
IAMポリシーの版管理は権限定義の機能で、テキスト品質の評価指標ではない。
IAMポリシーの版管理は権限定義の機能で、テキスト品質の評価指標ではない。
問題の条件では、IAMポリシーのVersionが担う対象と、ほかの選択肢が担う対象を分けて考える。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01ガイドのDomain 3.4で、モデル評価指標と自動評価の限界を確認する。期待される結果
ROUGE・BLEUを参照テキストとの比較に使う指標として説明できる。理解のポイント
- ROUGE
- BLEU
- 参照テキスト
- 評価の限界
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントの対象サービス・機能の説明と、AIF-C01の対応Taskを確認する。
- サービスの提供範囲と、利用者が設計・設定する範囲を混同しない。
基礎のおさらい
自動評価
参照テキストとの語句の重なりを測れるが、意味の正確さや安全性を完全には表さない。
複合評価
自動指標、LLM-as-a-judge、人手評価、業務固有のテストを組み合わせる。