3.4標準
検索は高性能だが、最終回答に誤りがある。
段階ごとの原因を切り分ける。
評価として適切なものを2つ選べ。
× 不正解
RAGは検索の取得・順位・認可、生成の根拠支持・欠落・安全性を分けて評価し、共通質問で最終品質・遅延・費用を追跡する。
詳細解説
正しい検索のRecall・順位・認可、生成の根拠支持・欠落・安全性を別々に測る
原因の層を分けられる。
原因の層を分けられる。
問題の要件では、検索のRecall・順位・認可、生成の根拠支持・欠落・安全性を別々に測るが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい同じ質問セットで検索結果と最終回答を結び、遅延・費用・拒否も記録する
全体のトレードオフを比較できる。
全体のトレードオフを比較できる。
問題の要件では、同じ質問セットで検索結果と最終回答を結び、遅延・費用・拒否も記録するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り最終回答の正解率だけで検索と生成の原因を判断する
段階の差を分けられない。
段階の差を分けられない。
問題の要件では、最終回答の正解率だけで検索と生成の原因を判断するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り検索が正しそうなら根拠と出力の対応を確認しない
生成段階の誤りが残る。
生成段階の誤りが残る。
問題の要件では、検索が正しそうなら根拠と出力の対応を確認しないが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.4のRAG評価、検索指標、生成品質を確認する。期待される結果
検索と生成のどの段階が失敗したかを分離して改善できる。理解のポイント
- RAG評価
- 取得
- 生成
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
端から端まで評価
入力から検索・生成・出力までの一連の品質を測ること。
失敗切り分け
検索・プロンプト・モデル・出力のどの層が原因か分ける分析。
問題IDAWS-AIF-443
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告