3.4標準
複数のモデル候補を比較する。
単一のスコアだけで決めない。
評価として適切なものを2つ選べ。
× 不正解
モデル比較は用途の代表・境界・安全・多言語・長文・拒否ケースを固定し、品質・根拠・安全・遅延・費用・データ条件を同一条件で測る。
詳細解説
正しい代表的・境界・安全・多言語・長文・拒否ケースを固定評価セットへ含める
要件と限界を測れる。
要件と限界を測れる。
問題の要件では、代表的・境界・安全・多言語・長文・拒否ケースを固定評価セットへ含めるが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい品質・根拠・安全性・遅延・費用・データ利用条件を同じ条件で比較する
実運用の選択材料になる。
実運用の選択材料になる。
問題の要件では、品質・根拠・安全性・遅延・費用・データ利用条件を同じ条件で比較するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り公開ベンチマークの最高点だけで本番モデルを決める
用途と条件が異なる。
用途と条件が異なる。
問題の要件では、公開ベンチマークの最高点だけで本番モデルを決めるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り評価セットをモデルごとに変える
公平な比較ができない。
公平な比較ができない。
問題の要件では、評価セットをモデルごとに変えるが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 2.1・3.4のモデル評価、ベンチマーク、コストを確認する。期待される結果
公開スコアではなく自社要件に合わせた再現可能な比較ができる。理解のポイント
- ベンチマーク
- 同一条件
- 要件
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
ベンチマーク
複数候補を同じ評価条件で比較するテストセットや手順。
代表ケース
実際の利用分布と重要な境界を反映した評価例。
問題IDAWS-AIF-519
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告