3.4標準
日本語・英語・少数言語で同じAI機能を提供する。
言語ごとの品質と安全性を測る。
評価として適切なものを2つ選べ。
× 不正解
多言語評価は言語ごとの代表質問・表記・専門語・拒否例を用意し、事実性・安全性・公平性・遅延・理解度を別々に比較する。
詳細解説
正しい言語ごとに代表的な質問・方言・表記・専門語・拒否ケースを用意する
言語固有の失敗を測れる。
言語固有の失敗を測れる。
問題の要件では、言語ごとに代表的な質問・方言・表記・専門語・拒否ケースを用意するが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい翻訳品質だけでなく、事実性・有害性・公平性・遅延・利用者理解を言語別に比較する
総合的な差を把握できる。
総合的な差を把握できる。
問題の要件では、翻訳品質だけでなく、事実性・有害性・公平性・遅延・利用者理解を言語別に比較するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り英語で高性能なら他の言語も同じとみなす
言語差を見落とす。
言語差を見落とす。
問題の要件では、英語で高性能なら他の言語も同じとみなすが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り少数言語の評価データを作らず、平均値だけを報告する
影響を隠す。
影響を隠す。
問題の要件では、少数言語の評価データを作らず、平均値だけを報告するが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.4・4.2の多言語評価、公平性、安全性を確認する。期待される結果
一言語の平均性能を他言語へ外挿せず、言語ごとの影響を評価できる。理解のポイント
- 多言語
- 表記差
- 言語別指標
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
多言語評価
複数言語で同じ品質・安全要件を比較する評価。
言語カバレッジ
対象言語や方言・表記のどこまで評価・対応するか。
問題IDAWS-AIF-480
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告