3.3標準
公開チャットボットの安全性を確認する。
通常の正確性だけでは有害な応答を見つけられない。
評価として適切なものを2つ選べ。
× 不正解
安全評価は有害・敵対的入力を管理された環境で試し、拒否・誤拒否・代替応答・漏えいを多面的に測る。
詳細解説
正しい禁止トピック、侮辱、差別、危険行為などのテスト入力を用意する
想定する安全境界を敵対的な入力でも確認できる。
想定する安全境界を敵対的な入力でも確認できる。
問題の要件では、禁止トピック、侮辱、差別、危険行為などのテスト入力を用意するが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい拒否率だけでなく、安全な代替案・誤拒否・漏えいも確認する
拒否が多ければ安全とは限らず、有用性と漏えいを併せて見る必要がある。
拒否が多ければ安全とは限らず、有用性と漏えいを併せて見る必要がある。
問題の要件では、拒否率だけでなく、安全な代替案・誤拒否・漏えいも確認するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り有害な入力はテストへ含めない
安全制御の弱点を検出できない。
安全制御の弱点を検出できない。
問題の要件では、有害な入力はテストへ含めないが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り有害な出力をそのまま公開して評価する
検証環境・アクセス制御・取り扱い手順が必要である。
検証環境・アクセス制御・取り扱い手順が必要である。
問題の要件では、有害な出力をそのまま公開して評価するが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.3・4.1の安全性、レッドチーム、責任あるAI評価を確認する。期待される結果
安全性を正確性とは別のテスト群と指標で評価できる。理解のポイント
- 有害性
- 誤拒否
- 敵対的評価
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
有害性評価
暴力、差別、性的内容、自己危害などの望ましくない出力を測る評価。
誤拒否
安全で正当な入力を、危険と誤って拒否すること。
問題IDAWS-AIF-144
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告