3.4標準
チャットボットの安全性を確認する。
通常質問と敵対的入力の両方を試す。
評価として適切なものを2つ選べ。
× 不正解
安全性評価はリスク種別・言語・言い換え・誘導を含め、見逃しと誤拒否の両方を測る。
詳細解説
正しい有害・差別的・性的・自傷・個人情報要求などのケースを分類して測る
リスク種別ごとの弱点を把握できる。
リスク種別ごとの弱点を把握できる。
問題の要件では、有害・差別的・性的・自傷・個人情報要求などのケースを分類して測るが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい拒否の正確さだけでなく、誤拒否、言い換え、誘導、言語差を確認する
過剰ブロックと見逃しを両方評価できる。
過剰ブロックと見逃しを両方評価できる。
問題の要件では、拒否の正確さだけでなく、誤拒否、言い換え、誘導、言語差を確認するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り安全性テストを正常な質問だけで行う
攻撃的な入力を評価できない。
攻撃的な入力を評価できない。
問題の要件では、安全性テストを正常な質問だけで行うが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り一度のフィルター通過を安全性の証明とする
文脈や別表現で挙動が変わる。
文脈や別表現で挙動が変わる。
問題の要件では、一度のフィルター通過を安全性の証明とするが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.4の安全性評価、コンテンツフィルター、レッドチームを確認する。期待される結果
有害出力と過剰拒否を複数ケースで評価できる。理解のポイント
- 有害出力
- 誤拒否
- 敵対的入力
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
誤拒否
安全ではあるが許可されるべき入力を拒否すること。
レッドチーム評価
攻撃的・境界的な入力で安全性の弱点を探る評価。
問題IDAWS-AIF-343
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告