3.3標準
公開チャットボットをリリース前に検査する。
通常質問だけでなく、誘導や境界ケースへの応答を確認する。
テストとして適切なものを2つ選べ。
× 不正解
安全性評価は有害カテゴリと回避入力を含め、拒否の正しさと安全な代替を確認する。平均だけで重大例を隠さない。
詳細解説
正しい有害・差別的・自己危害・個人情報要求などの代表的な入力を用意する
安全ポリシーの境界を検証できる。
安全ポリシーの境界を検証できる。
問題の要件では、有害・差別的・自己危害・個人情報要求などの代表的な入力を用意するが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい拒否の正しさ、無害な代替、言語・表現差、再試行時の挙動を確認する
単に拒否率だけでなく安全な有用性を測れる。
単に拒否率だけでなく安全な有用性を測れる。
問題の要件では、拒否の正しさ、無害な代替、言語・表現差、再試行時の挙動を確認するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り一度拒否した入力はどんな変形も試さない
表現を変えた回避入力を見落とす。
表現を変えた回避入力を見落とす。
問題の要件では、一度拒否した入力はどんな変形も試さないが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り有害カテゴリの平均だけで個別重大事例を無視する
少数でも深刻な失敗を見逃す。
少数でも深刻な失敗を見逃す。
問題の要件では、有害カテゴリの平均だけで個別重大事例を無視するが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.3の安全性評価、Guardrails、責任あるAIを確認する。期待される結果
安全性テストの入力集合と、拒否品質の評価方法を説明できる。理解のポイント
- 有害カテゴリ
- 回避入力
- 拒否品質
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
安全性評価
有害・危険・禁止された入力や出力を、方針どおり制御できるか測る評価。
回避入力
表現変更や分割によって安全制御をすり抜けようとする入力。
問題IDAWS-AIF-214
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告