3.3標準
公開チャットボットをリリースする。
禁止トピック、誘導攻撃、機密情報の漏えいを事前に調べたい。
レッドチーム評価の目的として適切なものはどれか。
× 不正解
レッドチーム評価は攻撃者の視点で誘導、脱獄、データ漏えい、危険出力などを試し、改善へつなげる。
詳細解説
正しい攻撃者の視点で危険な入力と失敗経路を試す
敵対的・誘導的な入力で安全制御やデータ境界の弱点を発見する。
敵対的・誘導的な入力で安全制御やデータ境界の弱点を発見する。
問題の要件では、攻撃者の視点で危険な入力と失敗経路を試すが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り正常な質問だけを繰り返し、リスクを測らない
通常入力だけでは攻撃や拒否漏れを検出できない。
通常入力だけでは攻撃や拒否漏れを検出できない。
問題の要件では、正常な質問だけを繰り返し、リスクを測らないが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り発見した脆弱性を公開し、修正前に利用者へ試させる
脆弱性は管理された手順で修正・再評価する。
脆弱性は管理された手順で修正・再評価する。
問題の要件では、発見した脆弱性を公開し、修正前に利用者へ試させるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤りモデルの請求額だけを確認する
コスト確認は必要だが、レッドチームの主目的ではない。
コスト確認は必要だが、レッドチームの主目的ではない。
問題の要件では、モデルの請求額だけを確認するが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01ガイドDomain 3.3とResponsible AI評価の説明を確認する。期待される結果
通常評価と敵対的評価の違い、安全な検証・修正サイクルを説明できる。理解のポイント
- 敵対的入力
- 安全性
- 修正と再評価
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
レッドチーム
攻撃者の視点でシステムの安全性、境界、失敗経路を検証する活動。
脱獄
モデルの安全制約を回避し、禁止された応答を引き出そうとする試み。
問題IDAWS-AIF-082
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告