3.4標準
配信再試行で同じevent_idが複数回取り込まれる。
集計前に重複を検出し、元データを消さずに重複件数を報告したい。
最も適切な品質保証方法はどれか。
× 不正解
event_idの重複を検出し、イベント時刻・受信時刻・バージョンで採用行を決め、原データと違反件数を保持する。
詳細解説
正しいevent_idの一意性ルールと重複件数の集計を設定する
重複キーを特定し、品質違反として隔離・通知できる。
重複キーを特定し、品質違反として隔離・通知できる。
誤り重複行をランダムに1行だけ削除する
どの行を採用したか追跡できず、再現性を失う。
どの行を採用したか追跡できず、再現性を失う。
誤りS3 Lifecycleで古い重複ファイルを消す
ファイルの古さはイベント重複の判定基準にならない。
ファイルの古さはイベント重複の判定基準にならない。
誤りCloudTrail API数をevent_id重複の根拠にする
API回数は業務イベントの一意性を直接示さない。
API回数は業務イベントの一意性を直接示さない。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS Glue Data Quality uniqueness rules、SQL COUNT、deduplicationの公式説明を確認する。期待される結果
一意性検知とランダム削除の再現性の違いを説明できる。理解のポイント
- 一意性
- event_id
- 重複
- 採用基準
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 3・Task 3.4と各サービスの公式ドキュメントを確認する。
基礎のおさらい
冪等性
入力再送を前提に、event_idと処理版をキーにして重複書き込みを防ぐ。
履歴
重複を削除する前に検知結果と元行を保存し、原因を追跡できるようにする。
問題IDAWS-DEA-232
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告