3.2標準
数十億件のアクセスログからユニーク利用者数の傾向を日次で出す。
厳密値より低コスト・短時間を優先し、誤差を明示したい。
最も適切な分析方法はどれか。
× 不正解
近似distinctを使う場合は誤差範囲・用途・再現性を明示し、請求や監査の厳密値とは分ける。
詳細解説
正しいapprox_distinctなどの近似集計を検討する
少ないメモリとスキャンで概数を計算でき、誤差と用途を明示できる。
少ないメモリとスキャンで概数を計算でき、誤差と用途を明示できる。
誤り常にCOUNT(DISTINCT)だけを使う
大規模データでメモリ・時間・スキャンコストが増える。
大規模データでメモリ・時間・スキャンコストが増える。
誤りS3 Lifecycleで重複ログを削除する
重複判定を誤ると原データを失い、集計の再現性がなくなる。
重複判定を誤ると原データを失い、集計の再現性がなくなる。
誤りCloudTrailの利用者数を代用する
API利用者と業務ログのユニーク利用者は定義が異なる。
API利用者と業務ログのユニーク利用者は定義が異なる。
実際に確かめる
一時的な検証環境で実行できる例です。
Amazon Athena approximate functions、approx_distinct、COUNT DISTINCTの公式説明を確認する。期待される結果
厳密集計と近似集計のコスト・精度のトレードオフを説明できる。理解のポイント
- approx_distinct
- 近似集計
- 誤差
- コスト
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 3・Task 3.2と各サービスの公式ドキュメントを確認する。
基礎のおさらい
用途分離
ダッシュボード傾向は近似、請求・監査・契約値は厳密というように要件を分ける。
検証
サンプルや厳密計算との比較で誤差を測定し、利用者へ表示する。
問題IDAWS-DEA-209
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告