2.2標準
Athena・ETLのクエリプランが大規模テーブルで非効率になる。
列の値分布やNULL数をメタデータとして収集し、オプティマイザの判断に活用する。
最も適切な方法はどれか。
× 不正解
Glue Data CatalogのColumn Statisticsは列の値分布やNULL数を提供し、クエリ最適化や品質分析に利用できる。
詳細解説
正しいGlue Data CatalogのColumn Statisticsを収集する
列のNDV・NULL数などの統計を記録し、クエリ最適化や品質確認に利用できる。
列のNDV・NULL数などの統計を記録し、クエリ最適化や品質確認に利用できる。
誤りS3オブジェクトのLastModifiedだけを使う
ファイル更新時刻は列値分布やNULL率を示さない。
ファイル更新時刻は列値分布やNULL率を示さない。
誤りIAM Access Advisorを列統計にする
権限利用履歴はデータ列の値統計ではない。
権限利用履歴はデータ列の値統計ではない。
誤りCloudTrailのイベント数をNULL数とみなす
APIイベント数はデータ列のNULL数と無関係である。
APIイベント数はデータ列のNULL数と無関係である。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS Glue Data Catalog Column Statistics、AnalyzeTable、統計の公式説明を確認する。期待される結果
オブジェクト時刻・権限利用・監査イベントと列統計を区別できる。理解のポイント
- Column Statistics
- NDV
- NULL率
- クエリ最適化
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 2・Task 2.2と各サービスの公式ドキュメントを確認する。
基礎のおさらい
統計の鮮度
データ更新後に統計を再収集し、古い分布による計画悪化を防ぐ。
統計と品質
NULL・重複・基数の統計を品質監視とクエリ最適化の両方に利用する。
問題IDAWS-DEA-139
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告