3.4基礎
数TBの新規データセットを初回評価する。
全件検査の前に、代表的な分布・欠損・型を低コストで確認したい。
最も適切な品質保証方法はどれか。
× 不正解
層化・時間帯・パーティションを考慮したサンプルでプロファイルし、必須列や制約は全件または段階的に検査する。
詳細解説
正しい代表性を定義したサンプリングでプロファイルし、重要列は全件検査する
探索段階のコストを抑えつつ、サンプルの偏りと全件品質ルールを分けて管理できる。
探索段階のコストを抑えつつ、サンプルの偏りと全件品質ルールを分けて管理できる。
誤り先頭100行だけで全体品質を断定する
並び順に偏りがあり、異常や分布変化を見逃す。
並び順に偏りがあり、異常や分布変化を見逃す。
誤り全件を毎回ローカルへダウンロードする
時間・転送・機密リスクが増える。
時間・転送・機密リスクが増える。
誤りS3 Lifecycleで無作為にファイルを削除する
データを失い、品質推定にも再現性にもならない。
データを失い、品質推定にも再現性にもならない。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS Glue Data Quality profiling、sampling、data statisticsの公式説明を確認する。期待される結果
先頭行だけの確認と代表性を設計したサンプリングを区別できる。理解のポイント
- Sampling
- 代表性
- プロファイリング
- 全件検査
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 3・Task 3.4と各サービスの公式ドキュメントを確認する。
基礎のおさらい
誤差と偏り
サンプルサイズだけでなく、地域・時間・カテゴリの層をカバーする。
運用
新規データの探索と本番品質ゲートを別ステップにし、検査コストを管理する。
問題IDAWS-DEA-237
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告