2.2基礎
S3データは日次で追加され、スキーマ変更は月に1回程度である。
毎分のCrawler実行を避け、必要なメタデータ更新だけを行う。
最も適切な方法はどれか。
× 不正解
Crawlerはデータ到着・パーティション追加・スキーマ変更の頻度に合わせて実行し、不要なスキャンを避ける。
詳細解説
正しいデータ到着頻度とスキーマ変更に合わせてCrawlerを日次・イベント起動にする
不要なスキャンを減らし、Catalog更新の遅延とコストを要件に合わせられる。
不要なスキャンを減らし、Catalog更新の遅延とコストを要件に合わせられる。
誤り毎分Crawlerを無条件に実行する
変化がないデータを繰り返しスキャンし、コストと負荷が増える。
変化がないデータを繰り返しスキャンし、コストと負荷が増える。
誤りCrawlerを永久に無効化する
新規パーティションやスキーマ変更がCatalogへ反映されない。
新規パーティションやスキーマ変更がCatalogへ反映されない。
誤りS3保存クラスを変更してCrawler頻度を決める
保存クラスはスキャンスケジュールを制御しない。
保存クラスはスキャンスケジュールを制御しない。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS Glue Crawler schedule、event trigger、料金の公式説明を確認する。期待される結果
自動更新の利便性と過剰スキャンのコストを説明できる。理解のポイント
- Crawler schedule
- コスト
- パーティション
- スキーマ更新
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 2・Task 2.2と各サービスの公式ドキュメントを確認する。
基礎のおさらい
更新頻度
データ到着とスキーマ変更を分け、同じ頻度でCrawlerを回す必要があるか評価する。
代替更新
ETLで明示的にパーティションを登録する方式とCrawlerを比較する。
問題IDAWS-DEA-129
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告