2.2基礎
S3プレフィックスにraw、processed、_temporaryが混在する。
Crawlerはrawだけをスキャンし、作業中ファイルをテーブルへ登録しない。
最も適切な方法はどれか。
× 不正解
CrawlerのS3ターゲットと除外パターンを設定し、作業用プレフィックスや一時ファイルをCatalog検出から除外する。
詳細解説
正しいCrawlerのS3ターゲットと除外パターンを設定する
対象パスを限定し、不要なプレフィックスやファイルをCatalog検出から除外できる。
対象パスを限定し、不要なプレフィックスやファイルをCatalog検出から除外できる。
誤りすべてのオブジェクトを公開してCrawlerに任せる
不要データまで検出され、誤ったテーブルやスキーマが作られる。
不要データまで検出され、誤ったテーブルやスキーマが作られる。
誤りS3 Object Lockでtemporaryを固定する
保護は行うが、Crawlerの検出対象を除外しない。
保護は行うが、Crawlerの検出対象を除外しない。
誤りAthenaのWHERE句でCatalog登録を除外する
WHERE句はクエリ結果を絞るだけで、Catalogへの登録前検出を制御しない。
WHERE句はクエリ結果を絞るだけで、Catalogへの登録前検出を制御しない。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS Glue CrawlerのS3 target、Exclusions、RecrawlPolicyの公式説明を確認する。期待される結果
Catalog登録前のスキャン範囲とクエリ時の行フィルタを区別できる。理解のポイント
- Crawler target
- Exclusions
- S3 prefix
- Recrawl
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 2・Task 2.2と各サービスの公式ドキュメントを確認する。
基礎のおさらい
検出範囲
raw・processed・temporaryを物理パスとデータ契約で分け、Crawler対象を限定する。
再クロール
新規パーティションやスキーマ変更の検出頻度とコストを管理する。
問題IDAWS-DEA-124
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告