3.1基礎
S3へ日々追加されるファイルをGlueジョブで処理する。
毎回全ファイルを再読込せず、失敗時には対象を再処理できるようにする。
最も適切な自動化方法はどれか。
× 不正解
Job bookmarkで増分入力を追跡し、ジョブのリセット・再処理・原データ保持を運用手順として定義する。
詳細解説
正しいGlue job bookmarksを有効化し、再処理方針を定義する
前回処理済みの入力を追跡し、増分処理を実現できる。
前回処理済みの入力を追跡し、増分処理を実現できる。
誤り毎回S3全体をScanして処理する
データ量に比例して時間とコストが増える。
データ量に比例して時間とコストが増える。
誤りS3 Lifecycleで処理済みファイルを即時削除する
再処理や監査のための原データを失う。
再処理や監査のための原データを失う。
誤りTTLでS3ファイルを期限削除する
TTLはDynamoDB項目用の機能であり、S3ファイルの処理状態を管理しない。
TTLはDynamoDB項目用の機能であり、S3ファイルの処理状態を管理しない。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS Glue job bookmarks、enable/reset、incremental processingの公式説明を確認する。期待される結果
増分追跡とファイル削除による擬似的な管理の違いを説明できる。理解のポイント
- Job bookmark
- 増分処理
- リセット
- 原データ保持
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 3・Task 3.1と各サービスの公式ドキュメントを確認する。
基礎のおさらい
状態管理
bookmarkの状態とジョブコード・入力場所の変更が再処理へ与える影響を確認する。
再現性
原データを保持し、必要時にbookmarkをリセットして同じ入力を再処理する。
問題IDAWS-DEA-191
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告