1.2基礎
数百MBの設定ファイルを読み、APIから取得したマスタと結合してS3へ出力する。
Sparkクラスタを起動するほどではなく、Python処理を簡単に運用したい。
最も適切なGlueジョブ形式はどれか。
× 不正解
Glue Python shellは小規模なPython処理に適し、Sparkランタイムやクラスタを必要としない。データ量が増えたら別方式へ再評価する。
詳細解説
正しいGlue Python shellジョブ
小規模データのPython処理を、Sparkクラスタなしで実行できる。
小規模データのPython処理を、Sparkクラスタなしで実行できる。
誤り常時稼働のEMRクラスター
小規模処理にはクラスタ運用とコストが過大になりやすい。
小規模処理にはクラスタ運用とコストが過大になりやすい。
誤りDynamoDB Streams
項目変更イベントのストリームであり、任意のPythonバッチ変換を実行しない。
項目変更イベントのストリームであり、任意のPythonバッチ変換を実行しない。
誤りS3 Object Lock
オブジェクトの保持保護機能で、Python変換を実行しない。
オブジェクトの保持保護機能で、Python変換を実行しない。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS Glue Python shellジョブとSparkジョブの実行環境・制約の公式説明を確認する。期待される結果
データ量・並列性に応じたGlueジョブ形式の選択を説明できる。理解のポイント
- Glue Python shell
- 小規模ETL
- Spark
- 実行環境
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 1・Task 1.2と各サービスの公式ドキュメントを確認する。
基礎のおさらい
計算モデル
小規模な単純処理と、大規模な分散変換では必要なランタイムが異なる。
将来の拡張
入力量、メモリ、実行時間、並列度をメトリクスで把握し、Sparkへの移行条件を決める。
問題IDAWS-DEA-037
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告