3.1標準
毎晩数時間だけSpark変換を実行し、常時稼働クラスターを避けたい。
ジョブごとのログと失敗再実行を管理したい。
最も適切な自動化方法はどれか。
× 不正解
EMR ServerlessでSparkジョブを実行し、最大容量・ネットワーク・ログ・再試行をワークフローから管理する。
詳細解説
正しいEMR ServerlessへSparkジョブを送信し、Step Functions等で状態を監視する
ジョブ実行時にリソースを確保し、アプリケーション単位でログと実行状態を管理できる。
ジョブ実行時にリソースを確保し、アプリケーション単位でログと実行状態を管理できる。
誤り常時稼働の大規模EMRクラスターを固定する
断続的な処理でもアイドルコストと運用負荷が発生する。
断続的な処理でもアイドルコストと運用負荷が発生する。
誤りLambdaで巨大なSpark処理を実行する
実行時間・メモリ・依存ライブラリの制約が大きい。
実行時間・メモリ・依存ライブラリの制約が大きい。
誤りS3 Selectだけで複数表を結合する
S3 Selectは単一オブジェクトの選択で、分散Spark処理を代替しない。
S3 Selectは単一オブジェクトの選択で、分散Spark処理を代替しない。
実際に確かめる
一時的な検証環境で実行できる例です。
Amazon EMR Serverless、Spark job run、CloudWatch logsの公式説明を確認する。期待される結果
EMR Serverlessと常時稼働クラスター・Lambdaの適用範囲を説明できる。理解のポイント
- EMR Serverless
- Spark
- ジョブ実行
- アイドルコスト
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 3・Task 3.1と各サービスの公式ドキュメントを確認する。
基礎のおさらい
容量管理
最大vCPU・メモリ・同時ジョブ数を設定し、下流サービスへの負荷を制御する。
再実行
入力・出力の一時パスを実行IDで分離し、失敗ジョブを安全に再処理する。
問題IDAWS-DEA-192
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告