1.2標準
数TBのS3データを結合・集約し、日次でParquetへ変換する。
単一Lambdaの実行時間やメモリに依存せず、分散処理で完了させる。
最も適切な処理基盤はどれか。
× 不正解
Amazon EMRはApache Sparkなどの分散処理フレームワークを実行でき、TB級データの結合・集約に適する。クラスタ構成とコストを管理する必要がある。
詳細解説
正しいAmazon EMRでApache Sparkジョブを実行する
複数ノードでデータを分散処理し、大規模な結合・集約を実行できる。
複数ノードでデータを分散処理し、大規模な結合・集約を実行できる。
誤り1つのLambda関数で全ファイルを順番に処理する
実行時間、メモリ、一時ストレージの制約によりTB級の処理には適さない。
実行時間、メモリ、一時ストレージの制約によりTB級の処理には適さない。
誤りCloudTrailのイベントセレクターで集約する
CloudTrailは監査イベント収集の設定であり、任意のS3データを分散集約しない。
CloudTrailは監査イベント収集の設定であり、任意のS3データを分散集約しない。
誤りIAMロールだけでSparkを実行する
IAMロールは権限を付与するだけで、分散計算エンジンを提供しない。
IAMロールは権限を付与するだけで、分散計算エンジンを提供しない。
実際に確かめる
一時的な検証環境で実行できる例です。
Amazon EMR、Apache Spark、分散処理、S3入力の公式説明を確認する。期待される結果
分散ETLと単一関数の実行制約、権限と計算基盤の役割を区別できる。理解のポイント
- Amazon EMR
- Apache Spark
- 分散処理
- TB級データ
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 1と各サービスの公式ドキュメントを確認する。
基礎のおさらい
分散処理
入力をパーティションへ分割し、複数ノードで結合・集約を並列実行する。
運用方式
EMRクラスタの起動時間、ノード種類、スポット利用、失敗時の再実行を含めてコストを設計する。
問題IDAWS-DEA-030
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告