3.5標準
S3に保存された大量データをSparkで分散処理する。
ジョブの実行環境とクラスターの計算リソースを管理する。
最も適切なサービスはどれか。
× 不正解
Sparkなどの分散フレームワークを大規模データへ適用する場合は、EMRのクラスターを選ぶ。
詳細解説
正しいAmazon EMRでSparkクラスターを実行する
EMRはHadoopやSparkなどのビッグデータフレームワークをマネージドクラスターで実行する。
EMRはHadoopやSparkなどのビッグデータフレームワークをマネージドクラスターで実行する。
誤りAmazon Route 53でSparkジョブを実行する
Route 53はDNSサービスで、分散データ処理を実行しない。
Route 53はDNSサービスで、分散データ処理を実行しない。
誤りS3 LifecycleでSparkの計算ノードを作成する
Lifecycleはオブジェクトの移行・削除で、計算クラスターを作成しない。
Lifecycleはオブジェクトの移行・削除で、計算クラスターを作成しない。
誤りIAMポリシーだけでS3データを変換する
IAMは権限を定義し、データ変換処理を実行しない。
IAMは権限を定義し、データ変換処理を実行しない。
実際に確かめる
一時的な検証環境で実行できる例です。
Amazon EMRとSparkの公式説明を確認する。期待される結果
Glue ETLとEMRクラスターの使い分けを処理要件から判断できる。理解のポイント
- Amazon EMR
- Apache Spark
- 分散処理
確認時の注意
- 確認環境: AWS公式EMRドキュメントの確認
- AWS公式SAA-C03 Domain 3と各サービスの公式ドキュメントを確認する。
基礎のおさらい
処理エンジン
既存のSpark制御やクラスター設定が必要ならEMR、マネージドETL中心ならGlueを比較する。
判断のポイント
問題文の要件を、サービスの役割・制約・運用条件に分けて確認する。
問題IDAWS-SAA-070
確認環境AWS公式EMRドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告