1.2標準
EMRのSpark結合で、特定の顧客IDに大量の行が集中し、1タスクだけが長時間残る。
パーティション間の偏りを減らし、ジョブの完了時間を短縮する。
最も適切な対策はどれか。
× 不正解
Sparkのデータスキューには、偏ったキーの特定、ソルトキー、再パーティション、ブロードキャスト結合などをデータサイズに応じて検討する。
詳細解説
正しい偏ったキーを検出し、ソルトキーや適切な再パーティションを検討する
大きなキーを複数の処理単位へ分散し、特定タスクへの集中を緩和できる。
大きなキーを複数の処理単位へ分散し、特定タスクへの集中を緩和できる。
誤りすべてのデータを1つのパーティションへ集める
並列性を失い、偏りと処理時間を悪化させる。
並列性を失い、偏りと処理時間を悪化させる。
誤りS3バージョニングを有効化する
オブジェクト履歴はSparkの実行時パーティション分布を変えない。
オブジェクト履歴はSparkの実行時パーティション分布を変えない。
誤りIAMポリシーにリトライを追加する
IAMポリシーは権限を定義し、Sparkのデータ分散や再試行を制御しない。
IAMポリシーは権限を定義し、Sparkのデータ分散や再試行を制御しない。
実際に確かめる
一時的な検証環境で実行できる例です。
Apache Sparkのデータスキュー、パーティション、salting、join戦略の公式説明を確認する。期待される結果
権限設定やS3版管理ではなく、分散処理のパーティション設計が原因と対策になることを説明できる。理解のポイント
- Spark
- データスキュー
- ソルトキー
- 再パーティション
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 1・Task 1.2と各サービスの公式ドキュメントを確認する。
基礎のおさらい
データ分布
分散処理ではデータ量がタスク間で偏ると、最遅タスクが全体の完了時間を決める。
結合戦略
小さい側のブロードキャスト、ソルト、パーティションキー変更をデータ量とメモリで選択する。
問題IDAWS-DEA-036
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告