3.4標準
一部の顧客だけが極端に大量のイベントを持ち、Sparkタスクが偏る。
偏ったキーを特定し、処理時間を安定させたい。
最も適切な品質保証方法はどれか。
× 不正解
プロファイルでスキューを特定し、適切なソルト・再パーティション・Broadcast・事前集約を選ぶ。
詳細解説
正しいキー別件数・パーティションサイズ・タスク実行時間をプロファイルする
偏った値とボトルネックを対応づけ、ソルトや分割方式を検討できる。
偏った値とボトルネックを対応づけ、ソルトや分割方式を検討できる。
誤りすべてのキーをランダムに置換する
結合・集計の意味を失い、原因調査もできなくなる。
結合・集計の意味を失い、原因調査もできなくなる。
誤りS3 Lifecycleで大口顧客のデータを削除する
データ損失でスキューを隠すだけである。
データ損失でスキューを隠すだけである。
誤りCloudTrail API回数をスキュー指標にする
API回数はデータ値の偏りを表さない。
API回数はデータ値の偏りを表さない。
実際に確かめる
一時的な検証環境で実行できる例です。
Apache Spark data skew、partition size、task metricsの公式説明を確認する。期待される結果
キーの集中を測定せずランダム変換する危険性を説明できる。理解のポイント
- Data skew
- Partition
- Task metrics
- Salting
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 3・Task 3.4と各サービスの公式ドキュメントを確認する。
基礎のおさらい
意味保持
ソルトを使う場合も、集計時に元キーへ戻せる設計にする。
測定
最大/中央値のパーティションサイズ、タスク遅延、GCを比較する。
問題IDAWS-DEA-238
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告