1.4標準
数億件の売上イベントから上位100商品の集計結果を求める。
全件を完全ソートするコストを抑え、分散処理で結果を正しく統合する。
最も適切な方法はどれか。
× 不正解
分散Top-Kでは各パーティションの上位候補を求めて統合し、全件の単一ノードソートを避ける。順位同値の規則も定義する。
詳細解説
正しい各パーティションでTop-Kを求め、候補を統合して最終Top-Kを計算する
局所候補を減らしてから統合し、全件の完全ソートを避けられる。
局所候補を減らしてから統合し、全件の完全ソートを避けられる。
誤り全レコードを1ノードへ集めて完全ソートする
ネットワーク転送とメモリが集中し、大規模データではボトルネックになる。
ネットワーク転送とメモリが集中し、大規模データではボトルネックになる。
誤りS3ライフサイクルで順位を計算する
保存期間管理は売上集計や順位計算を実行しない。
保存期間管理は売上集計や順位計算を実行しない。
誤りIAMのポリシー順で商品順位を決める
IAMポリシー順はデータ値のランキングを表さない。
IAMポリシー順はデータ値のランキングを表さない。
実際に確かめる
一時的な検証環境で実行できる例です。
Apache SparkのorderBy、limit、分散集約、Top-Kアルゴリズムの公式説明を確認する。期待される結果
全件ソートと分散候補統合の計算量・通信量の違いを説明できる。理解のポイント
- Top-K
- 分散処理
- 候補統合
- 計算量
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 1・Task 1.4と各サービスの公式ドキュメントを確認する。
基礎のおさらい
アルゴリズム設計
データ量・K・パーティション数を基に、完全ソートか候補削減かを選ぶ。
正確性
局所Top-KのKと最終統合、同値順位、NULL・欠損を検証する。
問題IDAWS-DEA-102
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告