1.4標準
Spark Structured Streamingのジョブが途中で停止する。
入力オフセットと状態を復元し、停止済みデータを二重計上せず再開する。
最も適切な方法はどれか。
× 不正解
Structured StreamingのcheckpointLocationを耐久性のあるストレージへ設定し、出力先の冪等性と保持期間を合わせて設計する。
詳細解説
正しいcheckpointLocationを永続S3へ設定し、出力モードと冪等性を設計する
オフセット・状態・進捗を永続化し、再起動後に処理位置を復元できる。
オフセット・状態・進捗を永続化し、再起動後に処理位置を復元できる。
誤りチェックポイントをローカル一時ディスクへ保存する
ノード交換や再起動で状態を失い、最初からの再処理や重複が起こる。
ノード交換や再起動で状態を失い、最初からの再処理や重複が起こる。
誤りS3のライフサイクルでオフセットを削除する
保持期間を短くすると再開に必要な状態を失う。
保持期間を短くすると再開に必要な状態を失う。
誤りIAMポリシーだけでSparkの状態を復元する
権限は状態データを保存・復元しない。
権限は状態データを保存・復元しない。
実際に確かめる
一時的な検証環境で実行できる例です。
Apache Spark Structured Streaming checkpointing、offset、state storeの公式説明を確認する。期待される結果
ローカル状態・S3保持・IAM権限の役割を区別できる。理解のポイント
- Spark Structured Streaming
- checkpoint
- offset
- 状態復元
確認時の注意
- 確認環境: AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
- AWS公式DEA-C01 Domain 1・Task 1.4と各サービスの公式ドキュメントを確認する。
基礎のおさらい
進捗と状態
入力オフセットだけでなく、集計状態や水位を復元して正しい結果を続ける。
再処理と重複
出力モード、トランザクション、冪等キーで再起動時の二重計上を防ぐ。
問題IDAWS-DEA-100
確認環境AWS公式DEA-C01試験ガイドと各サービスの公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告