2.1基礎
利用者が領収書画像と質問文を送る。
文字、レイアウト、金額を一緒に理解したい。
判断として適切なものを2つ選べ。
× 不正解
マルチモーダル利用では入力形式に対応した能力を確認し、OCR・解像度・表・個人情報を含む評価で検証する。
詳細解説
正しい画像とテキストの入力に対応したモデルの能力・制限を確認する
必要な入力モダリティへ適合するか判断できる。
必要な入力モダリティへ適合するか判断できる。
問題の要件では、画像とテキストの入力に対応したモデルの能力・制限を確認するが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しいOCR誤り、解像度、表の読み取り、機密情報を含む評価セットで検証する
画像特有の品質と安全性を測れる。
画像特有の品質と安全性を測れる。
問題の要件では、OCR誤り、解像度、表の読み取り、機密情報を含む評価セットで検証するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤りテキスト専用モデルへ画像をそのまま渡せば同じ結果になる
入力形式と能力が一致しない。
入力形式と能力が一致しない。
問題の要件では、テキスト専用モデルへ画像をそのまま渡せば同じ結果になるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り画像を扱うため出力の根拠や個人情報制御は不要である
モダリティが増えても説明・安全性が必要である。
モダリティが増えても説明・安全性が必要である。
問題の要件では、画像を扱うため出力の根拠や個人情報制御は不要であるが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 2.1のマルチモーダル基盤モデルと評価を確認する。期待される結果
入力モダリティとモデル能力、画像特有の評価観点を説明できる。理解のポイント
- マルチモーダル
- OCR
- 画像品質
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
マルチモーダルモデル
テキスト、画像、音声など複数の入力・出力形式を扱うモデル。
OCR
画像内の文字を認識してテキストへ変換する処理。
問題IDAWS-AIF-227
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告