3.4標準
二つの回答が異なる文言で同じ意味を表す。
自動指標だけに依存しない。
評価として適切なものを2つ選べ。
× 不正解
意味類似度や文字一致は回帰比較に有用だが、事実性・根拠・欠落・安全性は人手や別評価で確認する。
詳細解説
正しい埋め込み類似度や文字一致を回帰比較に使い、事実性・安全性は別に測る
指標の役割を分けられる。
指標の役割を分けられる。
問題の要件では、埋め込み類似度や文字一致を回帰比較に使い、事実性・安全性は別に測るが解決する範囲と、別の工程が担う範囲を分けて判断する。
正しい代表例を人が確認し、根拠・欠落・矛盾・危険な表現を評価する
意味とリスクを直接確認できる。
意味とリスクを直接確認できる。
問題の要件では、代表例を人が確認し、根拠・欠落・矛盾・危険な表現を評価するが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り意味類似度が高ければ事実性も保証される
似た文でも誤った内容になり得る。
似た文でも誤った内容になり得る。
問題の要件では、意味類似度が高ければ事実性も保証されるが解決する範囲と、別の工程が担う範囲を分けて判断する。
誤り自動指標が高ければ重大な個別失敗を無視する
平均が危険な例を隠す。
平均が危険な例を隠す。
問題の要件では、自動指標が高ければ重大な個別失敗を無視するが解決する範囲と、別の工程が担う範囲を分けて判断する。
実際に確かめる
一時的な検証環境で実行できる例です。
AWS公式AIF-C01 Domain 3.4の評価指標、意味評価、人手レビューを確認する。期待される結果
自動指標の比較用途と、事実性・安全性の限界を説明できる。理解のポイント
- 意味類似度
- 事実性
- 人手評価
確認時の注意
- 確認環境: AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
- AWS公式ドキュメントで、対象サービスが提供する機能と前提条件を確認する。
- モデル、データ、アプリケーション、利用者の責任分界を混同しない。
基礎のおさらい
意味類似度
二つの文章の意味表現がどれだけ近いかを数値化する指標。
自動評価限界
指標が捉えられない事実性・安全性・文脈を別途確認する必要があること。
問題IDAWS-AIF-401
確認環境AWS公式AIF-C01試験ガイドとAWS公式ドキュメントの確認
最終技術確認2026-08-20
誤り・権利侵害を報告