モデル抽出攻撃とは?
モデル抽出攻撃とは、公開された推論APIへ問い合わせを繰り返し、入力と出力の対応関係から元のモデルとほぼ同等に振る舞う複製を作り出す攻撃。学習に投じた費用と知的財産が奪われるだけでなく、複製を手元で解析して敵対的サンプルを効率よく作る足掛かりにもなる。
もでるちゅうしゅつこうげき
モデル抽出攻撃の意味
公開された推論APIへ問い合わせを繰り返し、入力と出力の対応関係から元のモデルとほぼ同等に振る舞う複製を作り出す攻撃。学習に投じた費用と知的財産が奪われるだけでなく、複製を手元で解析して敵対的サンプルを効率よく作る足掛かりにもなる。
モデル抽出攻撃の具体例
分類APIに数万件の入力を投げて確信度付きの結果を集め、それを教師データとして自前のモデルを学習させる。対策は確信度の出力を丸める、レート制限と利用者ごとの問い合わせ傾向の監視、応答に検知用の透かしを埋め込む、といった組合せ。
モデル抽出攻撃は試験でどう引っ掛けられる?
学習データそのものを盗む攻撃ではなく、盗まれるのは入出力の振る舞い。特定の個人データが学習に使われたかを当てるメンバシップ推論攻撃とは目的が異なる。認証を掛けても正規利用者による大量問い合わせは止められない点が難しい。
モデル抽出攻撃と関連する用語
最終更新:2026-08-25/解説は資格暗記が独自に作成しています。 過去問の出典は各問題に記載のとおりです。