Membership Inference Attack
개념
MIA(Membership Inference Attack: 학습데이터 추론 공격)는 특정 데이터(개인의 정보, 사진, 기록 등)가 해당 머신러닝 모델을 학습시키는 데 사용되었는지 여부를 알아내는 공격이다.
원리
모델은 자신이 이미 학습해서 알고 있는 데이터와 처음 보는 데이터에 다르게 반응한다.
- 학습에 사용된 데이터: 모델이 정답을 이미 알고 있으므로, 매우 높은 확신과 낮은 오차로 결과를 출력한다.
- 처음 보는 데이터: 예측에 대한 확신이 상대적으로 낮고 오차가 크다.
MIA는 본질적으로 모델의 Overfitting 문제를 이용한 공격이다. 모델이 훈련 데이터에 심하게 Overfitting 되어있는 경우, 훈련 데이터와 비훈련 데이터에 대한 출력값의 차이가 극명해지기 때문에 공격자의 공격 성공률은 높아지게 된다. 이러한 특징을 이용하여 공격자는 타겟 모델에 특정 데이터를 입력한 뒤에 나오는 출력값을 분석하여, 이 모델이 해당 데이터를 학습했는지 여부를 확인한다.
방어 기법
MIA를 방어하기 위해서는 앞서 언급한 과적합 문제를 해결하고 공격자의 정보 수집을 차단해야 한다. 방어기법은 아래와 같다.
- 과적합 방지: 모델이 훈련 데이터에 과도하게 맞춰지지 않도록 제약을 가해 일반화 성능을 높인다.
- 출력 정보 제한: 최종 출력을 Confidence Score 대신 최종 예측 라벨만 반환하여 공격에 필요한 데이터를 숨긴다.
- 행동 탐지: 특정 사용자 계정이나 IP에서 짧은 시간 내에 비정상적으로 많은 요청을 보내거나 특이한 형태의 데이터를 집중적으로 입력하는 등 일반 사용자와 다른 패턴을 보이면 이를 공격 시도로 간주하고, 접근을 차단한다.
Leave a comment