Evasion Attack
개념
Evasion Attack(회피 공격)이란 학습을 마친 AI모델에게 미세하게 조작된 데이터를 입력하여 잘못된 판단을 유도하는 공격이다. 크게 두가지 방법으로 공격이 가능하다.
- 노이즈 기반 공격
- 적대적 패치(스티커)공격
공격 방식
노이즈 기반 공격 방식
이미지 파일의 픽셀에 사람 눈에 보이지 않을 만큼의 미세한 수치적 변화(노이즈)를 덧씌우는 방식
특징 및 한계
- 사람의 눈에 원본과 똑같아 보인다.
- 계산된 미세한 노이즈이기 때문에 이미지가 압축되면 효과가 사라지는 단점이 있다.
출처: Goodfellow et al., “Explaining and Harnessing Adversarial Examples,” ICLR 2015
적대적 패치 공격 방식
사진 전체를 건드리는 것이 아니라, 화면이나 현실 세계의 물체 위에 특정 무늬가 인쇄된 스티커를 붙여놓는 방식
특징 및 한계
- 이미지 파일에 손댈 필요 없이 스티커를 인쇄해서 현실의 물체에 갖다 붙이기만 하면 공격이 가능하기에 매우 위협적인 공격이다.
- AI가 사진의 각도를 다르게 찍거나, 멀리서 바라보거나, 조명이 조금 어두워도 시각적 특징을 유지하며 AI의 주의를 끌어당기기 때문에 물리적인 환경 변화에 매우 강건하다.
| 구분 | 디지털 노이즈 공격 (Pixel Perturbation) | 적대적 패치 공격 (Adversarial Patch) |
|---|---|---|
| 조작 대상 | 이미지 전체의 모든 픽셀에 미세한 변화 부여 | 이미지의 특정 구역에 화려한 스티커(패치) 부착 |
| 인간의 눈에 | 안 보임 (원본과 완전히 똑같아 보임) | 보임 (이상한 무늬가 대놓고 붙어 있음) |
| 주요 무대 | 디지털 공간 (웹 서버, 앱, 이미지 파일 변조) | 현실 세계 (도로, 표지판, 오프라인 환경) |
| 내구성 | 각도나 조명 변화, 압축에 약함 | 각도나 환경 변화에 강함 (물리적 적용 용이) |
방어 방식
노이즈 기반 공격 방어 방식
- 입력 전처리
- AI모델에 이미지를 입력하기 전에 이미지를 뭉개거나 압축, 픽셀 재배치 등을 통해서 공격을 무력화시킨다.
- 적대적 학습
- 방어 원리: AI를 학습시키는 훈련 단계에서 정상 데이터 뿐만 아니라, 노이즈가 섞인 가짜 이미지나 적대적 패치가 붙은 이미지도 대량으로 미리 학습시킨다. 이런한 식으로 노이즈가 섞여있는 데이터가 input값으로 들어와도 속지 못하도록 미리 학습을 해놓는 것이다.
- 한계점: 해커의 공격 패턴을 미리 예측해서 학습시켜야 하므로, AI가 한 번도 본 적 없는 완전히 새로운 방식의 기발한 노이즈나 패치 공격이 들어오면 다시 속을 수 있다
적대적 패치 공격 방어 방식
- 패치 마스킹
- AI는 패치에 강하게 시선을 뺏긴다. 방어 시스템은 이미지 안에서 “비정상적으로 특징이 뭉쳐 있고 시선을 너무 많이 뺏는 좁은 구역”을 탐지한다. 그 구역을 찾아내면 Masking을 한 뒤 AI에게 보여준다.
- 적대적 학습
- 방어 원리: AI를 학습시키는 훈련 단계에서 정상 데이터 뿐만 아니라, 노이즈가 섞인 가짜 이미지나 적대적 패치가 붙은 이미지도 대량으로 미리 학습시킨다. 이런한 식으로 노이즈가 섞여있는 데이터가 input값으로 들어와도 속지 못하도록 미리 학습을 해놓는 것이다.
- 한계점: 해커의 공격 패턴을 미리 예측해서 학습시켜야 하므로, AI가 한 번도 본 적 없는 완전히 새로운 방식의 기발한 노이즈나 패치 공격이 들어오면 다시 속을 수 있다
Leave a comment