AI 모델 공격 기법
Membership Inference Attack (MIA)
특정 데이터가 모델의 학습 데이터셋에 포함되었는지 추론하는 공격. 개인정보 유출 위험이 높음.
핵심 원리
- 학습 데이터에 대한 모델의 confidence score가 더 높음
- Shadow Model을 활용한 차별화 분석
- Loss 값 분포를 통한 멤버십 판별
Model Extraction (모델 추출)
API를 통해 블랙박스 모델의 기능을 복제하는 공격. 상업적 모델의 지식재산권 침해 가능.
공격 시나리오
- Query Synthesis: 합성 데이터로 API 호출
- Knockoff Nets: 대체 모델 학습
- Functionally Equivalent Extraction
Model Inversion (모델 역전)
모델의 출력으로부터 학습 데이터를 역추론. 얼굴 인식 모델에서 원본 얼굴 복원 가능.
핵심 메커니즘
- Gradient Ascent on Input Space
- GAN-based Reconstruction
- Confidence Score 활용한 픽셀 복원
Backdoor Attack (백도어 공격)
학습 단계에서 트리거 패턴을 삽입, 추론 시 특정 입력에 대해 원하는 출력 유도.
공격 유형
- BadNets: 특정 픽셀 패턴 트리거
- Clean Label Attack: 라벨 변경 없이 주입
- Physical Backdoor: 실제 물체 트리거
적대적 머신러닝 (Adversarial ML)
FGSM (Fast Gradient Sign Method)
Goodfellow et al. (2015) 제안. 손실 함수의 기울기 방향으로 미세하게 입력을 왜곡.
수식
- x' = x + ε · sign(∇ₓJ(θ, x, y))
- ε: 왜곡 크기 (보통 0.007~0.03)
- 단일 스텝으로 빠른 공격 생성
PGD (Projected Gradient Descent)
Iterative FGSM. 여러 스텝에 걸쳐 공격을 반복, 더 강력한 적대적 샘플 생성.
특징
- Random Start로 로컬 최적화 회피
- ε-ball 내에서 프로젝션
- First-order 공격의 "강력한 베이스라인"
C&W Attack (Carlini & Wagner)
L-BFGS보다 효율적이고 강력한 공격. Distance metric 최적화 기반.
최적화 문제
- minimize ||δ||ₚ + c · f(x+δ)
- f: objective function (타겟 클래스 확률 극대화)
- L0, L2, L∞ 세 가지 버전 존재
Transfer Attack (전이 공격)
한 모델에서 생성한 적대적 샘플이 다른 모델에서도 작동하는 현상. 블랙박스 공격의 핵심.
전이성 향상 기법
- Ensemble Attack: 여러 모델 동시 공격
- Input Transformation (DIM, TIM)
- Model Augmentation (MI-FGSM)
AutoAttack
적대적 방어의 강건성을 평가하는 표준 벤치마크. 4가지 공격의 앙상블.
구성 공격
- APGD-CE: Cross-Entropy 기반
- APGD-DLR: DLR Loss 기반
- FAB (Fast Adaptive Boundary)
- Square Attack: 쿼리 기반
Universal Adversarial Perturbation
단일 노이즈 패턴으로 대부분의 이미지를 오분류. 모델의 기하학적 취약성 노출.
특징
- 데이터셋 전체에 적용 가능한 단일 perturbation
- 모델의 의사결정 경계 구조 분석
- 물리적 세계 공격에도 활용 가능
LLM 프롬프트 보안
Prompt Injection (프롬프트 인젝션)
사용자 입력에 악성 지시를 삽입하여 LLM의 행동을 조작. OWASP Top 10 for LLM #1.
공격 유형
- Direct Injection: 시스템 프롬프트 우회
- Indirect Injection: 외부 데이터 삽입
- Multi-turn Jailbreak: 대화 맥락 조작
Jailbreak Techniques
LLM의 안전 장치를 우회하여 해로운 출력을 유도하는 다양한 기법.
주요 기법
- Role-play: "DAN" (Do Anything Now)
- Encoding: Base64, ROT13, Leetspeak
- Hypothetical Framing: "가상의 시나리오에서..."
- Gradient-based: GCG (Greedy Coordinate Gradient)
Prompt Leaking
시스템 프롬프트나 Few-shot 예시를 유출. 프롬프트 엔지니어링 노하우 탈취.
유출 기법
- "Repeat the words above" 트릭
- JSON/XML 포맷 강제 출력
- Token 분석을 통한 역추론
Token Smuggling
금지된 단어를 토큰 단위로 분할하여 필터링 우회. 바이트 수준 조작.
구현 방식
- Byte-level tokenization exploit
- Unicode homoglyph attack
- Token boundary manipulation
모델 보안 & 취약점 분석
Weight Stealing (가중치 탈취)
API 호출을 통해 모델의 내부 가중치를 역산. Fully-connected layer 복원 가능.
공격 벡터
- Equation-solving via carefully crafted queries
- Side-channel: 타이밍/전력 분석
- Gradient leakage in Federated Learning
Data Poisoning (데이터 오염)
학습 데이터셋에 악성 샘플 주입. 모델의 전반적인 동작을 왜곡.
공격 시나리오
- Label Flipping: 라벨 반전
- Clean Label: 보이지 않는 오염
- Semantic Backdoor: 의미적 트리거
Gradient Inversion (그래디언트 역전)
연합학습에서 공유된 그래디언트로부터 원본 데이터 복원. 개인정보 침해.
핵심 기법
- Deep Leakage from Gradients (DLG)
- Inverting Gradients (iDLG)
- Robust Aggregation 필요
Supply Chain Attack
모델 가중치, 데이터셋, 라이브러리 체인의 취약점을 이용.
공격 지점
- Pre-trained Model Tampering
- Dataset Contamination
- Dependency Confusion
- Pickle Deserialization (PyTorch)
방어 메커니즘
Adversarial Training
적대적 샘플을 학습 데이터에 포함시켜 모델의 강건성 향상. Madry et al. 제안.
구현 전략
- PGD-based Adversarial Training
- TRADES: Robustness-Accuracy Trade-off
- Free Adversarial Training (메모리 효율)
Input Preprocessing
입력 데이터 전처리로 적대적 노이즈 제거 또는 완화.
기법 목록
- Feature Squeezing: 색상/공간 압축
- JPEG Compression: 고주파 노이즈 제거
- Spatial Smoothing: Gaussian blur
- Pixel Deflection: 랜덤 픽셀 이동
Certified Defense
수학적으로 보증된 강건성. Randomized Smoothing이 대표적.
Randomized Smoothing
- 입력에 Gaussian noise 추가
- Smoothed classifier: f(x) = E[f(x+δ)]
- Certified Radius 계산 가능
- Neyman-Pearson Lemma 기반 증명
LLM Defense Strategies
대형 언어 모델 특화 방어 기법.
방어 기법
- Prompt Filtering: 입력 검열
- Output Monitoring: 출력 감시
- Instruction Hierarchy: 지시 계층 구조
- Constitutional AI: 원칙 기반 학습
Differential Privacy
학습 과정에 노이즈를 추가하여 개인정보 보호. 수학적 프라이버시 보장.
핵심 개념
- (ε, δ)-Differential Privacy
- DP-SGD: 프라이버시 preserving 학습
- Privacy Budget 관리
- Membership Inference 방어
Model Watermarking
모델에 보이지 않는 워터마크 삽입. 모델 추출 탐지 및 저작권 보호.
기법
- White-box: 가중치 기반 워터마크
- Black-box: 트리거 세트 기반
- Feature-based: 중간 레이어 활성화
도구 & 프레임워크
| 도구명 | 카테고리 | 설명 | 심각도/중요도 |
|---|---|---|---|
| Adversarial Robustness Toolbox (ART) | 공격/방어 | IBM 개발. 30+ 공격, 20+ 방어 기법 포함 | 필수 |
| Foolbox | 적대적 공격 | PyTorch/TensorFlow/JAX 지원. Gradient-free 공격 포함 | 권장 |
| TextAttack | NLP 공격 | 텍스트 기반 적대적 공격 프레임워크 | 권장 |
| Garak | LLM 보안 | LLM 취약점 스캐닝. Prompt injection, jailbreak 탐지 | 필수 |
| PyRIT | LLM Red Teaming | Microsoft 개발. 자동화된 LLM Red Teaming | 권장 |
| SecML | 보안 ML | 이탈리아 CNR 개발. Evasion, Poisoning, Extraction | 참고 |
| CleverHans | 적대적 예제 | Google Brain. TensorFlow 기반 벤치마크 | 참고 |
| Privacy Meter | 프라이버시 | Membership Inference Attack 측정 도구 | 권장 |
| TensorFlow Privacy | DP 학습 | TensorFlow용 Differential Privacy 라이브러리 | 권장 |
| Backdoors101 | 백도어 | 백도어 공격/방어 연구 플랫폼 | 참고 |
AI 보안 연구 타임라인
2014 — Szegedy et al.
적대적 예제의 존재 최초 발견. 딥러닝 모델의 취약성 입증.
2015 — Goodfellow et al. (FGSM)
Fast Gradient Sign Method 제안. 효율적인 적대적 공격 생성.
2017 — Madry et al. (PGD)
Projected Gradient Descent. 적대적 훈련의 표준 베이스라인 확립.
2018 — Carlini & Wagner (C&W)
강력한 공격 방법론. 방어 메커니즘의 취약점 입증.
2019 — Cohen et al. (Randomized Smoothing)
Certified Defense의 실용화. 수학적 보증 가능.
2021 — GCG (Greedy Coordinate Gradient)
자동화된 jailbreak 생성. LLM 보안의 새로운 위협.
2023 — OWASP Top 10 for LLM
LLM 애플리케이션 보안 위험 Top 10 발표.
2024 — AutoAttack Standardization
적대적 방어 평가의 표준화. 연구의 재현성 향상.
AI 보안 실무 체크리스트
모델 배포 전
- AutoAttack 기반 강건성 평가
- Membership Inference 취약점 테스트
- Model Extraction 저항성 검증
- Privacy Budget 계산 (DP-SGD)
- Watermark 삽입 및 검증
LLM 서비스 운영 시
- Input/Output 필터링 레이어 구축
- Prompt Injection 탐지 시스템
- Rate Limiting & Query Monitoring
- Instruction Hierarchy 적용
- Red Teaming 주기적 수행
연합학습 환경
- Secure Aggregation 프로토콜
- Gradient Clipping & Noise 추가
- Byzantine-robust Aggregation
- Gradient Inversion 방어
- 참여자 신원 검증
Supply Chain 보안
- Pre-trained Model Hash 검증
- Dependency 취약점 스캐닝
- Pickle 파일 보안 검토
- Model Card & Provenance 문서화
- SBOM (Software Bill of Materials)