SECTION Ⅴ · 레드티밍 이행
넓게 훑고, 깊게 파고든다
자동화 전수조사 + 전문가 심층 점검, 그리고 영향 분석과 증적 기록.
1공격 수행
2단계 검증 접근법
한정된 자원 안에서 효율과 깊이를 동시에 확보하기 위해 두 단계로 나눠 점검합니다.
1단계 · 자동화 도구 활용공격 표면 전체에 정형 페이로드 대량 투입 · 탈옥 템플릿·적대적 예제 API 전송 · 적응형 변이 공격(Attacker LLM) 재시도 · 악용 점수로 후보 1차 선별
2단계 · 전문가 심층 점검자동화가 못 뚫은 가드레일·복합 취약점 직접 공략 · 맥락 기반 우회(심층 역할극·경쟁 조건) · 멀티턴 공격으로 도메인 위험 실증 · 화이트박스 시 CoT·어텐션 분석
확장 방법론: LLM-as-an-Attacker(공격 자동 생성) + LLM-as-a-Judge(자동 평가) 병행
특정 시나리오를 수행하지 않기로 했더라도, 고위험 시나리오는 최종 보고서에 반드시 기록해 향후 대책 수립과 잔여 위험 파악에 활용합니다.
2영향 분석
'성공' 여부보다 '영향'이 중요하다
공격 성공 여부뿐 아니라 결과가 시스템에 미치는 영향을 분석합니다. 이론적 위험과 실제 확인된 영향을 구분하는 것이 핵심입니다.
안전 영향실행 가능성·신규성·위험도(일반 지식~물리적 위해)
성능·가용성리소스 포화, 지연 시간 악화, 서비스 거부 가능성
품질·신뢰성환각 심각도, 편향·공정성 문제
시스템 영향측면이동, 연쇄적 장애, 추적 가능성 상실
후속 결과 분석 — 출력이 실제 코드·명령 실행으로 이어지는 실행 위험, 외부 공개 시 평판 영향 검토
근본 원인 분석 — 취약한 시스템 프롬프트, 출력 필터링 부재, 권한 검증 미흡 등 실패 원인 규명
3기록 관리
재현할 수 없으면 고칠 수 없다
기록은 취약점을 정확히 재현하고 근본 원인을 분석하는 핵심 데이터 자산입니다. 공격 시나리오·입력 프롬프트·시스템 응답·모델 버전·하이퍼파라미터를 구조화해 남깁니다.
로그 데이터 스키마 — 평가 매트릭스와 연동되도록 3분류로 저장
입력공격 목표·표면, 사용 페이로드, 모델 파라미터
출력모델 응답, 호출 도구·인자, 지연 시간
평가취약 판단, 악용 점수, 영향 여부, 평가자
공격 체인 스냅샷 — 멀티턴 공격의 전체 대화를 한 세션으로 저장
재현 스크립트 — RAG·외부 API 의존 취약점을 파이썬으로 동일 재현
시각적 증거 — UI 취약점(XSS 등)은 스크린샷·화면 녹화로 보존
AI 보안 레드티밍 가이드 · ⑤ 레드티밍 이행 · 총 6편 중 5편