지정해주신 소스 문서(raw/Adversarial Attacks on LLMs.md)를 분석하여 ‘모델 레드팀 공격’(유형: workflow)에 대한 위키 노트를 작성 완료했습니다.
위키 파일은 지정된 노-아스크(No-Ask) 규칙 및 YAML 스키마, 템플릿 구조를 엄격히 준수하여 아래 위치에 저장되었습니다:
- 파일 경로:
llm-wiki/wiki/모델 레드팀 공격.md(절대 경로:/Users/railscraft/.gemini/antigravity-cli/scratch/llm-wiki/wiki/모델 레드팀 공격.md)
작성된 위키 노트 주요 내용 요약
- Frontmatter 및 메타데이터:
type: workflow,status: draft,sources: ['raw/Adversarial Attacks on LLMs.md'],created: 2026-08-28,updated: 2026-08-28적용.
- 핵심 정의 및 요지:
- 인간 평가자(Human-in-the-loop) 및 자동화 공격자 모델(Red LM) 기반의 레드팀 공격 워크플로우 정의.
- Explore-Establish-Exploit 파이프라인, FLIRT(Feedback Loop In-context Red Teaming) 및 RLHF 강화 모델 규모 증가에 따른 적대적 정교함 트레이드오프 분석.
- 구체적 지표 및 출처 명시:
- Ziegler 연구 도구 사용 시 작성 시간 단축(예제당 20분 13분), ParlAI BAD 데이터셋(~2,500개 대화), Anthropic Red Team 데이터셋(~40,000개 시도) 등 수치 표기 및 출처(
raw/Adversarial Attacks on LLMs.md) 병기.
- Ziegler 연구 도구 사용 시 작성 시간 단축(예제당 20분 13분), ParlAI BAD 데이터셋(~2,500개 대화), Anthropic Red Team 데이터셋(~40,000개 시도) 등 수치 표기 및 출처(
- 코드 예시 및 실전 시나리오:
- PyTorch 및 HuggingFace 기반의 레드팀 모델-타겟 모델-유해성 분류기 간 자동화 공격/수집 루프 Python 예시 코드 제공.
Vicuna-13b,GPT-3.5-turbo대상 1에포크 SFT 및 Base64/거절 억제 프롬프트 조합 공격 시나리오 서술.
- Obsidian 연동 (관련 노트):
- LLM 적대적 공격, 탈옥 프롬프트, AI 톤앤매너 가드레일 설정, 프롬프트 주입 방어 등 기존 및 유관 위키 노트와 백링크 연동 구축.