지정해주신 소스 문서(raw/Adversarial Attacks on LLMs.md)를 분석하여 ‘모델 레드팀 공격’(유형: workflow)에 대한 위키 노트를 작성 완료했습니다.

위키 파일은 지정된 노-아스크(No-Ask) 규칙 및 YAML 스키마, 템플릿 구조를 엄격히 준수하여 아래 위치에 저장되었습니다:

  • 파일 경로: llm-wiki/wiki/모델 레드팀 공격.md (절대 경로: /Users/railscraft/.gemini/antigravity-cli/scratch/llm-wiki/wiki/모델 레드팀 공격.md)

작성된 위키 노트 주요 내용 요약

  1. Frontmatter 및 메타데이터:
    • type: workflow, status: draft, sources: ['raw/Adversarial Attacks on LLMs.md'], created: 2026-08-28, updated: 2026-08-28 적용.
  2. 핵심 정의 및 요지:
    • 인간 평가자(Human-in-the-loop) 및 자동화 공격자 모델(Red LM) 기반의 레드팀 공격 워크플로우 정의.
    • Explore-Establish-Exploit 파이프라인, FLIRT(Feedback Loop In-context Red Teaming) 및 RLHF 강화 모델 규모 증가에 따른 적대적 정교함 트레이드오프 분석.
  3. 구체적 지표 및 출처 명시:
    • Ziegler 연구 도구 사용 시 작성 시간 단축(예제당 20분 13분), ParlAI BAD 데이터셋(~2,500개 대화), Anthropic Red Team 데이터셋(~40,000개 시도) 등 수치 표기 및 출처(raw/Adversarial Attacks on LLMs.md) 병기.
  4. 코드 예시 및 실전 시나리오:
    • PyTorch 및 HuggingFace 기반의 레드팀 모델-타겟 모델-유해성 분류기 간 자동화 공격/수집 루프 Python 예시 코드 제공.
    • Vicuna-13b, GPT-3.5-turbo 대상 1에포크 SFT 및 Base64/거절 억제 프롬프트 조합 공격 시나리오 서술.
  5. Obsidian 연동 (관련 노트):