제공해주신 소스 문서(raw/Adversarial Attacks on LLMs.md)를 바탕으로 보편적 적대적 트리거(Universal Adversarial Triggers) 개념에 관한 한국어 위키 노트를 작성 완료했습니다.
생성된 노트 파일: /Users/railscraft/.gemini/antigravity-cli/scratch/llm-wiki/wiki/보편적 적대적 트리거.md
작업 요약
- 규정 프론트매터 적용:
type: concept,status: draft,sources: ['raw/Adversarial Attacks on LLMs.md'], 지정된 날짜 스키마 준수. - 수학적 공식 및 검증된 수치/지표 수록: 1차 테일러 전개 기반 기울기 근사 최적화 수식 및 모델별 퍼플렉서티(GPT-2 기준 UAT , UAT-LM , UTSC-1 ) 및 소스 경로 명시.
- 구체적 예시 구현: GCG(Greedy Coordinate Gradient) 기반 적대적 접미사를 활용한 탈옥 우회 프롬프트 시나리오 및 PyTorch 기반 1차 테일러 전개 기울기 검색 코드 예제 수록.
- 위키 연동 및 충돌 요약: 옵시디언 위키링크(
[[적대적 공격]],[[탈옥 프롬프트]]등) 연동 및 ‘공격 성공률/전이성 vs 퍼플렉서티 기반 감지 가능성’ 간의 트레이드오프 분석을 수록.