한 줄 정의

피드백 제어 루프 내에서 확률적으로 작동하는 AI 에이전트의 현재 출력값(소스 코드 등)을 실행하여 정상 동작 여부와 오류 내용을 정량적이고 상세하게 진단하는 검증 장치이다.

핵심 요지

  • 루프 비용과 안정성의 결정자: 검증 센서가 반환하는 피드백 정보의 정밀도가 전체 루프의 반복 횟수와 실행 비용을 좌우한다.
  • 상관관계 오류(Correlated Error) 방지: 코드를 작성하는 에이전트(Plant)와 이를 검증하는 센서는 상관관계 오류에 빠지지 않도록 독립적으로 설계되어야 한다.
  • 인간 도메인 지식의 전유물: 비즈니스의 성공 조건을 정의하고 불변 규칙(Invariants)을 규정하는 작업은 기계가 대행할 수 없는 인간 고유의 영역이다.

상세

검증 센서는 다음과 같은 세 가지 설계 원칙을 준수해야 한다:

  1. 풍부한 피드백 제공: 단순 가부(Pass/Fail) 판정이 아닌 실패 함수명, 예외 스택 트레이스(Stack Trace), 디프(Diff) 정보 등을 상세히 오케스트레이터에 전달하여 탐색 범위를 즉각 좁혀 주어야 한다.
  2. 독립성 유지: 코드를 작성한 주체(낙관주의자)가 채점(비관주의자)까지 겸임하면 동일한 논리적 맹점을 발견하지 못하는 상관관계 오류에 노출되므로, 독립된 센서를 분리하여 배치해야 한다.
  3. 결정론적 설계: 간헐적으로 깨지는 테스트(Flaky Test)는 센서의 노이즈로 작용하여 불필요한 재시도 비용을 유발하거나 심각한 결함을 방치하므로, 재시도 필터를 도입하거나 결정론적으로 작동하도록 빌드하여 노이즈를 방어해야 한다.

예시

충돌

  • 대형 모델에만 의존하는 경향성: 대다수 빌더는 가장 강력하고 비싼 대형 모델을 투입하여 코드를 짜게 하면서도 검증에는 아주 빈약한 테스트 한 번만 돌리고 타협한다 raw/Loop Engineering Is NOT What Everybody Thinks It Is.md#L103. 이 경우 불합리한 리소스 비용 낭비가 초래된다.

관련 노트