한 줄 정의

AI 에이전트의 Think-Act-Observe 자율 루프를 프로덕션 환경에서 안정적으로 구동하기 위해 독립 분리된 7개 기술 레이어(오케스트레이션, 메모리, 프로토콜, 브라우저, 코딩 에이전트, 평가/관측성, 인퍼런스)의 모듈형 소프트웨어 아키텍처이다.

핵심 요지

  • 독립적 7개 레이어 의사결정: 단일 에코시스템으로 전체 스택을 충족할 수 없으므로, 레이어별 지배적 제약 조건(Latency, Audit Trail, Model Portability, Language Stack)에 맞춰 최적 도구를 각각 선택해야 한다.
  • Runtime State vs Knowledge Memory 분리: 내구성이 필요한 상태 관리(LangGraph PostgresSaver)와 세션 초월 지식 저장소(Mem0/Zep)를 동일 도구로 통합 처리 시 시스템 크래시 복구 및 맥락 보존이 동시에 파괴된다.
  • MCP(Model Context Protocol) 표준 정립: 툴 인터페이스 레이어는 MCP로 통일되며 FastMCP, mcp-agent 등이 프레임워크 표준 연결을 담당한다.
  • DOM/Vision 하이브리드 브라우저 제어: 평시에는 DOM-driven(Browser Use, Stagehand)으로 고속 처리하고, Canvas/Anti-bot 영역은 Vision-driven(Skyvern)을 Escape hatch로 병용한다.

상세

7개 레이어의 구체적 오픈소스 지형 및 선택 기준은 다음과 같다:

  1. Layer 1: Orchestration & Runtime Control
    • LangGraph: Python 프로덕션 표준. Graph 기반 State Machine, PostgresSaver 내구성, Audit log 타임트래블 디버깅 제공.
    • CrewAI: 프로토타이핑에 최적화되나 crashed run 재개 불과.
    • Pydantic AI: Pydantic 기반 타입 안전성 및 자동 재시도 중심.
    • Mastra: TypeScript/Next.js 스택 표준.
  2. Layer 2: Memory & State
    • Mem0: 하이브리드 Vector/Graph. LoCoMo 벤치마크 기준 Latency 92%, 토큰 93% 감소 (14배 저렴).
    • Zep/Graphiti: Temporal Knowledge Graph. 시간축 추론 가능하나 conversation당 600K 토큰 소모 (Mem0 1.7K 대비 극심한 부하).
    • Letta: 가상 메모리(OS) 구조.
  3. Layer 3: Protocols & Tools: FastMCP, mcp-agent.
  4. Layer 4: Browsers & CUA: Browser Use (Python 기본값, 50K+ stars), Stagehand (TS/Chrome CDP), Skyvern (Vision-first, WebVoyager 2.0 85.85% 달성).
  5. Layer 5: Coding Agents & Sandboxes: OpenHands (SWE-bench Verified 53%+), Aider (Git 통합, 30~40% 토큰 절감), Cline (VS Code Plan/Act 모드).
  6. Layer 6: Evals & Observability: Langfuse (오픈소스 기본값), Arize Phoenix (OTel 네이티브), Inspect AI (안전성 평가).
  7. Layer 7: Models & Inference: vLLM (PagedAttention, 프로덕션 표준), Ollama (로컬), llama.cpp (C++ CPU/Apple Silicon), SGLang (JSON 스키마 엔진 내장 강제).

예시

  • Mem0 vs Zep 성능 비교 수치: LoCoMo 벤치마크에서 Mem0 적용 시 순수 Full-context 대비 Latency 92% 감소, 토큰 93% 절감, 토큰 소비량 1,764 토큰 달성. 반면 Zep은 대화당 600,000 토큰 초과 소비.
  • Coding Agent SWE-bench: OpenHands + Claude 4.5 조합 시 SWE-bench Verified 53%+ 해답률 기록.

충돌

  • Latency-first vs Audit-first 스택 충돌: 지연 시간 최적화 스택은 Mem0 + vLLM으로 수렴하는 반면, 감사/규제 준수 우선 스택은 LangGraph + Langfuse 조합으로 이동한다. 한 에코시스템으로 두 제약을 동시 충족할 수 없다.
  • DOM vs Vision 브라우징: DOM 제어가 Vision 제어 대비 1217점 높고 step당 비용이 48배 저렴하므로, Vision 전용 프레임워크를 기본 경로로 사용하는 것은 비효율적이다.

관련 노트