한 줄 정의

임베딩(Embedding)은 컴퓨터가 텍스트의 의미적 유사성을 연산할 수 있도록 단어나 토큰을 수치화하여 고차원 기하학적 의미 공간 내의 밀집 벡터(Vector)로 사상하는 수학적 표현 방식이다.

핵심 요지

  • 의미적 거리 투영: 의미론적으로 유사한 단어들일수록 고차원 좌표 공간 상에서 가까운 거리에 군집화된다.
  • 통계적 패턴 매칭: 언어 모델은 대규모 텍스트 말뭉치 속 단어들의 출현 빈도를 분석하여 사전 명세 없이 통계적 거리 좌표를 자율 학습한다.
  • 기계 독해의 기저: 컴퓨터가 텍스트 자체를 연산하지 못하는 한계를 수학적 기하 변환을 통해 인공신경망 입력으로 활용할 수 있게 하는 필수 기술이다.

상세

임베딩은 단어들을 거대한 지도 상의 임의의 위치(좌표값)로 나타낸 것으로 직관할 수 있다. 예를 들어 차원 수 1,000개가 넘는 공간 안에서 "King""Queen"은 좌표가 극도로 인접하여 배치되지만, "King""Pizza"는 서로 다른 분면의 까마득히 먼 공간에 배치된다.

이를 통해 인공지능은 텍스트의 상호 관계를 “의미론적 계산”의 형태로 해결할 수 있게 된다. 훈련 데이터가 늘어날수록 단어 임베딩 좌표계의 의미론적 선형 대수 정합성은 더욱 조밀하고 명확해진다.

예시

  • 좌표상 유사성: King - Man + Woman = Queen 과 같은 벡터 연산이 기하 공간상에서 실제로 성립한다.
  • 문맥 유사성: "왕""황제", "국가""나라"처럼 어형은 전혀 다르나 의미가 흡사한 경우 좌표상의 유클리디안 거리 및 코사인 유사도가 0.9 이상으로 매우 높게 측정된다.

관련 노트