소스 데이터 임베딩(0단계): 기반 구축

이 글에서는 SEO 및 검색 파이프라인 전반에 걸쳐 의미론적 매칭을 지원하기 위해, 모든 발견 가능한 소스 콘텐츠(제품, 부품, 온사이트 페이지)를 공유 벡터 공간에 어떻게 임베딩하는지 설명합니다.

문제: 의미를 통해 쿼리와 콘텐츠 매칭하기

사용자는 다양한 표현으로 의도를 설명합니다. 쿼리 문구가 카탈로그 문구와 겹치지 않을 때 키워드 매칭은 실패합니다.

쿼리와 소스 콘텐츠 모두 의미를 기준으로(일반적으로 코사인 유사도를 통해) 비교할 수 있도록 의미론적 임베딩을 사용합니다.

무엇을 임베딩하는가

사용자가 발견할 수 있고 파이프라인이 라우팅할 수 있는 모든 콘텐츠를 임베딩합니다:

  • 제품: 판매 가능한 카탈로그 항목(제목 + 기능 설명 + 모든 큐레이팅/AI 생성 카피).

  • 부품: 판매 가능한 구성 요소 및 액세서리(이름 + 사양).

  • 온사이트 페이지: 아티클(/a/) 및 검색과 내부 링크에 나타날 수 있는 기타 탐색 가능한 페이지.

발견 가능한 모든 콘텐츠를 임베딩하면 유형 간 검색이 가능해집니다(예: 아티클이 제품 지향적 쿼리에 순위를 매길 수 있고, 제품이 적절할 때 정보성 쿼리에 순위를 매길 수 있음).

하이레벨 아키텍처

flowchart TD
    A[카탈로그 + 부품 + 페이지] --> B[정규화 및 설명 구축]
    B --> C[정규 URL 기준 중복 제거]
    C --> D[증분 임베딩]
    D --> E[소스 임베딩 행렬 + 키 인덱스]
    E --> F[다운스트림: 매칭, 라우팅, 관련 검색, 검색 서비스]

임베딩 파이프라인

A단계: 소스 데이터 통합

  • 목적: 소스 항목의 하나의 정규 데이터셋을 구축합니다.

  • 입력: 제품 카탈로그, 부품 데이터셋, 페이지 콘텐츠.

  • 출력: 다음과 같은 통합 소스 데이터셋:

    • 키: 정규 URL(안정적인 식별자로 사용됨)
    • 설명: 임베딩에 사용되는 텍스트
    • 유형: 제품 / 부품 / 아티클 / 페이지 (다운스트림 라우팅용)
  • 프로세스:

    1. 각 소스에서 항목을 추출합니다.
    2. 항목별 설명을 구축합니다.
    3. 정규 URL 기준으로 중복을 제거하여 각 URL이 한 번만 나타나도록 합니다.

B단계: 증분 임베딩

변경되지 않은 콘텐츠에 대한 임베딩 재계산을 피하기 위해 증분 학습 원칙을 사용합니다.

  • 목적: 변경되지 않은 항목에 대해서는 캐시된 임베딩을 재사용하면서, 새롭거나 변경된 항목만 임베딩합니다.

  • 입력: 통합 소스 데이터셋 및 임베딩 캐시(이전 실행).

  • 출력: 업데이트된 임베딩 행렬 및 키 인덱스.

  • 프로세스:

    1. 캐시된 키와 임베딩을 로드합니다.
    2. 각 항목에 대한 변경 신호를 계산합니다(항목의 임베딩 텍스트 기준).
    3. 구성된 모델을 사용하여 새롭거나 변경된 항목만 임베딩합니다(임베딩 전략 참조).
    4. 캐시된 임베딩과 새로 계산된 임베딩을 URL을 키로 하여 안정적인 순서로 병합합니다.

C단계: 아티팩트 저장

임베딩은 효율적인 숫자 형식(일반적으로 NumPy를 통해)으로 저장되며, 별도의 키 인덱스와 함께 저장되어 다운스트림 단계에서 벡터 행을 정규 URL에 다시 매핑할 수 있도록 합니다.

설명 구축 (임베딩하는 텍스트)

제품

제품 설명은 다음으로부터 구축됩니다:

  • 단순화된 이름: 제품 이름 및 주요 식별자(예: SKU/시리즈 명명).

  • 기능 텍스트: 제품 기능의 사람이 읽을 수 있는 표현(SKU 구조 참조).

  • 장문 카피: 사용 가능한 경우 큐레이팅되거나 AI 생성된 카피(콘텐츠 AI 생성 참조).

예시 (설명적):

<제품 이름>
<짧은 설명>
<주요 기능 하이라이트>

부품

부품 설명은 다음으로부터 구축됩니다:

  • 고객용 이름

  • 내부 이름 (기술적 식별자)

  • 카테고리

  • 텍스트로 렌더링된 사양/속성

온사이트 페이지

페이지 설명은 다음으로부터 구축됩니다:

  • 제목

  • 주요 본문 스니펫 (소개/리드 섹션)

  • 컨텍스트 식별자 (해당되는 경우 카테고리/제품군 라벨)

목표는 페이지 의미가 변경될 때 변경되는, 안정적이고 콘텐츠를 대표하는 텍스트입니다.

중복 제거 규칙

각 정규 URL은 통합 데이터셋에 한 번만 나타납니다.

  • 이유: 여러 소스가 다양한 생성 경로를 통해 동일한 URL을 설명할 수 있습니다. 중복은 라우팅, 매칭 및 다운스트림 인덱싱을 방해합니다.

  • 방법: 정규 URL을 키로 하는 딕셔너리를 구축하고 통합 시점에 고유성을 강제합니다. 중복이 발견되면 스크립트가 개수를 출력하고 제거합니다.

다른 단계에서 소스 임베딩을 사용하는 방법

  • 제품 매칭: 클러스터 또는 쿼리는 의미론적 유사도에 따라 가장 가까운 소스 항목과 매칭됩니다(SEO 제품 매칭 참조).

  • 관련 검색: 관련 검색 생성기는 임베딩 유사도를 사용하여 관련 탐색 링크를 제안합니다(SEO 관련 검색 참조).

  • 검색 서비스: 온라인 검색은 인덱싱된 임베딩에 대한 벡터 유사도를 사용할 수 있습니다(검색 서비스 아키텍처 참조).

함께 보기

참고 자료

요약

  • 무엇: 제품, 부품 및 발견 가능한 페이지를 공유 벡터 공간에 임베딩합니다.

  • 방법: 정규 URL 기준으로 통합 및 중복 제거 후, 변경된 항목만 증분 임베딩합니다.

  • 이유: 이는 파이프라인 전반(매칭, 관련 검색, 온라인 벡터 검색)에 걸쳐 의미론적 검색 및 라우팅을 가능하게 합니다.


← 문서 인덱스로 돌아가기