소스 데이터 임베딩(0단계): 기반 구축
이 글에서는 SEO 및 검색 파이프라인 전반에 걸쳐 의미론적 매칭을 지원하기 위해, 모든 발견 가능한 소스 콘텐츠(제품, 부품, 온사이트 페이지)를 공유 벡터 공간에 어떻게 임베딩하는지 설명합니다.
문제: 의미를 통해 쿼리와 콘텐츠 매칭하기
사용자는 다양한 표현으로 의도를 설명합니다. 쿼리 문구가 카탈로그 문구와 겹치지 않을 때 키워드 매칭은 실패합니다.
쿼리와 소스 콘텐츠 모두 의미를 기준으로(일반적으로 코사인 유사도를 통해) 비교할 수 있도록 의미론적 임베딩을 사용합니다.
무엇을 임베딩하는가
사용자가 발견할 수 있고 파이프라인이 라우팅할 수 있는 모든 콘텐츠를 임베딩합니다:
-
제품: 판매 가능한 카탈로그 항목(제목 + 기능 설명 + 모든 큐레이팅/AI 생성 카피).
-
부품: 판매 가능한 구성 요소 및 액세서리(이름 + 사양).
-
온사이트 페이지: 아티클(
/a/) 및 검색과 내부 링크에 나타날 수 있는 기타 탐색 가능한 페이지.
발견 가능한 모든 콘텐츠를 임베딩하면 유형 간 검색이 가능해집니다(예: 아티클이 제품 지향적 쿼리에 순위를 매길 수 있고, 제품이 적절할 때 정보성 쿼리에 순위를 매길 수 있음).
하이레벨 아키텍처
flowchart TD
A[카탈로그 + 부품 + 페이지] --> B[정규화 및 설명 구축]
B --> C[정규 URL 기준 중복 제거]
C --> D[증분 임베딩]
D --> E[소스 임베딩 행렬 + 키 인덱스]
E --> F[다운스트림: 매칭, 라우팅, 관련 검색, 검색 서비스]임베딩 파이프라인
A단계: 소스 데이터 통합
-
목적: 소스 항목의 하나의 정규 데이터셋을 구축합니다.
-
입력: 제품 카탈로그, 부품 데이터셋, 페이지 콘텐츠.
-
출력: 다음과 같은 통합 소스 데이터셋:
- 키: 정규 URL(안정적인 식별자로 사용됨)
- 설명: 임베딩에 사용되는 텍스트
- 유형: 제품 / 부품 / 아티클 / 페이지 (다운스트림 라우팅용)
-
프로세스:
- 각 소스에서 항목을 추출합니다.
- 항목별 설명을 구축합니다.
- 정규 URL 기준으로 중복을 제거하여 각 URL이 한 번만 나타나도록 합니다.
B단계: 증분 임베딩
변경되지 않은 콘텐츠에 대한 임베딩 재계산을 피하기 위해 증분 학습 원칙을 사용합니다.
-
목적: 변경되지 않은 항목에 대해서는 캐시된 임베딩을 재사용하면서, 새롭거나 변경된 항목만 임베딩합니다.
-
입력: 통합 소스 데이터셋 및 임베딩 캐시(이전 실행).
-
출력: 업데이트된 임베딩 행렬 및 키 인덱스.
-
프로세스:
- 캐시된 키와 임베딩을 로드합니다.
- 각 항목에 대한 변경 신호를 계산합니다(항목의 임베딩 텍스트 기준).
- 구성된 모델을 사용하여 새롭거나 변경된 항목만 임베딩합니다(임베딩 전략 참조).
- 캐시된 임베딩과 새로 계산된 임베딩을 URL을 키로 하여 안정적인 순서로 병합합니다.
C단계: 아티팩트 저장
임베딩은 효율적인 숫자 형식(일반적으로 NumPy를 통해)으로 저장되며, 별도의 키 인덱스와 함께 저장되어 다운스트림 단계에서 벡터 행을 정규 URL에 다시 매핑할 수 있도록 합니다.
설명 구축 (임베딩하는 텍스트)
제품
제품 설명은 다음으로부터 구축됩니다:
-
단순화된 이름: 제품 이름 및 주요 식별자(예: SKU/시리즈 명명).
-
기능 텍스트: 제품 기능의 사람이 읽을 수 있는 표현(SKU 구조 참조).
-
장문 카피: 사용 가능한 경우 큐레이팅되거나 AI 생성된 카피(콘텐츠 AI 생성 참조).
예시 (설명적):
<제품 이름>
<짧은 설명>
<주요 기능 하이라이트>
부품
부품 설명은 다음으로부터 구축됩니다:
-
고객용 이름
-
내부 이름 (기술적 식별자)
-
카테고리
-
텍스트로 렌더링된 사양/속성
온사이트 페이지
페이지 설명은 다음으로부터 구축됩니다:
-
제목
-
주요 본문 스니펫 (소개/리드 섹션)
-
컨텍스트 식별자 (해당되는 경우 카테고리/제품군 라벨)
목표는 페이지 의미가 변경될 때 변경되는, 안정적이고 콘텐츠를 대표하는 텍스트입니다.
중복 제거 규칙
각 정규 URL은 통합 데이터셋에 한 번만 나타납니다.
-
이유: 여러 소스가 다양한 생성 경로를 통해 동일한 URL을 설명할 수 있습니다. 중복은 라우팅, 매칭 및 다운스트림 인덱싱을 방해합니다.
-
방법: 정규 URL을 키로 하는 딕셔너리를 구축하고 통합 시점에 고유성을 강제합니다. 중복이 발견되면 스크립트가 개수를 출력하고 제거합니다.
다른 단계에서 소스 임베딩을 사용하는 방법
-
제품 매칭: 클러스터 또는 쿼리는 의미론적 유사도에 따라 가장 가까운 소스 항목과 매칭됩니다(SEO 제품 매칭 참조).
-
관련 검색: 관련 검색 생성기는 임베딩 유사도를 사용하여 관련 탐색 링크를 제안합니다(SEO 관련 검색 참조).
-
검색 서비스: 온라인 검색은 인덱싱된 임베딩에 대한 벡터 유사도를 사용할 수 있습니다(검색 서비스 아키텍처 참조).
함께 보기
-
SEO 임베딩 전략 — 모델 선택 및 임베딩 규칙
-
SEO 제품 매칭 — 제품/페이지 라우팅을 위한 임베딩 사용
-
SEO 관련 검색 — 내부 링크 생성에 적용된 임베딩
-
검색 서비스 아키텍처 — 임베딩이 온라인에서 제공되는 방식
-
SEO 파이프라인 개요 — 엔드투엔드 파이프라인 컨텍스트
참고 자료
요약
-
무엇: 제품, 부품 및 발견 가능한 페이지를 공유 벡터 공간에 임베딩합니다.
-
방법: 정규 URL 기준으로 통합 및 중복 제거 후, 변경된 항목만 증분 임베딩합니다.
-
이유: 이는 파이프라인 전반(매칭, 관련 검색, 온라인 벡터 검색)에 걸쳐 의미론적 검색 및 라우팅을 가능하게 합니다.