Incorporação de Dados de Origem (Passo 0): Construindo a Base
Este artigo explica como incorporamos todo o conteúdo de origem detectável (produtos, peças e páginas do site) em um espaço vetorial compartilhado para suportar a correspondência semântica em todo o pipeline de SEO e busca.
O Problema: Corresponder Consultas a Conteúdo por Significado
Os usuários descrevem a intenção com muitas formulações diferentes. A correspondência por palavra-chave falha quando a formulação da consulta não coincide com a do catálogo.
Usamos incorporações semânticas para que tanto as consultas quanto o conteúdo de origem possam ser comparados por significado (tipicamente via similaridade de cosseno).
O que é Incorporado
Incorporamos todo o conteúdo que um usuário pode descobrir e que o pipeline pode direcionar:
-
Produtos: Os itens do catálogo comercializáveis (título + texto de características + qualquer texto curado/gerado por IA).
-
Peças: Componentes e acessórios comercializáveis (nomes + especificações).
-
Páginas do site: Artigos (
/a/) e outras páginas navegáveis que podem aparecer na busca e em links internos.
Incorporar todo o conteúdo detectável permite a recuperação entre tipos (por exemplo, um artigo pode ser classificado para uma consulta orientada a produto, e um produto pode ser classificado para uma consulta informativa quando apropriado).
Arquitetura de Alto Nível
flowchart TD
A[Catálogo + peças + páginas] --> B[Normalizar & construir descrições]
B --> C[Deduplicar por URL canônica]
C --> D[Incorporar incrementalmente]
D --> E[Matriz de incorporação de origem + índice de chaves]
E --> F[A jusante: correspondência, roteamento, buscas relacionadas, serviço de busca]O Pipeline de Incorporação
Passo A: Consolidar Dados de Origem
-
Objetivo: Construir um conjunto de dados canônico dos itens de origem.
-
Entradas: Catálogo de produtos, conjunto de dados de peças e conteúdo de página.
-
Saídas: Um conjunto de dados de origem consolidado com:
- Chaves: URLs canônicas (usadas como identificadores estáveis)
- Descrições: Texto usado para incorporação
- Tipos: Produto / peça / artigo / página (para roteamento a jusante)
-
Processo:
- Extrair itens de cada fonte.
- Construir uma descrição por item.
- Deduplicar por URL canônica para que cada URL seja representada uma vez.
Passo B: Incorporação Incremental
Usamos princípios de aprendizado incremental para evitar recalcular incorporações para conteúdo que não mudou.
-
Objetivo: Incorporar apenas itens novos/alterados, reutilizando incorporações em cache para itens inalterados.
-
Entradas: Conjunto de dados de origem consolidado e um cache de incorporações (execução anterior).
-
Saídas: Matriz de incorporação e índice de chaves atualizados.
-
Processo:
- Carregar chaves e incorporações em cache.
- Calcular um sinal de mudança para cada item (com base no texto de incorporação do item).
- Incorporar apenas itens novos/alterados usando o modelo configurado (veja Estratégia de Incorporação de SEO).
- Mesclar incorporações em cache e recém-calculadas em uma ordem estável indexada por URL.
Passo C: Persistir Artefatos
As incorporações são armazenadas em um formato numérico eficiente (comumente via NumPy) junto com um índice de chaves separado para que as etapas a jusante possam mapear linhas de vetores de volta para URLs canônicas.
Construção da Descrição (Que Texto Incorporamos)
Produtos
As descrições de produtos são construídas a partir de:
-
Nome Simplificado: Nome do produto e identificadores-chave (por exemplo, nomeação de SKU/série).
-
Texto de características: Representação legível por humanos das características do produto (veja Estrutura de SKU).
-
Texto de longa forma: Texto curado ou gerado por IA, quando disponível (veja Geração de Conteúdo por IA).
Exemplo (ilustrativo):
<nome do produto>
<descrição curta>
<destaques das características-chave>
Peças
As descrições de peças são construídas a partir de:
-
Nome voltado para o cliente
-
Nome interno (Identificador técnico)
-
Categoria
-
Especificações/atributos renderizados como texto
Páginas do site
As descrições de página são construídas a partir de:
-
Título
-
Trecho do corpo principal (seção de introdução/lead)
-
Identificadores contextuais (rótulos de categoria/família, quando aplicável)
O objetivo é um texto estável e representativo do conteúdo, que mude quando o significado da página mudar.
Regras de Deduplicação
Cada URL canônica aparece uma vez no conjunto de dados consolidado.
-
Por quê: Múltiplas fontes podem descrever a mesma URL através de diferentes caminhos de geração; duplicatas quebram o roteamento, a correspondência e a indexação a jusante.
-
Como: Construir um dicionário indexado por URL canônica e impor unicidade no momento da consolidação. Se duplicatas forem encontradas, o script imprime a contagem e as remove.
Como Outros Passos Usam as Incorporações de Origem
-
Correspondência de produtos: Clusters ou consultas são correspondidos aos itens de origem mais próximos por similaridade semântica (veja Correspondência de Produtos de SEO).
-
Buscas relacionadas: O gerador de buscas relacionadas usa similaridade de incorporação para propor links de navegação relevantes (veja Buscas Relacionadas de SEO).
-
Serviço de busca: A busca online pode usar similaridade vetorial sobre incorporações indexadas (veja Arquitetura do Serviço de Busca).
Veja Também
-
Estratégia de Incorporação de SEO — Escolha do modelo e convenções de incorporação
-
Correspondência de Produtos de SEO — Usando incorporações para roteamento para produtos/páginas
-
Buscas Relacionadas de SEO — Incorporações aplicadas à geração de links internos
-
Arquitetura do Serviço de Busca — Como as incorporações são servidas online
-
Visão Geral do Pipeline de SEO — Contexto do pipeline de ponta a ponta
Referências
Resumo
-
O que: Incorporar produtos, peças e páginas detectáveis em um espaço vetorial compartilhado.
-
Como: Consolidar e deduplicar por URL canônica, depois incorporar incrementalmente apenas itens alterados.
-
Por quê: Isso permite recuperação e roteamento semântico em todo o pipeline (correspondência, buscas relacionadas e busca vetorial online).