Incorporação de Dados de Origem (Passo 0): Construindo a Base

Este artigo explica como incorporamos todo o conteúdo de origem detectável (produtos, peças e páginas do site) em um espaço vetorial compartilhado para suportar a correspondência semântica em todo o pipeline de SEO e busca.

O Problema: Corresponder Consultas a Conteúdo por Significado

Os usuários descrevem a intenção com muitas formulações diferentes. A correspondência por palavra-chave falha quando a formulação da consulta não coincide com a do catálogo.

Usamos incorporações semânticas para que tanto as consultas quanto o conteúdo de origem possam ser comparados por significado (tipicamente via similaridade de cosseno).

O que é Incorporado

Incorporamos todo o conteúdo que um usuário pode descobrir e que o pipeline pode direcionar:

  • Produtos: Os itens do catálogo comercializáveis (título + texto de características + qualquer texto curado/gerado por IA).

  • Peças: Componentes e acessórios comercializáveis (nomes + especificações).

  • Páginas do site: Artigos (/a/) e outras páginas navegáveis que podem aparecer na busca e em links internos.

Incorporar todo o conteúdo detectável permite a recuperação entre tipos (por exemplo, um artigo pode ser classificado para uma consulta orientada a produto, e um produto pode ser classificado para uma consulta informativa quando apropriado).

Arquitetura de Alto Nível

flowchart TD
    A[Catálogo + peças + páginas] --> B[Normalizar & construir descrições]
    B --> C[Deduplicar por URL canônica]
    C --> D[Incorporar incrementalmente]
    D --> E[Matriz de incorporação de origem + índice de chaves]
    E --> F[A jusante: correspondência, roteamento, buscas relacionadas, serviço de busca]

O Pipeline de Incorporação

Passo A: Consolidar Dados de Origem

  • Objetivo: Construir um conjunto de dados canônico dos itens de origem.

  • Entradas: Catálogo de produtos, conjunto de dados de peças e conteúdo de página.

  • Saídas: Um conjunto de dados de origem consolidado com:

    • Chaves: URLs canônicas (usadas como identificadores estáveis)
    • Descrições: Texto usado para incorporação
    • Tipos: Produto / peça / artigo / página (para roteamento a jusante)
  • Processo:

    1. Extrair itens de cada fonte.
    2. Construir uma descrição por item.
    3. Deduplicar por URL canônica para que cada URL seja representada uma vez.

Passo B: Incorporação Incremental

Usamos princípios de aprendizado incremental para evitar recalcular incorporações para conteúdo que não mudou.

  • Objetivo: Incorporar apenas itens novos/alterados, reutilizando incorporações em cache para itens inalterados.

  • Entradas: Conjunto de dados de origem consolidado e um cache de incorporações (execução anterior).

  • Saídas: Matriz de incorporação e índice de chaves atualizados.

  • Processo:

    1. Carregar chaves e incorporações em cache.
    2. Calcular um sinal de mudança para cada item (com base no texto de incorporação do item).
    3. Incorporar apenas itens novos/alterados usando o modelo configurado (veja Estratégia de Incorporação de SEO).
    4. Mesclar incorporações em cache e recém-calculadas em uma ordem estável indexada por URL.

Passo C: Persistir Artefatos

As incorporações são armazenadas em um formato numérico eficiente (comumente via NumPy) junto com um índice de chaves separado para que as etapas a jusante possam mapear linhas de vetores de volta para URLs canônicas.

Construção da Descrição (Que Texto Incorporamos)

Produtos

As descrições de produtos são construídas a partir de:

  • Nome Simplificado: Nome do produto e identificadores-chave (por exemplo, nomeação de SKU/série).

  • Texto de características: Representação legível por humanos das características do produto (veja Estrutura de SKU).

  • Texto de longa forma: Texto curado ou gerado por IA, quando disponível (veja Geração de Conteúdo por IA).

Exemplo (ilustrativo):

<nome do produto>
<descrição curta>
<destaques das características-chave>

Peças

As descrições de peças são construídas a partir de:

  • Nome voltado para o cliente

  • Nome interno (Identificador técnico)

  • Categoria

  • Especificações/atributos renderizados como texto

Páginas do site

As descrições de página são construídas a partir de:

  • Título

  • Trecho do corpo principal (seção de introdução/lead)

  • Identificadores contextuais (rótulos de categoria/família, quando aplicável)

O objetivo é um texto estável e representativo do conteúdo, que mude quando o significado da página mudar.

Regras de Deduplicação

Cada URL canônica aparece uma vez no conjunto de dados consolidado.

  • Por quê: Múltiplas fontes podem descrever a mesma URL através de diferentes caminhos de geração; duplicatas quebram o roteamento, a correspondência e a indexação a jusante.

  • Como: Construir um dicionário indexado por URL canônica e impor unicidade no momento da consolidação. Se duplicatas forem encontradas, o script imprime a contagem e as remove.

Como Outros Passos Usam as Incorporações de Origem

  • Correspondência de produtos: Clusters ou consultas são correspondidos aos itens de origem mais próximos por similaridade semântica (veja Correspondência de Produtos de SEO).

  • Buscas relacionadas: O gerador de buscas relacionadas usa similaridade de incorporação para propor links de navegação relevantes (veja Buscas Relacionadas de SEO).

  • Serviço de busca: A busca online pode usar similaridade vetorial sobre incorporações indexadas (veja Arquitetura do Serviço de Busca).

Veja Também

Referências

Resumo

  • O que: Incorporar produtos, peças e páginas detectáveis em um espaço vetorial compartilhado.

  • Como: Consolidar e deduplicar por URL canônica, depois incorporar incrementalmente apenas itens alterados.

  • Por quê: Isso permite recuperação e roteamento semântico em todo o pipeline (correspondência, buscas relacionadas e busca vetorial online).


← Voltar ao Índice de Documentação