Incorporamento dei Dati Sorgente (Passo 0): Costruire le Fondamenta

Questo articolo spiega come incorporiamo tutti i contenuti sorgente scopribili (prodotti, parti e pagine del sito) in uno spazio vettoriale condiviso per supportare l'abbinamento semantico nell'intera pipeline di SEO e ricerca.

Il Problema: Abbinare le Query ai Contenuti per Significato

Gli utenti descrivono l'intento con molte formulazioni diverse. L'abbinamento per parole chiave fallisce quando la formulazione della query non coincide con la terminologia del catalogo.

Utilizziamo incorporamenti semantici in modo che sia le query che i contenuti sorgente possano essere confrontati per significato (tipicamente tramite similarità del coseno).

Cosa Viene Incorporato

Incorporiamo tutti i contenuti che un utente può scoprire e che la pipeline può indirizzare:

  • Prodotti: Gli articoli vendibili del catalogo (titolo + testo delle caratteristiche + qualsiasi testo curato/generato da IA).

  • Parti: Componenti e accessori vendibili (nomi + specifiche).

  • Pagine del sito: Articoli (/a/) e altre pagine navigabili che possono apparire nei risultati di ricerca e nei link interni.

Incorporare tutti i contenuti scopribili abilita il recupero tra tipi diversi (ad esempio, un articolo può posizionarsi per una query orientata al prodotto, e un prodotto può posizionarsi per una query informativa quando appropriato).

Architettura di Alto Livello

flowchart TD
    A[Catalogo + parti + pagine] --> B[Normalizza & costruisci descrizioni]
    B --> C[Deduplica per URL canonico]
    C --> D[Incorporamento incrementale]
    D --> E[Matrice di incorporamento sorgente + indice delle chiavi]
    E --> F[A valle: abbinamento, instradamento, ricerche correlate, servizio di ricerca]

La Pipeline di Incorporamento

Passo A: Consolidare i Dati Sorgente

  • Scopo: Costruire un dataset canonico unico di elementi sorgente.

  • Input: Catalogo prodotti, dataset delle parti e contenuto delle pagine.

  • Output: Un dataset sorgente consolidato con:

    • Chiavi: URL canonici (usati come identificatori stabili)
    • Descrizioni: Testo usato per l'incorporamento
    • Tipi: Prodotto / parte / articolo / pagina (per l'instradamento a valle)
  • Processo:

    1. Estrai gli elementi da ogni sorgente.
    2. Costruisci una descrizione per ogni elemento.
    3. Deduplica per URL canonico in modo che ogni URL sia rappresentato una sola volta.

Passo B: Incorporamento Incrementale

Utilizziamo principi di apprendimento incrementale per evitare di ricalcolare gli incorporamenti per contenuti che non sono cambiati.

  • Scopo: Incorporare solo gli elementi nuovi/cambiati, riutilizzando gli incorporamenti in cache per gli elementi invariati.

  • Input: Dataset sorgente consolidato e una cache di incorporamenti (esecuzione precedente).

  • Output: Matrice di incorporamento e indice delle chiavi aggiornati.

  • Processo:

    1. Carica le chiavi e gli incorporamenti in cache.
    2. Calcola un segnale di cambiamento per ogni elemento (basato sul testo di incorporamento dell'elemento).
    3. Incorpora solo gli elementi nuovi/cambiati utilizzando il modello configurato (vedi Strategia di Incorporamento SEO).
    4. Unisci gli incorporamenti in cache e quelli appena calcolati in un ordine stabile indicizzato per URL.

Passo C: Persistenza degli Artefatti

Gli incorporamenti sono memorizzati in un formato numerico efficiente (comunemente tramite NumPy) insieme a un indice separato delle chiavi, in modo che i passaggi a valle possano mappare le righe dei vettori agli URL canonici.

Costruzione della Descrizione (Quale Testo Incorporiamo)

Prodotti

Le descrizioni dei prodotti sono costruite da:

  • Nome Semplificato: Nome del prodotto e identificatori chiave (es. denominazione SKU/serie).

  • Testo delle caratteristiche: Rappresentazione leggibile delle caratteristiche del prodotto (vedi Struttura SKU).

  • Testo esteso: Testo curato o generato da IA, dove disponibile (vedi Generazione Contenuti con IA).

Esempio (illustrativo):

<nome prodotto>
<descrizione breve>
<punti salienti delle caratteristiche chiave>

Parti

Le descrizioni delle parti sono costruite da:

  • Nome per il cliente

  • Nome interno (Identificatore tecnico)

  • Categoria

  • Specifiche/attributi resi come testo

Pagine del sito

Le descrizioni delle pagine sono costruite da:

  • Titolo

  • Snippet del corpo principale (sezione introduttiva/lead)

  • Identificatori contestuali (etichette di categoria/famiglia, dove applicabile)

L'obiettivo è un testo stabile e rappresentativo del contenuto, che cambi quando cambia il significato della pagina.

Regole di Deduplicazione

Ogni URL canonico appare una sola volta nel dataset consolidato.

  • Perché: Fonti multiple possono descrivere lo stesso URL attraverso diversi percorsi di generazione; i duplicati compromettono l'instradamento, l'abbinamento e l'indicizzazione a valle.

  • Come: Costruisci un dizionario indicizzato per URL canonico e imponi l'unicità al momento del consolidamento. Se vengono trovati duplicati, lo script ne stampa il conteggio e li rimuove.

Come gli Altri Passi Utilizzano gli Incorporamenti Sorgente

  • Abbinamento prodotti: I cluster o le query vengono abbinati agli elementi sorgente più vicini per similarità semantica (vedi Abbinamento Prodotti SEO).

  • Ricerche correlate: Il generatore di ricerche correlate utilizza la similarità degli incorporamenti per proporre link di navigazione pertinenti (vedi Ricerche Correlate SEO).

  • Servizio di ricerca: La ricerca online può utilizzare la similarità vettoriale sugli incorporamenti indicizzati (vedi Architettura del Servizio di Ricerca).

Vedi Anche

Riferimenti

Riepilogo

  • Cosa: Incorporare prodotti, parti e pagine scopribili in uno spazio vettoriale condiviso.

  • Come: Consolidare e deduplicare per URL canonico, poi incorporare in modo incrementale solo gli elementi cambiati.

  • Perché: Questo abilita il recupero e l'instradamento semantico attraverso la pipeline (abbinamento, ricerche correlate e ricerca vettoriale online).


← Torna all'Indice della Documentazione