Intégration des Données Sources (Étape 0) : Construire les Fondations

Cet article explique comment nous intégrons tout le contenu source découvrable (produits, pièces et pages du site) dans un espace vectoriel partagé pour supporter l'appariement sémantique dans le pipeline SEO et de recherche.

Le Problème : Apparier les Requêtes au Contenu par le Sens

Les utilisateurs expriment leur intention avec de nombreuses formulations différentes. L'appariement par mots-clés échoue lorsque la formulation de la requête ne recoupe pas celle du catalogue.

Nous utilisons des intégrations sémantiques afin que les requêtes et le contenu source puissent être comparés par leur sens (généralement via la similarité cosinus).

Ce qui est Intégré

Nous intégrons tout le contenu qu'un utilisateur peut découvrir et que le pipeline peut router :

  • Produits : Les articles du catalogue vendables (titre + texte des caractéristiques + toute copie organisée/générée par IA).

  • Pièces : Les composants et accessoires vendables (noms + spécifications).

  • Pages du site : Articles (/a/), et autres pages navigables pouvant apparaître dans les résultats de recherche et les liens internes.

L'intégration de tout le contenu découvrable permet une récupération inter-types (par exemple, un article peut être classé pour une requête orientée produit, et un produit peut être classé pour une requête informationnelle le cas échéant).

Architecture Haut Niveau

flowchart TD
    A[Catalog + parts + pages] --> B[Normalize & build descriptions]
    B --> C[Deduplicate by canonical URL]
    C --> D[Incremental embedding]
    D --> E[Source embedding matrix + key index]
    E --> F[Downstream: matching, routing, related searches, search service]

Le Pipeline d'Intégration

Étape A : Consolider les Données Sources

  • Objectif : Construire un jeu de données canonique unique des éléments sources.

  • Entrées : Catalogue produits, jeu de données des pièces, et contenu des pages.

  • Sorties : Un jeu de données source consolidé avec :

    • Clés : URLs canoniques (utilisées comme identifiants stables)
    • Descriptions : Texte utilisé pour l'intégration
    • Types : Produit / pièce / article / page (pour le routage en aval)
  • Processus :

    1. Extraire les éléments de chaque source.
    2. Construire une description par élément.
    3. Dédupliquer par URL canonique afin que chaque URL ne soit représentée qu'une fois.

Étape B : Intégration Incrémentielle

Nous utilisons les principes de l'apprentissage incrémental pour éviter de recalculer les intégrations pour le contenu qui n'a pas changé.

  • Objectif : Intégrer uniquement les éléments nouveaux/modifiés tout en réutilisant les intégrations en cache pour les éléments inchangés.

  • Entrées : Jeu de données source consolidé et un cache d'intégrations (exécution précédente).

  • Sorties : Matrice d'intégration et index des clés mis à jour.

  • Processus :

    1. Charger les clés et intégrations en cache.
    2. Calculer un signal de changement pour chaque élément (basé sur le texte d'intégration de l'élément).
    3. Intégrer uniquement les éléments nouveaux/modifiés en utilisant le modèle configuré (voir Stratégie d'Intégration SEO).
    4. Fusionner les intégrations en cache et nouvellement calculées dans un ordre stable indexé par URL.

Étape C : Persister les Artéfacts

Les intégrations sont stockées dans un format numérique efficace (généralement via NumPy) avec un index de clés séparé afin que les étapes en aval puissent mapper les lignes de vecteurs aux URLs canoniques.

Construction de la Description (Quel Texte Nous Intégrons)

Produits

Les descriptions de produits sont construites à partir de :

  • Nom Simplifié : Nom du produit et identifiants clés (par ex., référence/série).

  • Texte des caractéristiques : Représentation lisible par un humain des caractéristiques du produit (voir Structure des Références).

  • Copie longue : Copie organisée ou générée par IA lorsque disponible (voir Génération de Contenu par IA).

Exemple (illustratif) :

<product name>
<short description>
<key feature highlights>

Pièces

Les descriptions de pièces sont construites à partir de :

  • Nom client

  • Nom interne (Identifiant technique)

  • Catégorie

  • Spécifications/attributs rendus sous forme de texte

Pages du site

Les descriptions de pages sont construites à partir de :

  • Titre

  • Extrait du corps principal (section introductive/lead)

  • Identifiants contextuels (libellés de catégorie/famille le cas échéant)

L'objectif est un texte stable et représentatif du contenu, qui change lorsque le sens de la page change.

Règles de Déduplication

Chaque URL canonique apparaît une seule fois dans le jeu de données consolidé.

  • Pourquoi : Plusieurs sources peuvent décrire la même URL via différents chemins de génération ; les doublons cassent le routage, l'appariement et l'indexation en aval.

  • Comment : Construire un dictionnaire indexé par URL canonique et imposer l'unicité au moment de la consolidation. Si des doublons sont trouvés, le script affiche le compte et les supprime.

Comment les Autres Étapes Utilisent les Intégrations Sources

  • Appariement de produits : Les clusters ou requêtes sont appariés aux éléments sources les plus proches par similarité sémantique (voir Appariement de Produits SEO).

  • Recherches associées : Le générateur de recherches associées utilise la similarité d'intégration pour proposer des liens de navigation pertinents (voir Recherches Associées SEO).

  • Service de recherche : La recherche en ligne peut utiliser la similarité vectorielle sur les intégrations indexées (voir Architecture du Service de Recherche).

Voir Aussi

Références

Résumé

  • Quoi : Intégrer les produits, pièces et pages découvrables dans un espace vectoriel partagé.

  • Comment : Consolider et dédupliquer par URL canonique, puis intégrer de manière incrémentielle uniquement les éléments modifiés.

  • Pourquoi : Cela permet la récupération et le routage sémantique à travers le pipeline (appariement, recherches associées et recherche vectorielle en ligne).


← Retour à l'Index de Documentation