Intégration des Données Sources (Étape 0) : Construire les Fondations
Cet article explique comment nous intégrons tout le contenu source découvrable (produits, pièces et pages du site) dans un espace vectoriel partagé pour supporter l'appariement sémantique dans le pipeline SEO et de recherche.
Le Problème : Apparier les Requêtes au Contenu par le Sens
Les utilisateurs expriment leur intention avec de nombreuses formulations différentes. L'appariement par mots-clés échoue lorsque la formulation de la requête ne recoupe pas celle du catalogue.
Nous utilisons des intégrations sémantiques afin que les requêtes et le contenu source puissent être comparés par leur sens (généralement via la similarité cosinus).
Ce qui est Intégré
Nous intégrons tout le contenu qu'un utilisateur peut découvrir et que le pipeline peut router :
-
Produits : Les articles du catalogue vendables (titre + texte des caractéristiques + toute copie organisée/générée par IA).
-
Pièces : Les composants et accessoires vendables (noms + spécifications).
-
Pages du site : Articles (
/a/), et autres pages navigables pouvant apparaître dans les résultats de recherche et les liens internes.
L'intégration de tout le contenu découvrable permet une récupération inter-types (par exemple, un article peut être classé pour une requête orientée produit, et un produit peut être classé pour une requête informationnelle le cas échéant).
Architecture Haut Niveau
flowchart TD
A[Catalog + parts + pages] --> B[Normalize & build descriptions]
B --> C[Deduplicate by canonical URL]
C --> D[Incremental embedding]
D --> E[Source embedding matrix + key index]
E --> F[Downstream: matching, routing, related searches, search service]Le Pipeline d'Intégration
Étape A : Consolider les Données Sources
-
Objectif : Construire un jeu de données canonique unique des éléments sources.
-
Entrées : Catalogue produits, jeu de données des pièces, et contenu des pages.
-
Sorties : Un jeu de données source consolidé avec :
- Clés : URLs canoniques (utilisées comme identifiants stables)
- Descriptions : Texte utilisé pour l'intégration
- Types : Produit / pièce / article / page (pour le routage en aval)
-
Processus :
- Extraire les éléments de chaque source.
- Construire une description par élément.
- Dédupliquer par URL canonique afin que chaque URL ne soit représentée qu'une fois.
Étape B : Intégration Incrémentielle
Nous utilisons les principes de l'apprentissage incrémental pour éviter de recalculer les intégrations pour le contenu qui n'a pas changé.
-
Objectif : Intégrer uniquement les éléments nouveaux/modifiés tout en réutilisant les intégrations en cache pour les éléments inchangés.
-
Entrées : Jeu de données source consolidé et un cache d'intégrations (exécution précédente).
-
Sorties : Matrice d'intégration et index des clés mis à jour.
-
Processus :
- Charger les clés et intégrations en cache.
- Calculer un signal de changement pour chaque élément (basé sur le texte d'intégration de l'élément).
- Intégrer uniquement les éléments nouveaux/modifiés en utilisant le modèle configuré (voir Stratégie d'Intégration SEO).
- Fusionner les intégrations en cache et nouvellement calculées dans un ordre stable indexé par URL.
Étape C : Persister les Artéfacts
Les intégrations sont stockées dans un format numérique efficace (généralement via NumPy) avec un index de clés séparé afin que les étapes en aval puissent mapper les lignes de vecteurs aux URLs canoniques.
Construction de la Description (Quel Texte Nous Intégrons)
Produits
Les descriptions de produits sont construites à partir de :
-
Nom Simplifié : Nom du produit et identifiants clés (par ex., référence/série).
-
Texte des caractéristiques : Représentation lisible par un humain des caractéristiques du produit (voir Structure des Références).
-
Copie longue : Copie organisée ou générée par IA lorsque disponible (voir Génération de Contenu par IA).
Exemple (illustratif) :
<product name>
<short description>
<key feature highlights>
Pièces
Les descriptions de pièces sont construites à partir de :
-
Nom client
-
Nom interne (Identifiant technique)
-
Catégorie
-
Spécifications/attributs rendus sous forme de texte
Pages du site
Les descriptions de pages sont construites à partir de :
-
Titre
-
Extrait du corps principal (section introductive/lead)
-
Identifiants contextuels (libellés de catégorie/famille le cas échéant)
L'objectif est un texte stable et représentatif du contenu, qui change lorsque le sens de la page change.
Règles de Déduplication
Chaque URL canonique apparaît une seule fois dans le jeu de données consolidé.
-
Pourquoi : Plusieurs sources peuvent décrire la même URL via différents chemins de génération ; les doublons cassent le routage, l'appariement et l'indexation en aval.
-
Comment : Construire un dictionnaire indexé par URL canonique et imposer l'unicité au moment de la consolidation. Si des doublons sont trouvés, le script affiche le compte et les supprime.
Comment les Autres Étapes Utilisent les Intégrations Sources
-
Appariement de produits : Les clusters ou requêtes sont appariés aux éléments sources les plus proches par similarité sémantique (voir Appariement de Produits SEO).
-
Recherches associées : Le générateur de recherches associées utilise la similarité d'intégration pour proposer des liens de navigation pertinents (voir Recherches Associées SEO).
-
Service de recherche : La recherche en ligne peut utiliser la similarité vectorielle sur les intégrations indexées (voir Architecture du Service de Recherche).
Voir Aussi
-
Stratégie d'Intégration SEO — Choix du modèle et conventions d'intégration
-
Appariement de Produits SEO — Utilisation des intégrations pour router vers produits/pages
-
Recherches Associées SEO — Application des intégrations à la génération de liens internes
-
Architecture du Service de Recherche — Comment les intégrations sont servies en ligne
-
Vue d'Ensemble du Pipeline SEO — Contexte du pipeline de bout en bout
Références
Résumé
-
Quoi : Intégrer les produits, pièces et pages découvrables dans un espace vectoriel partagé.
-
Comment : Consolider et dédupliquer par URL canonique, puis intégrer de manière incrémentielle uniquement les éléments modifiés.
-
Pourquoi : Cela permet la récupération et le routage sémantique à travers le pipeline (appariement, recherches associées et recherche vectorielle en ligne).