स्रोत डेटा एम्बेडिंग (चरण 0): नींव का निर्माण

यह लेख बताता है कि हम सभी खोजे जा सकने वाले स्रोत सामग्री (उत्पाद, पार्ट्स और ऑन-साइट पेजों) को एक साझा वेक्टर स्पेस में कैसे एम्बेड करते हैं ताकि SEO और खोज पाइपलाइन में शब्दार्थ मिलान का समर्थन किया जा सके।

समस्या: अर्थ के आधार पर क्वेरीज़ को सामग्री से मिलाना

उपयोगकर्ता इरादे को कई अलग-अलग शब्दांशों से व्यक्त करते हैं। कीवर्ड मिलान तब टूट जाता है जब क्वेरी के शब्द कैटलॉग के शब्दों से मेल नहीं खाते।

हम शब्दार्थ एम्बेडिंग का उपयोग करते हैं ताकि क्वेरीज़ और स्रोत सामग्री दोनों की तुलना अर्थ के आधार पर की जा सके (आमतौर पर कोसाइन समानता के माध्यम से)।

क्या एम्बेड किया जाता है

हम उस सभी सामग्री को एम्बेड करते हैं जिसे एक उपयोगकर्ता खोज सकता है और जिसे पाइपलाइन रूट कर सकती है:

  • उत्पाद: बेचे जाने वाले कैटलॉग आइटम (शीर्षक + विशेषता पाठ + कोई भी क्यूरेटेड/AI कॉपी)।

  • पार्ट्स: बेचे जाने वाले घटक और एक्सेसरीज़ (नाम + विशिष्टताएँ)।

  • ऑन-साइट पेज: लेख (/a/), और अन्य नेविगेबल पेज जो खोज और आंतरिक लिंक में दिखाई दे सकते हैं।

सभी खोजे जा सकने वाली सामग्री को एम्बेड करने से क्रॉस-टाइप पुनर्प्राप्ति सक्षम होती है (उदाहरण के लिए, एक लेख उत्पाद-उन्मुख क्वेरी के लिए रैंक कर सकता है, और एक उत्पाद सूचनात्मक क्वेरी के लिए उचित होने पर रैंक कर सकता है)।

उच्च-स्तरीय आर्किटेक्चर

flowchart TD
    A[Catalog + parts + pages] --> B[Normalize & build descriptions]
    B --> C[Deduplicate by canonical URL]
    C --> D[Incremental embedding]
    D --> E[Source embedding matrix + key index]
    E --> F[Downstream: matching, routing, related searches, search service]

एम्बेडिंग पाइपलाइन

चरण A: स्रोत डेटा को समेकित करना

  • उद्देश्य: स्रोत आइटम्स का एक कैनोनिकल डेटासेट बनाना।

  • इनपुट: उत्पाद कैटलॉग, पार्ट्स डेटासेट, और पेज सामग्री।

  • आउटपुट: एक समेकित स्रोत डेटासेट जिसमें शामिल हैं:

    • कुंजियाँ: कैनोनिकल URL (स्थिर पहचानकर्ता के रूप में उपयोग किए जाते हैं)
    • विवरण: एम्बेडिंग के लिए उपयोग किया गया पाठ
    • प्रकार: उत्पाद / पार्ट / लेख / पेज (डाउनस्ट्रीम रूटिंग के लिए)
  • प्रक्रिया:

    1. प्रत्येक स्रोत से आइटम निकालें।
    2. प्रति आइटम एक विवरण बनाएँ।
    3. कैनोनिकल URL द्वारा डीडुप्लिकेट करें ताकि प्रत्येक URL का प्रतिनिधित्व एक बार हो।

चरण B: वृद्धिशील एम्बेडिंग

हम उस सामग्री के लिए एम्बेडिंग की पुनर्गणना से बचने के लिए वृद्धिशील शिक्षा के सिद्धांतों का उपयोग करते हैं जो नहीं बदली है।

  • उद्देश्य: केवल नए/बदले हुए आइटम्स को एम्बेड करना जबकि अपरिवर्तित आइटम्स के लिए कैश्ड एम्बेडिंग का पुन: उपयोग करना।

  • इनपुट: समेकित स्रोत डेटासेट और एक एम्बेडिंग कैश (पिछला रन)।

  • आउटपुट: अद्यतन एम्बेडिंग मैट्रिक्स और कुंजी सूचकांक।

  • प्रक्रिया:

    1. कैश्ड कुंजियाँ और एम्बेडिंग लोड करें।
    2. प्रत्येक आइटम के लिए एक परिवर्तन संकेत की गणना करें (आइटम के एम्बेडिंग पाठ के आधार पर)।
    3. केवल नए/बदले हुए आइटम्स को कॉन्फ़िगर किए गए मॉडल का उपयोग करके एम्बेड करें (एम्बेडिंग रणनीति देखें)।
    4. कैश्ड और नवगणित एम्बेडिंग को URL द्वारा कुंजीबद्ध एक स्थिर क्रम में मर्ज करें।

चरण C: आर्टिफैक्ट्स को स्थायी रूप से संग्रहीत करना

एम्बेडिंग को एक कुशल संख्यात्मक प्रारूप (आमतौर पर NumPy के माध्यम से) में संग्रहीत किया जाता है, साथ ही एक अलग कुंजी सूचकांक भी होता है ताकि डाउनस्ट्रीम चरण वेक्टर पंक्तियों को वापस कैनोनिकल URL से मैप कर सकें।

विवरण निर्माण (हम कौन सा पाठ एम्बेड करते हैं)

उत्पाद

उत्पाद विवरण इनसे बनाए जाते हैं:

  • सरलीकृत नाम: उत्पाद का नाम और प्रमुख पहचानकर्ता (जैसे, SKU/श्रृंखला नामकरण)।

  • विशेषता पाठ: उत्पाद विशेषताओं का मानव-पठनीय प्रतिनिधित्व (SKU संरचना देखें)।

  • लंबे-रूप की कॉपी: क्यूरेटेड या AI-जनित कॉपी जहां उपलब्ध हो (सामग्री AI जनरेशन देखें)।

उदाहरण (वर्णनात्मक):

<product name>
<short description>
<key feature highlights>

पार्ट्स

पार्ट्स विवरण इनसे बनाए जाते हैं:

  • ग्राहक-सामने वाला नाम

  • आंतरिक नाम (तकनीकी पहचानकर्ता)

  • श्रेणी

  • विशिष्टताएँ/गुण पाठ के रूप में प्रस्तुत

ऑन-साइट पेज

पेज विवरण इनसे बनाए जाते हैं:

  • शीर्षक

  • प्राथमिक बॉडी स्निपेट (परिचय/लीड सेक्शन)

  • प्रासंगिक पहचानकर्ता (श्रेणी/परिवार लेबल जहाँ लागू हो)

लक्ष्य स्थिर, सामग्री-प्रतिनिधि पाठ है जो पेज के अर्थ बदलने पर बदलता है।

डीडुप्लिकेशन नियम

प्रत्येक कैनोनिकल URL समेकित डेटासेट में एक बार प्रकट होता है।

  • क्यों: कई स्रोत एक ही URL का वर्णन विभिन्न जनरेशन पथों के माध्यम से कर सकते हैं; डुप्लिकेट रूटिंग, मिलान और डाउनस्ट्रीम इंडेक्सिंग को तोड़ते हैं।

  • कैसे: कैनोनिकल URL द्वारा कुंजीबद्ध एक शब्दकोश बनाएं और समेकन के समय विशिष्टता लागू करें। यदि डुप्लिकेट मिलते हैं, तो स्क्रिप्ट गिनती प्रिंट करती है और उन्हें हटा देती है।

अन्य चरण स्रोत एम्बेडिंग का उपयोग कैसे करते हैं

  • उत्पाद मिलान: क्लस्टर या क्वेरीज़ को शब्दार्थ समानता द्वारा निकटतम स्रोत आइटम्स से मिलाया जाता है (SEO उत्पाद मिलान देखें)।

  • संबंधित खोजें: संबंधित-खोज जनरेटर प्रासंगिक नेविगेशनल लिंक्स प्रस्तावित करने के लिए एम्बेडिंग समानता का उपयोग करता है (SEO संबंधित खोजें देखें)।

  • खोज सेवा: ऑनलाइन खोज इंडेक्स्ड एम्बेडिंग पर वेक्टर समानता का उपयोग कर सकती है (खोज सेवा आर्किटेक्चर देखें)।

यह भी देखें

संदर्भ

सारांश

  • क्या: उत्पादों, पार्ट्स और खोजे जा सकने वाले पेजों को एक साझा वेक्टर स्पेस में एम्बेड करना।

  • कैसे: कैनोनिकल URL द्वारा समेकित और डीडुप्लिकेट करना, फिर केवल बदले हुए आइटम्स को वृद्धिशील रूप से एम्बेड करना।

  • क्यों: यह पाइपलाइन (मिलान, संबंधित खोजें, और ऑनलाइन वेक्टर खोज) में शब्दार्थ पुनर्प्राप्ति और रूटिंग सक्षम करता है।


← डॉक्यूमेंटेशन इंडेक्स पर वापस जाएँ