स्त्रोत डेटा एम्बेडिंग (स्टेप ०): पाया तयार करणे

हा लेख स्पष्ट करतो की आम्ही शोधण्यायोग्य सर्व स्त्रोत सामग्री (उत्पादने, पार्ट्स आणि ऑन-साइट पृष्ठे) एका सामायिक वेक्टर स्पेस मध्ये कशी एम्बेड करतो, ज्यामुळे SEO आणि शोध पायपलाटात अर्थपूर्ण जुळणीला पाठिंबा मिळतो.

समस्या: अर्थानुसार क्वेरी सामग्रीशी जोडणे

वापरकर्ते त्यांच्या हेतूचे वर्णन अनेक वेगवेगळ्या शब्दरचनांनी करतात. जेव्हा क्वेरीमधील शब्दरचना कॅटलॉगमधील शब्दरचनेशी जुळत नाही, तेव्हा कीवर्ड जुळणी काम करत नाही.

आम्ही सिमँटिक एम्बेडिंग्ज वापरतो जेणेकरून क्वेरी आणि स्त्रोत सामग्री दोन्हीची अर्थानुसार तुलना करता येईल (सामान्यतः कोसाइन सिमिलॅरिटी द्वारे).

काय एम्बेड केले जाते

आम्ही अशी सर्व सामग्री एम्बेड करतो जी वापरकर्ता शोधू शकतो आणि ज्याकडे पायपलाट मार्गदर्शन करू शकतो:

  • उत्पादने: विक्रीयोग्य कॅटलॉग आयटम्स (शीर्षक + वैशिष्ट्य मजकूर + कोणताही क्युरेटेड/AI कॉपी).

  • पार्ट्स: विक्रीयोग्य घटक आणि ॲक्सेसरीज (नावे + तपशील).

  • ऑन-साइट पृष्ठे: लेख (/a/), आणि इतर नेव्हिगेबल पृष्ठे जी शोध आणि अंतर्गत लिंक्समध्ये दिसू शकतात.

सर्व शोधण्यायोग्य सामग्री एम्बेड करण्यामुळे क्रॉस-टाइप रिट्रायव्हल सक्षम होते (उदा., एखादा लेख उत्पादन-केंद्रित क्वेरीसाठी रँक करू शकतो, आणि एखादे उत्पादन माहितीपूर्ण क्वेरीसाठी योग्य तेव्हा रँक करू शकते).

उच्च-स्तरीय आर्किटेक्चर

flowchart TD
    A[Catalog + parts + pages] --> B[Normalize & build descriptions]
    B --> C[Deduplicate by canonical URL]
    C --> D[Incremental embedding]
    D --> E[Source embedding matrix + key index]
    E --> F[Downstream: matching, routing, related searches, search service]

एम्बेडिंग पायपलाट

स्टेप A: स्त्रोत डेटा एकत्रित करा

  • उद्देश: स्त्रोत आयटम्सचा एक कॅनोनिकल डेटासेट तयार करा.

  • इनपुट: उत्पादन कॅटलॉग, पार्ट्स डेटासेट, आणि पृष्ठ सामग्री.

  • आउटपुट: एक एकत्रित स्त्रोत डेटासेट ज्यामध्ये आहे:

    • की: कॅनोनिकल URL (स्थिर आयडेंटिफायर म्हणून वापरले)
    • वर्णने: एम्बेडिंगसाठी वापरलेला मजकूर
    • प्रकार: उत्पादन / पार्ट / लेख / पृष्ठ (डाउनस्ट्रीम मार्गदर्शनासाठी)
  • प्रक्रिया:

    1. प्रत्येक स्त्रोतातून आयटम्स काढा.
    2. प्रति आयटम एक वर्णन तयार करा.
    3. कॅनोनिकल URL द्वारे डुप्लिकेट काढा जेणेकरून प्रत्येक URL एकदाच प्रतिनिधित्व करेल.

स्टेप B: इंक्रिमेंटल एम्बेडिंग

बदललेली नसलेली सामग्री पुन्हा एम्बेड करणे टाळण्यासाठी आम्ही इंक्रिमेंटल लर्निंग तत्त्वे वापरतो.

  • उद्देश: केवळ नवीन/बदललेली आयटम्स एम्बेड करा तर न बदललेल्या आयटम्ससाठी कॅश्ड एम्बेडिंग्ज पुन्हा वापरा.

  • इनपुट: एकत्रित स्त्रोत डेटासेट आणि एम्बेडिंग कॅश (मागील रन).

  • आउटपुट: अद्ययावत एम्बेडिंग मॅट्रिक्स आणि की इंडेक्स.

  • प्रक्रिया:

    1. कॅश्ड की आणि एम्बेडिंग्ज लोड करा.
    2. प्रत्येक आयटमसाठी बदल सिग्नल काढा (आयटमच्या एम्बेडिंग मजकुरावर आधारित).
    3. केवळ नवीन/बदललेली आयटम्स कॉन्फिगर केलेल्या मॉडेलचा वापर करून एम्बेड करा (पहा एम्बेडिंग स्ट्रॅटेजी).
    4. कॅश्ड आणि नवीन गणना केलेली एम्बेडिंग्ज URL द्वारे की केलेल्या स्थिर क्रमात मर्ज करा.

स्टेप C: आर्टिफॅक्ट्स जतन करा

एम्बेडिंग्ज एका कार्यक्षम संख्यात्मक स्वरूपात साठवल्या जातात (सामान्यतः NumPy द्वारे) त्यासोबत एक स्वतंत्र की इंडेक्स असतो जेणेकरून डाउनस्ट्रीम स्टेप्स वेक्टर रो कॅनोनिकल URL वर मॅप करू शकतील.

वर्णन निर्मिती (कोणता मजकूर आम्ही एम्बेड करतो)

उत्पादने

उत्पादन वर्णने यावरून तयार केली जातात:

  • सरलीकृत नाव: उत्पादनाचे नाव आणि प्रमुख आयडेंटिफायर्स (उदा., SKU/मालिका नामकरण).

  • वैशिष्ट्य मजकूर: उत्पादन वैशिष्ट्यांचे मानवी-वाचनीय प्रतिनिधित्व (पहा SKU स्ट्रक्चर).

  • लाँग-फॉर्म कॉपी: क्युरेटेड किंवा AI-जनरेटेड कॉपी जिथे उपलब्ध असेल (पहा कंटेंट AI जनरेशन).

उदाहरण (स्पष्टीकरणात्मक):

<product name>
<short description>
<key feature highlights>

पार्ट्स

पार्ट वर्णने यावरून तयार केली जातात:

  • ग्राहक-केंद्रित नाव

  • अंतर्गत नाव (तांत्रिक आयडेंटिफायर)

  • श्रेणी

  • तपशील/गुणधर्म मजकूर म्हणून रेंडर केलेले

ऑन-साइट पृष्ठे

पृष्ठ वर्णने यावरून तयार केली जातात:

  • शीर्षक

  • प्राथमिक बॉडी स्निपेट (परिचय/लीड विभाग)

  • प्रासंगिक आयडेंटिफायर्स (श्रेणी/कुटुंब लेबल जिथे लागू असेल)

ध्येय अस्थिर, सामग्री-प्रतिनिधी मजकूर असा आहे जो पृष्ठाचा अर्थ बदलला तेव्हाच बदलतो.

डुप्लिकेट काढण्याचे नियम

प्रत्येक कॅनोनिकल URL एकत्रित डेटासेटमध्ये एकदाच दिसतो.

  • का: एकाधिक स्त्रोत वेगवेगळ्या जनरेशन मार्गांद्वारे समान URL चे वर्णन करू शकतात; डुप्लिकेट्स मार्गदर्शन, जुळणी, आणि डाउनस्ट्रीम इंडेक्सिंग बिघडवतात.

  • कसे: कॅनोनिकल URL द्वारे की केलेले डिक्शनरी तयार करा आणि एकत्रित करण्याच्या वेळी युनिकनेस लागू करा. डुप्लिकेट्स सापडल्यास, स्क्रिप्ट काउंट प्रिंट करते आणि त्यांना काढून टाकते.

इतर स्टेप्स स्त्रोत एम्बेडिंग्ज कशा वापरतात

  • उत्पादन जुळणी: क्लस्टर किंवा क्वेरी सिमँटिक सिमिलॅरिटीद्वारे सर्वात जवळच्या स्त्रोत आयटम्सशी जोडल्या जातात (पहा SEO उत्पादन जुळणी).

  • संबंधित शोध: संबंधित-शोध जनरेटर संबंधित नेव्हिगेशनल लिंक्स सुचवण्यासाठी एम्बेडिंग सिमिलॅरिटी वापरतो (पहा SEO संबंधित शोध).

  • शोध सेवा: ऑनलाइन शोध इंडेक्स केलेल्या एम्बेडिंग्जवर वेक्टर सिमिलॅरिटी वापरू शकतो (पहा शोध सेवा आर्किटेक्चर).

हे देखील पहा

संदर्भ

सारांश

  • काय: उत्पादने, पार्ट्स, आणि शोधण्यायोग्य पृष्ठे एका सामायिक वेक्टर स्पेसमध्ये एम्बेड करा.

  • कसे: कॅनोनिकल URL द्वारे एकत्रित करा आणि डुप्लिकेट काढा, नंतर केवळ बदललेली आयटम्स इंक्रिमेंटली एम्बेड करा.

  • का: हे पायपलाटभर (जुळणी, संबंधित शोध, आणि ऑनलाइन वेक्टर शोध) सिमँटिक रिट्रायव्हल आणि मार्गदर्शन सक्षम करते.


← दस्तऐवजीकरण अनुक्रमणिका परत जा