ಮೂಲ ಡೇಟಾ ಎಂಬೆಡಿಂಗ್ (ಹಂತ 0): ಅಡಿಪಾಯವನ್ನು ನಿರ್ಮಿಸುವುದು
ಈ ಲೇಖನವು, SEO ಮತ್ತು ಹುಡುಕಾಟ ಪೈಪ್ಲೈನ್ನಾದ್ಯಂತ ಸಿಮ್ಯಾಂಟಿಕ್ ಹೊಂದಾಣಿಕೆಯನ್ನು ಬೆಂಬಲಿಸಲು, ಎಲ್ಲಾ ಪತ್ತೆಹಚ್ಚಬಹುದಾದ ಮೂಲ ವಿಷಯವನ್ನು (ಉತ್ಪನ್ನಗಳು, ಬಿಡಿಭಾಗಗಳು, ಮತ್ತು ಸೈಟ್ನಲ್ಲಿನ ಪುಟಗಳು) ಹಂಚಿದ ಸದಿಶ ಸ್ಥಳ ಆಗಿ ನಾವು ಹೇಗೆ ಎಂಬೆಡ್ ಮಾಡುತ್ತೇವೆ ಎಂಬುದನ್ನು ವಿವರಿಸುತ್ತದೆ.
ಸಮಸ್ಯೆ: ಪ್ರಶ್ನೆಗಳನ್ನು ಅರ್ಥದ ಮೂಲಕ ವಿಷಯಕ್ಕೆ ಹೊಂದಿಸುವುದು
ಬಳಕೆದಾರರು ಉದ್ದೇಶವನ್ನು ಹಲವು ವಿಭಿನ್ನ ಪದಗುಚ್ಛಗಳಲ್ಲಿ ವಿವರಿಸುತ್ತಾರೆ. ಪ್ರಶ್ನೆಯ ಪದಬಳಕೆಯು ಕ್ಯಾಟಲಾಗ್ ಪದಬಳಕೆಯೊಂದಿಗೆ ಅತಿಕ್ರಮಿಸದಿದ್ದಾಗ ಕೀವರ್ಡ್ ಹೊಂದಾಣಿಕೆ ವಿಫಲಗೊಳ್ಳುತ್ತದೆ.
ನಾವು ಸಿಮ್ಯಾಂಟಿಕ್ ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಬಳಸುತ್ತೇವೆ, ಇದರಿಂದ ಪ್ರಶ್ನೆಗಳು ಮತ್ತು ಮೂಲ ವಿಷಯ ಎರಡನ್ನೂ ಅರ್ಥದ ಮೂಲಕ ಹೋಲಿಸಬಹುದು (ಸಾಮಾನ್ಯವಾಗಿ ಕೊಸೈನ್ ಸಾಮ್ಯತೆ ಮೂಲಕ).
ಏನನ್ನು ಎಂಬೆಡ್ ಮಾಡಲಾಗುತ್ತದೆ
ನಾವು ಬಳಕೆದಾರನಿಗೆ ಪತ್ತೆಹಚ್ಚಬಹುದಾದ ಮತ್ತು ಪೈಪ್ಲೈನ್ ಮಾರ್ಗನಿರ್ದೇಶನ ಮಾಡಬಹುದಾದ ಎಲ್ಲಾ ವಿಷಯವನ್ನು ಎಂಬೆಡ್ ಮಾಡುತ್ತೇವೆ:
-
ಉತ್ಪನ್ನಗಳು: ಮಾರಾಟಯೋಗ್ಯ ಕ್ಯಾಟಲಾಗ್ ವಸ್ತುಗಳು (ಶೀರ್ಷಿಕೆ + ವೈಶಿಷ್ಟ್ಯ ಪಠ್ಯ + ಯಾವುದೇ ಕ್ಯುರೇಟೆಡ್/AI ಪಠ್ಯ).
-
ಬಿಡಿಭಾಗಗಳು: ಮಾರಾಟಯೋಗ್ಯ ಘಟಕಗಳು ಮತ್ತು ಪರಿಕರಗಳು (ಹೆಸರುಗಳು + ವಿಶೇಷಣಗಳು).
-
ಸೈಟ್ನಲ್ಲಿನ ಪುಟಗಳು: ಲೇಖನಗಳು (
/a/), ಮತ್ತು ಹುಡುಕಾಟ ಮತ್ತು ಆಂತರಿಕ ಲಿಂಕ್ಗಳಲ್ಲಿ ಕಾಣಿಸಬಹುದಾದ ಇತರ ಸಂಚಾರಯೋಗ್ಯ ಪುಟಗಳು.
ಎಲ್ಲಾ ಪತ್ತೆಹಚ್ಚಬಹುದಾದ ವಿಷಯವನ್ನು ಎಂಬೆಡ್ ಮಾಡುವುದರಿಂದ ಅಡ್ಡ-ಪ್ರಕಾರದ ಮರುಪಡೆಯುವಿಕೆ ಸಾಧ್ಯವಾಗುತ್ತದೆ (ಉದಾ., ಒಂದು ಲೇಖನವು ಉತ್ಪನ್ನ-ಆಧಾರಿತ ಪ್ರಶ್ನೆಗೆ ಶ್ರೇಯಾಂಕ ಪಡೆಯಬಹುದು, ಮತ್ತು ಒಂದು ಉತ್ಪನ್ನವು ಸೂಕ್ತವಾದಾಗ ಮಾಹಿತಿ-ಆಧಾರಿತ ಪ್ರಶ್ನೆಗೆ ಶ್ರೇಯಾಂಕ ಪಡೆಯಬಹುದು).
ಉನ್ನತ-ಮಟ್ಟದ ವಾಸ್ತುಶಿಲ್ಪ
flowchart TD
A[Catalog + parts + pages] --> B[Normalize & build descriptions]
B --> C[Deduplicate by canonical URL]
C --> D[Incremental embedding]
D --> E[Source embedding matrix + key index]
E --> F[Downstream: matching, routing, related searches, search service]ಎಂಬೆಡಿಂಗ್ ಪೈಪ್ಲೈನ್
ಹಂತ A: ಮೂಲ ಡೇಟಾವನ್ನು ಏಕೀಕರಿಸುವುದು
-
ಉದ್ದೇಶ: ಮೂಲ ವಸ್ತುಗಳ ಒಂದು ಕ್ಯಾನಾನಿಕಲ್ ಡೇಟಾಸೆಟ್ ಅನ್ನು ನಿರ್ಮಿಸುವುದು.
-
ಇನ್ಪುಟ್ಗಳು: ಉತ್ಪನ್ನ ಕ್ಯಾಟಲಾಗ್, ಬಿಡಿಭಾಗಗಳ ಡೇಟಾಸೆಟ್, ಮತ್ತು ಪುಟದ ವಿಷಯ.
-
ಔಟ್ಪುಟ್ಗಳು: ಇವುಗಳನ್ನು ಹೊಂದಿರುವ ಏಕೀಕೃತ ಮೂಲ ಡೇಟಾಸೆಟ್:
- ಕೀಗಳು: ಕ್ಯಾನಾನಿಕಲ್ URLಗಳು (ಸ್ಥಿರ ಗುರುತಿಸುವಿಕೆಗಳಾಗಿ ಬಳಸಲಾಗುತ್ತದೆ)
- ವಿವರಣೆಗಳು: ಎಂಬೆಡಿಂಗ್ಗಾಗಿ ಬಳಸುವ ಪಠ್ಯ
- ಪ್ರಕಾರಗಳು: ಉತ್ಪನ್ನ / ಬಿಡಿಭಾಗ / ಲೇಖನ / ಪುಟ (ಮುಂದಿನ ಹಂತದ ಮಾರ್ಗನಿರ್ದೇಶನಕ್ಕಾಗಿ)
-
ಪ್ರಕ್ರಿಯೆ:
- ಪ್ರತಿ ಮೂಲದಿಂದ ವಸ್ತುಗಳನ್ನು ಹೊರತೆಗೆಯಿರಿ.
- ಪ್ರತಿ ವಸ್ತುವಿಗೆ ಒಂದು ವಿವರಣೆಯನ್ನು ನಿರ್ಮಿಸಿ.
- ಕ್ಯಾನಾನಿಕಲ್ URL ಮೂಲಕ ನಕಲು ತೆಗೆದುಹಾಕಿ, ಇದರಿಂದ ಪ್ರತಿ URL ಒಮ್ಮೆ ಮಾತ್ರ ಪ್ರತಿನಿಧಿಸಲ್ಪಡುತ್ತದೆ.
ಹಂತ B: ವರ್ಧಿತ ಎಂಬೆಡಿಂಗ್
ಬದಲಾಗದ ವಿಷಯಕ್ಕಾಗಿ ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಮರು ಲೆಕ್ಕಾಚಾರ ಮಾಡುವುದನ್ನು ತಪ್ಪಿಸಲು ನಾವು ವರ್ಧಿತ ಕಲಿಕೆ ತತ್ವಗಳನ್ನು ಬಳಸುತ್ತೇವೆ.
-
ಉದ್ದೇಶ: ಬದಲಾಗದ ವಸ್ತುಗಳಿಗೆ ಕ್ಯಾಶ್ ಮಾಡಿದ ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಮರುಬಳಕೆ ಮಾಡುವಾಗ ಹೊಸ/ಬದಲಾದ ವಸ್ತುಗಳನ್ನು ಮಾತ್ರ ಎಂಬೆಡ್ ಮಾಡುವುದು.
-
ಇನ್ಪುಟ್ಗಳು: ಏಕೀಕೃತ ಮೂಲ ಡೇಟಾಸೆಟ್ ಮತ್ತು ಎಂಬೆಡಿಂಗ್ ಕ್ಯಾಶ್ (ಹಿಂದಿನ ರನ್).
-
ಔಟ್ಪುಟ್ಗಳು: ನವೀಕರಿಸಿದ ಎಂಬೆಡಿಂಗ್ ಮ್ಯಾಟ್ರಿಕ್ಸ್ ಮತ್ತು ಕೀ ಸೂಚ್ಯಂಕ.
-
ಪ್ರಕ್ರಿಯೆ:
- ಕ್ಯಾಶ್ ಮಾಡಿದ ಕೀಗಳು ಮತ್ತು ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಲೋಡ್ ಮಾಡಿ.
- ಪ್ರತಿ ವಸ್ತುವಿಗೆ ಬದಲಾವಣೆ ಸಂಕೇತವನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ (ವಸ್ತುವಿನ ಎಂಬೆಡಿಂಗ್ ಪಠ್ಯದ ಆಧಾರದಲ್ಲಿ).
- ಸಂರಚಿಸಲಾದ ಮಾದರಿಯನ್ನು ಬಳಸಿ ಹೊಸ/ಬದಲಾದ ವಸ್ತುಗಳನ್ನು ಮಾತ್ರ ಎಂಬೆಡ್ ಮಾಡಿ (ನೋಡಿ ಎಂಬೆಡಿಂಗ್ ತಂತ್ರ).
- ಕ್ಯಾಶ್ ಮಾಡಿದ ಮತ್ತು ಹೊಸದಾಗಿ ಲೆಕ್ಕಾಚಾರ ಮಾಡಿದ ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು URL ಆಧಾರಿತ ಸ್ಥಿರ ಕ್ರಮದಲ್ಲಿ ವಿಲೀನಗೊಳಿಸಿ.
ಹಂತ C: ಆರ್ಟಿಫ್ಯಾಕ್ಟ್ಗಳನ್ನು ಶಾಶ್ವತಗೊಳಿಸುವುದು
ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಸಮರ್ಥ ಸಂಖ್ಯಾ ಸ್ವರೂಪದಲ್ಲಿ (ಸಾಮಾನ್ಯವಾಗಿ NumPy ಮೂಲಕ) ಪ್ರತ್ಯೇಕ ಕೀ ಸೂಚ್ಯಂಕದೊಂದಿಗೆ ಸಂಗ್ರಹಿಸಲಾಗುತ್ತದೆ, ಇದರಿಂದ ಮುಂದಿನ ಹಂತಗಳು ವೆಕ್ಟರ್ ಸಾಲುಗಳನ್ನು ಕ್ಯಾನಾನಿಕಲ್ URLಗಳಿಗೆ ಮರುನಕ್ಷೆ ಮಾಡಬಹುದು.
ವಿವರಣೆ ನಿರ್ಮಾಣ (ನಾವು ಯಾವ ಪಠ್ಯವನ್ನು ಎಂಬೆಡ್ ಮಾಡುತ್ತೇವೆ)
ಉತ್ಪನ್ನಗಳು
ಉತ್ಪನ್ನ ವಿವರಣೆಗಳನ್ನು ಇವುಗಳಿಂದ ನಿರ್ಮಿಸಲಾಗುತ್ತದೆ:
-
ಸರಳೀಕೃತ ಹೆಸರು: ಉತ್ಪನ್ನದ ಹೆಸರು ಮತ್ತು ಪ್ರಮುಖ ಗುರುತಿಸುವಿಕೆಗಳು (ಉದಾ., SKU/ಸರಣಿ ಹೆಸರಿಸುವಿಕೆ).
-
ವೈಶಿಷ್ಟ್ಯ ಪಠ್ಯ: ಉತ್ಪನ್ನದ ವೈಶಿಷ್ಟ್ಯಗಳ ಮಾನವ-ಓದಬಲ್ಲ ಪ್ರಾತಿನಿಧ್ಯ (ನೋಡಿ SKU ರಚನೆ).
-
ದೀರ್ಘ-ರೂಪದ ಪಠ್ಯ: ಲಭ್ಯವಿರುವಲ್ಲಿ ಕ್ಯುರೇಟೆಡ್ ಅಥವಾ AI-ರಚಿಸಿದ ಪಠ್ಯ (ನೋಡಿ ವಿಷಯ AI ಉತ್ಪಾದನೆ).
ಉದಾಹರಣೆ (ನಿದರ್ಶನಾತ್ಮಕ):
<product name>
<short description>
<key feature highlights>
ಬಿಡಿಭಾಗಗಳು
ಬಿಡಿಭಾಗಗಳ ವಿವರಣೆಗಳನ್ನು ಇವುಗಳಿಂದ ನಿರ್ಮಿಸಲಾಗುತ್ತದೆ:
-
ಗ್ರಾಹಕರಿಗೆ ಪ್ರದರ್ಶಿಸುವ ಹೆಸರು
-
ಆಂತರಿಕ ಹೆಸರು (ತಾಂತ್ರಿಕ ಗುರುತಿಸುವಿಕೆ)
-
ವರ್ಗ
-
ವಿಶೇಷಣಗಳು/ಗುಣಲಕ್ಷಣಗಳು ಪಠ್ಯವಾಗಿ ನಿರೂಪಿಸಲಾಗಿದೆ
ಸೈಟ್ನಲ್ಲಿನ ಪುಟಗಳು
ಪುಟಗಳ ವಿವರಣೆಗಳನ್ನು ಇವುಗಳಿಂದ ನಿರ್ಮಿಸಲಾಗುತ್ತದೆ:
-
ಶೀರ್ಷಿಕೆ
-
ಪ್ರಾಥಮಿಕ ಮುಖ್ಯಭಾಗದ ತುಣುಕು (ಪರಿಚಯ/ಮುನ್ನುಡಿ ವಿಭಾಗ)
-
ಸಂದರ್ಭೋಚಿತ ಗುರುತಿಸುವಿಕೆಗಳು (ಅನ್ವಯವಾದಲ್ಲಿ ವರ್ಗ/ಕುಟುಂಬ ಲೇಬಲ್ಗಳು)
ಗುರಿಯು ಸ್ಥಿರವಾದ, ವಿಷಯ-ಪ್ರತಿನಿಧಿಸುವ ಪಠ್ಯವಾಗಿದ್ದು, ಅದು ಪುಟದ ಅರ್ಥ ಬದಲಾದಾಗ ಬದಲಾಗುತ್ತದೆ.
ನಕಲು ತೆಗೆದುಹಾಕುವ ನಿಯಮಗಳು
ಏಕೀಕೃತ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ಪ್ರತಿ ಕ್ಯಾನಾನಿಕಲ್ URL ಒಮ್ಮೆ ಮಾತ್ರ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತದೆ.
-
ಏಕೆ: ವಿಭಿನ್ನ ಉತ್ಪಾದನಾ ಮಾರ್ಗಗಳ ಮೂಲಕ ಅನೇಕ ಮೂಲಗಳು ಒಂದೇ URL ಅನ್ನು ವಿವರಿಸಬಹುದು; ನಕಲುಗಳು ಮಾರ್ಗನಿರ್ದೇಶನ, ಹೊಂದಾಣಿಕೆ ಮತ್ತು ಮುಂದಿನ ಹಂತದ ಸೂಚ್ಯಂಕೀಕರಣವನ್ನು ಮುರಿಯುತ್ತವೆ.
-
ಹೇಗೆ: ಕ್ಯಾನಾನಿಕಲ್ URL ಆಧಾರಿತ ನಿಘಂಟನ್ನು ನಿರ್ಮಿಸಿ ಮತ್ತು ಏಕೀಕರಣದ ಸಮಯದಲ್ಲಿ ವಿಶಿಷ್ಟತೆಯನ್ನು ಜಾರಿಗೊಳಿಸಿ. ನಕಲುಗಳು ಕಂಡುಬಂದರೆ, ಸ್ಕ್ರಿಪ್ಟ್ ಎಣಿಕೆಯನ್ನು ಮುದ್ರಿಸಿ ಅವುಗಳನ್ನು ತೆಗೆದುಹಾಕುತ್ತದೆ
ಇತರ ಹಂತಗಳು ಮೂಲ ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಹೇಗೆ ಬಳಸುತ್ತವೆ
-
ಉತ್ಪನ್ನ ಹೊಂದಾಣಿಕೆ: ಕ್ಲಸ್ಟರ್ಗಳು ಅಥವಾ ಪ್ರಶ್ನೆಗಳನ್ನು ಸಿಮ್ಯಾಂಟಿಕ್ ಸಾಮ್ಯತೆಯ ಮೂಲಕ ಅತ್ಯಂತ ಹತ್ತಿರದ ಮೂಲ ವಸ್ತುಗಳಿಗೆ ಹೊಂದಿಸಲಾಗುತ್ತದೆ (ನೋಡಿ SEO ಉತ್ಪನ್ನ ಹೊಂದಾಣಿಕೆ).
-
ಸಂಬಂಧಿತ ಹುಡುಕಾಟಗಳು: ಸಂಬಂಧಿತ-ಹುಡುಕಾಟ ಜನರೇಟರ್ ಸೂಕ್ತ ಸಂಚಾರ ಲಿಂಕ್ಗಳನ್ನು ಸೂಚಿಸಲು ಎಂಬೆಡಿಂಗ್ ಸಾಮ್ಯತೆಯನ್ನು ಬಳಸುತ್ತದೆ (ನೋಡಿ SEO ಸಂಬಂಧಿತ ಹುಡುಕಾಟಗಳು).
-
ಹುಡುಕಾಟ ಸೇವೆ: ಆನ್ಲೈನ್ ಹುಡುಕಾಟವು ಸೂಚ್ಯಂಕೀಕರಿಸಿದ ಎಂಬೆಡಿಂಗ್ಗಳ ಮೇಲೆ ವೆಕ್ಟರ್ ಸಾಮ್ಯತೆಯನ್ನು ಬಳಸಬಹುದು (ನೋಡಿ ಹುಡುಕಾಟ ಸೇವಾ ವಾಸ್ತುಶಿಲ್ಪ).
ಇವನ್ನೂ ನೋಡಿ
-
SEO ಎಂಬೆಡಿಂಗ್ ತಂತ್ರ — ಮಾದರಿ ಆಯ್ಕೆ ಮತ್ತು ಎಂಬೆಡಿಂಗ್ ಪದ್ಧತಿಗಳು
-
SEO ಉತ್ಪನ್ನ ಹೊಂದಾಣಿಕೆ — ಉತ್ಪನ್ನಗಳು/ಪುಟಗಳಿಗೆ ಮಾರ್ಗನಿರ್ದೇಶನ ಮಾಡಲು ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಬಳಸುವುದು
-
SEO ಸಂಬಂಧಿತ ಹುಡುಕಾಟಗಳು — ಆಂತರಿಕ-ಲಿಂಕ್ ಉತ್ಪಾದನೆಗೆ ಅನ್ವಯಿಸಲಾದ ಎಂಬೆಡಿಂಗ್ಗಳು
-
ಹುಡುಕಾಟ ಸೇವಾ ವಾಸ್ತುಶಿಲ್ಪ — ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಆನ್ಲೈನ್ನಲ್ಲಿ ಹೇಗೆ ನೀಡಲಾಗುತ್ತದೆ
-
SEO ಪೈಪ್ಲೈನ್ ಅವಲೋಕನ — ಅಂತ್ಯದಿಂದ ಅಂತ್ಯದ ಪೈಪ್ಲೈನ್ ಸಂದರ್ಭ
ಉಲ್ಲೇಖಗಳು
ಸಾರಾಂಶ
-
ಏನು: ಉತ್ಪನ್ನಗಳು, ಬಿಡಿಭಾಗಗಳು ಮತ್ತು ಪತ್ತೆಹಚ್ಚಬಹುದಾದ ಪುಟಗಳನ್ನು ಹಂಚಿದ ಸದಿಶ ಸ್ಥಳದಲ್ಲಿ ಎಂಬೆಡ್ ಮಾಡುವುದು.
-
ಹೇಗೆ: ಕ್ಯಾನಾನಿಕಲ್ URL ಮೂಲಕ ಏಕೀಕರಿಸಿ ಮತ್ತು ನಕಲು ತೆಗೆದುಹಾಕಿ, ನಂತರ ಬದಲಾದ ವಸ್ತುಗಳನ್ನು ಮಾತ್ರ ವರ್ಧಿತವಾಗಿ ಎಂಬೆಡ್ ಮಾಡಿ.
-
ಏಕೆ: ಇದು ಪೈಪ್ಲೈನ್ನಾದ್ಯಂತ (ಹೊಂದಾಣಿಕೆ, ಸಂಬಂಧಿತ ಹುಡುಕಾಟಗಳು, ಮತ್ತು ಆನ್ಲೈನ್ ವೆಕ್ಟರ್ ಹುಡುಕಾಟ) ಸಿಮ್ಯಾಂಟಿಕ್ ಮರುಪಡೆಯುವಿಕೆ ಮತ್ತು ಮಾರ್ಗನಿರ್ದೇಶನವನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತದೆ.