भाषांतर रांग: गट प्रक्रिया प्रणाली
हा लेख आम्ही भाषांतरे कशी रांगेत ठेवतो आणि गटात प्रक्रिया करतो याचे स्पष्टीकरण देते, ज्यामुळे AI API वापर सुधारतो.
समस्या: मागणीनुसार भाषांतर करणे महाग आहे
मागणीनुसार सामग्रीचे भाषांतर करण्यात काही समस्या आहेत:
-
मंद: प्रत्येक भाषांतराला १-२ सेकंद लागतात
-
महाग: API खर्च प्रति विनंती
-
पुनरावृत्ती: समान मजकूर अनेक वेळा भाषांतरित होतो
-
अडथळा: वापरकर्ता भाषांतरासाठी वाट पाहतो
आम्हाला एक चांगली पद्धत हवी आहे.
उपाय: रांग आणि गट
रांग: भाषांतर विनंती जमा करा
गट: अनेक भाषांतरे एकत्र प्रक्रिया करा
साठा: निकाल पुनर्वापरासाठी संग्रहित करा
वेळापत्रक: रांग नियतकालिक (रीअल-टाइम नाही) प्रक्रिया करा
रांग रचना
रांग फाइल
स्थान: डिस्कवरील JSON फाइल
स्वरूप: भाषांतर विनंतींची अॅरे
फील्ड्स:
-
text: भाषांतरासाठीचा इंग्रजी मजकूर -
target_lang: भाषा कोड (hi, de, fr, इ.) -
context: मजकूर कोठे दिसतो (उत्पादन, क्वेरी, लेख) -
priority: उच्च/सामान्य/कमी
रांगेत जोडणे
भाषांतर गहाळ असताना:
queue_translation(text, target_lang, context="product")
डीडुप्लिकेशन: आधीच रांगेत आहे का ते तपासा
प्रमाणीकरण: कचरा मूल्ये नाकारा
गट प्रक्रिया
स्क्रिप्ट
स्थान: scripts/web/process_translation_queue.py
वेळापत्रक: दर ६ तासांनी cron द्वारे चालते
लॉक फाइल: एकाचवेळी चालू होण्यापासून रोखते
प्रक्रिया प्रवाह
१. रांग लोड करा: सर्व प्रलंबित विनंती वाचा
२. भाषेनुसार गट करा: समान भाषेच्या विनंतींचा गट करा
३. डीडुप्लिकेट करा: गटातील डुप्लिकेट काढा
४. साठा तपासा: आधीच भाषांतरित केलेला मजकूर वगळा
५. गट भाषांतर करा: DeepSeek API वर पाठवा
६. निकाल पार्स करा: प्रतिसरातून भाषांतरे काढा
७. साठ्यात जतन करा: वाक्यांश सारण्यांमध्ये संग्रहित करा
८. रांग साफ करा: प्रक्रिया केलेल्या विनंती काढा
गट भाषांतर
API कॉल
मॉडेल: DeepSeek-V3 (Together.ai द्वारे)
सिस्टीम प्रॉम्प्ट: साठवलेले (समान भाषेतील सर्व गटांसाठी समान)
यूजर प्रॉम्प्ट: चल (गट-विशिष्ट)
स्वरूप: क्रमांकित यादी
उदाहरण:
या १० मजकुरांचे भाषांतर करा:
१. Mini PC
२. Thin Client
३. Compact Desktop
...
प्रतिसर:
१. मिनी पीसी
२. थिन क्लाइंट
३. कॉम्पैक्ट डेस्कटॉप
...
पार्सिंग
ओळ क्रमांकानुसार भाषांतरे काढा:
-
क्रमांक उपसर्ग काढा (
१.,२., इ.) -
स्थानानुसार मूळ मजकुराशी जुळवा
-
संख्या जुळते याची पडताळणी करा
त्रुटी हाताळणी
API अपयश: फॉलबॅक API सह पुन्हा प्रयत्न करा
पार्स अपयश: मूळ मजकूर परत करा
आंशिक यश: यशस्वी भाषांतरे जतन करा, अपयशी विनंती पुन्हा रांगेत ठेवा
साठवणूक धोरण
वाक्यांश सारण्या
स्थान: प्रति भाषा JSON फाइल्स
स्वरूप: {"English": "Translation"}
लोडिंग: सुरूवातीला एकदाच लोड केले
फायदा: द्रुत शोध, API कॉल नाहीत
साठा हिट दर
पहिली धाव: कमी (सर्व काही नवीन)
पुढील धावा: उच्च (बहुतांश मजकूर साठवलेले)
फायदा: API खर्च कमी
संरक्षण नियम
भाषांतरादरम्यान, आम्ही हे जतन करतो:
ब्रँड नावे: Thinvent®, Intel®, AMD®
HTML टॅग्स: <p>, <br>, <strong>
URLs: https://www.thinvent.in
SKUs: Treo-N100-8-256
संख्या: 8GB, 256GB, 4 cores
अंमलबजावणी: सिस्टीम प्रॉम्प्टमधील रेगेक्स नमुने
भाषा ओळख
भाषांतरापूर्वी, आधीच भाषांतरित केले आहे का ते तपासा:
पद्धत: वर्णसंच विश्लेषण
हिंदी: देवनागरी लिपी
चिनी: CJK वर्ण
अरबी: अरबी लिपी
फायदा: अनावश्यक भाषांतरे वगळा
प्राधान्य हाताळणी
उच्च प्राधान्य: उत्पादन नावे, वैशिष्ट्ये (प्रथम प्रक्रिया करा)
सामान्य प्राधान्य: वर्णने, लेख (दुसरे प्रक्रिया करा)
कमी प्राधान्य: जुनी सामग्री, क्वचित पाहिली जाणारी (शेवटी प्रक्रिया करा)
फायदा: महत्त्वाची सामग्री प्रथम भाषांतरित होते
वेळापत्रक
Cron कार्य
वारंवारता: दर ६ तासांनी
आदेश: python3 scripts/web/process_translation_queue.py
लॉक फाइल: /tmp/process_translation_queue.lock
फायदा: स्वयंचलित प्रक्रिया, कोणतेही मॅन्युअल हस्तक्षेप नाही
साप्ताहिक कार्ये
लेख: नवीन लेख साप्ताहिक भाषांतरित करा
बॅबल स्ट्रिंग्ज: टेम्पलेट भाषांतरे साप्ताहिक अपडेट करा
स्क्रिप्ट: scripts/web/translate_articles_weekly.sh
निरीक्षण
रांग आकार
प्रलंबित विनंती ट्रॅक करा:
-
एकूण विनंती
-
प्रति भाषा विनंती
-
सर्वात जुनी विनंती वय
सतर्कता: जर रांग खूप मोठी वाढली तर
भाषांतर आकडेवारी
प्रक्रिया ट्रॅक करा:
-
प्रति गट भाषांतरे
-
API यश दर
-
साठा हिट दर
-
प्रक्रिया वेळ
खर्च ट्रॅकिंग
API वापर निरीक्षण करा:
-
प्रति दिवस विनंती
-
प्रति विनंती टोकन्स
-
प्रति भाषा खर्च
संदर्भ
संबंधित लेख
-
भाषांतर प्रणाली - तीन-तंत्रज्ञान संकरित
-
सामग्री AI निर्मिती - DeepSeek एकत्रीकरण
-
भाषा ओळख - वापरकर्ता भाषा प्राधान्य
सारांश
भाषांतर रांग कार्यक्षम गट प्रक्रिया सक्षम करते:
रांग:
-
✅ भाषांतर विनंती जमा करा
-
✅ गटात डीडुप्लिकेट करा
-
✅ प्राधान्य हाताळणी
-
✅ प्रमाणीकरण आणि फिल्टरिंग
गट प्रक्रिया:
-
✅ भाषेनुसार गट करा
-
✅ DeepSeek API वर पाठवा
-
✅ क्रमांकित प्रतिसर पार्स करा
-
✅ वाक्यांश सारण्यांमध्ये जतन करा
साठवणूक:
-
✅ भाषांतरापूर्वी साठा तपासा
-
✅ उच्च साठा हिट दर
-
✅ कमी API खर्च
वेळापत्रक:
-
✅ दर ६ तासांनी cron द्वारे
-
✅ लॉक फाइल एकाचवेळी चालू होण्यापासून रोखते
-
✅ साप्ताहिक लेख भाषांतरे
संरक्षण:
-
✅ ब्रँड नावे
-
✅ HTML टॅग्स
-
✅ URLs आणि SKUs
ही पद्धत गटबद्ध करणे आणि साठवणूकद्वारे API खर्च कमी करते आणि भाषांतर गुणवत्ता सुधारते.