अनुवाद

बिना फॉर्मेटिंग खोए किसी दस्तावेज़ का अनुवाद कैसे करें

अनुवादित दस्तावेज़ टूट जाते हैं क्योंकि अधिकांश टूल आपकी फ़ाइल को सामान्य टेक्स्ट में बदल देते हैं, उसका अनुवाद करते हैं, और फिर अनुमान लगाते हैं कि सब कुछ कहाँ गया। टेबल बिखर जाते हैं, कॉलम मिल जाते हैं, हेडर गायब हो जाते हैं। इसका उपाय यह है कि ऐसे अनुवाद इंजन का उपयोग किया जाए जो दस्तावेज़ की वास्तविक संरचना पर काम करता हो, और इंजन को फ़ाइल प्रकार से मिलाया जाए: Office फ़ाइलें, PDF, और कोड प्रत्येक अलग-अलग इंजनों पर स्पष्ट रूप से अनुवादित होते हैं। यह मार्गदर्शिका बताती है कि फ़ॉर्मेटिंग क्यों टूटती है और प्रत्येक कार्य के लिए सही इंजन कैसे चुनें।

अपडेट किया गया 27 अगस्त 2026 · 8 मिनट की रीडिंग

आप एक साफ़, तैयार दस्तावेज़ अपलोड करते हैं। आपको कुछ ऐसा वापस मिलता है जो लगता है जैसे श्रेडर (कागज काटने की मशीन) से गुजरा हो और फिर टेप से चिपकाया गया हो। शब्दों का अनुवाद तो सही होता है, लेकिन भुगतान तालिका (payment table) दो पृष्ठों में टूट चुकी होती है, दो-कॉलम वाला लेआउट अब टेक्स्ट का एक लंबा रिबन बन गया है, और हेडर मुख्य भाग में मिल गए हैं। अब आपको इसे ठीक करने में एक घंटा लगेगा, जिसमें अनुवाद द्वारा बचाए गए समय से अधिक समय खर्च होता है।

दस्तावेज़ अनुवाद में यह सबसे आम शिकायत है, और यह लगभग कभी भी भाषा की गुणवत्ता के बारे में नहीं होती। यह संरचना के बारे में होती है। एक बार जब आप समझ जाते हैं कि ऐसा क्यों होता है, तो इसे ठीक करना सीधा है, और यह आमतौर पर एक निर्णय पर निर्भर करता है: आप फ़ाइल को किस इंजन पर भेजते हैं।

अनुवाद फॉर्मेटिंग को क्यों तोड़ता है

एक बुनियादी अनुवादक क्रम से तीन काम करता है: यह आपकी फ़ाइल से टेक्स्ट निकालता है, उस टेक्स्ट का अनुवाद करता है, और उसे वापस डाल देता है। समस्या यह है कि पहले चरण में क्या खो जाता है। जब टेक्स्ट बाहर आता है, तो लेआउट की जानकारी पीछे छूट जाती है, इसलिए टूल को यह अनुमान लगाना पड़ता है कि पृष्ठ को फिर से कैसे इकट्ठा किया जाए। यही अनुमान टेबल्स और कॉलम को तोड़ते हैं।

PDF इसे और भी बदतर बना देते हैं। एक PDF वास्तव में उस तरह का दस्तावेज़ नहीं है जैसे Word फ़ाइल होती है। यह निर्देशों का एक सेट है जो बताता है कि एक पृष्ठ पर निशान कहाँ जाने चाहिए, न कि उन निशानों का क्या मतलब है। इसमें "यह एक टेबल है" या "यह दूसरा कॉलम है" जैसी कोई विश्वसनीय धारणा अंतर्निहित नहीं होती है। इसलिए जब कोई अनुवादक किसी PDF को अलग करता है, तो उसे इसे फिर से बनाने से पहले संरचना का अनुमान लगाना पड़ता है, और यदि वह अनुमान थोड़ा सा भी गलत होता है, तो लेआउट बिखर जाता है।

"फॉर्मेटिंग बनाए रखने" का वास्तव में क्या अर्थ है

हर टूट-फूट समान नहीं होती है, और सभी टूल एक ही जगह विफल नहीं होते हैं। जब लोग कहते हैं कि अनुवाद ने "फॉर्मेटिंग बनाए रखी," तो उनका आमतौर पर मतलब होता है कि यह सब बरकरार रहा:

  • टेबल: पंक्तियां, कॉलम, मर्ज किए गए सेल और बॉर्डर अपनी जगह पर रहते हैं, और अनुवादित टेक्स्ट सही सेल में होता है।
  • हेडर और फुटर: पृष्ठ संख्या, शीर्षक और रनिंग हेडर हर पृष्ठ पर बने रहते हैं।
  • मल्टी-कॉलम लेआउट: दो और तीन कॉलम वाले पृष्ठ एक ही प्रवाह में नहीं ढहते हैं।
  • जोर और पदानुक्रम (Emphasis and hierarchy): बोल्ड, इटैलिक, हेडिंग के स्तर और सूची इंडेंटेशन संरक्षित रहते हैं, सपाट नहीं होते।
  • चित्र और कैप्शन: चित्र अपनी स्थिति में रहते हैं, और उनके बगल का टेक्स्ट भी अनुवादित हो जाता है।

कुछ टूल टेक्स्ट स्टाइलिंग को तो सही रखते हैं लेकिन टेबल को नष्ट कर देते हैं। अन्य छवियों को अपनी जगह पर रखते हैं लेकिन आपके कॉलम को सपाट कर देते हैं। लक्ष्य एक ऐसे टूल का है जो इन सभी को एक साथ बनाए रखे, जिसकी संभावना तब कहीं अधिक होती है जब टूल आपकी फ़ाइल की चपटी (flattened) कॉपी के बजाय उसकी वास्तविक संरचना का अनुवाद करता है।

वास्तविक उपाय: इंजन को फ़ाइल से मिलाएँ

यहाँ वह हिस्सा है जिसे लगभग हर गाइड छोड़ देती है। फ़ॉर्मेटिंग के लिए कोई एक सर्वश्रेष्ठ अनुवाद इंजन नहीं है। प्रत्येक फ़ाइल प्रकार के लिए एक सर्वश्रेष्ठ इंजन है। एक टूल जो DOCX का खूबसूरती से अनुवाद करता है, वह PDF को पूरी तरह से अस्वीकार कर सकता है; जो PDF पर त्रुटिहीन है, उसकी आकार सीमा बहुत सख्त हो सकती है। ट्रिक कोई एक जादुई इंजन खोजना नहीं है। यह आपके सामने मौजूद काम के लिए सही इंजन चुनना है।

यही कारण है कि DocTranslating आपको सब कुछ एक ही पाइपलाइन के माध्यम से मजबूर करने के बजाय प्रति फ़ाइल इंजन चुनने देता है। नीचे दिया गया है कि चारों इंजन वास्तव में कैसे तुलना करते हैं, ताकि आप उन्हें स्वयं मिला सकें।

इंजनइसके लिए सर्वश्रेष्ठफ़ाइल प्रकारआकार सीमाध्यान दें
Microsoft AzureOffice फ़ाइलें (Word, PowerPoint, Excel)DOCX, PPTX, XLSX, HTML, MD, TXT20 MBकोई सीधा PDF समर्थन नहीं
Google Cloudसबसे सुसंगत समग्र परिणाम, PDF सहितPDF, DOCX, PPTX, XLSX10 MBसबसे छोटी आकार सीमा
DeepLअधिकांश जोड़ों पर उच्चतम अनुवाद गुणवत्ताDOCX, PPTX, XLSX, TXT, HTML, SRT, और बहुत कुछ30 MBघने PDF पर कभी-कभार लेआउट की समस्याएँ
Geminiकोड फ़ाइलें और मिश्रित-भाषा दस्तावेज़PDF और कोड (JS, TS, Python, आदि)100 MB (25-पृष्ठ सीमा)लंबे PDF पर पृष्ठ सीमा
फॉर्मेटिंग-सुरक्षित अनुवाद के लिए चारों इंजनों की तुलना।

जिद्दी PDF के लिए Office-फ़ाइल ट्रिक

यदि आपके पास कोई ऐसा PDF है जो बार-बार खराब होकर आ रहा है, तो एक विश्वसनीय तरीका है जिसका उपयोग पेशेवर करते हैं: PDF का अनुवाद न करें। इसे पहले Word में बदलें, Word फ़ाइल का अनुवाद करें (जहाँ संरचना स्पष्ट होती है और Azure बेहतरीन काम करता है), और फिर यदि आपको आवश्यकता हो तो वापस PDF में बदलें। इसमें एक अतिरिक्त कदम जुड़ जाता है, लेकिन क्योंकि Word फ़ाइल केवल अपनी दिखावट के बजाय अपनी संरचना को वास्तव में सहेजती है, परिणाम सीधे PDF का अनुवाद करने की तुलना में कहीं बेहतर रहता है।

यह तरीका काम क्यों करता है, इसका कारण सरल है: Word फ़ाइल अपने फ़ॉर्मेटिंग को संरचना के रूप में संग्रहीत करती है, इसलिए वह अनुवाद के बाद भी बरकरार रहती है, जबकि PDF केवल दिखावट संग्रहीत करता है, जिसे दोबारा बनाना पड़ता है और अक्सर टूट जाता है।

स्कैन किए गए दस्तावेज़ों के बारे में क्या?

एक ऐसा मामला है जहाँ इनमें से कोई भी सीधे काम नहीं करता: एक स्कैन किया हुआ PDF। स्कैन एक पृष्ठ की तस्वीर होती है, इसलिए अनुवाद करने के लिए कोई टेक्स्ट नहीं होता, केवल पिक्सेल होते हैं। इसका अनुवाद करने से पहले, छवि से टेक्स्ट को पहचान कर निकालना होता है। यही OCR है।

DocTranslating का OCR टूल इसे संभालता है, जो 50 से अधिक भाषाओं में स्कैन से टेक्स्ट पढ़ता है, जिसमें लिखावट भी शामिल है, ताकि कोई स्कैन किया हुआ अनुबंध या संग्रहीत प्रमाणपत्र किसी अन्य दस्तावेज़ की तरह अनुवाद योग्य बन जाए। यदि आपको पूरी प्रक्रिया जाननी है, तो स्कैन किए गए PDF से टेक्स्ट निकालने पर एक समर्पित मार्गदर्शिका उपलब्ध है।

कुछ भी भेजने से पहले एक चेकलिस्ट

आप चाहे किसी भी इंजन का उपयोग करें, क्लाइंट या ऑफिस में भेजने से पहले परिणाम की समीक्षा करने में दो मिनट बिताएं। मूल (original) और अनुवाद को अगल-बगल खोलें और जांचें:

  1. क्या टेबल अभी भी सही ढंग से लाइन में हैं, और सही सेल में सही टेक्स्ट है?
  2. क्या हेडर, फुटर और पृष्ठ संख्याएं हर पृष्ठ पर मौजूद हैं?
  3. क्या कोई मल्टी-कॉलम या दो-कॉलम वाले अनुभाग अपने कॉलम में ही रहे?
  4. क्या कोई बॉक्स से बाहर जा रहा है या मार्जिन के पार फैल रहा है (आमतौर पर टेक्स्ट का विस्तार)?
  5. क्या बोल्ड, इटैलिक और हेडिंग के स्तर अभी भी अपनी जगह पर हैं?

खिसके हुए टेबल को अभी पकड़ने में कुछ ही पल लगते हैं। क्लाइंट के ध्यान दिलाने के बाद इसे पकड़ना बहुत अधिक महंगा पड़ता है।

निष्कर्ष

अनुवाद के बाद फॉर्मेटिंग तब बची रहती है जब दो बातें सच हों: टूल आपकी फ़ाइल की चपटी कॉपी के बजाय उसकी वास्तविक संरचना पर काम करता हो, और इंजन वास्तव में उस फ़ाइल प्रकार का समर्थन करता हो जो आप उसे दे रहे हैं। Office फ़ाइलों को Azure से, PDF को Google से, गुणवत्ता-महत्वपूर्ण काम को DeepL से, और कोड या मिश्रित-भाषा फ़ाइलों को Gemini से मिलाएं, और रीफॉर्मेटिंग के बुरे सपने का अधिकांश हिस्सा आसानी से गायब हो जाएगा।

प्लेटफॉर्म पर नए हैं? DocTranslating का उपयोग करने की पूरी मार्गदर्शिका में फ़ाइल अपलोड करने, इंजन चुनने और अपना अनुवादित दस्तावेज़ डाउनलोड करने की चरण-दर-चरण प्रक्रिया बताई गई है।

अक्सर पूछे जाने वाले प्रश्न

मैं बिना फॉर्मेटिंग खोए PDF का अनुवाद कैसे करूं?

ऐसे अनुवादक का उपयोग करें जो PDF के लिए बना हो और फ़ाइल को सामान्य टेक्स्ट में बदलने के बजाय लेआउट को सुरक्षित रखता हो। DocTranslating पर, Google Cloud PDF के लिए सबसे सुसंगत इंजन है। किसी जिद्दी PDF के लिए, पहले इसे Word में बदलना, उसका अनुवाद करना, और वापस बदलना अक्सर सबसे साफ़ परिणाम देता है, क्योंकि एक Word फ़ाइल अपनी संरचना को स्पष्ट रूप से सहेजती है जबकि PDF केवल अपनी दिखावट को सहेजता है।

Word, PowerPoint और Excel फ़ाइलों के लिए कौन सा इंजन सबसे अच्छा है?

Microsoft Azure Office फ़ॉर्मेट के लिए सबसे मज़बूत है। यह DOCX, PPTX और XLSX फ़ाइलों को मूल जैसा ही दिखने देता है क्योंकि यह लेआउट को खरोंच से (from scratch) फिर से बनाने के बजाय दस्तावेज़ की अंतर्निहित संरचना का अनुवाद करता है।

अनुवाद सही होने के बावजूद मेरा अनुवादित दस्तावेज़ टूटा हुआ क्यों दिखता है?

क्योंकि अनुवाद की सटीकता और फॉर्मेटिंग दो अलग-अलग समस्याएँ हैं। अधिकांश टूल टेक्स्ट को बाहर निकालते हैं, उसका अनुवाद करते हैं, और फिर अनुमान लगाते हैं कि पृष्ठ को वापस कैसे एक साथ रखा जाए। शब्द तो सही निकलते हैं, लेकिन अनुमान लगाया गया लेआउट टूट जाता है: टेबल बिखर जाते हैं, कॉलम मिल जाते हैं, हेडर गायब हो जाते हैं। फ़ाइल की वास्तविक संरचना पर काम करने वाले टूल का उपयोग करने से इससे बचा जा सकता है।

क्या मैं स्कैन किए गए PDF का अनुवाद कर सकता हूँ?

हाँ, लेकिन इसके लिए एक अतिरिक्त कदम की आवश्यकता है। एक स्कैन एक छवि होती है, इसलिए अनुवाद करने के लिए तब तक कोई टेक्स्ट नहीं होता जब तक कि OCR पृष्ठ से टेक्स्ट को पढ़ नहीं लेता। DocTranslating का OCR टूल लिखावट सहित 50 से अधिक भाषाओं में टेक्स्ट को पहचानता है, और एक स्कैन को अनुवाद योग्य दस्तावेज़ में बदल देता है।

कोड या ऐसे दस्तावेज़ों के लिए मुझे किस इंजन का उपयोग करना चाहिए जिनमें भाषाएँ मिश्रित हों?

Gemini। यह चारों इंजनों में से एकमात्र ऐसा इंजन है जो कोड फ़ाइलों (JavaScript, TypeScript, Python और अन्य) का अनुवाद करता है और एकमात्र ऐसा है जो एक से अधिक स्रोत भाषा वाले दस्तावेज़ों को संभालता है। यह 100 MB तक की फ़ाइलें स्वीकार करता है लेकिन 25 पृष्ठों तक सीमित है।