July 10, 2026
दो शब्द। छह मॉडल। तीन अलग-अलग अनुवाद निर्णय। यहाँ देखिए कि जब मैंने MachineTranslation.com पर उपलब्ध नवीनतम AI मॉडल्स के माध्यम से 8 परीक्षण वाक्य चलाए, तो आउटपुट वास्तव में क्या प्रकट करते हैं जब एक मॉडल चुप चाप विफल हो जाता है।
दो शब्द। वह बीमार है। छह मॉडल। तीन अलग-अलग अनुवाद निर्णय।
जापानी में, एक मॉडल ने इसे それはやばい के रूप में प्रस्तुत किया, जो अस्पष्टता को संरक्षित करता है। एक और ने विषय सर्वनाम को पूरी तरह छोड़ दिया और नंगे रूप やばい लिखा, जो संभव सबसे अनौपचारिक संस्करण है। एक तीसरे ने लिखा それはすごい, जो अस्पष्टता को पूरी तरह से "अद्भुत" के पक्ष में हल करता है, उस दोहरे अर्थ को निकाल देता है जो पहले वाक्य को दिलचस्प बनाता था। वियतनामी में, एक मॉडल ने Đỉnh vậy (स्लैंग, युवा रजिस्टर के लिए सही) लिखा। एक अन्य ने लिखा यह वास्तव में अद्भुत है, व्याकरणिक रूप से सही है, लेकिन जब कोई आपको एक मेम भेजता है तो "यह वास्तव में अद्भुत है" कहने के करीब है।
ये सभी रक्षणीय हैं। उनमें से कोई भी एक जैसी चीज नहीं है। और अगर आप अनुवाद को एक ही मॉडल के माध्यम से चला रहे हैं, तो आप कभी भी आपकी ओर से किए गए विकल्प को नहीं देखेंगे।
यह केंद्रीय प्रश्न है जिसका उत्तर देने की कोशिश यह लेख कर रहा है। यह सवाल नहीं है कि 2026 में अनुवाद के लिए कौन सा AI मॉडल सबसे अच्छा है (उत्तर भाषा जोड़ी, रजिस्टर, डोमेन और वाक्य संरचना पर निर्भर करता है), बल्कि: आप कैसे जान सकते हैं कि आपके मॉडल ने गलत निर्णय लिया? विशेष रूप से चिकित्सा शब्दावली, कानूनी अनुबंध, या व्यावसायिक औपचारिकता जैसे डोमेन में, जहां गलत निर्णय बिल्कुल सही अनुवाद जैसा दिखता है जब तक कि कोई विशेषज्ञ इसे नहीं पढ़ता।
यहाँ मैंने क्या किया। मैंने 8 परीक्षण वाक्यों को MachineTranslation.com पर दो राउंड के मॉडल के माध्यम से चलाया: पहले 5 व्यापक रूप से उपयोग किए जाने वाले मॉडल की एक आधारभूत रेखा, फिर एक विस्तारित पूल जो अब भुगतान करने वाले उपयोगकर्ताओं के लिए उपलब्ध कई नवीनतम प्रीमियम-स्तरीय मॉडल वेरिएंट जोड़ता है। आम तौर पर, इस तरह के मॉडल से आउटपुट की तुलना करने का मतलब प्रत्येक प्रदाता के साथ अलग-अलग सशुल्क सदस्यता होगी। MachineTranslation.com पर, वे एक ही तुलना दृश्य में बैठते हैं। भाषा जोड़े अंग्रेजी→जापानी और अंग्रेजी→वियतनामी थे। वाक्य श्रेणियों को विशेष रूप से उन क्षेत्रों को तनाव-परीक्षण करने के लिए चुना गया था जहां मॉडल असहमति सबसे परिणामी है: मुहावरेदार वाक्यांश, कानूनी शब्दावली, चिकित्सा शब्दावली, औपचारिकता-संवेदनशील संदर्भ, और जानबूझकर अर्थगत अस्पष्टता।
मूल्यांकन पद्धति पर एक नोट: मशीन अनुवाद अनुसंधान लंबे समय से स्वचालित रूप से आउटपुट स्कोर करने के तरीके के साथ जूझ रहा है। BLEU और COMET जैसे मेट्रिक्स जैसा कि WMT साझा कार्यों में मापा जाता है, उपयोगी समग्र संकेत देते हैं, लेकिन वे रजिस्टर त्रुटियों, मुहावरे की विफलताओं, और शब्दावली सटीकता का पता लगाने में खराब हैं, बिल्कुल वे श्रेणियां जो यहां सबसे अधिक महत्वपूर्ण हैं। आप जो पढ़ने वाले हैं वह आउटपुट विश्लेषण है, न कि BLEU दौड़।

हर वाक्य एक सार्थक असहमति को सामने नहीं लाता है। आठ परीक्षणों में से दो, "आइए इस सौदे पर धूल जमने के बाद एक बार संपर्क में आते हैं" (→ जापानी) और "हम इस लॉन्च तारीख को पूरा करने के लिए मध्यरात्रि का तेल जला रहे हैं" (→ वियतनामी), दोनों दौरों में उच्च समझौता पैदा हुआ। मुहावरों को सही ढंग से मुहावरों के रूप में समझा गया। किसी ने भी "touch base" का अनुवाद शारीरिक आधार को छूने के रूप में नहीं किया। किसी ने "the dust settles" का अनुवाद तलछट गिरने के रूप में नहीं किया।
यह ध्यान देने योग्य है: मुहावरेदार अंग्रेजी व्यावसायिक भाषा वर्तमान अत्याधुनिक मॉडल द्वारा काफी अच्छी तरह से संभाली जाती है जब मुहावरा काफी सामान्य होता है। "टच बेस" के लिए सर्वसम्मति दोनों दौरों में स्थिर रही; भिन्नता विशुद्ध रूप से शैलीगत थी, चाहे इस मामले (this matter), इस सौदे (this deal), या इस मामले (this case) के लिए इस件 (this matter), इस取引 (this deal), या इस案件 (this case) का उपयोग करना हो।

"मध्यरात्रि का तेल जलाना" परीक्षण वह जगह है जहां चीजें अधिक दिलचस्प हो गईं। एक को छोड़कर हर मॉडल ने मुहावरे को सही तरीके से समझा। MiniMax M2.7, राउंड 2 में पेश किया गया, "burning" का शाब्दिक अनुवाद किया, जिससे đốt đuốc, का अर्थ "जलती हुई मशालें" निकला। सर्वसम्मति ने इसे सही तरीके से बाहर रखा।

जापानी एक औपचारिकता-स्तरीय भाषा है। क्रिया समापन, सर्वनाम और संदर्भात्मक संज्ञा रूप का चयन शैलीगत नहीं है। यह वक्ता और प्राप्तकर्ता के बीच संबंध को दर्शाता है। अपने CEO को casual verb forms का उपयोग करके संदेश भेजना व्याकरणिक अर्थ में अनुवाद त्रुटि नहीं है। यह एक सामाजिक त्रुटि है, और एक महत्वपूर्ण है।
क्या आप वह भेज सकते हैं? धन्यवाद, इसकी सराहना करता हूँ।" संदर्भ: एक CEO को संदेश भेजना।

मॉडल पूल के विस्तार होने पर सर्वसम्मति बदल गई। तंत्र सीधा है: मॉडल जोड़ने जो औपचारिकता संदर्भ को सही तरीके से पढ़ते हैं, ने बहुमत को स्थानांतरित किया, और सहमति का पालन किया। यहाँ Round 2 में मॉडल द्वारा उत्पादित पूरा स्पेक्ट्रम है:

वियतनामी रजिस्टर परीक्षण ने एक अलग तरह की औपचारिकता त्रुटि को सामने लाया, जो कि अधिक सूक्ष्म है। स्रोत वाक्य: "अरे, एक जल्दी सवाल — क्या तुम कॉल पर आने के लिए फ्री हो?" **संदर्भ: किसी क्लाइंट को संदेश भेजना।** राउंड 1 में Qwen में "mình" शामिल था, जो एक प्रथम-व्यक्ति सर्वनाम है जो आकस्मिक साथी-स्तरीय मित्रता का संकेत देता है। हर दूसरे मॉडल ने पूरी तरह से प्रथम-व्यक्ति आत्म-संदर्भ से बचा, जो अधिक सुरक्षित व्यावसायिक विकल्प है। महत्वपूर्ण रूप से, Qwen ने इसे Round 2 में ठीक किया और "mình" को हटा दिया। दोनों दौरों में सर्वसम्मति ने इसे बाहर रखा।

विक्रेता/ग्राहक क्षतिपूर्ति वाक्य वाणिज्यिक समझौतों में एक मानक खंड है: "विक्रेता इस समझौते के उल्लंघन से उत्पन्न किसी भी तीसरे पक्ष के दावों के विरुद्ध ग्राहक को क्षतिपूर्ति देगा।"
राउंड 1 में, सभी पांच मॉडलों ने कानूनी रजिस्टर की सही पहचान की और उधार लिए गए शब्दों ベンダー (विक्रेता) और クライアント (ग्राहक) का उपयोग किया, जो अंग्रेज़ी मूल के जापानी वाणिज्यिक अनुबंधों में मानक हैं। एक अपवाद: GPT-4.1-NANO ने 販売者 (विक्रेता) और 顧客 (ग्राहक) का उपयोग किया, जो वैध जापानी शब्द हैं जिनमें ऋण शब्द समकक्षों की औपचारिक कानूनी विशिष्टता का अभाव है।
अधिक महत्वपूर्ण खोज दूसरे दौर में सामने आई। मुख्य अंतर दो शब्दों के बीच है:
ये कानूनी रूप से अलग-अलग अवधारणाएं हैं। "Indemnify" विशेष रूप से किसी पक्ष को तीसरे पक्ष की देयता से बचाने का अर्थ है। क्षतिपूर्ति सही कानूनी शब्द है। सभी राउंड 1 मॉडल 補償 का उपयोग करते थे। राउंड 2 में, DeepSeek V4-Pro एकमात्र मॉडल था जिसने 免責 का उत्पादन किया, और यह केवल राउंड 2 में ही किया, राउंड 1 में नहीं।

एक अनुबंध में, 補償 और 免責 पर्यायवाची नहीं हैं। "एक का मतलब है 'हम आपको वापस भुगतान करेंगे।'" दूसरा मतलब है "आप पहली जगह में दावे से सुरक्षित हैं।" यदि कोई अनुवाद प्लेटफॉर्म जहां 免責 सही है वहां 補償 का उपयोग करता है, तो जापानी संस्करण पढ़ने वाला एक वकील वही समझौता नहीं देखेगा जो अंग्रेजी संस्करण वर्णित करता है।
यह डेटासेट में सबसे महत्वपूर्ण खोज है। परीक्षण वाक्य: "यह दवा यकृत हानि के इतिहास वाले रोगियों में contraindicated है।" स्रोत: नैदानिक उत्पाद दस्तावेज़। लक्ष्य: Vietnamese.
यकृत हानि "hepatic impairment" महत्वपूर्ण शब्द है। दो वियतनामी उम्मीदवार हैं:
ये नैदानिक रूप से भिन्न हैं। "हेपेटिक दुर्बलता" के आधार पर एक मतभेद चेतावनी केवल उन लोगों के लिए नहीं है जिन्होंने पूर्ण अंग विफलता का अनुभव किया है, बल्कि यह किसी भी व्यक्ति पर लागू होती है जिसके यकृत की कार्यप्रणाली में कमी है। "suy gan" का उपयोग करने से संकेतित जनसंख्या को गलत तरीके से सीमित किया जाता है। मध्यम यकृत क्षति वाले एक रोगी, जो "suy gan" पढ़ते हैं, हो सकता है कि खुद को उस निषिद्ध (contraindicated) आबादी के रूप में न पहचानें।

कुछ स्रोत वाक्य जानबूझकर अस्पष्ट होते हैं। समकालीन अंग्रेजी स्लैंग में "That's sick" का अर्थ कुछ उत्कृष्ट है, लेकिन यह अपने शाब्दिक अर्थ को भी बनाए रखता है (अर्थात् घृणास्पद/भद्दा), और इन दोनों अर्थों के बीच का तनाव इस वाक्यांश के संचार का एक हिस्सा है। एक अनुवाद मॉडल के लिए चुनौती यह है: क्या आप अस्पष्टता को संरक्षित करते हैं, इसे सबसे संभावित अर्थ तक सीमित करते हैं, या एक को चुनते हैं और प्रतिबद्ध होते हैं?


इस परीक्षा में मॉडल सभी समान नहीं हैं। वे विभिन्न आर्किटेक्चर, प्रशिक्षण व्यवस्था और तैनाती संदर्भों में फैले हुए हैं। राउंड 1 बेसलाइन में ऐसे मॉडल शामिल हैं जो व्यापक रूप से सुलभ हैं। विस्तारित राउंड 2 पूल में अब MachineTranslation.com पर भुगतान करने वाले उपयोगकर्ताओं के लिए उपलब्ध कई नवीनतम प्रीमियम-स्तरीय मॉडल वेरिएंट जोड़े गए हैं, जो मॉडल का वही स्तर है जिसका अर्थ अन्यथा प्रत्येक व्यक्तिगत प्रदाता के साथ एक अलग भुगतान खाता होगा।

राउंड 2 में विस्तारित पूल में ऐसे मॉडल शामिल हैं जो अधिक उन्नत हैं और MachineTranslation.com पर भुगतान करने वाले उपयोगकर्ताओं के लिए उपलब्ध हैं। पूल को विस्तृत करने का प्रभाव समान नहीं है। कुछ परीक्षणों में (औपचारिकता/जापानी), इसने सहमति को सार्थक रूप से स्थानांतरित किया। दूसरों में (चिकित्सा शब्दावली/वियतनामी), विभाजन गहरा हो गया।

परीक्षण डेटा दो अलग-अलग विफलता श्रेणियों की ओर इशारा करता है, और उन्हें विभिन्न प्रतिक्रियाओं की आवश्यकता है।
श्रेणी A: मौन विफलताएं। औपचारिकता त्रुटियां, रजिस्टर त्रुटियां, चिकित्सा शब्दावली सटीकता: ये ऐसे आउटपुट का उत्पादन करती हैं जो सही दिखते हैं। जापानी व्याकरणिक है। वह वियतनामी धाराप्रवाह है। कोई भी सतही संकेत नहीं है कि कुछ गलत हुआ। एक भाषाभाषी उपयोगकर्ता एक एकल मॉडल के आउटपुट को पढ़ते हुए यह जानने का कोई तरीका नहीं है कि मॉडल ने एक रजिस्टर विकल्प बनाया है जिसे एक वरिष्ठ जापानी कार्यकारी नोटिस करेगा, या कि एक नैदानिक शब्द को इस तरह से संकीर्ण किया गया था जो जनसंख्या को बदल देता है जिसमें यह लागू होता है।
श्रेणी बी: दृश्यमान विफलताएं। MiniMax "burning the midnight oil" को "burning torches" के रूप में अनुवाद कर रहा है। GPT-4.1-NANO "That's sick" को स्पष्ट "すごい" में हल कर रहा है। ये पहचानने योग्य हैं, या तो लक्ष्य भाषा के वक्ता द्वारा या अन्य मॉडल आउटपुट के साथ तुलना करके।
बहु-मॉडल तुलना जो SMART प्रदान करता है, वह श्रेणी A में सबसे मूल्यवान है। जब पाँच या दस मॉडल आउटपुट तैयार करते हैं और अधिकांश एक औपचारिक रजिस्टर पर सहमत होते हैं जबकि एक अनौपचारिक सादा-रूप जापानी तैयार करता है, तो असहमति तुलना दृश्य में दृश्यमान होती है। एक उपयोगकर्ता जो लक्ष्य भाषा बोलता है वह विकल्पों का मूल्यांकन कर सकता है। एक उपयोगकर्ता जो नहीं देख सकता कि एक विवादास्पद निर्णय लिया गया था, और यह तय कर सकता है कि क्या वह वाक्य मानव समीक्षा की गारंटी देता है।
दस्तावेज़-स्तरीय कार्य के लिए, बड़ी फ़ाइलें, पीडीएफ, अनुबंध, या नैदानिक सामग्री का लेआउट-संरक्षण अनुवाद, प्लेटफ़ॉर्म की दस्तावेज़ प्रसंस्करण क्षमता फ़ाइल संरचना को बिना स्वरूपण को तोड़े संभालती है। लेकिन ऊपर उठाए गए गुणवत्ता के सवाल फ़ाइल आकार की परवाह किए बिना लागू होते हैं। एक 100-पृष्ठ की नैदानिक अध्ययन जहां "hepatic impairment" के हर उदाहरण को "यकृत विफलता" के रूप में अनुवादित किया गया है, परीक्षण 2 में पहचानी गई समस्या का एक बड़ा संस्करण है।
चिकित्सा और कानूनी श्रेणियों के लिए विशेष रूप से, मानव सत्यापन सही रोकथाम है। Tomedes की AI पोस्ट-एडिटिंग सेवा, जो इस तरह की उच्च-दांव सामग्री के लिए AI आउटपुट को प्रमाणित मानव समीक्षा के साथ जोड़ती है, इसके लिए बनाई गई है। सुय गान / सुय गिảm chức năng gan विभाजन बिल्कुल वह तरह का निष्कर्ष है जो उस समीक्षा को ट्रिगर करना चाहिए, न कि इसलिए कि सभी मॉडल गलत हैं, बल्कि इसलिए कि जो मॉडल सबसे आत्मविश्वासी हैं वे सबसे सटीक नहीं हैं।
कई आउटपुट देखने का मूल्य यह नहीं है कि आप हमेशा बहुमत को चुनेंगे। यह कि आप जानेंगे कि एक विकल्प बनाया गया था, जो आपके सामने के आउटपुट को सही मानने से अलग है।

आठ परीक्षणों को एक साथ रखें और एक पैटर्न कायम रहता है: सहमति और असहमति यादृच्छिक रूप से वितरित नहीं हैं। मुहावरेदार, रोजमर्रा की व्यावसायिक भाषा ("संपर्क स्थापित करना," "रातभर काम करना") लगभग हर मॉडल में दोनों राउंड में एकत्रित हुई। औपचारिकता, कानूनी सटीकता, और चिकित्सा शब्दावली नहीं थी। मुख्य कार्यकारी अधिकारी-औपचारिकता परीक्षण विस्तारित पूल को शामिल करने के बाद ही अनौपचारिक से औपचारिक हो गया। क्षतिपूर्ति खंड ने एक वास्तविक कानूनी अंतर को उजागर किया (दायित्व से मुक्ति बनाम मुआवजा) जिसे केवल एक मॉडल ने, एक दौर में, सही तरीके से समझा। चिकित्सा शब्दावली विभाजन कभी भी पूरी तरह से हल नहीं हुआ, दोनों राउंड में लगभग 6-से-4 पर रहा, चाहे कोई भी मॉडल पूल में हों।
यह वास्तविक खोज है, विपणन दावा नहीं: सर्वसम्मति हर वाक्य को बेहतर नहीं बनाती है, और इसकी आवश्यकता नहीं है। यह सबसे मूल्यवान है ठीक वहाँ जहाँ एक एकल मॉडल की प्रवाहिता आपको इसमें संदेह करने का कोई कारण नहीं देती है, और जहाँ गलत होना वास्तव में कुछ खर्च करता है।
इस परीक्षण के लिए एक दूसरी, अधिक व्यावहारिक परत है जो स्पष्ट रूप से कहने योग्य है। इस तुलना को स्वयं चलाने का मतलब था कि GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, और MiniMax M2.7 से आउटपुट को एक साथ, एक जगह पर, एक प्लेटफॉर्म पर मौजूदा बेसलाइन मॉडल के साथ जांचना। MachineTranslation.com के बाहर, यह एक सदस्यता नहीं है। यह कई हैं, प्रत्येक प्रदाता के लिए एक जिसके प्रीमियम टियर को आप परीक्षण करना चाहते हैं, जो भी प्रत्येक प्रदाता व्यक्तिगत रूप से चार्ज करता है। यहां भुगतान करने वाले उपयोगकर्ताओं को वही तुलना एक क्लिक में मिलती है, पांच अलग-अलग प्रीमियम सदस्यताओं को बनाए रखने की तुलना में एक अंश की लागत पर, बिना उस चीज को छोड़े जो वास्तव में मायने रखती है: यह देखना कि मॉडल कहां सहमत हैं, और बिल्कुल जानना कि वे कब नहीं हैं।
कोई भी स्पष्ट रूप से बेहतर नहीं है; यह परीक्षण श्रेणी पर निर्भर करता है। Claude Sonnet और Claude Opus ने लगातार अधिक सटीक वियतनामी चिकित्सा शब्द को चुना, और Claude Opus ने "That's sick" के लिए सबसे उपयुक्त स्लैंग का उत्पादन किया। लेकिन Claude Sonnet ने एक औपचारिक CEO-संदर्भ वाक्य में अनौपचारिक जापानी भाषा का उत्पादन किया, जहाँ GPT-5.5 को सही जवाब मिला। आउटपुट की सीधे तुलना करना किसी एक मॉडल को चुनकर उस पर भरोसा करने से अधिक रक्षणीय है।
कोई एक नहीं है; सटीकता डोमेन पर निर्भर है। Gemini 3.5-Flash और GLM-5-Turbo ने इस परीक्षा में सबसे उपयुक्त औपचारिक जापानी का उत्पादन किया। दोनों Claude मॉडल वियतनामी चिकित्सा शब्दावली पर सबसे सटीक थे। DeepSeek V4-Pro एकमात्र मॉडल था जिसने सही जापानी कानूनी शब्द का उपयोग किया, लेकिन केवल राउंड 2 में, और इसने अन्य जगहों पर आकस्मिक जापानी का उत्पादन किया। कोई भी एकल मॉडल सभी आठ परीक्षणों में प्रभावी नहीं रहा।
नहीं, स्वचालित रूप से नहीं। नई प्रीमियम-स्तरीय मॉडल वेरिएंट के साथ पूल का विस्तार करने से जापानी औपचारिकता परीक्षण में सहमति को अनौपचारिक से औपचारिक में स्थानांतरित कर दिया गया। लेकिन वियतनामी चिकित्सा शब्दावली परीक्षण में, विभाजन लगभग 6-से-4 के अनुपात में बना रहा, चाहे कोई भी मॉडल शामिल किए गए हों। अधिक मॉडल अधिक असहमति को सामने लाते हैं, जो एक उपयोगी संकेत है, लेकिन सहमति अभी भी बहुमत का अनुसरण करती है, और बहुमत हमेशा सबसे सटीक उत्तर नहीं होता है।
SMART MachineTranslation.com की एक बहु-मॉडल सर्वसम्मति प्रणाली है, जो OpenAI, Anthropic, Google और DeepSeek सहित प्रदाताओं के 22 तक AI मॉडल को शामिल करती है। यह एक साथ कई मॉडलों के माध्यम से अनुवाद चलाता है और बहुमत-सहमति आउटपुट को हर व्यक्तिगत मॉडल के उत्तर के साथ सामने लाता है, डिफ़ॉल्ट रूप से, कोई कॉन्फ़िगरेशन की आवश्यकता नहीं है। सर्वसम्मति मॉडल पूल के बदलने पर बदलती है, जैसा कि इस परीक्षण के जापानी औपचारिकता परिणाम में दिखाया गया है: राउंड 1 में एक अनौपचारिक सर्वसम्मति राउंड 2 में औपचारिक हो गई।
कोई एक मॉडल नहीं; मानव समीक्षा बेहतर उत्तर है। Claude मॉडल्स ने लगातार अधिक सटीक वियतनामी चिकित्सा शब्द को चुना, और DeepSeek V4-Pro ने अकेले ही सही जापानी कानूनी शब्द का उपयोग किया, लेकिन केवल राउंड 2 में। चिकित्सा शब्दावली विभाजन 10 मॉडलों में कभी हल नहीं हुआ, जो यह संकेत देता है कि एक अलग मॉडल चुना जाना चाहिए नहीं, बल्कि डोमेन विशेषज्ञता की आवश्यकता है। A प्रमाणित मानव पोस्ट-एडिटिंग समीक्षा, जैसे कि Tomedes प्रदान करता है, वह विशेषज्ञ जांच प्रदान करता है।