June 5, 2026
मैं कुछ ऐसा चला रहा हूँ जिस पर हम अनुवाद उद्योग में पर्याप्त बात नहीं करते हैं : यह नहीं कि विभिन्न एआई सिस्टम अलग-अलग अनुवाद करते हैं , बल्कि यह कि एक ही एआई के विभिन्न संस्करणअलग-अलग अनुवाद करते हैं — और कितना करते हैं।
पिछले हफ्ते मैंने मशीन ट्रांसलेशन.कॉम के आंतरिक परीक्षण मंच पर एक साथ चैटजीपीटी के पांच संस्करणों के माध्यम से एक स्पेनिश मुहावरे का परीक्षण किया। जो वापस आया वह मुझे रोक गया।
दो संस्करणों ने एक ऐसा अनुवाद तैयार किया जो, सचमुच, अंग्रेजी में निरर्थक है। तीन संस्करणों ने सही मुहावरेदार अनुवाद तैयार किए। और तीन सही वाले एक दूसरे से सहमत नहीं थे।
सभी पाँच ChatGPT हैं। सभी पांच ओपनएआई हैं। वही एआई, अलग मॉडल — और आउटपुट इससे ज़्यादा अलग नहीं हो सकते।
मैं इसे अभी साझा कर रहा हूँ क्योंकि मुझे लगता है कि यह मायने रखता है, न कि इसलिए कि मेरे पास स्पष्ट उत्तर हैं। मैं नहीं करता। लेकिन यह अवलोकन इतना दिलचस्प है कि इसे दुनिया में लाया जा सके।
मैंने जिस वाक्यांश का परीक्षण किया वह था llevarse el gato al agua.

यहां बताया गया है कि प्रत्येक संस्करण ने क्या उत्पादन किया:
| मॉडल | आउटपुट | मुहावरेदार? |
|---|---|---|
| चैटजीपीटी::जीपीटी-4ओ-मिनी | बिल्ली को पानी में ले जाना | ❌ शाब्दिक |
| चैटजीपीटी::जीपीटी-4.1-नैनो | बिल्ली को पानी में ले जाना | ❌ शाब्दिक |
| चैटजीपीटी::जीपीटी-4.1-मिनी | इसे सफलतापूर्वक पूरा करना | ✅ सही |
| चैटजीपीटी::जीपीटी-5.4-मिनी | अपनी राह पाना | ✅ आंशिक |
| चैटजीपीटी::जीपीटी-5.4 | शीर्ष पर आना | ✅ सही |
इस वाक्यांश का अर्थ है कि प्रतिकूल परिस्थितियों के बावजूद कुछ हासिल करना, कठिन जीत हासिल करना। इसका बिल्लियों या पानी से कोई लेना-देना नहीं है। शाब्दिक अनुवाद अनुवाद नहीं है। यह एक वाक्यांश का शब्द-दर-शब्द प्रतिलेखन है जिसे मॉडल मुहावरे के रूप में पहचानने में विफल रहा।
GPT-4o-MINI और GPT-4.1-NANO ने समान आउटपुट उत्पन्न किए। समान नहीं, बिल्कुल एक जैसा। हमारे अनुवाद अंतर्दृष्टि ने इसे सीधे फ़्लैग किया: जीपीटी-4.1-नैनो और जीपीटी-4o-मिनी, शाब्दिक व्याख्या पर जोर देते हुए, मुहावरेदार अर्थ के बजाय समान अनुवाद साझा करते हैं।
जीपीटी-4.1-मिनी, जीपीटी-5.4-मिनी, और जीपीटी-5.4 में से प्रत्येक ने कुछ पहचानने योग्य रूप से सही उत्पन्न किया - लेकिन एक दूसरे से अलग।
मैं इस बारे में सटीक होना चाहता हूं कि llevarse el gato al agua एक उपयोगी परीक्षण इनपुट क्यों है, न कि एक चुनिंदा।
यह एक सुस्थापित मुहावरा है। यह साहित्य, पत्रकारिता और रोजमर्रा की बोलचाल में दिखाई देता है। यह अस्पष्ट नहीं है। स्पेनिश पाठ के किसी भी उचित कॉर्पस पर प्रशिक्षित किसी भी मॉडल को इसका सामना करना पड़ा होगा। सवाल यह नहीं है कि मॉडल ने वाक्यांश देखा है या नहीं। सवाल यह है कि वह इसके साथ क्या करता है। मुहावरे के अनुवाद में सबसे खराब विफलता मोड एक बुरा अनुवाद नहीं
है। यह एक शाब्दिक अनुवाद उत्पन्न कर रहा है जो लक्ष्य भाषा को नहीं जानने वाले किसी व्यक्ति के लिए स्वीकार्य लगता है।
बिल्ली को पानी में ले जाना व्याकरणिक रूप से सही अंग्रेजी है। यह सुगठित है। यह कुछ ऐसा लगता है जिसका कोई मतलब हो सकता है। एक उपयोगकर्ता जो स्पेनिश नहीं बोलता है, वह इसे पढ़ सकता है, सिर हिला सकता है, और आगे बढ़ सकता है — यह कभी नहीं जान पाएगा कि मूल अर्थ पूरी तरह से खो गया था।
यह विफलता मोड है जिसकी मुझे परवाह है। स्पष्ट त्रुटि नहीं। अदृश्य वाला।
यहां पैटर्न यादृच्छिक नहीं है। दो मॉडल जिन्होंने शाब्दिक अनुवाद उत्पन्न किए (GPT-4o-MINI और GPT-4.1-NANO) दोनों छोटे, हल्के मॉडल हैं जो गति और लागत दक्षता के लिए अनुकूलित हैं। तीन मॉडल जिन्होंने मुहावरेदार अनुवाद (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) उत्पन्न किए, वे एक अलग पीढ़ी या पैरामीटर स्केल का प्रतिनिधित्व करते हैं।
यह कुछ ऐसा सुझाता है जो मुझे लगता है कि कम खोजा गया है: अनुवाद में मुहावरेदार क्षमता मॉडल क्षमता के साथ इस तरह से बढ़ती है जो सामान्य बेंचमार्क में दिखाई नहीं देती है।
सामान्य भाषा बेंचमार्क तर्क, ज्ञान, कोडिंग, गणित का परीक्षण करते हैं। वे आम तौर पर यह परीक्षण नहीं करते हैं कि क्या कोई मॉडल यह पहचान सकता है कि कि बिल्ली और कुत्ते की बारिश मौसम की स्थिति के बारे में नहीं है, या कि llevarse el gato al agua एक बिल्ली को हाइड्रेट करने के बारे में नहीं है। मुहावरे सांस्कृतिक ज्ञान, प्रासंगिक अनुमान और पैटर्न पहचान के चौराहे पर स्थित हैं - और वह चौराहा मॉडल क्षमता की एक सीमा की आवश्यकता प्रतीत होता है जिसे छोटे मॉडल लगातार पार नहीं करते हैं।
मैं यह दावा नहीं कर रहा हूं: कि बड़े मॉडल हमेशा बेहतर अनुवादक होते हैं। मेरे पास सामान्य नियम के तौर पर इसका कोई सबूत नहीं है। मैं क्या देख रहा हूँ: कि विशेष रूप से मुहावरेदार सामग्री के लिए, परिवार के भीतर का संस्करण अंतर मेरी अपेक्षा से अधिक था।
अधिकांश उपयोगकर्ता जो एआई अनुवाद उपकरण का उपयोग करते हैं, वे नहीं जानते कि वे उस एआई के किस संस्करण का उपयोग कर रहे हैं। वे एक उत्पाद खोलते हैं, एक भाषा जोड़ी चुनते हैं, और एक आउटपुट प्राप्त करते हैं। मॉडल रूटिंग उनके लिए अदृश्य है।
यह बड़े पैमाने पर मायने रखता है। मशीनट्रांसलेशन.कॉम ने केवल 90 दिनों की अवधि में अंग्रेजी-से-स्पेनिश अनुवाद के लाखों से अधिक कार्य पूरे किए। यदि उन नौकरियों का एक महत्वपूर्ण हिस्सा मुहावरेदार सामग्री (मार्केटिंग कॉपी, कानूनी भाषा, साहित्यिक पाठ, आकस्मिक संचार) को छूता है और उन नौकरियों को निर्देशित करने वाला उपकरण उपयोगकर्ताओं को उनकी जानकारी के बिना एक छोटे मॉडल पर निर्देशित कर रहा था, तो बिल्ली को पानी तक ले जाना वास्तविक आउटपुट में, वास्तविक दस्तावेजों में, वास्तविक लोगों के लिए दिखाई दे रहा था जो परिणाम पर भरोसा करते थे। अनुवाद उद्योग ने वर्षों से एआई प्रदाताओं की तुलना की है। डीपएल बनाम गूगल।
क्लाउड बनाम चैटजीपीटी। वे तुलनाएँ उपयोगी हैं । लेकिन एक ही प्रदाता के भीतर, संस्करण का अंतर उतना ही महत्वपूर्ण हो सकता है — और यह एक ऐसा अंतर है जिसे अधिकांश तुलनात्मक ढांचे नहीं मापते हैं क्योंकि वे मॉडल-संस्करण स्तर पर परीक्षण नहीं करते हैं। जब कोई कहता है मैं अनुवाद के लिए चैटजीपीटी का उपयोग करता हूं, तो वह वाक्य सार्थक होने के लिए पर्याप्त विशिष्ट नहीं है।
कौन सा चैटजीपीटी? नैनो? 4o-मिनी? 4.1-मिनी? 5.4? उत्तर उन तरीकों से आउटपुट को बदलता है जो गैर-तुच्छ हैं, कम से कम मुहावरेदार सामग्री के लिए।
यह वह हिस्सा है जो मुझे सबसे दिलचस्प लगता है, और मैंने अभी तक पूरी तरह से यह नहीं समझा है कि इसका क्या मतलब है।
मुहावरेदार अनुवाद उत्पन्न करने वाले तीन मॉडलों ने तीन अलग-अलग दिए:
तीनों llevarse el gato al aguaके बचाव योग्य अंग्रेजी रेंडरिंग हैं। लेकिन वे समतुल्य नहीं हैं।
इसे पूरा करने के लिएकठिनाई के मुकाबले निष्पादन पर जोर देता है, आपने कुछ कठिन किया और वह काम कर गया। अपनी बात मनवाने का अर्थ है कि आपने जो चाहा वह हासिल कर लिया, इस पर कम ज़ोर दिया गया है कि इसमें कितनी कठिनाई हुई। सर्वश्रेष्ठ बनना प्रतिस्पर्धी जीत, दूसरों के मुकाबले जीतना पर जोर देता है।
मूल स्पेनिश मुहावरा इनमें से पहले के सबसे करीब है। इस वाक्यांश में प्रतिरोध पर काबू पाने का अर्थ है, न कि केवल एक परिणाम को प्राथमिकता देना और उसे साकार करना। लेकिन अपनी बात मनवाना और जीतना गलत नहीं हैं, वे बस अलग-अलग दिशाओं में सटीक नहीं हैं।
इससे एक ऐसा प्रश्न उठता है जो मुझे वास्तव में कठिन लगता है: जब तीन मॉडल प्रत्येक एक सही लेकिन अलग मुहावरेदार अनुवाद उत्पन्न करते हैं, तो आप मूल्यांकन कैसे करते हैं कि कौन सा सबसे अच्छा है? BLEU स्कोर एक संदर्भ अनुवाद से तुलना करते हैं — लेकिन संदर्भ किसने लिखा, और इन तीनों में से वे किसे चुनते?
हमारे एआई अनुवाद एजेंट ने, अपनी साख के अनुसार, किसी भी आउटपुट को प्रतिबद्ध करने से पहले सही सवाल पूछा: इस संदर्भ में 'llevarse el gato al agua' का क्या मतलब है? तीन विकल्प दिए गए थे — एक कठिन लक्ष्य प्राप्त करना, कुछ अनावश्यक लेना, या जोखिम भरी गतिविधि में शामिल होना। यह सवाल सजावटी नहीं है। यह वह तंत्र है जिसके द्वारा अनुवाद को अंतिम रूप देने से पहले प्रासंगिक अस्पष्टता को हल किया जाता है।
लेकिन बात यह है: तीन सही उत्तर, अर्थ के तीन अलग-अलग रंग। अनुवाद मूल्यांकन उपकरण इस तरह की बारीकियों के लिए नहीं बनाए गए हैं ।
मैं इस परीक्षण के दायरे की सीमाओं के बारे में ईमानदार रहना चाहता हूं।
एक मुहावरा, एक भाषा जोड़ी, आंतरिक परीक्षण का एक दिन। वह अध्ययन नहीं है। यह एक अवलोकन है। मुझे नहीं पता कि यह पैटर्न (छोटे मॉडल शाब्दिक रूप से डिफ़ॉल्ट होते हैं, बड़े मॉडल मुहावरेदार होते हैं) लगातार इन पर लागू होता है या नहीं:
मुझे यह भी नहीं पता कि यह इन मॉडलों की एक स्थिर संपत्ति है या कुछ ऐसा है जो अपडेट और फाइन-ट्यूनिंग के साथ बदलता है। मॉडल प्रदाता अनुवाद-विशिष्ट चेंजलॉग प्रकाशित नहीं करते हैं। एक मॉडल संस्करण जो आज llevarse el gato al agua को सही ढंग से संभालता है, उसे अगले महीने अपडेट किया जा सकता है, और हमें पता नहीं चलेगा।
मुझे जो पता है: इस परीक्षण ने एक ऐसा परिणाम दिया जो इतना दिलचस्प था कि मैं उन्हें और अधिक, अधिक व्यवस्थित रूप से, अधिक भाषा जोड़े और सामग्री प्रकारों में चलाना चाहता हूं। जब मेरे पास साझा करने के लिए और होगा, तो मैं करूँगा।
मैं उन दो प्रश्नों के साथ समाप्त करूँगा जो इस परीक्षण ने मुझे दिए हैं। मैं उनका जवाब नहीं दूंगा, मेरे पास अभी ऐसा करने के लिए डेटा नहीं है। लेकिन मुझे लगता है कि ये सही सवाल हैं।
पहला: किस पैरामीटर थ्रेशोल्ड पर मुहावरेदार क्षमता भरोसेमंद हो जाती है?
GPT-4o-MINI और GPT-4.1-NANO (दोनों शाब्दिक) से GPT-4.1-MINI (मुहावरेदार) तक की छलांग बताती है कि उन मॉडल आकारों के बीच पैरामीटर रेंज में कहीं एक थ्रेशोल्ड है जहाँ मुहावरे की पहचान चालू हो जाती है। क्या यह सुसंगत है? क्या यह सभी भाषाओं के मुहावरों पर लागू होता है, या यह इस बात पर निर्भर करता है कि प्रशिक्षण डेटा में कोई भाषा कितनी अच्छी तरह प्रस्तुत की गई है? मुझे नहीं पता। लेकिन अनुवाद वर्कफ़्लो बनाने वाले किसी भी व्यक्ति के लिए यह जानना उपयोगी होगा। दूसरा: मॉडल संस्करण अपारदर्शिता की उपयोगकर्ताओं को बड़े पैमाने पर क्या लागत आती है? यदि कोई उपयोगकर्ता प्रति माह 1,000 दस्तावेज़ों को ऐसे टूल के माध्यम से रूट करता है जो यह खुलासा नहीं करता है कि कौन सा मॉडल संस्करण उपयोग किया जा रहा है (और उन दस्तावेज़ों में से कुछ में मुहावरेदार सामग्री होती है), तो शाब्दिक विफलता कितनी बार अदृश्य रूप से
हो रही
है? वे कैसे जानेंगे? कभी पता न चलने की वास्तविक लागत क्या है?
मुझे लगता है कि यह प्रश्न वर्तमान में प्रसारित होने वाले अधिकांश कौन सी AI अनुवाद के लिए सबसे अच्छी है की तुलना से अधिक महत्वपूर्ण है। इसका जवाब सबसे बड़े मॉडल का उपयोग करें नहीं है। इसका जवाब यह हो सकता है: जानें कि आप क्या उपयोग कर रहे हैं, अपनी सामग्री पर अपने स्वयं के परीक्षण चलाएं, और यह न मानें कि एक प्रदाता का नाम उनके मॉडल की सीमा में लगातार व्यवहार की गारंटी है।
कम से कम, मैं इस परीक्षण से यही समझ रहा हूँ।
इस एकल परीक्षण के आधार पर: एक ही AI परिवार के भीतर छोटे, दक्षता-अनुकूलित मॉडल एक स्थापित स्पेनिश मुहावरे के शाब्दिक अनुवाद पर डिफ़ॉल्ट हो गए, जबकि उसी मॉडल के बड़े/नए संस्करणों ने सही मुहावरेदार प्रस्तुतियाँ उत्पन्न कीं। क्या यह मुहावरे की श्रेणियों और भाषा युग्मों में भी लागू होता है, यह अगला प्रश्न है। मैं और परीक्षण करूँगा।
GPT-4.1-MINI, GPT-5.4-MINI, और GPT-5.4 सभी ने llevarse el gato al agua मुहावरे का अनुवाद किया - लेकिन सूक्ष्म रूप से भिन्न अर्थों वाले विभिन्न अंग्रेजी अभिव्यक्तियों में। यह सुझाव देता है कि मुहावरेदार अनुवाद की गुणवत्ता के कम से कम दो आयाम हैं: क्या मॉडल मुहावरे को बिल्कुल पहचानता है, और लक्ष्य भाषा के उपलब्ध विकल्पों में से वह कौन सा समतुल्य अभिव्यक्ति चुनता है। मानक अनुवाद गुणवत्ता मेट्रिक्स इन दो आयामों को स्पष्ट रूप से अलग नहीं करते हैं । मुझे लगता है कि उन्हें करना चाहिए। यह पोस्ट MachineTranslation.com के डेवलपमेंट प्लेटफॉर्म पर आंतरिक परीक्षण पर आधारित
है। यहां दिखाया गया मल्टी-मॉडल संस्करण परीक्षण अभी सार्वजनिक रूप से उपलब्ध नहीं है। मैं यह निष्कर्ष साझा कर रहा हूँ क्योंकि मुझे लगता है कि यह अवलोकन उपयोगी है, चाहे आप अपने अनुवाद कहीं भी चलाएँ।