July 10, 2026
دو الفاظ۔ چھ ماڈل۔ تین مختلف ترجمے کے فیصلے۔ یہاں دیکھیں کہ جب میں نے MachineTranslation.com پر دستیاب تازہ ترین AI ماڈلز کے ذریعے 8 ٹیسٹ جملے چلائے تو کیا ہوا، اور ان آؤٹ پٹ سے اصل میں یہ ظاہر ہوتا ہے کہ ایک ماڈل خاموشی سے کب ناکام ہوتا ہے۔
دو الفاظ۔ یہ بیمار ہے۔ چھ ماڈل۔ تین الگ الگ ترجمہ کے فیصلے۔
جاپانی میں، ایک ماڈل نے اسے それはやばいکے طور پر پیش کیا، ابہام کو برقرار رکھتے ہوئے۔ ایک اور نے موضوع کی ضمیر کو مکمل طور پر چھوڑ دیا اور bare form やばい لکھا، جو سب سے زیادہ بول چال والا ورژن ممکن ہے۔ ایک تیسرے نے لکھا یہ بہت شاندار ہے، جو ابہام کو مکمل طور پر "حیرت انگیز" کے حق میں حل کرتا ہے، اس دوہری معنی کو نکال دیتا ہے جو اس جملے کو دلچسپ بناتی تھی۔ ویتنامی میں، ایک ماڈل نے لکھا اس طرح (سلنگ، نوجوانوں کے رجسٹر کے لیے درست)۔ ایک اور نے لکھا یہ واقعی شاندار ہے، گرامر کے لحاظ سے درست، لیکن جب کوئی آپ کو ایک meme بھیجے تو "یہ واقعی حیرت انگیز ہے" کہنے کے قریب تر ہے۔
یہ تمام قابل دفاع ہیں۔ ان میں سے کوئی بھی ایک جیسی چیز نہیں ہے۔ اور اگر آپ ترجمے کو ایک واحد ماڈل کے ذریعے چلا رہے ہیں، تو آپ کو کبھی بھی آپ کی طرف سے کیے گئے انتخاب کو نہیں دیکھیں گے۔
یہ مرکزی سوال ہے جس کا جواب یہ مضمون دینے کی کوشش کر رہا ہے۔ یہ سوال نہیں کہ 2026 میں ترجمے کے لیے کون سا AI ماڈل بہترین ہے (جواب زبان کے جوڑے، رجسٹر، ڈومین، اور جملے کی ساخت پر منحصر ہے)، بلکہ یہ: آپ کو کیسے معلوم ہوگا کہ آپ کے ماڈل نے غلط فیصلہ کیا؟ خاص طور پر طبی اصطلاحات، قانونی معاہدوں، یا پروفیشنل رسمیت جیسے ڈومینز میں، جہاں غلط فیصلہ بالکل صحیح ترجمے جیسا لگتا ہے جب تک کہ کوئی ماہر اسے نہ پڑھے۔
یہاں میں نے جو کیا۔ میں نے 8 ٹیسٹ جملوں کو MachineTranslation.com پر دو راؤنڈ ماڈلز کے ذریعے چلایا: پہلے 5 وسیع پیمانے پر استعمال شدہ ماڈلز کی ایک بنیادی لائن، پھر ایک توسیع شدہ پول جو اب ادائیگی کرنے والے صارفین کے لیے دستیاب نئے پریمیم ٹیئر ماڈل کی متغیرات کو شامل کرتا ہے۔ عام طور پر، اس طرح کے ماڈلز سے نتائج کا موازنہ کرنے کا مطلب ہر فراہم کنندہ کے ساتھ الگ الگ معاوضہ شدہ رکنیت ہوگا۔ MachineTranslation.com پر، وہ ایک جیسے موازنہ کے نقطہ نظر میں بیٹھے ہوئے ہیں۔ زبان کے جوڑے انگریزی→جاپانی اور انگریزی→ویتنامی تھے۔ جملہ کی زمرہ جات کو خاص طور پر ان علاقوں کو دباؤ ڈالنے کے لیے منتخب کیا گیا تھا جہاں ماڈل کے اختلاف سب سے زیادہ اہم ہیں: محاورہ والی تشکیل، قانونی اصطلاحات، طبی اصطلاحات، رسمیت سے حساس سیاق و سباق، اور ارادی معنی کی ابہام۔
تشخیص کے طریقہ کار پر ایک نوٹ: مشین ترجمہ کی تحقیق نے طویل عرصے سے اس سے جوجھا ہے کہ آؤٹ پٹ کو خودکار طور پر کیسے اسکور کیا جائے۔ BLEU اور COMET جیسی میٹرکس جو WMT مشترکہ کاموں میں ماپی جاتی ہیں مفید مجموعی اشارہ دیتی ہیں، لیکن یہ رجسٹر کی غلطیوں، محاورے کی ناکامیوں، اور اصطلاحی درستگی کا پتہ لگانے میں کمزور ہیں، بالکل وہی زمرے جو یہاں سب سے زیادہ اہم ہیں۔ جو کچھ آپ پڑھنے والے ہیں وہ نتیجہ کا تجزیہ ہے، نہ کہ BLEU کی دوڑ۔

ہر جملہ معنی خیز اختلاف کو ظاہر نہیں کرتا۔ آٹھ میں سے دو ٹیسٹ، "آئیے اس ڈیل پر دھول بیٹھنے کے بعد ایک بار رابطہ قائم کریں" (→ جاپانی) اور "ہم اس لانچ کی تاریخ کو پورا کرنے کے لیے آدھی رات کا تیل جلا رہے ہیں" (→ ویتنامی)، دونوں راؤنڈ میں زیادہ معاہدہ پیدا کیا۔ اِن محاورے صحیح طریقے سے محاورے کے طور پر سمجھے گئے۔ کسی نے بھی "touch base" کو کسی جسمانی بیس کو چھونے کے طور پر ترجمہ نہیں کیا۔ کسی نے "the dust settles" کو تلچھٹ گرنے کے طور پر ترجمہ نہیں کیا۔
یہ رکنے کے قابل ہے: بول چال انگریزی کاروباری زبان موجودہ سرحد کے ماڈلز کے ذریعے معقول طریقے سے سنبھالی جاتی ہے جب محاورہ کافی عام ہو۔ "ٹچ بیس" کے لیے اتفاق رائے دونوں راؤنڈز میں مستحکم رہا؛ تبدیلی خالصتاً طرز کی تھی، اس بات کے ارد گرد کہ ماخذ فقرے کے لیے この件 (یہ معاملہ)، この取引 (یہ ڈیل)، یا この案件 (یہ کیس) استعمال کریں یا نہیں۔

"آدھی رات کا تیل جلانا" ٹیسٹ وہ جگہ ہے جہاں چیزیں زیادہ دلچسپ ہو گئیں۔ ایک کے علاوہ ہر ماڈل نے اس محاورے کو صحیح طریقے سے سمجھا۔ MiniMax M2.7، جو دوسرے راؤنڈ میں متعارف کرایا گیا، نے "burning" کو لفظی طور پر ترجمہ کیا، جس سے đốt đuốc پیدا ہوا، جس کا مطلب "جلتی ہوئی مشاعلیں" ہے۔ اس بات پر صحیح طریقے سے اس کو خارج کر دیا گیا۔

جاپانی ایک رسمیت کی تہوں والی زبان ہے۔ فعل کے اختتام، ضمیر، اور حوالہ جاتی اسم کی شکل کا انتخاب طرزِ تحریر پر منحصر نہیں ہے۔ یہ بولنے والے اور سننے والے کے درمیان تعلق کو ظاہر کرتا ہے۔ اپنے CEO کو غیر رسمی فعل کی شکلوں استعمال کرتے ہوئے پیغام بھیجنا گرامر کے لحاظ سے ترجمہ کی غلطی نہیں ہے۔ یہ ایک سماجی غلطی ہے، اور ایک اہم غلطی ہے۔
کیا آپ یہ بھیج سکتے ہیں؟ شکریہ، اس کی تعریف کرتا ہوں۔" Context: ایک CEO کو پیغام بھیجنا۔

جب ماڈل پول میں توسیع ہوئی تو اتفاق رائے میں تبدیلی آئی۔ یہ طریقہ کار سادہ ہے: ایسے ماڈلز شامل کرنے سے جو رسمیت کے تناظر کو صحیح طریقے سے پڑھتے ہیں، اکثریت میں تبدیلی آئی، اور اتفاق رائے اس کے ساتھ ہو گیا۔ یہاں وہ مکمل سپیکٹرم ہے جو ماڈلز نے Round 2 میں تیار کیا:

ویتنامی رجسٹر ٹیسٹ نے رسمیت کی ایک مختلف قسم کی خرابی کو سامنے لایا، جو کہ زیادہ لطیف ہے۔ ماخذ جملہ: ارے، ایک جلدی سوال — کیا تم کال پر آنے کے لیے آزاد ہو؟ سیاق و سباق: کلائنٹ کو پیغام بھیجنا۔ پہلے دور میں Qwen نے "mình" شامل کیا، جو ایک اول شخص ضمیر ہے جو غیر رسمی ہم مرتبہ دوستی کا مطلب رکھتا ہے۔ ہر دوسرا ماڈل پہلے شخص میں خود حوالہ دینے سے مکمل طور پر بچتا ہے، جو زیادہ محفوظ پیشہ ورانہ انتخاب ہے۔ اہم بات یہ ہے کہ Qwen نے اس کو دوسری بار درست کیا اور "mình" کو ہٹا دیا۔ اس بات پر دونوں دوروں میں اتفاق رائے نے اسے مستثنیٰ کر دیا۔

فروخت کنندہ/کلائنٹ معاوضہ کی سزا ایک تجارتی معاہدوں میں معیاری شق ہے: "فروخت کنندہ کلائنٹ کو اس معاہدے کی خلاف ورزی سے پیدا ہونے والے کسی بھی تیسری طرف کے دعویٰ سے محفوظ رکھے گا۔"
راؤنڈ 1 میں، تمام پانچ ماڈلز نے قانونی رجسٹر کی درست شناخت کی اور مستعار الفاظ ベンダー (فراہم کنندہ) اور クライアント (کلائنٹ) استعمال کیے، جو انگریزی نژاد جاپانی تجارتی معاہدوں میں معیاری ہیں۔ ایک استثنیٰ: GPT-4.1-NANO نے 販売者 (فروخت کنندہ) اور 顧客 (گاہک) استعمال کیے، جو قانونی لحاظ سے درست جاپانی الفاظ ہیں لیکن قرض لیے گئے الفاظ کی رسمی قانونی تخصیص سے محروم ہیں۔
زیادہ اہم دریافت دوسری کے دور میں سامنے آئی۔ اہم فرق دو الفاظ کے درمیان ہے:
یہ قانونی طور پر مختلف تصورات ہیں۔ "Indemnify" خاص طور پر کسی فریق کو تیسری فریق کی ذمہ داری سے محفوظ رکھنے کا مطلب ہے۔ معافی یا تاوان دینا درست قانونی اصطلاح ہے۔ تمام Round 1 ماڈلز نے 補償 استعمال کیا۔ راؤنڈ 2 میں، DeepSeek V4-Pro واحد ماڈل تھا جس نے 免責 پیدا کیا، اور اس نے یہ صرف راؤنڈ 2 میں کیا، راؤنڈ 1 میں نہیں۔

ایک معاہدے میں، 補償 اور 免責 مترادفات نہیں ہیں۔ ایک کا مطلب ہے "ہم آپ کو واپس کی رقم دیں گے۔" دوسرا مطلب یہ ہے کہ "آپ شروع میں ہی اس دعویٰ سے محفوظ ہیں۔" اگر کوئی ترجمہ پلیٹ فارم 補償 استعمال کرتا ہے جہاں 免責 درست ہے، تو جاپانی ورژن پڑھنے والا وکیل وہی معاہدہ نہیں دیکھے گا جو انگریزی ورژن بیان کرتا ہے۔
یہ ڈیٹاسیٹ میں سب سے اہم دریافت ہے۔ ٹیسٹ جملہ: یہ دوا ان مریضوں میں منع ہے جن کو جگر کی خرابی کی تاریخ ہے۔ ذریعہ: کلینیکل پروڈکٹ دستاویزات۔ ہدف: Vietnamese.
کبدی خرابی اہم اصطلاح ہے۔ دو ویتنامی امیدوار ہیں:
یہ طبی لحاظ سے الگ الگ ہیں۔ "ہیپاٹک امپیئرمنٹ" کی بنیاد پر موانع انتباہ کا اطلاق ان تمام افراد پر ہوتا ہے جن کا جگر کی کارکردگی میں کمی ہے، نہ کہ صرف ان لوگوں پر جنہوں نے مکمل اعضاء کی ناکامی کا سامنا کیا ہے۔ سوے گن کا استعمال اشارہ شدہ آبادی کو غلط طریقے سے محدود کرتا ہے۔ اعتدال پوائنٹ پر جگر کی خرابی والا مریض جو "suy gan" پڑھتا ہے وہ اپنے آپ کو منع شدہ آبادی کے طور پر شناخت نہیں کر سکتا۔

کچھ ذریعہ جملے ڈیزائن کے لحاظ سے ابہام خیز ہوتے ہیں۔ معاصر انگریزی بول چال میں "That's sick" کا مطلب کچھ بہترین ہے، لیکن یہ اپنا لفظی معنیٰ بھی رکھتا ہے (یعنی متلی آور/ناپسندیدہ)، اور ان دونوں معنوں کے درمیان تناؤ اس بات کا حصہ ہے کہ یہ جملہ کیسے بات کرتا ہے۔ ترجمہ ماڈل کے لیے چیلنج یہ ہے: کیا آپ ابہام کو برقرار رکھتے ہیں، اسے سب سے زیادہ ممکنہ معنی تک محدود کرتے ہیں، یا ایک کو منتخب کرتے ہیں اور اس پر عمل کرتے ہیں؟


اس ٹیسٹ میں ماڈل سب برابر نہیں ہیں۔ وہ مختلف آرکیٹیکچرز، تربیتی نظاموں، اور تعیناتی سیاق و سباق میں پھیلے ہوئے ہیں۔ راؤنڈ 1 کی بنیادی لائن میں وہ ماڈلز شامل ہیں جو بڑے پیمانے پر قابل رسائی ہیں۔ وسیع شدہ Round 2 پول میں MachineTranslation.com پر ادا کرنے والے صارفین کے لیے دستیاب نئے ترین پریمیم ٹیئر ماڈل کی متعدد شکلیں شامل ہیں، ماڈل کی وہی ٹیئر جس کا مطلب ورنہ ہر انفرادی فراہم کنندہ کے ساتھ الگ الگ ادا شدہ اکاؤنٹ ہوگا۔

Round 2 میں وسیع شدہ پول میں ایسے ماڈلز شامل ہیں جو زیادہ جدید ہیں اور MachineTranslation.com پر ادا کرنے والے صارفین کے لیے دستیاب ہیں۔ پول کو بڑھانے کے اثرات یکساں نہیں ہیں۔ کچھ ٹیسٹوں میں (رسمیت/جاپانی)، اس نے اتفاق رائے کو بامعنیٰ طریقے سے تبدیل کر دیا۔ دوسروں میں (طبی اصطلاحات/ویتنامی)، تقسیم گہری ہو گئی۔

ٹیسٹ ڈیٹا دو الگ الگ ناکامی کے زمرے کی طرف اشارہ کرتا ہے، اور ان کے لیے مختلف جوابات کی ضرورت ہے۔
زمرہ A: خاموش ناکامیاں۔ رسمی غلطیاں، رجسٹر کی غلطیاں، طبی اصطلاحات کی درستگی: یہ ایسے نتائج پیدا کرتے ہیں جو صحیح نظر آتے ہیں۔ جاپانی قواعد اللغة کے لحاظ سے صحیح ہے۔ ویتنامی روانی ہے۔ کوئی ظاہری نشانی نہیں ہے کہ کچھ غلط ہوا۔ ایک لسانی صارف جو صرف ایک ماڈل کی پیداوار پڑھ رہا ہے اس کے پاس یہ جاننے کا کوئی طریقہ نہیں ہے کہ ماڈل نے ایسا رجسٹر انتخاب کیا ہے جو ایک سینئر جاپانی ایگزیکٹو کو نوٹس کریں گے، یا یہ کہ ایک طبی اصطلاح اس طریقے سے تنگ کی گئی تھی جو آبادی کو تبدیل کرتی ہے جس پر یہ لاگو ہوتی ہے۔
Category B: نمایاں ناکامیاں۔ MiniMax نے "burning the midnight oil" کو "مشاعل جلانا" کے طور پر ترجمہ کیا۔ جی پی ٹی-4.1-نینو "That's sick" کو غیر مبہم "すごい" میں حل کر رہا ہے۔ یہ قابلِ شناخت ہیں، یا تو ہدف کی زبان کے بولنے والے کے ذریعے یا دوسری ماڈل کی پیداواروں کے ساتھ موازنے کے ذریعے۔
جو کثیر ماڈل کا موازنہ SMART فراہم کرتا ہے وہ زمرہ A میں سب سے زیادہ قیمتی ہے۔ جب پانچ یا دس ماڈلز پیداوار دیتے ہیں اور زیادہ تر رسمی رجسٹر پر متفق ہوں جبکہ ایک غیر رسمی سادہ شکل میں جاپانی پیدا کرتا ہے، تو یہ اختلاف موازنے کے نقطہ نظر میں نمایاں ہے۔ ایک صارف جو ہدف کی زبان بولتا ہے اختیارات کا جائزہ لے سکتا ہے۔ ایک صارف جو نہیں دیکھ سکتا کہ ایک متنازعہ فیصلہ کیا گیا تھا، اور یہ فیصلہ کر سکتا ہے کہ آیا یہ سزا انسانی جائزے کی ضرورت ہے۔
دستاویز کی سطح کے کام کے لیے، بڑی فائلیں، PDFs کی ترتیب کو محفوظ رکھنے والی ترجمہ، معاہدے، یا کلینیکی مواد کے لیے، پلیٹ فارم کی دستاویز پروسیسنگ صلاحیت فائل کی ساخت کو فارمیٹنگ کو توڑے بغیر سنبھالتی ہے۔ لیکن اوپر اٹھائے گئے معیار کے سوالات فائل کی سائز سے قطع نظر لاگو ہوتے ہیں۔ ایک 100 صفحات کی کلینیکل تحقیق جہاں "ہیپاٹک خرابی" کی ہر مثال کو "جگر کی ناکامی" کے طور پر ترجمہ کیا گیا ہے، یہ ٹیسٹ 2 میں شناخت کی گئی اسی مسئلے کا ایک بڑا ورژن ہے۔
خاص طور پر طبی اور قانونی زمرہ جات کے لیے، انسانی تصدیق صحیح حفاظتی تدبیر ہے۔ ٹومیڈز کی AI پوسٹ ایڈٹنگ سروس، جو AI کے نتائج کو اعلیٰ تربیت یافتہ انسانی جائزے کے ساتھ جوڑتی ہے، بالکل اسی قسم کے اہم مواد کے لیے بنائی گئی ہے۔ suy gan / suy giảm chức năng gan کی تقسیم بالکل اسی قسم کی تلاش ہے جو اس جائزے کو متحرک کرنی چاہیے، نہ کہ اس لیے کہ تمام ماڈل غلط ہیں، بلکہ اس لیے کہ جو ماڈل سب سے زیادہ اعتماد رکھتے ہیں وہ سب سے زیادہ درست نہیں ہیں۔
متعدد آؤٹ پٹ دیکھنے کی قیمت یہ نہیں ہے کہ آپ ہمیشہ اکثریت کو منتخب کریں گے۔ یہ ہے کہ آپ کو معلوم ہوگا کہ ایک انتخاب کیا گیا تھا، جو اس بات سے مختلف ہے کہ آپ کے سامنے موجود نتیجہ کو درست سمجھ لیا جائے۔

آٹھ ٹیسٹوں کو ایک ساتھ رکھیں اور ایک نمونہ برقرار رہتا ہے: اتفاق اور اختلاف بے ترتیب طریقے سے تقسیم نہیں ہیں۔ روزمرہ کے کاروباری محاورے ("رابطہ قائم کرنا،" "رات بھر کام کرنا") تقریباً ہر ماڈل میں دونوں دورں میں متحد ہوئے۔ رسمیت، قانونی درستگی، اور طبی اصطلاحات نہیں تھے۔ سی ای او کی رسمیت کا ٹیسٹ صرف اس وقت غیر رسمی سے رسمی میں تبدیل ہوا جب توسیع شدہ پول شامل کیا گیا۔ شناخت کی شق نے ایک حقیقی قانونی امتیاز کو سامنے لایا (معافی بخشی بمقابلہ معاوضہ) جو صرف ایک ماڈل نے، ایک دور میں، صحیح طریقے سے حاصل کیا۔ طبی اصطلاحات میں تقسیم کبھی بھی مکمل طور پر حل نہیں ہوئی، دونوں راؤنڈز میں تقریباً 6 سے 4 کے تناسب پر برقرار رہی چاہے ماڈلز کا کوئی بھی مجموعہ استعمال ہو۔
یہ حقیقی نتیجہ ہے، نہ کہ کوئی مارکیٹنگ دعویٰ: اتفاق رائے ہر جملے کو بہتر نہیں بناتا، اور اس کی ضرورت نہیں ہے۔ یہ بالکل وہاں سب سے زیادہ قیمتی ہے جہاں ایک واحد ماڈل کی روانی آپ کو اس پر شک کرنے کی کوئی وجہ نہیں دیتی، اور جہاں غلط ہونا دراصل کچھ خرچ کرتا ہے۔
اس ٹیسٹ کی ایک دوسری، زیادہ عملی تہہ ہے جو صاف طور سے بیان کے قابل ہے۔ اس موازنے کو خود چلانے کا مطلب یہ تھا کہ GPT-5.5، Claude Opus 4-7، Gemini 3.5-Flash، GLM-5-Turbo، اور MiniMax M2.7 سے نتائج کو موجودہ بیس لائن ماڈلز کے ساتھ ایک جگہ، ایک پلیٹ فارم پر، شانہ بشانہ چیک کیا جائے۔ MachineTranslation.com کے باہر، یہ ایک رکنیت نہیں ہے۔ یہ کئی ہیں، ہر ایک فراہم کنندہ کے لیے جس کی پریمیم ٹیئر آپ ٹیسٹ کرنا چاہتے ہیں، جو کچھ بھی ہر فراہم کنندہ انفرادی طور پر چارج کرتا ہے۔ یہاں ادا کرنے والے صارفین کو یہی موازنہ ایک کلک میں ملتا ہے، پانچ الگ الگ پریمیم سبسکرپشنز برقرار رکھنے کی لاگت کے ایک حصے میں، بغیر اس چیز کو ترک کیے جو واقعی اہم ہے: یہ دیکھنا کہ ماڈلز کہاں متفق ہیں، اور بالکل جاننا کہ وہ کب متفق نہیں ہیں۔
کوئی بھی واضح طور پر بہتر نہیں ہے؛ یہ ٹیسٹ کے زمرے پر منحصر ہے۔ کلاڈ سونیٹ اور کلاڈ اوپس نے مسلسل زیادہ درست ویتنامی طبی اصطلاح کا انتخاب کیا، اور کلاڈ اوپس نے "That's sick" کے لیے سب سے موزوں سلینگ تیار کیا۔ لیکن Claude Sonnet نے ایک رسمی CEO-سیاق میں غیر رسمی جاپانی بھی تیار کیا، جہاں GPT-5.5 نے اسے صحیح طریقے سے سمجھا۔ براہ راست آؤٹ پٹ کا موازنہ کرنا ایک ماڈل کو منتخب کرنے اور اس پر اعتماد کرنے سے زیادہ قابل دفاع ہے۔
کوئی نہیں ہے؛ درستگی ڈومین پر منحصر ہے۔ Gemini 3.5-Flash اور GLM-5-Turbo نے اس ٹیسٹ میں سب سے زیادہ موزوں رسمی جاپانی پیدا کیے۔ دونوں Claude ماڈلز ویتنامی طبی اصطلاحات میں سب سے زیادہ درست تھے۔ DeepSeek V4-Pro واحد ماڈل تھا جو صحیح جاپانی قانونی اصطلاح استعمال کرنے والا تھا، لیکن صرف Round 2 میں، اور یہ دوسری جگہوں پر غیر رسمی جاپانی پیدا کرتا تھا۔ کوئی بھی ایک ماڈل تمام آٹھ ٹیسٹوں میں غالب نہیں رہا۔
نہیں، خودکار طور پر نہیں۔ نئے پریمیم ٹیئر ماڈل کی اقسام کے ساتھ پول کو بڑھانے سے جاپانی رسمی الفاظ کے ٹیسٹ میں اتفاق رائے غیر رسمی سے رسمی میں منتقل ہو گیا۔ لیکن ویتنامی طبی اصطلاحات کے ٹیسٹ میں، یہ تقسیم تقریباً 6 سے 4 کے تناسب میں برقرار رہی قطع نظر اس سے کہ کون سے ماڈلز شامل کیے گئے تھے۔ زیادہ ماڈلز زیادہ اختلاف کو سطح پر لاتے ہیں، جو ایک مفید اشارہ ہے، لیکن اتفاق رائے ابھی بھی اکثریت کی پیروی کرتا ہے، اور اکثریت ہمیشہ سب سے زیادہ درست جواب نہیں ہوتی۔
SMART MachineTranslation.com کا ایک کثیر ماڈل اتفاق رائے کا نظام ہے، جو OpenAI، Anthropic، Google، اور DeepSeek سمیت فراہم کنندگان کے ذریعے 22 تک AI ماڈلز پر پھیلا ہوا ہے۔ یہ ایک ترجمہ کو بیک وقت متعدد ماڈلز کے ذریعے چلاتا ہے اور اکثریت کی بنیاد پر اتفاق رائے کی پیداوار کو ہر انفرادی ماڈل کے جواب کے ساتھ ظاہر کرتا ہے، ڈیفالٹ کے لحاظ سے، کسی ترتیب کی ضرورت نہیں۔ اتفاق رائے میں تبدیلی آتی ہے جب ماڈل کا ذخیرہ بدل جاتا ہے، جیسا کہ اس ٹیسٹ کے جاپانی رسمیت کے نتیجے میں دکھایا گیا ہے: دور 1 میں غیر رسمی اتفاق رائے دور 2 میں رسمی بن گیا۔
کوئی ایک ماڈل نہیں؛ انسانی جائزہ بہتر جواب ہے۔ کلاڈ ماڈلز نے مسلسل زیادہ درست ویتنامی طبی اصطلاح کا انتخاب کیا، اور صرف ڈیپ سیک V4-Pro نے صحیح جاپانی قانونی اصطلاح استعمال کی، لیکن صرف دوسری دور میں۔ طبی اصطلاحات کی تقسیم 10 ماڈلز میں کبھی حل نہیں ہوئی، جو یہ ظاہر کرتا ہے کہ ڈومین کی مہارت درکار ہے، نہ کہ ایک مختلف ماڈل منتخب کیا جائے۔ Tomedes کی پیشکش کی طرح ایک تصدیق شدہ انسانی پوسٹ ایڈیٹنگ جائزہ، وہ ماہرانہ جانچ فراہم کرتا ہے۔