July 10, 2026

2026 میں کون سا AI ترجمہ کار سب سے زیادہ درست ہے؟ میں نے حالیہ 10 AI ماڈلز کو آزمایا

دو‎ ‎الفاظ۔ چھ‎ ‎ماڈل۔ تین‎ ‎مختلف‎ ‎ترجمے‎ ‎کے‎ ‎فیصلے۔ یہاں‎ ‎دیکھیں‎ ‎کہ‎ ‎جب‎ ‎میں‎ ‎نے‎ MachineTranslation.com ‎پر‎ ‎دستیاب‎ ‎تازہ‎ ‎ترین‎ AI ‎ماڈلز‎ ‎کے‎ ‎ذریعے‎ 8 ‎ٹیسٹ‎ ‎جملے‎ ‎چلائے‎ ‎تو‎ ‎کیا‎ ‎ہوا،‎ ‎اور‎ ‎ان‎ ‎آؤٹ‎ ‎پٹ‎ ‎سے‎ ‎اصل‎ ‎میں‎ ‎یہ‎ ‎ظاہر‎ ‎ہوتا‎ ‎ہے‎ ‎کہ‎ ‎ایک‎ ‎ماڈل‎ ‎خاموشی‎ ‎سے‎ ‎کب‎ ‎ناکام‎ ‎ہوتا‎ ‎ہے۔

آپ‎ ‎کو‎ ‎یہ‎ ‎کیسے‎ ‎معلوم‎ ‎ہوگا‎ ‎کہ‎ ‎آپ‎ ‎کے‎ ‎ماڈل‎ ‎نے‎ ‎غلط‎ ‎فیصلہ‎ ‎کیا‎ ‎ہے؟

دو‎ ‎الفاظ۔ یہ‎ ‎بیمار‎ ‎ہے۔ چھ‎ ‎ماڈل۔ تین‎ ‎الگ‎ ‎الگ‎ ‎ترجمہ‎ ‎کے‎ ‎فیصلے۔

جاپانی‎ ‎میں،‎ ‎ایک‎ ‎ماڈل‎ ‎نے‎ ‎اسے それはやばいکے‎ ‎طور‎ ‎پر‎ ‎پیش‎ ‎کیا،‎ ‎ابہام‎ ‎کو‎ ‎برقرار‎ ‎رکھتے‎ ‎ہوئے۔ ایک‎ ‎اور‎ ‎نے‎ ‎موضوع‎ ‎کی‎ ‎ضمیر‎ ‎کو‎ ‎مکمل‎ ‎طور‎ ‎پر‎ ‎چھوڑ‎ ‎دیا‎ ‎اور‎ bare form やばい‎ ‎لکھا،‎ ‎جو‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎بول‎ ‎چال‎ ‎والا‎ ‎ورژن‎ ‎ممکن‎ ‎ہے۔ ایک‎ ‎تیسرے‎ ‎نے‎ ‎لکھا یہ‎ ‎بہت‎ ‎شاندار‎ ‎ہے،‎ ‎جو‎ ‎ابہام‎ ‎کو‎ ‎مکمل‎ ‎طور‎ ‎پر‎ "‎حیرت‎ ‎انگیز‎" ‎کے‎ ‎حق‎ ‎میں‎ ‎حل‎ ‎کرتا‎ ‎ہے،‎ ‎اس‎ ‎دوہری‎ ‎معنی‎ ‎کو‎ ‎نکال‎ ‎دیتا‎ ‎ہے‎ ‎جو‎ ‎اس‎ ‎جملے‎ ‎کو‎ ‎دلچسپ‎ ‎بناتی‎ ‎تھی۔ ویتنامی‎ ‎میں،‎ ‎ایک‎ ‎ماڈل‎ ‎نے‎ ‎لکھا اس‎ ‎طرح ‎(‎سلنگ،‎ ‎نوجوانوں‎ ‎کے‎ ‎رجسٹر‎ ‎کے‎ ‎لیے‎ ‎درست‎)‎۔ ایک‎ ‎اور‎ ‎نے‎ ‎لکھا یہ‎ ‎واقعی‎ ‎شاندار‎ ‎ہے،‎ ‎گرامر‎ ‎کے‎ ‎لحاظ‎ ‎سے‎ ‎درست،‎ ‎لیکن‎ ‎جب‎ ‎کوئی‎ ‎آپ‎ ‎کو‎ ‎ایک‎ meme ‎بھیجے‎ ‎تو‎ "‎یہ‎ ‎واقعی‎ ‎حیرت‎ ‎انگیز‎ ‎ہے‎" ‎کہنے‎ ‎کے‎ ‎قریب‎ ‎تر‎ ‎ہے۔

یہ‎ ‎تمام‎ ‎قابل‎ ‎دفاع‎ ‎ہیں۔ ان‎ ‎میں‎ ‎سے‎ ‎کوئی‎ ‎بھی‎ ‎ایک‎ ‎جیسی‎ ‎چیز‎ ‎نہیں‎ ‎ہے۔ اور‎ ‎اگر‎ ‎آپ‎ ‎ترجمے‎ ‎کو‎ ‎ایک‎ ‎واحد‎ ‎ماڈل‎ ‎کے‎ ‎ذریعے‎ ‎چلا‎ ‎رہے‎ ‎ہیں،‎ ‎تو‎ ‎آپ‎ ‎کو‎ ‎کبھی‎ ‎بھی‎ ‎آپ‎ ‎کی‎ ‎طرف‎ ‎سے‎ ‎کیے‎ ‎گئے‎ ‎انتخاب‎ ‎کو‎ ‎نہیں‎ ‎دیکھیں‎ ‎گے۔

یہ‎ ‎مرکزی‎ ‎سوال‎ ‎ہے‎ ‎جس‎ ‎کا‎ ‎جواب‎ ‎یہ‎ ‎مضمون‎ ‎دینے‎ ‎کی‎ ‎کوشش‎ ‎کر‎ ‎رہا‎ ‎ہے۔ یہ‎ ‎سوال‎ ‎نہیں‎ ‎کہ‎ 2026 ‎میں‎ ‎ترجمے‎ ‎کے‎ ‎لیے‎ ‎کون‎ ‎سا‎ AI ‎ماڈل‎ ‎بہترین‎ ‎ہے‎ (‎جواب‎ ‎زبان‎ ‎کے‎ ‎جوڑے،‎ ‎رجسٹر،‎ ‎ڈومین،‎ ‎اور‎ ‎جملے‎ ‎کی‎ ‎ساخت‎ ‎پر‎ ‎منحصر‎ ‎ہے‎)‎،‎ ‎بلکہ‎ ‎یہ‎:‎ آپ‎ ‎کو‎ ‎کیسے‎ ‎معلوم‎ ‎ہوگا‎ ‎کہ‎ ‎آپ‎ ‎کے‎ ‎ماڈل‎ ‎نے‎ ‎غلط‎ ‎فیصلہ‎ ‎کیا؟ خاص‎ ‎طور‎ ‎پر‎ ‎طبی‎ ‎اصطلاحات،‎ ‎قانونی‎ ‎معاہدوں،‎ ‎یا‎ ‎پروفیشنل‎ ‎رسمیت‎ ‎جیسے‎ ‎ڈومینز‎ ‎میں،‎ ‎جہاں‎ ‎غلط‎ ‎فیصلہ‎ ‎بالکل‎ ‎صحیح‎ ‎ترجمے‎ ‎جیسا‎ ‎لگتا‎ ‎ہے‎ ‎جب‎ ‎تک‎ ‎کہ‎ ‎کوئی‎ ‎ماہر‎ ‎اسے‎ ‎نہ‎ ‎پڑھے۔

یہاں‎ ‎میں‎ ‎نے‎ ‎جو‎ ‎کیا۔ میں‎ ‎نے‎ 8 ‎ٹیسٹ‎ ‎جملوں‎ ‎کو‎ ‏ MachineTranslation.com ‎پر‎ ‎دو‎ ‎راؤنڈ‎ ‎ماڈلز‎ ‎کے‎ ‎ذریعے‎ ‎چلایا‎: ‎پہلے‎ 5 ‎وسیع‎ ‎پیمانے‎ ‎پر‎ ‎استعمال‎ ‎شدہ‎ ‎ماڈلز‎ ‎کی‎ ‎ایک‎ ‎بنیادی‎ ‎لائن،‎ ‎پھر‎ ‎ایک‎ ‎توسیع‎ ‎شدہ‎ ‎پول‎ ‎جو‎ ‎اب‎ ‎ادائیگی‎ ‎کرنے‎ ‎والے‎ ‎صارفین‎ ‎کے‎ ‎لیے‎ ‎دستیاب‎ ‎نئے‎ ‎پریمیم‎ ‎ٹیئر‎ ‎ماڈل‎ ‎کی‎ ‎متغیرات‎ ‎کو‎ ‎شامل‎ ‎کرتا‎ ‎ہے۔ عام‎ ‎طور‎ ‎پر،‎ ‎اس‎ ‎طرح‎ ‎کے‎ ‎ماڈلز‎ ‎سے‎ ‎نتائج‎ ‎کا‎ ‎موازنہ‎ ‎کرنے‎ ‎کا‎ ‎مطلب‎ ‎ہر‎ ‎فراہم‎ ‎کنندہ‎ ‎کے‎ ‎ساتھ‎ ‎الگ‎ ‎الگ‎ ‎معاوضہ‎ ‎شدہ‎ ‎رکنیت‎ ‎ہوگا۔ MachineTranslation.com ‎پر،‎ ‎وہ‎ ‎ایک‎ ‎جیسے‎ ‎موازنہ‎ ‎کے‎ ‎نقطہ‎ ‎نظر‎ ‎میں‎ ‎بیٹھے‎ ‎ہوئے‎ ‎ہیں۔ زبان‎ ‎کے‎ ‎جوڑے‎ ‎انگریزی‎→‎جاپانی‎ ‎اور‎ ‎انگریزی‎→‎ویتنامی‎ ‎تھے۔ جملہ‎ ‎کی‎ ‎زمرہ‎ ‎جات‎ ‎کو‎ ‎خاص‎ ‎طور‎ ‎پر‎ ‎ان‎ ‎علاقوں‎ ‎کو‎ ‎دباؤ‎ ‎ڈالنے‎ ‎کے‎ ‎لیے‎ ‎منتخب‎ ‎کیا‎ ‎گیا‎ ‎تھا‎ ‎جہاں‎ ‎ماڈل‎ ‎کے‎ ‎اختلاف‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎اہم‎ ‎ہیں‎: ‎محاورہ‎ ‎والی‎ ‎تشکیل،‎ ‎قانونی‎ ‎اصطلاحات،‎ ‎طبی‎ ‎اصطلاحات،‎ ‎رسمیت‎ ‎سے‎ ‎حساس‎ ‎سیاق‎ ‎و‎ ‎سباق،‎ ‎اور‎ ‎ارادی‎ ‎معنی‎ ‎کی‎ ‎ابہام۔

طریقہ‎ ‎کار

  • زبان‎ ‎کے‎ ‎جوڑے‎:‎ انگریزی‎ → ‎جاپانی،‎ ‎انگریزی‎ → ‎ویتنامی
  • دور‎ 1 (‎بنیادی‎):‏ Claude Sonnet 4-6‏،‎ DeepSeek V4-Pro‏،‎ Qwen 3.7-Max‏،‎ GPT-4.1-NANO‏،‎ Gemini 3.1-Pro-Preview
  • دور‎ 2 (‎توسیع‎ ‎شدہ‎):‎ مذکورہ‎ ‎بالا‎ ‎تمام‎ + ‏ Claude Opus 4-7, GPT-5.5, Gemini 3.5-Flash, GLM-5-Turbo, MiniMax M2.7
  • ٹیسٹ‎ ‎کے‎ ‎زمرہ‎ ‎جات‎:‎ محاورہ‎ ‎والی‎ ‎تشکیل‎ (2)‎،‎ ‎قانونی‎/‎پیشہ‎ ‎ورانہ‎ ‎اصطلاحات‎ (2)‎،‎ ‎طبی‎ ‎اصطلاحات‎ (1)‎،‎ ‎رسمیت‎ ‎پر‎ ‎منحصر‎ ‎سیاق‎ ‎و‎ ‎سباق‎ (2)‎،‎ ‎ارادی‎ ‎ابہام‎ (1)‎
  • جو‎ ‎ماپا‎ ‎گیا‎:‎ براہ‎ ‎راست‎ ‎ترجمہ‎ ‎کی‎ ‎پیداوار،‎ ‎نہ‎ ‎کہ‎ ‎ترمیم‎ ‎کا‎ ‎وقت،‎ TER،‎ ‎یا‎ ‎عددی‎ ‎غلطی‎ ‎کی‎ ‎شرح۔ جہاں‎ ‎متعلقہ‎ ‎ہو،‎ ‎فرق‎ ‎کو‎ ‎لسانی‎ ‎طور‎ ‎پر‎ ‎سمجھایا‎ ‎جاتا‎ ‎ہے۔
  • SMART ‎اتفاق‎ ‎رائے‎:‎ ہر‎ ‎دور‎ ‎میں‎ ‎پلیٹ‎ ‎فارم‎ ‎کی‎ ‎ملٹی‎ ‎ماڈل‎ ‎اتفاق‎ ‎رائے‎ ‎کی‎ ‎پیداوار‎ ‎شامل‎ ‎ہے۔ SMART 22 AI ‎ماڈلز‎ ‎تک‎ ‎پھیلا‎ ‎ہوا‎ ‎ہے‎ ‎جو‎ ‎مختلف‎ ‎فراہم‎ ‎کنندگین‎ ‎میں‎ ‎موجود‎ ‎ہیں‎ ‎اور‎ ‎تمام‎ ‎دستیاب‎ ‎ماڈلز‎ ‎کو‎ ‎بیک‎ ‎وقت‎ ‎چلاتا‎ ‎ہے‎ ‎تاکہ‎ ‎اتفاق‎ ‎رائے‎ ‎ترجمہ‎ ‎حاصل‎ ‎کیا‎ ‎جا‎ ‎سکے۔ اتفاق‎ ‎رائے‎ ‎بدل‎ ‎جاتی‎ ‎ہے‎ ‎جب‎ ‎ماڈل‎ ‎کا‎ ‎مجموعہ‎ ‎بدل‎ ‎جاتا‎ ‎ہے۔

تشخیص‎ ‎کے‎ ‎طریقہ‎ ‎کار‎ ‎پر‎ ‎ایک‎ ‎نوٹ‎: ‎مشین‎ ‎ترجمہ‎ ‎کی‎ ‎تحقیق‎ ‎نے‎ ‎طویل‎ ‎عرصے‎ ‎سے‎ ‎اس‎ ‎سے‎ ‎جوجھا‎ ‎ہے‎ ‎کہ‎ ‎آؤٹ‎ ‎پٹ‎ ‎کو‎ ‎خودکار‎ ‎طور‎ ‎پر‎ ‎کیسے‎ ‎اسکور‎ ‎کیا‎ ‎جائے۔ BLEU ‎اور‎ COMET ‎ ‎جیسی‎ ‎میٹرکس‎ ‎جو‎ WMT ‎مشترکہ‎ ‎کاموں‎ ‎میں ماپی‎ ‎جاتی‎ ‎ہیں‎ ‎مفید‎ ‎مجموعی‎ ‎اشارہ‎ ‎دیتی‎ ‎ہیں،‎ ‎لیکن‎ ‎یہ‎ ‎رجسٹر‎ ‎کی‎ ‎غلطیوں،‎ ‎محاورے‎ ‎کی‎ ‎ناکامیوں،‎ ‎اور‎ ‎اصطلاحی‎ ‎درستگی‎ ‎کا‎ ‎پتہ‎ ‎لگانے‎ ‎میں‎ ‎کمزور‎ ‎ہیں،‎ ‎بالکل‎ ‎وہی‎ ‎زمرے‎ ‎جو‎ ‎یہاں‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎اہم‎ ‎ہیں۔ جو‎ ‎کچھ‎ ‎آپ‎ ‎پڑھنے‎ ‎والے‎ ‎ہیں‎ ‎وہ‎ ‎نتیجہ‎ ‎کا‎ ‎تجزیہ‎ ‎ہے،‎ ‎نہ‎ ‎کہ‎ BLEU ‎کی‎ ‎دوڑ۔

ایک‎ ‎نظر‎ ‎میں‎ ‎نتائج

حصہ‎ 1: جہاں‎ ‎تمام‎ ‎ماڈل‎ ‎متفق‎ ‎ہوں،‎ ‎اور‎ ‎یہ‎ ‎بھی‎ ‎اہم‎ ‎کیوں‎ ‎ہے

ہر‎ ‎جملہ‎ ‎معنی‎ ‎خیز‎ ‎اختلاف‎ ‎کو‎ ‎ظاہر‎ ‎نہیں‎ ‎کرتا۔ آٹھ‎ ‎میں‎ ‎سے‎ ‎دو‎ ‎ٹیسٹ،‎ "‎آئیے‎ ‎اس‎ ‎ڈیل‎ ‎پر‎ ‎دھول‎ ‎بیٹھنے‎ ‎کے‎ ‎بعد‎ ‎ایک‎ ‎بار‎ ‎رابطہ‎ ‎قائم‎ ‎کریں‎" (→ ‎جاپانی‎) ‎اور‎ "‎ہم‎ ‎اس‎ ‎لانچ‎ ‎کی‎ ‎تاریخ‎ ‎کو‎ ‎پورا‎ ‎کرنے‎ ‎کے‎ ‎لیے‎ ‎آدھی‎ ‎رات‎ ‎کا‎ ‎تیل‎ ‎جلا‎ ‎رہے‎ ‎ہیں‎" (→ ‎ویتنامی‎)‎،‎ ‎دونوں‎ ‎راؤنڈ‎ ‎میں‎ ‎زیادہ‎ ‎معاہدہ‎ ‎پیدا‎ ‎کیا۔ اِن‎ ‎محاورے‎ ‎صحیح‎ ‎طریقے‎ ‎سے‎ ‎محاورے‎ ‎کے‎ ‎طور‎ ‎پر‎ ‎سمجھے‎ ‎گئے۔ کسی‎ ‎نے‎ ‎بھی‎ "touch base" ‎کو‎ ‎کسی‎ ‎جسمانی‎ ‎بیس‎ ‎کو‎ ‎چھونے‎ ‎کے‎ ‎طور‎ ‎پر‎ ‎ترجمہ‎ ‎نہیں‎ ‎کیا۔ کسی‎ ‎نے‎ "the dust settles" ‎کو‎ ‎تلچھٹ‎ ‎گرنے‎ ‎کے‎ ‎طور‎ ‎پر‎ ‎ترجمہ‎ ‎نہیں‎ ‎کیا۔

یہ‎ ‎رکنے‎ ‎کے‎ ‎قابل‎ ‎ہے‎: ‎بول‎ ‎چال‎ ‎انگریزی‎ ‎کاروباری‎ ‎زبان‎ ‎موجودہ‎ ‎سرحد‎ ‎کے‎ ‎ماڈلز‎ ‎کے‎ ‎ذریعے‎ ‎معقول‎ ‎طریقے‎ ‎سے‎ ‎سنبھالی‎ ‎جاتی‎ ‎ہے‎ ‎جب‎ ‎محاورہ‎ ‎کافی‎ ‎عام‎ ‎ہو۔ ‎"‎ٹچ‎ ‎بیس‎" ‎کے‎ ‎لیے‎ ‎اتفاق‎ ‎رائے‎ ‎دونوں‎ ‎راؤنڈز‎ ‎میں‎ ‎مستحکم‎ ‎رہا؛‎ ‎تبدیلی‎ ‎خالصتاً‎ ‎طرز‎ ‎کی‎ ‎تھی،‎ ‎اس‎ ‎بات‎ ‎کے‎ ‎ارد‎ ‎گرد‎ ‎کہ‎ ‎ماخذ‎ ‎فقرے‎ ‎کے‎ ‎لیے‎ この件 (‎یہ‎ ‎معاملہ‎)‏،‎ この取引 (‎یہ‎ ‎ڈیل‎)‎،‎ ‎یا‎ この案件 (‎یہ‎ ‎کیس‎) ‎استعمال‎ ‎کریں‎ ‎یا‎ ‎نہیں۔

ٹیسٹ‎ 8: ‎"‎آئیں‎ ‎اس‎ ‎معاہدے‎ ‎پر‎ ‎گرد‎ ‎بیٹھنے‎ ‎کے‎ ‎بعد‎ ‎دوبارہ‎ ‎رابطہ‎ ‎کریں۔‎" → ‎جاپانی

‎"‎آدھی‎ ‎رات‎ ‎کا‎ ‎تیل‎ ‎جلانا‎" ‎ٹیسٹ‎ ‎وہ‎ ‎جگہ‎ ‎ہے‎ ‎جہاں‎ ‎چیزیں‎ ‎زیادہ‎ ‎دلچسپ‎ ‎ہو‎ ‎گئیں۔ ایک‎ ‎کے‎ ‎علاوہ‎ ‎ہر‎ ‎ماڈل‎ ‎نے‎ ‎اس‎ ‎محاورے‎ ‎کو‎ ‎صحیح‎ ‎طریقے‎ ‎سے‎ ‎سمجھا۔ MiniMax M2.7،‎ ‎جو‎ ‎دوسرے‎ ‎راؤنڈ‎ ‎میں‎ ‎متعارف‎ ‎کرایا‎ ‎گیا،‎ ‎نے‎ "burning" ‎کو‎ ‎لفظی‎ ‎طور‎ ‎پر‎ ‎ترجمہ‎ ‎کیا،‎ ‎جس‎ ‎سے đốt đuốc‎ ‎پیدا‎ ‎ہوا،‎ ‎جس‎ ‎کا‎ ‎مطلب‎ "‎جلتی‎ ‎ہوئی‎ ‎مشاعلیں‎" ‎ہے۔ اس‎ ‎بات‎ ‎پر‎ ‎صحیح‎ ‎طریقے‎ ‎سے‎ ‎اس‎ ‎کو‎ ‎خارج‎ ‎کر‎ ‎دیا‎ ‎گیا۔

ٹیسٹ‎ 5: ‎"‎ہم‎ ‎اس‎ ‎لانچ‎ ‎کی‎ ‎تاریخ‎ ‎کو‎ ‎پورا‎ ‎کرنے‎ ‎کے‎ ‎لیے‎ ‎رات‎ ‎بھر‎ ‎محنت‎ ‎کر‎ ‎رہے‎ ‎ہیں۔‎" → ‎ویتنامی

نتیجہ‎ — ‎محاورے

معیاری‎ ‎ماڈلز‎ ‎عام‎ ‎طور‎ ‎پر‎ ‎جاپانی‎ ‎اور‎ ‎ویتنامی‎ ‎دونوں‎ ‎زبانوں‎ ‎میں‎ ‎عام‎ ‎انگریزی‎ ‎کاروباری‎ ‎محاورات‎ ‎کو‎ ‎درست‎ ‎طریقے‎ ‎سے‎ ‎سنبھالتے‎ ‎ہیں۔ اتفاق‎ ‎رائے‎ ‎کی‎ ‎قدر متنازعہ جملوں‎ ‎میں‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎ہے‎: ‎رسمیت،‎ ‎رجسٹر،‎ ‎اور‎ ‎اصطلاحات۔ ‎**‎محاورہ‎ ‎ٹیسٹ‎ ‎پر،‎ ‎اتفاق‎ ‎رائے‎ ‎اب‎ ‎بھی‎ ‎حقیقی‎ ‎باہر‎ ‎والوں‎ ‎کو‎ ‎نشان‎ ‎زد‎ ‎کرنے‎ ‎میں‎ ‎اپنی‎ ‎قیمت‎ ‎برقرار‎ ‎رکھتا‎ ‎ہے‎ (MiniMax ‎کی‎ ‎لفظی‎ "‎جلتی‎ ‎ہوئی‎ ‎مشعلیں‎" ‎ناکام‎ ‎ہو‎ ‎جاتی‎ ‎ہیں‎)‎،‎ ‎لیکن‎ ‎مجموعی‎ ‎طور‎ ‎پر‎ ‎پول‎ ‎پہلے‎ ‎سے‎ ‎ہی‎ ‎متفق‎ ‎ہے۔

حصہ‎ 2:** رسمیت‎ ‎کا‎ ‎فاصلہ

جاپانی‎ ‎ایک‎ ‎رسمیت‎ ‎کی‎ ‎تہوں‎ ‎والی‎ ‎زبان‎ ‎ہے۔ فعل‎ ‎کے‎ ‎اختتام،‎ ‎ضمیر،‎ ‎اور‎ ‎حوالہ‎ ‎جاتی‎ ‎اسم‎ ‎کی‎ ‎شکل‎ ‎کا‎ ‎انتخاب‎ ‎طرزِ‎ ‎تحریر‎ ‎پر‎ ‎منحصر‎ ‎نہیں‎ ‎ہے۔ یہ‎ ‎بولنے‎ ‎والے‎ ‎اور‎ ‎سننے‎ ‎والے‎ ‎کے‎ ‎درمیان‎ ‎تعلق‎ ‎کو‎ ‎ظاہر‎ ‎کرتا‎ ‎ہے۔ اپنے‎ CEO ‎کو‎ ‎غیر‎ ‎رسمی‎ ‎فعل‎ ‎کی‎ ‎شکلوں‎ ‎استعمال‎ ‎کرتے‎ ‎ہوئے‎ ‎پیغام‎ ‎بھیجنا‎ ‎گرامر‎ ‎کے‎ ‎لحاظ‎ ‎سے‎ ‎ترجمہ‎ ‎کی‎ ‎غلطی‎ ‎نہیں‎ ‎ہے۔ یہ‎ ‎ایک‎ ‎سماجی‎ ‎غلطی‎ ‎ہے،‎ ‎اور‎ ‎ایک‎ ‎اہم‎ ‎غلطی‎ ‎ہے۔

کیا‎ ‎آپ‎ ‎یہ‎ ‎بھیج‎ ‎سکتے‎ ‎ہیں؟ شکریہ،‎ ‎اس‎ ‎کی‎ ‎تعریف‎ ‎کرتا‎ ‎ہوں۔‎" Context: ‎ایک‎ CEO ‎کو‎ ‎پیغام‎ ‎بھیجنا۔

جب‎ ‎ماڈل‎ ‎پول‎ ‎میں‎ ‎توسیع‎ ‎ہوئی‎ ‎تو‎ ‎اتفاق‎ ‎رائے‎ ‎میں‎ ‎تبدیلی‎ ‎آئی۔ یہ‎ ‎طریقہ‎ ‎کار‎ ‎سادہ‎ ‎ہے‎: ‎ایسے‎ ‎ماڈلز‎ ‎شامل‎ ‎کرنے‎ ‎سے‎ ‎جو‎ ‎رسمیت‎ ‎کے‎ ‎تناظر‎ ‎کو‎ ‎صحیح‎ ‎طریقے‎ ‎سے‎ ‎پڑھتے‎ ‎ہیں،‎ ‎اکثریت‎ ‎میں‎ ‎تبدیلی‎ ‎آئی،‎ ‎اور‎ ‎اتفاق‎ ‎رائے‎ ‎اس‎ ‎کے‎ ‎ساتھ‎ ‎ہو‎ ‎گیا۔ یہاں‎ ‎وہ‎ ‎مکمل‎ ‎سپیکٹرم‎ ‎ہے‎ ‎جو‎ ‎ماڈلز‎ ‎نے‎ Round 2 ‎میں‎ ‎تیار‎ ‎کیا‎:‏

Test 1: CEO ‎جملہ‎ — ‎مکمل‎ Round 2 ‎ماڈل‎ ‎آؤٹ‎ ‎پٹس


قابلِ‎ ‎غور‎ outlier — DeepSeek R2

DeepSeek V4-Pro in Round 2 ‎تیار‎ ‎کیا‎ ‎گیا 送ってくれる?ありがとう、助かる。‎‎, ‎سادہ‎ ‎شکل‎ ‎جاپانی۔ یہ‎ ‎وہ‎ ‎ہے‎ ‎جو‎ ‎آپ‎ ‎ایک‎ ‎قریبی‎ ‎دوست‎ ‎کو‎ ‎ٹیکسٹ‎ ‎کرتے‎ ‎ہیں۔ یہ‎ ‎ایک‎ ‎سی‎ ‎ای‎ ‎او‎ ‎کو‎ ‎پیغام‎ ‎کے‎ ‎لیے‎ ‎موزوں‎ ‎رجسٹر‎ ‎نہیں‎ ‎ہے۔ سادہ‎ ‎شکل‎ (くれる、助かる) ‎تمام‎ ‎احترام‎ ‎کے‎ ‎نشانات‎ ‎کو‎ ‎ہٹا‎ ‎دیتی‎ ‎ہے۔ اتفاق‎ ‎رائے‎ ‎نے‎ ‎اسے‎ ‎درست‎ ‎طریقے‎ ‎سے‎ ‎مستثنیٰ‎ ‎کیا،‎ ‎لیکن‎ ‎اگر‎ ‎یہ‎ ‎آپ‎ ‎کا‎ ‎واحد‎ ‎ماڈل‎ ‎ہوتا‎ ‎تو‎ ‎آپ‎ ‎اپنے‎ ‎سی‎ ‎ای‎ ‎او‎ ‎کو‎ ‎ایک‎ ‎غیر‎ ‎رسمی‎ ‎ٹیکسٹ‎ ‎کے‎ ‎مساوی‎ ‎پیغام‎ ‎بھیجتے۔

ویتنامی‎ ‎رجسٹر‎ ‎ٹیسٹ‎ ‎نے‎ ‎رسمیت‎ ‎کی‎ ‎ایک‎ ‎مختلف‎ ‎قسم‎ ‎کی‎ ‎خرابی‎ ‎کو‎ ‎سامنے‎ ‎لایا،‎ ‎جو‎ ‎کہ‎ ‎زیادہ‎ ‎لطیف‎ ‎ہے۔ ماخذ‎ ‎جملہ‎: ارے،‎ ‎ایک‎ ‎جلدی‎ ‎سوال‎ — ‎کیا‎ ‎تم‎ ‎کال‎ ‎پر‎ ‎آنے‎ ‎کے‎ ‎لیے‎ ‎آزاد‎ ‎ہو؟ سیاق‎ ‎و‎ ‎سباق‎: ‎کلائنٹ‎ ‎کو‎ ‎پیغام‎ ‎بھیجنا۔ پہلے‎ ‎دور‎ ‎میں‎ Qwen ‎نے‎ "mình" ‎شامل‎ ‎کیا،‎ ‎جو‎ ‎ایک‎ ‎اول‎ ‎شخص‎ ‎ضمیر‎ ‎ہے‎ ‎جو‎ ‎غیر‎ ‎رسمی‎ ‎ہم‎ ‎مرتبہ‎ ‎دوستی‎ ‎کا‎ ‎مطلب‎ ‎رکھتا‎ ‎ہے۔ ہر‎ ‎دوسرا‎ ‎ماڈل‎ ‎پہلے‎ ‎شخص‎ ‎میں‎ ‎خود‎ ‎حوالہ‎ ‎دینے‎ ‎سے‎ ‎مکمل‎ ‎طور‎ ‎پر‎ ‎بچتا‎ ‎ہے،‎ ‎جو‎ ‎زیادہ‎ ‎محفوظ‎ ‎پیشہ‎ ‎ورانہ‎ ‎انتخاب‎ ‎ہے۔ اہم‎ ‎بات‎ ‎یہ‎ ‎ہے‎ ‎کہ‎ Qwen ‎نے‎ ‎اس‎ ‎کو‎ ‎دوسری‎ ‎بار‎ ‎درست‎ ‎کیا‎ ‎اور‎ "mình" ‎کو‎ ‎ہٹا‎ ‎دیا۔ اس‎ ‎بات‎ ‎پر‎ ‎دونوں‎ ‎دوروں‎ ‎میں‎ ‎اتفاق‎ ‎رائے‎ ‎نے‎ ‎اسے‎ ‎مستثنیٰ‎ ‎کر‎ ‎دیا۔

ٹیسٹ‎ 6: ‎"‎ہے،‎ ‎ایک‎ ‎سوال‎ ‎ہے‎ — ‎کیا‎ ‎آپ‎ ‎کال‎ ‎پر‎ ‎آنے‎ ‎کے‎ ‎لیے‎ ‎آزاد‎ ‎ہیں؟‎" → ‎ویتنامی


نتیجہ‎ — ‎رجسٹر‎ ‎کی‎ ‎غلطیاں‎ ‎موازنے‎ ‎کے‎ ‎بغیر‎ ‎نظر‎ ‎نہیں‎ ‎آتیں

Qwen ‎کی‎ "mình" ‎غلطی‎ ‎اس‎ ‎کی‎ ‎واضح‎ ‎ترین‎ ‎مثال‎ ‎ہے‎ ‎کہ‎ ‎کیوں‎ ‎سنگل‎ ‎ماڈل‎ ‎ترجمہ‎ ‎کلائنٹ‎ ‎سے‎ ‎متعلق‎ ‎مواصلات‎ ‎کے‎ ‎لیے‎ ‎خطرناک‎ ‎ہے‎: ‎نتیجہ‎ ‎روانی‎ ‎سے،‎ ‎گرامر‎ ‎کے‎ ‎لحاظ‎ ‎سے‎ ‎درست،‎ ‎اور‎ ‎فطری‎ ‎آواز‎ ‎والی‎ ‎ویتنامی‎ ‎زبان‎ ‎ہے۔ کوئی‎ ‎بھی‎ ‎چیز‎ ‎فلیگ‎ ‎کرنے‎ ‎کے‎ ‎لیے‎ ‎نہیں‎ ‎ہے۔ دوسری‎ ‎چار‎ ‎ماڈلز‎ ‎کو‎ ‎دیکھے‎ ‎بغیر‎ ‎پہلے‎ ‎شخص‎ ‎کے‎ ‎خود‎ ‎حوالہ‎ ‎سے‎ ‎بچتے‎ ‎ہوئے،‎ ‎آپ‎ ‎کو‎ ‎کوئی‎ ‎اشارہ‎ ‎نہیں‎ ‎ہوتا‎ ‎کہ‎ ‎رجسٹر‎ ‎کا‎ ‎انتخاب‎ ‎کیا‎ ‎گیا‎ ‎تھا۔

حصہ‎ 3: قانونی‎ ‎اصطلاحات‎ — ‎معافی‎ ‎کا‎ ‎مسئلہ

فروخت‎ ‎کنندہ‎/‎کلائنٹ‎ ‎معاوضہ‎ ‎کی‎ ‎سزا‎ ‎ایک‎ ‎تجارتی‎ ‎معاہدوں‎ ‎میں‎ ‎معیاری‎ ‎شق‎ ‎ہے‎: ‎"‎فروخت‎ ‎کنندہ‎ ‎کلائنٹ‎ ‎کو‎ ‎اس‎ ‎معاہدے‎ ‎کی‎ ‎خلاف‎ ‎ورزی‎ ‎سے‎ ‎پیدا‎ ‎ہونے‎ ‎والے‎ ‎کسی‎ ‎بھی‎ ‎تیسری‎ ‎طرف‎ ‎کے‎ ‎دعویٰ‎ ‎سے‎ ‎محفوظ‎ ‎رکھے‎ ‎گا۔‎"‎

راؤنڈ‎ 1 ‎میں،‎ ‎تمام‎ ‎پانچ‎ ‎ماڈلز‎ ‎نے‎ ‎قانونی‎ ‎رجسٹر‎ ‎کی‎ ‎درست‎ ‎شناخت‎ ‎کی‎ ‎اور‎ ‎مستعار‎ ‎الفاظ‎ ベンダー (‎فراہم‎ ‎کنندہ‎) ‎اور‎ クライアント (‎کلائنٹ‎) ‎استعمال‎ ‎کیے،‎ ‎جو‎ ‎انگریزی‎ ‎نژاد‎ ‎جاپانی‎ ‎تجارتی‎ ‎معاہدوں‎ ‎میں‎ ‎معیاری‎ ‎ہیں۔ ایک‎ ‎استثنیٰ‎: GPT-4.1-NANO ‎نے‎ 販売者 (‎فروخت‎ ‎کنندہ‎) ‎اور‎ 顧客 (‎گاہک‎) ‎استعمال‎ ‎کیے،‎ ‎جو‎ ‎قانونی‎ ‎لحاظ‎ ‎سے‎ ‎درست‎ ‎جاپانی‎ ‎الفاظ‎ ‎ہیں‎ ‎لیکن‎ ‎قرض‎ ‎لیے‎ ‎گئے‎ ‎الفاظ‎ ‎کی‎ ‎رسمی‎ ‎قانونی‎ ‎تخصیص‎ ‎سے‎ ‎محروم‎ ‎ہیں۔

زیادہ‎ ‎اہم‎ ‎دریافت‎ ‎دوسری‎ ‎کے‎ ‎دور‎ ‎میں‎ ‎سامنے‎ ‎آئی۔ اہم‎ ‎فرق‎ ‎دو‎ ‎الفاظ‎ ‎کے‎ ‎درمیان‎ ‎ہے‎:‏

  • 補償 (hoshō)‎ ‎— ‎معاوضہ‎ ‎دینا،‎ ‎واپس‎ ‎کرنا۔ کسی‎ ‎کو‎ ‎نقصان‎ ‎کے‎ ‎بعد‎ ‎مالی‎ ‎طور‎ ‎پر‎ ‎مکمل‎ ‎کرنا۔
  • 免責 (menseki)‎ ‎— ‎ذمہ‎ ‎داری‎ ‎سے‎ ‎معاف‎ ‎کرنا؛‎ ‎معاوضہ‎ ‎دینا۔ تیسری‎ ‎پارٹی‎ ‎کے‎ ‎دعویٰ‎ ‎سے‎ ‎پہلے‎ ‎کہ‎ ‎وہ‎ ‎عملی‎ ‎شکل‎ ‎اختیار‎ ‎کریں،‎ ‎بے‎ ‎ضرر‎ ‎رکھنا۔

یہ‎ ‎قانونی‎ ‎طور‎ ‎پر‎ ‎مختلف‎ ‎تصورات‎ ‎ہیں۔ ‎"Indemnify" ‎خاص‎ ‎طور‎ ‎پر‎ ‎کسی‎ ‎فریق‎ ‎کو‎ ‎تیسری‎ ‎فریق‎ ‎کی‎ ‎ذمہ‎ ‎داری‎ ‎سے‎ ‎محفوظ‎ ‎رکھنے‎ ‎کا‎ ‎مطلب‎ ‎ہے۔‎ ‎معافی‎ ‎یا‎ ‎تاوان‎ ‎دینا‎ ‎درست‎ ‎قانونی‎ ‎اصطلاح‎ ‎ہے۔ تمام‎ Round 1 ‎ماڈلز‎ ‎نے‎ 補償 ‎استعمال‎ ‎کیا۔ راؤنڈ‎ 2 ‎میں،‎ DeepSeek V4-Pro ‎واحد‎ ‎ماڈل‎ ‎تھا‎ ‎جس‎ ‎نے‎ 免責 ‎پیدا‎ ‎کیا،‎ ‎اور‎ ‎اس‎ ‎نے‎ ‎یہ‎ ‎صرف‎ ‎راؤنڈ‎ 2 ‎میں‎ ‎کیا،‎ ‎راؤنڈ‎ 1 ‎میں‎ ‎نہیں۔

ٹیسٹ‎ 7: معاوضہ‎ ‎شق‎ → ‎جاپانی‎ (‎اہم‎ ‎نتائج‎)‎


نتیجہ‎ — ‎قانونی‎ ‎رجسٹر

DeepSeek in R2 ‎واحد‎ ‎ماڈل‎ ‎ہے‎ ‎جو‎ 免責 ‎استعمال‎ ‎کرتا‎ ‎ہے،‎ ‎جو‎ "‎معاوضہ‎" ‎کا‎ ‎قانونی‎ ‎طور‎ ‎پر‎ ‎درست‎ ‎مترادف‎ ‎ہے۔ ہر‎ ‎دوسرا‎ ‎ماڈل‎ 補償 (‎معاوضہ‎) ‎استعمال‎ ‎کرتا‎ ‎ہے،‎ ‎جو‎ ‎لحاظ‎ ‎سے‎ ‎متعلقہ‎ ‎ہے‎ ‎لیکن‎ ‎قانونی‎ ‎طور‎ ‎پر‎ ‎الگ‎ ‎ہے۔ یہ‎ ‎نتیجہ‎ ‎صرف‎ ‎دوسری‎ ‎بار‎ ‎میں‎ ‎نظر‎ ‎آتا‎ ‎ہے،‎ ‎جو‎ ‎اس‎ ‎بات‎ ‎کو‎ ‎اجاگر‎ ‎کرتا‎ ‎ہے‎ ‎کہ‎ ‎ایک‎ ‎جامد،‎ ‎ایک‎ ‎بار‎ ‎کا‎ ‎ٹیسٹ‎ ‎جو‎ ‎ایک‎ ‎مقررہ‎ ‎ماڈل‎ ‎پول‎ ‎استعمال‎ ‎کرتا‎ ‎ہے‎ ‎اہم‎ ‎تبدیلی‎ ‎کو‎ ‎چھوڑ‎ ‎سکتا‎ ‎ہے۔
‎ ‎الگ‎ ‎سے،‎ Qwen R2 ‎میں‎ 売主/買主 (‎فروخت‎ ‎کنندہ‎/‎خریدار‎) ‎پر‎ ‎سوئچ‎ ‎کر‎ ‎کے‎ ‎پسماندہ‎ ‎ہو‎ ‎جاتا‎ ‎ہے،‎ ‎یہ‎ ‎اصطلاحات‎ ‎تجارتی‎ ‎فروخت‎ ‎کے‎ ‎قانون‎ ‎سے‎ ‎ہیں‎ ‎نہ‎ ‎کہ‎ ‎خدمات‎ ‎کے‎ ‎معاہدوں‎ ‎سے۔ یہ‎ ‎ایک‎ ‎کم‎ ‎مناسب‎ ‎فریم‎ ‎ورک‎ ‎ہے‎ ‎ایک‎ ‎معاہدے‎ ‎کے‎ ‎لیے‎ ‎جو‎ ‎انگریزی‎ ‎قانونی‎ ‎اصطلاحات‎ ‎استعمال‎ ‎کرتا‎ ‎ہے۔

ایک‎ ‎معاہدے‎ ‎میں،‎ 補償 ‎اور‎ 免責 ‎مترادفات‎ ‎نہیں‎ ‎ہیں۔ ایک‎ ‎کا‎ ‎مطلب‎ ‎ہے‎ "‎ہم‎ ‎آپ‎ ‎کو‎ ‎واپس‎ ‎کی‎ ‎رقم‎ ‎دیں‎ ‎گے۔‎" دوسرا‎ ‎مطلب‎ ‎یہ‎ ‎ہے‎ ‎کہ‎ "‎آپ‎ ‎شروع‎ ‎میں‎ ‎ہی‎ ‎اس‎ ‎دعویٰ‎ ‎سے‎ ‎محفوظ‎ ‎ہیں۔‎" اگر‎ ‎کوئی‎ ‎ترجمہ‎ ‎پلیٹ‎ ‎فارم‎ 補償 ‎استعمال‎ ‎کرتا‎ ‎ہے‎ ‎جہاں‎ 免責 ‎درست‎ ‎ہے،‎ ‎تو‎ ‎جاپانی‎ ‎ورژن‎ ‎پڑھنے‎ ‎والا‎ ‎وکیل‎ ‎وہی‎ ‎معاہدہ‎ ‎نہیں‎ ‎دیکھے‎ ‎گا‎ ‎جو‎ ‎انگریزی‎ ‎ورژن‎ ‎بیان‎ ‎کرتا‎ ‎ہے۔

حصہ‎ 4: طبی‎ ‎اصطلاحات‎ — ‎وہ‎ ‎تقسیم‎ ‎جو‎ ‎حل‎ ‎نہیں‎ ‎ہوئی

یہ‎ ‎ڈیٹاسیٹ‎ ‎میں‎ ‎سب‎ ‎سے‎ ‎اہم‎ ‎دریافت‎ ‎ہے۔ ٹیسٹ‎ ‎جملہ‎: یہ‎ ‎دوا‎ ‎ان‎ ‎مریضوں‎ ‎میں‎ ‎منع‎ ‎ہے‎ ‎جن‎ ‎کو‎ ‎جگر‎ ‎کی‎ ‎خرابی‎ ‎کی‎ ‎تاریخ‎ ‎ہے۔ ذریعہ‎: ‎کلینیکل‎ ‎پروڈکٹ‎ ‎دستاویزات۔ ہدف‎: Vietnamese.‎

کبدی‎ ‎خرابی‎ ‎اہم‎ ‎اصطلاح‎ ‎ہے۔ دو‎ ‎ویتنامی‎ ‎امیدوار‎ ‎ہیں‎:‏

  • suy gan ‎— ‎جگر‎ ‎کی‎ ‎ناکامی۔ شدید،‎ ‎شدید‎ ‎یا‎ ‎دائمی‎ ‎آخری‎ ‎مرحلے‎ ‎کے‎ ‎جگر‎ ‎کی‎ ‎خرابی‎ ‎سے‎ ‎مراد‎ ‎ہے۔ ایک‎ ‎مریض‎ ‎جو‎ ‎جگر‎ ‎کی‎ ‎ناکامی‎ ‎کا‎ ‎سامنا‎ ‎کر‎ ‎رہا‎ ‎تھا۔
  • جگر‎ ‎کی‎ ‎کمزور‎ ‎کارکردگی ‎— ‎کم‎ ‎شدہ‎/‎خراب‎ ‎جگر‎ ‎کی‎ ‎کارکردگی۔ جگر‎ ‎کی‎ ‎کارکردگی‎ ‎میں‎ ‎کسی‎ ‎بھی‎ ‎قسم‎ ‎کی‎ ‎کمی‎ ‎کو‎ ‎ظاہر‎ ‎کرتا‎ ‎ہے،‎ ‎بشمول‎ ‎ہلکے‎ ‎یا‎ ‎اعتدال‎ ‎پسند‎ ‎نقصان۔

یہ‎ ‎طبی‎ ‎لحاظ‎ ‎سے‎ ‎الگ‎ ‎الگ‎ ‎ہیں۔ ‎"‎ہیپاٹک‎ ‎امپیئرمنٹ‎" ‎کی‎ ‎بنیاد‎ ‎پر‎ ‎موانع‎ ‎انتباہ‎ ‎کا‎ ‎اطلاق‎ ‎ان‎ ‎تمام‎ ‎افراد‎ ‎پر‎ ‎ہوتا‎ ‎ہے‎ ‎جن‎ ‎کا‎ ‎جگر‎ ‎کی‎ ‎کارکردگی‎ ‎میں‎ ‎کمی‎ ‎ہے،‎ ‎نہ‎ ‎کہ‎ ‎صرف‎ ‎ان‎ ‎لوگوں‎ ‎پر‎ ‎جنہوں‎ ‎نے‎ ‎مکمل‎ ‎اعضاء‎ ‎کی‎ ‎ناکامی‎ ‎کا‎ ‎سامنا‎ ‎کیا‎ ‎ہے۔ سوے‎ ‎گن‎ ‎کا‎ ‎استعمال‎ ‎اشارہ‎ ‎شدہ‎ ‎آبادی‎ ‎کو‎ ‎غلط‎ ‎طریقے‎ ‎سے‎ ‎محدود‎ ‎کرتا‎ ‎ہے۔ اعتدال‎ ‎پوائنٹ‎ ‎پر‎ ‎جگر‎ ‎کی‎ ‎خرابی‎ ‎والا‎ ‎مریض‎ ‎جو‎ "suy gan" ‎پڑھتا‎ ‎ہے‎ ‎وہ‎ ‎اپنے‎ ‎آپ‎ ‎کو‎ ‎منع‎ ‎شدہ‎ ‎آبادی‎ ‎کے‎ ‎طور‎ ‎پر‎ ‎شناخت‎ ‎نہیں‎ ‎کر‎ ‎سکتا۔

ٹیسٹ‎ 2: موانع‎ ‎استعمال‎ ‎کی‎ ‎سزا‎ → ‎ویتنامی‎ (‎دونوں‎ ‎راؤنڈ‎)‎


اہم‎ ‎دریافت‎: ‎طبی‎ ‎اصطلاحات

تقسیم‎ 6 ‎ماڈل‎ ‎سوی‎ ‎گان‎ ‎بمقابلہ‎ 4 ‎ماڈل‎ ‎سوی‎ ‎گیام‎ ‎چک‎ ‎نانگ‎ ‎گان‎ ‎دوسری‎ ‎راؤنڈ‎ ‎میں۔ اکثریت،‎ ‎اور‎ ‎اس‎ ‎لیے‎ ‎اتفاق‎ ‎رائے،‎ ‎کم‎ ‎طبی‎ ‎درستگی‎ ‎والی‎ ‎اصطلاح‎ ‎کو‎ ‎منتخب‎ ‎کرتی‎ ‎ہے۔ دونوں‎ Claude ‎ماڈلز‎ (Sonnet ‎اور‎ Opus) ‎دونوں‎ ‎راؤنڈز‎ ‎میں‎ ‎مسلسل‎ ‎طور‎ ‎پر‎ suy giảm chức năng gan ‎کا‎ ‎انتخاب‎ ‎کرتے‎ ‎ہیں۔ تقسیم‎ ‎حل‎ ‎نہیں‎ ‎ہوتی‎ ‎جب‎ ‎پول‎ ‎پھیلتا‎ ‎ہے۔
یہ‎ ‎اس‎ ‎ڈیٹاسیٹ‎ ‎میں‎ ‎وہ‎ ‎ایک‎ ‎نتیجہ‎ ‎ہے‎ ‎جو‎ ‎طبی‎ ‎مواد‎ ‎پر‎ ‎انسانی‎ ‎ماہر‎ ‎کے‎ ‎جائزے‎ ‎کے‎ ‎لیے‎ ‎سب‎ ‎سے‎ ‎براہ‎ ‎راست‎ ‎دلیل‎ ‎دیتا‎ ‎ہے۔ اتفاق‎ ‎رائے‎ ‎اکثریتی‎ ‎رائے‎ ‎سے‎ ‎غلط‎ ‎نہیں‎ ‎ہوتی۔ یہ‎ ‎سرحدی‎ ‎ماڈلز‎ ‎کے‎ ‎درمیان‎ ‎ایک‎ ‎حقیقی‎ ‎اختلاف‎ ‎کو‎ ‎ظاہر‎ ‎کرتا‎ ‎ہے،‎ ‎اور‎ ‎یہ‎ ‎اختلاف‎ ‎خود‎ ‎ایک‎ ‎ترجمہ‎ ‎کار‎ ‎کو‎ ‎دیکھنے‎ ‎کی‎ ‎ضرورت‎ ‎ہے۔ یہ‎ ‎بالکل‎ ‎اسی‎ ‎قسم‎ ‎کا‎ ‎معاملہ‎ ‎ہے Tomedes' ‎انسانی‎ ‎نگرانی‎ ‎کے‎ ‎ذریعے‎ ‎جائزہ جس‎ ‎کے‎ ‎لیے‎ ‎بنایا‎ ‎گیا‎ ‎ہے۔

حصہ‎ 5: ‎"‎یہ‎ ‎بیمار‎ ‎ہے‎" — ‎جب‎ ‎ابہام‎ ‎مقصد‎ ‎ہو‎ ‎تو‎ ‎کیا‎ ‎ہوتا‎ ‎ہے

کچھ‎ ‎ذریعہ‎ ‎جملے‎ ‎ڈیزائن‎ ‎کے‎ ‎لحاظ‎ ‎سے‎ ‎ابہام‎ ‎خیز‎ ‎ہوتے‎ ‎ہیں۔ معاصر‎ ‎انگریزی‎ ‎بول‎ ‎چال‎ ‎میں‎ "That's sick" ‎کا‎ ‎مطلب‎ ‎کچھ‎ ‎بہترین‎ ‎ہے،‎ ‎لیکن‎ ‎یہ‎ ‎اپنا‎ ‎لفظی‎ ‎معنیٰ‎ ‎بھی‎ ‎رکھتا‎ ‎ہے‎ (‎یعنی‎ ‎متلی‎ ‎آور‎/‎ناپسندیدہ‎)‎،‎ ‎اور‎ ‎ان‎ ‎دونوں‎ ‎معنوں‎ ‎کے‎ ‎درمیان‎ ‎تناؤ‎ ‎اس‎ ‎بات‎ ‎کا‎ ‎حصہ‎ ‎ہے‎ ‎کہ‎ ‎یہ‎ ‎جملہ‎ ‎کیسے‎ ‎بات‎ ‎کرتا‎ ‎ہے۔ ترجمہ‎ ‎ماڈل‎ ‎کے‎ ‎لیے‎ ‎چیلنج‎ ‎یہ‎ ‎ہے‎: ‎کیا‎ ‎آپ‎ ‎ابہام‎ ‎کو‎ ‎برقرار‎ ‎رکھتے‎ ‎ہیں،‎ ‎اسے‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎ممکنہ‎ ‎معنی‎ ‎تک‎ ‎محدود‎ ‎کرتے‎ ‎ہیں،‎ ‎یا‎ ‎ایک‎ ‎کو‎ ‎منتخب‎ ‎کرتے‎ ‎ہیں‎ ‎اور‎ ‎اس‎ ‎پر‎ ‎عمل‎ ‎کرتے‎ ‎ہیں؟

جاپانی‎ ‎آؤٹ‎ ‎پٹ


ویتنامی‎ ‎آؤٹ‎ ‎پٹ


دریافت‎: ‎ابہام‎ ‎اور‎ ‎ایک‎ ‎جیسے‎ ‎خاندان‎ ‎کے‎ ‎اختلافات

Claude Opus 4-7 ‎لکھتے‎ ‎ہیں Đỉnh vậy ‎(‎سلنگ‎)‎۔ کلاڈ‎ ‎سونیٹ‎ 4-6 ‎لکھتا‎ ‎ہے بہت‎ ‎شاندار ‎(‎رسمی‎)‎۔ یہ‎ ‎ایک‎ ‎جیسے‎ ‎ماڈل‎ ‎خاندان‎ ‎سے‎ ‎دونوں‎ ‎ماڈلز‎ ‎کے‎ ‎ذریعے‎ ‎ایک‎ ‎جیسی‎ ‎دو‎ ‎لفظی‎ ‎ان‎ ‎پٹ‎ ‎پر‎ ‎بنائے‎ ‎گئے‎ ‎مخالف‎ ‎رجسٹر‎ ‎فیصلے‎ ‎ہیں۔ نہ‎ ‎تو‎ ‎کوئی‎ "‎غلط‎" ‎ہے۔ ‎"That's sick" ‎میں‎ ‎ابہام‎ ‎کا‎ ‎مطلب‎ ‎یہ‎ ‎ہے‎ ‎کہ‎ ‎دونوں‎ ‎معنی‎ ‎موجود‎ ‎ہیں۔ لیکن‎ ‎اگر‎ ‎آپ‎ ‎کے‎ ‎ہدف‎ ‎کے‎ ‎سامعین‎ ‎موجودہ‎ ‎ویتنامی‎ ‎نوجوانوں‎ ‎کی‎ ‎بول‎ ‎چال‎ ‎استعمال‎ ‎کرتے‎ ‎ہیں،‎ ‎تو‎ ‎ان‎ ‎ترجموں‎ ‎میں‎ ‎سے‎ ‎صرف‎ ‎ایک‎ ‎صحیح‎ ‎طریقے‎ ‎سے‎ ‎بات‎ ‎چیت‎ ‎کرتا‎ ‎ہے۔ اتفاق‎ ‎رائے‎ ‎اختلاف‎ ‎کو‎ ‎نمایاں‎ ‎کرتی‎ ‎ہے۔ اس‎ ‎کے‎ ‎بغیر،‎ ‎آپ‎ ‎کو‎ ‎معلوم‎ ‎نہیں‎ ‎ہوتا‎ ‎کہ‎ ‎کوئی‎ ‎انتخاب‎ ‎کیا‎ ‎گیا‎ ‎تھا۔
جاپانی‎ ‎میں،‎ GPT-4.1-NANO ‎واحد‎ ‎ماڈل‎ ‎ہے‎ ‎جو すごい‎ ‎استعمال‎ ‎کرتا‎ ‎ہے،‎ ‎جو‎ ‎ابہام‎ ‎کو‎ ‎مکمل‎ ‎طور‎ ‎پر‎ "‎حیرت‎ ‎انگیز‎" ‎کے‎ ‎حق‎ ‎میں‎ ‎ختم‎ ‎کر‎ ‎دیتا‎ ‎ہے۔ پانچ‎ ‎دوسری‎ ‎ماڈلز‎ ‎اسے‎ ‎محفوظ‎ ‎رکھتے‎ ‎ہیں やばい/ヤバい‎. کلاڈ‎ ‎اوپس‎ ‎سب‎ ‎سے‎ ‎کم‎ ‎شکل‎ ‎اختیار‎ ‎کرتا‎ ‎ہے‎: ‎بغیر‎ ‎کسی‎ ‎موضوع‎ ‎کے‎ ‎ننگا やばい 

حصہ‎ 6: ماڈل‎ ‎پول‎ ‎کی‎ ‎شکل‎ ‎کیا‎ ‎ہے

اس‎ ‎ٹیسٹ‎ ‎میں‎ ‎ماڈل‎ ‎سب‎ ‎برابر‎ ‎نہیں‎ ‎ہیں۔ وہ‎ ‎مختلف‎ ‎آرکیٹیکچرز،‎ ‎تربیتی‎ ‎نظاموں،‎ ‎اور‎ ‎تعیناتی‎ ‎سیاق‎ ‎و‎ ‎سباق‎ ‎میں‎ ‎پھیلے‎ ‎ہوئے‎ ‎ہیں۔ راؤنڈ‎ 1 ‎کی‎ ‎بنیادی‎ ‎لائن‎ ‎میں‎ ‎وہ‎ ‎ماڈلز‎ ‎شامل‎ ‎ہیں‎ ‎جو‎ ‎بڑے‎ ‎پیمانے‎ ‎پر‎ ‎قابل‎ ‎رسائی‎ ‎ہیں۔ وسیع‎ ‎شدہ‎ Round 2 ‎پول‎ ‎میں‎ MachineTranslation.com ‎پر‎ ‎ادا‎ ‎کرنے‎ ‎والے‎ ‎صارفین‎ ‎کے‎ ‎لیے‎ ‎دستیاب‎ ‎نئے‎ ‎ترین‎ ‎پریمیم‎ ‎ٹیئر‎ ‎ماڈل‎ ‎کی‎ ‎متعدد‎ ‎شکلیں‎ ‎شامل‎ ‎ہیں،‎ ‎ماڈل‎ ‎کی‎ ‎وہی‎ ‎ٹیئر‎ ‎جس‎ ‎کا‎ ‎مطلب‎ ‎ورنہ‎ ‎ہر‎ ‎انفرادی‎ ‎فراہم‎ ‎کنندہ‎ ‎کے‎ ‎ساتھ‎ ‎الگ‎ ‎الگ‎ ‎ادا‎ ‎شدہ‎ ‎اکاؤنٹ‎ ‎ہوگا۔

Round 2 ‎میں‎ ‎وسیع‎ ‎شدہ‎ ‎پول‎ ‎میں‎ ‎ایسے‎ ‎ماڈلز‎ ‎شامل‎ ‎ہیں‎ ‎جو‎ ‎زیادہ‎ ‎جدید‎ ‎ہیں‎ ‎اور‎ MachineTranslation.com ‎پر‎ ‎ادا‎ ‎کرنے‎ ‎والے‎ ‎صارفین‎ ‎کے‎ ‎لیے‎ ‎دستیاب‎ ‎ہیں۔ پول‎ ‎کو‎ ‎بڑھانے‎ ‎کے‎ ‎اثرات‎ ‎یکساں‎ ‎نہیں‎ ‎ہیں۔ کچھ‎ ‎ٹیسٹوں‎ ‎میں‎ (‎رسمیت‎/‎جاپانی‎)‎،‎ ‎اس‎ ‎نے‎ ‎اتفاق‎ ‎رائے‎ ‎کو‎ ‎بامعنیٰ‎ ‎طریقے‎ ‎سے‎ ‎تبدیل‎ ‎کر‎ ‎دیا۔ دوسروں‎ ‎میں‎ (‎طبی‎ ‎اصطلاحات‎/‎ویتنامی‎)‎،‎ ‎تقسیم‎ ‎گہری‎ ‎ہو‎ ‎گئی۔

حصہ‎ 7: اس‎ ‎کا‎ ‎مطلب‎ ‎ہے‎ ‎اگر‎ ‎آپ‎ ‎ترجمہ‎ ‎کے‎ ‎پلیٹ‎ ‎فارم‎ ‎کا‎ ‎انتخاب‎ ‎کر‎ ‎رہے‎ ‎ہیں

ٹیسٹ‎ ‎ڈیٹا‎ ‎دو‎ ‎الگ‎ ‎الگ‎ ‎ناکامی‎ ‎کے‎ ‎زمرے‎ ‎کی‎ ‎طرف‎ ‎اشارہ‎ ‎کرتا‎ ‎ہے،‎ ‎اور‎ ‎ان‎ ‎کے‎ ‎لیے‎ ‎مختلف‎ ‎جوابات‎ ‎کی‎ ‎ضرورت‎ ‎ہے۔

زمرہ‎ A: خاموش‎ ‎ناکامیاں۔ رسمی‎ ‎غلطیاں،‎ ‎رجسٹر‎ ‎کی‎ ‎غلطیاں،‎ ‎طبی‎ ‎اصطلاحات‎ ‎کی‎ ‎درستگی‎: ‎یہ‎ ‎ایسے‎ ‎نتائج‎ ‎پیدا‎ ‎کرتے‎ ‎ہیں‎ ‎جو‎ ‎صحیح‎ ‎نظر‎ ‎آتے‎ ‎ہیں۔ جاپانی‎ ‎قواعد‎ ‎اللغة‎ ‎کے‎ ‎لحاظ‎ ‎سے‎ ‎صحیح‎ ‎ہے۔ ویتنامی‎ ‎روانی‎ ‎ہے۔ کوئی‎ ‎ظاہری‎ ‎نشانی‎ ‎نہیں‎ ‎ہے‎ ‎کہ‎ ‎کچھ‎ ‎غلط‎ ‎ہوا۔ ایک‎ ‎لسانی‎ ‎صارف‎ ‎جو‎ ‎صرف‎ ‎ایک‎ ‎ماڈل‎ ‎کی‎ ‎پیداوار‎ ‎پڑھ‎ ‎رہا‎ ‎ہے‎ ‎اس‎ ‎کے‎ ‎پاس‎ ‎یہ‎ ‎جاننے‎ ‎کا‎ ‎کوئی‎ ‎طریقہ‎ ‎نہیں‎ ‎ہے‎ ‎کہ‎ ‎ماڈل‎ ‎نے‎ ‎ایسا‎ ‎رجسٹر‎ ‎انتخاب‎ ‎کیا‎ ‎ہے‎ ‎جو‎ ‎ایک‎ ‎سینئر‎ ‎جاپانی‎ ‎ایگزیکٹو‎ ‎کو‎ ‎نوٹس‎ ‎کریں‎ ‎گے،‎ ‎یا‎ ‎یہ‎ ‎کہ‎ ‎ایک‎ ‎طبی‎ ‎اصطلاح‎ ‎اس‎ ‎طریقے‎ ‎سے‎ ‎تنگ‎ ‎کی‎ ‎گئی‎ ‎تھی‎ ‎جو‎ ‎آبادی‎ ‎کو‎ ‎تبدیل‎ ‎کرتی‎ ‎ہے‎ ‎جس‎ ‎پر‎ ‎یہ‎ ‎لاگو‎ ‎ہوتی‎ ‎ہے۔

Category B: نمایاں‎ ‎ناکامیاں۔ MiniMax ‎نے‎ "burning the midnight oil" ‎کو‎ "‎مشاعل‎ ‎جلانا‎" ‎کے‎ ‎طور‎ ‎پر‎ ‎ترجمہ‎ ‎کیا۔ جی‎ ‎پی‎ ‎ٹی‎-4.1-‎نینو‎ "That's sick" ‎کو‎ ‎غیر‎ ‎مبہم‎ "すごい" ‎میں‎ ‎حل‎ ‎کر‎ ‎رہا‎ ‎ہے۔ یہ‎ ‎قابلِ‎ ‎شناخت‎ ‎ہیں،‎ ‎یا‎ ‎تو‎ ‎ہدف‎ ‎کی‎ ‎زبان‎ ‎کے‎ ‎بولنے‎ ‎والے‎ ‎کے‎ ‎ذریعے‎ ‎یا‎ ‎دوسری‎ ‎ماڈل‎ ‎کی‎ ‎پیداواروں‎ ‎کے‎ ‎ساتھ‎ ‎موازنے‎ ‎کے‎ ‎ذریعے۔

جو‎ ‎کثیر‎ ‎ماڈل‎ ‎کا‎ ‎موازنہ‎ SMART ‎فراہم‎ ‎کرتا‎ ‎ہے‎ ‎وہ‎ ‎زمرہ‎ A ‎میں‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎قیمتی‎ ‎ہے۔‎ ‎جب‎ ‎پانچ‎ ‎یا‎ ‎دس‎ ‎ماڈلز‎ ‎پیداوار‎ ‎دیتے‎ ‎ہیں‎ ‎اور‎ ‎زیادہ‎ ‎تر‎ ‎رسمی‎ ‎رجسٹر‎ ‎پر‎ ‎متفق‎ ‎ہوں‎ ‎جبکہ‎ ‎ایک‎ ‎غیر‎ ‎رسمی‎ ‎سادہ‎ ‎شکل‎ ‎میں‎ ‎جاپانی‎ ‎پیدا‎ ‎کرتا‎ ‎ہے،‎ ‎تو‎ ‎یہ‎ ‎اختلاف‎ ‎موازنے‎ ‎کے‎ ‎نقطہ‎ ‎نظر‎ ‎میں‎ ‎نمایاں‎ ‎ہے۔ ایک‎ ‎صارف‎ ‎جو‎ ‎ہدف‎ ‎کی‎ ‎زبان‎ ‎بولتا‎ ‎ہے‎ ‎اختیارات‎ ‎کا‎ ‎جائزہ‎ ‎لے‎ ‎سکتا‎ ‎ہے۔ ایک‎ ‎صارف‎ ‎جو‎ ‎نہیں‎ ‎دیکھ‎ ‎سکتا‎ ‎کہ‎ ‎ایک‎ ‎متنازعہ‎ ‎فیصلہ‎ ‎کیا‎ ‎گیا‎ ‎تھا،‎ ‎اور‎ ‎یہ‎ ‎فیصلہ‎ ‎کر‎ ‎سکتا‎ ‎ہے‎ ‎کہ‎ ‎آیا‎ ‎یہ‎ ‎سزا‎ ‎انسانی‎ ‎جائزے‎ ‎کی‎ ‎ضرورت‎ ‎ہے۔

دستاویز‎ ‎کی‎ ‎سطح‎ ‎کے‎ ‎کام‎ ‎کے‎ ‎لیے،‎ ‎بڑی‎ ‎فائلیں،‎ PDFs ‎کی‎ ‎ترتیب‎ ‎کو‎ ‎محفوظ‎ ‎رکھنے‎ ‎والی‎ ‎ترجمہ،‎ ‎معاہدے،‎ ‎یا‎ ‎کلینیکی‎ ‎مواد‎ ‎کے‎ ‎لیے،‎ ‎پلیٹ‎ ‎فارم‎ ‎کی‎ ‎دستاویز‎ ‎پروسیسنگ‎ ‎صلاحیت‎ ‎فائل‎ ‎کی‎ ‎ساخت‎ ‎کو‎ ‎فارمیٹنگ‎ ‎کو‎ ‎توڑے‎ ‎بغیر‎ ‎سنبھالتی‎ ‎ہے۔ لیکن‎ ‎اوپر‎ ‎اٹھائے‎ ‎گئے‎ ‎معیار‎ ‎کے‎ ‎سوالات‎ ‎فائل‎ ‎کی‎ ‎سائز‎ ‎سے‎ ‎قطع‎ ‎نظر‎ ‎لاگو‎ ‎ہوتے‎ ‎ہیں۔ ایک‎ 100 ‎صفحات‎ ‎کی‎ ‎کلینیکل‎ ‎تحقیق‎ ‎جہاں‎ "‎ہیپاٹک‎ ‎خرابی‎" ‎کی‎ ‎ہر‎ ‎مثال‎ ‎کو‎ "‎جگر‎ ‎کی‎ ‎ناکامی‎" ‎کے‎ ‎طور‎ ‎پر‎ ‎ترجمہ‎ ‎کیا‎ ‎گیا‎ ‎ہے،‎ ‎یہ‎ ‎ٹیسٹ‎ 2 ‎میں‎ ‎شناخت‎ ‎کی‎ ‎گئی‎ ‎اسی‎ ‎مسئلے‎ ‎کا‎ ‎ایک‎ ‎بڑا‎ ‎ورژن‎ ‎ہے۔

خاص‎ ‎طور‎ ‎پر‎ ‎طبی‎ ‎اور‎ ‎قانونی‎ ‎زمرہ‎ ‎جات‎ ‎کے‎ ‎لیے،‎ ‎انسانی‎ ‎تصدیق‎ ‎صحیح‎ ‎حفاظتی‎ ‎تدبیر‎ ‎ہے۔ ٹومیڈز‎ ‎کی‎ AI ‎پوسٹ‎ ‎ایڈٹنگ‎ ‎سروس،‎ ‎جو‎ AI ‎کے‎ ‎نتائج‎ ‎کو‎ ‎اعلیٰ‎ ‎تربیت‎ ‎یافتہ‎ ‎انسانی‎ ‎جائزے‎ ‎کے‎ ‎ساتھ‎ ‎جوڑتی‎ ‎ہے،‎ ‎بالکل‎ ‎اسی‎ ‎قسم‎ ‎کے‎ ‎اہم‎ ‎مواد‎ ‎کے‎ ‎لیے‎ ‎بنائی‎ ‎گئی‎ ‎ہے۔ suy gan / suy giảm chức năng gan ‎کی‎ ‎تقسیم‎ ‎بالکل‎ ‎اسی‎ ‎قسم‎ ‎کی‎ ‎تلاش‎ ‎ہے‎ ‎جو‎ ‎اس‎ ‎جائزے‎ ‎کو‎ ‎متحرک‎ ‎کرنی‎ ‎چاہیے،‎ ‎نہ‎ ‎کہ‎ ‎اس‎ ‎لیے‎ ‎کہ‎ ‎تمام‎ ‎ماڈل‎ ‎غلط‎ ‎ہیں،‎ ‎بلکہ‎ ‎اس‎ ‎لیے‎ ‎کہ‎ ‎جو‎ ‎ماڈل‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎اعتماد‎ ‎رکھتے‎ ‎ہیں‎ ‎وہ‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎درست‎ ‎نہیں‎ ‎ہیں۔

متعدد‎ ‎آؤٹ‎ ‎پٹ‎ ‎دیکھنے‎ ‎کی‎ ‎قیمت‎ ‎یہ‎ ‎نہیں‎ ‎ہے‎ ‎کہ‎ ‎آپ‎ ‎ہمیشہ‎ ‎اکثریت‎ ‎کو‎ ‎منتخب‎ ‎کریں‎ ‎گے۔ یہ‎ ‎ہے‎ ‎کہ‎ ‎آپ‎ ‎کو‎ ‎معلوم‎ ‎ہوگا‎ ‎کہ‎ ‎ایک‎ ‎انتخاب‎ ‎کیا‎ ‎گیا‎ ‎تھا،‎ ‎جو‎ ‎اس‎ ‎بات‎ ‎سے‎ ‎مختلف‎ ‎ہے‎ ‎کہ‎ ‎آپ‎ ‎کے‎ ‎سامنے‎ ‎موجود‎ ‎نتیجہ‎ ‎کو‎ ‎درست‎ ‎سمجھ‎ ‎لیا‎ ‎جائے۔

آٹھ‎ ‎جملے‎ ‎درحقیقت‎ ‎مجھے‎ ‎کیا‎ ‎بتاتے‎ ‎ہیں

آٹھ‎ ‎ٹیسٹوں‎ ‎کو‎ ‎ایک‎ ‎ساتھ‎ ‎رکھیں‎ ‎اور‎ ‎ایک‎ ‎نمونہ‎ ‎برقرار‎ ‎رہتا‎ ‎ہے‎: ‎اتفاق‎ ‎اور‎ ‎اختلاف‎ ‎بے‎ ‎ترتیب‎ ‎طریقے‎ ‎سے‎ ‎تقسیم‎ ‎نہیں‎ ‎ہیں۔ روزمرہ‎ ‎کے‎ ‎کاروباری‎ ‎محاورے‎ ("‎رابطہ‎ ‎قائم‎ ‎کرنا،‎" "‎رات‎ ‎بھر‎ ‎کام‎ ‎کرنا‎") ‎تقریباً‎ ‎ہر‎ ‎ماڈل‎ ‎میں‎ ‎دونوں‎ ‎دورں‎ ‎میں‎ ‎متحد‎ ‎ہوئے۔ رسمیت،‎ ‎قانونی‎ ‎درستگی،‎ ‎اور‎ ‎طبی‎ ‎اصطلاحات‎ ‎نہیں‎ ‎تھے۔ سی‎ ‎ای‎ ‎او‎ ‎کی‎ ‎رسمیت‎ ‎کا‎ ‎ٹیسٹ‎ ‎صرف‎ ‎اس‎ ‎وقت‎ ‎غیر‎ ‎رسمی‎ ‎سے‎ ‎رسمی‎ ‎میں‎ ‎تبدیل‎ ‎ہوا‎ ‎جب‎ ‎توسیع‎ ‎شدہ‎ ‎پول‎ ‎شامل‎ ‎کیا‎ ‎گیا۔ شناخت‎ ‎کی‎ ‎شق‎ ‎نے‎ ‎ایک‎ ‎حقیقی‎ ‎قانونی‎ ‎امتیاز‎ ‎کو‎ ‎سامنے‎ ‎لایا‎ (‎معافی‎ ‎بخشی‎ ‎بمقابلہ‎ ‎معاوضہ‎) ‎جو‎ ‎صرف‎ ‎ایک‎ ‎ماڈل‎ ‎نے،‎ ‎ایک‎ ‎دور‎ ‎میں،‎ ‎صحیح‎ ‎طریقے‎ ‎سے‎ ‎حاصل‎ ‎کیا۔ طبی‎ ‎اصطلاحات‎ ‎میں‎ ‎تقسیم‎ ‎کبھی‎ ‎بھی‎ ‎مکمل‎ ‎طور‎ ‎پر‎ ‎حل‎ ‎نہیں‎ ‎ہوئی،‎ ‎دونوں‎ ‎راؤنڈز‎ ‎میں‎ ‎تقریباً‎ 6 ‎سے‎ 4 ‎کے‎ ‎تناسب‎ ‎پر‎ ‎برقرار‎ ‎رہی‎ ‎چاہے‎ ‎ماڈلز‎ ‎کا‎ ‎کوئی‎ ‎بھی‎ ‎مجموعہ‎ ‎استعمال‎ ‎ہو۔

‎ ‎یہ‎ ‎حقیقی‎ ‎نتیجہ‎ ‎ہے،‎ ‎نہ‎ ‎کہ‎ ‎کوئی‎ ‎مارکیٹنگ‎ ‎دعویٰ‎: ‎اتفاق‎ ‎رائے‎ ‎ہر‎ ‎جملے‎ ‎کو‎ ‎بہتر‎ ‎نہیں‎ ‎بناتا،‎ ‎اور‎ ‎اس‎ ‎کی‎ ‎ضرورت‎ ‎نہیں‎ ‎ہے۔ یہ‎ ‎بالکل‎ ‎وہاں‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎قیمتی‎ ‎ہے‎ ‎جہاں‎ ‎ایک‎ ‎واحد‎ ‎ماڈل‎ ‎کی‎ ‎روانی‎ ‎آپ‎ ‎کو‎ ‎اس‎ ‎پر‎ ‎شک‎ ‎کرنے‎ ‎کی‎ ‎کوئی‎ ‎وجہ‎ ‎نہیں‎ ‎دیتی،‎ ‎اور‎ ‎جہاں‎ ‎غلط‎ ‎ہونا‎ ‎دراصل‎ ‎کچھ‎ ‎خرچ‎ ‎کرتا‎ ‎ہے۔

اس‎ ‎ٹیسٹ‎ ‎کی‎ ‎ایک‎ ‎دوسری،‎ ‎زیادہ‎ ‎عملی‎ ‎تہہ‎ ‎ہے‎ ‎جو‎ ‎صاف‎ ‎طور‎ ‎سے‎ ‎بیان‎ ‎کے‎ ‎قابل‎ ‎ہے۔ اس‎ ‎موازنے‎ ‎کو‎ ‎خود‎ ‎چلانے‎ ‎کا‎ ‎مطلب‎ ‎یہ‎ ‎تھا‎ ‎کہ‎ GPT-5.5‏،‎ Claude Opus 4-7‏،‎ Gemini 3.5-Flash‏،‎ GLM-5-Turbo،‎ ‎اور‎ MiniMax M2.7 ‎سے‎ ‎نتائج‎ ‎کو‎ ‎موجودہ‎ ‎بیس‎ ‎لائن‎ ‎ماڈلز‎ ‎کے‎ ‎ساتھ‎ ‎ایک‎ ‎جگہ،‎ ‎ایک‎ ‎پلیٹ‎ ‎فارم‎ ‎پر،‎ ‎شانہ‎ ‎بشانہ‎ ‎چیک‎ ‎کیا‎ ‎جائے۔ MachineTranslation.com ‎کے‎ ‎باہر،‎ ‎یہ‎ ‎ایک‎ ‎رکنیت‎ ‎نہیں‎ ‎ہے۔ یہ‎ ‎کئی‎ ‎ہیں،‎ ‎ہر‎ ‎ایک‎ ‎فراہم‎ ‎کنندہ‎ ‎کے‎ ‎لیے‎ ‎جس‎ ‎کی‎ ‎پریمیم‎ ‎ٹیئر‎ ‎آپ‎ ‎ٹیسٹ‎ ‎کرنا‎ ‎چاہتے‎ ‎ہیں،‎ ‎جو‎ ‎کچھ‎ ‎بھی‎ ‎ہر‎ ‎فراہم‎ ‎کنندہ‎ ‎انفرادی‎ ‎طور‎ ‎پر‎ ‎چارج‎ ‎کرتا‎ ‎ہے۔ یہاں‎ ‎ادا‎ ‎کرنے‎ ‎والے‎ ‎صارفین‎ ‎کو‎ ‎یہی‎ ‎موازنہ‎ ‎ایک‎ ‎کلک‎ ‎میں‎ ‎ملتا‎ ‎ہے،‎ ‎پانچ‎ ‎الگ‎ ‎الگ‎ ‎پریمیم‎ ‎سبسکرپشنز‎ ‎برقرار‎ ‎رکھنے‎ ‎کی‎ ‎لاگت‎ ‎کے‎ ‎ایک‎ ‎حصے‎ ‎میں،‎ ‎بغیر‎ ‎اس‎ ‎چیز‎ ‎کو‎ ‎ترک‎ ‎کیے‎ ‎جو‎ ‎واقعی‎ ‎اہم‎ ‎ہے‎: ‎یہ‎ ‎دیکھنا‎ ‎کہ‎ ‎ماڈلز‎ ‎کہاں‎ ‎متفق‎ ‎ہیں،‎ ‎اور‎ ‎بالکل‎ ‎جاننا‎ ‎کہ‎ ‎وہ‎ ‎کب‎ ‎متفق‎ ‎نہیں‎ ‎ہیں۔

اکثر‎ ‎پوچھے‎ ‎جانے‎ ‎والے‎ ‎سوالات

‎1۔ کیا‎ ChatGPT ‎یا‎ Claude ‎ترجمے‎ ‎کے‎ ‎لیے‎ ‎بہتر‎ ‎ہے؟

کوئی‎ ‎بھی‎ ‎واضح‎ ‎طور‎ ‎پر‎ ‎بہتر‎ ‎نہیں‎ ‎ہے؛‎ ‎یہ‎ ‎ٹیسٹ‎ ‎کے‎ ‎زمرے‎ ‎پر‎ ‎منحصر‎ ‎ہے۔ کلاڈ‎ ‎سونیٹ‎ ‎اور‎ ‎کلاڈ‎ ‎اوپس‎ ‎نے‎ ‎مسلسل‎ ‎زیادہ‎ ‎درست‎ ‎ویتنامی‎ ‎طبی‎ ‎اصطلاح‎ ‎کا‎ ‎انتخاب‎ ‎کیا،‎ ‎اور‎ ‎کلاڈ‎ ‎اوپس‎ ‎نے‎ "That's sick" ‎کے‎ ‎لیے‎ ‎سب‎ ‎سے‎ ‎موزوں‎ ‎سلینگ‎ ‎تیار‎ ‎کیا۔ لیکن‎ Claude Sonnet ‎نے‎ ‎ایک‎ ‎رسمی‎ CEO-‎سیاق‎ ‎میں‎ ‎غیر‎ ‎رسمی‎ ‎جاپانی‎ ‎بھی‎ ‎تیار‎ ‎کیا،‎ ‎جہاں‎ GPT-5.5 ‎نے‎ ‎اسے‎ ‎صحیح‎ ‎طریقے‎ ‎سے‎ ‎سمجھا۔ براہ‎ ‎راست‎ ‎آؤٹ‎ ‎پٹ‎ ‎کا‎ ‎موازنہ‎ ‎کرنا‎ ‎ایک‎ ‎ماڈل‎ ‎کو‎ ‎منتخب‎ ‎کرنے‎ ‎اور‎ ‎اس‎ ‎پر‎ ‎اعتماد‎ ‎کرنے‎ ‎سے‎ ‎زیادہ‎ ‎قابل‎ ‎دفاع‎ ‎ہے۔

‎2. ‎2026 ‎میں‎ ‎سب‎ ‎سے‎ ‎درست‎ AI ‎ترجمہ‎ ‎ماڈل‎ ‎کون‎ ‎سا‎ ‎ہے؟

کوئی‎ ‎نہیں‎ ‎ہے؛‎ ‎درستگی‎ ‎ڈومین‎ ‎پر‎ ‎منحصر‎ ‎ہے۔ Gemini 3.5-Flash ‎اور‎ GLM-5-Turbo ‎نے‎ ‎اس‎ ‎ٹیسٹ‎ ‎میں‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎موزوں‎ ‎رسمی‎ ‎جاپانی‎ ‎پیدا‎ ‎کیے۔ دونوں‎ Claude ‎ماڈلز‎ ‎ویتنامی‎ ‎طبی‎ ‎اصطلاحات‎ ‎میں‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎درست‎ ‎تھے۔ DeepSeek V4-Pro ‎واحد‎ ‎ماڈل‎ ‎تھا‎ ‎جو‎ ‎صحیح‎ ‎جاپانی‎ ‎قانونی‎ ‎اصطلاح‎ ‎استعمال‎ ‎کرنے‎ ‎والا‎ ‎تھا،‎ ‎لیکن‎ ‎صرف‎ Round 2 ‎میں،‎ ‎اور‎ ‎یہ‎ ‎دوسری‎ ‎جگہوں‎ ‎پر‎ ‎غیر‎ ‎رسمی‎ ‎جاپانی‎ ‎پیدا‎ ‎کرتا‎ ‎تھا۔ کوئی‎ ‎بھی‎ ‎ایک‎ ‎ماڈل‎ ‎تمام‎ ‎آٹھ‎ ‎ٹیسٹوں‎ ‎میں‎ ‎غالب‎ ‎نہیں‎ ‎رہا۔

‎3. کیا‎ ‎زیادہ‎ AI ‎ماڈلز‎ ‎شامل‎ ‎کرنے‎ ‎سے‎ ‎ہمیشہ‎ ‎ترجمے‎ ‎کی‎ ‎درستگی‎ ‎میں‎ ‎بہتری‎ ‎آتی‎ ‎ہے؟

نہیں،‎ ‎خودکار‎ ‎طور‎ ‎پر‎ ‎نہیں۔ نئے‎ ‎پریمیم‎ ‎ٹیئر‎ ‎ماڈل‎ ‎کی‎ ‎اقسام‎ ‎کے‎ ‎ساتھ‎ ‎پول‎ ‎کو‎ ‎بڑھانے‎ ‎سے‎ ‎جاپانی‎ ‎رسمی‎ ‎الفاظ‎ ‎کے‎ ‎ٹیسٹ‎ ‎میں‎ ‎اتفاق‎ ‎رائے‎ ‎غیر‎ ‎رسمی‎ ‎سے‎ ‎رسمی‎ ‎میں‎ ‎منتقل‎ ‎ہو‎ ‎گیا۔ لیکن‎ ‎ویتنامی‎ ‎طبی‎ ‎اصطلاحات‎ ‎کے‎ ‎ٹیسٹ‎ ‎میں،‎ ‎یہ‎ ‎تقسیم‎ ‎تقریباً‎ 6 ‎سے‎ 4 ‎کے‎ ‎تناسب‎ ‎میں‎ ‎برقرار‎ ‎رہی‎ ‎قطع‎ ‎نظر‎ ‎اس‎ ‎سے‎ ‎کہ‎ ‎کون‎ ‎سے‎ ‎ماڈلز‎ ‎شامل‎ ‎کیے‎ ‎گئے‎ ‎تھے۔ زیادہ‎ ‎ماڈلز‎ ‎زیادہ‎ ‎اختلاف‎ ‎کو‎ ‎سطح‎ ‎پر‎ ‎لاتے‎ ‎ہیں،‎ ‎جو‎ ‎ایک‎ ‎مفید‎ ‎اشارہ‎ ‎ہے،‎ ‎لیکن‎ ‎اتفاق‎ ‎رائے‎ ‎ابھی‎ ‎بھی‎ ‎اکثریت‎ ‎کی‎ ‎پیروی‎ ‎کرتا‎ ‎ہے،‎ ‎اور‎ ‎اکثریت‎ ‎ہمیشہ‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎درست‎ ‎جواب‎ ‎نہیں‎ ‎ہوتی۔

‎4. SMART ‎کیا‎ ‎ہے‎ ‎اور‎ ‎یہ‎ ‎کیسے‎ ‎کام‎ ‎کرتا‎ ‎ہے؟

SMART MachineTranslation.com ‎کا‎ ‎ایک‎ ‎کثیر‎ ‎ماڈل‎ ‎اتفاق‎ ‎رائے‎ ‎کا‎ ‎نظام‎ ‎ہے،‎ ‎جو‎ OpenAI‏،‎ Anthropic‏،‎ Google،‎ ‎اور‎ DeepSeek ‎سمیت‎ ‎فراہم‎ ‎کنندگان‎ ‎کے‎ ‎ذریعے‎ 22 ‎تک‎ AI ‎ماڈلز‎ ‎پر‎ ‎پھیلا‎ ‎ہوا‎ ‎ہے۔ یہ‎ ‎ایک‎ ‎ترجمہ‎ ‎کو‎ ‎بیک‎ ‎وقت‎ ‎متعدد‎ ‎ماڈلز‎ ‎کے‎ ‎ذریعے‎ ‎چلاتا‎ ‎ہے‎ ‎اور‎ ‎اکثریت‎ ‎کی‎ ‎بنیاد‎ ‎پر‎ ‎اتفاق‎ ‎رائے‎ ‎کی‎ ‎پیداوار‎ ‎کو‎ ‎ہر‎ ‎انفرادی‎ ‎ماڈل‎ ‎کے‎ ‎جواب‎ ‎کے‎ ‎ساتھ‎ ‎ظاہر‎ ‎کرتا‎ ‎ہے،‎ ‎ڈیفالٹ‎ ‎کے‎ ‎لحاظ‎ ‎سے،‎ ‎کسی‎ ‎ترتیب‎ ‎کی‎ ‎ضرورت‎ ‎نہیں۔ اتفاق‎ ‎رائے‎ ‎میں‎ ‎تبدیلی‎ ‎آتی‎ ‎ہے‎ ‎جب‎ ‎ماڈل‎ ‎کا‎ ‎ذخیرہ‎ ‎بدل‎ ‎جاتا‎ ‎ہے،‎ ‎جیسا‎ ‎کہ‎ ‎اس‎ ‎ٹیسٹ‎ ‎کے‎ ‎جاپانی‎ ‎رسمیت‎ ‎کے‎ ‎نتیجے‎ ‎میں‎ ‎دکھایا‎ ‎گیا‎ ‎ہے‎: ‎دور‎ 1 ‎میں‎ ‎غیر‎ ‎رسمی‎ ‎اتفاق‎ ‎رائے‎ ‎دور‎ 2 ‎میں‎ ‎رسمی‎ ‎بن‎ ‎گیا۔

‎5. کون‎ ‎سا‎ AI ‎ماڈل‎ ‎طبی‎ ‎یا‎ ‎قانونی‎ ‎ترجمے‎ ‎کے‎ ‎لیے‎ ‎بہترین‎ ‎ہے؟

کوئی‎ ‎ایک‎ ‎ماڈل‎ ‎نہیں؛‎ ‎انسانی‎ ‎جائزہ‎ ‎بہتر‎ ‎جواب‎ ‎ہے۔ کلاڈ‎ ‎ماڈلز‎ ‎نے‎ ‎مسلسل‎ ‎زیادہ‎ ‎درست‎ ‎ویتنامی‎ ‎طبی‎ ‎اصطلاح‎ ‎کا‎ ‎انتخاب‎ ‎کیا،‎ ‎اور‎ ‎صرف‎ ‎ڈیپ‎ ‎سیک‎ V4-Pro ‎نے‎ ‎صحیح‎ ‎جاپانی‎ ‎قانونی‎ ‎اصطلاح‎ ‎استعمال‎ ‎کی،‎ ‎لیکن‎ ‎صرف‎ ‎دوسری‎ ‎دور‎ ‎میں۔ طبی‎ ‎اصطلاحات‎ ‎کی‎ ‎تقسیم‎ 10 ‎ماڈلز‎ ‎میں‎ ‎کبھی‎ ‎حل‎ ‎نہیں‎ ‎ہوئی،‎ ‎جو‎ ‎یہ‎ ‎ظاہر‎ ‎کرتا‎ ‎ہے‎ ‎کہ‎ ‎ڈومین‎ ‎کی‎ ‎مہارت‎ ‎درکار‎ ‎ہے،‎ ‎نہ‎ ‎کہ‎ ‎ایک‎ ‎مختلف‎ ‎ماڈل‎ ‎منتخب‎ ‎کیا‎ ‎جائے۔ Tomedes ‎کی‎ ‎پیشکش‎ ‎کی‎ ‎طرح ایک‎ ‎تصدیق‎ ‎شدہ‎ ‎انسانی‎ ‎پوسٹ‎ ‎ایڈیٹنگ‎ ‎جائزہ،‎ ‎وہ‎ ‎ماہرانہ‎ ‎جانچ‎ ‎فراہم‎ ‎کرتا‎ ‎ہے۔