June 5, 2026

وہی اے آئی، مختلف ماڈل — اور ترجمے اس سے زیادہ مختلف نہیں ہو سکتے

میں‎ ‎ایک‎ ‎ایسی‎ ‎چیز‎ ‎پر‎ ‎اندرونی‎ ‎جانچ‎ ‎کر‎ ‎رہا‎ ‎ہوں‎ ‎جس‎ ‎کے‎ ‎بارے‎ ‎میں‎ ‎ہم‎ ‎ترجمہ‎ ‎کی‎ ‎صنعت‎ ‎میں‎ ‎کافی‎ ‎بات‎ ‎نہیں‎ ‎کرتے‎: ‎یہ‎ ‎نہیں‎ ‎کہ‎ ‎مختلف‎ AI ‎سسٹم‎ ‎مختلف‎ ‎ترجمہ‎ ‎کرتے‎ ‎ہیں،‎ ‎بلکہ‎ ‎یہ‎ ‎کہ‎ ‎ایک‎ ‎ہی‎ AI ‎کے‎ ‎مختلف‎ ‎ورژن‎ ‎مختلف‎ ‎ترجمہ‎ ‎کرتے‎ ‎ہیں‎ — ‎اور‎ ‎کس‎ ‎حد‎ ‎تک۔

گزشتہ‎ ‎ہفتے‎ ‎میں‎ ‎نے‎ MachineTranslation.com ‎کے‎ ‎اندرونی‎ ‎جانچ‎ ‎کے‎ ‎پلیٹ‎ ‎فارم‎ ‎پر‎ ‎بیک‎ ‎وقت‎ ChatGPT ‎کے‎ ‎پانچ‎ ‎ورژن‎ ‎کے‎ ‎ذریعے‎ ‎ایک‎ ‎ہسپانوی‎ ‎محاورے‎ ‎کی‎ ‎جانچ‎ ‎کی۔ جو‎ ‎نتیجہ‎ ‎سامنے‎ ‎آیا‎ ‎اس‎ ‎نے‎ ‎مجھے‎ ‎حیران‎ ‎کر‎ ‎دیا۔

دو‎ ‎ورژن‎ ‎نے‎ ‎ایک‎ ‎ایسا‎ ‎ترجمہ‎ ‎تیار‎ ‎کیا‎ ‎جو،‎ ‎سچ‎ ‎پوچھیں‎ ‎تو،‎ ‎انگریزی‎ ‎میں‎ ‎بے‎ ‎معنی‎ ‎تھا۔ تین‎ ‎ورژنوں‎ ‎نے‎ ‎درست‎ ‎محاوراتی‎ ‎ترجمے‎ ‎تیار‎ ‎کیے۔ اور‎ ‎وہ‎ ‎تین‎ ‎درست‎ ‎جوابات‎ ‎آپس‎ ‎میں‎ ‎متفق‎ ‎نہیں‎ ‎ تھے۔‎ ‎یہ‎ ‎سب‎ ‎پانچوں‎ ‎چیٹ‎ ‎جی‎ ‎پی‎ ‎ٹی‎ ‎

ہیں۔ تمام‎ ‎پانچ‎ ‎اوپن‎ ‎اے‎ ‎آئی‎ ‎ہیں۔ وہی‎ ‎اے‎ ‎آئی،‎ ‎مختلف‎ ‎ماڈل‎ —‎ اور‎ ‎آؤٹ‎ ‎پٹس‎ ‎اس‎ ‎سے‎ ‎زیادہ‎ ‎مختلف‎ ‎نہیں‎ ‎ہو‎ ‎سکتیں۔

میں‎ ‎اسے‎ ‎اب‎ ‎اس‎ ‎لیے‎ ‎شیئر‎ ‎کر‎ ‎رہا‎ ‎ہوں‎ ‎کیونکہ‎ ‎مجھے‎ ‎لگتا‎ ‎ہے‎ ‎کہ‎ ‎یہ‎ ‎اہم‎ ‎ہے،‎ ‎اس‎ ‎لیے‎ ‎نہیں‎ ‎کہ‎ ‎میرے‎ ‎پاس صاف‎ ‎جوابات‎ ‎ہیں۔ میں‎ ‎نہیں‎ ‎کرتا۔ لیکن‎ ‎یہ‎ ‎مشاہدہ‎ ‎دنیا‎ ‎میں‎ ‎لانے‎ ‎کے‎ ‎لیے‎ ‎کافی‎ ‎دلچسپ‎ ‎ہے فہرست‎ ‎کا‎ ‎عنوان

  • ٹیسٹ‎: ایک‎ ‎ہسپانوی‎ ‎محاورہ،‎ ‎پانچ‎ ‎جی‎ ‎پی‎ ‎ٹی‎ ‎ورژن‎ ‎یہ‎ ‎محاورہ‎ ‎ایک‎ ‎اچھا‎ ‎ٹیسٹ‎ ‎کیس‎ ‎کیوں‎ ‎ہے‎ ‎لفظی‎ ‎سے‎ ‎محاوراتی‎ ‎ترجمہ‎ ‎ہمیں‎ ‎ان‎ ‎ماڈلز‎ ‎کی‎ ‎تربیت‎ ‎کے‎ ‎بارے‎ ‎میں‎ ‎کیا‎ ‎بتاتا‎ ‎ہے‎ ‎اس‎ ‎کا‎ ‎مطلب‎ ‎یہ‎ ‎ہے‎ ‎کہ‎ ‎کوئی‎ ‎بھی‎ ‎بات‎ ‎نہیں‎ ‎کر‎ ‎رہا‎ ‎ہے‎ ‎یہاں‎ ‎تک‎ ‎
  • کہ‎ ‎درست‎ ‎ترجمے‎ ‎بھی‎ ‎ایک‎ ‎دوسرے‎ ‎سے‎ ‎متفق‎ ‎نہیں‎ ‎تھے‎ ‎میں‎ ‎ابھی‎ ‎تک‎ ‎کیا‎ ‎نہیں‎ ‎جانتا‎ ‎دو‎ ‎تحقیقی‎ ‎سوالات‎ ‎
  • جن‎ ‎پر‎ ‎غور‎ ‎کرنا‎ ‎ چاہیے‎ ‎ٹیسٹ‎:‎

ایک‎ ‎ہسپانوی‎ ‎محاورہ،‎ ‎پانچ‎ ‎جی‎ ‎پی‎ ‎ٹی‎ ‎ورژن‎ ‎

جس‎ ‎جملے‎ ‎کا‎ ‎میں‎ ‎نے‎ ‎تجربہ‎ ‎کیا‎ ‎وہ‎ ‎تھا‎ ‏llevarse el gato al agua‎.‎


یہاں‎ ‎وہ‎ ‎ہے‎ ‎جو‎ ‎ہر‎ ‎ورژن‎ ‎نے‎ ‎تیار‎ ‎کیا‎:‎

ماڈل ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎  آؤٹ‎ ‎پٹ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎   محاوراتی؟
چیٹ‎ ‎جی‎ ‎پی‎ ‎ٹی‎:: ‎جی‎ ‎پی‎ ‎ٹی‎-4o-MINI بلی‎ ‎کو‎ ‎پانی‎ ‎میں‎ ‎لے‎ ‎جانا ‎❌ ‎لفظی
چیٹ‎ ‎جی‎ ‎پی‎ ‎ٹی‎:: ‎جی‎ ‎پی‎ ‎ٹی‎-4.1-NANO بلی‎ ‎کو‎ ‎پانی‎ ‎میں‎ ‎لے‎ ‎جانا ‎❌ ‎لفظی
چیٹ‎ ‎جی‎ ‎پی‎ ‎ٹی‎:: ‎جی‎ ‎پی‎ ‎ٹی‎-4.1-MINI کامیابی‎ ‎سے‎ ‎انجام‎ ‎دینا ‎✅ ‎درست
چیٹ‎ ‎جی‎ ‎پی‎ ‎ٹی‎:: ‎جی‎ ‎پی‎ ‎ٹی‎-5.4-MINI اپنا‎ ‎راستہ‎ ‎نکالنا ‎✅ ‎جزوی
چیٹ‎ ‎جی‎ ‎پی‎ ‎ٹی‎:: ‎جی‎ ‎پی‎ ‎ٹی‎-5.4 سب‎ ‎سے‎ ‎اوپر‎ ‎آنا ‎✅ ‎درست

اس‎ ‎جملے‎ ‎کا‎ ‎مطلب‎ ‎ہے‎ ‎کہ‎ ‎مشکلات‎ ‎کے‎ ‎خلاف‎ ‎کچھ‎ ‎حاصل‎ ‎کرنا، ایک‎ ‎مشکل‎ ‎فتح‎ ‎حاصل‎ ‎کرنا۔ اس‎ ‎کا‎ ‎بلیوں‎ ‎یا‎ ‎پانی‎ ‎سے‎ ‎کوئی‎ ‎تعلق‎ ‎نہیں‎ ‎ہے۔ لفظی‎ ‎ترجمہ‎ ‎ترجمہ‎ ‎نہیں‎ ‎ہوتا۔ یہ‎ ‎ایک‎ ‎لفظ‎ ‎بہ‎ ‎لفظ ‎ ‎ٹرانسکرپشن‎ ‎ہے‎ ‎ایک‎ ‎جملے‎ ‎کی‎ ‎جسے‎ ‎ماڈل‎ ‎محاورے‎ ‎کے‎ ‎طور‎ ‎پر‎ ‎پہچاننے‎ ‎میں‎ ‎ناکام‎ ‎رہا۔

GPT-4o-MINI ‎اور‎ GPT-4.1-NANO ‎نے‎ ‎ایک‎ ‎جیسے‎ ‎آؤٹ‎ ‎پٹ‎ ‎تیار‎ ‎کیے۔ مشابہ‎ ‎نہیں،‎ ‎یکساں۔ ہمارے‎ ‎ترجمہ‎ ‎کے‎ ‎بصیرت‎ ‎نے‎ ‎اسے‎ ‎براہ‎ ‎راست‎ ‎پرچم‎ ‎زدہ‎ ‎کیا‎: GPT-4.1-nano اور‎ GPT-4o-mini ‎نے‎ ‎لفظی ‎ ‎ترجمے‎ ‎پر‎ ‎زور‎ ‎دیتے‎ ‎ہوئے،‎ ‎محاوراتی‎ ‎معنی‎ ‎کے‎ ‎بجائے،‎ ‎ایک‎ ‎جیسے‎ ‎ترجمے‎ ‎فراہم‎ ‎کیے۔

GPT-4.1-MINI‏،‎ GPT-5.4-MINI،‎ ‎اور‎ GPT-5.4 ‎نے‎ ‎ہر‎ ‎ایک‎ ‎کچھ‎ ‎ایسا‎ ‎پیدا‎ ‎کیا‎ ‎جو‎ ‎پہچانا‎ ‎جا‎ ‎سکتا‎ ‎تھا‎ ‎کہ‎ ‎درست‎ ‎ہے‎ — ‎لیکن‎ ‎ایک‎ ‎دوسرے‎ ‎سے‎ ‎مختلف‎ ‎تھا۔

یہ‎ ‎محاورہ‎ ‎ایک‎ ‎اچھا‎ ‎ٹیسٹ‎ ‎کیس‎ ‎کیوں‎ ‎ہے

میں‎ ‎اس‎ ‎بارے‎ ‎میں‎ ‎درست‎ ‎ہونا‎ ‎چاہتا‎ ‎ہوں‎ ‎کہ‎ ‏llevarse el gato al agua‎ ‎ایک‎ ‎منتخب‎ ‎شدہ‎ ‎کے‎ ‎بجائے‎ ‎ایک‎ ‎مفید ‎ ‎ٹیسٹ‎ ‎ان‎ ‎پٹ‎ ‎کیوں‎ ‎ہے۔

یہ‎ ‎ایک‎ ‎اچھی‎ ‎طرح‎ ‎سے‎ ‎قائم‎ ‎شدہ‎ ‎محاورہ‎ ‎ہے۔ یہ‎ ‎ادب،‎ ‎صحافت، ‎ ‎اور‎ ‎روزمرہ‎ ‎کی‎ ‎تقریر‎ ‎میں‎ ‎ظاہر‎ ‎ہوتا‎ ‎ہے۔ یہ‎ ‎مبہم‎ ‎نہیں‎ ‎ہے۔ اسپینی‎ ‎زبان‎ ‎کے‎ ‎کسی‎ ‎بھی‎ ‎معقول‎ ‎متن‎ ‎کے‎ ‎ذخیرے‎ ‎پر‎ ‎تربیت‎ ‎یافتہ‎ ‎کسی‎ ‎بھی‎ ‎ماڈل‎ ‎کو‎ ‎اس‎ ‎کا‎ ‎سامنا‎ ‎کرنا‎ ‎پڑا‎ ‎ ہوگا۔ سوال‎ ‎یہ‎ ‎نہیں‎ ‎ہے‎ ‎کہ‎ ‎ماڈل‎ ‎نے‎ ‎یہ‎ ‎جملہ‎ ‎دیکھا‎ ‎ہے‎ ‎یا‎ ‎نہیں۔ سوال‎ ‎یہ‎ ‎ہے‎ ‎کہ‎ ‎وہ‎ ‎اس‎ ‎کے‎ ‎ساتھ‎ ‎کیا‎ ‎کرتا‎ ‎ہے۔‎ ‎محاورے‎ ‎کے‎ ‎ترجمے‎ ‎میں‎ ‎سب‎ ‎سے‎ ‎ بدتر‎ ‎ناکامی‎ ‎ایک‎ ‎برا‎ ‎ترجمہ‎ ‎پیش‎ ‎کرنا‎ ‎نہیں‎ ‎

ہے۔ یہ‎ ‎ایک‎ ‎لفظی‎ ‎ترجمہ‎ ‎تیار‎ ‎کر‎ ‎رہا‎ ‎ہے‎ ‎جو‎ ‎کہ‎ ‎اس‎ ‎شخص‎ ‎کے‎ ‎لیے‎ ‎قابل‎ ‎قبول‎ ‎لگتا‎ ‎ہے‎ ‎جو‎ ‎ہدف‎ ‎زبان‎ ‎نہیں‎ ‎جانتا۔‎ To carry the cat to the water ‎گرامر‎ ‎کے‎ ‎لحاظ‎ ‎سے‎ ‎درست‎ ‎انگریزی‎ ‎ہے۔

یہ‎ ‎درست‎ ‎ہے۔ یہ‎ ‎کچھ‎ ‎ایسا‎ ‎لگتا‎ ‎ہے‎ ‎جس‎ ‎کا‎ ‎کوئی‎ ‎مطلب‎ ‎ہو‎ ‎سکتا‎ ‎ہے۔‎ ‎ ‎ ‎ایک‎ ‎صارف‎ ‎جو‎ ‎ہسپانوی‎ ‎نہیں‎ ‎بولتا‎ ‎ہے‎ ‎وہ‎ ‎اسے‎ ‎پڑھ‎ ‎سکتا‎ ‎ہے،‎ ‎سر‎ ‎ہلا‎ ‎سکتا‎ ‎ہے،‎ ‎اور‎ ‎آگے‎ ‎بڑھ‎ ‎سکتا‎ ‎ہے‎ — ‎ ‎ ‎کبھی‎ ‎یہ‎ ‎جانے‎ ‎بغیر‎ ‎کہ‎ ‎اصل‎ ‎معنی‎ ‎مکمل‎ ‎طور‎ ‎پر‎ ‎کھو‎ ‎گیا‎ ‎تھا۔‎ ‎

‎ ‎یہ‎ ‎وہ‎ ‎ناکامی‎ ‎کا‎ ‎موڈ‎ ‎ہے‎ ‎جس‎ ‎کی‎ ‎مجھے‎ ‎پرواہ‎ ‎ہے۔ واضح‎ ‎غلطی‎ ‎نہیں۔ وہ‎ ‎پوشیدہ‎ ‎ایک۔

یہ‎ ‎جو‎ ‎لفظی‎ ‎سے‎ ‎محاوراتی‎ ‎تقسیم‎ ‎ہمیں‎ ‎ان‎ ‎ماڈلز‎ ‎کی‎ ‎تربیت‎ ‎کے‎ ‎بارے‎ ‎میں‎ ‎بتاتی‎ ‎ہے

یہ‎ ‎نمونہ‎ ‎بے‎ ‎ترتیب‎ ‎نہیں‎ ‎ہے۔ دو‎ ‎ماڈلز‎ ‎جنہوں‎ ‎نے‎ ‎لفظی‎ ‎ترجمہ‎ ‎کیا‎ (GPT-4o-MINI ‎اور‎ GPT-4.1-NANO) ‎دونوں‎ ‎چھوٹے،‎ ‎ہلکے‎ ‎ماڈلز‎ ‎ہیں‎ ‎جو‎ ‎رفتار‎ ‎اور‎ ‎لاگت‎ ‎کی‎ ‎کارکردگی‎ ‎کے‎ ‎لیے‎ ‎بہتر‎ ‎بنائے‎ ‎گئے‎ ‎ ہیں۔ تین‎ ‎ماڈلز‎ ‎جو‎ ‎محاوراتی‎ ‎ترجمے‎ ‎تیار‎ ‎کرتے‎ ‎ہیں‎ (GPT-4.1-MINI‏،‎ GPT-5.4-MINI‏،‎ GPT-5.4) ‎ایک‎ ‎مختلف‎ ‎نسل‎ ‎یا‎ ‎پیرامیٹر‎ ‎اسکیل‎ ‎کی‎ ‎نمائندگی‎ ‎کرتے‎ ‎ہیں۔‎ ‎یہ‎ ‎کچھ‎ ‎ایسا‎ ‎تجویز‎ ‎کرتا‎ ‎ہے‎ ‎جو‎ ‎میرے‎ ‎خیال‎ ‎میں‎ ‎کم‎ ‎دریافت‎ ‎کیا‎ ‎گیا‎ ‎ہے‎: ‎ترجمے‎ ‎میں‎ ‎محاوراتی‎ ‎اہلیت‎ ‎ماڈل‎ ‎کی‎ ‎صلاحیت‎ ‎کے‎ ‎ساتھ‎ ‎اس‎ ‎طرح‎ ‎بڑھتی‎ ‎ہے‎ ‎جو‎ ‎عام‎ ‎بینچ‎ ‎مارکس‎ ‎میں‎ ‎نظر‎ ‎نہیں‎ ‎آتی۔‎ ‎عام‎ ‎زبان‎ ‎کے‎ ‎بینچ‎ ‎مارکس‎ ‎میں‎ ‎ استدلال،‎ ‎علم،‎ ‎کوڈنگ،‎ ‎ریاضی‎ ‎کا‎ ‎تجربہ‎ ‎کیا‎ ‎جاتا‎ ‎ ہے۔

وہ‎ ‎عام‎ ‎طور‎ ‎پر‎ ‎یہ‎ ‎تجربہ‎ ‎نہیں‎ ‎کرتے‎ ‎کہ‎ ‎آیا‎ ‎کوئی‎ ‎ماڈل‎ ‎یہ‎ ‎شناخت‎ ‎کر‎ ‎سکتا‎ ‎ہے ‎ ‎کہ‎ ‎بارش‎ ‎بلیوں‎ ‎اور‎ ‎کتوں‎ ‎کی‎ ‎ہو‎ ‎رہی‎ ‎ہے‎ ‎موسم‎ ‎کی‎ ‎صورتحال‎ ‎کے‎ ‎بارے‎ ‎میں‎ ‎نہیں‎ ‎ہے، ‎ ‎یا‎ ‎یہ‎ ‎کہ‎ ‏llevarse el gato al agua‎ ‎بلی‎ ‎کو‎ ‎پانی‎ ‎پلانے‎ ‎کے‎ ‎بارے‎ ‎میں‎ ‎نہیں‎ ‎ہے۔ ‎ ‎محاورے‎ ‎ثقافتی‎ ‎علم،‎ ‎سیاق‎ ‎و‎ ‎سباق ‎ ‎کے‎ ‎استدلال،‎ ‎اور‎ ‎نمونہ‎ ‎کی‎ ‎شناخت‎ ‎کے‎ ‎سنگم‎ ‎پر‎ ‎بیٹھے‎ ‎ہیں‎ — ‎اور‎ ‎وہ‎ ‎سنگم‎ ‎ماڈل‎ ‎کی‎ ‎صلاحیت‎ ‎کی‎ ‎ایک‎ ‎حد‎ ‎کا‎ ‎تقاضا‎ ‎کرتا‎ ‎ہے‎ ‎جو‎ ‎چھوٹے‎ ‎ماڈل‎ ‎مستقل‎ ‎طور‎ ‎پر‎ ‎عبور‎ ‎نہیں‎ ‎کرتے۔

‎ ‎میں‎ ‎جو‎ ‎دعویٰ‎ ‎نہیں‎ ‎کر‎ ‎رہا‎ ‎ہوں‎: ‎یہ‎ ‎کہ‎ ‎بڑے‎ ‎ماڈل‎ ‎ہمیشہ‎ ‎بہتر ‎ ‎مترجم‎ ‎ہوتے‎ ‎ہیں۔ میرے‎ ‎پاس‎ ‎اس‎ ‎کے‎ ‎لیے‎ ‎عام‎ ‎اصول‎ ‎کے‎ ‎طور‎ ‎پر‎ ‎کوئی‎ ‎ثبوت‎ ‎نہیں‎ ‎ہے۔ ‎ ‎میں‎ ‎کیا‎ ‎دیکھ‎ ‎رہا‎ ‎ہوں‎: ‎کہ‎ ‎خاص‎ ‎طور‎ ‎پر‎ ‎محاوراتی‎ ‎مواد‎ ‎کے‎ ‎لیے، ‎ ‎خاندان‎ ‎کے‎ ‎اندر‎ ‎کا‎ ‎ورژن‎ ‎کا‎ ‎فرق‎ ‎میری‎ ‎توقع‎ ‎سے‎ ‎زیادہ‎ ‎تھا۔

‎ ‎اس‎ ‎کا‎ ‎مطلب‎ ‎یہ‎ ‎ہے‎ ‎کہ‎ ‎کوئی‎ ‎بھی‎ ‎بات‎ ‎نہیں‎ ‎کر‎ ‎رہا‎ ‎ہے

‎ ‎زیادہ‎ ‎تر‎ ‎صارفین‎ ‎جو‎ AI ‎ترجمہ‎ ‎کا‎ ‎آلہ‎ ‎استعمال‎ ‎کرتے‎ ‎ہیں‎ ‎وہ‎ ‎نہیں‎ ‎جانتے‎ ‎کہ‎ ‎وہ‎ ‎اس‎ AI ‎کا‎ ‎کون‎ ‎سا‎ ‎ورژن‎ ‎استعمال‎ ‎کر‎ ‎رہے‎ ‎ہیں۔ وہ‎ ‎ایک‎ ‎پروڈکٹ‎ ‎کھولتے‎ ‎ہیں،‎ ‎ایک‎ ‎زبان‎ ‎کا‎ ‎جوڑا‎ ‎منتخب‎ ‎کرتے‎ ‎ہیں،‎ ‎اور‎ ‎ایک‎ ‎آؤٹ‎ ‎پٹ‎ ‎حاصل‎ ‎کرتے‎ ‎ ہیں۔ ماڈل‎ ‎روٹنگ‎ ‎ان‎ ‎کے‎ ‎لیے‎ ‎پوشیدہ‎ ‎ہے۔

‎ ‎یہ‎ ‎بڑے‎ ‎پیمانے‎ ‎پر‎ ‎اہم‎ ‎ہے۔ MachineTranslation.com ‎نے‎ ‎صرف‎ 90 ‎دن‎ ‎کی‎ ‎مدت‎ ‎میں‎ ‎انگریزی‎ ‎سے‎ ‎ہسپانوی‎ ‎ترجمے‎ ‎کے‎ ‎لاکھوں‎ ‎سے‎ ‎زیادہ‎ ‎کاموں‎ ‎پر‎ ‎عملدرآمد‎ ‎کیا۔ اگر‎ ‎ان‎ ‎میں‎ ‎سے‎ ‎ایک‎ ‎اہم‎ ‎حصہ‎ ‎ان‎ ‎ملازمتوں‎ ‎نے‎ ‎محاوراتی‎ ‎مواد‎ (‎مارکیٹنگ‎ ‎کاپی،‎ ‎قانونی‎ ‎زبان،‎ ‎ادبی‎ ‎متن،‎ ‎عام‎ ‎بات‎ ‎چیت‎) ‎کو‎ ‎چھوا‎ ‎اور‎ ‎وہ‎ ‎ٹول‎ ‎جو‎ ‎ان‎ ‎ملازمتوں‎ ‎کو‎ ‎روٹ‎ ‎کر‎ ‎رہا‎ ‎تھا‎ ‎وہ‎ ‎صارفین‎ ‎کو‎ ‎ان‎ ‎کی‎ ‎لاعلمی‎ ‎میں‎ ‎ایک‎ ‎چھوٹے‎ ‎ماڈل‎ ‎کی‎ ‎طرف‎ ‎بھیج‎ ‎رہا‎ ‎تھا،‎ ‎تو‎ ‎بلی‎ ‎کو‎ ‎پانی‎ ‎تک‎ ‎لے‎ ‎جانا‎ ‎حقیقی‎ ‎آؤٹ‎ ‎پٹس‎ ‎میں،‎ ‎حقیقی‎ ‎دستاویزات‎ ‎میں،‎ ‎حقیقی‎ ‎لوگوں‎ ‎کے‎ ‎لیے‎ ‎جو‎ ‎نتائج‎ ‎پر‎ ‎بھروسہ‎ ‎کرتے‎ ‎تھے،‎ ‎ظاہر‎ ‎ہو‎ ‎رہا‎ ‎تھا۔‎ ‎ترجمہ‎ ‎کی‎ ‎صنعت‎ ‎نے‎ ‎برسوں‎ ‎سے‎ AI ‎فراہم‎ ‎کنندگان‎ ‎کا‎ ‎موازنہ‎ ‎کیا‎ ‎ہے۔‎ ‎ڈیپ‎ ‎ایل‎ ‎بمقابلہ‎ ‎ گوگل۔

کلاڈ‎ ‎بمقابلہ‎ ‎چیٹ‎ ‎جی‎ ‎پی‎ ‎ٹی۔ وہ‎ ‎موازنے‎ ‎مفید‎ ‎ہیں۔ لیکن‎ ‎ایک‎ ‎ہی‎ ‎فراہم‎ ‎کنندہ‎ ‎کے‎ ‎اندر،‎ ‎ورژن‎ ‎کا‎ ‎فرق‎ ‎اتنا‎ ‎ہی‎ ‎اہم‎ ‎ہو‎ ‎سکتا‎ ‎ہے‎ — ‎اور‎ ‎یہ‎ ‎ایک‎ ‎ایسا‎ ‎فرق‎ ‎ہے‎ ‎جسے‎ ‎زیادہ‎ ‎تر‎ ‎موازنہ‎ ‎کے‎ ‎فریم‎ ‎ورک‎ ‎نہیں‎ ‎ناپتے‎ ‎کیونکہ‎ ‎وہ‎ ‎ماڈل‎-‎ورژن‎ ‎کی‎ ‎سطح‎ ‎پر‎ ‎جانچ‎ ‎نہیں‎ ‎کرتے۔‎ ‎جب‎ ‎کوئی‎ ‎کہتا‎ ‎ہے‎ ‎میں‎ ‎ترجمے‎ ‎کے‎ ‎لیے‎ ‎چیٹ‎ ‎جی‎ ‎پی‎ ‎ٹی‎ ‎استعمال‎ ‎کرتا‎ ‎ہوں،‎ ‎تو‎ ‎یہ‎ ‎جملہ‎ ‎بامعنی‎ ‎ہونے‎ ‎کے‎ ‎لیے‎ ‎کافی‎ ‎مخصوص‎ ‎نہیں‎ ‎ ہے۔

کون‎ ‎سا‎ ‎چیٹ‎ ‎جی‎ ‎پی‎ ‎ٹی؟ نینو؟ ‎4o-‎منی؟ ‎4.1-‎منی؟ 5.4? جواب‎ ‎ایسے‎ ‎طریقوں‎ ‎سے‎ ‎آؤٹ‎ ‎پٹ‎ ‎کو‎ ‎تبدیل‎ ‎کرتا‎ ‎ہے‎ ‎ ‎ ‎جو‎ ‎غیر‎ ‎معمولی‎ ‎ہیں،‎ ‎کم‎ ‎از‎ ‎کم‎ ‎محاوراتی‎ ‎مواد‎ ‎کے‎ ‎لیے۔

‎ ‎یہاں‎ ‎تک‎ ‎کہ‎ ‎درست‎ ‎ترجمے‎ ‎بھی‎ ‎ایک‎ ‎دوسرے‎ ‎سے‎ ‎متفق‎ ‎نہیں‎ ‎تھے

‎ ‎یہ‎ ‎وہ‎ ‎حصہ‎ ‎ہے‎ ‎جو‎ ‎مجھے‎ ‎سب‎ ‎سے‎ ‎زیادہ‎ ‎دلچسپ‎ ‎لگتا‎ ‎ہے،‎ ‎اور‎ ‎میں‎ ‎نے‎ ‎ابھی‎ ‎تک‎ ‎اس‎ ‎کے‎ ‎بارے‎ ‎میں‎ ‎پوری‎ ‎طرح‎ ‎سے‎ ‎کچھ‎ ‎نہیں‎ ‎سمجھا‎ ‎ہے۔

‎ ‎تین‎ ‎ماڈلز‎ ‎جنہوں‎ ‎نے‎ ‎محاوراتی‎ ‎ترجمے‎ ‎تیار‎ ‎کیے،‎ ‎تین‎ ‎مختلف‎ ‎ترجمے‎ ‎دیے‎:‏

  • GPT-4.1-MINI: to pull it off successfully
  • GPT-5.4-MINI: to get one's way
  • GPT-5.4: to come out on top
  • ‎ ‎تینوں‎ ‎ہی‎ ‏llevarse el gato al agua‎ ‎کی‎ ‎قابل‎ ‎دفاع‎ ‎انگریزی‎ ‎ترجمانی‎ ‎ہیں۔ لیکن‎ ‎وہ‎ ‎برابر‎ ‎نہیں‎ ‎ہیں۔

    ‎ ‎اسے‎ ‎انجام‎ ‎دینے‎ ‎کے‎ ‎لیے‎ ‎مشکل‎ ‎کے‎ ‎مقابلے‎ ‎میں‎ ‎عمل‎ ‎درآمد‎ ‎پر‎ ‎زور‎ ‎دیتا‎ ‎ہے،‎ ‎آپ‎ ‎نے کچھ‎ ‎مشکل‎ ‎کیا‎ ‎اور‎ ‎یہ‎ ‎کام‎ ‎کر‎ ‎گیا۔ ‎ ‎اپنی‎ ‎مرضی‎ ‎کروانا‎ ‎اس‎ ‎بات‎ ‎پر‎ ‎زور‎ ‎دیتا‎ ‎ہے‎ ‎کہ‎ ‎آپ‎ ‎جو‎ ‎نتیجہ‎ ‎چاہتے‎ ‎تھے‎ ‎وہ‎ ‎حاصل‎ ‎ہو‎ ‎گیا،‎ ‎اس‎ ‎میں ‎ ‎مشکل‎ ‎پر‎ ‎کم‎ ‎زور‎ ‎دیا‎ ‎جاتا‎ ‎ہے۔ سبقت‎ ‎لے‎ ‎جانا‎ ‎مقابلہ‎ ‎میں‎ ‎فتح،‎ ‎دوسروں‎ ‎کے‎ ‎مقابلے‎ ‎میں‎ ‎جیتنا،‎ ‎پر‎ ‎زور‎ ‎دیتا‎ ‎ہے۔

    ‎ ‎اصل‎ ‎ہسپانوی‎ ‎محاورہ‎ ‎ان‎ ‎میں‎ ‎سے‎ ‎پہلے‎ ‎کے‎ ‎سب‎ ‎سے‎ ‎قریب‎ ‎ہے۔ ‎ ‎اس‎ ‎فقرے‎ ‎میں‎ ‎مزاحمت‎ ‎پر‎ ‎قابو‎ ‎پانے‎ ‎کا‎ ‎مفہوم‎ ‎ہے،‎ ‎نہ‎ ‎کہ ‎ ‎صرف‎ ‎ایک‎ ‎نتیجے‎ ‎کو‎ ‎ترجیح‎ ‎دینا‎ ‎اور‎ ‎اسے‎ ‎حقیقت‎ ‎بنانا۔ لیکن ‎ ‎اپنی‎ ‎بات‎ ‎منوانا‎ ‎اور‎ ‎‎ ‎سبقت‎ ‎لے‎ ‎جانا‎ ‎غلط‎ ‎نہیں‎ ‎ہیں،‎ ‎وہ‎ ‎صرف‎ ‎مختلف‎ ‎سمتوں‎ ‎میں‎ ‎غیر‎ ‎واضح‎ ‎ہیں۔

    ‎ ‎اس‎ ‎سے‎ ‎ایک‎ ‎ایسا‎ ‎سوال‎ ‎پیدا‎ ‎ہوتا‎ ‎ہے‎ ‎جو‎ ‎مجھے‎ ‎واقعی‎ ‎مشکل‎ ‎لگتا‎ ‎ہے‎: ‎جب‎ ‎تین ‎ ‎ماڈل‎ ‎ہر‎ ‎ایک‎ ‎درست‎ ‎لیکن‎ ‎مختلف‎ ‎محاوراتی‎ ‎ترجمہ‎ ‎تیار‎ ‎کرتے‎ ‎ہیں، ‎ ‎تو‎ ‎آپ‎ ‎بہترین‎ ‎کا‎ ‎اندازہ‎ ‎کیسے‎ ‎لگاتے‎ ‎ہیں؟ BLEU ‎اسکور‎ ‎ایک‎ ‎حوالہ‎ ‎ترجمے‎ ‎کے‎ ‎مقابلے‎ ‎میں‎ ‎ہیں‎ — ‎لیکن‎ ‎حوالہ‎ ‎کس‎ ‎نے‎ ‎لکھا،‎ ‎اور‎ ‎ان‎ ‎تین‎ ‎میں‎ ‎سے‎ ‎کون‎ ‎سا‎ ‎وہ‎ ‎منتخب‎ ‎کرتے؟‎ ‎ہمارے‎ AI ‎ترجمہ‎ ‎ایجنٹ‎ ‎نے،‎ ‎اس‎ ‎کی‎ ‎تعریف‎ ‎کرتے‎ ‎ ہوئے،‎ ‎کسی‎ ‎بھی‎ ‎آؤٹ‎ ‎پٹ‎ ‎کو‎ ‎کمٹ‎ ‎کرنے‎ ‎سے‎ ‎پہلے‎ ‎صحیح‎ ‎سوال‎ ‎ پوچھا‎:‎

    اس‎ ‎سیاق‎ ‎و‎ ‎سباق‎ ‎میں ‎'llevarse el gato al agua' ‎کا‎ ‎کیا‎ ‎مطلب‎ ‎ہے؟ تین‎ ‎اختیارات‎ ‎پیش‎ ‎کیے‎ ‎گئے‎ ‎تھے‎ — ‎ایک‎ ‎مشکل‎ ‎ہدف‎ ‎حاصل‎ ‎کرنا،‎ ‎کوئی‎ ‎غیر‎ ‎ضروری‎ ‎چیز‎ ‎لینا،‎ ‎یا‎ ‎کوئی‎ ‎خطرناک‎ ‎ سرگرمی‎ ‎ کرنا۔ یہ‎ ‎سوال‎ ‎آرائشی‎ ‎نہیں‎ ‎ ہے۔ یہ‎ ‎وہ‎ ‎طریقہ‎ ‎کار‎ ‎ہے‎ ‎جس‎ ‎کے‎ ‎ذریعے‎ ‎ترجمے‎ ‎کو‎ ‎حتمی‎ ‎شکل‎ ‎دینے‎ ‎سے‎ ‎پہلے‎ ‎سیاق‎ ‎و‎ ‎سباق‎ ‎کی‎ ‎ابہام‎ ‎کو‎ ‎حل‎ ‎کیا‎ ‎جاتا‎ ‎ہے۔‎ ‎لیکن‎ ‎بات‎ ‎یہ‎ ‎ہے‎: ‎تین‎ ‎درست‎ ‎جواب،‎ ‎معنی‎ ‎کے‎ ‎تین‎ ‎مختلف‎ ‎ رنگ۔

    ترجمہ‎ ‎کے‎ ‎جانچ‎ ‎کے‎ ‎اوزار‎ ‎اس‎ ‎قسم‎ ‎کی‎ ‎باریکی‎ ‎کے‎ ‎لیے‎ ‎نہیں‎ ‎بنائے‎ ‎گئے‎ ‎ہیں۔ ‎ ‎میں‎ ‎ابھی‎ ‎تک‎ ‎یہ‎ ‎نہیں‎ ‎جانتا‎ ‎ہوں

    ‎ ‎میں‎ ‎اس‎ ‎بات‎ ‎کے‎ ‎حدود‎ ‎کے‎ ‎بارے‎ ‎میں‎ ‎ایماندار‎ ‎رہنا‎ ‎چاہتا‎ ‎ہوں‎ ‎جو‎ ‎یہ‎ ‎ٹیسٹ‎ ‎دکھاتا‎ ‎ہے۔

    ‎ ‎ایک‎ ‎محاورہ،‎ ‎ایک‎ ‎زبان‎ ‎کا‎ ‎جوڑا،‎ ‎اندرونی‎ ‎جانچ‎ ‎کا‎ ‎ایک‎ ‎دن۔ یہ‎ ‎کوئی‎ ‎مطالعہ‎ ‎نہیں‎ ‎ہے۔ یہ‎ ‎ایک‎ ‎مشاہدہ‎ ‎ہے۔ مجھے‎ ‎نہیں‎ ‎معلوم‎ ‎کہ‎ ‎یہ‎ ‎پیٹرن‎ (‎چھوٹے‎ ‎ماڈلز‎ ‎کا‎ ‎لغوی‎ ‎معنی‎ ‎پر‎ ‎انحصار‎ ‎کرنا،‎ ‎بڑے‎ ‎ماڈلز‎ ‎کا‎ ‎محاوراتی‎ ‎معنی‎ ‎حاصل‎ ‎کرنا‎) ‎مستقل‎ ‎طور‎ ‎ پر‎ ‎ان‎ ‎پر‎ ‎لاگو‎ ‎ہوتا‎ ‎ہے‎: ‎دیگر‎ ‎ہسپانوی‎ ‎محاورے،‎ ‎بھرپور‎ ‎محاوراتی‎ ‎روایات‎ ‎والے‎ ‎دیگر‎ ‎زبان‎ ‎کے‎ ‎جوڑے‎ (‎عربی،‎ ‎جاپانی،‎ ‎روسی‎ ‎سب‎ ‎ذہن‎ ‎میں‎ ‎آتے‎ ‎ہیں‎)‎،‎ ‎غیر‎ ‎محاوراتی‎ ‎مواد‎ ‎جہاں‎ ‎فرق‎ ‎لاگو‎ ‎نہیں‎ ‎ہوتا،‎ ‎ایسے‎ ‎معاملات‎ ‎جہاں‎ ‎ایک‎ ‎چھوٹا‎ ‎ماڈل‎ ‎محاورے‎ ‎کو‎ ‎درست‎ ‎سمجھتا‎ ‎ہے‎ ‎اور‎ ‎ایک‎ ‎بڑا‎ ‎ماڈل‎ ‎اسے‎ ‎سمجھنے‎ ‎سے‎ ‎قاصر‎ ‎رہتا‎ ‎ہے۔‎ ‎مجھے‎ ‎یہ‎ ‎بھی‎ ‎نہیں‎ ‎معلوم‎ ‎ کہ‎ ‎یہ‎ ‎ان‎ ‎ماڈلز‎ ‎کی‎ ‎ایک‎ ‎مستحکم‎ ‎خصوصیت‎ ‎ہے‎ ‎یا‎ ‎کچھ‎ ‎ایسا‎ ‎جو‎ ‎اپ‎ ‎ڈیٹس‎ ‎اور‎ ‎فائن‎ ‎ٹیوننگ‎ ‎کے‎ ‎ساتھ‎ ‎بدلتا‎ ‎ہے۔‎ ‎ماڈل‎ ‎فراہم‎ ‎کرنے‎ ‎والے‎ ‎ترجمہ‎ ‎کے‎ ‎مخصوص‎ ‎چینج‎ ‎لاگ‎ ‎شائع‎ ‎نہیں‎ ‎کرتے۔‎ ‎ایک‎ ‎ماڈل‎ ‎ورژن‎ ‎جو‎ ‎آج‎ llevarse

    • el gato al agua ‎کو‎ ‎درست‎ ‎طریقے‎ ‎سے‎ ‎ہینڈل‎ ‎کرتا‎ ‎
    • ہے،‎ ‎اگلے‎ ‎مہینے‎ ‎اپ‎ ‎ڈیٹ‎ ‎ہو‎ ‎سکتا‎ ‎ہے،‎ ‎اور‎ ‎ہمیں‎ ‎اس‎ ‎کا‎ ‎کوئی‎ ‎علم‎ ‎نہیں‎ ‎ہوگا۔‎ ‎جو‎ ‎میں‎ ‎جانتا‎ ‎ہوں‎: ‎اس‎ ‎ٹیسٹ‎ ‎نے‎ ‎ایک‎ ‎ ایسا‎ ‎نتیجہ‎ ‎پیدا‎ ‎کیا‎ ‎جو‎ ‎اتنا‎ ‎دلچسپ‎ ‎تھا‎ ‎کہ‎ ‎میں‎ ‎ان‎ ‎میں‎ ‎سے‎ ‎
    • مزید،‎ ‎زیادہ‎ ‎منظم‎ ‎طریقے‎ ‎سے،‎ ‎مزید‎ ‎زبان‎ ‎کے‎ ‎جوڑوں‎ ‎اور‎ ‎
    • مواد‎ ‎کی‎ ‎اقسام‎ ‎میں‎ ‎چلانا‎ ‎ چاہتا‎ ‎

    ہوں۔

    جب‎ ‎میرے‎ ‎پاس‎ ‎مزید‎ ‎بانٹنے‎ ‎کے‎ ‎لیے‎ ‎ہوگا،‎ ‎تو‎ ‎میں‎ ‎بانٹوں‎ ‎گا۔

    دو‎ ‎تحقیقی‎ ‎سوال‎ ‎جن‎ ‎پر‎ ‎غور‎ ‎کرنے‎ ‎کے‎ ‎قابل‎ ‎ہیں

    میں‎ ‎ان‎ ‎دو‎ ‎سوالات‎ ‎کے‎ ‎ساتھ‎ ‎اختتام‎ ‎کروں‎ ‎گا‎ ‎جو‎ ‎اس‎ ‎امتحان‎ ‎نے‎ ‎مجھے‎ ‎دیے‎ ‎ہیں۔ میں‎ ‎ان‎ ‎کا‎ ‎جواب‎ ‎نہیں‎ ‎دوں‎ ‎گا،‎ ‎میرے‎ ‎پاس‎ ‎ابھی‎ ‎تک‎ ‎ ایسا‎ ‎کرنے‎ ‎کے‎ ‎لیے‎ ‎ڈیٹا‎ ‎نہیں‎ ‎ہے۔ لیکن میرا‎ ‎خیال‎ ‎ہے‎ ‎کہ‎ ‎یہ‎ ‎پوچھنے‎ ‎کے‎ ‎لیے‎ ‎درست‎ ‎سوالات‎ ‎ہیں۔

    پہلا‎: ‎کس‎ ‎پیرامیٹر‎ ‎تھریشولڈ‎ ‎پر‎ ‎محاوراتی‎ ‎اہلیت قابل‎ ‎اعتماد‎ ‎بن‎ ‎جاتی‎ ‎ہے؟

    GPT-4o-MINI ‎اور‎ GPT-4.1-NANO (‎دونوں‎ ‎لفظی‎) ‎سے GPT-4.1-MINI (‎محاوراتی‎) ‎تک‎ ‎کا‎ ‎چھلانگ‎ ‎یہ‎ ‎بتاتی‎ ‎ہے‎ ‎کہ‎ ‎ان‎ ‎ماڈل‎ ‎سائز‎ ‎کے‎ ‎درمیان‎ ‎پیرامیٹر‎ ‎رینج‎ ‎میں‎ ‎کہیں‎ ‎ایک‎ ‎تھریشولڈ‎ ‎موجود‎ ‎ہے‎ ‎جہاں‎ ‎محاورے کی‎ ‎شناخت‎ ‎شروع‎ ‎ہوتی‎ ‎ہے۔ کیا‎ ‎یہ‎ ‎مستقل‎ ‎ہے؟ کیا‎ ‎یہ‎ ‎تمام‎ ‎زبانوں‎ ‎کے‎ ‎محاورات‎ ‎پر‎ ‎لاگو‎ ‎ہوتا‎ ‎ہے،‎ ‎یا‎ ‎یہ‎ ‎اس‎ ‎بات‎ ‎پر‎ ‎منحصر‎ ‎ہے‎ ‎کہ‎ ‎تربیت‎ ‎کے‎ ‎ڈیٹا‎ ‎میں‎ ‎کوئی‎ ‎زبان‎ ‎کتنی‎ ‎اچھی‎ ‎طرح‎ ‎سے‎ ‎نمائندگی‎ ‎کرتی‎ ‎ ہے؟ مجھے‎ ‎نہیں‎ ‎معلوم۔ لیکن‎ ‎ترجمے‎ ‎کے‎ ‎ورک‎ ‎فلو‎ ‎بنانے‎ ‎والے‎ ‎کسی‎ ‎بھی‎ ‎شخص‎ ‎کے‎ ‎لیے‎ ‎یہ‎ ‎جاننا‎ ‎مفید‎ ‎ہوگا۔ ‎ ‎دوسرا‎: ‎ماڈل‎ ‎ورژن‎ ‎کی‎ ‎عدم‎ ‎شفافیت‎ ‎کی‎ ‎صارفین‎ ‎کو‎ ‎بڑے‎ ‎پیمانے‎ ‎پر‎ ‎کیا‎ ‎قیمت‎ ‎ادا‎ ‎کرنی‎ ‎پڑتی‎ ‎ہے؟

    ‎ ‎اگر‎ ‎کوئی‎ ‎صارف‎ ‎کسی‎ ‎ایسے‎ ‎ٹول‎ ‎کے‎ ‎ذریعے‎ ‎مہینے‎ ‎میں‎ 1,000 ‎دستاویزات‎ ‎بھیجتا‎ ‎ہے‎ ‎جو‎ ‎یہ‎ ‎ظاہر‎ ‎نہیں‎ ‎کرتا‎ ‎کہ‎ ‎کون‎ ‎سا‎ ‎ماڈل‎ ‎ورژن‎ ‎استعمال‎ ‎کیا‎ ‎جا‎ ‎رہا‎ ‎ہے‎ (‎اور‎ ‎ان‎ ‎میں‎ ‎سے‎ ‎کچھ‎ ‎دستاویزات‎ ‎میں‎ ‎محاوراتی‎ ‎مواد‎ ‎شامل‎ ‎ہے‎)‎،‎ ‎تو‎ ‎کتنی‎ ‎بار‎ ‎یہ‎ ‎ناکامی‎ ‎پوشیدہ‎ ‎طور‎ ‎پر‎ ‎ہو‎ ‎رہی‎ ‎ہے؟ وہ‎ ‎کیسے‎ ‎جانیں‎ ‎گے؟ ‎ ‎اصل‎ ‎قیمت‎ ‎کیا‎ ‎ہے،‎ ‎کبھی‎ ‎نہ‎ ‎جاننے‎ ‎کی؟

    ‎ ‎مجھے‎ ‎لگتا‎ ‎ہے‎ ‎کہ‎ ‎یہ‎ ‎سوال‎ ‎ان‎ ‎بہت‎ ‎سے‎ ‎سوالوں‎ ‎سے‎ ‎زیادہ‎ ‎اہم‎ ‎ہے‎ ‎جو ‎ ‎ترجمے‎ ‎کے‎ ‎لیے‎ ‎کون‎ ‎سا‎ ‎اے‎ ‎آئی‎ ‎بہترین‎ ‎ہے‎ ‎کے‎ ‎موازنے‎ ‎فی‎ ‎الحال ‎ ‎گردش‎ ‎میں‎ ‎ہیں۔ جواب‎ ‎سب‎ ‎سے‎ ‎بڑا‎ ‎ماڈل‎ ‎استعمال‎ ‎کریں‎ ‎نہیں‎ ‎ہے۔ ‎ ‎جواب‎ ‎یہ‎ ‎ہو‎ ‎سکتا‎ ‎ہے‎: ‎جانیں‎ ‎کہ‎ ‎آپ‎ ‎کیا‎ ‎استعمال‎ ‎کر‎ ‎رہے‎ ‎ہیں،‎ ‎اپنے‎ ‎مواد‎ ‎پر ‎ ‎اپنے‎ ‎ٹیسٹ‎ ‎چلائیں،‎ ‎اور‎ ‎یہ‎ ‎فرض‎ ‎نہ‎ ‎کریں‎ ‎کہ‎ ‎ایک‎ ‎فراہم‎ ‎کنندہ‎ ‎کا ‎ ‎نام‎ ‎ان‎ ‎کے‎ ‎ماڈل ‎ ‎رینج‎ ‎میں‎ ‎مستقل‎ ‎رویے‎ ‎کی‎ ‎ضمانت‎ ‎ہے۔

    ‎ ‎کم‎ ‎از‎ ‎کم،‎ ‎میں‎ ‎اس‎ ‎ٹیسٹ‎ ‎سے‎ ‎یہی‎ ‎اخذ‎ ‎کر‎ ‎رہا‎ ‎ہوں۔

    تحقیقی‎ ‎سوالات

    ‎1. کیا‎ ‎ماڈل‎ ‎کا‎ ‎سائز‎ ‎قابل‎ ‎اعتماد‎ ‎طریقے‎ ‎سے‎ ‎محاوراتی‎ ‎ترجمے‎ ‎کے‎ ‎معیار‎ ‎کی‎ ‎پیش‎ ‎گوئی‎ ‎کرتا‎ ‎ہے؟‎ ‎اس‎ ‎ایک‎ ‎ٹیسٹ‎ ‎کی‎ ‎بنیاد‎ ‎پر‎: ‎ایک‎ ‎ہی‎ ‎اے‎ ‎آئی‎ ‎فیملی‎ ‎کے‎ ‎اندر‎ ‎چھوٹے،‎ ‎کارکردگی‎ ‎کے‎ ‎لیے‎ ‎بہتر‎ ‎بنائے‎ ‎گئے‎ ‎ماڈلز‎ ‎نے‎ ‎ایک‎ ‎اچھی‎ ‎طرح‎ ‎سے‎ ‎قائم‎ ‎ہسپانوی‎ ‎محاورے‎ ‎کا‎ ‎لفظی‎ ‎ترجمہ‎ ‎کیا،‎ ‎جبکہ‎ ‎اسی‎ ‎ماڈل‎ ‎کے‎ ‎بڑے‎/‎نئے‎ ‎ورژن‎ ‎نے‎ ‎درست‎ ‎محاوراتی‎ ‎ترجمے‎ ‎تیار‎ ‎

    کیے۔ یہ‎ ‎سوال‎ ‎ہے‎ ‎کہ‎ ‎آیا‎ ‎یہ‎ ‎محاورے‎ ‎کی‎ ‎اقسام‎ ‎ اور‎ ‎زبان‎ ‎کے‎ ‎جوڑوں‎ ‎میں‎ ‎بھی‎ ‎درست‎ ‎ ہے۔ میں‎ ‎مزید‎ ‎ٹیسٹ‎ ‎کروں‎ ‎گا۔

    ‎2. تین‎ ‎درست‎ ‎محاوراتی‎ ‎ترجموں‎ ‎نے‎ ‎تین معنی‎ ‎خیز‎ ‎طور‎ ‎پر‎ ‎مختلف‎ ‎نتائج‎ ‎کیوں‎ ‎پیدا‎ ‎کیے؟

    GPT-4.1-MINI‏،‎ GPT-5.4-MINI،‎ ‎اور‎ GPT-5.4 ‎سب‎ ‎نےllevarse el gato al agua‎ ‎کا‎ ‎محاوراتی‎ ‎ترجمہ‎ ‎کیا‎ — ‎لیکن‎ ‎مختلف‎ ‎انگریزی ‎ ‎اظہارات‎ ‎میں‎ ‎جن‎ ‎کے‎ ‎معنی‎ ‎میں‎ ‎تھوڑا‎ ‎سا‎ ‎فرق‎ ‎تھا۔ یہ‎ ‎بتاتا‎ ‎ہے کہ‎ ‎محاوراتی‎ ‎ترجمے‎ ‎کے‎ ‎معیار‎ ‎کے‎ ‎کم‎ ‎از‎ ‎کم‎ ‎دو‎ ‎پہلو‎ ‎ہیں‎:‎ کیا‎ ‎ماڈل‎ ‎محاورے‎ ‎کو‎ ‎بالکل‎ ‎پہچانتا‎ ‎ہے،‎ ‎اور‎ ‎یہ‎ ‎کہ‎ ‎یہ مخصوص‎ ‎زبان‎ ‎کے دستیاب‎ ‎اختیارات‎ ‎میں‎ ‎سے‎ ‎کون‎ ‎سا مترادف‎ ‎اظہار‎ ‎منتخب‎ ‎کرتا‎ ‎ہے۔ معیاری‎ ‎ترجمہ‎ ‎کے‎ ‎معیار‎ ‎ان‎ ‎دو‎ ‎جہتوں‎ ‎کو‎ ‎صاف‎ ‎طور‎ ‎پر‎ ‎الگ‎ ‎نہیں‎ ‎کرتے‎ ‎ ہیں۔ مجھے‎ ‎لگتا‎ ‎ہے‎ ‎کہ‎ ‎انہیں‎ ‎ایسا‎ ‎کرنا‎ ‎چاہیے۔


    یہ‎ ‎پوسٹ‎ MachineTranslation.com ‎کے‎ ‎ڈیولپمنٹ‎ ‎پلیٹ‎ ‎فارم‎ ‎پر‎ ‎اندرونی‎ ‎جانچ‎ ‎پر‎ ‎مبنی‎ ‎ہے۔ یہاں‎ ‎دکھائی‎ ‎جانے‎ ‎والی‎ ‎ملٹی‎ ‎ماڈل‎ ‎ورژن‎ ‎کی‎ ‎جانچ‎ ‎ابھی‎ ‎عوامی‎ ‎طور‎ ‎پر‎ ‎دستیاب‎ ‎نہیں‎ ‎ہے۔ میں‎ ‎یہ‎ ‎نتیجہ‎ ‎اس‎ ‎لیے‎ ‎شیئر‎ ‎کر‎ ‎رہا‎ ‎ہوں‎ ‎کیونکہ‎ ‎مجھے‎ ‎لگتا‎ ‎ہے‎ ‎کہ‎ ‎یہ‎ ‎مشاہدہ‎ ‎مفید‎ ‎ہے‎ ‎چاہے‎ ‎آپ‎ ‎اپنے‎ ‎ترجمے‎ ‎کہاں‎ ‎بھی‎ ‎چلائیں۔