June 5, 2026
میں ایک ایسی چیز پر اندرونی جانچ کر رہا ہوں جس کے بارے میں ہم ترجمہ کی صنعت میں کافی بات نہیں کرتے: یہ نہیں کہ مختلف AI سسٹم مختلف ترجمہ کرتے ہیں، بلکہ یہ کہ ایک ہی AI کے مختلف ورژن مختلف ترجمہ کرتے ہیں — اور کس حد تک۔
گزشتہ ہفتے میں نے MachineTranslation.com کے اندرونی جانچ کے پلیٹ فارم پر بیک وقت ChatGPT کے پانچ ورژن کے ذریعے ایک ہسپانوی محاورے کی جانچ کی۔ جو نتیجہ سامنے آیا اس نے مجھے حیران کر دیا۔
دو ورژن نے ایک ایسا ترجمہ تیار کیا جو، سچ پوچھیں تو، انگریزی میں بے معنی تھا۔ تین ورژنوں نے درست محاوراتی ترجمے تیار کیے۔ اور وہ تین درست جوابات آپس میں متفق نہیں تھے۔ یہ سب پانچوں چیٹ جی پی ٹی
ہیں۔ تمام پانچ اوپن اے آئی ہیں۔ وہی اے آئی، مختلف ماڈل — اور آؤٹ پٹس اس سے زیادہ مختلف نہیں ہو سکتیں۔
میں اسے اب اس لیے شیئر کر رہا ہوں کیونکہ مجھے لگتا ہے کہ یہ اہم ہے، اس لیے نہیں کہ میرے پاس صاف جوابات ہیں۔ میں نہیں کرتا۔ لیکن یہ مشاہدہ دنیا میں لانے کے لیے کافی دلچسپ ہے فہرست کا عنوان
جس جملے کا میں نے تجربہ کیا وہ تھا llevarse el gato al agua.

یہاں وہ ہے جو ہر ورژن نے تیار کیا:
| ماڈل | آؤٹ پٹ | محاوراتی؟ |
|---|---|---|
| چیٹ جی پی ٹی:: جی پی ٹی-4o-MINI | بلی کو پانی میں لے جانا | ❌ لفظی |
| چیٹ جی پی ٹی:: جی پی ٹی-4.1-NANO | بلی کو پانی میں لے جانا | ❌ لفظی |
| چیٹ جی پی ٹی:: جی پی ٹی-4.1-MINI | کامیابی سے انجام دینا | ✅ درست |
| چیٹ جی پی ٹی:: جی پی ٹی-5.4-MINI | اپنا راستہ نکالنا | ✅ جزوی |
| چیٹ جی پی ٹی:: جی پی ٹی-5.4 | سب سے اوپر آنا | ✅ درست |
اس جملے کا مطلب ہے کہ مشکلات کے خلاف کچھ حاصل کرنا، ایک مشکل فتح حاصل کرنا۔ اس کا بلیوں یا پانی سے کوئی تعلق نہیں ہے۔ لفظی ترجمہ ترجمہ نہیں ہوتا۔ یہ ایک لفظ بہ لفظ ٹرانسکرپشن ہے ایک جملے کی جسے ماڈل محاورے کے طور پر پہچاننے میں ناکام رہا۔
GPT-4o-MINI اور GPT-4.1-NANO نے ایک جیسے آؤٹ پٹ تیار کیے۔ مشابہ نہیں، یکساں۔ ہمارے ترجمہ کے بصیرت نے اسے براہ راست پرچم زدہ کیا: GPT-4.1-nano اور GPT-4o-mini نے لفظی ترجمے پر زور دیتے ہوئے، محاوراتی معنی کے بجائے، ایک جیسے ترجمے فراہم کیے۔
GPT-4.1-MINI، GPT-5.4-MINI، اور GPT-5.4 نے ہر ایک کچھ ایسا پیدا کیا جو پہچانا جا سکتا تھا کہ درست ہے — لیکن ایک دوسرے سے مختلف تھا۔
میں اس بارے میں درست ہونا چاہتا ہوں کہ llevarse el gato al agua ایک منتخب شدہ کے بجائے ایک مفید ٹیسٹ ان پٹ کیوں ہے۔
یہ ایک اچھی طرح سے قائم شدہ محاورہ ہے۔ یہ ادب، صحافت، اور روزمرہ کی تقریر میں ظاہر ہوتا ہے۔ یہ مبہم نہیں ہے۔ اسپینی زبان کے کسی بھی معقول متن کے ذخیرے پر تربیت یافتہ کسی بھی ماڈل کو اس کا سامنا کرنا پڑا ہوگا۔ سوال یہ نہیں ہے کہ ماڈل نے یہ جملہ دیکھا ہے یا نہیں۔ سوال یہ ہے کہ وہ اس کے ساتھ کیا کرتا ہے۔ محاورے کے ترجمے میں سب سے بدتر ناکامی ایک برا ترجمہ پیش کرنا نہیں
ہے۔ یہ ایک لفظی ترجمہ تیار کر رہا ہے جو کہ اس شخص کے لیے قابل قبول لگتا ہے جو ہدف زبان نہیں جانتا۔ To carry the cat to the water گرامر کے لحاظ سے درست انگریزی ہے۔
یہ درست ہے۔ یہ کچھ ایسا لگتا ہے جس کا کوئی مطلب ہو سکتا ہے۔ ایک صارف جو ہسپانوی نہیں بولتا ہے وہ اسے پڑھ سکتا ہے، سر ہلا سکتا ہے، اور آگے بڑھ سکتا ہے — کبھی یہ جانے بغیر کہ اصل معنی مکمل طور پر کھو گیا تھا۔
یہ وہ ناکامی کا موڈ ہے جس کی مجھے پرواہ ہے۔ واضح غلطی نہیں۔ وہ پوشیدہ ایک۔
یہ نمونہ بے ترتیب نہیں ہے۔ دو ماڈلز جنہوں نے لفظی ترجمہ کیا (GPT-4o-MINI اور GPT-4.1-NANO) دونوں چھوٹے، ہلکے ماڈلز ہیں جو رفتار اور لاگت کی کارکردگی کے لیے بہتر بنائے گئے ہیں۔ تین ماڈلز جو محاوراتی ترجمے تیار کرتے ہیں (GPT-4.1-MINI، GPT-5.4-MINI، GPT-5.4) ایک مختلف نسل یا پیرامیٹر اسکیل کی نمائندگی کرتے ہیں۔ یہ کچھ ایسا تجویز کرتا ہے جو میرے خیال میں کم دریافت کیا گیا ہے: ترجمے میں محاوراتی اہلیت ماڈل کی صلاحیت کے ساتھ اس طرح بڑھتی ہے جو عام بینچ مارکس میں نظر نہیں آتی۔ عام زبان کے بینچ مارکس میں استدلال، علم، کوڈنگ، ریاضی کا تجربہ کیا جاتا ہے۔
وہ عام طور پر یہ تجربہ نہیں کرتے کہ آیا کوئی ماڈل یہ شناخت کر سکتا ہے کہ بارش بلیوں اور کتوں کی ہو رہی ہے موسم کی صورتحال کے بارے میں نہیں ہے، یا یہ کہ llevarse el gato al agua بلی کو پانی پلانے کے بارے میں نہیں ہے۔ محاورے ثقافتی علم، سیاق و سباق کے استدلال، اور نمونہ کی شناخت کے سنگم پر بیٹھے ہیں — اور وہ سنگم ماڈل کی صلاحیت کی ایک حد کا تقاضا کرتا ہے جو چھوٹے ماڈل مستقل طور پر عبور نہیں کرتے۔
میں جو دعویٰ نہیں کر رہا ہوں: یہ کہ بڑے ماڈل ہمیشہ بہتر مترجم ہوتے ہیں۔ میرے پاس اس کے لیے عام اصول کے طور پر کوئی ثبوت نہیں ہے۔ میں کیا دیکھ رہا ہوں: کہ خاص طور پر محاوراتی مواد کے لیے، خاندان کے اندر کا ورژن کا فرق میری توقع سے زیادہ تھا۔
زیادہ تر صارفین جو AI ترجمہ کا آلہ استعمال کرتے ہیں وہ نہیں جانتے کہ وہ اس AI کا کون سا ورژن استعمال کر رہے ہیں۔ وہ ایک پروڈکٹ کھولتے ہیں، ایک زبان کا جوڑا منتخب کرتے ہیں، اور ایک آؤٹ پٹ حاصل کرتے ہیں۔ ماڈل روٹنگ ان کے لیے پوشیدہ ہے۔
یہ بڑے پیمانے پر اہم ہے۔ MachineTranslation.com نے صرف 90 دن کی مدت میں انگریزی سے ہسپانوی ترجمے کے لاکھوں سے زیادہ کاموں پر عملدرآمد کیا۔ اگر ان میں سے ایک اہم حصہ ان ملازمتوں نے محاوراتی مواد (مارکیٹنگ کاپی، قانونی زبان، ادبی متن، عام بات چیت) کو چھوا اور وہ ٹول جو ان ملازمتوں کو روٹ کر رہا تھا وہ صارفین کو ان کی لاعلمی میں ایک چھوٹے ماڈل کی طرف بھیج رہا تھا، تو بلی کو پانی تک لے جانا حقیقی آؤٹ پٹس میں، حقیقی دستاویزات میں، حقیقی لوگوں کے لیے جو نتائج پر بھروسہ کرتے تھے، ظاہر ہو رہا تھا۔ ترجمہ کی صنعت نے برسوں سے AI فراہم کنندگان کا موازنہ کیا ہے۔ ڈیپ ایل بمقابلہ گوگل۔
کلاڈ بمقابلہ چیٹ جی پی ٹی۔ وہ موازنے مفید ہیں۔ لیکن ایک ہی فراہم کنندہ کے اندر، ورژن کا فرق اتنا ہی اہم ہو سکتا ہے — اور یہ ایک ایسا فرق ہے جسے زیادہ تر موازنہ کے فریم ورک نہیں ناپتے کیونکہ وہ ماڈل-ورژن کی سطح پر جانچ نہیں کرتے۔ جب کوئی کہتا ہے میں ترجمے کے لیے چیٹ جی پی ٹی استعمال کرتا ہوں، تو یہ جملہ بامعنی ہونے کے لیے کافی مخصوص نہیں ہے۔
کون سا چیٹ جی پی ٹی؟ نینو؟ 4o-منی؟ 4.1-منی؟ 5.4? جواب ایسے طریقوں سے آؤٹ پٹ کو تبدیل کرتا ہے جو غیر معمولی ہیں، کم از کم محاوراتی مواد کے لیے۔
یہ وہ حصہ ہے جو مجھے سب سے زیادہ دلچسپ لگتا ہے، اور میں نے ابھی تک اس کے بارے میں پوری طرح سے کچھ نہیں سمجھا ہے۔
تین ماڈلز جنہوں نے محاوراتی ترجمے تیار کیے، تین مختلف ترجمے دیے:
تینوں ہی llevarse el gato al agua کی قابل دفاع انگریزی ترجمانی ہیں۔ لیکن وہ برابر نہیں ہیں۔
اسے انجام دینے کے لیے مشکل کے مقابلے میں عمل درآمد پر زور دیتا ہے، آپ نے کچھ مشکل کیا اور یہ کام کر گیا۔ اپنی مرضی کروانا اس بات پر زور دیتا ہے کہ آپ جو نتیجہ چاہتے تھے وہ حاصل ہو گیا، اس میں مشکل پر کم زور دیا جاتا ہے۔ سبقت لے جانا مقابلہ میں فتح، دوسروں کے مقابلے میں جیتنا، پر زور دیتا ہے۔
اصل ہسپانوی محاورہ ان میں سے پہلے کے سب سے قریب ہے۔ اس فقرے میں مزاحمت پر قابو پانے کا مفہوم ہے، نہ کہ صرف ایک نتیجے کو ترجیح دینا اور اسے حقیقت بنانا۔ لیکن اپنی بات منوانا اور سبقت لے جانا غلط نہیں ہیں، وہ صرف مختلف سمتوں میں غیر واضح ہیں۔
اس سے ایک ایسا سوال پیدا ہوتا ہے جو مجھے واقعی مشکل لگتا ہے: جب تین ماڈل ہر ایک درست لیکن مختلف محاوراتی ترجمہ تیار کرتے ہیں، تو آپ بہترین کا اندازہ کیسے لگاتے ہیں؟ BLEU اسکور ایک حوالہ ترجمے کے مقابلے میں ہیں — لیکن حوالہ کس نے لکھا، اور ان تین میں سے کون سا وہ منتخب کرتے؟ ہمارے AI ترجمہ ایجنٹ نے، اس کی تعریف کرتے ہوئے، کسی بھی آؤٹ پٹ کو کمٹ کرنے سے پہلے صحیح سوال پوچھا:
اس سیاق و سباق میں 'llevarse el gato al agua' کا کیا مطلب ہے؟ تین اختیارات پیش کیے گئے تھے — ایک مشکل ہدف حاصل کرنا، کوئی غیر ضروری چیز لینا، یا کوئی خطرناک سرگرمی کرنا۔ یہ سوال آرائشی نہیں ہے۔ یہ وہ طریقہ کار ہے جس کے ذریعے ترجمے کو حتمی شکل دینے سے پہلے سیاق و سباق کی ابہام کو حل کیا جاتا ہے۔ لیکن بات یہ ہے: تین درست جواب، معنی کے تین مختلف رنگ۔
ترجمہ کے جانچ کے اوزار اس قسم کی باریکی کے لیے نہیں بنائے گئے ہیں۔ میں ابھی تک یہ نہیں جانتا ہوں
میں اس بات کے حدود کے بارے میں ایماندار رہنا چاہتا ہوں جو یہ ٹیسٹ دکھاتا ہے۔
ایک محاورہ، ایک زبان کا جوڑا، اندرونی جانچ کا ایک دن۔ یہ کوئی مطالعہ نہیں ہے۔ یہ ایک مشاہدہ ہے۔ مجھے نہیں معلوم کہ یہ پیٹرن (چھوٹے ماڈلز کا لغوی معنی پر انحصار کرنا، بڑے ماڈلز کا محاوراتی معنی حاصل کرنا) مستقل طور پر ان پر لاگو ہوتا ہے: دیگر ہسپانوی محاورے، بھرپور محاوراتی روایات والے دیگر زبان کے جوڑے (عربی، جاپانی، روسی سب ذہن میں آتے ہیں)، غیر محاوراتی مواد جہاں فرق لاگو نہیں ہوتا، ایسے معاملات جہاں ایک چھوٹا ماڈل محاورے کو درست سمجھتا ہے اور ایک بڑا ماڈل اسے سمجھنے سے قاصر رہتا ہے۔ مجھے یہ بھی نہیں معلوم کہ یہ ان ماڈلز کی ایک مستحکم خصوصیت ہے یا کچھ ایسا جو اپ ڈیٹس اور فائن ٹیوننگ کے ساتھ بدلتا ہے۔ ماڈل فراہم کرنے والے ترجمہ کے مخصوص چینج لاگ شائع نہیں کرتے۔ ایک ماڈل ورژن جو آج llevarse
ہوں۔
جب میرے پاس مزید بانٹنے کے لیے ہوگا، تو میں بانٹوں گا۔
میں ان دو سوالات کے ساتھ اختتام کروں گا جو اس امتحان نے مجھے دیے ہیں۔ میں ان کا جواب نہیں دوں گا، میرے پاس ابھی تک ایسا کرنے کے لیے ڈیٹا نہیں ہے۔ لیکن میرا خیال ہے کہ یہ پوچھنے کے لیے درست سوالات ہیں۔
پہلا: کس پیرامیٹر تھریشولڈ پر محاوراتی اہلیت قابل اعتماد بن جاتی ہے؟
GPT-4o-MINI اور GPT-4.1-NANO (دونوں لفظی) سے GPT-4.1-MINI (محاوراتی) تک کا چھلانگ یہ بتاتی ہے کہ ان ماڈل سائز کے درمیان پیرامیٹر رینج میں کہیں ایک تھریشولڈ موجود ہے جہاں محاورے کی شناخت شروع ہوتی ہے۔ کیا یہ مستقل ہے؟ کیا یہ تمام زبانوں کے محاورات پر لاگو ہوتا ہے، یا یہ اس بات پر منحصر ہے کہ تربیت کے ڈیٹا میں کوئی زبان کتنی اچھی طرح سے نمائندگی کرتی ہے؟ مجھے نہیں معلوم۔ لیکن ترجمے کے ورک فلو بنانے والے کسی بھی شخص کے لیے یہ جاننا مفید ہوگا۔ دوسرا: ماڈل ورژن کی عدم شفافیت کی صارفین کو بڑے پیمانے پر کیا قیمت ادا کرنی پڑتی ہے؟
اگر کوئی صارف کسی ایسے ٹول کے ذریعے مہینے میں 1,000 دستاویزات بھیجتا ہے جو یہ ظاہر نہیں کرتا کہ کون سا ماڈل ورژن استعمال کیا جا رہا ہے (اور ان میں سے کچھ دستاویزات میں محاوراتی مواد شامل ہے)، تو کتنی بار یہ ناکامی پوشیدہ طور پر ہو رہی ہے؟ وہ کیسے جانیں گے؟ اصل قیمت کیا ہے، کبھی نہ جاننے کی؟
مجھے لگتا ہے کہ یہ سوال ان بہت سے سوالوں سے زیادہ اہم ہے جو ترجمے کے لیے کون سا اے آئی بہترین ہے کے موازنے فی الحال گردش میں ہیں۔ جواب سب سے بڑا ماڈل استعمال کریں نہیں ہے۔ جواب یہ ہو سکتا ہے: جانیں کہ آپ کیا استعمال کر رہے ہیں، اپنے مواد پر اپنے ٹیسٹ چلائیں، اور یہ فرض نہ کریں کہ ایک فراہم کنندہ کا نام ان کے ماڈل رینج میں مستقل رویے کی ضمانت ہے۔
کم از کم، میں اس ٹیسٹ سے یہی اخذ کر رہا ہوں۔
کیے۔ یہ سوال ہے کہ آیا یہ محاورے کی اقسام اور زبان کے جوڑوں میں بھی درست ہے۔ میں مزید ٹیسٹ کروں گا۔
GPT-4.1-MINI، GPT-5.4-MINI، اور GPT-5.4 سب نےllevarse el gato al agua کا محاوراتی ترجمہ کیا — لیکن مختلف انگریزی اظہارات میں جن کے معنی میں تھوڑا سا فرق تھا۔ یہ بتاتا ہے کہ محاوراتی ترجمے کے معیار کے کم از کم دو پہلو ہیں: کیا ماڈل محاورے کو بالکل پہچانتا ہے، اور یہ کہ یہ مخصوص زبان کے دستیاب اختیارات میں سے کون سا مترادف اظہار منتخب کرتا ہے۔ معیاری ترجمہ کے معیار ان دو جہتوں کو صاف طور پر الگ نہیں کرتے ہیں۔ مجھے لگتا ہے کہ انہیں ایسا کرنا چاہیے۔
یہ پوسٹ MachineTranslation.com کے ڈیولپمنٹ پلیٹ فارم پر اندرونی جانچ پر مبنی ہے۔ یہاں دکھائی جانے والی ملٹی ماڈل ورژن کی جانچ ابھی عوامی طور پر دستیاب نہیں ہے۔ میں یہ نتیجہ اس لیے شیئر کر رہا ہوں کیونکہ مجھے لگتا ہے کہ یہ مشاہدہ مفید ہے چاہے آپ اپنے ترجمے کہاں بھی چلائیں۔