June 5, 2026
আমি এমন কিছুর উপর অভ্যন্তরীণ পরীক্ষা চালাচ্ছি যা আমরা অনুবাদ শিল্পে যথেষ্ট আলোচনা করি না: বিভিন্ন এআই সিস্টেম ভিন্নভাবে অনুবাদ করে কিনা তা নয়, কিন্তু একই এআই-এর বিভিন্ন সংস্করণ ভিন্নভাবে অনুবাদ করে কিনা — এবং কতটা।
গত সপ্তাহে আমি MachineTranslation.com-এর অভ্যন্তরীণ টেস্টিং প্ল্যাটফর্মে একই সাথে পাঁচটি চ্যাটজিপিটি সংস্করণের মাধ্যমে একটি স্প্যানিশ বাগধারা পরীক্ষা করেছি। যা ফিরে এসেছে তা আমাকে থামিয়ে দিয়েছে।
দুটি সংস্করণ এমন একটি অনুবাদ তৈরি করেছে যা সত্যিই ইংরেজিতে অর্থহীন। তিনটি সংস্করণ সঠিক বাগধারা অনুবাদ তৈরি করেছে। এবং সঠিক তিনটি সংস্করণ একে অপরের সাথে একমত হয়নি।
পাঁচটি মডেলই চ্যাটজিপিটি । সবগুলোই ওপেনএআই। একই এআই, ভিন্ন মডেল — এবং ফলাফলগুলো এর চেয়ে বেশি ভিন্ন হতে পারত না।
আমি এটি এখন শেয়ার করছি কারণ আমি মনে করি এটি গুরুত্বপূর্ণ, আমার কাছে কোনো সুস্পষ্ট উত্তর আছে বলে নয়। আমি তা করি না। কিন্তু পর্যবেক্ষণটি যথেষ্ট আকর্ষণীয় যে এটি বিশ্বে স্থাপন করা যেতে পারে।
আমি যে বাক্যটি পরীক্ষা করেছি তা হল llevarse el gato al agua।

প্রতিটি সংস্করণ কী তৈরি করেছে তা এখানে:
| মডেল | আউটপুট | প্রবাদমূলক? |
|---|---|---|
| চ্যাটজিপিটি::জিপিটি-৪ও-মিনি | বিড়ালটিকে জলে নিয়ে যাওয়া | ❌ আক্ষরিক |
| চ্যাটজিপিটি::জিপিটি-৪.১-ন্যানো | বিড়ালটিকে জলে নিয়ে যাওয়া | ❌ আক্ষরিক |
| চ্যাটজিপিটি::জিপিটি-৪.১-মিনি | সাফল্যের সাথে সম্পন্ন করা | ✅ সঠিক |
| চ্যাটজিপিটি::জিপিটি-৫.৪-মিনি | নিজের ইচ্ছা পূরণ করা | ✅ আংশিক |
| চ্যাটজিপিটি::জিপিটি-৫.৪ | শীর্ষে আসা | ✅ সঠিক |
বাক্যটির অর্থ হল প্রতিকূলতার বিরুদ্ধে কিছু অর্জন করা, কঠিন জয় লাভ করা। এর সাথে বিড়াল বা জলের কোনও সম্পর্ক নেই। আক্ষরিক অনুবাদ অনুবাদ নয়। এটি একটি শব্দে-শব্দে অনুবাদ বা রূপান্তর এমন একটি বাক্যাংশের যা সনাক্ত করতে মডেলটি ব্যর্থ হয়েছিল যে সেটি একটি বাগধারা।
GPT-4o-MINI এবং GPT-4.1-NANO হুবহু একই ফলাফল তৈরি করেছিল। একই রকম নয়, অভিন্ন। আমাদের অনুবাদ অন্তর্দৃষ্টি এটি সরাসরি চিহ্নিত করেছে: GPT-4.1-nano এবং GPT-4o-mini আক্ষরিক ব্যাখ্যার উপর জোর দিয়ে একই অনুবাদ তৈরি করেছে, বাগধারার অর্থের চেয়ে।
GPT-4.1-MINI, GPT-5.4-MINI, এবং GPT-5.4 প্রত্যেকেই কিছু স্বীকৃতিযোগ্যভাবে সঠিক তৈরি করেছে — কিন্তু একে অপরের থেকে ভিন্ন।
আমি সুনির্দিষ্টভাবে বলতে চাই কেন llevarse el gato al agua একটি দরকারী পরীক্ষার ইনপুট, নির্বিচারে বাছাই করা নয়।
এটি একটি সুপ্রতিষ্ঠিত বাগধারা। এটি সাহিত্য, সাংবাদিকতা, এবং দৈনন্দিন কথাবার্তায় ব্যবহৃত হয়। এটা অস্পষ্ট নয়। স্প্যানিশ ভাষার একটি যুক্তিসঙ্গত কর্পাসে প্রশিক্ষিত যেকোনো মডেল এটি খুঁজে পাবে। প্রশ্নটি মডেলটি এই শব্দগুচ্ছটি দেখেছে কিনা তা নিয়ে নয়। প্রশ্নটি হল এটি দিয়ে কী করে। বাগধারা অনুবাদের সবচেয়ে খারাপ ব্যর্থতার ধরণ হল একটি খারাপ অনুবাদ তৈরি না
করা। এটি এমন একটি আক্ষরিক অনুবাদ তৈরি করছে যা মনে হতে পারে এমন কারোর কাছে গ্রহণযোগ্য যে লক্ষ্য ভাষাটি জানে না।
"To carry the cat to the water" ব্যাকরণগতভাবে সঠিক ইংরেজি। এটি সুগঠিত। এটি এমন কিছু মনে হতে পারে যার একটি অর্থ আছে। যে ব্যবহারকারী স্প্যানিশ জানেন না তিনি হয়তো এটি পড়বেন, মাথা নাড়বেন এবং এগিয়ে যাবেন — কখনই জানতে পারবেন না যে মূল অর্থটি সম্পূর্ণ হারিয়ে গেছে।
এটিই সেই ব্যর্থতার ধরন যা নিয়ে আমি উদ্বিগ্ন। স্পষ্ট ত্রুটি নয়। অদৃশ্য একজন।
এখানে প্যাটার্নটি এলোমেলো নয়। দুটি মডেল যারা আক্ষরিক অনুবাদ তৈরি করেছে (GPT-4o-MINI এবং GPT-4.1-NANO) উভয়ই ছোট, হালকা মডেল যা গতি এবং খরচ দক্ষতার জন্য অপ্টিমাইজ করা হয়েছে। তিনটি মডেল যা সাবলীল অনুবাদ তৈরি করেছে (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) একটি ভিন্ন প্রজন্ম বা প্যারামিটার স্কেল উপস্থাপন করে। এটি এমন কিছু বোঝায় যা আমার মতে কম অন্বেষণ করা হয়েছে: অনুবাদের সাবলীলতা মডেলের ক্ষমতার সাথে এমনভাবে স্কেল করে যা সাধারণ বেঞ্চমার্কে দৃশ্যমান নয়। সাধারণ ভাষা বেঞ্চমার্কে যুক্তি, জ্ঞান, কোডিং, গণিত পরীক্ষা করা হয়।
তারা সাধারণত এটি পরীক্ষা করে না যে একটি মডেল সনাক্ত করতে পারে কিনা যে it's raining cats and dogs আবহাওয়া পরিস্থিতি সম্পর্কিত নয়, অথবা llevarse el gato al agua একটি বিড়ালকে পানি খাওয়ানো সম্পর্কিত নয়। বাগধারাগুলো মূলত সাংস্কৃতিক জ্ঞান, প্রাসঙ্গিক অনুমান এবং প্যাটার্ন সনাক্তকরণের সংযোগস্থলে অবস্থান করে — আর এই সংযোগস্থলের জন্য মডেলের সক্ষমতার এমন একটি ন্যূনতম স্তর প্রয়োজন যা ছোট মডেলগুলো ধারাবাহিকভাবে অতিক্রম করতে পারে না।
আমি যা দাবি করছি না: বড় মডেলগুলোই সবসময় ভালো অনুবাদক। সাধারণ নিয়ম হিসেবে আমার কাছে এর কোনো প্রমাণ নেই। তবে আমি যা লক্ষ্য করছি তা হলো: বিশেষ করে বাগধারার বিষয়বস্তুর ক্ষেত্রে, একই পরিবারের মডেল সংস্করণগুলোর মধ্যকার ব্যবধান আমার প্রত্যাশার চেয়ে বেশি ছিল।
যেসব ব্যবহারকারী এআই অনুবাদ টুল ব্যবহার করেন, তাদের বেশিরভাগই জানেন না যে তারা সেই এআই-এর কোন সংস্করণটি ব্যবহার করছেন। তারা একটি পণ্য খোলে, একটি ভাষা জোড়া নির্বাচন করে এবং একটি আউটপুট পায়। মডেল রাউটিং তাদের কাছে অদৃশ্য।
এটি স্কেলে গুরুত্বপূর্ণ। MachineTranslation.com একটি ৯০ দিনের সময়কালে শত শত হাজার হাজার ইংরেজি থেকে স্প্যানিশ অনুবাদ কাজ সম্পন্ন করেছে। যদি এই চাকরিগুলির একটি উল্লেখযোগ্য অংশ বাগধারাযুক্ত বিষয়বস্তুকে (বিপণন কপি, আইনি ভাষা, সাহিত্যিক পাঠ্য, সাধারণ যোগাযোগ) স্পর্শ করে এবং সেই চাকরিগুলি পরিচালনা করার সরঞ্জামটি ব্যবহারকারীদের অজ্ঞাতসারে একটি ছোট মডেলে নির্দেশিত করে, তবে বিড়ালকে জলের কাছে নিয়ে যাওয়া বাস্তব আউটপুটগুলিতে, বাস্তব নথিতে, বাস্তব মানুষের জন্য উপস্থিত হচ্ছিল যারা ফলাফলকে বিশ্বাস করেছিল।
অনুবাদ শিল্প বছরের পর বছর ধরে এআই সরবরাহকারীদের তুলনা করে আসছে। ডিপএল বনাম গুগল। ক্লড বনাম চ্যাটজিপিটি। সেই তুলনাগুলো দরকারী। কিন্তু একক প্রদানকারীর মধ্যেও, সংস্করণের পার্থক্য ততটাই গুরুত্বপূর্ণ হতে পারে — এবং এটি এমন একটি পার্থক্য যা বেশিরভাগ তুলনা কাঠামো পরিমাপ করে না কারণ তারা মডেল-সংস্করণ স্তরে পরীক্ষা করে না। যখন কেউ বলে আমি অনুবাদের জন্য চ্যাটজিপিটি ব্যবহার করি, সেই বাক্যটি অর্থপূর্ণ হওয়ার জন্য যথেষ্ট নির্দিষ্ট নয়।
কোন চ্যাটজিপিটি? Nano? 4o-mini? ৪.১-মিনি? 5.4? উত্তরটি এমনভাবে আউটপুট পরিবর্তন করে যা নগণ্য নয়, অন্তত বাগধারার বিষয়বস্তুর জন্য।
এটি সেই অংশ যা আমি সবচেয়ে আকর্ষণীয় বলে মনে করি, এবং আমি এখনও এটি থেকে কী তৈরি করব তা পুরোপুরি বের করতে পারিনি।
বাগধারার অনুবাদ তৈরি করা তিনটি মডেল তিনটি ভিন্ন অনুবাদ দিয়েছে:
তিনটিই llevarse el gato al agua-এর গ্রহণযোগ্য ইংরেজি অনুবাদ। কিন্তু তারা সমতুল্য নয়।
টু পুল ইট অফ কঠিনের বিরুদ্ধে কার্যকারিতাকে জোর দেয়, আপনি কঠিন কিছু করেছেন এবং এটি কাজ করেছে। নিজের ইচ্ছা পূরণ করা বোঝায় যে আপনি যা চেয়েছিলেন তা অর্জিত হয়েছে, তবে এর মধ্যেকার কষ্টের উপর কম জোর দেওয়া হয়। শীর্ষে আসা অন্যদের তুলনায় প্রতিযোগিতামূলক বিজয়, জয়কে জোর দেয়।
মূল স্প্যানিশ প্রবাদটি এগুলোর মধ্যে প্রথমটির সবচেয়ে কাছাকাছি। এই বাক্যাংশটি প্রতিরোধের উপর জয়লাভের অর্থ বহন করে, কেবল একটি ফলাফলকে প্রাধান্য দেওয়া এবং তা বাস্তবায়িত হওয়া নয়। কিন্তু নিজের ইচ্ছা পূরণ করা এবং শেষ পর্যন্ত জয়ী হওয়া ভুল নয়, তারা কেবল ভিন্ন ভিন্ন দিকে অস্পষ্ট।
এটি একটি প্রশ্ন উত্থাপন করে যা আমার কাছে সত্যিই কঠিন মনে হয়: যখন তিনটি মডেল প্রত্যেকেই একটি সঠিক কিন্তু ভিন্ন ভিন্ন বাগধারার অনুবাদ তৈরি করে, তখন আপনি কোনটি সেরা তা কীভাবে মূল্যায়ন করবেন? BLEU স্কোর একটি রেফারেন্স অনুবাদের সাথে তুলনা করে — কিন্তু রেফারেন্স কে লিখেছেন, এবং এই তিনটির মধ্যে কোনটি তারা বেছে নিতেন?
আমাদের এআই অনুবাদ এজেন্ট, তার কৃতিত্বের জন্য, কোনও আউটপুট প্রতিশ্রুতিবদ্ধ করার আগে সঠিক প্রশ্নটি জিজ্ঞাসা করেছিল: এই প্রসঙ্গে 'llevarse el gato al agua'-এর অভীষ্ট অর্থ কী? তিনটি বিকল্প প্রস্তাব করা হয়েছিল — একটি কঠিন লক্ষ্য অর্জন করা, অপ্রয়োজনীয় কিছু নেওয়া, অথবা ঝুঁকিপূর্ণ কার্যকলাপে জড়িত হওয়া। প্রশ্নটি আলংকারিক নয়। এটি সেই প্রক্রিয়া যার মাধ্যমে অনুবাদ চূড়ান্ত হওয়ার আগে প্রাসঙ্গিক অস্পষ্টতা সমাধান করা হয়।
কিন্তু মূল বিষয়টি হলো: তিনটি সঠিক উত্তর, অর্থের তিনটি ভিন্ন রূপ। অনুবাদ মূল্যায়ন সরঞ্জামগুলি এই ধরণের সূক্ষ্মতার জন্য তৈরি করা হয়নি । আমি এখনও জানি না
এই পরীক্ষাটি কী দেখায় তার সীমাবদ্ধতা সম্পর্কে আমি সৎ থাকতে চাই।
একটি বাগধারা, একটি ভাষা জুটি, একদিনের অভ্যন্তরীণ পরীক্ষা। সেটা কোনো গবেষণা নয়। এটি একটি পর্যবেক্ষণ। আমি জানি না এই প্যাটার্নটি (ছোট মডেলগুলি আক্ষরিক অর্থে এবং বড় মডেলগুলি বাগধারার অর্থ প্রকাশে পারদর্শী) ধারাবাহিকভাবে প্রযোজ্য কিনা:
আমি আরও জানি না যে এটি এই মডেলগুলির একটি স্থিতিশীল বৈশিষ্ট্য কিনা বা এটি আপডেট এবং ফাইন-টিউনিংয়ের সাথে পরিবর্তিত হয় কিনা। মডেল সরবরাহকারীরা অনুবাদ-নির্দিষ্ট চেঞ্জলগ প্রকাশ করে না। একটি মডেল সংস্করণ যা আজ llevarse el gato al agua সঠিকভাবে পরিচালনা করে, পরের মাসে আপডেট করা হতে পারে, এবং আমরা তা জানার কোনো উপায় থাকবে না।
আমি যা জানি: এই পরীক্ষাটি একটি আকর্ষণীয় ফলাফল তৈরি করেছে যে আমি আরও বেশি পরীক্ষা, আরও পদ্ধতিগতভাবে, আরও ভাষার জোড়া এবং বিষয়বস্তুর প্রকার জুড়ে চালাতে চাই। যখন আমার আরও কিছু বলার থাকবে, তখন আমি বলব।
এই পরীক্ষাটি আমাকে যে দুটি প্রশ্ন দিয়েছে, তা দিয়েই আমি শেষ করব। আমি তাদের উত্তর দেব না, আমার কাছে এখনও সেই ডেটা নেই। কিন্তু আমার মনে হয় এগুলো জিজ্ঞাসা করার মতো সঠিক প্রশ্ন।
প্রথমত: কোন প্যারামিটার থ্রেশহোল্ডে বাগধারাগত দক্ষতা নির্ভরযোগ্য হয়ে ওঠে?
GPT-4o-MINI এবং GPT-4.1-NANO (উভয়ই আক্ষরিক) থেকে GPT-4.1-MINI (বাগধারাগত) পর্যন্ত এই উল্লম্ফনটি ইঙ্গিত দেয় যে সেই মডেলগুলির আকারের মধ্যে প্যারামিটার পরিসরে কোথাও একটি থ্রেশহোল্ড রয়েছে যেখানে বাগধারা শনাক্তকরণ চালু হয়। এটা কি সামঞ্জস্যপূর্ণ? এটি কি সমস্ত ভাষার বাগধারার ক্ষেত্রে প্রযোজ্য, নাকি এটি প্রশিক্ষণের ডেটাতে একটি ভাষা কতটা ভালোভাবে উপস্থাপিত হয়েছে তার উপর নির্ভর করে? আমি জানি না। কিন্তু এটি জানা যেকোনো অনুবাদ কাজের প্রক্রিয়া তৈরি করার ক্ষেত্রে দরকারী হবে।
দ্বিতীয়ত: বড় পরিসরে মডেল সংস্করণের এই অস্পষ্টতার কারণে ব্যবহারকারীদের কী মূল্য দিতে হয়?
যদি কোনো ব্যবহারকারী প্রতি মাসে এমন একটি টুলের মাধ্যমে ১,০০০টি নথি পাঠান যা কোন মডেল সংস্করণটি ব্যবহার করা হচ্ছে তা প্রকাশ করে না (এবং সেই নথিগুলোর কিছুতে বাগধারা বা প্রচলিত অভিব্যক্তি থাকে), তবে কত ঘন ঘন এই আক্ষরিক অনুবাদের ব্যর্থতাটি অলক্ষ্যেই ঘটে চলেছে? তারা কীভাবে জানবে? বাস্তব অর্থে, এটি কখনই জানতে না পারার মূল্য কতটা?
আমার মনে হয় বর্তমানে প্রচলিত বেশিরভাগ "অনুবাদের জন্য কোন এআই সবচেয়ে ভালো" তুলনাগুলোর চেয়ে এটি অনেক বেশি গুরুত্বপূর্ণ একটি প্রশ্ন। উত্তরটি হল সবচেয়ে বড় মডেল ব্যবহার করুন নয়। উত্তরটি হতে পারে: আপনি কী ব্যবহার করছেন তা জানুন, আপনার নিজের বিষয়বস্তুর উপর নিজস্ব পরীক্ষা চালান, এবং ধরে নেবেন না যে একজন প্রদানকারীর নাম তাদের মডেল পরিসীমার জুড়ে সামঞ্জস্যপূর্ণ আচরণের নিশ্চয়তা দেয়।
অন্তত, আমি এই পরীক্ষা থেকে এটাই নিচ্ছি।
এই একক পরীক্ষার উপর ভিত্তি করে: একই এআই পরিবারের মধ্যে ছোট, দক্ষতা-অপ্টিমাইজ করা মডেলগুলি একটি সুপ্রতিষ্ঠিত স্প্যানিশ বাগধারার আক্ষরিক অনুবাদে ডিফল্ট হয়েছে, যখন একই মডেলের বড়/নতুন সংস্করণগুলি সঠিক বাগধারার রেন্ডারিং তৈরি করেছে। এইটি বিভিন্ন বাগধারা বিভাগ এবং ভাষার জোড়ার ক্ষেত্রে প্রযোজ্য কিনা তা পরবর্তী প্রশ্ন। আমি আরও পরীক্ষা
2.চালাব। কেন তিনটি সঠিক বাগধারার অনুবাদ তিনটি অর্থপূর্ণভাবে ভিন্ন ফলাফল তৈরি করেছে?
GPT-4.1-MINI, GPT-5.4-MINI, এবং GPT-5.4 সকলেই llevars el gato al agua বাগধারাটিকে আক্ষরিকভাবে অনুবাদ করেছে — কিন্তু ভিন্ন ভিন্ন ইংরেজি
অভিব্যক্তিতে যা সূক্ষ্মভাবে ভিন্ন অর্থ বহন করে। এটি ইঙ্গিত করেযে বাগধারার অনুবাদের গুণমানের অন্তত দুটি মাত্রা রয়েছে:মডেলটি আদৌ বাগধারাটি চিনতে পারে কিনা, এবং লক্ষ্য ভাষারউপলব্ধ বিকল্পগুলি থেকে এটি কোন সমতুল্য অভিব্যক্তি নির্বাচন করে। মানসম্মত অনুবাদের গুণমান পরিমাপকগুলি এই দুটি মাত্রাকে স্পষ্টভাবে আলাদা করে না। আমার মনে হয় তাদের উচিত।
এই পোস্টটি MachineTranslation.com-এর ডেভেলপমেন্ট প্ল্যাটফর্মে অভ্যন্তরীণ পরীক্ষার উপর ভিত্তি করে তৈরি। এখানে প্রদর্শিত মাল্টি-মডেল সংস্করণ পরীক্ষা এখনও সর্বজনীনভাবে উপলব্ধ নয়। আমি এই তথ্যটি শেয়ার করছি কারণ আমার মনে হয় এই পর্যবেক্ষণটি আপনার অনুবাদের কাজ যেখানেই হোক না কেন তা দরকারী।