July 10, 2026
দুটি শব্দ। ছয়টি মডেল। তিনটি ভিন্ন অনুবাদ সিদ্ধান্ত। এখানে দেখুন কী ঘটেছিল যখন আমি MachineTranslation.com-এ উপলব্ধ সর্বশেষ AI মডেলগুলির মাধ্যমে 8টি পরীক্ষামূলক বাক্য চালিয়েছিলাম, এবং আউটপুটগুলি আসলে কখন একটি মডেল নীরবে ব্যর্থ হয় সে সম্পর্কে কী প্রকাশ করে।
দুটি শব্দ। ওটা দুর্দান্ত। ছয়টি মডেল। তিনটি স্বতন্ত্র অনুবাদ সিদ্ধান্ত।
জাপানিতে, একটি মডেল এটিকে それはやばい হিসাবে রেন্ডার করেছিল, অস্পষ্টতা সংরক্ষণ করে। আরেকজন বিষয় সর্বনাম সম্পূর্ণভাবে বাদ দিয়ে খালি রূপ やばい লিখেছেন, যা সম্ভাব্য সবচেয়ে কথ্য সংস্করণ। একজন তৃতীয় ব্যক্তি লিখেছেন それはすごい, যা সম্পূর্ণভাবে "অসাধারণ" এর পক্ষে দ্বিধা দূর করে, সেই দ্বৈত অর্থ বাদ দেয় যা বাক্যটিকে আকর্ষণীয় করে তুলেছিল। ভিয়েতনামীয় ভাষায়, একটি মডেল লিখেছে ঠিক আছে (স্ল্যাং, যুব নিবন্ধনের জন্য সঠিক)। আরেকজন লিখেছেন সত্যিই দুর্দান্ত, ব্যাকরণগতভাবে সঠিক, কিন্তু যখন কেউ আপনাকে একটি মেম পাঠায় তখন "এটি সত্যিই অসাধারণ" বলার কাছাকাছি।
এই সবগুলি রক্ষণযোগ্য। তাদের কেউই একই জিনিস নয়। এবং যদি আপনি একটি একক মডেলের মাধ্যমে অনুবাদ চালাচ্ছেন, তাহলে আপনি আপনার পক্ষে যে পছন্দটি করা হয়েছিল তা কখনও দেখতে পাবেন না।
এটি এই নিবন্ধটি যে কেন্দ্রীয় প্রশ্নের উত্তর দেওয়ার চেষ্টা করছে। ২০২৬ সালে অনুবাদের জন্য কোন এআই মডেল সেরা তা নয় (উত্তর ভাষার জোড়া, রেজিস্টার, ডোমেইন এবং বাক্য কাঠামোর উপর নির্ভর করে), বরং: আপনার মডেল যখন ভুল সিদ্ধান্ত নিয়েছে তখন আপনি কীভাবে জানবেন? বিশেষত চিকিৎসা পরিভাষা, আইনি চুক্তি বা পেশাদার আনুষ্ঠানিকতার মতো ডোমেইনে, যেখানে ভুল সিদ্ধান্ত একটি সঠিক অনুবাদের মতো দেখায় যতক্ষণ না একজন বিশেষজ্ঞ এটি পড়েন।
আমি এটি করেছি। আমি ৮টি পরীক্ষামূলক বাক্য দুটি রাউন্ড মডেলের মধ্য দিয়ে MachineTranslation.com-এ চালিয়েছি: প্রথমে ৫টি ব্যাপকভাবে ব্যবহৃত মডেলের একটি ভিত্তিরেখা, তারপর একটি সম্প্রসারিত পুল যা এখন পেইড ব্যবহারকারীদের জন্য উপলব্ধ সর্বশেষ প্রিমিয়াম-স্তরের মডেল ভেরিয়েন্টগুলির কয়েকটি যোগ করে। সাধারণত, এই ধরনের মডেল থেকে আউটপুট তুলনা করার অর্থ প্রতিটি প্রদানকারীর সাথে আলাদা আলাদা পেইড সাবস্ক্রিপশন থাকা। MachineTranslation.com-এ, তারা একই তুলনা ভিউতে বসে আছে। ভাষার জোড়গুলি ছিল English→Japanese এবং English→Vietnamese। বাক্য বিভাগগুলি বিশেষভাবে চাপ-পরীক্ষার জন্য নির্বাচন করা হয়েছিল এমন ক্ষেত্রগুলি যেখানে মডেল মতবিরোধ সবচেয়ে গুরুত্বপূর্ণ: প্রাসঙ্গিক বাক্যাংশ, আইনি পরিভাষা, চিকিৎসা পরিভাষা, আনুষ্ঠানিকতা-সংবেদনশীল প্রসঙ্গ এবং ইচ্ছাকৃত অর্থগত অস্পষ্টতা।
মূল্যায়ন পদ্ধতি সম্পর্কে একটি নোট: মেশিন অনুবাদ গবেষণা দীর্ঘকাল ধরে আউটপুট স্বয়ংক্রিয়ভাবে কীভাবে স্কোর করতে হয় তা নিয়ে সংগ্রাম করেছে। BLEU এবং COMET এর মতো মেট্রিক্স যা WMT শেয়ার্ড টাস্কে পরিমাপ করা হয় তা দরকারী সামগ্রিক সংকেত প্রদান করে, কিন্তু তারা রেজিস্টার ত্রুটি, বাগধারা ব্যর্থতা এবং পরিভাষাগত নির্ভুলতা সনাক্ত করতে দুর্বল, যা ঠিক এখানে সবচেয়ে গুরুত্বপূর্ণ বিভাগ। আপনি যা পড়তে চলেছেন তা আউটপুট বিশ্লেষণ, BLEU রেস নয়।

প্রতিটি বাক্য অর্থপূর্ণ মতবিরোধ প্রকাশ করে না। আটটি পরীক্ষার মধ্যে দুটি, "এই ডিলটি নিষ্পত্তির পরে একবার যোগাযোগ করি" (→ জাপানি) এবং "এই লঞ্চ তারিখটি পূরণ করতে আমরা মধ্যরাতের তেল পুড়িয়ে ফেলছি" (→ ভিয়েতনামী), উভয় রাউন্ড জুড়ে উচ্চ চুক্তি তৈরি করেছে। প্রবাদগুলি সঠিকভাবে প্রবাদ হিসাবে বোঝা হয়েছিল। কেউ "touch base" কে শারীরিক ভাবে একটি বেস স্পর্শ করা হিসাবে অনুবাদ করেনি। কেউ "the dust settles" কে পলি পড়া হিসেবে অনুবাদ করেনি।
এটি নিয়ে থেমে থাকা মূল্যবান: ইডিওম্যাটিক ইংরেজি ব্যবসায়িক ভাষা যখন ইডিয়ম যথেষ্ট সাধারণ হয় তখন বর্তমান সীমান্ত মডেলগুলি দ্বারা যুক্তিসঙ্গতভাবে ভালভাবে পরিচালিত হয়। "touch base" এর ঐক্যমত উভয় রাউন্ড জুড়ে স্থিতিশীল ছিল; পরিবর্তন সম্পূর্ণভাবে শৈলীগত ছিল, এই বিষয় (এই বিষয়), এই ডিল (এই চুক্তি), বা এই কেস (এই ক্ষেত্রে) ব্যবহার করার চারপাশে উৎস বাক্যাংশের জন্য।

"মধ্যরাতের তেল জ্বালানো" পরীক্ষাটি এখানেই আরও আকর্ষণীয় হয়ে ওঠে। একটি ছাড়া প্রতিটি মডেল সঠিকভাবে এই বাগধারাটি বুঝতে পেরেছে। MiniMax M2.7, Round 2 এ প্রবর্তিত, "burning" কে আক্ষরিকভাবে অনুবাদ করেছে, যা đốt đuốc তৈরি করেছে, যার অর্থ "জ্বলন্ত মশাল।" ঐকমত্য এটি সঠিকভাবে বাদ দিয়েছে।

জাপানি একটি আনুষ্ঠানিকতা-স্তরযুক্ত ভাষা। ক্রিয়াপদের সমাপ্তি, সর্বনাম এবং নির্দেশক বিশেষ্য রূপের পছন্দ শৈলীগত নয়। এটি বক্তা এবং প্রাপকের মধ্যে সম্পর্ক নির্দেশ করে। আপনার সিইওকে অনানুষ্ঠানিক ক্রিয়াপদ ব্যবহার করে বার্তা পাঠানো ব্যাকরণগত অর্থে অনুবাদ ত্রুটি নয়। এটি একটি সামাজিক ত্রুটি, এবং একটি উল্লেখযোগ্য।
পরীক্ষার বাক্য: এটা পাঠিয়ে দিতে পারবেন? ধন্যবাদ, এটি প্রশংসা করি। প্রসঙ্গ: একজন সিইওকে বার্তা পাঠানো।

মডেল পুল সম্প্রসারিত হলে ঐক্যমত পরিবর্তিত হয়েছিল। প্রক্রিয়াটি সরল: যে মডেলগুলি সঠিকভাবে আনুষ্ঠানিকতার প্রসঙ্গ পড়তে পারে তা যোগ করা সংখ্যাগরিষ্ঠতা পরিবর্তন করেছে, এবং ঐক্যমত অনুসরণ করেছে। এখানে রাউন্ড 2-এ মডেলগুলি যা তৈরি করেছে তার সম্পূর্ণ বর্ণালী রয়েছে:

ভিয়েতনামী রেজিস্টার পরীক্ষা একটি ভিন্ন ধরনের আনুষ্ঠানিকতার ত্রুটি প্রকাশ করেছিল, যা আরও সূক্ষ্ম। উৎস বাক্য: "হেই, একটা দ্রুত প্রশ্ন — তুমি কি একটা কল করার জন্য ফ্রি আছো?" **প্রসঙ্গ: একজন ক্লায়েন্টকে বার্তা পাঠানো।** প্রথম রাউন্ডে Qwen "mình" অন্তর্ভুক্ত করেছিল, যা একটি প্রথম-ব্যক্তি সর্বনাম যা নৈমিত্তিক সমবয়সী-স্তরের বন্ধুত্ব নির্দেশ করে। অন্যান্য প্রতিটি মডেল প্রথম-ব্যক্তি স্ব-উল্লেখ সম্পূর্ণরূপে এড়িয়ে গেছে, যা নিরাপদ পেশাদার পছন্দ। গুরুত্বপূর্ণভাবে, Qwen এটি Round 2-এ সংশোধন করেছে এবং "mình" বাদ দিয়েছে। উভয় রাউন্ডে সর্বসম্মতি এটিকে বাদ দিয়েছে।

বিক্রেতা/ক্লায়েন্ট ক্ষতিপূরণ বাক্য বাণিজ্যিক চুক্তিতে একটি মান ধারা: "বিক্রেতা এই চুক্তির লঙ্ঘনের ফলে উদ্ভূত যেকোনো তৃতীয় পক্ষের দাবি থেকে ক্লায়েন্টকে ক্ষতিপূরণ করবে।"
রাউন্ড ১-এ, সবগুলো মডেল সঠিকভাবে আইনি রেজিস্টার শনাক্ত করেছে এবং ধার করা শব্দ ベンダー (বিক্রেতা) এবং クライアント (ক্লায়েন্ট) ব্যবহার করেছে, যা ইংরেজি উৎসের জাপানি বাণিজ্যিক চুক্তিতে প্রমিত। একটি ব্যতিক্রম: GPT-4.1-NANO ব্যবহার করেছে 販売者 (বিক্রেতা) এবং 顧客 (গ্রাহক), বৈধ জাপানি শব্দ যা ঋণশব্দ সমতুল্যগুলির আনুষ্ঠানিক আইনি নির্দিষ্টতার অভাব রাখে।
আরও গুরুত্বপূর্ণ আবিষ্কার রাউন্ড ২-এ উদ্ভূত হয়েছিল। মূল পার্থক্য দুটি শব্দের মধ্যে:
এগুলি আইনিভাবে ভিন্ন ধারণা। "ইনডেমনিফাই" বিশেষভাবে একটি পক্ষকে তৃতীয় পক্ষের দায়বদ্ধতা থেকে রক্ষা করা অর্থ বোঝায়। 免責 হল সঠিক আইনি শব্দ। সমস্ত রাউন্ড ১ মডেলগুলি 補償 ব্যবহার করেছে। রাউন্ড ২-তে, DeepSeek V4-Pro ছিল একমাত্র মডেল যা 免責 তৈরি করেছিল, এবং এটি শুধুমাত্র রাউন্ড ২-তে করেছিল, রাউন্ড ১-তে নয়।

একটি চুক্তিতে, 補償 এবং 免責 সমার্থক নয়। একটি মানে "আমরা আপনাকে অর্থ ফেরত দেব।" অন্যটির অর্থ "আপনি প্রথম স্থানে দাবি থেকে সুরক্ষিত।" যদি একটি অনুবাদ প্ল্যাটফর্ম 補償 ব্যবহার করে যেখানে 免責 সঠিক, তাহলে জাপানি সংস্করণ পড়া একজন আইনজীবী ইংরেজি সংস্করণ যা বর্ণনা করে তার মতো একই চুক্তি দেখতে পাবেন না।
এটি ডেটাসেটে সবচেয়ে গুরুত্বপূর্ণ আবিষ্কার। পরীক্ষার বাক্য: "এই ওষুধটি হেপাটিক বৈকল্য়ের ইতিহাস সহ রোগীদের ক্ষেত্রে contraindicated।" উৎস: ক্লিনিক্যাল পণ্য ডকুমেন্টেশন। লক্ষ্য: ভিয়েতনামী।
গুরুত্বপূর্ণ পদটি হল "হেপাটিক বৈকল্য।" দুইজন ভিয়েতনামী প্রার্থী রয়েছেন:
এগুলি ক্লিনিক্যালি স্বতন্ত্র। "হেপাটিক ইমপেয়ারমেন্ট" এর উপর ভিত্তি করে একটি পরিপন্থী সতর্কতা শুধুমাত্র যারা সম্পূর্ণ অঙ্গ ব্যর্থতা অনুভব করেছেন তাদের নয়, বরং যে কেউ লিভার ফাংশন হ্রাস পেয়েছে তাদের জন্য প্রযোজ্য। suy gan ব্যবহার করে নির্দেশিত জনসংখ্যাকে ভুলভাবে সংকুচিত করে। মধ্যম হেপাটিক দুর্বলতা সম্পন্ন একজন রোগী যিনি suy gan পড়েন তারা নিজেদেরকে contraindicated জনসংখ্যা হিসাবে চিনতে পারেন না।

কিছু উৎস বাক্য ডিজাইন অনুযায়ী অস্পষ্ট। আধুনিক ইংরেজি স্ল্যাঙ্গে "That's sick" মানে কিছু চমৎকার, কিন্তু এটি এখনও এর আক্ষরিক অর্থও বহন করে (অর্থাৎ বমিবমি/ঘৃণ্য), এবং এই দুটি অর্থের মধ্যে উত্তেজনা হল কীভাবে বাক্যাংশটি যোগাযোগ করে তার একটি অংশ। একটি অনুবাদ মডেলের জন্য চ্যালেঞ্জ হল: আপনি কি অস্পষ্টতা সংরক্ষণ করেন, এটিকে সবচেয়ে সম্ভাব্য অর্থে সংকুচিত করেন, নাকি একটি বেছে নিয়ে প্রতিশ্রুতিবদ্ধ হন?


এই পরীক্ষায় থাকা মডেলগুলি সবই সমতুল্য নয়। তারা বিভিন্ন আর্কিটেকচার, প্রশিক্ষণ পদ্ধতি এবং স্থাপনার প্রেক্ষাপট জুড়ে বিস্তৃত। রাউন্ড ১ বেসলাইনে এমন মডেল রয়েছে যা ব্যাপকভাবে অ্যাক্সেসযোগ্য। সম্প্রসারিত রাউন্ড ২ পুল এখন MachineTranslation.com-এ পেয়িং ব্যবহারকারীদের জন্য উপলব্ধ বেশ কয়েকটি নতুন প্রিমিয়াম-স্তরের মডেল ভেরিয়েন্ট যোগ করে, যা অন্যথায় প্রতিটি স্বতন্ত্র প্রদানকারীর সাথে একটি পৃথক পেয়িড অ্যাকাউন্ট মানে হবে।

রাউন্ড ২-এ সম্প্রসারিত পুল এমন মডেলগুলি অন্তর্ভুক্ত করে যা আরও উন্নত এবং MachineTranslation.com-এ পেয়িং ব্যবহারকারীদের জন্য উপলব্ধ। পুলটি সম্প্রসারিত করার প্রভাব সমান নয়। কিছু পরীক্ষায় (আনুষ্ঠানিকতা/জাপানি), এটি ঐকমত্যকে অর্থপূর্ণভাবে পরিবর্তন করেছে। অন্যদের ক্ষেত্রে (চিকিৎসা পরিভাষা/ভিয়েতনামীয়), বিভাজন আরও গভীর হয়েছে।

পরীক্ষার ডেটা দুটি স্বতন্ত্র ব্যর্থতার বিভাগ নির্দেশ করে, এবং তাদের বিভিন্ন প্রতিক্রিয়া প্রয়োজন।
বিভাগ A: নীরব ব্যর্থতা। আনুষ্ঠানিকতার ত্রুটি, নিবন্ধন ত্রুটি, চিকিৎসা পরিভাষার নির্ভুলতা: এগুলি এমন আউটপুট তৈরি করে যা সঠিক দেখায়। জাপানি ভাষা ব্যাকরণগতভাবে সঠিক। ভিয়েতনামী ব্যক্তি সাবলীল। কোনো পৃষ্ঠতল সংকেত নেই যে কিছু ভুল হয়েছে। একজন একভাষিক ব্যবহারকারী একটি একক মডেলের আউটপুট পড়ে এমন কোনো উপায় নেই যে মডেলটি একটি রেজিস্টার পছন্দ করেছে যা একজন সিনিয়র জাপানি নির্বাহী লক্ষ্য করবে, বা একটি ক্লিনিক্যাল শব্দ এমনভাবে সংকুচিত হয়েছে যা এটি প্রযোজ্য জনসংখ্যা পরিবর্তন করে।
বিভাগ খ: দৃশ্যমান ব্যর্থতা। MiniMax "burning the midnight oil" কে "burning torches" হিসাবে অনুবাদ করছে। GPT-4.1-NANO "That's sick" কে স্পষ্ট "すごい" এ সমাধান করছে। এগুলি সনাক্ত করা যায়, হয় লক্ষ্য ভাষার একজন বক্তা দ্বারা বা অন্যান্য মডেল আউটপুটের সাথে তুলনার মাধ্যমে।
SMART যে মাল্টি-মডেল তুলনা প্রদান করে তা বিভাগ A-তে সবচেয়ে মূল্যবান। যখন পাঁচটি বা দশটি মডেল আউটপুট তৈরি করে এবং বেশিরভাগ একটি আনুষ্ঠানিক রেজিস্টারে সম্মত হয় যখন একটি নৈমিত্তিক সাধারণ-ফর্ম জাপানি তৈরি করে, তখন মতবিরোধটি তুলনা দৃশ্যে দৃশ্যমান হয়। লক্ষ্য ভাষায় কথা বলা একজন ব্যবহারকারী বিকল্পগুলি মূল্যায়ন করতে পারেন। একজন ব্যবহারকারী যিনি দেখতে পারেন না যে একটি বিতর্কিত সিদ্ধান্ত নেওয়া হয়েছে, এবং সিদ্ধান্ত নিতে পারেন যে সেই বাক্যটি মানব পর্যালোচনার যোগ্য কিনা।
ডকুমেন্ট-স্কেল কাজের জন্য, বড় ফাইল, লেআউট-সংরক্ষণকারী পিডিএফ অনুবাদ, চুক্তি, বা ক্লিনিকাল উপকরণের জন্য, প্ল্যাটফর্মের ডকুমেন্ট প্রসেসিং ক্ষমতা ফর্ম্যাটিং ভেঙে না দিয়ে ফাইল কাঠামো পরিচালনা করে। কিন্তু উপরে উত্থাপিত গুণমান সম্পর্কিত প্রশ্নগুলি ফাইলের আকার নির্বিশেষে প্রযোজ্য। একটি ১০০-পৃষ্ঠার ক্লিনিকাল গবেষণা যেখানে "হেপাটিক দুর্বলতা" এর প্রতিটি উদাহরণ "লিভার ব্যর্থতা" হিসাবে অনুবাদ করা হয় তা পরীক্ষা ২-এ চিহ্নিত করা একই সমস্যার একটি বৃহত্তর সংস্করণ।
চিকিৎসা এবং আইনি বিভাগের জন্য বিশেষভাবে, মানব যাচাইকরণ সঠিক ব্যাকস্টপ। টোমেডেস' এআই পোস্ট-এডিটিং সেবা, যা এআই আউটপুটকে প্রত্যয়িত মানব পর্যালোচনার সাথে যুক্ত করে ঠিক এই ধরনের উচ্চ-ঝুঁকিপূর্ণ সামগ্রীর জন্য, এটির জন্য তৈরি করা হয়েছে। সুই গ্যান / সুই গিয়াম চুক নাং গ্যান বিভাজন ঠিক সেই ধরনের আবিষ্কার যা সেই পর্যালোচনা ট্রিগার করা উচিত, শুধুমাত্র কারণ সমস্ত মডেল ভুল নয়, বরং যে মডেলগুলি সবচেয়ে আত্মবিশ্বাসী তারা সবচেয়ে নির্ভুল নয়।
একাধিক আউটপুট দেখার মূল্য এটি নয় যে আপনি সর্বদা সংখ্যাগরিষ্ঠতা বেছে নেবেন। এটি হল যে আপনি জানবেন একটি পছন্দ করা হয়েছে, যা আপনার সামনে থাকা আউটপুটটি সঠিক বলে ধরে নেওয়া থেকে আলাদা।

আটটি পরীক্ষাকে পাশাপাশি রাখুন এবং একটি প্যাটার্ন ধরে রাখে: সম্মতি এবং মতবিরোধ এলোমেলোভাবে বিতরণ করা হয় না। প্রতিটি মডেলে প্রায় সর্বত্র, উভয় রাউন্ডে, প্রাসঙ্গিক, দৈনন্দিন ব্যবসায়িক ভাষা ("টাচ বেস," "মধ্যরাতের তেল পোড়ানো") একত্রিত হয়েছিল। আনুষ্ঠানিকতা, আইনি নির্ভুলতা এবং চিকিৎসা পরিভাষা ছিল না। সিইও-আনুষ্ঠানিকতা পরীক্ষা সম্প্রসারিত পুল অন্তর্ভুক্ত করার পরেই নৈমিত্তিক থেকে আনুষ্ঠানিকে রূপান্তরিত হয়েছিল। ক্ষতিপূরণ ধারাটি একটি বাস্তব আইনি পার্থক্য (দায়মুক্তি বনাম ক্ষতিপূরণ) প্রকাশ করেছিল যা শুধুমাত্র একটি মডেল, একটি রাউন্ডে, সঠিকভাবে বুঝেছিল। চিকিৎসা পরিভাষার বিভাজন কখনও সমাধান হয়নি, উভয় রাউন্ডে পুল-এ কোন মডেল থাকুক না কেন মোটামুটি ৬-থেকে-৪ অনুপাতে থেকেছে।
এটি প্রকৃত অনুসন্ধান, বিপণন দাবি নয়: ঐকমত্য প্রতিটি বাক্যকে আরও ভাল করে না, এবং এটি করার প্রয়োজন নেই। এটি সবচেয়ে মূল্যবান ঠিক সেখানে যেখানে একটি একক মডেলের সাবলীলতা আপনাকে এটি সন্দেহ করার কোনো কারণ দেয় না, এবং যেখানে ভুল হওয়া আসলে কিছু খরচ করে।
এই পরীক্ষায় একটি দ্বিতীয়, আরও ব্যবহারিক স্তর রয়েছে যা স্পষ্টভাবে বলার যোগ্য। এই তুলনা নিজে চালানোর অর্থ ছিল GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo এবং MiniMax M2.7 এর আউটপুটগুলি বিদ্যমান বেসলাইন মডেলগুলির সাথে একই জায়গায়, একটি প্ল্যাটফর্মে পাশাপাশি পরীক্ষা করা। MachineTranslation.com এর বাইরে, এটি একটি সাবস্ক্রিপশন নয়। এটি বেশ কয়েকটি, প্রতিটি প্রদানকারীর জন্য একটি যার প্রিমিয়াম স্তর আপনি পরীক্ষা করতে চান, যাই হোক না কেন প্রতিটি প্রদানকারী স্বতন্ত্রভাবে চার্জ করে। এখানে পেয়িং ব্যবহারকারীরা একটি ক্লিকে একই তুলনা পান, পাঁচটি আলাদা প্রিমিয়াম সাবস্ক্রিপশন বজায় রাখার খরচের একটি ভগ্নাংশে, যা সত্যিই গুরুত্বপূর্ণ তা ছাড়াই: মডেলগুলি কোথায় একমত তা দেখা এবং ঠিক কখন তারা তা জানা নয়।
কোনটিই স্পষ্টভাবে ভাল নয়; এটি পরীক্ষার বিভাগের উপর নির্ভর করে। Claude Sonnet এবং Claude Opus ধারাবাহিকভাবে আরও নির্ভুল ভিয়েতনামী চিকিৎসা শব্দ বেছে নিয়েছে, এবং Claude Opus "That's sick" এর জন্য সবচেয়ে উপযুক্ত স্ল্যাং তৈরি করেছে। কিন্তু Claude Sonnet একটি আনুষ্ঠানিক CEO-প্রসঙ্গ বাক্যে নৈমিত্তিক জাপানি ভাষাও তৈরি করেছে, যেখানে GPT-5.5 এটি সঠিকভাবে পেয়েছে। আউটপুট সরাসরি তুলনা করা একটি মডেল বেছে নিয়ে এটিতে বিশ্বাস করার চেয়ে আরও প্রতিরক্ষাযোগ্য।
একটি নেই; নির্ভুলতা ডোমেইন-নির্ভর। এই পরীক্ষায় Gemini 3.5-Flash এবং GLM-5-Turbo সবচেয়ে উপযুক্ত আনুষ্ঠানিক জাপানি ভাষা তৈরি করেছে। উভয় ক্লড মডেল ভিয়েতনামী চিকিৎসা পরিভাষায় সবচেয়ে নির্ভুল ছিল। DeepSeek V4-Pro একমাত্র মডেল যা সঠিক জাপানি আইনি শব্দ ব্যবহার করেছিল, কিন্তু শুধুমাত্র রাউন্ড 2-এ, এবং এটি অন্যত্র নৈমিত্তিক জাপানি তৈরি করেছিল। কোনো একক মডেল আটটি পরীক্ষা জুড়ে আধিপত্য বিস্তার করেনি।
না, স্বয়ংক্রিয়ভাবে নয়। নতুন প্রিমিয়াম-স্তরের মডেল ভেরিয়েন্টগুলির সাথে পুলটি সম্প্রসারিত করা জাপানি আনুষ্ঠানিকতা পরীক্ষায় ঐক্যমতকে নৈমিত্তিক থেকে আনুষ্ঠানিকে স্থানান্তরিত করেছে। কিন্তু ভিয়েতনামী চিকিৎসা পরিভাষা পরীক্ষায়, কোন মডেল অন্তর্ভুক্ত করা হোক না কেন, বিভাজন মোটামুটি ৬-থেকে-৪ অনুপাতে বজায় ছিল। আরও মডেল আরও মতবিরোধ প্রকাশ করে, যা একটি দরকারী সংকেত, কিন্তু ঐকমত্য এখনও সংখ্যাগরিষ্ঠতা অনুসরণ করে, এবং সংখ্যাগরিষ্ঠতা সর্বদা সবচেয়ে নির্ভুল উত্তর নয়।
SMART হল MachineTranslation.com এর মাল্টি-মডেল ঐকমত্য সিস্টেম, যা OpenAI, Anthropic, Google এবং DeepSeek সহ প্রদানকারীদের জুড়ে 22টি পর্যন্ত AI মডেল বিস্তৃত। এটি একযোগে একাধিক মডেলের মাধ্যমে অনুবাদ চালায় এবং প্রতিটি পৃথক মডেলের উত্তরের পাশাপাশি সংখ্যাগরিষ্ঠ-সম্মতির আউটপুট প্রদর্শন করে, ডিফল্টরূপে, কোনো কনফিগারেশনের প্রয়োজন ছাড়াই। ঐক্যমত পরিবর্তিত হয় যখন মডেল পুল পরিবর্তিত হয়, যেমনটি এই পরীক্ষার জাপানি আনুষ্ঠানিকতার ফলাফলে দেখা যায়: রাউন্ড ১-এ একটি নৈমিত্তিক ঐক্যমত রাউন্ড ২-এ আনুষ্ঠানিক হয়ে উঠেছে।
কোন একক মডেল নয়; মানব পর্যালোচনা আরও ভাল উত্তর। Claude মডেলগুলি ধারাবাহিকভাবে আরও নির্ভুল ভিয়েতনামী চিকিৎসা পদ্ধতি বেছে নিয়েছে, এবং DeepSeek V4-Pro একাই সঠিক জাপানি আইনি পদ্ধতি ব্যবহার করেছে, কিন্তু শুধুমাত্র রাউন্ড 2-এ। চিকিৎসা পরিভাষার বিভাজন ১০টি মডেল জুড়ে কখনও সমাধান হয়নি, যা সংকেত দেয় যে একটি ভিন্ন মডেল বেছে নেওয়া উচিত নয় বরং ডোমেইন দক্ষতার প্রয়োজন। একটি প্রত্যয়িত মানব পোস্ট-এডিটিং পর্যালোচনা, যেমন টোমেডস অফার করে, সেই বিশেষজ্ঞ পরীক্ষা প্রদান করে।