June 5, 2026
மொழிபெயர்ப்புத் துறையில் நாம் போதுமான அளவு பேசாத ஒன்றைப் பற்றி நான் உள் சோதனைகளைச் செய்து வருகிறேன் : வெவ்வேறு AI அமைப்புகள் வித்தியாசமாக மொழிபெயர்க்கின்றனவா என்பது அல்ல, ஆனால் ஒரே AI இன் வெவ்வேறு பதிப்புகள் வித்தியாசமாக மொழிபெயர்க்கின்றனவா — எவ்வளவு வித்தியாசமாக என்பதைப் பற்றியது.
கடந்த வாரம் நான் மெஷின் டிரான்ஸ்லேஷன்.காம் இன் உள் சோதனை தளத்தில் ஒரே நேரத்தில் ஐந்து ChatGPT பதிப்புகள் வழியாக ஒரு ஸ்பானிஷ் சொற்றொடரை இயக்கினேன். என்ன வந்தது என்பது என்னை நிறுத்தியது.
இரண்டு பதிப்புகள் ஒரு மொழிபெயர்ப்பை உருவாக்கின, அது உண்மையாகவே, ஆங்கிலத்தில் அர்த்தமற்றது. மூன்று பதிப்புகள் சரியான மரபுவழி மொழிபெயர்ப்புகளை உருவாக்கின. மேலும் அந்த மூன்று சரியானவை ஒன்றுக்கொன்று உடன்படவில்லை.
ஐந்துமே சாட்ஜிபிடி ஆகும். ஐந்துமே OpenAI ஆகும். அதே AI, வேறு மாதிரி — மற்றும் வெளியீடுகள் மிகவும் வித்தியாசமாக இருக்க முடியாது.
நான் இதை இப்போது பகிர்கிறேன், ஏனென்றால் அது முக்கியம் என்று நான் நினைக்கிறேன், என்னிடம் தெளிவான பதில்கள் இருப்பதால் அல்ல. எனக்கு இல்லை. ஆனால் இந்த கவனிப்பு உலகிற்கு அறிமுகப்படுத்த போதுமான சுவாரஸ்யமானது. உள்ளடக்க அட்டவணை
நான் சோதித்த சொற்றொடர் llevarse el gato al agua.

ஒவ்வொரு பதிப்பும் என்ன கொடுத்தது என்பது இங்கே:
| மாதிரி | வெளியீடு | சொற்றொடர் போல் உள்ளதா? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | பூனையை தண்ணீருக்கு கொண்டு செல் | ❌ நேரடிப் பொருள் |
| ChatGPT::GPT-4.1-NANO | பூனையை தண்ணீருக்கு கொண்டு செல் | ❌ நேரடிப் பொருள் |
| ChatGPT::GPT-4.1-MINI | வெற்றிகரமாக முடி | ✅ சரி |
| ChatGPT::GPT-5.4-MINI | தங்கள் வழியில் செல் | ✅ பகுதி |
| ChatGPT::GPT-5.4 | மேலோங்கி நில் | ✅ சரி |
இந்த சொற்றொடரின் பொருள், சாத்தியமற்றதாகத் தோன்றும் ஒன்றில் வெற்றி பெறுவது, கடினமான வெற்றியைப் பெறுவது என்பதாகும். பூனைகள் அல்லது தண்ணீருடன் இதற்கு எந்த சம்பந்தமும் இல்லை. நேரடி மொழிபெயர்ப்பு மொழிபெயர்ப்பு அல்ல. இது ஒரு சொற்றொடரின் வார்த்தைக்கு வார்த்தையான படியெடுத்தல் ஆகும், அதை ஒரு மரபுத்தொடராக மாதிரி அங்கீகரிக்கத் தவறிவிட்டது.
GPT-4o-MINI மற்றும் GPT-4.1-NANO ஒரே மாதிரியான வெளியீடுகளை உருவாக்கின. ஒத்ததாக இல்லை, ஒரே மாதிரியாக. எங்கள் மொழிபெயர்ப்பு நுண்ணறிவு இதை நேரடியாகக் கொடியிட்டது: GPT-4.1-nano மற்றும் GPT-4o-mini ஆகியவை ஒரே மாதிரியான மொழிபெயர்ப்புகளைப் பகிர்ந்து கொள்கின்றன, இது சொற்றொடர்களின் அர்த்தத்தை விட நேரடிப் பொருளுக்கு முக்கியத்துவம் அளிக்கிறது. GPT-4.1-MINI, GPT-5.4-MINI, மற்றும் GPT-5.4 ஆகியவை ஒவ்வொன்றும் அங்கீகரிக்கக்கூடிய வகையில் சரியான ஒன்றை உருவாக்கின — ஆனால் ஒன்றுக்கொன்று வேறுபட்டவை.
நான் ஏன் llevarse el gato al agua ஒரு தேர்ந்தெடுக்கப்பட்ட ஒன்றை விட பயனுள்ள சோதனை உள்ளீடாக இருக்கிறது என்பதைப் பற்றி துல்லியமாக இருக்க விரும்புகிறேன்.
இது ஒரு நன்கு நிறுவப்பட்ட சொற்றொடர். இது இலக்கியம், இதழியல், மற்றும் அன்றாட பேச்சில் தோன்றுகிறது. அது மறைவாக இல்லை. ஸ்பானிஷ் உரையின் நியாயமான தொகுப்பில் பயிற்சி பெற்ற எந்த மாதிரியும் அதை எதிர்கொண்டிருக்க வேண்டும். மாதிரி அந்த சொற்றொடரைப் பார்த்ததா இல்லையா என்பது கேள்வி அல்ல. அது என்ன செய்கிறது என்பதுதான் கேள்வி. சொற்றொடர் மொழிபெயர்ப்பில் மிக மோசமான தோல்வி முறை ஒரு மோசமான மொழிபெயர்ப்பை உருவாக்குவது
அல்ல. இது இலக்கு மொழியை அறியாத ஒருவருக்கு ஏற்றுக்கொள்ளக்கூடியதாகத் தோன்றும் ஒரு நேரடி மொழிபெயர்ப்பை உருவாக்குகிறது.
பூனையை தண்ணீருக்கு அழைத்துச் செல்வது என்பது இலக்கணப்படி சரியான ஆங்கிலமாகும். இது சரியாக வடிவமைக்கப்பட்டுள்ளது. அது எதையோ குறிக்கக்கூடிய ஒன்றாகத் தெரிகிறது. ஸ்பானிஷ் மொழி பேசாத ஒரு பயனர் அதைப் படித்து, தலையசைத்துவிட்டு, நகர்ந்து செல்லலாம் — அதன் அசல் அர்த்தம் முற்றிலும் இழந்துவிட்டது என்பதை அறியாமலேயே.
நான் அக்கறை கொள்ளும் தோல்வி முறை அதுதான். స్పష్టమైన లోపం కాదు. కనబడనిది.
ఇక్కడ నమూనా యాదృచ్ఛికం కాదు. நேரடி மொழிபெயர்ப்புகளை உருவாக்கிய இரண்டு மாதிரிகள் (GPT-4o-MINI மற்றும் GPT-4.1-NANO) இரண்டும் சிறியவை, வேகத்திற்கும் செலவுத் திறனுக்கும் உகந்த இலகுவான மாதிரிகள் ஆகும். மொழிபெயர்ப்பில் சொற்றொடர்ரீதியான மொழிபெயர்ப்புகளை உருவாக்கிய மூன்று மாதிரிகள் (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) ஒரு வெவ்வேறு தலைமுறை அல்லது அளவுரு அளவைக் குறிக்கின்றன.
இது நான் ஆராயப்படாததாகக் கருதும் ஒன்றைச் சுட்டிக்காட்டுகிறது: மொழிபெயர்ப்பில் சொற்றொடர்ரீதியான திறன், பொதுவான அளவுகோல்களில் காணப்படாத வழிகளில் மாதிரித் திறனுடன் அளவிடப்படுகிறது.
பொதுவான மொழி அளவுகோல்கள் பகுத்தறிவு, அறிவு, குறியீடாக்கம், கணிதம் ஆகியவற்றைச் சோதிக்கின்றன. மாதிரிகள் பூனைகளும் நாய்களும் மழை பெய்கிறது என்பது வானிலை நிலைமைகள் பற்றியது அல்ல என்பதையோ, அல்லது llevarse el gato al agua என்பது ஒரு பூனைக்கு நீர்ச்சத்து அளிப்பது பற்றியது அல்ல என்பதையோ கண்டறிய முடியுமா என்பதை அவை பொதுவாக சோதிப்பதில்லை. மரபுத்தொடர்கள் கலாச்சார அறிவு, சூழல்சார் அனுமானம் மற்றும் முறை அங்கீகாரம் ஆகியவற்றின் சந்திப்பில் அமைகின்றன - மேலும் அந்த சந்திப்பு சிறிய மாதிரிகள் சீராக கடக்க முடியாத மாதிரித் திறனின் ஒரு வரம்பைக் கோருவதாகத் தெரிகிறது. நான் என்ன உரிமை கோரவில்லை: பெரிய மாதிரிகள் எப்போதும் சிறந்த மொழிபெயர்ப்பாளர்கள்.
நான் அதற்கு பொதுவான விதியாக ஆதாரம் இல்லை. நான் கவனிப்பது: மொழிபெயர்ப்பு உள்ளடக்கத்திற்கு குறிப்பாக, குடும்பத்திற்குள் உள்ள பதிப்பு இடைவெளி நான் எதிர்பார்த்ததை விட அதிகமாக இருந்தது.
AI மொழிபெயர்ப்பு கருவியைப் பயன்படுத்தும் பெரும்பாலான பயனர்கள் தாங்கள் எந்த AI பதிப்பைப் பயன்படுத்துகிறார்கள் என்பதை அறியாமல் இருக்கிறார்கள். அவர்கள் ஒரு தயாரிப்பைத் திறந்து, ஒரு மொழி ஜோடியைத் தேர்ந்தெடுத்து, ஒரு வெளியீட்டைப் பெறுகிறார்கள். மாதிரி வழித்தடம் அவர்களுக்குத் தெரியாது.
இது பெரிய அளவில் முக்கியமானது. MachineTranslation.com ஆனது ஒரே 90 நாள் காலத்தில் நூற்றுக்கணக்கான ஆயிரக்கணக்கான ஆங்கிலம்-ஸ்பானிஷ் மொழிபெயர்ப்பு பணிகளைச் செய்தது. ஒரு குறிப்பிடத்தக்க பகுதி அந்த வேலைகள் சொற்றொடர் உள்ளடக்கத்தை (சந்தைப்படுத்தல் நகல், சட்ட மொழி, இலக்கிய உரை, சாதாரண தொடர்பு) தொட்டிருந்தால், மேலும் அந்த வேலைகளை வழிநடத்தும் கருவி பயனர்களை அவர்களின் அறிவின்றி ஒரு சிறிய மாதிரிக்கு அனுப்பியிருந்தால், பூனையை தண்ணீருக்கு கொண்டு செல்வது உண்மையான வெளியீடுகளில், உண்மையான ஆவணங்களில், முடிவை நம்பியிருந்த உண்மையான நபர்களுக்குத் தோன்றியிருக்கும்.
மொழிபெயர்ப்புத் தொழில் பல ஆண்டுகளாக AI வழங்குநர்களை ஒப்பிட்டு வருகிறது. டீப்எல் எதிராக கூகிள். கிளாட் எதிராக சாட்ஜிபிடி. அந்த ஒப்பீடுகள் பயனுள்ளதாக இருக்கும் . ஆனால் ஒரே வழங்குநருக்குள், பதிப்பு இடைவெளி குறிப்பிடத்தக்கதாக இருக்கலாம் — மேலும் இது பெரும்பாலான ஒப்பீட்டு கட்டமைப்புகள் அளவிடாத ஒரு இடைவெளி, ஏனெனில் அவை மாதிரி-பதிப்பு மட்டத்தில் சோதிப்பதில்லை. ஒருவர் நான் மொழிபெயர்ப்புக்கு ChatGPT ஐப் பயன்படுத்துகிறேன் என்று சொல்லும்போது, அந்த வாக்கியம் அர்த்தமுள்ளதாக இருக்க போதுமானதாக இல்லை.
எந்த ChatGPT? நானோ? 4o-மினி? 4.1-சிறியதா? 5.4? பதில், சில வழிகளில் வெளியீட்டை மாற்றுகிறது அவை முக்கியமற்றவை, குறைந்தபட்சம் மரபு சார்ந்த உள்ளடக்கத்திற்கு.
இதுதான் எனக்கு மிகவும் சுவாரஸ்யமாகத் தோன்றுகிறது, மேலும் இதை நான் இன்னும் முழுமையாகப் புரிந்துகொள்ளவில்லை.
மரபு சார்ந்த மொழிபெயர்ப்புகளை உருவாக்கிய மூன்று மாதிரிகள் மூன்று வெவ்வேறு மொழிபெயர்ப்புகளைக் கொடுத்தன:
இந்த மூன்றும் llevarse el gato al agua என்பதன் நியாயமான ஆங்கில மொழிபெயர்ப்புகள். ஆனால் அவை சமமானவை அல்ல.
அதைச் சாதிக்க கடினத்திற்கு எதிராகச் செயல்படுத்துவதை வலியுறுத்துகிறது, நீங்கள் கடினமான ஒன்றைச் செய்தீர்கள், அது வேலை செய்தது. தங்களுக்கு வேண்டியதைச் சாதித்துக் கொள்வது என்பது, நீங்கள் விரும்பிய முடிவு எட்டப்பட்டதை வலியுறுத்துகிறது, அதில் உள்ள சிரமங்களுக்கு குறைந்த முக்கியத்துவம் கொடுக்கப்படுகிறது. வெற்றி பெறுவது என்பது மற்றவர்களுடன் ஒப்பிடும்போது போட்டியின் வெற்றியை வலியுறுத்துகிறது.
அசல் ஸ்பானிஷ் சொற்றொடர் இவற்றில் முதல் சொற்றொடருக்கு மிக நெருக்கமாக உள்ளது. இந்த சொற்றொடர் எதிர்ப்பை வெல்வதைக் குறிக்கிறது, வெறுமனே ஒரு விளைவை விரும்பி அது நடப்பதாகக் கூறுவதல்ல. ஆனால் தங்கள் வழியைப் பெறுவது மற்றும் வெற்றி பெறுவது தவறில்லை, அவை வெவ்வேறு திசைகளில் துல்லியமற்றவை.
இது எனக்கு உண்மையிலேயே கடினமான ஒரு கேள்வியை எழுப்புகிறது: மூன்று மாதிரிகள் ஒவ்வொன்றும் சரியான ஆனால் தனித்துவமான மரபுவழி மொழிபெயர்ப்பை உருவாக்கும்போது, எது சிறந்தது என்பதை நீங்கள் எவ்வாறு மதிப்பிடுவீர்கள்? BLEU மதிப்பெண்கள் ஒரு குறிப்பு மொழிபெயர்ப்புடன் ஒப்பிடுகின்றன — ஆனால் குறிப்பை யார் எழுதினார்கள், மேலும் இந்த மூன்றில் எதை அவர்கள் தேர்ந்தெடுத்திருப்பார்கள்?
எங்கள் AI மொழிபெயர்ப்பு முகவர், அதன் கடன், எந்த வெளியீட்டிற்கும் உறுதியளிப்பதற்கு முன்பு சரியான கேள்வியைக் கேட்டது: இந்தச் சூழலில் 'llevarse el gato al agua' என்பதன் நோக்கம் என்ன? மூன்று விருப்பங்கள் வழங்கப்பட்டன — கடினமான இலக்கை அடைவது, தேவையற்ற ஒன்றை எடுப்பது அல்லது ஆபத்தான செயலில் ஈடுபடுவது. அந்த கேள்வி அலங்காரமானது அல்ல. மொழிபெயர்ப்பு இறுதி செய்யப்படுவதற்கு முன்பு சூழல்சார் தெளிவின்மை தீர்க்கப்படும் வழிமுறை இதுவாகும். ஆனால் முக்கிய கருத்து என்னவென்றால்: மூன்று சரியான பதில்கள், மூன்று வெவ்வேறு அர்த்தங்களின் சாயல்கள்.
மொழிபெயர்ப்பு மதிப்பீட்டுக் கருவிகள் இந்த வகையான நுணுக்கங்களுக்காக உருவாக்கப்படவில்லை . எனக்கு இன்னும் தெரியாதது
இந்தச் சோதனை காட்டுவதின் வரம்புகளைப் பற்றி நான் நேர்மையாக இருக்க விரும்புகிறேன்.
ஒரு மரபுத்தொடர், ஒரு மொழி ஜோடி, ஒரு நாள் உள் சோதனை. அது ஒரு ஆய்வு அல்ல. இது ஒரு கவனிப்பு. இந்த முறை (சிறிய மாதிரிகள் நேரடி மொழிபெயர்ப்பையும், பெரிய மாதிரிகள் மரபுத்தொடர்களையும் அடைகின்றன) சீராகப் பொருந்துமா என்று எனக்குத் தெரியவில்லை:
இந்த மாதிரிகளின் நிலையான பண்பா இதுதானா அல்லது புதுப்பிப்புகள் மற்றும் ஃபைன்-ட்யூனிங்குடன் மாறும் ஒன்றா என்றும் எனக்குத் தெரியவில்லை. மாதிரி வழங்குநர்கள் மொழிபெயர்ப்பு-குறிப்பிட்ட மாற்றப் பதிவுகளை வெளியிடுவதில்லை. இன்று llevarse el gato al agua என்பதைச் சரியாகக் கையாளும் ஒரு மாதிரி பதிப்பு அடுத்த மாதம் புதுப்பிக்கப்படலாம், மேலும் எங்களுக்குத் தெரிய எந்த வழியும் இருக்காது.
எனக்குத் தெரிந்தவை: இந்தச் சோதனை ஒரு சுவாரஸ்யமான முடிவை உருவாக்கியது, அதை நான் மேலும், மேலும் முறையாக, பல மொழி இணைகள் மற்றும் உள்ளடக்க வகைகளில் இயக்க விரும்புகிறேன். நான் பகிர இன்னும் அதிகமாக வைத்திருக்கும்போது, நான் செய்வேன்.
இந்த சோதனை என்னிடம் விட்டுச்சென்ற இரண்டு கேள்விகளுடன் நான் முடிப்பேன். நான் அவற்றுக்குப் பதிலளிக்கப் போவதில்லை, என்னிடம் இன்னும் அதற்கான தரவு இல்லை. ஆனால் அவை கேட்க வேண்டிய சரியான கேள்விகள் என்று நான் நினைக்கிறேன்.
முதலில்: எந்த அளவுரு வரம்பில் மரபுசார்ந்த திறன் நம்பிக்கைக்குரியதாகிறது?
GPT-4o-MINI மற்றும் GPT-4.1-NANO (இரண்டும் நேரடியானவை) இலிருந்து GPT-4.1-MINI (மரபுசார்ந்தவை) வரை உள்ள பாய்ச்சல், அந்த மாதிரி அளவுகளுக்கு இடையே உள்ள அளவுரு வரம்பில் எங்கோ ஒரு வரம்பு இருக்கிறது என்பதைக் குறிக்கிறது, அங்கு மரபு அங்கீகாரம் செயல்படுகிறது. அது சீராக உள்ளதா? இது அனைத்து மொழிகளிலும் உள்ள மரபுத்தொடர்களுக்குப் பொருந்துமா, அல்லது பயிற்சித் தரவுகளில் ஒரு மொழி எவ்வளவு நன்கு குறிப்பிடப்பட்டுள்ளது என்பதைப் பொறுத்தது? எனக்குத் தெரியாது. ஆனால் மொழிபெயர்ப்பு பணிப்பாய்வுகளை உருவாக்கும் எவருக்கும் அறிவது பயனுள்ளதாக இருக்கும்.
இரண்டாவது: மாதிரி பதிப்பு வெளிப்படைத்தன்மை பயனர்களுக்கு பெரிய அளவில் என்ன செலவு செய்கிறது?
ஒரு பயனர் மாதத்திற்கு 1,000 ஆவணங்களை ஒரு கருவி மூலம் அனுப்பினால், அது எந்த மாதிரி பதிப்பு பயன்படுத்தப்படுகிறது என்பதை வெளியிடாது (மற்றும் அந்த ஆவணங்களில் சில சொற்றொடர் உள்ளடக்கத்தைக் கொண்டிருக்கின்றன), எவ்வளவு அடிக்கடி நேரடி தோல்வி கண்ணுக்குத் தெரியாமல் நிகழ்கிறது? அவர்களுக்கு எப்படித் தெரியும்? கண்டுபிடிக்காமல் இருப்பதன் உண்மையான செலவு என்ன?
தற்போது பரவலாக உள்ள மொழிபெயர்ப்புக்கு சிறந்த AI எது என்ற ஒப்பீடுகளை விட இது ஒரு முக்கியமான கேள்வி என்று நான் நினைக்கிறேன். பதில் மிகப்பெரிய மாதிரியைப் பயன்படுத்துங்கள் அல்ல. பதில் இதுவாக இருக்கலாம்: நீங்கள் எதைப் பயன்படுத்துகிறீர்கள் என்பதை அறிந்து கொள்ளுங்கள், உங்கள் சொந்த உள்ளடக்கத்தில் சோதனைகளைச் செய்யுங்கள், மேலும் ஒரு வழங்குநரின் பெயர் அவர்களின் மாதிரி வரம்பில் நிலையான நடத்தத்திற்கு உத்தரவாதம் அளிக்கும் என்று கருத வேண்டாம்.
குறைந்தபட்சம், இந்த சோதனையிலிருந்து நான் இதைப் புரிந்துகொள்கிறேன்.
இந்த ஒற்றை சோதனையின் அடிப்படையில்: ஒரே AI குடும்பத்திற்குள், சிறிய, செயல்திறன்-மேம்படுத்தப்பட்ட மாதிரிகள் நன்கு நிறுவப்பட்ட ஸ்பானிஷ் சொற்றொடரின் நேரடி மொழிபெயர்ப்புக்கு இயல்பாகவே சென்றன, அதே நேரத்தில் அதே மாதிரியின் பெரிய/புதிய பதிப்புகள் சரியான சொற்றொடர் மொழிபெயர்ப்புகளை உருவாக்கின. இந்த மொழிப் பிரிவுகள் மற்றும் மொழி இணைகள் அனைத்திற்கும் இது பொருந்துமா என்பது அடுத்த கேள்வி. நான் மேலும் சோதனைகளைச் செய்வேன்.
GPT-4.1-MINI, GPT-5.4-MINI, மற்றும் GPT-5.4 அனைத்தும் llevarse el gato al agua என்ற மரபுத்தொடரை மரபுப்படி மொழிபெயர்த்தன — ஆனால் நுட்பமான வேறுபட்ட அர்த்தங்களைக் கொண்ட வெவ்வேறு ஆங்கில சொற்றொடர்களாக. இது சொற்றொடர் மொழிபெயர்ப்பின் தரம் குறைந்தது இரண்டு பரிமாணங்களைக் கொண்டுள்ளது என்பதைக் குறிக்கிறது : மாதிரி சொற்றொடரை அங்கீகரிக்கிறதா இல்லையா, மேலும் இலக்கு மொழியின் கிடைக்கக்கூடிய விருப்பங்களிலிருந்து எந்த சமமான வெளிப்பாட்டைத் தேர்ந்தெடுக்கிறது. தரமான மொழிபெயர்ப்புத் தர அளவீடுகள் இந்த இரண்டு பரிமாணங்களையும் தெளிவாகப் பிரிக்காது . நான் நினைக்கிறேன் அவர்கள் செய்ய வேண்டும்.
இந்த இடுகை MachineTranslation.com இன் மேம்பாட்டு தளத்தில் உள் சோதனையின் அடிப்படையில் அமைந்துள்ளது. இங்கு காட்டப்பட்டுள்ள பல மாதிரி பதிப்பு சோதனை இன்னும் பொதுமக்களுக்கு கிடைக்கவில்லை. நான் கண்டுபிடிப்பைப் பகிர்கிறேன், ஏனெனில் உங்கள் மொழிபெயர்ப்புகளை நீங்கள் எங்கு இயக்கினாலும் இந்த அவதானிப்பு பயனுள்ளதாக இருக்கும் என்று நான் நினைக்கிறேன்.