July 10, 2026

2026 இல் எந்த AI மொழிபெயர்ப்பாளர் மிகவும் துல்லியமாக உள்ளது? நான் 10 சமீபத்திய AI மாதிரிகளை சோதித்தேன்

இரண்டு சொற்கள். ஆறு மாதிரிகள். மூன்று வெவ்வேறு மொழிபெயர்ப்பு முடிவுகள். இங்கே நடந்தது என்ன என்பது இங்கே உள்ளது. நான் MachineTranslation.com இல் கிடைக்கும் சமீபத்திய AI மாதிரிகளின் மூலம் 8 சோதனை வாக்கியங்களை இயக்கியபோது, மற்றும் ஒரு மாதிரி எப்போது அமைதியாக தோல்வியடைகிறது என்பதைப் பற்றி வெளியீடுகள் உண்மையில் என்ன வெளிப்படுத்துகின்றன.

உங்கள் மாதிரி தவறான அழைப்பை செய்தபோது நீங்கள் எப்படி அறிந்துகொள்வீர்கள்?

இரண்டு வார்த்தைகள். அது அசத்தல். ஆறு மாதிரிகள். மூன்று வேறுபட்ட மொழிபெயர்ப்பு முடிவுகள்.

ஜப்பானிய மொழியில், ஒரு மாதிரி அதை それはやばいஎன வழங்கியது, தெளிவின்மையைப் பாதுகாத்தது. மற்றொருவர் பொருள் சர்வनாமத்தை முற்றிலுமாக நீக்கிவிட்டு வெறும் வடிவத்தை やばい எழுதினார், இது சாத்தியமான மிகவும் பேச்சுவழக்கு பதிப்பு. மூன்றாவது நபர் எழுதினார் அது அற்புதமாக இருந்தது, இது தெளிவாக "அற்புதமான" என்ற பொருளுக்கு ஆதரவாக தெளிவுபடுத்துகிறது, சொற்றொடியை சுவாரஸ்யமாக்கிய இரட்டை அர்த்தத்தை முழுவதுமாக நீக்குகிறது. வியட்நாமிய மொழியில், ஒரு மாதிரி எழுதியது Đỉnh vậy (சlangs, இளைஞர் பதிவுக்கு சரியானது). மற்றொருவர் எழுதினார் அது உண்மையில் அற்புதமாக இருக்கிறது, இலக்கணப்படி சரியாக, ஆனால் யாரோ உங்களுக்கு ஒரு மீம் அனுப்பும்போது "அது உண்மையில் அற்புதமாக இருக்கிறது" என்று சொல்வதற்கு நெருக்கமாக இருக்கிறது.

இவை அனைத்தும் நியாயமானவை. அவர்களில் யாரும் ஒரே விஷயம் இல்லை. மேலும் நீங்கள் ஒரு ஒற்றை மாதிரியின் மூலம் மொழிபெயர்ப்புகளை இயக்கினால், உங்கள் சார்பாக எடுக்கப்பட்ட தேர்வை நீங்கள் ποτέ பார்க்க மாட்டீர்கள்.

இது இந்த கட்டுரை பதிலளிக்க முயற்சிக்கும் மைய கேள்வி. ‎2026 இல் மொழிபெயர்ப்புக்கு எந்த AI மாதிரி சிறந்தது என்பது அல்ல (பதில் மொழி ஜோடி, பதிவு, களம் மற்றும் வாக்கிய கட்டமைப்பைப் பொறுத்தது), மாறாக: உங்கள் மாதிரி தவறான முடிவை எடுத்தபோது நீங்கள் எப்படி அறிவீர்கள்? குறிப்பாக மருத்துவ சொல்லகராதி, சட்ட ஒப்பந்தங்கள் அல்லது தொழில்முறை முறைமை போன்ற களங்களில், தவறான அழைப்பு ஒரு நிபுணர் அதைப் படிக்கும் வரை சரியான மொழிபெயர்ப்பு போல் தெரிகிறது.

நான் செய்தது இதோ. நான் 8 சோதனை வாக்கியங்களை  MachineTranslation.com இல் இரண்டு சுற்றுகளின் மாதிரிகளின் மூலம் இயக்கினேன்: முதலில் 5 பரவலாகப் பயன்படுத்தப்படும் மாதிரிகளின் அடிப்படை, பின்னர் ஒரு விரிவாக்கப்பட்ட குழு இது தற்போது பணம் செலுத்தும் பயனர்களுக்கு கிடைக்கும் சில புதிய பிரீமியம்-நிலை மாதிரி மாறுபாடுகளைச் சேர்க்கிறது. இந்த போன்ற மாதிரிகளிலிருந்து வெளியீடுகளை ஒப்பிடுவது பொதுவாக ஒவ்வொரு வழங்குநருடனும் தனித்தனி பணம் செலுத்தும் சந்தாக்கள் தேவைப்படும். MachineTranslation.com இல், அவர்கள் ஒரே ஒப்பீட்டு காட்சியில் அமர்ந்திருக்கிறார்கள். மொழி ஜோடிகள் ஆங்கிலம்→ஜப்பானியம் மற்றும் ஆங்கிலம்→வியட்நாமியம் ஆகும். வாக்য வகைகள் குறிப்பாக மாதிரி கருத்து வேறுபாடு மிகவும் முக்கியமான பகுதிகளை அழுத்த-சோதனை செய்ய தேர்ந்தெடுக்கப்பட்டன:成语 சொற்றொடி, சட்ட சொல்லாட்சி, மருத்துவ சொல்லாட்சி, முறைமை-உணர்வுள்ள சூழல், மற்றும் வேண்டுமென்றே பொருள் நிச்சயமற்ற தன்மை.

முறைமை

  • மொழி ஜோடிகள்: ஆங்கிலம் → ஜப்பானிய, ஆங்கிலம் → வியட்நாமிய
  • சுற்று 1 (அடிப்படை): Claude Sonnet 4-6, DeepSeek V4-Pro, Qwen 3.7-Max, GPT-4.1-NANO, Gemini 3.1-Pro-Preview
  • சுற்று 2 (விரிவாக்கப்பட்ட): மேலே உள்ள அனைத்தும் + Claude Opus 4-7, GPT-5.5, Gemini 3.5-Flash, GLM-5-Turbo, MiniMax M2.7
  • சோதனை வகைகள்: 成语 சொற்றொடி (2), சட்ட/தொழிலாதார சொல்லாட்சி (2), மருத்துவ சொல்லாட்சி (1), முறைமை-சார்ந்த சூழல் (2), வேண்டுமென்றே நிச்சயமற்ற தன்மை (1)
  • அளவிடப்பட்டவை: மொழிபெயர்ப்பு வெளியீடு நேரடியாக, திருத்த நேரம், TER, அல்லது எண்ணிக்கை பிழை விகிதங்கள் அல்ல. பொருத்தமான இடங்களில், வேறுபாடுகள் மொழியியல் ரீதியாக விளக்கப்படுகின்றன.
  • SMART ஒருமித்த கருத்து: ஒவ்வொரு சுற்றிலும் தளத்தின் பல-மாதிரி ஒருமித்த கருத்து வெளியீடு அন்தর்ভুক்த உள்ளது. SMART என்பது 22 வரை AI மாதிரிகளை வழங்குநர்கள் முழுவதும் பரவியுள்ளது மற்றும் ஒரு ஒருமித மொழிபெயர்ப்பைப் பெற அனைத்து கிடைக்கக்கூடிய மாதிரிகளையும் ஒரே நேரத்தில் இயக்குகிறது. மாதிரி குழு மாறும்போது ஒருமித்த கருத்து மாறுகிறது.

மূல்யாঙ্கन முறையைப் பற்றிய குறிப்பு: இயந்திர மொழிபெயர்ப்பு গবেষણை நீண்ட காலமாக வெளியீடுகளை தானாக மதிப்பிடுவது எப்படி என்பதை கொண்டு போராடி வருகிறது. BLEU மற்றும் COMET  போன்ற மெட்ரிக்குகள் WMT பகிரப்பட்ட பணிகளில்  அளவிடப்படுவதால் பயனுள்ள ஒட்டுமொத்த சமிக்ஞை கொடுக்கின்றன, ஆனால் அவை பதிவு பிழைகள்,成语 தோல்விகள் மற்றும் சொல்லாக்க துல்லியத்தை கண்டறிய மோசமாக உள்ளன, இவை சரியாக இங்கே மிக முக்கியமான வகைகள். நீங்கள் படிக்கப் போவது வெளியீட்டு பகுப்பாய்வு, BLEU பந்தயம் அல்ல.

ஒரு பார்வையில் முடிவுகள்

பிரிவு 1: அனைத்து மாதிரிகளும் ஒப்புக்கொள்ளும் இடம், மற்றும் அது ஏன் முக்கியமானது

ஒவ்வொரு வாக்கியமும் அর்த்தமுள்ள கருத்து வேறுபாட்டை வெளிப்படுத்துவதில்லை. எட்டு சோதனைகளில் இரண்டு, "இந்த ஒப்பந்தத்தில் தூசி குடியேறியதும் ஒருமுறை தொடர்பு கொள்வோம்" (→ ஜப்பானிய) மற்றும் "இந்த வெளியீட்டு தேதியை அடைய நாங்கள் நள்ளிரவு எண்ணெய் எரிக்கிறோம்" (→ வியட்நாமிய), இரண்டு சுற்றுகளிலும் அதிக உடன்பாட்டை உருவாக்கியது. இலக்கணச் சொற்றொடிகள் சரியாக இலக்கணச் சொற்றொடிகளாக புரிந்துகொள்ளப்பட்டன. யாரும் "touch base" என்பதை உடல்ரீதியாக ஒரு தளத்தைத் தொடுவது என்று மொழிபெயர்க்கவில்லை. யாரும் "the dust settles" என்பதை வண்டல் விழுதல் என்று மொழிபெயர்க்கவில்லை.

இது நிறுத்திக்கொண்டு சிந்திக்க வேண்டிய விஷயம்: பொதுவான வாணிജ்ய ஆங்கில மொழியின் உவமை வெளிப்பாடுகள் தற்போதைய முன்னணி மாதிரிகளால் நியாயமாக நன்றாக கையாளப்படுகின்றன, உவமை வெளிப்பாடு போதுமான அளவு பொதுவாக இருக்கும்போது. ‎"touch base" என்பதற்கான ஒருமித்த கருத்து இரு சுற்றுகளிலும் நிலையாக இருந்தது; மாறுபாடு முற்றிலும்文体 சார்ந்ததாக இருந்தது, இந்த விஷயம் (இந்த விஷயம்), இந்த ஒப்பந்தம் (இந்த ஒப்பந்தம்), அல்லது இந்த வழக்கு (இந்த வழக்கு) என்பதை மூல சொற்றொடருக்குப் பயன்படுத்துவது பற்றியது.

Test 8: ‎"இந்த ஒப்பந்தத்தில் புழுதி அடங்கியவுடன் மீண்டும் தொடர்பு கொள்வோம்." → ஜப்பானியம்

"நள்ளிரவு எண்ணெய் எரித்தல்" சோதனை தான் விஷயங்கள் இன்னும் சுவாரஸ்யமானதாக மாறிய இடம். ஒரு மாதிரி தவிர மற்ற அனைத்து மாதிரிகளும்成語ஐ சரியாக புரிந்துகொண்டன. MiniMax M2.7, Round 2 இல் அறிமுகப்படுத்தப்பட்டது, "burning" ஐ நேரடியாக மொழிபெயர்த்து, "burning torches" என்ற பொருளைக் கொண்ட đốt đuốc ஐ உருவாக்கியது. ஒருமித்த கருத்து அதை சரியாக விலக்கியது.

சோதனை 5: ‎"நாங்கள் இந்த வெளியீட்டு தேதியை அடைய நள்ளிரவு எண்ணெய்யை எரிக்கிறோம்." → வியட்நாமியம்

கண்டறிதல் — சொலவடைகள்

முன்னணி மாதிரிகள் பொதுவாக ஜப்பானிய மற்றும் வியட்நாமிய மொழிகளில் பொதுவான ஆங்கில வணிக சொலவடைகளை சரியாக கையாளுகின்றன. ஒருமித்த கருத்தின் மதிப்பு சர்ச்சைக்குரிய வாக்கியங்களில் அதிகபட்சமாக உள்ளது: முறைமை, பதிவு, மற்றும் சொற்களஞ்சியம். 成语 परीक्षणों में, सर्वसम्मति अभी भी वास्तविक आउटलेर्स को फ़्लैग करके अपनी जगह बनाए रखती है (MiniMax का शाब्दिक "जलती मशालें" विफल), लेकिन समग्र पूल पहले से ही सहमत है।

अनुभाग 2: முறைமைத் தட்டு

ஜப்பானிய மொழி ஒரு முறைமை-அடுக்கிய மொழி ஆகும். வினையின் முடிவு, ப代代ணை, மற்றும் குறிப்பு பெயர் வடிவத்தின் தேர்வு文体ரீதியாக இல்லை. இது பேசுபவருக்கும் பெறுபவருக்கும் இடையிலான உறவைக் குறிக்கிறது. உங்கள் தலைமை நிர்வாহகருக்கு சாதாரண வினைச்சொல் வடிவங்களைப் பயன்படுத்தி செய்தி அனுப்புவது இலக்கணக் கோணத்தில் மொழிபெயர்ப்பு பிழை அல்ல. இது ஒரு சामூக பிழை, மற்றும் ஒரு குறிப்பிடத்தக்க ஒன்று.‎

அதை அனுப்பி வைக்க முடியுமா? நன்றி, நான் அதை பாராட்டுகிறேன்." சூழல்: ஒரு தலைமை நிರவாহியிடம் செய்தி அனுப்புதல்.

மாதிரி குழு விரிவடைந்தபோது ஒருமித்த கருத்து மாறியது. பொறிமுறை நேரடியானது: முறைமையான சூழலை சரியாக படிக்கும் மாதிரிகளைச் சேர்ப்பது பெரும்பான்மையை மாற்றியது, மேலும் ஒருமித்த கருத்து பின்பற்றப்பட்டது. இங்கே Round 2 இல் மாதிரிகள் உற்பத்தி செய்த முழு நிறமாலை:

Test 1: CEO வாக்கியம் — முழு Round 2 மாதிரி வெளியீடுகள்


குறிப்பிடத்தக்க விலக்கு — DeepSeek R2

DeepSeek V4-Pro Round 2 இல் உற்பத்தி செய்தது 送ってくれる?ありがとう、助かる。, எளிய வடிவ ஜப்பானிய. இது உங்கள் நெருங்கிய நண்பருக்கு அனுப்பும் செய்தி. இது CEO க்கு ஒரு செய்தியின் பொருத்தமான பதிவு அல்ல. சாதாரণ வடிவம் (くれる、助かる) அனைத்து மரியாதை குறிப்பான்களையும் நீக்குகிறது. ஒருமித்த கருத்து அதை சரியாக除除 செய்தது, ஆனால் இது உங்களின் ஒரே மாதிரி என்றால், நீங்கள் உங்கள் முதல் நிர்வாகிக்கு ஒரு சாதாரண உரையின் சமமான செய்தியை அனுப்புவீர்கள்.

வியட்நாம மொழி பதிவு சோதனை ஒரு வித்தியாசமான வகையான முறைமை பிழையை வெளிப்படுத்தியது, இது மிகவும் நுட்பமான ஒன்றாகும். மூல வாக்கியம்: ‎"ஏய், ஒரு விரைவான கேள்வி — நீ ஒரு கால்ல பேச நேரம் இருக்கிறாயா?" சூழல்: ஒரு வாடிக்கையாளருக்கு செய்தி அனுப்புதல். சுற்று 1-இல் Qwen, சாதாரண சம-நிலை நட்பைக் குறிக்கும் முதல் நபர் பிரதிபெயரான "mình" என்பதைச் சேர்த்திருந்தது. மற்ற ஒவ்வொரு மாதிரியும் முதல்-நபர் சுய-குறிப்பை முற்றிலுமாக தவிர்த்தது, இது பாதுகாப்பான தொழில்முறை தேர்வு ஆகும். முக்கியமாக, Qwen இதை Round 2 இல் சரி செய்தது மற்றும் "mình" ஐ நீக்கியது. இரண்டு சுற்றுகளிலும் உள்ள ஒருமித்த கருத்து அதை விலக்கியது.

Test 6: ‎"ஏய், விரைந்து ஒரு கேள்வி — நீ ஒரு அழைப்புக்கு வர இலவசமாக இருக்கிறாயா?" → வியட்நாமியம்


கண்டறிதல் — ஒப்பீடு இல்லாமல் பதிவு பிழைகள் தெரியாது

Qwen இன் "mình" பிழை, வாடிக்கையாளர் தொடர்பு தகவல்தொடர்புக்கு ஒரு மாதிரி மொழிபெயர்ப்பு ஏன் ஆபத்தானது என்பதற்கான தெளிவான உதாரணம்: வெளியீடு சரளமான, இலக்கண ரீதியாக சரியான, இயற்கையான ஒலியுடைய வியட்நாமிய மொழியாகும். கொடிக்க எதுவும் இல்லை. மற்ற நான்கு மாதிரிகளைப் பார்க்காமல் முதல் நபர் சுய-குறிப்பைத் தவிர்க்கும் போது, ​​ஒரு பதிவு தேர்வு செய்யப்பட்டது என்பதற்கான சமிக்ஞை உங்களுக்கு இருக்காது।

பிரிவு 3: சட்ட சொற்களஞ்சலம் — தடையின்றி விடுதல் சிக்கல்

விற்பனையாளர்/வாடிக்கையாளர் ஈடுசெய்தல் வாக்கியம் வணிக ஒப்பந்தங்களில் ஒரு நிலையான உறுப்பு: ‎"விற்பனையாளர் இந்த ஒப்பந்தத்தின் மீறல்களிலிருந்து எழும் எந்த மூன்றாம் পক்ష கோரிக்கைகளுக்கு எதிராக வாடிக்கையாளரை சேதமடையாமல் பாதுகாக்க வேண்டும்."

சுற்று 1 இல், ஐந்து மாதிரிகளும் சட்டப் பதிவை சரியாக அடையாளம் கண்டு, ஆங்கில தோற்றம் கொண்ட ஜப்பானிய வணிக ஒப்பந்தங்களில் நிலையான கடன் வார்த்தைகளான ベンダー (விற்பனையாளர்) மற்றும் クライアント (வாடிக்கையாளர்) ஆகியவற்றைப் பயன்படுத்தின. ஒரு விதிவிலக்கு: GPT-4.1-NANO பயன்படுத்திய 販売者 (விற்பனையாளர்) மற்றும் 顧客 (வாடிக்கையாளர்), சட்டப்பூர்வமான சொல்லாட்சி சமமான கடன் சொல்லுக்கு முறையான சட்ட குறிப்பியல் இல்லாத ந合法 ஜப்பானிய சொற்கள்.

மேலும் முக்கியமான கண்டுபிடிப்பு Round 2 இல் வெளிப்பட்டது. முக்கிய வேறுபாடு இரண்டு சொற்களுக்கு இடையே உள்ளது:

  • 補償 (hoshō) — ஈடு செய், திருப்பி கொடு. ஒரு நஷ்டத்திற்குப் பிறகு யாரையாவது நிதி ரீதியாக முழுமையாக்குதல்.
  • 免責 (menseki) — பொறுப்பிலிருந்து விலக்கு அளித்தல்; ஈடுசெய்தல். மூன்றாம் পक்ష கோரிக்கைகளிலிருந்து அவை உருவாகுவதற்கு முன்பே ক্ষতিহীனமாக வைத்திருக்க வேண்டும்.

இவை சட்டப்பூর்வமாக வேறுபட்ட கருத்துக்கள். ‎"Indemnify" என்பது ஒரு தரப்பை மூன்றாம் தரப்பு பொறுப்பிலிருந்து பாதுகாப்பது என்று குறிப்பாக பொருள்படும். 免責 என்பது சரியான சட்ட சொல். அனைத்து ரவுண்ட் 1 மாதிரிகள் 補償 பயன்படுத்தினர். சுற்று 2 இல், DeepSeek V4-Pro மட்டுமே 免責 ஐ உருவாக்கிய மாதிரியாகும், மேலும் அது சுற்று 2 இல் மட்டுமே செய்தது, சுற்று 1 இல் அல்ல.

சோதனை 7: ஈடுசெய்தல் விதி → ஜப்பானிய (முக்கிய வெளியீடுகள்)


கண்டுபிடிப்பு — சட்ட பதிவு

DeepSeek in R2 என்பது 免責 ஐப் பயன்படுத்தும்유일한மாதிரி ஆகும், இது "ஈடுசெய்யுதல்" என்பதன் சட்டப்பூர்வமான துல்லியமான சமம். மற்ற ஒவ்வொரு மாதிரியும் 補償 (ஈடுசெய்) பயன்படுத்துகிறது, இது பொருளாதார ரீதியாக தொடர்புடையது ஆனால் சட்டப்பூர்வமாக வேறுபட்டது. இந்த கண்டுபிடிப்பு இரண்டாவது சுற்றில் மட்டுமே தெரியும், இது ஒரு நிலையான, ஒற்றை-சுற்று சோதனை நிலையான மாதிரி குளத்தைப் பயன்படுத்தி முக்கியமான மாறுபாட்டை মிஸ் செய்ய முடியும் என்பதை அடிக்கோடிட்டுக் காட்டுகிறது.
தனித்தனியாக, Qwen R2 இல் விற்பனையாளர்/ক্রেতா (விற்பனையாளர்/ক்রেতா) க்கு மாறுவதன் மூலம் பின்னடைவு செய்கிறது, சேவை ஒப்பந்தங்களைக் காட்டிலும் வணிக விற்பனை சட்டத்தின் விதிமுறைகள். இது ஆங்கில சட்ட சொற்களைப் பயன்படுத்தும் ஒப்பந்தத்திற்கான குறைந்த பொருத்தமான கட்டமைப்பாகும்.

ஒப்பந்தத்தில், 補償 மற்றும் 免責 ஆகியவை ஒத்த பொருளுள்ள சொற்கள் அல்ல. ஒன் என்பது "நாங்கள் உங்களுக்கு திரும்பக் கொடுப்போம்" என்று பொருள். மற்றொன்று "நீங்கள் முதல் இடத்தில் கூற்றிலிருந்து பாதுகாக்கப்பட்டுள்ளீர்கள்" என்று பொருள். ஒரு மொழிபெயர்ப்பு தளம் 補償 ஐ பயன்படுத்தினால் 免責 சரியான இடத்தில் இருக்க வேண்டும், ஜப்பானிய பதிப்பை படிக்கும் வழக்குரைஞர் ஆங்கில பதிப்பு விவரிக்கும் அதே ஒப்பந்தத்தைக் காணமாட்டார்.

பிரிவு 4: மருத்துவ சொற்களஞ்சலம் — தீர்க்கப்படாத பிளவு

இது தரவுத்தொகுப்பில் மிகவும் முக்கியமான கண்டுபிடிப்பு ஆகும். சோதனை வாக்கியம்: ‎"இந்த மருந்து கல்லீரல் செயல்பாடு குறைபாடு உள்ள வரலாறு கொண்ட நோயாளிகளுக்கு தடை செய்யப்பட்டுள்ளது." மூலம்: மருத்துவ பொருள் ஆவணங்கள். இலக்கு: வியட்நாமிய.

முக்கியமான சொல் "கல்லீரல் செயலிழப்பு." இரண்டு வியட்நாமிய வேட்பாளர்கள் உள்ளனர்:

  • சுய கான் — கல்லீரல் செயலிழப்பு. கடுமையான, தীவிரமான அல்லது நாள்பட்ட இறுதிநிலை கல்லீரல் செயலிழப்பைக் குறிக்கிறது. கல்லீரல் செயல்பாடு குறைந்த ஒரு நோயாளி.
  • suy giảm chức năng gan — குறைந்த/பாதிக்கப்பட்ட கல்லீரல் செயல்பாடு. கல்லீரல் செயல்பாட்டில் ஏதேனும் குறைப்பு, லேசான அல்லது மிதமான குறைபாடு உட்பட.

இவை மருத்துவ ரீதியாக வேறுபட்டவை. ‎"கல்லீரல் செயல்பாட்டில் குறைவு" என்ற அடிப்படையில் உள்ள முரண்பாடு எச்சரிக்கை, முழு உறுப்பு செயலிழப்பை அனுபவித்தவர்களுக்கு மட்டுமல்லாமல், குறைந்த கல்லீரல் செயல்பாட்டைக் கொண்ட எவருக்கும் பொருந்தும். suy gan ஐ பயன்படுத்துவது சுட்டிக்காட்டப்பட்ட மக்கள்தொகையை தவறாக குறுக்குவிடுகிறது. மிதமான கல்லீரல் செயல்பாட்டு குறைபாடு உள்ள ஒரு நோயாளி suy gan ஐ படிக்கும் போது தங்களை தடைசெய்யப்பட்ட மக்கள் குழுவாக அங்கீகரிக்க முடியாமல் இருக்கலாம்.

Test 2: எதிர்ப்பு வாக்கியம் → வিയட்நாமிய (இரண்டு சுற்றுகளும்)


முக்கியமான கண்டுபிடிப்பு: மருத்துவ சொல்லாடல்

பிரிவு சுற்று 2 இல் suy gan க்கு 6 மாதிரிகள் மற்றும் suy giảm chức năng gan க்கு 4 மாதிரிகள். பெரும்பாலானவர்கள், எனவே ஒருமித்த கருத்து, குறைந்த மருத்துவ ரீதியாக துல்லியமான சொல்லைத் தேர்ந்தெடுக்கிறார்கள். இரண்டு Claude மாதிரிகளும் (Sonnet மற்றும் Opus) இரண்டு சுற்றுகளிலும் கல்லீரல் செயல்பாட்டு குறைவை தொடர்ந்து தேர்வு செய்கின்றன. குளம் விரிவடையும் போது பிளவு தீர்க்கப்படுவதில்லை.
இந்த தரவுத்தொகுப்பில் மருத்துவ உள்ளடக்கத்தில் மனித நிபுணர் மதிப்பாய்வுக்கு நேரடியாக வாதிடும் ஒரே கண்டுபிடிப்பு இதுவாகும். பெரும்பான்மை வாக்குப்பெறுதல் மூலம் ஒருமித்த கருத்து தவறு என்று கூற முடியாது. இது எல்லைப் பகுதி மாதிரிகளுக்கு இடையே உண்மையான கருத்து வேறுபாட்டை பிரதிபலிக்கிறது, மேலும் அந்த கருத்து வேறுபாடு தன்னை ஒரு மொழிபெயர்ப்பாளர் பார்க்க வேண்டிய தகவல் ஆகும். இது சரியாக Tomedes' மனித-சுழலில்-மதிப்பாய்வு  கட்டமைக்கப்பட்ட வழக்கு ஆகும்.

பிரிவு 5: ‎"அது அருமை" — சில வாக்கியங்கள் வேண்டுமென்றே பொருளுவளவு இருக்கும் போது என்ன நடக்கிறது

சில மூல வாக்கியங்கள் வேண்டுமென்றே பொருளுவளவாக இருக்கின்றன. ‎"That's sick" என்ற சொல் இன்றைய ஆங்கில ஸ்லாங்கில் ஏதோ சிறந்தது என்று பொருள் தருகிறது, ஆனால் இது இன்னும் அதன் நேரடி அர்த்தத்தையும் (அதாவது வெறுப்பூட்டும்/அருவருப்பான) வைத்திருக்கிறது, மேலும் இந்த இரண்டு அর்த்தங்களுக்கு இடையிலான பதற்றம் சொற்றொடர் எவ்வாறு தொடர்பு கொள்கிறது என்பதের ஒரு பகுதியாகும். ஒரு மொழிபெயர்ப்பு மாதிரியின் சவாலு: நீங்கள் தெளிவற்ற தன்மையைப் பாதுகாக்கிறீர்களா, அதை மிகவும் சாத்தியமான அர்த்தத்திற்கு சரிந்துவிடுகிறீர்களா, அல்லது ஒன்றைத் தேர்ந்தெடுத்து உறுதিபடுத்துகிறீர்களா?

ஜப்பானிய வெளியீடுகள்


வியட்நாமிய வெளியீடுகள்


கண்டுபிடிப்பு: தெளிவற்ற தன்மை மற்றும் ஒரே குடும்பத்தின் வேறுபாடு

கிளாட் ஒপাস் 4-7 எழுதுகிறது ðỉnh vậy (ஸ்லாங்). Claude Sonnet 4-6 Thật tuyệt vời (முறையான) என்று எழுதுகிறது. இவை ஒரே மாதிரி குடும்பத்தைச் சேர்ந்த இரண்டு மாதிரிகளால் ஒரே மாதிரியான இரண்டு-சொல் உள்ளீட்டில் எடுக்கப்பட்ட எதிர் பதிவு முடிவுகள். இரண்டும் "தவறு" இல்லை. ‎"That's sick" என்ற சொல்லில் உள்ள சொற்களின் இரட்டை பொருளால் இரண்டு பொருளும் உள்ளன. ஆனால் உங்கள் இலக்கு பார்வையாளர்கள் தற்போதைய வியட்நாமிய இளைஞர் அரட்டை மொழியைப் பயன்படுத்தினால், இந்த மொழிபெயர்ப்புகளில் ஒன்று மட்டுமே சரியாக தொடাযுகிறது. ஒருமித்த கருத்து கருத்து வேறுபாட்டை புலப்படுத்துகிறது. இல்லாமல், நீங்கள் ஒரு தேர்வு செய்யப்பட்டது என்பது தெரியாது.
ஜப்பானிய மொழியில், GPT-4.1-NANO மட்டுமே பயன்படுத்த வேண்டிய மாதிரி すごい, இது முழுவதுமாக "அற்புதமான" என்ற பக்கத்தில் தெளிவின்மையை சரிந்துவிடுகிறது. ஐந்து பிற மாதிரிகள் இதை  やばい/ヤバい உடன் பாதுகாக்கின்றன. கிளாட் ஓபஸ் மிகவும் குறைந்தபட்ச வடிவத்தை எடுக்கிறது: வெறுமனே やばい எந்த பொருளும் இல்லாமல்.

பிரிவு 6: மாதிரி குளம் எப்படி இருக்கிறது

இந்த சோதனையில் உள்ள மாதிரிகள் அனைத்தும் சமம் இல்லை. அவை வெவ்வேறு கட்டமைப்புகள், பயிற்சி முறைகள் மற்றும் பயன்பாட்டு சூழல்களை உள்ளடக்கியுள்ளன. ரவுண்ட் 1 அடிப்படைக் கோட்டில் பரவலாக அணுகக்கூடிய மாதிரிகள் அন்தர்ভুक்தமாக உள்ளன. விரிவுபடுத்தப்பட்ட ரவுண்ட் 2 பூல் MachineTranslation.com இல் பணம் செலுத்தும் பயனர்களுக்கு இப்போது கிடைக்கும் பல புதிய பிரিமியம்-স்তরের மாதிரி மாறுபாடுகளைச் சேர்க்கிறது, இது ஒவ்வொரு தனிப்பட்ட வழங்குநரிடமும் தனித்தனி பணம் செலுத்தும் கணக்கு என்று பொருள்படும் அதே மாதிரி স்தரம்.

ரவுண்ட் 2 இல் விரிவுபடுத்தப்பட்ட பூல் MachineTranslation.com இல் பணம் செலுத்தும் பயனர்களுக்கு கிடைக்கும் மேம்பட்ட மாதிரிகளை உள்ளடக்கியுள்ளது. குளத்தை விரிவுபடுத்துவதின் விளைவு சீரானதல்ல. சில சோதனைகளில் (முறைமை/ஜப்பானிய), இது ஒருமித்த கருத்தை பொருளுள்ளவாறு மாற்றியது. மற்றவற்றில் (மருத்துவ சொல்லகராதி/வியட்நாமிய), பிளவு ஆழமடைந்தது.

பிரிவு 7: நீங்கள் மொழிபெயர்ப்பு தளத்தைத் தேர்ந்தெடுக்கும் போது இதன் பொருள் என்ன

சோதனை தரவு இரண்டு வெவ்வேறு தோல்வி வகைகளை சுட்டிக்காட்டுகிறது, மேலும் அவை வெவ்வேறு பதிலிகளைத் தேவைப்படுத்துகின்றன.

வகை A: அமைதியான தோல்விகள். முறைமை பிழைகள், பதிவு பிழைகள், மருத்துவ சொல்லாட்சி துல்லியம்: இவை சரியாக தோன்றும் வெளியீடுகளை உருவாக்குகின்றன. ஜப்பானியர் இலக்கணமாக உள்ளனர். வியட்நாமிய மொழி பேசுபவர் சரளமாக பேசுகிறார். எந்த பிரச்சனையும் ஏற்பட்டதற்கான எந்த வெளிப்புற சமிக்ஞையும் இல்லை. ஒரு மொழிபெசும் பயனர் ஒரு மாதிரியின் வெளியீட்டைப் படிக்கும்போது, மாதிரி ஒரு மூத்த ஜப்பানிய நிர்வாহகர் கவனிக்கக்கூடிய பதிவேட்டு தேர்வு செய்தது என்பதை அறிய எந்த வழியும் இல்லை, அல்லது ஒரு மருத்துவ சொல் குறுக்கப்பட்ட வகையில் அது பொருந்தும் மக்களை மாற்றுகிறது.

வகை B: தெரியும் தோல்விகள். MiniMax "burning the midnight oil" என்பதை "burning torches" என்று மொழிபெயர்க்கிறது. GPT-4.1-NANO "அது நோயுள்ளது" என்பதை தெளிவற்ற "すごい" என்பதாக தீர்மானித்தல். இவை கண்டறியக்கூடியவை, இலக்கு மொழியின் பேசுபவரால் அல்லது மற்ற மாதிரி வெளியீடுகளுடன் 비교ப்படுவதன் மூலம்.

பல-மாதிரி 비교 SMART வழங்குவது Category A இல் மிகவும் மূல்யவானது. ஐந்து அல்லது பத்து மாதிரிகள் வெளியீடுகளை உற்பத்தி செய்யும் போது மற்றும் பெரும்பாலானவை முறையான பதிவேட்டில் ஒப்புக்கொள்ளும் போது ஒன்று சாதாரண வெற்று-வடிவ ஜப்பானிய மொழியை உற்பத்தி செய்கிறது, கருத்து வேறுபாடு 비교 காட்சியில் தெரியும். இலக்கு மொழியைப் பேசும் ஒரு பயனாளர் விருப்பங்களை மதிப்பீடு செய்யலாம். ஒரு பயனர் சர்ச்சைக்குரிய முடிவு எடுக்கப்பட்டதைக் காணலாம் மற்றும் அந்த வாக்கியம் மனித மதிப்பாய்வுக்கு தகுதியுடையதா என்பதை முடிவு செய்யலாம்.

ஆவணத்-அளவிலான வேலைக்கு, பெரிய கோப்புகள், PDF-களின் தளவமைப்பு-பாதுகாக்கும் மொழிபெயர்ப்பு, ஒப்பந்தங்கள் அல்லது மருத்துவ பொருட்களுக்கு, தளத்தின் ஆவணம் செயலாக்க திறன் கோப்பு கட்டமைப்பைக் கையாளுகிறது வடிவமைப்பை உடைக்காமல். ஆனால் மேலே எழுப்பப்பட்ட தரம் சம்பந்தப்பட்ட கேள்விகள் கோப்பு அளவைப் பொருட்படுத்தாமல் பொருந்தும். ‎100 பக்கங்களைக் கொண்ட ஒரு மருத்துவ ஆய்வில் "கல்லீரல் செயல்பாட்டு குறைபாடு" என்ற ஒவ்வொரு நிகழ்வும் "கல்லீரல் செயலிழப்பு" என்று மொழிபெயர்க்கப்பட்டது என்பது சோதனை 2 இல் கண்டறியப்பட்ட அதே சிக்கலின் ஒரு பெரிய பதிப்பாகும்.

மருத்துவ மற்றும் சட்ட வகைகளுக்கு குறிப்பாக, மனித சரிபார்ப்பு சரியான பின்னணி ஆதரவாகும். Tomedes' AI பிந்தைய-திருத்தல் சேவை, AI வெளியீட்டை சான்றளிக்கப்பட்ட மனித மதிப்பாய்வுடன் இணைக்கிறது, இந்த வகையான உচ்च-ஆபத்து உள்ளடக்கத்திற்காக கட்டமைக்கப்பட்டுள்ளது. சுய கான் / சுய கிआம் சுக்ष்ம கான் பிளவு என்பது சரியாக அந்த மதிப்பாய்வைத் தூண்டக்கூடிய ஒரு கண்டுபிடிப்பு, அனைத்து மாதிரிகளும் தவறு என்பதால் அல்ல, மாறாக மிகவும் நம்பிக்கையுடன் இருக்கும் மாதிரிகள் மிகவும் துல்லியமாக இல்லை என்பதால்.

பல வெளியீடுகளைப் பார்ப்பதின் மதிப்பு என்னவென்றால், நீங்கள் எப்போதும் பெரும்பான்மையைத் தேர்ந்தெடுப்பீர்கள் என்பதல்ல. நீங்கள் ஒரு தேர்வு செய்யப்பட்டது தெரிந்துகொள்வீர்கள் என்பது, உங்களுக்கு முன் உள்ள வெளியீடு சரியானது என்று கருதுவதிலிருந்து வேறுபட்டது.

எந்த எட்டு வாக்கியங்கள் உண்மையில் என்னிடம் சொன்னது

எட்டு சோதனைகளை ஒன்றாக வைத்து ஒரு முறை நிலைத்திருக்கிறது: உடன்பாடு மற்றும் கருத்து வேறுபாடு சீரற்ற முறையில் விநியோகிக்கப்படவில்லை. வழக்கமான, அன்றாட வணிக மொழி ("தொடர்பு கொள்ளுதல்," "நள்ளிரவு வேலை செய்தல்") கிட்டத்திட்ட ஒவ்வொரு மாதிரியிலும் இரண்டு சுற்றுகளிலும் ஒன்றிணைந்தது. முறைமையும், சட்ட துல்லியতையும், மருத்துவ சொற்களும் இல்லை. CEO-முறைமை சோதனை விரிவாக்கப்பட்ட குழு சேர்க்கப்பட்ட பிறகுதான் முறைசாரா நிலையிலிருந்து முறைசாரிய நிலைக்கு ஒரு முறை மாறியது. இழப்பீட்டு விதி (indemnification clause) ஒரு உண்மையான சட்ட வேறுபாட்டை (免責 vs. 補償) வெளிப்படுத்தியது, இது ஒரு மாதிரி, ஒரு சுற்றில் மட்டுமே சரியாக பெற்றது. மருத்துவ சொல்லியல் பிளவு எந்த வகையிலும் தீர்க்கப்படவில்லை, இரண்டு சுற்றுகளிலும் பொதுவாக 6-க்கு-4 என்ற விகிதத்தில் இருந்தது, எந்த மாதிரிகள் குளத்தில் இருந்தாலும் பொருட்படாமல்.

இது உண்மையான கண்டுபிடிப்பு, மார்க்கெட்டிங் கூற்று அல்ல: ஒருமித்த கருத்து ஒவ்வொரு வாக்கியத்தையும் சிறப்பாக்குவதில்லை, மேலும் அதற்கு தேவையில்லை. இது மிகவும் மதிப்புமிக்கது சரியாக ஒரு மாதிரியின் சரளத்தை சந்தேகிக்க உங்களுக்கு எந்த காரணமும் இல்லாத இடத்தில், மற்றும் தவறாக இருப்பது உண்மையில் ஏதாவது செலவாகும் இடத்தில்.

இந்த சோதனைக்கு இரண்டாவது, மிகவும் நடைமுறை அடுக்கு உள்ளது, இது தெளிவாக கூறுவதற்கு மதிப்புள்ளது. இந்த ஒப்பீட்டை நானே நடத்துவது என்பது GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, மற்றும் MiniMax M2.7 ஆகியவற்றின் வெளியீடுகளை ஒரே இடத்தில், ஒரே தளத்தில், বিদ்யமான அடிப்படை மாதிரிகளுடன் இணையாக சரிபார்ப்பது என்று பொருள். MachineTranslation.com க்கு வெளியே, அது ஒரு சந்தா அல்ல. இது பல உள்ளது, ஒவ்வொரு வழங்குநரின் பிரீமியம் நிலையை சோதிக்க விரும்பும் ஒவ்வொன்றுக்கும் ஒன்று, ஒவ்வொரு வழங்குநரும் தனித்தனியாக வசூல் செய்யும் விலையில். இங்கு பணம் செலுத்தும் பயனர்கள் ஐந்து தனித்தனி பிரீமியம் சந்தாக்களை பராமரிப்பதற்கான செலவின் ஒரு பகுதியில் ஒரே ஒரு கிளிக்கில் அதே ஒப்பீட்டைப் பெறுகிறார்கள், உண்மையில் முக்கியமான விஷயத்தை விட்டுக்கொடுக்காமல்: மாதிரிகள் எங்கு உடன்படுகின்றன என்பதைப் பார்ப்பது, மற்றும் அவை எப்போது உடன்படாது என்பதை சரியாக அறிவது.

அடிக்கடி கேட்கப்படும் கேள்விகள்

1. ChatGPT அல்லது Claude மொழிபெயர்ப்புக்கு சிறந்தது?

இரண்டுமே வகைப்படுத்தப்பட்ட முறையில் சிறந்தது அல்ல; இது சோதனை வகையைப் பொறுத்தது. Claude Sonnet மற்றும் Claude Opus ஆகியவை மிகவும் துல்லியமான வியட்நாமிய மருத்துவ சொல்லைத் தொடர்ந்து தேர்ந்தெடுத்தன, மேலும் Claude Opus "That's sick" என்பதற்கான மிகவும் பொருத்தமான ஸ்லாங்கை உருவாக்கியது. ஆனால் Claude Sonnet ஒரு முறையான CEO-சூழல் வாக்கியத்தில் சாதாரண ஜப்பானிய மொழியையும் உருவாக்கியது, அங்கு GPT-5.5 சரியாக பெற்றது. வெளியீடுகளை நேரடியாக ஒப்பிடுவது ஒரு மாதிரியைத் தேர்ந்தெடுத்து அதை நம்புவதை விட மிகவும் நியாயமானது.

2. ‎2026 இல் மிகவும் துல்லியமான AI மொழிபெயர்ப்பு மாதிரி என்ன?

ஒன்று இல்லை; துல்லியம் களத்தைச் சார்ந்துள்ளது. இந்த சோதனையில் Gemini 3.5-Flash மற்றும் GLM-5-Turbo மிகவும் பொருத்தமான முறையான ஜப்பானிய மொழியை உருவாக்கினார்கள். இரண்டு Claude மாதிரிகளும் வியட்நாமிய மருத்துவ சொல்லியலில் மிகவும் துல்லியமாக இருந்தன. DeepSeek V4-Pro ஆனது சரியான ஜப்பானிய சட்ட சொல்லைப் பயன்படுத்திய ஒரே மாதிரியாக இருந்தது, ஆனால் இரண்டாம் சுற்றில் மட்டுமே, மேலும் இது வேறு இடங்களில் சாதாரண ஜப்பானிய மொழியை உருவாக்கியது. எந்த ஒரு மாதிரியும் எட்டு சோதனைகள் அனைத்திலும் ஆதிக்கம் செலுத்தவில்லை.

3. கூடுதல் AI மாதிரிகளைச் சேர்ப்பது எப்போதும் மொழிபெயர்ப்பு துல்லியத்தை மேம்படுத்துகிறதா?

இல்லை, தானாகவல்ல. புதிய பிரিமியம்-நிலை மாதிரி மாறுபாடுகளுடன் குளத்தை விரிவுபடுத்துவது ஜப்பানிய முறைமை சோதனையில் முறைசாரா முதல் முறைசாரமான ஆக்கத்திற்கு மாற்றிக் கொடுத்தது. ஆனால் வியட்நாமிய மருத்துவ சொல்லியல் சோதனையில், எந்த மாதிரிகள் சேர்க்கப்பட்டாலும் பொருட்படுத்தாமல் பிளவு தோராயமாக 6-க்கு-4 என்ற விகிதத்தில் நீடித்தது. அதிக மாதிரிகள் அதிக கருத்து வேறுபாடுகளை வெளிப்படுத்துகின்றன, இது பயனுள்ள சமிக்ஞை ஆனால் ஒருமித்த கருத்து இன்னும் பெரும்பான்மையை பின்பற்றுகிறது, மற்றும் பெரும்பான்மை எப்போதும் மிகவும் துல்லியமான பதில் அல்ல.

4. SMART என்றால் என்ன மற்றும் அது எவ்வாறு செயல்படுகிறது?

SMART என்பது MachineTranslation.com இன் பல-மாதிரி ஒருமித்த அமைப்பு ஆகும், இது OpenAI, Anthropic, Google மற்றும் DeepSeek உட்பட வழங்குநர்களுக்கு 22 AI மாதிரிகள் வரை பரவியுள்ளது. இது ஒரே நேரத்தில் பல மாதிரிகள் மூலம் மொழிபெயர்ப்பை இயக்குகிறது மற்றும் ஒவ்வொரு தனிப்பட்ட மாதிரியின் பதிலுடன் பெரும்பான்மை-ஒருமித மொழிபெயர்ப்பு முடிவை முன்னிலைப்படுத்துகிறது, இயல்பாக, எந்த உள்ளமைவும் தேவையில்லை. மாதிரி குழு மாறும்போது ஒருமித்த கருத்து மாறுகிறது, இந்த சோதனையின் ஜப்பானிய முறைமை முடிவில் காட்டப்பட்டுள்ளது: சுற்று 1 இல் ஒரு சாதாரண ஒருமித்த கருத்து சுற்று 2 இல் முறைசாரமாக மாறியது.

5. எந்த AI மாதிரி மருத்துவ அல்லது சட்ட மொழிபெயர்ப்புக்கு சிறந்தது?

ஒரு ஒক்க மாதிரி இல்லை; மனித மதிப்பாய்வு சிறந்த பதில். Claude மாதிரிகள் தொடர்ந்து மிகவும் துல்லியமான வியட்நாமிய மருத்துவ சொல்லைத் தேர்ந்தெடுத்தன, மேலும் DeepSeek V4-Pro மட்டுமே சரியான ஜப்பானிய சட்ட சொல்லைப் பயன்படுத்தியது, ஆனால் ரவுண்ட் 2 இல் மட்டுமே. ‎10 மாதிரிகள் முழுவதும் மருத்துவ சொல்லியல் பிளவு ஒருபோதும் தீர்க்கப்படவில்லை, இது ஒரு வேறுபட்ட மாதிரியைத் தேர்ந்தெடுக்க வேண்டும் என்பதை சுட்டிக்காட்டாமல், களத்தின் நிபுணத்வம் தேவை என்பதை சுட்டிக்காட்டுகிறது. Tomedes வழங்குவது போல் சான்றளிக்கப்பட்ட மனித பிந்தைய-திருத்த மதிப்பாய்வு, அந்த நிபுணர் சோதனையை வழங்குகிறது.‎