July 10, 2026
இரண்டு சொற்கள். ஆறு மாதிரிகள். மூன்று வெவ்வேறு மொழிபெயர்ப்பு முடிவுகள். இங்கே நடந்தது என்ன என்பது இங்கே உள்ளது. நான் MachineTranslation.com இல் கிடைக்கும் சமீபத்திய AI மாதிரிகளின் மூலம் 8 சோதனை வாக்கியங்களை இயக்கியபோது, மற்றும் ஒரு மாதிரி எப்போது அமைதியாக தோல்வியடைகிறது என்பதைப் பற்றி வெளியீடுகள் உண்மையில் என்ன வெளிப்படுத்துகின்றன.
இரண்டு வார்த்தைகள். அது அசத்தல். ஆறு மாதிரிகள். மூன்று வேறுபட்ட மொழிபெயர்ப்பு முடிவுகள்.
ஜப்பானிய மொழியில், ஒரு மாதிரி அதை それはやばいஎன வழங்கியது, தெளிவின்மையைப் பாதுகாத்தது. மற்றொருவர் பொருள் சர்வनாமத்தை முற்றிலுமாக நீக்கிவிட்டு வெறும் வடிவத்தை やばい எழுதினார், இது சாத்தியமான மிகவும் பேச்சுவழக்கு பதிப்பு. மூன்றாவது நபர் எழுதினார் அது அற்புதமாக இருந்தது, இது தெளிவாக "அற்புதமான" என்ற பொருளுக்கு ஆதரவாக தெளிவுபடுத்துகிறது, சொற்றொடியை சுவாரஸ்யமாக்கிய இரட்டை அர்த்தத்தை முழுவதுமாக நீக்குகிறது. வியட்நாமிய மொழியில், ஒரு மாதிரி எழுதியது Đỉnh vậy (சlangs, இளைஞர் பதிவுக்கு சரியானது). மற்றொருவர் எழுதினார் அது உண்மையில் அற்புதமாக இருக்கிறது, இலக்கணப்படி சரியாக, ஆனால் யாரோ உங்களுக்கு ஒரு மீம் அனுப்பும்போது "அது உண்மையில் அற்புதமாக இருக்கிறது" என்று சொல்வதற்கு நெருக்கமாக இருக்கிறது.
இவை அனைத்தும் நியாயமானவை. அவர்களில் யாரும் ஒரே விஷயம் இல்லை. மேலும் நீங்கள் ஒரு ஒற்றை மாதிரியின் மூலம் மொழிபெயர்ப்புகளை இயக்கினால், உங்கள் சார்பாக எடுக்கப்பட்ட தேர்வை நீங்கள் ποτέ பார்க்க மாட்டீர்கள்.
இது இந்த கட்டுரை பதிலளிக்க முயற்சிக்கும் மைய கேள்வி. 2026 இல் மொழிபெயர்ப்புக்கு எந்த AI மாதிரி சிறந்தது என்பது அல்ல (பதில் மொழி ஜோடி, பதிவு, களம் மற்றும் வாக்கிய கட்டமைப்பைப் பொறுத்தது), மாறாக: உங்கள் மாதிரி தவறான முடிவை எடுத்தபோது நீங்கள் எப்படி அறிவீர்கள்? குறிப்பாக மருத்துவ சொல்லகராதி, சட்ட ஒப்பந்தங்கள் அல்லது தொழில்முறை முறைமை போன்ற களங்களில், தவறான அழைப்பு ஒரு நிபுணர் அதைப் படிக்கும் வரை சரியான மொழிபெயர்ப்பு போல் தெரிகிறது.
நான் செய்தது இதோ. நான் 8 சோதனை வாக்கியங்களை MachineTranslation.com இல் இரண்டு சுற்றுகளின் மாதிரிகளின் மூலம் இயக்கினேன்: முதலில் 5 பரவலாகப் பயன்படுத்தப்படும் மாதிரிகளின் அடிப்படை, பின்னர் ஒரு விரிவாக்கப்பட்ட குழு இது தற்போது பணம் செலுத்தும் பயனர்களுக்கு கிடைக்கும் சில புதிய பிரீமியம்-நிலை மாதிரி மாறுபாடுகளைச் சேர்க்கிறது. இந்த போன்ற மாதிரிகளிலிருந்து வெளியீடுகளை ஒப்பிடுவது பொதுவாக ஒவ்வொரு வழங்குநருடனும் தனித்தனி பணம் செலுத்தும் சந்தாக்கள் தேவைப்படும். MachineTranslation.com இல், அவர்கள் ஒரே ஒப்பீட்டு காட்சியில் அமர்ந்திருக்கிறார்கள். மொழி ஜோடிகள் ஆங்கிலம்→ஜப்பானியம் மற்றும் ஆங்கிலம்→வியட்நாமியம் ஆகும். வாக்য வகைகள் குறிப்பாக மாதிரி கருத்து வேறுபாடு மிகவும் முக்கியமான பகுதிகளை அழுத்த-சோதனை செய்ய தேர்ந்தெடுக்கப்பட்டன:成语 சொற்றொடி, சட்ட சொல்லாட்சி, மருத்துவ சொல்லாட்சி, முறைமை-உணர்வுள்ள சூழல், மற்றும் வேண்டுமென்றே பொருள் நிச்சயமற்ற தன்மை.
மূல்யாঙ্கन முறையைப் பற்றிய குறிப்பு: இயந்திர மொழிபெயர்ப்பு গবেষણை நீண்ட காலமாக வெளியீடுகளை தானாக மதிப்பிடுவது எப்படி என்பதை கொண்டு போராடி வருகிறது. BLEU மற்றும் COMET போன்ற மெட்ரிக்குகள் WMT பகிரப்பட்ட பணிகளில் அளவிடப்படுவதால் பயனுள்ள ஒட்டுமொத்த சமிக்ஞை கொடுக்கின்றன, ஆனால் அவை பதிவு பிழைகள்,成语 தோல்விகள் மற்றும் சொல்லாக்க துல்லியத்தை கண்டறிய மோசமாக உள்ளன, இவை சரியாக இங்கே மிக முக்கியமான வகைகள். நீங்கள் படிக்கப் போவது வெளியீட்டு பகுப்பாய்வு, BLEU பந்தயம் அல்ல.

ஒவ்வொரு வாக்கியமும் அর்த்தமுள்ள கருத்து வேறுபாட்டை வெளிப்படுத்துவதில்லை. எட்டு சோதனைகளில் இரண்டு, "இந்த ஒப்பந்தத்தில் தூசி குடியேறியதும் ஒருமுறை தொடர்பு கொள்வோம்" (→ ஜப்பானிய) மற்றும் "இந்த வெளியீட்டு தேதியை அடைய நாங்கள் நள்ளிரவு எண்ணெய் எரிக்கிறோம்" (→ வியட்நாமிய), இரண்டு சுற்றுகளிலும் அதிக உடன்பாட்டை உருவாக்கியது. இலக்கணச் சொற்றொடிகள் சரியாக இலக்கணச் சொற்றொடிகளாக புரிந்துகொள்ளப்பட்டன. யாரும் "touch base" என்பதை உடல்ரீதியாக ஒரு தளத்தைத் தொடுவது என்று மொழிபெயர்க்கவில்லை. யாரும் "the dust settles" என்பதை வண்டல் விழுதல் என்று மொழிபெயர்க்கவில்லை.
இது நிறுத்திக்கொண்டு சிந்திக்க வேண்டிய விஷயம்: பொதுவான வாணிജ்ய ஆங்கில மொழியின் உவமை வெளிப்பாடுகள் தற்போதைய முன்னணி மாதிரிகளால் நியாயமாக நன்றாக கையாளப்படுகின்றன, உவமை வெளிப்பாடு போதுமான அளவு பொதுவாக இருக்கும்போது. "touch base" என்பதற்கான ஒருமித்த கருத்து இரு சுற்றுகளிலும் நிலையாக இருந்தது; மாறுபாடு முற்றிலும்文体 சார்ந்ததாக இருந்தது, இந்த விஷயம் (இந்த விஷயம்), இந்த ஒப்பந்தம் (இந்த ஒப்பந்தம்), அல்லது இந்த வழக்கு (இந்த வழக்கு) என்பதை மூல சொற்றொடருக்குப் பயன்படுத்துவது பற்றியது.

"நள்ளிரவு எண்ணெய் எரித்தல்" சோதனை தான் விஷயங்கள் இன்னும் சுவாரஸ்யமானதாக மாறிய இடம். ஒரு மாதிரி தவிர மற்ற அனைத்து மாதிரிகளும்成語ஐ சரியாக புரிந்துகொண்டன. MiniMax M2.7, Round 2 இல் அறிமுகப்படுத்தப்பட்டது, "burning" ஐ நேரடியாக மொழிபெயர்த்து, "burning torches" என்ற பொருளைக் கொண்ட đốt đuốc ஐ உருவாக்கியது. ஒருமித்த கருத்து அதை சரியாக விலக்கியது.

ஜப்பானிய மொழி ஒரு முறைமை-அடுக்கிய மொழி ஆகும். வினையின் முடிவு, ப代代ணை, மற்றும் குறிப்பு பெயர் வடிவத்தின் தேர்வு文体ரீதியாக இல்லை. இது பேசுபவருக்கும் பெறுபவருக்கும் இடையிலான உறவைக் குறிக்கிறது. உங்கள் தலைமை நிர்வாহகருக்கு சாதாரண வினைச்சொல் வடிவங்களைப் பயன்படுத்தி செய்தி அனுப்புவது இலக்கணக் கோணத்தில் மொழிபெயர்ப்பு பிழை அல்ல. இது ஒரு சामூக பிழை, மற்றும் ஒரு குறிப்பிடத்தக்க ஒன்று.
அதை அனுப்பி வைக்க முடியுமா? நன்றி, நான் அதை பாராட்டுகிறேன்." சூழல்: ஒரு தலைமை நிರவாহியிடம் செய்தி அனுப்புதல்.

மாதிரி குழு விரிவடைந்தபோது ஒருமித்த கருத்து மாறியது. பொறிமுறை நேரடியானது: முறைமையான சூழலை சரியாக படிக்கும் மாதிரிகளைச் சேர்ப்பது பெரும்பான்மையை மாற்றியது, மேலும் ஒருமித்த கருத்து பின்பற்றப்பட்டது. இங்கே Round 2 இல் மாதிரிகள் உற்பத்தி செய்த முழு நிறமாலை:

வியட்நாம மொழி பதிவு சோதனை ஒரு வித்தியாசமான வகையான முறைமை பிழையை வெளிப்படுத்தியது, இது மிகவும் நுட்பமான ஒன்றாகும். மூல வாக்கியம்: "ஏய், ஒரு விரைவான கேள்வி — நீ ஒரு கால்ல பேச நேரம் இருக்கிறாயா?" சூழல்: ஒரு வாடிக்கையாளருக்கு செய்தி அனுப்புதல். சுற்று 1-இல் Qwen, சாதாரண சம-நிலை நட்பைக் குறிக்கும் முதல் நபர் பிரதிபெயரான "mình" என்பதைச் சேர்த்திருந்தது. மற்ற ஒவ்வொரு மாதிரியும் முதல்-நபர் சுய-குறிப்பை முற்றிலுமாக தவிர்த்தது, இது பாதுகாப்பான தொழில்முறை தேர்வு ஆகும். முக்கியமாக, Qwen இதை Round 2 இல் சரி செய்தது மற்றும் "mình" ஐ நீக்கியது. இரண்டு சுற்றுகளிலும் உள்ள ஒருமித்த கருத்து அதை விலக்கியது.

விற்பனையாளர்/வாடிக்கையாளர் ஈடுசெய்தல் வாக்கியம் வணிக ஒப்பந்தங்களில் ஒரு நிலையான உறுப்பு: "விற்பனையாளர் இந்த ஒப்பந்தத்தின் மீறல்களிலிருந்து எழும் எந்த மூன்றாம் পক்ష கோரிக்கைகளுக்கு எதிராக வாடிக்கையாளரை சேதமடையாமல் பாதுகாக்க வேண்டும்."
சுற்று 1 இல், ஐந்து மாதிரிகளும் சட்டப் பதிவை சரியாக அடையாளம் கண்டு, ஆங்கில தோற்றம் கொண்ட ஜப்பானிய வணிக ஒப்பந்தங்களில் நிலையான கடன் வார்த்தைகளான ベンダー (விற்பனையாளர்) மற்றும் クライアント (வாடிக்கையாளர்) ஆகியவற்றைப் பயன்படுத்தின. ஒரு விதிவிலக்கு: GPT-4.1-NANO பயன்படுத்திய 販売者 (விற்பனையாளர்) மற்றும் 顧客 (வாடிக்கையாளர்), சட்டப்பூர்வமான சொல்லாட்சி சமமான கடன் சொல்லுக்கு முறையான சட்ட குறிப்பியல் இல்லாத ந合法 ஜப்பானிய சொற்கள்.
மேலும் முக்கியமான கண்டுபிடிப்பு Round 2 இல் வெளிப்பட்டது. முக்கிய வேறுபாடு இரண்டு சொற்களுக்கு இடையே உள்ளது:
இவை சட்டப்பூর்வமாக வேறுபட்ட கருத்துக்கள். "Indemnify" என்பது ஒரு தரப்பை மூன்றாம் தரப்பு பொறுப்பிலிருந்து பாதுகாப்பது என்று குறிப்பாக பொருள்படும். 免責 என்பது சரியான சட்ட சொல். அனைத்து ரவுண்ட் 1 மாதிரிகள் 補償 பயன்படுத்தினர். சுற்று 2 இல், DeepSeek V4-Pro மட்டுமே 免責 ஐ உருவாக்கிய மாதிரியாகும், மேலும் அது சுற்று 2 இல் மட்டுமே செய்தது, சுற்று 1 இல் அல்ல.

ஒப்பந்தத்தில், 補償 மற்றும் 免責 ஆகியவை ஒத்த பொருளுள்ள சொற்கள் அல்ல. ஒன் என்பது "நாங்கள் உங்களுக்கு திரும்பக் கொடுப்போம்" என்று பொருள். மற்றொன்று "நீங்கள் முதல் இடத்தில் கூற்றிலிருந்து பாதுகாக்கப்பட்டுள்ளீர்கள்" என்று பொருள். ஒரு மொழிபெயர்ப்பு தளம் 補償 ஐ பயன்படுத்தினால் 免責 சரியான இடத்தில் இருக்க வேண்டும், ஜப்பானிய பதிப்பை படிக்கும் வழக்குரைஞர் ஆங்கில பதிப்பு விவரிக்கும் அதே ஒப்பந்தத்தைக் காணமாட்டார்.
இது தரவுத்தொகுப்பில் மிகவும் முக்கியமான கண்டுபிடிப்பு ஆகும். சோதனை வாக்கியம்: "இந்த மருந்து கல்லீரல் செயல்பாடு குறைபாடு உள்ள வரலாறு கொண்ட நோயாளிகளுக்கு தடை செய்யப்பட்டுள்ளது." மூலம்: மருத்துவ பொருள் ஆவணங்கள். இலக்கு: வியட்நாமிய.
முக்கியமான சொல் "கல்லீரல் செயலிழப்பு." இரண்டு வியட்நாமிய வேட்பாளர்கள் உள்ளனர்:
இவை மருத்துவ ரீதியாக வேறுபட்டவை. "கல்லீரல் செயல்பாட்டில் குறைவு" என்ற அடிப்படையில் உள்ள முரண்பாடு எச்சரிக்கை, முழு உறுப்பு செயலிழப்பை அனுபவித்தவர்களுக்கு மட்டுமல்லாமல், குறைந்த கல்லீரல் செயல்பாட்டைக் கொண்ட எவருக்கும் பொருந்தும். suy gan ஐ பயன்படுத்துவது சுட்டிக்காட்டப்பட்ட மக்கள்தொகையை தவறாக குறுக்குவிடுகிறது. மிதமான கல்லீரல் செயல்பாட்டு குறைபாடு உள்ள ஒரு நோயாளி suy gan ஐ படிக்கும் போது தங்களை தடைசெய்யப்பட்ட மக்கள் குழுவாக அங்கீகரிக்க முடியாமல் இருக்கலாம்.

சில மூல வாக்கியங்கள் வேண்டுமென்றே பொருளுவளவாக இருக்கின்றன. "That's sick" என்ற சொல் இன்றைய ஆங்கில ஸ்லாங்கில் ஏதோ சிறந்தது என்று பொருள் தருகிறது, ஆனால் இது இன்னும் அதன் நேரடி அர்த்தத்தையும் (அதாவது வெறுப்பூட்டும்/அருவருப்பான) வைத்திருக்கிறது, மேலும் இந்த இரண்டு அর்த்தங்களுக்கு இடையிலான பதற்றம் சொற்றொடர் எவ்வாறு தொடர்பு கொள்கிறது என்பதের ஒரு பகுதியாகும். ஒரு மொழிபெயர்ப்பு மாதிரியின் சவாலு: நீங்கள் தெளிவற்ற தன்மையைப் பாதுகாக்கிறீர்களா, அதை மிகவும் சாத்தியமான அர்த்தத்திற்கு சரிந்துவிடுகிறீர்களா, அல்லது ஒன்றைத் தேர்ந்தெடுத்து உறுதিபடுத்துகிறீர்களா?


இந்த சோதனையில் உள்ள மாதிரிகள் அனைத்தும் சமம் இல்லை. அவை வெவ்வேறு கட்டமைப்புகள், பயிற்சி முறைகள் மற்றும் பயன்பாட்டு சூழல்களை உள்ளடக்கியுள்ளன. ரவுண்ட் 1 அடிப்படைக் கோட்டில் பரவலாக அணுகக்கூடிய மாதிரிகள் அন்தர்ভুक்தமாக உள்ளன. விரிவுபடுத்தப்பட்ட ரவுண்ட் 2 பூல் MachineTranslation.com இல் பணம் செலுத்தும் பயனர்களுக்கு இப்போது கிடைக்கும் பல புதிய பிரিமியம்-স்তরের மாதிரி மாறுபாடுகளைச் சேர்க்கிறது, இது ஒவ்வொரு தனிப்பட்ட வழங்குநரிடமும் தனித்தனி பணம் செலுத்தும் கணக்கு என்று பொருள்படும் அதே மாதிரி স்தரம்.

ரவுண்ட் 2 இல் விரிவுபடுத்தப்பட்ட பூல் MachineTranslation.com இல் பணம் செலுத்தும் பயனர்களுக்கு கிடைக்கும் மேம்பட்ட மாதிரிகளை உள்ளடக்கியுள்ளது. குளத்தை விரிவுபடுத்துவதின் விளைவு சீரானதல்ல. சில சோதனைகளில் (முறைமை/ஜப்பானிய), இது ஒருமித்த கருத்தை பொருளுள்ளவாறு மாற்றியது. மற்றவற்றில் (மருத்துவ சொல்லகராதி/வியட்நாமிய), பிளவு ஆழமடைந்தது.

சோதனை தரவு இரண்டு வெவ்வேறு தோல்வி வகைகளை சுட்டிக்காட்டுகிறது, மேலும் அவை வெவ்வேறு பதிலிகளைத் தேவைப்படுத்துகின்றன.
வகை A: அமைதியான தோல்விகள். முறைமை பிழைகள், பதிவு பிழைகள், மருத்துவ சொல்லாட்சி துல்லியம்: இவை சரியாக தோன்றும் வெளியீடுகளை உருவாக்குகின்றன. ஜப்பானியர் இலக்கணமாக உள்ளனர். வியட்நாமிய மொழி பேசுபவர் சரளமாக பேசுகிறார். எந்த பிரச்சனையும் ஏற்பட்டதற்கான எந்த வெளிப்புற சமிக்ஞையும் இல்லை. ஒரு மொழிபெசும் பயனர் ஒரு மாதிரியின் வெளியீட்டைப் படிக்கும்போது, மாதிரி ஒரு மூத்த ஜப்பানிய நிர்வாহகர் கவனிக்கக்கூடிய பதிவேட்டு தேர்வு செய்தது என்பதை அறிய எந்த வழியும் இல்லை, அல்லது ஒரு மருத்துவ சொல் குறுக்கப்பட்ட வகையில் அது பொருந்தும் மக்களை மாற்றுகிறது.
வகை B: தெரியும் தோல்விகள். MiniMax "burning the midnight oil" என்பதை "burning torches" என்று மொழிபெயர்க்கிறது. GPT-4.1-NANO "அது நோயுள்ளது" என்பதை தெளிவற்ற "すごい" என்பதாக தீர்மானித்தல். இவை கண்டறியக்கூடியவை, இலக்கு மொழியின் பேசுபவரால் அல்லது மற்ற மாதிரி வெளியீடுகளுடன் 비교ப்படுவதன் மூலம்.
பல-மாதிரி 비교 SMART வழங்குவது Category A இல் மிகவும் மূல்யவானது. ஐந்து அல்லது பத்து மாதிரிகள் வெளியீடுகளை உற்பத்தி செய்யும் போது மற்றும் பெரும்பாலானவை முறையான பதிவேட்டில் ஒப்புக்கொள்ளும் போது ஒன்று சாதாரண வெற்று-வடிவ ஜப்பானிய மொழியை உற்பத்தி செய்கிறது, கருத்து வேறுபாடு 비교 காட்சியில் தெரியும். இலக்கு மொழியைப் பேசும் ஒரு பயனாளர் விருப்பங்களை மதிப்பீடு செய்யலாம். ஒரு பயனர் சர்ச்சைக்குரிய முடிவு எடுக்கப்பட்டதைக் காணலாம் மற்றும் அந்த வாக்கியம் மனித மதிப்பாய்வுக்கு தகுதியுடையதா என்பதை முடிவு செய்யலாம்.
ஆவணத்-அளவிலான வேலைக்கு, பெரிய கோப்புகள், PDF-களின் தளவமைப்பு-பாதுகாக்கும் மொழிபெயர்ப்பு, ஒப்பந்தங்கள் அல்லது மருத்துவ பொருட்களுக்கு, தளத்தின் ஆவணம் செயலாக்க திறன் கோப்பு கட்டமைப்பைக் கையாளுகிறது வடிவமைப்பை உடைக்காமல். ஆனால் மேலே எழுப்பப்பட்ட தரம் சம்பந்தப்பட்ட கேள்விகள் கோப்பு அளவைப் பொருட்படுத்தாமல் பொருந்தும். 100 பக்கங்களைக் கொண்ட ஒரு மருத்துவ ஆய்வில் "கல்லீரல் செயல்பாட்டு குறைபாடு" என்ற ஒவ்வொரு நிகழ்வும் "கல்லீரல் செயலிழப்பு" என்று மொழிபெயர்க்கப்பட்டது என்பது சோதனை 2 இல் கண்டறியப்பட்ட அதே சிக்கலின் ஒரு பெரிய பதிப்பாகும்.
மருத்துவ மற்றும் சட்ட வகைகளுக்கு குறிப்பாக, மனித சரிபார்ப்பு சரியான பின்னணி ஆதரவாகும். Tomedes' AI பிந்தைய-திருத்தல் சேவை, AI வெளியீட்டை சான்றளிக்கப்பட்ட மனித மதிப்பாய்வுடன் இணைக்கிறது, இந்த வகையான உচ்च-ஆபத்து உள்ளடக்கத்திற்காக கட்டமைக்கப்பட்டுள்ளது. சுய கான் / சுய கிआம் சுக்ष்ம கான் பிளவு என்பது சரியாக அந்த மதிப்பாய்வைத் தூண்டக்கூடிய ஒரு கண்டுபிடிப்பு, அனைத்து மாதிரிகளும் தவறு என்பதால் அல்ல, மாறாக மிகவும் நம்பிக்கையுடன் இருக்கும் மாதிரிகள் மிகவும் துல்லியமாக இல்லை என்பதால்.
பல வெளியீடுகளைப் பார்ப்பதின் மதிப்பு என்னவென்றால், நீங்கள் எப்போதும் பெரும்பான்மையைத் தேர்ந்தெடுப்பீர்கள் என்பதல்ல. நீங்கள் ஒரு தேர்வு செய்யப்பட்டது தெரிந்துகொள்வீர்கள் என்பது, உங்களுக்கு முன் உள்ள வெளியீடு சரியானது என்று கருதுவதிலிருந்து வேறுபட்டது.

எட்டு சோதனைகளை ஒன்றாக வைத்து ஒரு முறை நிலைத்திருக்கிறது: உடன்பாடு மற்றும் கருத்து வேறுபாடு சீரற்ற முறையில் விநியோகிக்கப்படவில்லை. வழக்கமான, அன்றாட வணிக மொழி ("தொடர்பு கொள்ளுதல்," "நள்ளிரவு வேலை செய்தல்") கிட்டத்திட்ட ஒவ்வொரு மாதிரியிலும் இரண்டு சுற்றுகளிலும் ஒன்றிணைந்தது. முறைமையும், சட்ட துல்லியতையும், மருத்துவ சொற்களும் இல்லை. CEO-முறைமை சோதனை விரிவாக்கப்பட்ட குழு சேர்க்கப்பட்ட பிறகுதான் முறைசாரா நிலையிலிருந்து முறைசாரிய நிலைக்கு ஒரு முறை மாறியது. இழப்பீட்டு விதி (indemnification clause) ஒரு உண்மையான சட்ட வேறுபாட்டை (免責 vs. 補償) வெளிப்படுத்தியது, இது ஒரு மாதிரி, ஒரு சுற்றில் மட்டுமே சரியாக பெற்றது. மருத்துவ சொல்லியல் பிளவு எந்த வகையிலும் தீர்க்கப்படவில்லை, இரண்டு சுற்றுகளிலும் பொதுவாக 6-க்கு-4 என்ற விகிதத்தில் இருந்தது, எந்த மாதிரிகள் குளத்தில் இருந்தாலும் பொருட்படாமல்.
இது உண்மையான கண்டுபிடிப்பு, மார்க்கெட்டிங் கூற்று அல்ல: ஒருமித்த கருத்து ஒவ்வொரு வாக்கியத்தையும் சிறப்பாக்குவதில்லை, மேலும் அதற்கு தேவையில்லை. இது மிகவும் மதிப்புமிக்கது சரியாக ஒரு மாதிரியின் சரளத்தை சந்தேகிக்க உங்களுக்கு எந்த காரணமும் இல்லாத இடத்தில், மற்றும் தவறாக இருப்பது உண்மையில் ஏதாவது செலவாகும் இடத்தில்.
இந்த சோதனைக்கு இரண்டாவது, மிகவும் நடைமுறை அடுக்கு உள்ளது, இது தெளிவாக கூறுவதற்கு மதிப்புள்ளது. இந்த ஒப்பீட்டை நானே நடத்துவது என்பது GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, மற்றும் MiniMax M2.7 ஆகியவற்றின் வெளியீடுகளை ஒரே இடத்தில், ஒரே தளத்தில், বিদ்யமான அடிப்படை மாதிரிகளுடன் இணையாக சரிபார்ப்பது என்று பொருள். MachineTranslation.com க்கு வெளியே, அது ஒரு சந்தா அல்ல. இது பல உள்ளது, ஒவ்வொரு வழங்குநரின் பிரீமியம் நிலையை சோதிக்க விரும்பும் ஒவ்வொன்றுக்கும் ஒன்று, ஒவ்வொரு வழங்குநரும் தனித்தனியாக வசூல் செய்யும் விலையில். இங்கு பணம் செலுத்தும் பயனர்கள் ஐந்து தனித்தனி பிரீமியம் சந்தாக்களை பராமரிப்பதற்கான செலவின் ஒரு பகுதியில் ஒரே ஒரு கிளிக்கில் அதே ஒப்பீட்டைப் பெறுகிறார்கள், உண்மையில் முக்கியமான விஷயத்தை விட்டுக்கொடுக்காமல்: மாதிரிகள் எங்கு உடன்படுகின்றன என்பதைப் பார்ப்பது, மற்றும் அவை எப்போது உடன்படாது என்பதை சரியாக அறிவது.
இரண்டுமே வகைப்படுத்தப்பட்ட முறையில் சிறந்தது அல்ல; இது சோதனை வகையைப் பொறுத்தது. Claude Sonnet மற்றும் Claude Opus ஆகியவை மிகவும் துல்லியமான வியட்நாமிய மருத்துவ சொல்லைத் தொடர்ந்து தேர்ந்தெடுத்தன, மேலும் Claude Opus "That's sick" என்பதற்கான மிகவும் பொருத்தமான ஸ்லாங்கை உருவாக்கியது. ஆனால் Claude Sonnet ஒரு முறையான CEO-சூழல் வாக்கியத்தில் சாதாரண ஜப்பானிய மொழியையும் உருவாக்கியது, அங்கு GPT-5.5 சரியாக பெற்றது. வெளியீடுகளை நேரடியாக ஒப்பிடுவது ஒரு மாதிரியைத் தேர்ந்தெடுத்து அதை நம்புவதை விட மிகவும் நியாயமானது.
ஒன்று இல்லை; துல்லியம் களத்தைச் சார்ந்துள்ளது. இந்த சோதனையில் Gemini 3.5-Flash மற்றும் GLM-5-Turbo மிகவும் பொருத்தமான முறையான ஜப்பானிய மொழியை உருவாக்கினார்கள். இரண்டு Claude மாதிரிகளும் வியட்நாமிய மருத்துவ சொல்லியலில் மிகவும் துல்லியமாக இருந்தன. DeepSeek V4-Pro ஆனது சரியான ஜப்பானிய சட்ட சொல்லைப் பயன்படுத்திய ஒரே மாதிரியாக இருந்தது, ஆனால் இரண்டாம் சுற்றில் மட்டுமே, மேலும் இது வேறு இடங்களில் சாதாரண ஜப்பானிய மொழியை உருவாக்கியது. எந்த ஒரு மாதிரியும் எட்டு சோதனைகள் அனைத்திலும் ஆதிக்கம் செலுத்தவில்லை.
இல்லை, தானாகவல்ல. புதிய பிரিமியம்-நிலை மாதிரி மாறுபாடுகளுடன் குளத்தை விரிவுபடுத்துவது ஜப்பানிய முறைமை சோதனையில் முறைசாரா முதல் முறைசாரமான ஆக்கத்திற்கு மாற்றிக் கொடுத்தது. ஆனால் வியட்நாமிய மருத்துவ சொல்லியல் சோதனையில், எந்த மாதிரிகள் சேர்க்கப்பட்டாலும் பொருட்படுத்தாமல் பிளவு தோராயமாக 6-க்கு-4 என்ற விகிதத்தில் நீடித்தது. அதிக மாதிரிகள் அதிக கருத்து வேறுபாடுகளை வெளிப்படுத்துகின்றன, இது பயனுள்ள சமிக்ஞை ஆனால் ஒருமித்த கருத்து இன்னும் பெரும்பான்மையை பின்பற்றுகிறது, மற்றும் பெரும்பான்மை எப்போதும் மிகவும் துல்லியமான பதில் அல்ல.
SMART என்பது MachineTranslation.com இன் பல-மாதிரி ஒருமித்த அமைப்பு ஆகும், இது OpenAI, Anthropic, Google மற்றும் DeepSeek உட்பட வழங்குநர்களுக்கு 22 AI மாதிரிகள் வரை பரவியுள்ளது. இது ஒரே நேரத்தில் பல மாதிரிகள் மூலம் மொழிபெயர்ப்பை இயக்குகிறது மற்றும் ஒவ்வொரு தனிப்பட்ட மாதிரியின் பதிலுடன் பெரும்பான்மை-ஒருமித மொழிபெயர்ப்பு முடிவை முன்னிலைப்படுத்துகிறது, இயல்பாக, எந்த உள்ளமைவும் தேவையில்லை. மாதிரி குழு மாறும்போது ஒருமித்த கருத்து மாறுகிறது, இந்த சோதனையின் ஜப்பானிய முறைமை முடிவில் காட்டப்பட்டுள்ளது: சுற்று 1 இல் ஒரு சாதாரண ஒருமித்த கருத்து சுற்று 2 இல் முறைசாரமாக மாறியது.
ஒரு ஒক்க மாதிரி இல்லை; மனித மதிப்பாய்வு சிறந்த பதில். Claude மாதிரிகள் தொடர்ந்து மிகவும் துல்லியமான வியட்நாமிய மருத்துவ சொல்லைத் தேர்ந்தெடுத்தன, மேலும் DeepSeek V4-Pro மட்டுமே சரியான ஜப்பானிய சட்ட சொல்லைப் பயன்படுத்தியது, ஆனால் ரவுண்ட் 2 இல் மட்டுமே. 10 மாதிரிகள் முழுவதும் மருத்துவ சொல்லியல் பிளவு ஒருபோதும் தீர்க்கப்படவில்லை, இது ஒரு வேறுபட்ட மாதிரியைத் தேர்ந்தெடுக்க வேண்டும் என்பதை சுட்டிக்காட்டாமல், களத்தின் நிபுணத்வம் தேவை என்பதை சுட்டிக்காட்டுகிறது. Tomedes வழங்குவது போல் சான்றளிக்கப்பட்ட மனித பிந்தைய-திருத்த மதிப்பாய்வு, அந்த நிபுணர் சோதனையை வழங்குகிறது.