July 10, 2026
Du vortoj. Ses modeloj. Tri malsamaj tradukdecidoj. Jen estas kio okazis kiam mi pasigis 8 testajn frazojn tra la plej novaj AI-modeloj disponeblaj ĉe MachineTranslation.com, kaj kion la produktaĵoj efektive malkaŝas pri kiam modelo malsukcesas silente.
Du vortoj. Tio estas malsana. Ses modeloj. Tri distinctaj tradukaj decidoj.
En japana, unu modelo ĝin prezentis kiel それはやばい, konservante la ambiguecon. Alia tute forlasis la subjektan pronomon kaj skribis la nudan formon やばい, la plej kolokvia versio ebla. Tria persono skribis それはすごい, kio tute solvas la ambigueco favore de "mirinda," forstrabe la duoblan signifon kiu igis la frazon interesa antaŭe. En la Vjetnama, unu modelo skribis Đỉnh vậy (slango, ĝusta por junulara registaro). Alia skribis Tio estas vere mirinda, gramatike ĝusta, sed pli proksima al diro "tio estas vere meravela" kiam iu tekstas al vi memon.
Ĉiuj el ĉi tiuj estas defendeblaj. Neniu el ili estas la sama afero. Kaj se vi uzas tradukon per ununura modelo, vi neniam vidos la elekton, kiu estis farita en via nomo.
Tio estas la centra demando, kiun ĉi tiu artikolo provas respondi. Ne kiu AI-modelo estas plej bona por traduko en 2026 (la respondo dependas de la lingva paro, registaro, domajno, kaj frazvico), sed anstataŭe: kiel vi scipovas kiam via modelo faris la malĝustan decidon? Precipe en domajnoj kiel medicina terminologio, juraj kontraktoj, aŭ profesia formaleco, kie la malĝusta decidon aspektas ekzakte kiel ĝusta traduko ĝis specialisto ĝin legas.
Jen kio mi faris. Mi testis 8 testeajn frazojn per du rondoj de modeloj sur MachineTranslation.com: unue bazlinion de 5 vaste uzataj modeloj, poste etenditan grupon kiu aldonas plurajn el la plej novaj ĉefnivelaj variantoj de modeloj nun disponeblaj por pagantaj uzantoj. Normale, kompari rezultojn el modeloj kiel ĉi tio signifus apartajn pagitajn abonojn ĉe ĉiu provizanto aparte. Ĉe MachineTranslation.com, ili sidas en la sama kompara vido. La lingvoparo estis Angla→Japana kaj Angla→Vjetnama. La frazaj kategorioj estis elektitaj specife por stres-testi areojn kie modelo-malakordo estas plej konsekvenco: idioma frazo, jura terminologio, medicina terminologio, formaleco-senca kunteksto, kaj intenca semantika ambigueco.
Noto pri taksa metodologio: maŝina traduko-esplorado longe luktas pri kiel aŭtomate taksi produktaĵojn. Metriko kiel BLEU kaj COMET kiel mezurite en WMT-kunaj taskoj donas utilan kunmetitan signalon, sed ili estas malbonoj en detektado de registraj eraroj, idiomaj malsukcesoj, kaj terminologia precizeco, ĝuste la kategorioj kiuj plej gravas ĉi tie. Kio vi estas apud legi estas eligo-analizo, ne BLEU-kuraco.

Ne ĉiu frazo surfacas signifan malakordon. Du el la ok testoj, "Ni kontaktu sin post kiam la polvo sidiĝos ĉe ĉi tiu interkonsento" (→ japana) kaj "Ni brulas la meznoktan oleon por atingi ĉi tiun lanĉan daton" (→ vjetnama), produktis altan konsenon en ambaŭ rondoj. La idiomoj estis ĝuste komprenataj kiel idiomoj. Neniu tradukis "touch base" kiel tuŝi fizikan bazon. Neniu tradukis "the dust settles" kiel sedimento falas.
Ĉi tio merias paŭzigi: idioma angla komerca lingvo estas sufiĉe bone traktata de nuntempaj limaj modeloj kiam la idiomo estas sufiĉe ofta. La konsensuo por "tuŝi bazon" restis stabila tra ambaŭ turnoj; variaĵo estis pure stilistika, ĉirkaŭ ĉu uzi この件 (ĉi tiu afero), この取引 (ĉi tiu negoco), aŭ この案件 (ĉi tiu kazo) por la fonta frazo.

La "brulado de la noktomeza oleo" testo estas kie aferoj iĝis pli interesaj. Ĉiu modelo krom unu ĝuste komprenis la idiomon. MiniMax M2.7, enmetita en Rondo 2, tradukis "burning" laŭvorte, produktante đốt đuốc, signifante "bruladaj torĉoj." La konsenzo ĝuste ekskluzis ĝin.

Japana estas formaleco-stratita lingvo. La elekto de verba finaĵo, pronomo, kaj referenca substantiva formo ne estas stila. Ĝi signalas la rilaton inter parolanto kaj ricevanto. Sendi mesaĝon al via ĉefo uzante neformajn verbajn formojn ne estas traduka eraro en la gramatika senco. Ĝi estas socia eraro, kaj signifa unu.
Ĉu vi povas sendi tion? Dankon, mi ĝin aprezas." Ĉapelo: mesaĝado al ĉefo.

La konsento ŝanĝiĝis kiam la modelo-aro vastiĝis. La mekanismo estas simpla: aldono de modeloj kiuj ĝuste legis la formaleco-kuntekston ŝanĝis la plimulton, kaj la konsento sekvis. Jen estas la plena spektro de kio la modeloj produktis en Rondo 2:

La vietnama registra testo malkovris alian specon de formaleco-eraro, unu, kiu estas pli subtila. La fonta frazo: "Hej, rapida demando — ĉu vi liberas por saltadi en voko?" Kunteksto: mesaĝo al kliento. Qwen en Rondo 1 inkludis "mình," unua-persona pronomo kiu implicas neformal samrangxa amikeco. Ĉiu alia modelo evitis tute unuapersonecan memoriferacon, kio estas la pli sekura profesia elekto. Decise, Qwen ĉi tion ĝustis en Rondo 2 kaj formetis "mình." La konsenzo en ambaŭ rondoj ĝin ekskludis.

La vendisto/kliento-indemniga frazo estas norma klauzo en komercaj interkonsentoj: "La vendisto indemnos la klienton kontraŭ ĉiuj pretoj de tria partio kiuj rezultas el malobeo de ĉi tiu interkonsento."
En Raŭndo 1, ĉiuj kvin modeloj ĝuste identigis la laŭjuran registron kaj uzis la pruntvortojn ベンダー (vendisto) kaj クライアント (kliento), normajn en japanaj komercaj kontraktoj kun angla origino. Unu escepto: GPT-4.1-NANO uzis 販売者 (vendisto) kaj 顧客 (kliento), legitimaj japanaj vortoj, kiuj mankas la formalan juran specifecon de la enpruntvortaj ekvivalentoj.
La pli grava malkovro aperis en Rondo 2. La ĉefa distingo estas inter du vortoj:
Ĉi tiuj estas jure malsamaj konceptoj. "Indemnify" specifice signifas ŝirmi partion de triaparta respondeco. 免責 estas la ĝusta jura termino. Ĉiuj Round 1 modeloj uzis 補償. En Rondo 2, DeepSeek V4-Pro estis la sola modelo produkti 免責, kaj ĝi faris tion en Rondo 2 nur, ne Rondo 1.

En kontrakto, 補償 kaj 免責 ne estas sinonimoj. Unu signifas "ni repagos vin." La alia signifas "vi estas ŝirmita kontraŭ la postulo en la unua loko." Se tradukplatformo uzas 補償 kie 免責 estas ĝusta, advokato leganta la japanan version ne vidos la saman interkonsenton, kiun la angla versio priskribas.
Ĉi tio estas la plej konsekva trovajo en la datumaro. La prova frazo: "Ĉi tiu medikamento estas kontraŭindikita ĉe pacientoj kun historio de hepata difekto." Fonto: klina produkta dokumentaro. Celo: Vjetnama.
La kritika termino estas "hepata difekto." Estas du Vietnamaj kandidatoj:
Ĉi tiuj estas klinike apartaj. Averto pri kontraŭindiko bazita je "hepata difekto" aplikas al iu ajn kun redukta hepata funkcio, ne nur al tiuj, kiuj spertis kompletan organan malsukceson. Uzado de suy gan malĝuste mallarĝigas la indikitan popolacion. Pacienta kun moderat hepata difekto kiu legas suy gan eble ne reknosce sin kiel la kontraŭindikita populacio.

Iuj fontaj frazoj estas intence ambiguaj. "Ĉio estas malsana" en nuna angla ĝargono signifas ion bonega, sed ĝi ankaŭ daŭre portas sian literalan signifon (tio estas naŭziga/abomena), kaj la tensio inter tiuj du signifoj estas parto de kiel la frazo komunikas. La ĉalenge por tradukmodelo estas: ĉu vi konservas la ambiguecon, kolapsas ĝin al la plej verŝajna signifo, aŭ elektas unu kaj engaĝiĝas?


La modeloj en ĉi tiu testo ne estas ĉiuj ekvivalentaj. Ili kovras malsamajn arkitekturojn, trejnajn reĝimojn, kaj disvastigajn kuntekstojn. La Rondo 1 bazlinio inkluzivas modelojn, kiuj estas larĝe alireblebla. La vastigita Rondo 2 aro aldonas plurajn el la plej novaj ĉefnivelaj modelvariantoj nun disponeblaj al pagantaj uzantoj sur MachineTranslation.com, la sama nivelo de modelo kiu alie signifus apartan pagitan konton ĉe ĉiu individua provizanto.

La vastigita aro en Rondo 2 inkluzivas modelojn kiuj estas pli progresintaj kaj disponeblaj al pagantaj uzantoj sur MachineTranslation.com. La efiko de vastigado de la ĉaro ne estas unuforma. En iuj testoj (formaleco/japana), ĝi ŝanĝis la konsenson signife. En aliaj (medicinaj terminoj/Vietnama), la fendo profundiĝis.

La testaj datenpunktoj montras du apartajn misfunkciokategoriojn, kaj ili postulas malsamajn respondojn.
Kategorio A: Silentaj malsukcesoj. Formalaj eraroj, registraj eraroj, precizeco de medicina terminologio: ĉi tiuj produktas eligaĵojn, kiuj ŝajnas ĝustaj. La japana estas gramatika. La vietnamano estas flua. Ne estas surfaca signalo, ke io ajn malbone iris. Monolingva uzanto leganta eligo de ununura modelo havas neniun manieron scii, ke la modelo faris registran elekton, kiun seniora japana direktoro rimarkus, aŭ ke klinika termino estis mallarĝigita en maniero, kiu ŝanĝas la popolon, al kiu ĝi aplikas.
Kategorio B: Videblaj malsukcesoj. MiniMax tradukante "bruli la noktomezon" kiel "bruli torĉojn." GPT-4.1-NANO solvante "That's sick" al la neambigua "すごい." Ĉi tiuj estas detektebla, aŭ de parolanto de la ĉela lingvo aŭ per komparo kun aliaj modelaj produktaĵoj.
La multi-modela komparo, kiun SMART provizas, estas plej valora en Kategorio A. Kiam kvin aŭ dek modeloj produktas produktaĵojn kaj plej multaj konsentas pri formala registro dum unu produktas neformalajn simpla-forman Japanan, la malkonsentado estas videbla en la kompara vido. Uzanto kiu parolas la ĉelan lingvon povas taksi la eblojn. Uzanto, kiu ne povas vidi, ke kontestita decido estis farita, kaj decidi ĉu tiu frazo garantias homan kontrolon.
Por dokumento-skala laboro, grandaj dosieroj, aranĝo-konservanta traduko de PDF-oj, kontraktoj, aŭ klinikai materialoj, la platformo's dokumento-traktada kapablo traktas dosieran strukturon sen rompi formatigon. Sed la kvalitaj demandoj levitaj supre validas sendepende de dosiera grandeco. Klinikal studo de 100 paĝoj, kie ĉiu apero de "hepata ĉeno" estas tradukita kiel "hepata fiasko" estas pli granda versio de la sama problemo identigita en Testo 2.
Por la medicinaj kaj juridikaj kategorioj specife, homa verifikado estas la ĝusta kontraŭo. La AI Post-Editing servo de Tomedes, kiu kunparegas AI-elstaraĵon kun sertifikita homa recenzo por ĝuste ĉi tiu speco de alta-staka enhavo, estas konstruita por ĉi tio. La divido de suy gan / suy giảm chức năng gan estas ĝuste la speco de trovajo kiu devus decigi tiun ĝeneralan kontrolon, ne ĉar ĉiuj modeloj estas malĝustaj, sed ĉar la modeloj kiuj estas plej certaj ne estas la plej precizaj.
La valoro de vidi multajn produktaĵojn ne estas ke vi ĉiam elektos la plimulton. Ĝi estas tio, ke vi scios, ke elekto estis farita, kio estas malsama ol supozi, ke la produktaĵo antaŭ vi estas ĝusta.

Metu la ok testojn apud unu la alian kaj ŝablono tenas: konsento kaj malkonsento ne estas hazarde distribuitaj. Idioma, ĉiutaga komerca lingvo ("kontakti", "bruli la noktomezon") konverĝis en preskaŭ ĉiu modelo en la aro, en ambaŭ rondoj. Formaleco, jura precizeco, kaj medicina terminologio ne faris. La testo de CEO-formaleco ŝanĝiĝis de neformala al formala nur kiam la vastigita aro estis inkluzivita. La klauzo pri indemnigo elmontris veran jura distingon (免責 vs. 補償) kiun nur unu modelo, en unu rondo, ĝuste komprenis. La medicinska terminologio neniam plene solviĝis, restante ĉe proksimume 6-kontraŭ-4 en ambaŭ rondoj sendepende de kiuj modeloj estis en la aro.
Tio estas la aktuala malkovro, ne mercanta aserto: konsento ne plibonigas ĉiun frazon, kaj ĝi ne devas. Ĝi estas plej valora ĝuste kie la fluo de ununura modelo donas al vi neniun kialon dubi ĝin, kaj kie esti malĝusta efektive kostas ion.
Ekzistas dua, pli praktika tavolo de ĉi tiu testo valena klarigi simple. Fari ĉi tiun komparon mem signifis kontroli la eligojn de GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, kaj MiniMax M2.7 flanke ĉe flanko kun la ekzistantaj bazliniaj modeloj, en unu loko, sur unu platformo. Ekster de MachineTranslation.com, tio ne estas unu abono. Estas pluraj, unu por ĉiu provizanto kies premia tavolo vi volas testi, je kio ajn ĉiu provizanto ĉarĝas individue. Pagantaj uzantoj ĉi tie ricevas tiun saman komparon en unu kliko, je frakcio de tio, kio kostas konservi kvin apartajn premiajn abonojn, sen rezigni pri la afero, kiu vere gravas: vidi kie la modeloj konsentas, kaj scii eksakte kiam ili ne konsentas.
Neniu estas kategorie pli bona; ĝi dependas de la testa kategorio. Claude Sonnet kaj Claude Opus konsisteme elektis la pli precizevan vietnaman medizinan terminon, kaj Claude Opus produktis la plej taŭgan arĝon por "Tio estas malsana." Sed Claude Sonnet ankaŭ produktis neformalajn japanan en formala CEO-kunteksta frazo, kie GPT-5.5 ĝin ĝuste faris. Direkta komparo de produktaĵoj estas pli defendebla ol elekti unu modelon kaj fidi ĝin.
Ne ekzistas unu; precizeco dependas de la domajno. Gemini 3.5-Flash kaj GLM-5-Turbo produktis la plej taŭgan formalan japanan en ĉi tiu testo. Ambaŭ Claude-modeloj estis plej precizaj pri vietnama medicina terminologio. DeepSeek V4-Pro estis la sola modelo, kiu uzis la ĝustan japanan juridikan terminon, sed nur en Rondo 2, kaj ĝi produktis neformalajn japanan aliloke. Neniu sola modelo superis en ĉiuj ok testoj.
Ne, ne aŭtomate. Vastigado de la aro kun novaj premium-nivela modelo-variantoj ŝanĝis la konsenson de neformala al formala en la japana formaleco-testo. Sed en la vietnama medicina terminologia testo, la divido persistis je proksimume 6-al-4 sendepende de kiuj modeloj estis inkluzivitaj. Pli da modeloj surfacas pli da malakordo, kio estas utila signalo, sed la konsento daŭre sekvas la plimulton, kaj la plimulto ne estas ĉiam la plej preciza respondo.
SMART estas la plur-modelo-konsensa sistemo de MachineTranslation.com, kiu ĝi ĉapelas ĝis 22 AI-modelojn tra provizantoj inkluzive OpenAI, Anthropic, Google, kaj DeepSeek. Ĝi rulumas tradukon tra multaj modeloj samtempe kaj surfacas la plimulton-konsenson produkton kune kun ĉiu individua modelo respondo, defaŭlte, sen konfiguro bezono. La konsenzo ŝanĝiĝas kiam la modelo-aro ŝanĝiĝas, kiel montrite en ĉi tiu testo de japana formaleco: neformala konsenzo en Rondo 1 fariĝis formala en Rondo 2.
Neniu sola modelo; homa recenzo estas la pli bona respondo. Claudaj modeloj konstante elektis la pli precizejan vietnaman medizinan terminon, kaj DeepSeek V4-Pro sole uzis la ĝustan japanan juridikan terminon, sed nur en Rondo 2. La medicina terminologio disiĝo neniam solviĝis tra 10 modeloj, kio signifas, ke domaina kompetenteco estas postulata, ne ke malsama modelo devus esti elektita. Revizaĵo de post-redaktado de homo sertifikita , kiel Tomedes ofertas, donas tiun specialistan kontrolon.