July 10, 2026
Dos paraules. Sis models. Tres decisions de traducció diferents. Aquí és el que va passar quan vaig executar 8 oracions de prova a través dels últims models d'IA disponibles a MachineTranslation.com, i el que els resultats revelen realment sobre quan un model falla silenciosament.
Dues paraules. Això és malalt. Sis models. Tres decisions de traducció distintes.
En japonès, un model ho va renderitzar com それはやばい, preservant l'ambigüitat. Un altre va deixar caure el pronom subjecte completament i va escriure la forma nua やばい, la versió més col·loquial possible. Un tercer va escriure それはすごい, que resol completament l'ambigüitat a favor de "sorprenent", eliminant el doble significat que feia interessant la frase en primer lloc. En vietnamita, un model va escriure Đỉnh vậy (argot, correcte per al registre juvenil). Un altre va escriure Thật tuyệt vời, gramaticalment correcte, però més a prop de dir "això és veritablement meravellós" quan algú et mana un meme per missatge.
Tots aquests són defensables. Cap d'ells no és el mateix. I els esteu executant traduccions a través d'un únic model, mai no veureu l'opció que es va fer en vostre nom.
Aquesta és la qüestió central que aquest article intenta respondre. No quin model d'IA és millor per a la traducció el 2026 (la resposta depèn de la parella de llengües, el registre, el domini i l'estructura de les frases), sinó més aviat: com sabries quan el teu model ha pres una decisió equivocada? Especialment en dominis com la terminologia mèdica, els contractes legals o la formalitat professional, on la decisió equivocada es veu exactament com una traducció correcta fins que un especialista la llegeix.
Això és el que vaig fer. Vaig passar 8 oracions de prova a través de dues rondes de models a MachineTranslation.com: primer una línia de base de 5 models àmpliament utilitzats, després un conjunt expandit que afegeix diverses de les variants de model de nivell premium més noves ara disponibles per als usuaris que paguen. Normalment, comparar els resultats de models com aquest significaria tenir subscripcions de pagament separades amb cada proveïdor individualment. A MachineTranslation.com, es troben a la mateixa vista de comparació. Els parells de llengües eren anglès→japonès i anglès→vietnamita. Les categories de frases van ser escollides específicament per posar a prova les àrees on el desacord del model és més conseqüent: fraseologia idiomàtica, terminologia legal, terminologia mèdica, context sensible a la formalitat, i ambigüitat semàntica deliberada.
Una nota sobre la metodologia d'avaluació: la investigació en traducció automàtica ha estat lluitant durant molt de temps amb la manera de puntuar les sortides automàticament. Mètriques com BLEU i COMET tal com es mesuren en les tasques compartides de WMT proporcionen un senyal agregat útil, però són pobres en detectar errors de registre, fracassos d'idioma i precisió terminològica, exactament les categories que més importa aquí. El que esteu a punt de llegir és una anàlisi de resultats, no una carrera BLEU.

No tota frase evidencia un desacord significatiu. Dues de les vuit proves, "Let's touch base once the dust settles on this deal" (→ japonès) i "We're burning the midnight oil to hit this launch date" (→ vietnamita), van produir un alt acord en ambdues rondes. Els idioms van ser correctament entesos com a idioms. Ningú no va traduir "touch base" com tocar una base física. Ningú no ha traduït "the dust settles" com a sediment que cau.
Això val la pena parar-s'hi: el llenguatge empresarial idiomàtic anglès es gestiona raonablement bé pels models frontissa actuals quan l'idioma és prou comú. El consens per a "touch base" es va mantenir estable en ambdues rondes; la variació va ser purament estilística, al voltant de si utilitzar この件 (aquest assumpte), この取引 (aquest tracte), o aquesta proposta (aquest cas) per a la frase font.

La prova de "cremar l'oli de mitjanit" és on les coses es van tornar més interessants. Tots els models excepte un van entendre correctament l'expressió idiomàtica. MiniMax M2.7, introduït en la Ronda 2, va traduir "burning" literalment, produint đốt đuốc, que significa "torxes cremant". El consens correctament l'ha exclòs.

El japonès és una llengua amb capes de formalitat. La tria de la terminació verbal, el pronom i la forma del nom referencial no és estilística. Indica la relació entre el parlant i el destinatari. Enviar un missatge al vostre director executiu utilitzant formes verbals col·loquials no és un error de traducció en el sentit gramatical. Es un error social, i un de significatiu.
Pots enviar-ho? Gràcies, ho aprecio. Contexte: missatge a un CEO.

El consens va canviar quan el grup de models es va expandir. El mecanisme és senzill: afegir models que llegissin correctament el context de formalitat va desplaçar la majoria, i el consens va seguir. Aquí es l'espectre complet del que els models van produir a la Ronda 2:

La prova del registre vietnamita va revelar un tipus diferent d'error de formalitat, un que és més subtil. La frase font: Ei, una pregunta ràpida — estàs lliure per fer una trucada? Context: enviar un missatge a un client. Qwen en la Ronda 1 va incloure "mình," un pronom de primera persona que implica una amistat casual a nivell de companys. Tots els altres models van evitar completament l'autoeferència en primera persona, que és l'opció professional més segura. Cruciallement, Qwen va corregir això en la Ronda 2 i va deixar caure "mình." El consens en ambdues rondes l'ha exclòs.

La frase d'indemnització del venedor/client és una clàusula estàndard en els acords comercials: "El venedor indemnitzarà el client contra qualsevol reclamació de tercers que sorgeixi de l'incompliment d'aquest acord."
A la Ronda 1, els cinc models van identificar correctament el registre legal i van utilitzar els préstecs ベンダー (proveïdor) i クライアント (client), estàndard en els contractes comercials japonesos d'origen anglès. Una excepció: GPT-4.1-NANO va utilitzar 販売者 (venedor) i 顧客 (client), paraules japoneses legítimes que mancaven de l'especificitat legal formal dels equivalents de paraules manllevades.
El descobriment més important va sorgir a la Ronda 2. La distinció clau és entre dues paraules:
Aquests són conceptes legalment diferents. "Indemnify" específicament significa protegir una part de la responsabilitat de tercers. 免責 és el terme legal correcte. Tots els models de la Ronda 1 van utilitzar 補償. A la Ronda 2, DeepSeek V4-Pro va ser l'únic model que va produir 免責, i ho va fer a la Ronda 2 només, no a la Ronda 1.

En un contracte, 補償 i 免責 no són sinònims. Un significa "us reemborsar". L'altre significa "estàs protegit de la demanda des del principi." Si una plataforma de traducció utilitza 補償 on 免責 és correcte, un advocat que llegeixi la versió japonesa no veurà el mateix acord que descriu la versió anglesa.
Aquest és el descobriment més important del conjunt de dades. La frase de prova: "Aquest medicament està contraindicat en pacients amb antecedents d'insuficiència hepàtica." Font: documentació de producte clínic. Objectiu: Vietnamita.
El terme crític és "insuficiència hepàtica". Hi ha dos candidats en vietnamita:
Aquestes són clínicament diferents. Una advertència de contraindicació basada en "insuficiència hepàtica" s'aplica a qualsevol persona amb funció hepàtica reduïda, no només a aquells que van experimentar una fallida completa de l'òrgan. L'ús de suy gan estreny la població indicada incorrectament. Un pacient amb insuficiència hepàtica moderada que llegeix "suy gan" podria no reconèixer-se com a població contraindicada.

Algunes frases font són ambigües per disseny. "Això és malalt" en l'argot anglès contemporani significa quelcom excel·lent, però també manté el seu significat literal (és a dir, que és nauseabund/repugnant), i la tensió entre aquests dos significats és part de com la frase es comunica. El repte per a un model de traducció és: preserves l'ambigüitat, la col·lapses al significat més probable, o en trieu una i us hi comprometeu?


Els models en aquesta prova no són tots equivalents. Abasten diferents arquitectures, règims d'entrenament i contextos de desplegament. La línia de base de la Ronda 1 inclou models que són àmpliament accessibles. El grup ampliat de la Ronda 2 afegeix diversos dels variants de model de nivell premium més nous disponibles ara per als usuaris de pagament a MachineTranslation.com, el mateix nivell de model que d'altra manera significaria un compte de pagament separat amb cada proveïdor individual.

El grup ampliat a la Ronda 2 inclou models més avançats i disponibles per als usuaris de pagament a MachineTranslation.com. L'efecte d'ampliar el conjunt no és uniforme. En alguns tests (formalitat/japonès), va desplaçar significativament el consens. En altres (terminologia mèdica/vietnamita), la divisió s'aprofundí.

Les dades de prova apunten a dues categories de fallada diferents, i requereixen respostes diferents.
Categoria A: Fracassos silenciosos. Errors de formalitat, errors de registre, precisió de la terminologia mèdica: aquests produeixen resultats que semblen correctes. El japonès és gramatical. El vietnamita és fluent. No hi ha cap senyal superficial que res hagi anat malament. Un usuari monolingüe que llegeix la sortida d'un únic model no té manera de saber que el model va fer una elecció de registre que un executiu sènior japonès notaria, o que un terme clínic va ser restringit d'una manera que canvia la població a la qual s'aplica.
Categoria B: Fracassos visibles. MiniMax traduint "burning the midnight oil" com a "cremar torxes." GPT-4.1-NANO resolent "That's sick" a l'inequívoc "すごい." Aquests són detectables, ja sigui per un parlant de la llengua meta o per comparació amb altres sortides de models.
La comparació multimodel que proporciona SMART és més valuosa a la Categoria A. Quan cinc o deu models produeixen sortides i la majoria està d'acord en un registre formal mentre que un produeix japonès en forma plana casual, el desacord és visible a la vista de comparació. Un usuari que parla la llengua objectiu pot avaluar les opcions. Un usuari que no pot veure que es va prendre una decisió contestada, i decidir si aquesta sentència justifica una revisió humana.
Per al treball a escala de document, fitxers grans, traducció que preserva la disposició de PDF, contractes o materials clínics, la capacitat de processament de documents de la plataforma gestiona l'estructura de fitxers sense trencar el format. Però les qüestions de qualitat plantejades anteriorment s'apliquen independentment de la mida del fitxer. Un estudi clínic de 100 pàgines on cada instància de "hepatic impairment" es tradueix com a "insuficiència hepàtica" és una versió més gran del mateix problema identificat a la Prova 2.
Per a les categories mèdica i legal específicament, la verificació humana és la mesura de seguretat correcta. El servei de Postedició per IA de Tomedes, que combina la sortida de l'IA amb una revisió humana certificada exactament per a aquest tipus de contingut d'alt risc, està construït per a això. La divisió suy gan / suy giảm chức năng gan és exactament el tipus de descoberta que hauria de desencadenar aquesta revisió, no perquè tots els models siguin incorrectes, sinó perquè els models que són més confiats no són els més precisos.
El valor de veure múltiples resultats no és que sempre triareu la majoria. Es que sabràs que es va fer una elecció, que és diferent d'assumir que el resultat davant teu és correcte.

Posa les vuit proves una al costat de l'altra i es manté un patró: l'acord i el desacord no es distribueixen aleatòriament. El llenguatge empresarial idiomàtic i quotidià ("posar-se en contacte", "treballar fins a altes hores de la nit") va convergir en gairebé tots els models del grup, en ambdues rondes. La formalitat, la precisió legal i la terminologia mèdica no ho van fer. La prova de formalitat del CEO va canviar de casual a formal només quan es va incloure el grup ampliat. La clàusula d'indemnització va revelar una distinció legal real (免責 vs. 補償) que només un model, en una ronda, va aconseguir encertar. La divisió de la terminologia mèdica mai no es va resoldre del tot, mantenint-se aproximadament en una proporció de 6 a 4 en ambdues rondes independentment de quins models estaven al grup.
Aquest és l'hallazgo real, no una afirmació de màrqueting: el consens no millora cada frase, i no cal que ho faci. És més valuós exactament on la fluïdesa d'un únic model no et dona cap raó per dubtar-ne, i on estar equivocat realment costa quelcom.
Hi ha una segona capa més pràctica d'aquesta prova que val la pena exposar clarament. Executar aquesta comparació jo mateix va significar verificar les sortides de GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo i MiniMax M2.7 costat a costat amb els models de referència existents, en un lloc, en una única plataforma. Fora de MachineTranslation.com, això no és una subscripció. Són varios, un per a cada proveïdor la versió premium del qual vulguis provar, al preu que cobra individualment cada proveïdor. Els usuaris de pagament aquí obtenen aquesta mateixa comparació amb un clic, per una fracció del que costaria mantenir cinc subscripcions premium separades, sense renunciar a la cosa que realment importa: veure on els models estan d'acord, i saber exactament quan no ho estan.
Cap dels dos no és categòricament millor; depèn de la categoria de prova. Claude Sonnet i Claude Opus van triar consistentment el terme mèdic vietnamita més precís, i Claude Opus va produir l'argot més apropiat per a "That's sick." Però Claude Sonnet també va produir japonès casual en una frase de context formal de CEO, on GPT-5.5 ho va aconseguir correctament. Comparar les sortides directament és més defensable que triar un model i confiar-hi.
No n'hi ha un; la precisió depèn del domini. Gemini 3.5-Flash i GLM-5-Turbo van produir el japonès formal més apropiat en aquesta prova. Tots dos models de Claude van ser més precisos en la terminologia mèdica vietnamita. DeepSeek V4-Pro va ser l'únic model que va utilitzar el terme legal japonès correcte, però només a la Ronda 2, i va produir japonès casual en altres llocs. Cap model únic va dominar en tots els vuit tests.
No, no automàticament. L'expansió del conjunt amb variants de model de nivell premium més recent va desplaçar el consens de casual a formal en la prova de formalitat japonesa. Però en la prova de terminologia mèdica vietnamita, la divisió es va mantenir aproximadament en una proporció de 6 a 4 independentment de quins models s'incloïssin. Més models surfacen més desacord, que és un senyal útil, però el consens encara segueix la majoria, i la majoria no sempre és la resposta més precisa.
SMART és el sistema de consens multimodel de MachineTranslation.com, que abasta fins a 22 models d'IA de proveïdors com OpenAI, Anthropic, Google i DeepSeek. Executa una traducció a través de múltiples models simultàniament i mostra la sortida de consens majoritari juntament amb la resposta de cada model individual, per defecte, sense necessitat de configuració. El consens canvia quan canvia el conjunt de models, tal com es mostra en el resultat de formalitat japonesa d'aquesta prova: un consens casual a la Ronda 1 es va convertir en formal a la Ronda 2.
La revisió humana és la millor resposta, no hi ha un únic model. Els models Claude van triar consistentment el terme mèdic vietnamita més precís, i DeepSeek V4-Pro va ser l'únic que va utilitzar el terme legal japonès correcte, però només en la Ronda 2. La terminologia mèdica dividida mai es va resoldre entre els 10 models, cosa que senyala que es requereix experiència en el domini, no que s'hauria de triar un model diferent. A revisió d'edició humana certificada, com ofereix Tomedes, proporciona aquesta comprovació especialitzada.