July 10, 2026

Quin traductor d'IA és més precís el 2026? He provat 10 dels últims models d'IA

Dos paraules. Sis models. Tres decisions de traducció diferents. Aquí és el que va passar quan vaig executar 8 oracions de prova a través dels últims models d'IA disponibles a MachineTranslation.com, i el que els resultats revelen realment sobre quan un model falla silenciosament.

Com sabries fins i tot quan el teu model va fer la trucada incorrecta?

Dues paraules. Això és malalt. Sis models. Tres decisions de traducció distintes.

En japonès, un model ho va renderitzar com それはやばい, preservant l'ambigüitat. Un altre va deixar caure el pronom subjecte completament i va escriure la forma nua やばい, la versió més col·loquial possible. Un tercer va escriure それはすごい, que resol completament l'ambigüitat a favor de "sorprenent", eliminant el doble significat que feia interessant la frase en primer lloc. En vietnamita, un model va escriure Đỉnh vậy (argot, correcte per al registre juvenil). Un altre va escriure Thật tuyệt vời, gramaticalment correcte, però més a prop de dir "això és veritablement meravellós" quan algú et mana un meme per missatge.

Tots aquests són defensables. Cap d'ells no és el mateix. I els esteu executant traduccions a través d'un únic model, mai no veureu l'opció que es va fer en vostre nom.

Aquesta és la qüestió central que aquest article intenta respondre. No quin model d'IA és millor per a la traducció el 2026 (la resposta depèn de la parella de llengües, el registre, el domini i l'estructura de les frases), sinó més aviat: com sabries quan el teu model ha pres una decisió equivocada? Especialment en dominis com la terminologia mèdica, els contractes legals o la formalitat professional, on la decisió equivocada es veu exactament com una traducció correcta fins que un especialista la llegeix.

Això és el que vaig fer. Vaig passar 8 oracions de prova a través de dues rondes de models a MachineTranslation.com: primer una línia de base de 5 models àmpliament utilitzats, després un conjunt expandit que afegeix diverses de les variants de model de nivell premium més noves ara disponibles per als usuaris que paguen. Normalment, comparar els resultats de models com aquest significaria tenir subscripcions de pagament separades amb cada proveïdor individualment. A MachineTranslation.com, es troben a la mateixa vista de comparació. Els parells de llengües eren anglès→japonès i anglès→vietnamita. Les categories de frases van ser escollides específicament per posar a prova les àrees on el desacord del model és més conseqüent: fraseologia idiomàtica, terminologia legal, terminologia mèdica, context sensible a la formalitat, i ambigüitat semàntica deliberada.

Metodologia

  • Parells de llengües: Anglès → Japonès, Anglès → Vietnamita
  • Ronda 1 (línia de base): Claude Sonnet 4-6, DeepSeek V4-Pro, Qwen 3.7-Max, GPT-4.1-NANO, Gemini 3.1-Pro-Preview
  • Ronda 2 (expandida): Tots els anteriors + Claude Opus 4-7, GPT-5.5, Gemini 3.5-Flash, GLM-5-Turbo, MiniMax M2.7
  • Categories de prova: Fraseologia idiomàtica (2), Terminologia legal/professional (2), Terminologia mèdica (1), Context sensible a la formalitat (2), Ambigüitat deliberada (1)
  • Què es va mesurar: La sortida de traducció directament, no el temps d'edició, TER, o taxes d'error numèric. Quan sigui rellevant, les diferències s'expliquen lingüísticament.
  • Consens SMART: Cada ronda inclou la sortida de consens multimodel de la plataforma. SMART abasta fins a 22 models d'IA de diferents proveïdors i executa tots els models disponibles simultàniament per obtenir una traducció de consens. El consens es desplaça quan el conjunt de models es desplaça.

Una nota sobre la metodologia d'avaluació: la investigació en traducció automàtica ha estat lluitant durant molt de temps amb la manera de puntuar les sortides automàticament. Mètriques com BLEU i COMET tal com es mesuren en les tasques compartides de WMT proporcionen un senyal agregat útil, però són pobres en detectar errors de registre, fracassos d'idioma i precisió terminològica, exactament les categories que més importa aquí. El que esteu a punt de llegir és una anàlisi de resultats, no una carrera BLEU.

Resultats d'una ullada

Secció 1: On tots els models coincideixen, i per què això també importa

No tota frase evidencia un desacord significatiu. Dues de les vuit proves, "Let's touch base once the dust settles on this deal" (→ japonès) i "We're burning the midnight oil to hit this launch date" (→ vietnamita), van produir un alt acord en ambdues rondes. Els idioms van ser correctament entesos com a idioms. Ningú no va traduir "touch base" com tocar una base física. Ningú no ha traduït "the dust settles" com a sediment que cau.

Això val la pena parar-s'hi: el llenguatge empresarial idiomàtic anglès es gestiona raonablement bé pels models frontissa actuals quan l'idioma és prou comú. El consens per a "touch base" es va mantenir estable en ambdues rondes; la variació va ser purament estilística, al voltant de si utilitzar この件 (aquest assumpte), この取引 (aquest tracte), o aquesta proposta (aquest cas) per a la frase font.

Test 8: ‎"Posem-nos en contacte de nou quan s'assenti la pols d'aquest acord." → japonès

La prova de "cremar l'oli de mitjanit" és on les coses es van tornar més interessants. Tots els models excepte un van entendre correctament l'expressió idiomàtica. MiniMax M2.7, introduït en la Ronda 2, va traduir "burning" literalment, produint đốt đuốc, que significa "torxes cremant". El consens correctament l'ha exclòs.

Test 5: ‎"Estem cremant l'oli de mitjanit per complir aquesta data de llançament." → vietnamita

Troballa — Modismes

Els models capdavanters generalment gestionen correctament els modismes empresarials anglesos habituals en japonès i vietnamita. El valor del consens és més alt en frases contestades : formalitat, registre i terminologia. En proves d'idioma, el consens segueix tenint valor assenyalant veritables casos atípics (el literal "torxes cremant" de MiniMax fracassa), però el conjunt general ja està d'acord.

Secció 2: La bretxa de formalitat

El japonès és una llengua amb capes de formalitat. La tria de la terminació verbal, el pronom i la forma del nom referencial no és estilística. Indica la relació entre el parlant i el destinatari. Enviar un missatge al vostre director executiu utilitzant formes verbals col·loquials no és un error de traducció en el sentit gramatical. Es un error social, i un de significatiu.‎

Pots enviar-ho? Gràcies, ho aprecio. Contexte: missatge a un CEO.

El consens va canviar quan el grup de models es va expandir. El mecanisme és senzill: afegir models que llegissin correctament el context de formalitat va desplaçar la majoria, i el consens va seguir. Aquí es l'espectre complet del que els models van produir a la Ronda 2:

Prova 1: CEO sentence — full Round 2 model outputs


Notable outlier — DeepSeek R2

DeepSeek V4-Pro in Round 2 produced ¿Em pots enviar? Gràcies, m'ajudes molt., forma simple japonesa. Això és el que li escrius a un amic íntim. No és un registre apropiat per a un missatge a un CEO. La forma simple (くれる、助かる) elimina tots els marcadors honorífics. El consens correctament ho va excloure, però si aquest fos el teu únic model, enviaríes un missatge al teu CEO equivalent a un missatge de text casual.

La prova del registre vietnamita va revelar un tipus diferent d'error de formalitat, un que és més subtil. La frase font: Ei, una pregunta ràpida — estàs lliure per fer una trucada? Context: enviar un missatge a un client. Qwen en la Ronda 1 va incloure "mình," un pronom de primera persona que implica una amistat casual a nivell de companys. Tots els altres models van evitar completament l'autoeferència en primera persona, que és l'opció professional més segura. Cruciallement, Qwen va corregir això en la Ronda 2 i va deixar caure "mình." El consens en ambdues rondes l'ha exclòs.

Test 6: ‎"Ei, una pregunta ràpida — estàs lliure per fer una trucada?" → vietnamita


Troballa — Els errors de registre són invisibles sense comparació

L'error de Qwen amb "mình" és la il·lustració més clara de per què la traducció amb un sol model és arriscada per a la comunicació amb els clients: el resultat és un vietnamita fluid, gramaticalment correcte i de so natural. No hi ha res per assenyalar. Sense veure els altres quatre models evitar l'autorreferència en primera persona, no tindries cap senyal que s'hagués fet una tria de registre.

Secció 3: Terminologia legal — el problema de la 免責

La frase d'indemnització del venedor/client és una clàusula estàndard en els acords comercials: ‎"El venedor indemnitzarà el client contra qualsevol reclamació de tercers que sorgeixi de l'incompliment d'aquest acord."

A la Ronda 1, els cinc models van identificar correctament el registre legal i van utilitzar els préstecs ベンダー (proveïdor) i クライアント (client), estàndard en els contractes comercials japonesos d'origen anglès. Una excepció: GPT-4.1-NANO va utilitzar 販売者 (venedor) i 顧客 (client), paraules japoneses legítimes que mancaven de l'especificitat legal formal dels equivalents de paraules manllevades.

El descobriment més important va sorgir a la Ronda 2. La distinció clau és entre dues paraules:

  • 補償 (hoshō) — compensar, reemborsar. Per fer que algú estigui íntegrament compensat econòmicament després d'una pèrdua.
  • 免責 (menseki) — eximir de responsabilitat; indemnitzar. Mantenir indemne de reclamacions de tercers abans que es materialitzin.

Aquests són conceptes legalment diferents. ‎"Indemnify" específicament significa protegir una part de la responsabilitat de tercers. 免責 és el terme legal correcte. Tots els models de la Ronda 1 van utilitzar 補償. A la Ronda 2, DeepSeek V4-Pro va ser l'únic model que va produir 免責, i ho va fer a la Ronda 2 només, no a la Ronda 1.

Test 7: Clàusula d'indemnització → Japonès (sortides clau)


Descoberta — Registre legal

DeepSeek en R2 és l'únic model que utilitza 免責, l'equivalent legalment precís de "indemnificar". Tots els altres models utilitzen 補償 (compensar), que és semànticament relacionat però legalment diferent. Aquest descobriment només es fa visible en la segona ronda, cosa que subratlla per què una prova estàtica d'una sola ronda amb un conjunt de models fix pot perdre variacions importants.
Per separat, Qwen en R2 retrocedeix canviant a 売主/買主 (venedor/comprador), termes de la llei comercial de vendes en lloc d'acords de serveis. Aquesta és una estructura menys apropiada per a un contracte que utilitza terminologia legal anglesa.

En un contracte, 補償 i 免責 no són sinònims. Un significa "us reemborsar". L'altre significa "estàs protegit de la demanda des del principi." Si una plataforma de traducció utilitza 補償 on 免責 és correcte, un advocat que llegeixi la versió japonesa no veurà el mateix acord que descriu la versió anglesa.

Secció 4: Terminologia mèdica — la divisió que no es va resoldre

Aquest és el descobriment més important del conjunt de dades. La frase de prova: ‎"Aquest medicament està contraindicat en pacients amb antecedents d'insuficiència hepàtica." Font: documentació de producte clínic. Objectiu: Vietnamita.

El terme crític és "insuficiència hepàtica". Hi ha dos candidats en vietnamita:

  • suy gan — insuficiència hepàtica. Es refereix a la disfunció hepàtica severa, aguda o crònica en estadis terminals. Un pacient que va experimentar insuficiència hepàtica.
  • suy giảm chức năng gan — funció hepàtica disminuïda/deteriorada. Es refereix a qualsevol reducció de la funció hepàtica, inclòs l'afectació lleu o moderada.

Aquestes són clínicament diferents. Una advertència de contraindicació basada en "insuficiència hepàtica" s'aplica a qualsevol persona amb funció hepàtica reduïda, no només a aquells que van experimentar una fallida completa de l'òrgan. L'ús de suy gan estreny la població indicada incorrectament. Un pacient amb insuficiència hepàtica moderada que llegeix "suy gan" podria no reconèixer-se com a població contraindicada.

Test 2: Oració de contraindicació → Vietnamita (ambdues rondes)


Descoberta crítica: terminologia mèdica

La divisió és de 6 models per a suy gan versus 4 models per a suy giảm chức năng gan a la Ronda 2. La majoria, i per tant el consens, tria el terme menys precisió clínica. Tots dos models de Claude (Sonnet i Opus) trien sistemàticament suy giảm chức năng gan en ambdues rondes. La divisió no es resol quan la piscina s'expandeix.
Aquesta és l'única conclusió en aquest conjunt de dades que argumenta més directament a favor de la revisió per experts humans sobre contingut mèdic. El consens no és erroni per votació majoritària. Això reflecteix un desacord genuí entre els models de frontera, i aquest desacord és en si mateix informació que un traductor necessita veure. Això és exactament el tipus de cas la revisió humana en el bucle de Tomedes està construïda per a.

Secció 5: ‎«Això és malalt» — què passa quan l'ambigüitat és el punt

Algunes frases font són ambigües per disseny. ‎"Això és malalt" en l'argot anglès contemporani significa quelcom excel·lent, però també manté el seu significat literal (és a dir, que és nauseabund/repugnant), i la tensió entre aquests dos significats és part de com la frase es comunica. El repte per a un model de traducció és: preserves l'ambigüitat, la col·lapses al significat més probable, o en trieu una i us hi comprometeu?

Sortides del japonès


Sortides del vietnamita


Descoberta: ambigüitat i divergència de la mateixa família

Claude Opus 4-7 escriu Đỉnh vậy (argot). Claude Sonnet 4-6 escriu Això és meravellós (formal). Aquestes són decisions de registre oposades preses per dos models de la mateixa família de models en l'entrada idèntica de dues paraules. Cap dels dos no és "incorrecte". L'ambigüitat en "That's sick" significa que ambdues lectures existeixen. Però si la vostra audiència objectiu utilitza l'argot juvenil vietnamita actual, només una d'aquestes traduccions comunica correctament. El consens fa visible el desacord. Sense això, no saps que es va prendre una decisió.
En japonès, GPT-4.1-NANO és l'únic model que utilitza すごい, que col·lapsa l'ambigüitat completament a favor de "sorprenent". Cinc altres models la preserven amb やばい/ヤバい‎. Claude Opus adopta la forma més minimalista: nua やばい sense subjecte.

Secció 6: Com és el conjunt de models

Els models en aquesta prova no són tots equivalents. Abasten diferents arquitectures, règims d'entrenament i contextos de desplegament. La línia de base de la Ronda 1 inclou models que són àmpliament accessibles. El grup ampliat de la Ronda 2 afegeix diversos dels variants de model de nivell premium més nous disponibles ara per als usuaris de pagament a MachineTranslation.com, el mateix nivell de model que d'altra manera significaria un compte de pagament separat amb cada proveïdor individual.

El grup ampliat a la Ronda 2 inclou models més avançats i disponibles per als usuaris de pagament a MachineTranslation.com. L'efecte d'ampliar el conjunt no és uniforme. En alguns tests (formalitat/japonès), va desplaçar significativament el consens. En altres (terminologia mèdica/vietnamita), la divisió s'aprofundí.

Secció 7: Què significa això si esteu triant una plataforma de traducció

Les dades de prova apunten a dues categories de fallada diferents, i requereixen respostes diferents.

Categoria A: Fracassos silenciosos. Errors de formalitat, errors de registre, precisió de la terminologia mèdica: aquests produeixen resultats que semblen correctes. El japonès és gramatical. El vietnamita és fluent. No hi ha cap senyal superficial que res hagi anat malament. Un usuari monolingüe que llegeix la sortida d'un únic model no té manera de saber que el model va fer una elecció de registre que un executiu sènior japonès notaria, o que un terme clínic va ser restringit d'una manera que canvia la població a la qual s'aplica.

Categoria B: Fracassos visibles. MiniMax traduint "burning the midnight oil" com a "cremar torxes." GPT-4.1-NANO resolent "That's sick" a l'inequívoc "すごい." Aquests són detectables, ja sigui per un parlant de la llengua meta o per comparació amb altres sortides de models.

La comparació multimodel que proporciona SMART és més valuosa a la Categoria A. Quan cinc o deu models produeixen sortides i la majoria està d'acord en un registre formal mentre que un produeix japonès en forma plana casual, el desacord és visible a la vista de comparació. Un usuari que parla la llengua objectiu pot avaluar les opcions. Un usuari que no pot veure que es va prendre una decisió contestada, i decidir si aquesta sentència justifica una revisió humana.

Per al treball a escala de document, fitxers grans, traducció que preserva la disposició de PDF, contractes o materials clínics, la capacitat de processament de documents de la plataforma gestiona l'estructura de fitxers sense trencar el format. Però les qüestions de qualitat plantejades anteriorment s'apliquen independentment de la mida del fitxer. Un estudi clínic de 100 pàgines on cada instància de "hepatic impairment" es tradueix com a "insuficiència hepàtica" és una versió més gran del mateix problema identificat a la Prova 2.

Per a les categories mèdica i legal específicament, la verificació humana és la mesura de seguretat correcta. El servei de Postedició per IA de Tomedes, que combina la sortida de l'IA amb una revisió humana certificada exactament per a aquest tipus de contingut d'alt risc, està construït per a això. La divisió suy gan / suy giảm chức năng gan és exactament el tipus de descoberta que hauria de desencadenar aquesta revisió, no perquè tots els models siguin incorrectes, sinó perquè els models que són més confiats no són els més precisos.

El valor de veure múltiples resultats no és que sempre triareu la majoria. Es que sabràs que es va fer una elecció, que és diferent d'assumir que el resultat davant teu és correcte.

Què vuit frases em van dir realment

Posa les vuit proves una al costat de l'altra i es manté un patró: l'acord i el desacord no es distribueixen aleatòriament. El llenguatge empresarial idiomàtic i quotidià ("posar-se en contacte", "treballar fins a altes hores de la nit") va convergir en gairebé tots els models del grup, en ambdues rondes. La formalitat, la precisió legal i la terminologia mèdica no ho van fer. La prova de formalitat del CEO va canviar de casual a formal només quan es va incloure el grup ampliat. La clàusula d'indemnització va revelar una distinció legal real (免責 vs. 補償) que només un model, en una ronda, va aconseguir encertar. La divisió de la terminologia mèdica mai no es va resoldre del tot, mantenint-se aproximadament en una proporció de 6 a 4 en ambdues rondes independentment de quins models estaven al grup.

Aquest és l'hallazgo real, no una afirmació de màrqueting: el consens no millora cada frase, i no cal que ho faci. És més valuós exactament on la fluïdesa d'un únic model no et dona cap raó per dubtar-ne, i on estar equivocat realment costa quelcom.

Hi ha una segona capa més pràctica d'aquesta prova que val la pena exposar clarament. Executar aquesta comparació jo mateix va significar verificar les sortides de GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo i MiniMax M2.7 costat a costat amb els models de referència existents, en un lloc, en una única plataforma. Fora de MachineTranslation.com, això no és una subscripció. Són varios, un per a cada proveïdor la versió premium del qual vulguis provar, al preu que cobra individualment cada proveïdor. Els usuaris de pagament aquí obtenen aquesta mateixa comparació amb un clic, per una fracció del que costaria mantenir cinc subscripcions premium separades, sense renunciar a la cosa que realment importa: veure on els models estan d'acord, i saber exactament quan no ho estan.

Preguntes freqüents

1. És ChatGPT o Claude millor per a la traducció?

Cap dels dos no és categòricament millor; depèn de la categoria de prova. Claude Sonnet i Claude Opus van triar consistentment el terme mèdic vietnamita més precís, i Claude Opus va produir l'argot més apropiat per a "That's sick." Però Claude Sonnet també va produir japonès casual en una frase de context formal de CEO, on GPT-5.5 ho va aconseguir correctament. Comparar les sortides directament és més defensable que triar un model i confiar-hi.

2. Quin és el model de traducció per IA més precís el 2026?

No n'hi ha un; la precisió depèn del domini. Gemini 3.5-Flash i GLM-5-Turbo van produir el japonès formal més apropiat en aquesta prova. Tots dos models de Claude van ser més precisos en la terminologia mèdica vietnamita. DeepSeek V4-Pro va ser l'únic model que va utilitzar el terme legal japonès correcte, però només a la Ronda 2, i va produir japonès casual en altres llocs. Cap model únic va dominar en tots els vuit tests.

3. Afegir més models d'IA sempre millora la precisió de la traducció?

No, no automàticament. L'expansió del conjunt amb variants de model de nivell premium més recent va desplaçar el consens de casual a formal en la prova de formalitat japonesa. Però en la prova de terminologia mèdica vietnamita, la divisió es va mantenir aproximadament en una proporció de 6 a 4 independentment de quins models s'incloïssin. Més models surfacen més desacord, que és un senyal útil, però el consens encara segueix la majoria, i la majoria no sempre és la resposta més precisa.

4. Què és SMART i com funciona?

SMART és el sistema de consens multimodel de MachineTranslation.com, que abasta fins a 22 models d'IA de proveïdors com OpenAI, Anthropic, Google i DeepSeek. Executa una traducció a través de múltiples models simultàniament i mostra la sortida de consens majoritari juntament amb la resposta de cada model individual, per defecte, sense necessitat de configuració. El consens canvia quan canvia el conjunt de models, tal com es mostra en el resultat de formalitat japonesa d'aquesta prova: un consens casual a la Ronda 1 es va convertir en formal a la Ronda 2.

5. Quin model d'IA és millor per a la traducció mèdica o legal?

La revisió humana és la millor resposta, no hi ha un únic model. Els models Claude van triar consistentment el terme mèdic vietnamita més precís, i DeepSeek V4-Pro va ser l'únic que va utilitzar el terme legal japonès correcte, però només en la Ronda 2. La terminologia mèdica dividida mai es va resoldre entre els 10 models, cosa que senyala que es requereix experiència en el domini, no que s'hauria de triar un model diferent. A revisió d'edició humana certificada, com ofereix Tomedes, proporciona aquesta comprovació especialitzada.‎