July 10, 2026
Due parole. Sei modelli. Tre diverse decisioni di traduzione. Ecco cosa è successo quando ho fatto passare 8 frasi di prova attraverso gli ultimi modelli di intelligenza artificiale disponibili su MachineTranslation.com, e cosa rivelano effettivamente gli output su quando un modello fallisce silenziosamente.
Due parole. Quello è malato. Sei modelli. Tre distinte decisioni di traduzione.
In giapponese, un modello lo ha reso come それはやばい, preservando l'ambiguità. Un altro ha eliminato completamente il pronome soggetto e ha scritto la forma nuda やばい, la versione più colloquiale possibile. Un terzo ha scritto それはすごい, il che risolve completamente l'ambiguità a favore di "straordinario", eliminando il doppio significato che rendeva la frase interessante in primo luogo. In Vietnamese, un modello ha scritto Đỉnh vậy (slang, corretto per il registro giovanile). Un altro ha scritto Thật tuyệt vời, grammaticalmente corretto, ma più vicino al dire "è veramente meraviglioso" quando qualcuno ti invia un meme.
Tutti questi sono difendibili. Nessuno di loro è la stessa cosa. E se stai eseguendo traduzioni attraverso un singolo modello, non vedrai mai la scelta che è stata fatta per tuo conto.
Questa è la domanda centrale a cui questo articolo sta cercando di rispondere. Non quale modello di IA è migliore per la traduzione nel 2026 (la risposta dipende dalla coppia linguistica, dal registro, dal dominio e dalla struttura della frase), ma piuttosto: come faresti a sapere quando il tuo modello ha fatto la scelta sbagliata? Specialmente in domini come la terminologia medica, i contratti legali o la formalità professionale, dove la scelta sbagliata sembra esattamente una traduzione corretta finché uno specialista non la legge.
Ecco cosa ho fatto. Ho eseguito 8 frasi di test attraverso due round di modelli su MachineTranslation.com: prima una baseline di 5 modelli ampiamente utilizzati, poi un pool ampliato che aggiunge diverse delle più recenti varianti di modelli di fascia premium ora disponibili per gli utenti a pagamento. Normalmente, il confronto degli output di modelli come questo significherebbe sottoscrizioni a pagamento separate con ciascun provider individualmente. Su MachineTranslation.com, si trovano nella stessa visualizzazione di confronto. Le coppie di lingue erano inglese→giapponese e inglese→vietnamita. Le categorie di frasi sono state scelte specificamente per testare le aree in cui il disaccordo del modello è più consequenziale: fraseologia idiomatica, terminologia legale, terminologia medica, contesto sensibile alla formalità e ambiguità semantica deliberata.
Una nota sulla metodologia di valutazione: la ricerca sulla traduzione automatica ha a lungo affrontato la questione di come valutare automaticamente gli output. Metriche come BLEU e COMET misurate nei compiti condivisi WMT forniscono un segnale aggregato utile, ma sono scarse nel rilevare errori di registro, fallimenti di idiomi e precisione terminologica, esattamente le categorie che contano di più qui. Quello che stai per leggere è un'analisi dei risultati, non una gara BLEU.

Non ogni frase emerge un disaccordo significativo. Due dei otto test, "Facciamo il punto una volta che la polvere si sarà depositata su questo accordo" (→ Giapponese) e "Stiamo lavorando giorno e notte per rispettare questa data di lancio" (→ Vietnamita), hanno prodotto un alto accordo in entrambi i round. Gli idiomi sono stati correttamente compresi come idiomi. Nessuno ha tradotto "touch base" come toccare una base fisica. Nessuno ha tradotto "the dust settles" come sedimento che cade.
Vale la pena fermarsi su questo punto: il linguaggio commerciale idiomatico inglese è gestito abbastanza bene dai modelli frontier attuali quando l'idioma è abbastanza comune. Il consenso per "touch base" è rimasto stabile in entrambi i round; la variazione era puramente stilistica, riguardante se utilizzare この件 (questo argomento), この取引 (questo affare), o この案件 (questo caso) per la frase di partenza.

Il test del "bruciare l'olio di mezzanotte" è dove le cose sono diventate più interessanti. Tutti i modelli tranne uno hanno compreso correttamente l'idioma. MiniMax M2.7, introdotto nel Round 2, ha tradotto "burning" letteralmente, producendo đốt đuốc, che significa "torce ardenti". Il consenso l'ha correttamente escluso.

Il giapponese è una lingua stratificata per formalità. La scelta della desinenza verbale, del pronome e della forma del nome referenziale non è stilistica. Segnala la relazione tra il parlante e il destinatario. Inviare un messaggio al tuo CEO utilizzando forme verbali informali non è un errore di traduzione in senso grammaticale. È un errore sociale, e uno significativo.
Puoi mandarmelo? Grazie, lo apprezzo. Contesto: messaggi a un CEO.

Il consenso è cambiato quando il pool di modelli si è espanso. Il meccanismo è semplice: aggiungere modelli che leggono correttamente il contesto di formalità ha spostato la maggioranza, e il consenso ha seguito. Ecco l'intero spettro di ciò che i modelli hanno prodotto nella Ronda 2:

Il test del registro vietnamita ha fatto emergere un diverso tipo di errore di formalità, uno più sottile. La frase di origine: "Ehi, una domanda veloce — sei libero per una chiamata?" Contesto: messaggio a un cliente. Qwen nel Round 1 ha incluso "mình", un pronome di prima persona che implica un'amicizia casual tra pari. Tutti gli altri modelli hanno evitato completamente l'auto-riferimento in prima persona, che è la scelta professionale più sicura. Crucialmente, Qwen ha corretto questo nella Round 2 e ha eliminato "mình." Il consenso in entrambi i turni l'ha escluso.

La frase di indennizzo fornitore/cliente è una clausola standard negli accordi commerciali: "Il fornitore dovrà indennizzare il cliente contro qualsiasi reclamo di terze parti derivante dalla violazione del presente accordo."
Nel Round 1, tutti e cinque i modelli hanno identificato correttamente il registro legale e usato i prestiti ベンダー (fornitore) e クライアント (cliente), standard nei contratti commerciali giapponesi di origine inglese. Un'eccezione: GPT-4.1-NANO ha utilizzato 販売者 (seller) e 顧客 (customer), parole giapponesi legittime che mancano della specificità legale formale degli equivalenti prestiti linguistici.
Il risultato più importante è emerso nella Seconda Fase. La distinzione chiave è tra due parole:
Questi sono concetti legalmente diversi. "Indemnify" significa specificamente proteggere una parte dalla responsabilità nei confronti di terzi. 免責 è il termine legale corretto. Tutti i modelli della Round 1 hanno utilizzato 補償. Nel Round 2, DeepSeek V4-Pro era l'unico modello a produrre 免責, e lo ha fatto nel Round 2 solamente, non nel Round 1.

In un contratto, 補償 e 免責 non sono sinonimi. Uno significa "ti rimborseremo." L'altro significa "sei protetto dal reclamo fin dall'inizio." Se una piattaforma di traduzione utilizza 補償 dove 免責 è corretto, un avvocato che legge la versione giapponese non vedrà lo stesso accordo che la versione inglese descrive.
Questo è il risultato più significativo nel dataset. La frase di prova: "Questo farmaco è controindicato nei pazienti con anamnesi di insufficienza epatica." Fonte: documentazione del prodotto clinico. Destinazione: Vietnamita.
Il termine critico è "compromissione epatica". Ci sono due candidati vietnamiti:
Questi sono clinicamente distinti. Un avvertimento di controindicazione basato su "compromissione epatica" si applica a chiunque abbia una funzione epatica ridotta, non solo a coloro che hanno subito un completo fallimento d'organo. L'uso di suy gan restringe la popolazione indicata in modo errato. Un paziente con compromissione epatica moderata che legge suy gan potrebbe non riconoscersi come la popolazione controindicata.

Alcune frasi sorgente sono ambigue per design. "Che schifo" nell'inglese contemporaneo significa qualcosa di eccellente, ma conserva anche il suo significato letterale (cioè disgustoso/ripugnante), e la tensione tra questi due significati è parte di come la frase comunica. La sfida per un modello di traduzione è: preservi l'ambiguità, la riduca al significato più probabile, o ne scelga una e si impegni?


I modelli in questo test non sono tutti equivalenti. Si estendono su diverse architetture, regimi di addestramento e contesti di distribuzione. La baseline della Round 1 include modelli ampiamente accessibili. Il pool ampliato della Round 2 aggiunge diversi dei più recenti modelli varianti di livello premium ora disponibili per gli utenti paganti su MachineTranslation.com, lo stesso livello di modello che altrimenti significherebbe un account pagato separato con ogni singolo provider.

Il pool ampliato nella Round 2 include modelli più avanzati e disponibili per gli utenti paganti su MachineTranslation.com. L'effetto dell'ampliamento del pool non è uniforme. In alcuni test (formalità/Giapponese), ha spostato il consenso in modo significativo. In altri (terminologia medica/vietnamita), la divisione si è approfondita.

I dati di test indicano due categorie di errore distinte e richiedono risposte diverse.
Categoria A: Errori silenziosi. Errori di formalità, errori di registro, precisione della terminologia medica: questi producono output che sembrano corretti. Il giapponese è grammaticale. Il vietnamita è fluente. Non c'è alcun segnale in superficie che qualcosa sia andato male. Un utente monolingue che legge l'output di un singolo modello non ha modo di sapere che il modello ha fatto una scelta di registro che un dirigente senior giapponese noterebbe, o che un termine clinico è stato ristretto in un modo che cambia la popolazione a cui si applica.
Categoria B: Errori evidenti. MiniMax traduce "burning the midnight oil" come "burning torches." GPT-4.1-NANO che risolve "That's sick" all'inequivocabile "すごい." Questi sono rilevabili, sia da un parlante della lingua di destinazione che dal confronto con altri output del modello.
Il confronto multi-modello che SMART fornisce è più prezioso nella Categoria A. Quando cinque o dieci modelli producono output e la maggior parte concorda su un registro formale mentre uno produce giapponese in forma piana casual, il disaccordo è visibile nella vista di confronto. Un utente che parla la lingua di destinazione può valutare le opzioni. Un utente che non può vedere che è stata presa una decisione contestata, e decidere se quella sentenza merita una revisione umana.
Per il lavoro su scala di documento, file di grandi dimensioni, traduzione che preserva il layout di PDF, contratti o materiali clinici, la capacità di elaborazione dei documenti della piattaforma gestisce la struttura del file senza rompere la formattazione. Ma le questioni di qualità sollevate sopra si applicano indipendentemente dalla dimensione del file. Uno studio clinico di 100 pagine in cui ogni istanza di "hepatic impairment" è tradotta come "liver failure" è una versione più ampia dello stesso problema identificato nel Test 2.
Per le categorie mediche e legali in particolare, la verifica umana è il corretto meccanismo di controllo. Il servizio di post-editing AI di Tomedes, che abbina l'output dell'IA con la revisione umana certificata esattamente per questo tipo di contenuti ad alto rischio, è costruito per questo. La divisione suy gan / suy giảm chức năng gan è esattamente il tipo di risultato che dovrebbe attivare quella revisione, non perché tutti i modelli sono sbagliati, ma perché i modelli più sicuri non sono i più precisi.
Il valore di vedere più output non è che sceglierai sempre la maggioranza. È che saprai che è stata fatta una scelta, il che è diverso dall'assumere che l'output di fronte a te sia corretto.

Metti gli otto test uno accanto all'altro e uno schema regge: l'accordo e il disaccordo non sono distribuiti casualmente. Il linguaggio aziendale idiomatico e colloquiale ("mettersi in contatto", "lavorare fino a tardi") è converso in quasi tutti i modelli del gruppo, in entrambi i turni. La formalità, la precisione legale e la terminologia medica non lo hanno fatto. Il test di formalità del CEO è passato da informale a formale solo una volta che è stato incluso il pool ampliato. La clausola di indennizzo ha evidenziato una vera distinzione legale (免責 vs. 補償) che solo un modello, in un round, ha interpretato correttamente. La divisione della terminologia medica non si è mai risolta completamente, rimanendo approssimativamente 6 a 4 in entrambi i round indipendentemente da quali modelli fossero nel pool.
Questo è il risultato effettivo, non una affermazione di marketing: il consenso non rende migliore ogni frase, e non ha bisogno di farlo. È più prezioso esattamente dove la fluidità di un singolo modello non ti dà motivo di dubitare, e dove sbagliare costa davvero qualcosa.
C'è un secondo livello, più pratico, di questo test che vale la pena affermare chiaramente. Eseguire personalmente questo confronto ha significato controllare gli output di GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo e MiniMax M2.7 uno accanto all'altro con i modelli di base esistenti, in un unico luogo, su un'unica piattaforma. Al di fuori di MachineTranslation.com, non è un unico abbonamento. Sono diversi, uno per ogni provider il cui livello premium vuoi testare, a qualunque prezzo ogni provider addebita individualmente. Gli utenti paganti qui ottengono lo stesso confronto con un clic, a una frazione del costo del mantenimento di cinque abbonamenti premium separati, senza rinunciare a ciò che conta davvero: vedere dove i modelli concordano e sapere esattamente quando non lo fanno.
Nessuno dei due è categoricamente migliore; dipende dalla categoria di test. Claude Sonnet e Claude Opus hanno scelto costantemente il termine medico vietnamita più preciso, e Claude Opus ha prodotto lo slang più appropriato per "That's sick." Ma Claude Sonnet ha anche prodotto un giapponese informale in una frase di contesto formale da CEO, dove GPT-5.5 l'ha interpretata correttamente. Confrontare gli output direttamente è più difendibile che scegliere un modello e fidarsi di esso.
Non esiste uno; l'accuratezza dipende dal dominio. Gemini 3.5-Flash e GLM-5-Turbo hanno prodotto il giapponese formale più appropriato in questo test. Entrambi i modelli Claude erano più precisi sulla terminologia medica vietnamita. DeepSeek V4-Pro è stato l'unico modello a utilizzare il termine legale giapponese corretto, ma solo nel Round 2, e ha prodotto giapponese informale altrove. Nessun singolo modello ha dominato in tutti e otto i test.
No, non automaticamente. L'espansione del pool con varianti di modelli di fascia premium più recenti ha spostato il consenso da informale a formale nel test di formalità giapponese. Ma nel test di terminologia medica vietnamita, la divisione persisteva approssimativamente 6 a 4 indipendentemente da quali modelli fossero inclusi. Più modelli emergono più disaccordo, che è un segnale utile, ma il consenso segue ancora la maggioranza, e la maggioranza non è sempre la risposta più precisa.
SMART è il sistema di consenso multi-modello di MachineTranslation.com, che abbraccia fino a 22 modelli di intelligenza artificiale da provider tra cui OpenAI, Anthropic, Google e DeepSeek. Esegue una traduzione attraverso più modelli contemporaneamente e visualizza l'output del consenso della maggioranza insieme alla risposta di ogni singolo modello, per impostazione predefinita, senza alcuna configurazione necessaria. Il consenso cambia quando il pool di modelli cambia, come mostrato dal risultato della formalità giapponese di questo test: un consenso informale nella Ronda 1 è diventato formale nella Ronda 2.
Nessun modello singolo; la revisione umana è la risposta migliore. I modelli Claude hanno costantemente scelto il termine medico vietnamita più preciso, e solo DeepSeek V4-Pro ha utilizzato il termine legale giapponese corretto, ma solo nel Round 2. La terminologia medica non si è mai risolta in 10 modelli, il che segnala che è richiesta competenza nel dominio, non che dovrebbe essere scelto un modello diverso. Una revisione di post-editing umano certificata, come offre Tomedes, fornisce quel controllo specialistico.