June 5, 2026
Ho condotto test interni su qualcosa di cui non parliamo abbastanza nel settore della traduzione: non se diversi sistemi di IA traducano in modo diverso, ma se diverse versioni della stessa IA traducano in modo diverso, e di quanto.
La scorsa settimana ho sottoposto un singolo idioma spagnolo a cinque versioni di ChatGPT contemporaneamente sulla piattaforma di test interna di MachineTranslation.com. Ciò che è tornato mi ha fermato.
Due versioni hanno prodotto una traduzione che, onestamente, non ha senso in inglese. Tre versioni hanno prodotto traduzioni idiomatiche corrette. E i tre corretti non andavano d'accordo tra loro. Tutti e cinque sono
ChatGPT. Tutti e cinque sono OpenAI. Stessa IA, modello diverso — e gli output non potrebbero essere più diversi.
Condivido questo ora perché penso che sia importante, non perché abbia risposte chiare. Non lo faccio. Ma l'osservazione è abbastanza interessante da mettere al mondo.
La frase che ho testato è llevarse el gato al agua.

Ecco cosa ha prodotto ogni versione:
| Modello | Output | Idiomatico? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | portare il gatto all'acqua | ❌ Letterale |
| ChatGPT::GPT-4.1-NANO | portare il gatto all'acqua | ❌ Letterale |
| ChatGPT::GPT-4.1-MINI | riuscire | ✅ Corretto |
| ChatGPT::GPT-5.4-MINI | ottenere ciò che si vuole | ✅ Parziale |
| ChatGPT::GPT-5.4 | venire fuori vincitori | ✅ Corretto |
La frase significa ottenere qualcosa di difficile contro ogni probabilità, ottenere una vittoria difficile. Non ha niente a che fare con i gatti o con l'acqua. La traduzione letterale non è una traduzione. Si tratta di una trascrizione parola per parola di una frase che il modello non è riuscito a riconoscere come idioma.
GPT-4o-MINI e GPT-4.1-NANO hanno prodotto output identici. Non simile, identico. I nostri Translation Insights hanno segnalato questo direttamente: GPT-4.1-nano e GPT-4o-mini condividono traduzioni identiche, enfatizzando l'interpretazione letterale piuttosto che il significato idiomatico.
GPT-4.1-MINI, GPT-5.4-MINI e GPT-5.4 hanno prodotto qualcosa di riconoscibilmente corretto, ma non identico tra loro.
Voglio essere preciso sul perché llevarse el gato al agua sia un input di test utile piuttosto che scelto a caso.
È un idioma ben consolidato. Appare nella letteratura, nel giornalismo e nel linguaggio comune. Non è oscuro. Qualsiasi modello addestrato su un corpus di testo spagnolo ragionevole dovrebbe averlo incontrato. La domanda non è se il modello abbia visto la frase. La domanda è cosa ne fa.
Il peggior modo di fallire nella traduzione di idiomi non è produrre una traduzione scadente. Si tratta di una traduzione letterale che appare accettabile a chi non conosce la lingua di destinazione.
"Portare il gatto all'acqua" è grammaticalmente corretto in inglese. È ben formato. Sembra qualcosa che potrebbe significare qualcosa. Un utente che non parla spagnolo potrebbe leggerlo, annuire e andare avanti — senza mai sapere che il significato originale è andato completamente perso.
Questa è la modalità di errore che mi interessa. Non l'errore ovvio. L'invisibile.
Il modello qui non è casuale. I due modelli che hanno prodotto traduzioni letterali (GPT-4o-MINI e GPT-4.1-NANO) sono entrambi modelli più piccoli e leggeri, ottimizzati per velocità ed efficienza dei costi. I tre modelli che hanno prodotto traduzioni idiomatiche (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) rappresentano una generazione o scala di parametri diversa.
Ciò suggerisce qualcosa che penso sia poco esplorato: la competenza idiomatica nella traduzione scala con la capacità del modello in modi che non sono visibili nei benchmark generali.
I benchmark linguistici generali testano il ragionamento, la conoscenza, la programmazione, la matematica. In genere non testano se un modello può identificare che piove a catinelle non riguarda le condizioni meteorologiche, o che llevarse el gato al agua non riguarda l'idratazione di un gatto. Le espressioni idiomatiche si trovano all'incrocio tra conoscenza culturale, inferenza contestuale e riconoscimento di schemi — e quell'incrocio sembra richiedere una soglia di capacità del modello che i modelli più piccoli non superano costantemente.
Quello che non sto affermando: che i modelli più grandi siano sempre traduttori migliori. Non ho prove di ciò come regola generale. Quello che sto osservando: che per i contenuti idiomatici in particolare, il divario di versione all'interno della famiglia era più ampio di quanto mi aspettassi.
La maggior parte degli utenti che utilizzano uno strumento di traduzione AI non sa quale versione di quell'AI sta utilizzando. Aprono un prodotto, selezionano una coppia di lingue e ottengono un output. Il routing del modello è invisibile per loro.
Questo è importante su larga scala. MachineTranslation.com ha elaborato centinaia di migliaia di traduzioni dall'inglese allo spagnolo in un unico periodo di 90 giorni. Se una porzione significativa di quei lavori toccava contenuti idiomatici (testi di marketing, linguaggio legale, testi letterari, comunicazione informale) e lo strumento che indirizzava quei lavori stava indirizzando gli utenti a un modello più piccolo a loro insaputa, allora portare il gatto all'acqua appariva in output reali, in documenti reali, per persone reali che si fidavano del risultato.
L'industria della traduzione ha trascorso anni a confrontare i fornitori di IA. DeepL contro Google. Claude contro ChatGPT. Quei confronti sono utili. Ma all'interno di un singolo provider, il divario di versione può essere altrettanto significativo — ed è un divario che la maggior parte dei framework di confronto non misura perché non testano a livello di versione del modello. Quando qualcuno dice Uso ChatGPT per la traduzione, quella frase non
è abbastanza specifica per essere significativa. Quale ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? La risposta cambia l'output in modi non banali, almeno per i contenuti idiomatici.
Questa è la parte che trovo più interessante, e non ho ancora capito bene cosa farne.
I tre modelli che hanno prodotto traduzioni idiomatiche ne hanno date tre diverse:
Tutte e tre sono rappresentazioni difendibili in inglese di llevarse el gato al agua. Ma non sono equivalenti.
Riuscirci enfatizza l'esecuzione contro la difficoltà, hai fatto qualcosa di difficile e ha funzionato. Ottenere ciò che si vuoleenfatizza il risultato desiderato, con minore enfasi sulla difficoltà. Venire fuori in cima sottolinea la vittoria competitiva, vincere rispetto agli altri.
L'idioma spagnolo originale è più vicino al primo di questi. La frase implica il superamento della resistenza, non semplicemente preferire un risultato e vederlo realizzarsi. Ma ottenere ciò che si vuole e avere la meglio non sono sbagliati, sono solo imprecisi in direzioni diverse. Questo solleva una domanda che trovo veramente difficile: quando tre modelli
producono ciascuno una traduzione idiomatica corretta ma distinta, come si valuta quale sia la migliore? I punteggi BLEU vengono confrontati con una traduzione di riferimento — ma chi ha scritto il riferimento e quale di questi tre avrebbe scelto? Il nostro agente di traduzione AI, a suo merito, ha posto la
domanda giusta prima di impegnarsi in qualsiasi output: Qual è il significato inteso di 'llevarse el gato al agua' in questo contesto? Furono offerte tre opzioni: raggiungere un obiettivo difficile, prendere qualcosa di non necessario o impegnarsi in un'attività rischiosa. Quella domanda non è decorativa. È il meccanismo con cui l'ambiguità contestuale viene risolta prima che la traduzione sia finalizzata.
Ma il punto rimane: tre risposte corrette, tre diverse sfumature di significato. Gli strumenti di valutazione della traduzione non sono costruiti per questo tipo di sfumature.
Voglio essere onesto riguardo ai limiti di ciò che questo test dimostra.
Un idioma, una coppia linguistica, un giorno di test interni. Quello non è uno studio. È un'osservazione. Non so se questo schema (modelli più piccoli che predefiniscono il letterale, modelli più grandi che raggiungono l'idiomatico) sia coerente in:
Inoltre, non so se questa sia una proprietà stabile di questi modelli o qualcosa che cambia con aggiornamenti e fine-tuning. I fornitori di modelli non pubblicano changelog specifici per la traduzione. Una versione del modello che gestisce correttamente llevarse el gato al agua oggi potrebbe essere aggiornata il mese prossimo, e non avremmo modo di saperlo.
Quello che so: questo test ha prodotto un risultato abbastanza interessante da volerne eseguire altri, in modo più sistematico, su più coppie linguistiche e tipi di contenuto. Quando avrò altro da condividere, lo farò.
Chiuderò con le due domande che questo test mi ha lasciato. Non ho intenzione di rispondere loro, non ho ancora i dati per farlo. Ma penso che siano le domande giuste da porsi.
Primo: a quale soglia di parametri la competenza idiomatica diventa affidabile?
Il salto da GPT-4o-MINI e GPT-4.1-NANO (entrambi letterali) a GPT-4.1-MINI (idiomatico) suggerisce che c'è una soglia da qualche parte nell'intervallo di parametri tra quelle dimensioni del modello in cui il riconoscimento degli idiomi si attiva. È coerente? Si applica alle espressioni idiomatiche in tutte le lingue, o dipende da quanto bene una lingua è rappresentata nei dati di addestramento? Non lo so. Ma sapere sarebbe utile per chiunque costruisca flussi di lavoro di traduzione.
Secondo: quanto costa agli utenti l'opacità della versione del modello su larga scala?
Se un utente instrada 1.000 documenti al mese attraverso uno strumento che non rivela quale versione del modello viene utilizzata (e alcuni di quei documenti contengono contenuti idiomatici), quanto spesso sta avvenendo il fallimento letterale in modo invisibile? Come farebbero a saperlo? Qual è il costo, in termini reali, di non scoprirlo mai?
Penso che questa sia una domanda più importante della maggior parte dei confronti quale IA è migliore per la traduzione attualmente in circolazione. La risposta non è usa il modello più grande. La risposta potrebbe essere: sappi cosa stai usando, esegui i tuoi test sul tuo contenuto e non dare per scontato che il nome di un fornitore sia una garanzia di comportamento coerente in tutta la sua gamma di modelli .
Questo, almeno, è quello che ho ricavato da questo test.
Basandosi su questo singolo test: modelli più piccoli e ottimizzati per l'efficienza all'interno della stessa famiglia di IA hanno optato per la traduzione letterale di un idioma spagnolo ben consolidato, mentre versioni più grandi/nuove dello stesso modello hanno prodotto traduzioni idiomatiche corrette. Se questo vale per le categorie idiomatiche e le coppie linguistiche è la prossima domanda. Farò altri test.
GPT-4.1-MINI, GPT-5.4-MINI e GPT-5.4 hanno tutti tradotto llevarse el gato al agua in modo idiomatico — ma in diverse espressioni inglesi con sottili differenze di connotazione. Ciò suggerisce che la qualità della traduzione idiomatica ha almeno due dimensioni: se il modello riconosce l'idioma o meno, e quale espressione equivalente seleziona tra le opzioni disponibili nella lingua di destinazione. Le metriche standard di qualità della traduzione non separano nettamente queste due dimensioni. Penso che dovrebbero.
Questo post si basa su test interni sulla piattaforma di sviluppo di MachineTranslation.com. Il test della versione multi-modello qui mostrato non è ancora disponibile pubblicamente. Sto condividendo la scoperta perché penso che l'osservazione sia utile indipendentemente da dove esegui le tue traduzioni.