June 5, 2026
He estat fent proves internes d'alguna cosa de la qual no parlem prou en la indústria de la traducció: no si diferents sistemes d'IA tradueixen de manera diferent, sinó si diferents versions de la mateixa IA tradueixen de manera diferent, i en quina mesura.
La setmana passada vaig passar un sol modisme espanyol per cinc versions de ChatGPT simultàniament a la plataforma de proves internes de MachineTranslation.com. El que va tornar em va aturar.
Dues versions van produir una traducció que, sincerament, no té sentit en anglès. Tres versions van produir traduccions idiomàtiques correctes. I els tres correctes no es van posar d'acord entre ells.
Tots cinc són ChatGPT. Tots cinc són d'OpenAI. La mateixa IA, un model diferent — i els resultats no podrien ser més diferents.
Ho comparteixo ara perquè crec que és important, no perquè tingui respostes clares. Jo no. Però l'observació és prou interessant com per posar-la al món.
La frase que vaig provar va ser llevarse el gato al agua.

Aquí teniu el que va produir cada versió:
| Model | Sortida | Idiomàtic? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | portar el gat a l'aigua | ❌ Literal |
| ChatGPT::GPT-4.1-NANO | portar el gat a l'aigua | ❌ Literal |
| ChatGPT::GPT-4.1-MINI | aconseguir-ho amb èxit | ✅ Correcte |
| ChatGPT::GPT-5.4-MINI | aconseguir el que un vol | ✅ Parcial |
| ChatGPT::GPT-5.4 | sortir guanyant | ✅ Correcte |
La frase significa aconseguir alguna cosa difícil contra tot pronòstic, aconseguir una victòria difícil. No té res a veure amb gats ni amb aigua. La traducció literal no és una traducció. És una transcripció paraula per paraula d'una frase que el model no va reconèixer com a modisme.
GPT-4o-MINI i GPT-4.1-NANO van produir resultats idèntics. No semblant, idèntic. Les nostres traduccions d'informació van assenyalar això directament: GPT-4.1-nano i GPT-4o-mini comparteixen traduccions idèntiques, emfatitzant la interpretació literal per sobre del significat idiomàtic.
GPT-4.1-MINI, GPT-5.4-MINI i GPT-5.4 van produir cadascun alguna cosa reconeixiblement correcte, però no igual entre si.
Vull ser precís sobre per què portar-se el gat a l'aigua és una entrada de prova útil en lloc d'una escollida a dit.
És un idioma ben establert. Apareix en la literatura, el periodisme, i el llenguatge quotidià. No és obscur. Qualsevol model entrenat en un corpus raonable de text espanyol l'hauria d'haver trobat. La qüestió no és si el model ha vist la frase. La pregunta és què en fa amb això.
La pitjor manera de fallar en la traducció d'idiomes no és produir una mala traducció. Està produint una traducció literal que sembla acceptable per a algú que no coneix la llengua d'arribada.
To carry the cat to the water és un anglès gramaticalment correcte. Està ben format. Sembla alguna cosa que podria significar alguna cosa. Un usuari que no parla espanyol podria llegir-ho, assentir i seguir endavant — sense saber mai que el significat original es va perdre completament.
Aquest és el mode de fallada que m'importa. No l'error obvi. L'invisible.
El patró aquí no és aleatori. Els dos models que van produir traduccions literals (GPT-4o-MINI i GPT-4.1-NANO) són models més petits i lleugers, optimitzats per a la velocitat i l'eficiència de costos. Els tres models que van produir traduccions idiomàtiques (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) representen una generació o escala de paràmetres diferent.
Això suggereix alguna cosa que crec que està poc explorada: la competència idiomàtica en la traducció escala amb la capacitat del model de maneres que no són visibles en els benchmarks generals.
Els benchmarks generals de llenguatge posen a prova el raonament, el coneixement, la codificació, les matemàtiques. No solen provar si un model pot identificar que pleureu a déu no tracta de condicions meteorològiques, o que portar-se el gat a l'aigua no tracta d'hidratar un gat. Les expressions idiomàtiques se situen a la intersecció del coneixement cultural, la inferència contextual i el reconeixement de patrons, i aquesta intersecció sembla requerir un llindar de capacitat del model que els models més petits no superen de manera constant.
El que no estic afirmant: que els models més grans siguin sempre millors traductors. No tinc proves d'això com a regla general. El que estic observant: que per a contingut idiomàtic específicament, la bretxa de versions dins de la família era més gran del que esperava.
La majoria d'usuaris que utilitzen una eina de traducció d'IA no saben quina versió d'aquesta IA estan utilitzant. Obre un producte, selecciona un parell d'idiomes i obté un resultat. El encaminament del model és invisible per a ells.
Això importa a gran escala. MachineTranslation.com va processar més de centenars de milers de treballs de traducció d'anglès a espanyol en un sol període de 90 dies. Si una part significativa d'aquesta feina tocava contingut idiomàtic (textos de màrqueting, llenguatge jurídic, text literari, comunicació informal) i l'eina que gestionava aquestes feines dirigia els usuaris a un model més petit sense el seu coneixement, aleshores portar el gat a l'aigua apareixia en resultats reals, en documents reals, per a persones reals que confiaven en el resultat. La indústria de la traducció ha passat anys comparant proveïdors d'IA. DeepL contra Google.
Claude contra ChatGPT. Aqueixes comparacions són útils. Però dins d'un mateix proveïdor, la diferència de versió pot ser igualment significant, i és una diferència que la majoria de marcs de comparació no mesuren perquè no proven a nivell de versió del model.
Quan algú diu Utilitzo ChatGPT per a la traducció, aquesta frase no és prou específica per ser significativa. Quin ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? La resposta canvia la sortida de maneres que no són trivials, almenys per al contingut idiomàtic.
Aquesta és la part que trobo més interessant, i encara no he entès del tot què fer-ne.
Els tres models que van produir traduccions idiomàtiques en van donar tres de diferents:
Les tres són representacions defensables en anglès de portar-se el gat a l'aigua. Però no són equivalents.
Per aconseguir-ho emfatitza l'execució contra la dificultat, has fet alguna cosa difícil i ha funcionat. Aconseguir el que un volemfatitza el resultat que volies aconseguir, amb menys èmfasi en la dificultat. Sortir-hi guanyant emfatitza la victòria competitiva, guanyant en relació amb els altres.
L'expressió original en castellà s'aproxima més a la primera d'aquestes. La frase implica la superació de la resistència, no simplement preferir un resultat i que aquest es materialitzi. Però aconseguir el que un vol i sortir guanyant no estan malament, simplement són imprecisos en diferents direccions.
Això planteja una pregunta que trobo genuïnament difícil: quan tres models produeixen cadascun una traducció idiomàtica correcta però diferent, com avaluaries quina és la millor? Les puntuacions BLEU es comparen amb una traducció de referència, però qui va escriure la referència i quina d'aquestes tres hauria triat?
El nostre agent de traducció IA, per a la seva glòria, va fer la pregunta correcta abans de comprometre's amb cap sortida: Quin és el significat previst de 'llevarse el gato al agua' en aquest context? Es van oferir tres opcions: aconseguir un objectiu difícil, agafar alguna cosa innecessària o participar en una activitat arriscada. Aquesta pregunta no és decorativa. És el mecanisme pel qual l'ambigüitat contextual es resol abans que la traducció es finalitzi.
Però el punt és vàlid: tres respostes correctes, tres diferents matisos de significat. Les eines d'avaluació de traduccions no estan fetes per a aquest tipus de matisos.
Vull ser honest sobre els límits del que mostra aquesta prova.
Un idioma, un parell d'idiomes, un dia de proves internes. Això no és un estudi. És una observació. No sé si aquest patró (models més petits que canvien a literal, models més grans que aconsegueixen idiomàtic) es manté constant en:
Tampoc sé si aquesta és una propietat estable d'aquests models o alguna cosa que canvia amb les actualitzacions i l'ajustament. Els proveïdors de models no publiquen registres de canvis específics de traducció. Una versió d'un model que gestiona portar-se el gat a l'aigua correctament avui podria actualitzar-se el mes que ve, i no tindríem manera de saber-ho.
El que sí que sé: aquesta prova va produir un resultat prou interessant que vull fer-ne més, de manera més sistemàtica, en més parells de llengües i tipus de contingut. Quan tingui més a compartir, ho faré.
Tancar amb les dues preguntes que em va deixar aquesta prova. No els hi contestaré , encara no tinc les dades per fer-ho. Però crec que són les preguntes correctes per fer.
Primer: a quin llindar de paràmetres la competència idiomàtica esdevé fiable? El salt de GPT-4o-MINI
i GPT-4.1-NANO (tots dos literals) a GPT-4.1-MINI (idiomàtic) suggereix que hi ha un llindar en algun lloc dins del rang de paràmetres entre aquestes mides de model on el reconeixement d'idiomes s'activa. És coherent? S'aplica a expressions idiomàtiques en totes les llengües, o depèn de com de ben representada estigui una llengua en les dades d'entrenament? No ho sé. Però saber seria útil per a qualsevol persona que construeixi fluxos de treball de traducció.
Segon: quin és el cost de l'opacitat de la versió del model per als usuaris a gran escala?
Si un usuari envia 1.000 documents al mes a través d'una eina que no revela quina versió del model s'està utilitzant (i alguns d'aquests documents contenen contingut idiomàtic), amb quina freqüència està succeint el fracàs literal de manera invisible? Com ho sabrien? Quin és el cost, en termes reals, de no descobrir-ho mai?
Crec que aquesta és una pregunta més important que la majoria de les comparacions de quina IA és millor per a la traducció que circulen actualment. La resposta no és utilitza el model més gran. La resposta podria ser: sap el que estàs utilitzant, fes les teves pròpies proves amb el teu propi contingut, i no assumeixis que el nom d'un proveïdor és una garantia de comportament consistent en tota la seva gamma de models .
Això és, almenys, el que extrec d'aquesta prova.
Basant-nos en aquesta única prova: models més petits i optimitzats per a l'eficiència dins de la mateixa família d'IA van optar per la traducció literal d'una expressió idiomàtica espanyola ben establerta, mentre que les versions més grans/noves de el mateix model van produir traduccions idiomàtiques correctes. Si això es manté en totes les categories idiomàtiques i parells de llengües és la següent pregunta. Executaré més proves.
GPT-4.1-MINI, GPT-5.4-MINI i GPT-5.4 van traduirllavar-se el gat a l'aigua de manera idiomàtica, però en diferents expressions angleses amb connotacions subtilment diferents. Això suggereix que la qualitat de la traducció idiomàtica té almenys dues dimensions: si el model reconeix l'idioma en absolut, i quina expressió equivalent selecciona de les opcions disponibles en la llengua d'arribada. Les mètriques estàndard de qualitat de traducció no separen netament aquestes dues dimensions. Penso que haurien de fer-ho.
Aquesta publicació es basa en proves internes a la plataforma de desenvolupament de MachineTranslation.com. La prova de versions multimodels que es mostra aquí encara no està disponible públicament. Estic compartint la troballa perquè crec que l'observació és útil independentment d'on executeu les vostres traduccions.