June 5, 2026
Estiven a realizar probas internas sobre algo do que non falamos abondo na industria da tradución: non se diferentes sistemas de IA traducen de xeito diferente, senón se diferentes versións da mesma IA traducen de xeito diferente, e en que medida.
A semana pasada pasei un único modismo español por cinco versións de ChatGPT simultaneamente na plataforma de probas internas de MachineTranslation.com. O que volveu paroume.
Dúas versións produciron unha tradución que, xenuinamente, non ten sentido en inglés. Tres versións produciron traducións idiomáticas correctas. E os tres correctos non estaban de acordo entre si.
Os cinco son ChatGPT. Todos os cinco son OpenAI. A mesma IA, un modelo diferente — e os resultados non poderían ser máis diferentes.
Comparto isto agora porque creo que importa, non porque teña respostas claras. Non. Mais a observación é o suficientemente interesante como para poñela no mundo.
A frase que probín foi levarse o gato á auga.

Aquí está o que produciu cada versión:
| Modelo | Saída | Idiomático? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | levar o gato á auga | ❌ Literal |
| ChatGPT::GPT-4.1-NANO | levar o gato á auga | ❌ Literal |
| ChatGPT::GPT-4.1-MINI | logralo con éxito | ✅ Correcto |
| ChatGPT::GPT-5.4-MINI | saír co seu | ✅ Parcial |
| ChatGPT::GPT-5.4 | saír por riba | ✅ Correcto |
A frase significa conseguir algo difícil contra todo prognóstico, lograr unha vitoria difícil. Non ten nada que ver con gatos nin con auga. A tradución literal non é unha tradución. É unha transcrición palabra por palabra dunha frase que o modelo non puido recoñecer como un modismo.
GPT-4o-MINI e GPT-4.1-NANO produciron saídas idénticas. Non similar, idéntico. A nosa Análise de Tradución sinalou isto directamente: GPT-4.1-nano e GPT-4o-mini comparten traducións idénticas, enfatizando a interpretación literal sobre o significado idiomático. GPT-4.1-MINI, GPT-5.4-MINI e GPT-5.4 produciron algo recoñeciblemente correcto, pero non o mesmo entre si.
Quero ser preciso sobre por que llevarse el gato al agua é unha entrada de proba útil en lugar dunha escollida á carta.
É un idioma ben establecido. Aparece na literatura, no xornalismo e na fala cotiá. Non é escuro. Calquera modelo adestrado nun corpus razoable de texto en castelán debería atopalo. A pregunta non é se o modelo viu a frase. A pregunta é o que fai con ela.
O peor modo de fallo na tradución de modismos non é producir unha mala tradución. Está a producir unha tradución literal que parece aceptable para alguén que non coñece a lingua de destino.
Levar o gato á auga é inglés gramaticalmente correcto. Está ben formado. Soa coma algo que podería significar algo. Un usuario que non fale español podería lelo, asentir e seguir adiante — sen saber nunca que o significado orixinal se perdeu por completo.
Ese é o modo de fallo que me importa. Non o erro obvio. O invisible.
é aleatorio. Os dous modelos que produciron traducións literais (GPT-4o-MINI e GPT-4.1-NANO) son modelos máis pequenos e lixeiros, optimizados para a velocidade e a eficiencia de custos. Os tres modelos que produciron traducións idiomáticas (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) representan unha xeración ou escala de parámetros diferente.
Isto suxire algo que creo que está pouco explorado: a competencia idiomática na tradución escala coa capacidade do modelo de xeitos que non son visibles nos benchmarks xerais.
Os benchmarks xerais de linguaxe proban o razoamento, o coñecemento, a codificación, as matemáticas. Non proban tipicamente se un modelo pode identificar que chover a manta non trata de condicións meteorolóxicas, ou que llevarse el gato al agua non trata de hidratar un gato. Os modismos sitúanse na intersección do coñecemento cultural, a inferencia contextual e o recoñecemento de patróns — e esa intersección parece requirir un limiar de capacidade do modelo que os modelos máis pequenos non superan de forma consistente.
O que non estou afirmando: que os modelos máis grandes sexan sempre mellores tradutores. Non teño probas diso como regra xeral. O que estou a observar: que para contido idiomático especificamente, a diferenza dentro da familia era maior do que esperaba.
A maioría dos usuarios que usan unha ferramenta de tradución de IA non saben que versión desa IA están a usar. Abren un produto, seleccionan un par de idiomas e obteñen un resultado. O enrutamento do modelo é invisible para eles.
Isto importa a grande escala. MachineTranslation.com procesou máis de centos de miles de traballos de tradución de inglés a español nun único período de 90 días. Se unha parte significativa deses traballos tocaba contido idiomático (textos de marketing, linguaxe xurídica, texto literario, comunicación informal) e a ferramenta que dirixía eses traballos estaba a dirixir aos usuarios a un modelo máis pequeno sen o seu coñecemento, entón levar o gato á auga aparecía en resultados reais, en documentos reais, para persoas reais que confiaban no resultado. A industria da tradución pasou anos comparando provedores de IA. DeepL fronte a
Google. Claude contra ChatGPT. Esas comparacións son útiles. Mais dentro dun único provedor, a diferenza de versión pode ser igual de significativa — e é unha diferenza que a maioría dos marcos de comparación non miden porque non proban a nivel de versión do modelo. Cando alguén di Uso ChatGPT para traducir, esa frase non é o suficientemente
específica como para ser significativa. Cal ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? A resposta cambia a saída de xeitos que non son triviais, polo menos para contido idiomático.
Esta é a parte que me parece máis interesante, e aínda non teño claro que facer con ela.
Os tres modelos que produciron traducións idiomáticas deron tres diferentes:
Os tres son representacións defendibles en inglés de levarse el gato al agua. Mais non son equivalentes.
Levalo a cabo fai énfase na execución fronte á dificultade, ti fixeches algo difícil e funcionou. Conseguir o que un quereenfatiza o resultado que querías que se conseguise, con menos énfase na dificultade. Saír á fronte salienta a vitoria competitiva, gañar en relación cos demais.
O modismo orixinal en castelán é o máis próximo ao primeiro destes. A frase ten a connotación de superar a resistencia, non simplemente preferir un resultado e que este se materialice. Pero saír co seu e saír gañando non están mal, simplemente son imprecisos en diferentes direccións.
Isto suscita unha pregunta que me resulta realmente difícil: cando tres modelos producen cada un unha tradución idiomática correcta pero distinta, como avalías cal é a mellor? As puntuacións BLEU compáranse cunha tradución de referencia — pero quen escribiu a referencia, e cal destas tres tería escollido?
O noso Axente de Tradución IA, para o seu crédito, fixo a pregunta correcta antes de comprometerse con calquera saída: Cal é o significado pretendido de 'levarse el gato al agua'neste contexto? Ofrecéronse tres opcións: acadar un obxectivo difícil, levar algo innecesario ou participar nunha actividade arriscada. Esa pregunta non é decorativa. É o mecanismo polo cal a ambigüidade contextual resólvese antes de que a tradución se finalice.
Pero o punto é: tres respostas correctas, tres matices de significado diferentes. As ferramentas de avaliación da tradución non están construídas para este tipo de matices.
Quero ser honesto sobre os límites do que mostra esta proba.
Un idioma, un par de idiomas, un día de probas internas. Iso non é un estudo. É unha observación. Non sei se este patrón (modelos máis pequenos que por defecto son literais, modelos máis grandes que acadan o idiomático) se mantén consistentemente en:
Tamén non sei se esta é unha propiedade estable destes modelos ou algo que cambia con actualizacións e axustes finos. Os provedores de modelos non publican rexistros de cambios específicos de tradución. Unha versión dun modelo que manexa levarse o gato á auga correctamente hoxe podería ser actualizada o mes que vén, e non teríamos forma de sabelo.
O que si sei: esta proba produciu un resultado o suficientemente interesante como para que queira facer máis, de forma máis sistemática, en máis parellas de linguas e tipos de contido. Cando teña máis que compartir, fareino.
Rematarei coas dúas preguntas que me deixou esta proba. Non vou responderlles, aínda non teño os datos para facelo. Pero creo que son as preguntas correctas que hai que facer.
Primeiro: en que limiar de parámetros a competencia idiomática convértese en fiable?
O salto de GPT-4o-MINI e GPT-4.1-NANO (ambos literais) a GPT-4.1-MINI (idiomático) suxire que hai un limiar nalgún lugar no rango de parámetros entre eses tamaños de modelo onde o recoñecemento de modismos se activa. É consistente? Aplícase a modismos en todas as linguas, ou depende de canto ben representada estea unha lingua nos datos de adestramento? Non sei. Mais saber sería útil para calquera persoa que estea a construír fluxos de traballo de tradución.
Segundo: canto custa aos usuarios a opacidade da versión do modelo a grande escala?
Se un usuario envía 1.000 documentos ao mes a través dunha ferramenta que non revela que versión do modelo se está a utilizar (e algúns deses documentos conteñen contido idiomático), con que frecuencia está a ocorrer o fallo literal de forma invisible? Como o saberían? Cal é o custo, en termos reais, de nunca o descubrir?
Creo que esta é unha pregunta máis importante que a maioría das comparacións de cal é a mellor IA para a tradución que circulan actualmente. A resposta non é usa o modelo máis grande. A resposta podería ser: saber o que estás a usar, fai as túas propias probas co teu propio contido, e non asumas que o nome dun provedor é unha garantía de comportamento consistente en toda a súa gama de modelos .
Iso é, polo menos, o que estou a sacar desta proba.
Baseado nesta única proba: os modelos máis pequenos e optimizados para a eficiencia dentro da mesma familia de IA optaron pola tradución literal dun idioma español ben establecido, mentres que as versións máis grandes/novas do mesmo modelo produciron as correspondentes expresións idiomáticas correctas. Se isto se mantén en todas as categorías de modismos e pares de linguas é a seguinte pregunta. Farei máis probas.
GPT-4.1-MINI, GPT-5.4-MINI e GPT-5.4 traducironlevarse el gato al agua idiomáticamente — pero en diferentes expresións en inglés con connotacións sutilmente diferentes. Isto suxire que a calidade da tradución idiomática ten polo menos dúas dimensións: se o modelo recoñece o idioma en absoluto, e cal expresión equivalente selecciona das opcións dispoñibles na lingua de destino . As métricas estándar de calidade da tradución non separan claramente estas dúas dimensións. Penso que deberían.
Esta publicación baséase en probas internas na plataforma de desenvolvemento de MachineTranslation.com. A proba de modelos múltiples que se mostra aquí aínda non está dispoñible publicamente. Estou a compartir o achado porque creo que a observación é útil independentemente de onde realices as túas traducións.