September 25, 2026
GPT-3, GPT-4 i GPT-5 estan separats per cinc anys i diverses generacions d'arquitectura, però la pregunta útil per a la traducció no és «quin és el més intel·ligent». És més concreta: què va canviar específicament en la manera com aquests models gestionen les parts d'una llengua que no es tradueixen paraula per paraula, com ara els modismes, l'ambigüitat i el registre? La millora es va produir en llocs concrets, en punts concrets, i no va seguir una línia recta dels més antics als més nous.
OpenAI va llançar GPT-3 el 2020, abans que existís el programa de proves propi de MachineTranslation.com, de manera que res del que hi ha aquí és una referència propietària. És història ben documentada, no pas el resultat d'una prova interna. GPT-3 va ser el primer model d'aquest tipus capaç de produir text fluid i amb un to humà en diversos idiomes sense un entrenament específic per a la tasca, cosa que el va convertir en una fita autèntica. Concretament per a la traducció, aquesta mateixa fluïdesa va crear un risc real: GPT-3 podia produir una frase segura i ben formada en la llengua d'arribada que, tot i així, fos incorrecta, sense que res en el resultat indiqués que s'havia produït un error.
GPT-4 es va llançar el març de 2023, i les proves de models pròpies de MachineTranslation.com comencen al voltant d'aquesta generació. La millora va ser real però desigual. En provar l'ambigua frase en anglès «That's sick» en japonès, GPT-4.1-nano va ser l'únic model dels sis provats que va reduir el doble sentit deliberat de la frase a una sola interpretació, mentre que els altres cinc van preservar l'ambigüitat que pretenia la frase original. Els modismes van ser una feblesa més gran: en passar el modisme espanyol «llevarse el gato al agua» per cinc versions de GPT alhora, els més petits GPT-4o-mini i GPT-4.1-nano van produir la mateixa traducció literal i incorrecta, ignorant completament el modisme.
El mateix patró va aparèixer en altres llocs. Una expressió idiomàtica alemanya, «ich verstehe nur Bahnhof», passada per vuit subversions de GPT i Claude, va ser traduïda literalment i incorrectament per GPT-4o-mini en concret, mentre que un model més petit i més nou de la mateixa prova, GPT-4.1-nano, la va encertar. La generació i la mida del model no es corresponien de cap manera coherent, un patró que les proves de versions de models de MachineTranslation.com tracten més a fons.
OpenAI va presentar GPT-5 com un sistema unificat que redirigeix entre un model ràpid predeterminat i un model de raonament més profund segons la tasca, un canvi estructural respecte al disseny de model únic de GPT-4. El mateix GPT-5 System Card d'OpenAI informa que la taxa global d'errors factuals del model és aproximadament un 45% inferior a la de GPT-4 i un 80% inferior a la de GPT-3, un augment general de la fiabilitat que també es reflecteix específicament en la traducció. Les proves de MachineTranslation.com mostren els guanys més clars allà on els models de l'era GPT-4 tenien més dificultats: en el mateix modisme espanyol en què GPT-4o-mini i GPT-4.1-nano van fallar, tant GPT-5.4-mini com GPT-5.4 van oferir traduccions correctes i idiomàtiques, cadascun formulant-la d'una manera lleugerament diferent però entenent el modisme en si.

La diferència entre generacions no va ser una pujada constant. Es va concentrar gairebé íntegrament en el llenguatge idiomàtic i ambigu. En textos directes, els models de l'era GPT-4 i de l'era GPT-5 obtenen puntuacions pràcticament idèntiques.
| GPT-3 | GPT-4 | GPT-5 | |
|---|---|---|---|
| Llançament | 2020 | Març de 2023 | 2025, ara a GPT-5.4/5.5 |
| Disponible avui | No, retirat | Només per API, retirat de ChatGPT | Sí, generació actual |
| Tractament de modismes | No provat per MachineTranslation.com (anterior al programa) | Inconsistent; va fallar completament en diversos modismes | Va tractar correctament els mateixos modismes que GPT-4 va fallar |
| Text empresarial estàndard | No provat per MachineTranslation.com | Sòlid, gairebé idèntic als models posteriors | Sòlid, gairebé idèntic a GPT-4 |
Aquest últim punt és important: una prova independent d'una frase empresarial estàndard, "please confirm receipt of this document", traduïda a l'alemany, va retornar un resultat gairebé idèntic en tots els models provats, inclosos els models GPT-4o-mini i els de la generació GPT-5. La bretxa generacional és específica del llenguatge figurat i ambigu, no pas una diferència de qualitat generalitzada.
No. En provar un modisme en hebreu entre diverses famílies de models, GPT-5.4-mini i GPT-5.4 van arribar a dues interpretacions diferents i parcials de la mateixa frase, cap de les dues del tot correcta, mentre que un model més antic i no relacionat s'hi va acostar més. Un model més nou no és automàticament més precís, i un model més gran o més recent no és automàticament l'opció més segura per a una frase determinada.
Tant GPT-3 com GPT-4 s'han retirat de ChatGPT; GPT-4 només continua sent accessible a través de l'API d'OpenAI per a integracions existents. La generació actual, GPT-5.4 i GPT-5.5, és la que utilitza MachineTranslation.com avui dia, i ofereix un rendiment competitiu en comparació amb els models actuals d'altres proveïdors, tot i que no de manera uniformement superior en totes les combinacions lingüístiques. Per veure més detalladament com es comparen entre si les subversions actuals de GPT i respecte a models com Claude i DeepSeek, consulteu les proves comparatives directes de subversions de MachineTranslation.com, que aprofundeixen més del que pot fer una visió general generacional.
La conclusió més important per a un programa de localització a gran escala no és que «GPT-5 supera GPT-3». És que la versió del model, i no només la família del model, determina si un modisme concret o una frase ambigua es tradueix correctament, i això és cert en totes les combinacions lingüístiques, no només en el grapat que es mostra aquí. Això és especialment rellevant en continguts que depenen del to i del llenguatge figurat des d'un bon principi, sobretot en textos de màrqueting i contingut generat per usuaris, on un sol modisme traduït literalment pot canviar tot el sentit d'una publicació o d'un anunci. Un programa que traslladi contingut a desenes d'idiomes es trobarà exactament amb aquest tipus de llenguatge en cadascun d'ells. La sèrie de proves de subversions i les proves completes de comparació de models de MachineTranslation.com tracten aquesta qüestió amb més profunditat. L'enfocament de la plataforma, que executa els models actuals de GPT juntament amb més de 20 models addicionals en cada traducció, existeix precisament perquè l'historial de versions de cap model per si sol no és una garantia prou fiable.
GPT-3 gestionava raonablement bé el text senzill i directe, però tenia serioses dificultats amb qualsevol cosa idiomàtica o ambigua. GPT-4 va reduir significativament aquesta bretxa, però continuava reduint algunes frases genuïnament ambigües a un sol significat en comptes de preservar l'ambigüitat. Les subversions posteriors de GPT-5 van gestionar correctament modismes que els models anteriors de l'era GPT-4 traduïen de manera literal i incorrecta.
No. Les proves pròpies de MachineTranslation.com han detectat casos en què una subversió més petita i nova ha superat una de més gran i antiga, i la diferència de qualitat entre generacions sol ser específica del llenguatge idiomàtic o figurat, més que una millora generalitzada a tots els nivells.
No. Tots dos s'han retirat de ChatGPT i s'han substituït per models més nous de la generació GPT-5. GPT-4 només continua sent accessible a través de l'API d'OpenAI per a integracions existents, no pas com una opció actual adreçada al consumidor final.
MachineTranslation.com utilitza models actuals de la generació GPT-5 (GPT-5.4 i GPT-5.5, segons el nivell del pla) juntament amb més de 20 altres models d'IA en cada traducció, en lloc de dependre exclusivament de GPT.
Els models de la generació GPT-5 ofereixen un rendiment competitiu, però no pas uniformement millor que models com Claude, Gemini o DeepSeek. Models diferents guanyen en diferents parells d'idiomes i tipus de contingut, motiu pel qual MachineTranslation.com els posa a prova directament entre ells en lloc de triar-ne un per defecte.