September 25, 2026
GPT-3, GPT-4 et GPT-5 sont séparés par cinq ans et plusieurs générations d’architectures, mais la question utile pour la traduction n'est pas de savoir « lequel est le plus intelligent ». Elle est plus précise : qu’est-ce qui a concrètement changé dans la façon dont ces modèles gèrent les subtilités du langage qui ne se traduisent pas mot à mot, comme les expressions idiomatiques, l'ambiguïté et le registre? L'amélioration s'est produite à des endroits précis, à des moments bien ciblés, et n'a pas suivi une ligne droite du plus ancien au plus récent.
OpenAI a lancé GPT-3 en 2020, avant que le programme d'évaluation de MachineTranslation.com n'existe; rien de tout ceci ne constitue donc un banc d'essai exclusif. Il s'agit d'une histoire bien documentée et non d'un résultat de test interne. GPT-3 a été le premier modèle du genre capable de produire un texte fluide et naturel dans plusieurs langues sans entraînement spécifique à la tâche, ce qui en a fait un véritable jalon. Pour la traduction en particulier, cette même fluidité présentait un réel danger : GPT-3 pouvait générer avec assurance une phrase bien structurée dans la langue cible qui était pourtant erronée, sans que rien dans le résultat ne laisse présager qu'une erreur avait été commise.
GPT-4 a été lancé en mars 2023, et c’est autour de cette génération que les tests de modèles de MachineTranslation.com ont débuté. L'amélioration était réelle, mais inégale. Lors d’un test de l'expression anglaise ambiguë « That's sick » en japonais, GPT-4.1-nano a été le seul des six modèles évalués à réduire le double sens délibéré de la formule à une interprétation unique, alors que les cinq autres ont préservé l'ambiguïté voulue par la phrase originale. Les expressions idiomatiques représentaient une faiblesse encore plus marquée : en soumettant l'expression espagnole « llevarse el gato al agua » à cinq versions de GPT en même temps, les modèles plus compacts GPT-4o-mini et GPT-4.1-nano ont tous deux produit la même traduction littérale et erronée, passant complètement à côté de l'expression.
La même tendance a été observée ailleurs. L'expression allemande « ich verstehe nur Bahnhof », soumise à huit sous-versions de GPT et de Claude, a été traduite de manière littérale et incorrecte par GPT-4o-mini en particulier, tandis qu'un modèle plus récent et plus compact au sein du même test, GPT-4.1-nano, l'a traduite correctement. La génération et la taille du modèle ne correspondaient pas de façon uniforme, un phénomène que les bancs d'essai des versions de modèles de MachineTranslation.com analysent plus en détail.
OpenAI a présenté GPT-5 comme un système unifié qui achemine les requêtes entre un modèle par défaut rapide et un modèle de raisonnement plus poussé selon la tâche à accomplir, un changement structurel par rapport à la conception à modèle unique de GPT-4. La propre fiche système (System Card) de GPT-5 publiée par OpenAI indique que le taux global d'erreurs factuelles du modèle est inférieur d'environ 45 % à celui de GPT-4 et de 80 % à celui de GPT-3, un gain de fiabilité général qui se manifeste aussi tout particulièrement en traduction. Les tests de MachineTranslation.com mettent en évidence les progrès les plus nets là où les modèles de l'ère GPT-4 éprouvaient le plus de difficultés : pour cette même expression espagnole sur laquelle GPT-4o-mini et GPT-4.1-nano ont trébuché, GPT-5.4-mini et GPT-5.4 sont tous deux parvenus à des traductions idiomatiques correctes, chacun avec une formulation légèrement différente, mais en comprenant parfaitement le sens de l'expression.

L'écart entre les générations n'a pas suivi une progression constante. Il s'est concentré presque entièrement sur le langage idiomatique et ambigu. Sur des textes simples et directs, les modèles de l'ère GPT-4 et ceux de l'ère GPT-5 obtiennent des résultats quasi identiques.
| GPT-3 | GPT-4 | GPT-5 | |
|---|---|---|---|
| Date de lancement | 2020 | Mars 2023 | 2025, maintenant à GPT-5.4/5.5 |
| Disponible aujourd'hui | Non, retiré | API seulement, retiré de ChatGPT | Oui, génération actuelle |
| Traitement des expressions idiomatiques | Non testé par MachineTranslation.com (antérieur au programme) | Inégal; a complètement manqué plusieurs expressions idiomatiques | A correctement traité les mêmes expressions que GPT-4 a manquées |
| Texte d'affaires standard | Non testé par MachineTranslation.com | Solide, presque identique aux modèles plus récents | Solide, presque identique à GPT-4 |
Ce dernier point est important : un test distinct portant sur une phrase d'affaires standard, « please confirm receipt of this document », traduite en allemand, a donné des résultats quasi identiques pour tous les modèles testés, y compris GPT-4o-mini et les modèles de la génération GPT-5. L'écart générationnel est propre au langage figuré et ambigu, plutôt qu'à une différence générale de qualité.
Non. Lors du test d'une expression idiomatique hébraïque à travers différentes familles de modèles, GPT-5.4-mini et GPT-5.4 ont abouti à deux interprétations différentes et partielles de la même phrase, sans qu'aucune ne soit entièrement exacte, tandis qu'un modèle plus ancien et sans lien s'en est davantage approché. Un modèle plus récent n'est pas automatiquement plus précis, et un modèle plus volumineux ou plus récent n'est pas d'emblée le choix le plus sûr pour une phrase donnée.
GPT-3 et GPT-4 ont tous deux été retirés de ChatGPT; GPT-4 demeure accessible uniquement par l'entremise de l'API d'OpenAI pour les intégrations existantes. La génération actuelle, GPT-5.4 et GPT-5.5, est celle qu'utilise MachineTranslation.com aujourd'hui, et elle offre un rendement concurrentiel par rapport aux modèles actuels d'autres fournisseurs, bien qu'elle ne soit pas systématiquement meilleure pour chaque paire de langues. Pour voir de plus près comment les sous-versions actuelles de GPT se comparent entre elles et par rapport à des modèles comme Claude et DeepSeek, consultez les tests comparatifs directs de sous-versions de MachineTranslation.com, qui vont plus loin qu'un simple survol générationnel.
Le constat le plus important pour un programme de localisation d'envergure n'est pas que « GPT-5 surpasse GPT-3 ». C'est que la version du modèle, et pas seulement sa famille, détermine si une expression idiomatique ou une tournure ambiguë précise est traduite correctement, et cela s'applique à chaque paire de langues, pas seulement à la poignée présentée ici. Cela importe particulièrement pour le contenu qui mise d'abord sur le ton et le sens figuré, notamment les textes publicitaires et le contenu généré par les utilisateurs, où une seule expression traduite littéralement peut changer tout le sens d'une publication ou d'une annonce. Un programme qui traduit du contenu dans des dizaines de langues se heurtera à ce genre de formulation dans chacune d'elles. La série de tests de sous-versions et les tests comparatifs complets de modèles de MachineTranslation.com traitent de cet aspect plus en détail. L'approche de la plateforme, qui exécute les modèles GPT actuels aux côtés de plus de 20 autres modèles pour chaque traduction, existe précisément parce que l'historique des versions d'un seul modèle ne constitue pas, à lui seul, une garantie suffisamment fiable.
GPT-3 traitait les textes simples assez bien, mais éprouvait de grandes difficultés avec tout ce qui était idiomatique ou ambigu. GPT-4 a réduit cet écart de façon notable, mais réduisait tout de même certaines phrases véritablement ambiguës à un sens unique au lieu de préserver l'ambiguïté. Les sous-versions ultérieures de GPT-5 ont correctement traité des expressions idiomatiques que les modèles précédents de l'ère GPT-4 traduisaient littéralement et de façon erronée.
Non. Les propres tests de MachineTranslation.com ont révélé des cas où une sous-version plus récente et plus petite a surpassé une version plus ancienne et plus imposante, et l'écart de qualité entre les générations tend à être propre au langage idiomatique ou figuré plutôt qu'à une amélioration générale et systématique.
Non. Les deux ont été retirés de ChatGPT et remplacés par de nouveaux modèles de la génération GPT-5. GPT-4 demeure accessible uniquement par l'intermédiaire de l'API d'OpenAI pour les intégrations existantes, et non comme option grand public actuelle.
MachineTranslation.com utilise les modèles actuels de la génération GPT-5 (GPT-5.4 et GPT-5.5, selon le forfait) aux côtés de plus de 20 autres modèles d'IA pour chaque traduction, plutôt que de se fier uniquement à GPT.
Les modèles de la génération GPT-5 offrent des performances concurrentielles, mais ne sont pas systématiquement meilleurs que des modèles comme Claude, Gemini ou DeepSeek. Différents modèles se démarquent selon les paires de langues et les types de contenu, c'est pourquoi MachineTranslation.com les teste directement les uns par rapport aux autres plutôt que d'en choisir un par défaut.