June 5, 2026
Je fais des tests internes sur quelque chose dont nous ne parlons pas assez dans l'industrie de la traduction : pas si différents systèmes d'IA traduisent différemment, mais si différentes versions de la même IA traduisent différemment — et dans quelle mesure.
La semaine dernière, j'ai soumis un seul idiome espagnol à cinq versions de ChatGPT simultanément sur la plateforme de test interne de MachineTranslation.com. Ce qui est revenu m'a arrêté.
Deux versions ont produit une traduction qui est, sincèrement, du non-sens en anglais. Trois versions ont produit des traductions idiomatiques correctes. Et les trois bonnes réponses n'étaient pas d'accord entre elles.
Les cinq sont ChatGPT. Les cinq sont d'OpenAI. Même IA, modèle différent — et les résultats ne pourraient pas être plus différents.
Je partage cela maintenant parce que je pense que c'est important, pas parce que j'ai des réponses claires. Moi non plus. Mais l'observation est suffisamment intéressante pour être mise au monde.
La phrase que j'ai testée était llevarse el gato al agua.

Voici ce que chaque version a produit:
| Modèle | Sortie | Idiomatique ? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | porter le chat à l'eau | ❌ Littéral |
| ChatGPT::GPT-4.1-NANO | porter le chat à l'eau | ❌ Littéral |
| ChatGPT::GPT-4.1-MINI | y arriver avec succès | ✅ Correct |
| ChatGPT::GPT-5.4-MINI | obtenir ce que l'on veut | ✅ Partiel |
| ChatGPT::GPT-5.4 | s'en sortir | ✅ Correct |
La phrase signifie accomplir quelque chose de difficile contre toute attente, remporter une victoire difficile. Ça n'a rien à voir avec les chats ou l'eau. La traduction littérale n'est pas une traduction. Il s'agit d'une transcription mot à mot d'une phrase que le modèle n'a pas réussi à reconnaître comme une expression idiomatique.
GPT-4o-MINI et GPT-4.1-NANO ont produit des sorties identiques. Pas similaire, identique. Nos Aperçus de traduction ont signalé ceci directement : « GPT-4.1-nano et GPT-4o-mini partagent des traductions identiques, privilégiant l'interprétation littérale au sens idiomatique. »
GPT-4.1-MINI, GPT-5.4-MINI et GPT-5.4 ont chacun produit quelque chose de reconnaissable comme correct — mais pas identique les uns aux autres.
Je veux être précis quant à la raison pour laquelle « llevarse el gato al agua » est une entrée de test utile plutôt qu'une entrée choisie arbitrairement.
C'est un idiome bien établi. Il apparaît dans la littérature, le journalisme et le langage courant. Ce n'est pas obscur. Tout modèle entraîné sur un corpus raisonnable de textes espagnols devrait l'avoir rencontré. La question n'est pas de savoir si le modèle a vu la phrase. La question est ce qu'il en fait.
Le pire mode d'échec dans la traduction d'idiomes n'est pas de produire une mauvaise traduction. Il produit une traduction littérale qui semble acceptable pour quelqu'un qui ne connaît pas la langue cible.
« Porter le chat à l'eau » est de l'anglais grammaticalement correct. Il est bien formé. Cela ressemble à quelque chose qui pourrait signifier quelque chose. Un utilisateur qui ne parle pas espagnol pourrait le lire, hocher la tête et passer à autre chose — sans jamais savoir que le sens original était complètement perdu.
C'est le mode de défaillance qui m'importe. Pas l'erreur évidente. L'invisible.
La tendance ici n'est pas aléatoire. Les deux modèles qui ont produit des traductions littérales (GPT-4o-MINI et GPT-4.1-NANO) sont tous deux des modèles plus petits et plus légers, optimisés pour la vitesse et la rentabilité. Les trois modèles qui ont produit des traductions idiomatiques (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) représentent une génération ou une échelle de paramètres différente.
Cela suggère quelque chose que je pense être sous-exploré : la compétence idiomatique en traduction évolue avec la capacité du modèle de manière invisible dans les benchmarks généraux.
Les benchmarks linguistiques généraux testent le raisonnement, les connaissances, le codage, les mathématiques. Ils ne testent généralement pas si un modèle peut identifier que « pleuvoir des cordes » ne concerne pas les conditions météorologiques, ou que « llevarse el gato al agua » ne concerne pas l'hydratation d'un chat. Les idiomes se situent à l'intersection des connaissances culturelles, de l'inférence contextuelle et de la reconnaissance des formes — et cette intersection semble nécessiter un seuil de capacité du modèle que les modèles plus petits ne franchissent pas de manière constante.
Ce que je n'affirme pas : que les modèles plus grands sont toujours de meilleurs traducteurs. Je n'ai pas de preuves pour cela en règle générale. Ce que j'observe : que pour le contenu idiomatique spécifiquement, l'écart entre les versions au sein de la famille était plus grand que je ne m'y attendais.
La plupart des utilisateurs qui utilisent un outil de traduction par IA ne savent pas quelle version de cette IA ils utilisent. Ils ouvrent un produit, sélectionnent une paire de langues et obtiennent un résultat. Le routage du modèle leur est invisible.
Cela compte à grande échelle. MachineTranslation.com a traité plus de centaines de milliers de traductions de l'anglais vers l'espagnol en une seule période de 90 jours. Si une portion significative de ces emplois touchait du contenu idiomatique (texte marketing, langage juridique, texte littéraire, communication informelle) et que l'outil dirigeait ces emplois vers un modèle plus petit à leur insu, alors « porter le chat à l'eau » apparaissait dans les résultats réels, dans les documents réels, pour de vraies personnes qui faisaient confiance au résultat. L'industrie de la traduction passe des années à comparer les fournisseurs d'IA. DeepL contre Google.
Claude contre ChatGPT. Ces comparaisons sont utiles. Mais au sein d'un même fournisseur, l'écart de version peut être tout aussi important — et c'est un écart que la plupart des cadres de comparaison ne mesurent pas parce qu'ils ne testent pas au niveau de la version du modèle. Quand quelqu'un dit « J'utilise ChatGPT pour la traduction », cette phrase n'est pas
assez précise pour être significative. Quel ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? La réponse modifie la sortie de manière non triviale, du moins pour le contenu idiomatique.
C'est la partie qui m'intéresse le plus, et je n'ai pas encore tout à fait compris ce qu'il faut en penser.
Les trois modèles qui ont produit des traductions idiomatiques en ont donné trois différentes :
Les trois sont des rendus défendables en anglais de llevarse el gato al agua. Mais ils ne sont pas équivalents.
Pour y arriver met l'accent sur l'exécution face à la difficulté, vous avez fait quelque chose de difficile et cela a fonctionné. Obtenir ce que l'on veut met l'accent sur l'atteinte du résultat souhaité, avec moins d'emphase sur la difficulté. « S'en sortir par le haut » met l'accent sur la victoire compétitive, le fait de gagner par rapport aux autres.
L'idiome espagnol original est le plus proche du premier. L'expression implique de surmonter la résistance, et pas simplement de préférer un résultat et de le voir se concrétiser. Mais « obtenir ce que l'on veut » et « s'en sortir » ne sont pas faux, ils sont simplement imprécis dans des directions différentes. Cela soulève une question que je trouve vraiment difficile : lorsque trois modèles
produisent chacun une traduction idiomatique correcte mais distincte, comment évaluez-vous laquelle est la meilleure ? Les scores BLEU sont comparés à une traduction de référence — mais qui a écrit la référence, et laquelle de ces trois aurait-elle choisie ? Notre agent de traduction IA, à son crédit, a posé la bonne question
avant de s'engager dans une quelconque sortie : Quelle est la signification voulue de « lllevarse el gato al agua » dans ce contexte ? Trois options étaient proposées — atteindre un objectif difficile, prendre quelque chose d'inutile, ou s'engager dans une activité risquée. Cette question n'est pas décorative. C'est le mécanisme par lequel l'ambiguïté contextuelle est résolue avant que la traduction ne soit finalisée.
Mais le fait demeure : trois réponses correctes, trois nuances de sens différentes . Les outils d'évaluation de la traduction ne sont pas conçus pour ce genre de nuance.
Je veux être honnête quant aux limites de ce que ce test démontre.
Une expression idiomatique, une paire de langues, une journée de tests internes. Ce n'est pas une étude. C'est une observation. Je ne sais pas si ce modèle (les modèles plus petits par défaut au littéral, les modèles plus grands atteignant l'idiomatique) est cohérent dans les cas suivants :
Je ne sais pas non plus si c'est une propriété stable de ces modèles ou quelque chose qui change avec les mises à jour et le réglage fin. Les fournisseurs de modèles ne publient pas de journaux de modifications spécifiques à la traduction. Une version de modèle qui gère correctement llevarse el gato al agua aujourd'hui pourrait être mise à jour le mois prochain, et nous n'aurions aucun moyen de le savoir.
Ce que je sais : ce test a produit un résultat suffisamment intéressant pour que je veuille en exécuter davantage, de manière plus systématique, sur plus de paires de langues et de types de contenu. Quand j'aurai plus à partager, je le ferai.
Je terminerai avec les deux questions que ce test m'a laissées. Je ne vais pas y répondre, je n'ai pas encore les données nécessaires pour le faire. Mais je pense que ce sont les bonnes questions à poser.
Premièrement : à quel seuil de paramètres la compétence idiomatique devient-elle fiable ? Le saut de GPT-4o-MINI
et GPT-4.1-NANO (tous deux littéraux) à GPT-4.1-MINI (idiomatique) suggère qu'il existe un seuil quelque part dans la plage de paramètres entre ces tailles de modèles où la reconnaissance des idiomes s'active. Est-ce que c'est cohérent ? Est-ce que cela s'applique aux idiomes de toutes les langues, ou cela dépend-il de la représentativité d'une langue dans les données d'entraînement? Je ne sais pas. Mais savoir serait utile à quiconque crée des flux de travail de traduction.
Deuxièmement : quel est le coût de l'opacité de la version du modèle pour les utilisateurs à grande échelle ?
Si un utilisateur achemine 1 000 documents par mois par l'intermédiaire d'un outil qui ne divulgue pas la version du modèle utilisée (et certains de ces documents contiennent du contenu idiomatique), à quelle fréquence l'échec littéral se produit-il de manière invisible ? Comment le sauraient-ils ? Quel est le coût, en termes réels, de ne jamais le découvrir ?
Je pense que c'est une question plus importante que la plupart des comparaisons « quelle IA est la meilleure pour la traduction » qui circulent actuellement. La réponse n'est pas « utilisez le plus grand modèle ». La réponse pourrait être : sachez ce que vous utilisez, effectuez vos propres tests sur votre propre contenu, et ne supposez pas que le nom d'un fournisseur est une garantie de comportement cohérent dans sa gamme de modèles .
C'est du moins ce que je retiens de ce test.
D'après ce seul test : les modèles plus petits et optimisés pour l'efficacité au sein de la même famille d'IA ont par défaut traduit littéralement un idiotisme espagnol bien établi, tandis que les versions plus grandes/plus récentes du même modèle ont produit des rendus idiomatiques corrects. La question qui se pose ensuite est de savoir si cela s'applique à toutes les catégories d'idiomes et à toutes les paires de langues. Je vais faire plus de tests.
GPT-4.1-MINI, GPT-5.4-MINI et GPT-5.4 ont tous traduit l'idiome« llevarse el gato al agua » de manière idiomatique — mais en différentes expressions anglaises aux connotations subtilement différentes. Ceci suggère que la qualité de la traduction idiomatique a au moins deux dimensions : si le modèle reconnaît l'idiome ou non, et quelle expression équivalente il sélectionne parmi les options disponibles dans la langue cible. Les métriques standard de qualité de traduction ne séparent pas clairement ces deux dimensions. Je pense qu'ils devraient.
Ce billet est basé sur des tests internes sur la plateforme de développement de MachineTranslation.com. La version multimodèle de test présentée ici n'est pas encore disponible publiquement. Je partage cette constatation parce que je pense que l'observation est utile, peu importe où vous effectuez vos traductions.