July 10, 2026
Deux mots. Six modèles. Trois différentes décisions de traduction. Voici ce qui s'est passé quand j'ai exécuté 8 phrases de test à travers les derniers modèles d'IA disponibles sur MachineTranslation.com, et ce que les résultats révèlent réellement sur le moment où un modèle échoue silencieusement.
Deux mots. C'est malade. Six modèles. Trois décisions de traduction distinctes.
En japonais, un modèle l'a rendu comme それはやばい, préservant l'ambiguïté. Un autre a complètement supprimé le pronom sujet et a écrit la forme nue やばい, la version la plus familière possible. Un tiers a écrit それはすごい, ce qui résout l'ambiguïté entièrement en faveur d'« incroyable », éliminant ainsi le double sens qui rendait l'expression intéressante en premier lieu. En vietnamien, un modèle a écrit Đỉnh vậy (argot, correct pour le registre des jeunes). Un autre a écrit C'est vraiment merveilleux, grammaticalement correct, mais plus proche de dire « c'est vraiment magnifique » quand quelqu'un vous envoie un mème par texto.
Tous ces éléments sont défendables. Aucun d'eux n'est la même chose. Et si vous exécutez des traductions par l'intermédiaire d'un seul modèle, vous ne verrez jamais le choix qui a été fait en votre nom.
C'est la question centrale à laquelle cet article tente de répondre. Ce n'est pas quel modèle d'IA est le meilleur pour la traduction en 2026 (la réponse dépend de la paire de langues, du registre, du domaine et de la structure des phrases), mais plutôt : comment sauriez-vous quand votre modèle a fait le mauvais choix ? Surtout dans des domaines comme la terminologie médicale, les contrats juridiques ou la formalité professionnelle, où le mauvais choix ressemble exactement à une traduction correcte jusqu'à ce qu'un spécialiste la lise.
Voici ce que j'ai fait. J'ai soumis 8 phrases de test à deux séries de modèles sur MachineTranslation.com : d'abord une base de référence composée de 5 modèles largement utilisés, puis un ensemble élargi qui ajoute plusieurs des plus récentes variantes de modèles haut de gamme maintenant disponibles pour les utilisateurs payants. Normalement, comparer les résultats de modèles comme celui-ci signifierait des abonnements payants distincts auprès de chaque fournisseur individuellement. Sur MachineTranslation.com, ils se trouvent dans la même vue de comparaison. Les paires de langues étaient l'anglais→le japonais et l'anglais→le vietnamien. Les catégories de phrases ont été choisies spécifiquement pour tester les domaines où le désaccord entre modèles est le plus important : les expressions idiomatiques, la terminologie juridique, la terminologie médicale, le contexte sensible à la formalité et l'ambiguïté sémantique délibérée.
Une note sur la méthodologie d'évaluation : la recherche en traduction automatique s'est longtemps demandé comment évaluer automatiquement les résultats. Des métriques comme BLEU et COMET mesurées dans les tâches partagées de WMT fournissent un signal agrégé utile, mais elles sont mauvaises pour détecter les erreurs de registre, les échecs d'idiomatique et la précision terminologique, exactement les catégories qui importent le plus ici. Ce que vous êtes sur le point de lire est une analyse des résultats, non une course BLEU.

Pas chaque phrase ne révèle un désaccord significatif. Deux des huit tests, « Prenons contact une fois que la poussière retombera sur cette transaction » (→ japonais) et « Nous travaillons d'arrache-pied pour respecter cette date de lancement » (→ vietnamien), ont produit un accord élevé dans les deux séries. Les expressions idiomatiques ont été correctement comprises comme des expressions idiomatiques. Personne n'a traduit « touch base » comme touchant une base physique. Personne n'a traduit « the dust settles » comme du sédiment qui tombe.
Cela vaut la peine de s'y arrêter : le langage commercial idiomatique anglais est raisonnablement bien géré par les modèles de pointe actuels lorsque l'idiome est suffisamment courant. Le consensus pour « touch base » est resté stable dans les deux séries ; la variation était purement stylistique, autour de la question d'utiliser この件 (cette affaire), この取引 (cette transaction), ou この案件 (ce dossier) pour la phrase source.

Le test du « travail jusqu'à minuit » est là où les choses sont devenues plus intéressantes. Tous les modèles sauf un ont correctement compris l'expression idiomatique. MiniMax M2.7, introduit au Tour 2, a traduit « burning » littéralement, produisant đốt đuốc, ce qui signifie « torches brûlantes ». Le consensus l'a correctement exclu.

Le japonais est une langue à couches de formalité. Le choix de la terminaison verbale, du pronom et de la forme du nom référentiel n'est pas stylistique. Cela signale la relation entre le locuteur et le destinataire. Envoyer un message à votre PDG en utilisant des formes verbales informelles n'est pas une erreur de traduction au sens grammatical. C'est une erreur sociale, et une erreur importante.
La phrase de test : Pouvez-vous m'envoyer ça? Merci, j'apprécie. Contexte : envoyer un message à un PDG.

Le consensus a changé quand le bassin de modèles s'est élargi. Le mécanisme est simple : l'ajout de modèles qui lisaient correctement le contexte de formalité a fait basculer la majorité, et le consensus a suivi. Voici le spectre complet de ce que les modèles ont produit au Tour 2 :

Le test de registre vietnamien a révélé un type d'erreur de formalité différent, celui-ci étant plus subtil. La phrase source : Hé, question rapide — es-tu libre pour un appel? Contexte : envoyer un message à un client. Qwen au premier tour a inclus « mình », un pronom à la première personne qui implique une amitié entre pairs décontractée. Tous les autres modèles ont entièrement évité l'autoréférence à la première personne, ce qui est le choix professionnel plus sûr. De façon cruciale, Qwen a corrigé cela au Deuxième tour et a supprimé « mình ». Le consensus dans les deux tours l'a exclu.

La phrase d'indemnisation vendeur/client est une clause standard dans les accords commerciaux : "Le fournisseur doit indemniser le client contre toute réclamation de tiers découlant du non-respect de cet accord."
Lors de la ronde 1, les cinq modèles ont correctement identifié le registre juridique et utilisé les emprunts ベンダー (fournisseur) et クライアント (client), standards dans les contrats commerciaux japonais d'origine anglaise. Une exception : GPT-4.1-NANO a utilisé 販売者 (vendeur) et 顧客 (client), des mots japonais légitimes qui manquent de la spécificité juridique formelle des équivalents empruntés.
La découverte la plus importante a émergé au cours de la Ronde 2. La distinction clé est entre deux mots:
Ce sont des concepts légalement différents. « Indemnify » signifie précisément de protéger une partie contre la responsabilité envers des tiers. 免責 est le terme juridique correct. Tous les modèles du Tour 1 utilisaient 補償. Au Round 2, DeepSeek V4-Pro était le seul modèle à produire 免責, et il l'a fait au Round 2 seulement, non au Round 1.

Dans un contrat, 補償 et 免責 ne sont pas des synonymes. Un moyen « nous vous rembourserons ». L'autre signifie « vous êtes protégé contre la réclamation dès le départ ». Si une plateforme de traduction utilise 補償 où 免責 est correct, un avocat lisant la version japonaise ne verra pas le même accord que celui décrit dans la version anglaise.
C'est la conclusion la plus importante de l'ensemble de données. La phrase de test : Ce médicament est contre-indiqué chez les patients ayant des antécédents d'insuffisance hépatique. Source: documentation de produit clinique. Cible : Vietnamien.
Le terme critique est « l'insuffisance hépatique ». Il y a deux candidats vietnamiens:
Ces conditions sont cliniquement distinctes. Une mise en garde contre-indication fondée sur l'« insuffisance hépatique » s'applique à toute personne ayant une fonction hépatique réduite, et non seulement à ceux qui ont connu une défaillance complète de l'organe. L'utilisation de suy gan rétrécit incorrectement la population indiquée. Un patient atteint d'une atteinte hépatique modérée qui lit suy gan pourrait ne pas se reconnaître comme la population contre-indiquée.

Certaines phrases sources sont ambiguës par conception. « C'est malade » en argot anglais contemporain signifie quelque chose d'excellent, mais ça conserve aussi son sens littéral (c'est-à-dire dégoûtant/répugnant), et la tension entre ces deux sens fait partie de la façon dont l'expression communique. Le défi pour un modèle de traduction est : préservez-vous l'ambiguïté, la réduisez-vous au sens le plus probable, ou en choisissez-vous un et vous y engagez-vous?


Les modèles dans ce test ne sont pas tous équivalents. Ils couvrent différentes architectures, régimes d'entraînement et contextes de déploiement. La ligne de base de la Ronde 1 comprend des modèles largement accessibles. Le pool élargi de la Ronde 2 ajoute plusieurs des variantes de modèles de niveau premium les plus récentes maintenant disponibles pour les utilisateurs payants sur MachineTranslation.com, le même niveau de modèle qui signifierait autrement un compte payant distinct auprès de chaque fournisseur individuel.

Le pool élargi de la Ronde 2 comprend des modèles plus avancés et disponibles pour les utilisateurs payants sur MachineTranslation.com. L'effet de l'expansion du bassin n'est pas uniforme. Dans certains tests (formalité/japonais), cela a décalé le consensus de façon significative. Chez d'autres (terminologie médicale/vietnamien), la division s'est approfondie.

Les données de test pointent vers deux catégories d'échecs distincts, et elles nécessitent des réponses différentes.
Catégorie A : Les défaillances silencieuses. Les erreurs de formalité, les erreurs de registre, la précision de la terminologie médicale : celles-ci produisent des résultats qui semblent corrects. Le japonais est grammatical. Le Vietnamien est courant. Il n'y a aucun signal de surface indiquant que quelque chose s'est mal passé. Un utilisateur monolingue lisant la sortie d'un seul modèle n'a aucun moyen de savoir que le modèle a fait un choix de registre qu'un cadre supérieur japonais remarquerait, ou qu'un terme clinique a été restreint d'une manière qui change la population à laquelle il s'applique.
Catégorie B : Défaillances visibles. MiniMax traduisant « burning the midnight oil » par « brûler des torches ». GPT-4.1-NANO résolvant « That's sick » en « すごい » sans ambiguïté. Ceux-ci sont détectables, soit par un locuteur de la langue cible, soit par comparaison avec d'autres résultats de modèles.
La comparaison multi-modèles que SMART fournit est la plus utile dans la catégorie A. Lorsque cinq ou dix modèles produisent des résultats et que la plupart s'accordent sur un registre formel tandis qu'un produit du japonais en forme simple et décontracté, le désaccord est visible dans la vue de comparaison. Un utilisateur qui parle la langue cible peut évaluer les options. Un utilisateur qui ne peut pas voir qu'une décision contestée a été prise peut décider si cette phrase justifie un examen humain.
Pour le travail à l'échelle du document, les fichiers volumineux, la traduction préservant la mise en page des fichiers PDF, des contrats ou des matériaux cliniques, la capacité de traitement de documents de la plateforme gère la structure des fichiers sans altérer le formatage. Mais les questions de qualité soulevées ci-dessus s'appliquent indépendamment de la taille du fichier. Une étude clinique de 100 pages où chaque instance d'« altération de la fonction hépatique » est traduite comme « insuffisance hépatique » est une version plus grande du même problème identifié au Test 2.
Pour les catégories médicale et juridique spécifiquement, la vérification humaine est le bon mécanisme de contrôle. Le service de post-édition IA de Tomedes, qui associe la sortie IA à un examen humain certifié pour exactement ce type de contenu à enjeux élevés, est conçu pour cela. La diminution de la fonction hépatique / insuffisance hépatique est exactement le type de constatation qui devrait déclencher cet examen, non pas parce que tous les modèles sont incorrects, mais parce que les modèles les plus confiants ne sont pas les plus précis.
L'intérêt de voir plusieurs résultats n'est pas que vous choisirez toujours la majorité. C'est que vous saurez qu'un choix a été fait, ce qui est différent de supposer que le résultat devant vous est correct.

Mettez les huit tests côte à côte et un motif se maintient : l'accord et le désaccord ne sont pas distribués aléatoirement. Le langage commercial idiomatique et quotidien (« prendre contact », « travailler tard le soir ») a convergé dans presque tous les modèles de l'ensemble, dans les deux tours. La formalité, la précision juridique et la terminologie médicale n'ont pas. Le test de formalité du PDG n'est passé du registre décontracté au registre formel qu'une seule fois lorsque le groupe élargi a été inclus. La clause d'indemnisation a mis en lumière une véritable distinction juridique (免責 vs. 補償) qu'un seul modèle, dans une seule ronde, a bien comprise. La division de la terminologie médicale ne s'est jamais vraiment résolue, restant à environ 6 contre 4 dans les deux séries, peu importe quels modèles se trouvaient dans le groupe.
C'est la constatation réelle, pas une affirmation marketing : le consensus ne rend pas chaque phrase meilleure, et il n'a pas besoin de le faire. C'est là que c'est le plus précieux, exactement où la fluidité d'un seul modèle ne vous donne aucune raison d'en douter, et où se tromper a réellement un coût.
Il y a une deuxième couche, plus pratique, à ce test qui vaut la peine d'être énoncée clairement. Faire cette comparaison moi-même signifiait vérifier les résultats de GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo et MiniMax M2.7 côte à côte avec les modèles de référence existants, en un seul endroit, sur une seule plateforme. À l'extérieur de MachineTranslation.com, ce n'est pas un seul abonnement. C'est plusieurs, un pour chaque fournisseur dont vous voulez tester le niveau premium, à quel que soit le prix que chaque fournisseur facture individuellement. Les utilisateurs payants ici obtiennent cette même comparaison en un clic, à une fraction du coût de l'entretien de cinq abonnements premium distincts, sans renoncer à ce qui compte vraiment : voir où les modèles s'accordent et savoir exactement quand ils ne s'accordent pas.
Aucun n'est catégoriquement meilleur; cela dépend de la catégorie de test. Claude Sonnet et Claude Opus ont régulièrement choisi le terme médical vietnamien plus précis, et Claude Opus a produit l'argot le plus approprié pour « C'est malade. » Mais Claude Sonnet a aussi produit du japonais décontracté dans une phrase de contexte formel de PDG, où GPT-5.5 l'a bien compris. Comparer les résultats directement est plus justifiable que de choisir un modèle et de lui faire confiance.
Il n'y en a pas; la précision dépend du domaine. Gemini 3.5-Flash et GLM-5-Turbo ont produit le japonais formel le plus approprié dans ce test. Les deux modèles Claude ont été les plus précis sur la terminologie médicale vietnamienne. DeepSeek V4-Pro était le seul modèle à utiliser le terme juridique japonais correct, mais seulement à la ronde 2, et il a produit du japonais décontracté ailleurs. Aucun modèle unique n'a dominé dans les huit tests.
Non, pas automatiquement. L'élargissement de la gamme avec de nouvelles variantes de modèles de niveau premium a fait basculer le consensus de l'informel au formel dans le test de formalité japonaise. Mais dans le test de terminologie médicale vietnamienne, la division persistait à environ 6 contre 4, peu importe les modèles inclus. Plus de modèles font surface plus de désaccord, ce qui est un signal utile, mais le consensus suit toujours la majorité, et la majorité n'est pas toujours la réponse la plus précise.
SMART est le système de consensus multi-modèles de MachineTranslation.com, couvrant jusqu'à 22 modèles d'IA provenant de fournisseurs incluant OpenAI, Anthropic, Google et DeepSeek. Cela exécute une traduction à travers plusieurs modèles à la fois et affiche le résultat du consensus majoritaire aux côtés de la réponse de chaque modèle individuel, par défaut, sans configuration nécessaire. Le consensus change lorsque le groupe de modèles change, comme le montre le résultat de formalité japonaise de ce test : un consensus informel à la ronde 1 est devenu formel à la ronde 2.
Aucun modèle unique; l'examen humain est la meilleure réponse. Les modèles Claude ont systématiquement choisi le terme médical vietnamien plus précis, et DeepSeek V4-Pro seul a utilisé le terme juridique japonais correct, mais seulement au deuxième tour. La terminologie médicale n'a jamais été résolue de manière cohérente sur les 10 modèles, ce qui signale que l'expertise du domaine est requise, et non qu'un modèle différent devrait être choisi. Un examen de révision post-édition humaine certifiée, comme l'offre Tomedes, fournit cette vérification spécialisée.