July 10, 2026
Deux mots. Six modèles. Trois décisions de traduction différentes. Voici ce qui s'est passé quand j'ai fait passer 8 phrases de test à travers les derniers modèles d'IA disponibles sur MachineTranslation.com, et ce que les résultats révèlent réellement sur le moment où un modèle échoue silencieusement.
Deux mots. C'est malade. Six modèles. Trois décisions de traduction distinctes.
En japonais, un modèle l'a rendu comme それはやばい, préservant l'ambiguïté. Un autre a entièrement supprimé le pronom sujet et a écrit la forme nue やばい, la version la plus familière possible. Un tiers a écrit それはすごい, ce qui résout complètement l'ambiguïté en faveur d'« incroyable », supprimant le double sens qui rendait la phrase intéressante en premier lieu. En vietnamien, un modèle a écrit Đỉnh vậy (argot, correct pour le registre jeunesse). Un autre a écrit C'est vraiment merveilleux, grammaticalement correct, mais plus proche de dire « c'est vraiment merveilleux » quand quelqu'un vous envoie un mème par texto.
Tous ces éléments sont défendables. Aucun d'eux n'est la même chose. Et si vous exécutez des traductions via un seul modèle, vous ne verrez jamais le choix qui a été fait en votre nom.
C'est la question centrale à laquelle cet article tente de répondre. Non pas quel modèle d'IA est le meilleur pour la traduction en 2026 (la réponse dépend de la paire linguistique, du registre, du domaine et de la structure de la phrase), mais plutôt : comment sauriez-vous quand votre modèle a fait le mauvais choix ? Surtout dans des domaines comme la terminologie médicale, les contrats juridiques ou la formalité professionnelle, où le mauvais choix ressemble exactement à une traduction correcte jusqu'à ce qu'un spécialiste la lise.
Voici ce que j'ai fait. J'ai soumis 8 phrases de test à deux séries de modèles sur MachineTranslation.com : d'abord une ligne de base de 5 modèles largement utilisés, puis un ensemble élargi qui ajoute plusieurs des variantes de modèles premium les plus récentes désormais disponibles pour les utilisateurs payants. Normalement, comparer les résultats de modèles comme celui-ci signifierait des abonnements payants distincts auprès de chaque fournisseur individuellement. Sur MachineTranslation.com, ils se trouvent dans la même vue de comparaison. Les paires de langues étaient l'anglais→le japonais et l'anglais→le vietnamien. Les catégories de phrases ont été choisies spécifiquement pour tester les domaines où le désaccord des modèles est le plus conséquent : les expressions idiomatiques, la terminologie juridique, la terminologie médicale, le contexte sensible à la formalité et l'ambiguïté sémantique délibérée.
Une note sur la méthodologie d'évaluation : la recherche en traduction automatique a longtemps débattu de la façon de noter automatiquement les résultats. Des métriques comme BLEU et COMET telles que mesurées dans les tâches partagées de WMT fournissent un signal agrégé utile, mais elles sont mauvaises pour détecter les erreurs de registre, les défaillances d'idiomes et la précision terminologique, exactement les catégories qui importent le plus ici. Ce que vous êtes sur le point de lire est une analyse de résultats, non une course BLEU.

Pas chaque phrase ne fait surface d'un désaccord significatif. Deux des huit tests, « Prenons contact une fois que la poussière retombe sur cette affaire » (→ Japonais) et « Nous travaillons d'arrache-pied pour respecter cette date de lancement » (→ Vietnamien), ont produit un accord élevé dans les deux séries. Les idiomes ont été correctement compris comme des idiomes. Personne n'a traduit « touch base » comme le fait de toucher une base physique. Personne n'a traduit « the dust settles » par sediment qui tombe.
Cela vaut la peine de s'y arrêter : le langage commercial idiomatique anglais est raisonnablement bien traité par les modèles de frontier actuels lorsque l'idiome est suffisamment courant. Le consensus pour « touch base » est resté stable dans les deux séries ; la variation était purement stylistique, autour du choix d'utiliser この件 (cette affaire), この取引 (cet accord), ou この案件 (ce dossier) pour la phrase source.

Le test « travailler tard dans la nuit » est là où les choses sont devenues plus intéressantes. Tous les modèles sauf un ont correctement compris l'idiome. MiniMax M2.7, introduit au Round 2, a traduit littéralement « burning » en produisant đốt đuốc, ce qui signifie « torches brûlantes ». Le consensus l'a correctement exclu.

Le japonais est une langue à couches de formalité. Le choix de la terminaison verbale, du pronom et de la forme du nom référentiel n'est pas stylistique. Cela signale la relation entre le locuteur et le destinataire. Envoyer un message à votre PDG en utilisant des formes verbales informelles n'est pas une erreur de traduction au sens grammatical. C'est une erreur sociale, et une erreur importante.
Pouvez-vous m'envoyer cela ? Merci, j'apprécie. Contexte : envoyer un message à un PDG.

Le consensus a changé lorsque le pool de modèles s'est élargi. Le mécanisme est simple : l'ajout de modèles qui lisaient correctement le contexte de formalité a fait basculer la majorité, et le consensus a suivi. Voici le spectre complet de ce que les modèles ont produit au Tour 2:

Le test de registre vietnamien a mis en évidence un type d'erreur de formalité différent, celui qui est plus subtil. La phrase source : "Hé, une petite question — tu es libre pour un appel ?" Contexte : envoi d'un message à un client. Qwen dans le Round 1 a inclus « mình », un pronom à la première personne qui implique une amitié de pairs casual. Tous les autres modèles ont entièrement évité l'autoréférence à la première personne, ce qui est le choix professionnel le plus sûr. De manière cruciale, Qwen a corrigé cela au Round 2 et a supprimé « mình ». Le consensus dans les deux tours l'a exclu.

La phrase d'indemnisation vendeur/client est une clause standard dans les accords commerciaux : "Le fournisseur devra indemniser le client contre toute réclamation de tiers résultant d'une violation de cet accord."
Au tour 1, les cinq modèles ont correctement identifié le registre juridique et utilisé les emprunts ベンダー (fournisseur) et クライアント (client), standards dans les contrats commerciaux japonais d'origine anglaise. Une exception : GPT-4.1-NANO a utilisé 販売者 (seller) et 顧客 (customer), des mots japonais légitimes qui manquent de la spécificité juridique formelle des équivalents d'emprunt linguistique.
La découverte la plus importante a émergé au cours de la deuxième manche. La distinction clé est entre deux mots:
Ce sont des concepts juridiquement différents. "Indemnify" spécifiquement signifie protéger une partie de la responsabilité envers les tiers. 免責 est le terme juridique correct. Tous les modèles de Round 1 utilisaient 補償. Au Round 2, DeepSeek V4-Pro était le seul modèle à produire 免責, et il l'a fait au Round 2 uniquement, pas au Round 1.

Dans un contrat, 補償 et 免責 ne sont pas des synonymes. Un signifie « nous vous rembourserons ». L'autre signifie « vous êtes protégé de la réclamation dès le départ ». Si une plateforme de traduction utilise 補償 où 免責 est correct, un avocat lisant la version japonaise ne verra pas le même accord que celui décrit dans la version anglaise.
C'est la découverte la plus importante de l'ensemble de données. La phrase de test : Ce médicament est contre-indiqué chez les patients ayant des antécédents d'insuffisance hépatique. Source : documentation de produit clinique. Cible : Vietnamien.
Le terme critique est « insuffisance hépatique ». Il y a deux candidats vietnamiens:
Ces sont cliniquement distincts. Une mise en garde de contre-indication basée sur « l'insuffisance hépatique » s'applique à toute personne ayant une fonction hépatique réduite, et non seulement à ceux qui ont connu une défaillance complète de l'organe. L'utilisation de suy gan rétrécit incorrectement la population indiquée. Un patient atteint d'une insuffisance hépatique modérée qui lit « suy gan » pourrait ne pas se reconnaître comme la population contre-indiquée.

Certaines phrases sources sont ambiguës par conception. « C'est dégueulasse » dans l'argot anglais contemporain signifie quelque chose d'excellent, mais cela conserve aussi son sens littéral (c'est-à-dire répugnant/dégoûtant), et la tension entre ces deux significations fait partie de la façon dont l'expression communique. Le défi pour un modèle de traduction est : préservez-vous l'ambiguïté, la réduisez-vous au sens le plus probable, ou en choisissez-vous une et vous y engagez-vous ?


Les modèles de ce test ne sont pas tous équivalents. Ils couvrent différentes architectures, régimes d'entraînement et contextes de déploiement. La ligne de base du Round 1 inclut des modèles largement accessibles. Le pool étendu de la Ronde 2 ajoute plusieurs des variantes de modèles premium les plus récentes désormais disponibles pour les utilisateurs payants sur MachineTranslation.com, le même niveau de modèle qui signifierait autrement un compte payant séparé auprès de chaque fournisseur individuel.

Le pool étendu de la Ronde 2 comprend des modèles plus avancés et disponibles pour les utilisateurs payants sur MachineTranslation.com. L'effet de l'expansion du pool n'est pas uniforme. Dans certains tests (formalité/japonais), cela a décalé le consensus de manière significative. Chez d'autres (terminologie médicale/vietnamien), la division s'est approfondie.

Les données de test pointent vers deux catégories d'échec distinctes, et elles nécessitent des réponses différentes.
Catégorie A: Défaillances silencieuses. Erreurs de formalité, erreurs de registre, précision de la terminologie médicale : ces éléments produisent des résultats qui semblent corrects. Le japonais est grammatical. Le Vietnamien est courant. Il n'y a aucun signal de surface indiquant que quelque chose s'est mal passé. Un utilisateur monolingue lisant la sortie d'un seul modèle n'a aucun moyen de savoir que le modèle a fait un choix de registre qu'un cadre supérieur japonais remarquerait, ou qu'un terme clinique a été restreint d'une manière qui change la population à laquelle il s'applique.
Catégorie B: Défaillances visibles. MiniMax traduisant « burning the midnight oil » par « burning torches ». GPT-4.1-NANO résolvant "That's sick" en "すごい" sans ambiguïté. Ceux-ci sont détectables, soit par un locuteur de la langue cible, soit par comparaison avec d'autres résultats de modèles.
La comparaison multi-modèles que SMART fournit est la plus précieuse dans la catégorie A. Lorsque cinq ou dix modèles produisent des résultats et que la plupart s'accordent sur un registre formel tandis qu'un seul produit du japonais en langage courant décontracté, le désaccord est visible dans la vue de comparaison. Un utilisateur qui parle la langue cible peut évaluer les options. Un utilisateur qui ne peut pas voir qu'une décision contestée a été prise peut décider si cette phrase justifie un examen humain.
Pour les travaux à l'échelle du document, les fichiers volumineux, la traduction préservant la mise en page des PDF, des contrats ou des matériaux cliniques, la capacité de traitement des documents de la plateforme gère la structure des fichiers sans casser la mise en forme. Mais les questions de qualité soulevées ci-dessus s'appliquent indépendamment de la taille du fichier. Une étude clinique de 100 pages où chaque instance d'« insuffisance hépatique » est traduite par « défaillance hépatique » est une version plus grande du même problème identifié dans le Test 2.
Pour les catégories médicale et juridique spécifiquement, la vérification humaine est le bon mécanisme de contrôle. Le service de post-édition IA de Tomedes, qui associe la sortie IA à un examen humain certifié pour exactement ce type de contenu à enjeux élevés, est conçu pour cela. La division suy gan / suy giảm chức năng gan est exactement le type de résultat qui devrait déclencher cet examen, non pas parce que tous les modèles sont erronés, mais parce que les modèles les plus confiants ne sont pas les plus précis.
L'intérêt de voir plusieurs résultats n'est pas que vous choisirez toujours la majorité. C'est que vous saurez qu'un choix a été fait, ce qui est différent de supposer que le résultat devant vous est correct.

Mettez les huit tests côte à côte et un motif se maintient : l'accord et le désaccord ne sont pas distribués au hasard. Le langage commercial idiomatique et quotidien (« prendre contact », « travailler tard dans la nuit ») a convergé dans presque tous les modèles de l'ensemble, dans les deux tours. La formalité, la précision juridique et la terminologie médicale ne l'ont pas fait. Le test de formalité du PDG n'a basculé du registre décontracté au registre formel qu'une fois que le groupe élargi a été inclus. La clause d'indemnisation a mis en évidence une véritable distinction juridique (exonération de responsabilité vs. indemnisation) qu'un seul modèle, dans un seul tour, a correctement identifiée. La division de la terminologie médicale ne s'est jamais résolue du tout, restant à peu près 6 contre 4 dans les deux rounds indépendamment des modèles qui étaient dans le pool.
C'est la conclusion réelle, pas une affirmation marketing : le consensus ne rend pas chaque phrase meilleure, et il n'a pas besoin de le faire. C'est plus précieux exactement là où la fluidité d'un seul modèle ne vous donne aucune raison d'en douter, et où se tromper coûte réellement quelque chose.
Il y a une deuxième couche, plus pratique, à ce test qui vaut la peine d'être énoncée clairement. Effectuer cette comparaison moi-même signifiait vérifier les résultats de GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo et MiniMax M2.7 côte à côte avec les modèles de base existants, en un seul endroit, sur une seule plateforme. En dehors de MachineTranslation.com, ce n'est pas un seul abonnement. C'est plusieurs, un pour chaque fournisseur dont vous voulez tester le niveau premium, à quel que soit le prix que chaque fournisseur facture individuellement. Les utilisateurs payants ici obtiennent cette même comparaison en un clic, à une fraction du coût du maintien de cinq abonnements premium distincts, sans renoncer à ce qui compte vraiment : voir où les modèles s'accordent et savoir exactement quand ils ne s'accordent pas.
Aucun n'est catégoriquement meilleur ; cela dépend de la catégorie de test. Claude Sonnet et Claude Opus ont systématiquement choisi le terme médical vietnamien plus précis, et Claude Opus a produit l'argot le plus approprié pour « C'est malade. » Mais Claude Sonnet a également produit du japonais casual dans une phrase de contexte formel de PDG, où GPT-5.5 l'a bien compris. Comparer les résultats directement est plus défendable que de choisir un modèle et de lui faire confiance.
Il n'en existe pas ; la précision dépend du domaine. Gemini 3.5-Flash et GLM-5-Turbo ont produit le japonais formel le plus approprié dans ce test. Les deux modèles Claude ont été les plus précis sur la terminologie médicale vietnamienne. DeepSeek V4-Pro était le seul modèle à utiliser le terme juridique japonais correct, mais seulement au Round 2, et il a produit du japonais décontracté ailleurs. Aucun modèle unique n'a dominé dans les huit tests.
Non, pas automatiquement. L'élargissement du pool avec des variantes de modèles de niveau premium plus récentes a fait basculer le consensus du registre casual au registre formel dans le test de formalité japonaise. Mais dans le test de terminologie médicale vietnamienne, la division a persisté à environ 6 contre 4, indépendamment des modèles inclus. Plus de modèles font surface plus de désaccord, ce qui est un signal utile, mais le consensus suit toujours la majorité, et la majorité n'est pas toujours la réponse la plus précise.
SMART est le système de consensus multi-modèle de MachineTranslation.com, couvrant jusqu'à 22 modèles d'IA provenant de fournisseurs incluant OpenAI, Anthropic, Google et DeepSeek. Il exécute une traduction via plusieurs modèles simultanément et affiche la sortie du consensus majoritaire aux côtés de la réponse de chaque modèle individuel, par défaut, sans configuration nécessaire. Le consensus change lorsque le pool de modèles change, comme le montre le résultat de formalité japonaise de ce test : un consensus informel au Round 1 est devenu formel au Round 2.
Aucun modèle unique ; l'examen humain est la meilleure réponse. Les modèles Claude ont systématiquement choisi le terme médical vietnamien plus précis, et DeepSeek V4-Pro seul a utilisé le terme juridique japonais correct, mais seulement au deuxième tour. La terminologie médicale divisée n'a jamais été résolue sur les 10 modèles, ce qui signale que l'expertise du domaine est requise, et non qu'un modèle différent devrait être choisi. Un examen de post-édition humaine certifiée, comme celui proposé par Tomedes, fournit cette vérification spécialisée.