June 10, 2026
Je veux partager quelque chose que nous avons décidé cette semaine — non pas après son déploiement, mais pendant que nous sommes encore en train de le développer.
Nous modifions la façon dont les modèles d'IA sont répartis entre nos paliers d'utilisateurs. Les utilisateurs payants de MachineTranslation.com auront bientôt accès à des modèles d'IA plus avancés des principaux fournisseurs — OpenAI, Anthropic, Google, DeepSeek, et d'autres. Les utilisateurs gratuits continueront de bénéficier d'une traduction performante et fiable — mais pas des mêmes modèles. Cet écart est intentionnel, et je veux expliquer exactement pourquoi nous prenons cette décision.
Je préfère l'écrire maintenant, tant que le raisonnement est frais et que la décision est encore un peu à vif, plutôt que d'attendre que ce soit lancé et de le présenter comme une annonce peaufinée. La version honnête est plus utile.
MachineTranslation.com traduit avec 22 modèles d'IA simultanément et utilise une approche basée sur le consensus pour afficher le meilleur résultat. Cela a toujours été au cœur de ce que nous faisons — ne pas tout miser sur un seul modèle, mais comparer plusieurs modèles et laisser les résultats parler d'eux-mêmes.
Le côté inconfortable de cette approche est qu'elle rend les différences de qualité entre les modèles très visibles. Nous voyons, chaque jour, que tous les modèles ne traitent pas tous les textes aussi bien. Et pendant longtemps, nous n'avons pas laissé cette observation changer la façon dont nous attribuions les modèles aux utilisateurs.
Il y a quelques semaines, Rachelle (notre cheffe de l'IA) nous a présenté un outil interne que nous avions développé pour tester la qualité de la traduction sur plusieurs modèles GPT simultanément — y compris GPT 4.1 nano, GPT 4.1 mini, GPT 5.4 mini, et d'autres. Vous entrez le même texte source, et vous voyez la sortie de chaque modèle côte à côte.
Ce que cet outil rend immédiatement clair, c'est ceci : sur des textes simples, courts et de tous les jours, les sorties sont presque identiques. On ne peut sincèrement pas justifier un argument de qualité pour les modèles haut de gamme pour « la réunion est à 15h ».
Mais pour tout ce qui présente une réelle complexité linguistique (phrasé idiomatique, terminologie de domaine, documents longs où le contexte doit être maintenu sur des milliers de mots), l'écart entre les modèles s'élargit, et cet écart se manifeste de manières qui sont importantes sur le plan professionnel.
C'est le point que, à mon avis, l'industrie de la traduction n'aborde pas assez honnêtement. Les modèles de niveau inférieur ne produisent généralement pas de traductions manifestement erronées. Ils produisent des traductions qui semblent correctes en surface, mais qui contiennent des erreurs subtiles qu'un expert en la matière (un avocat, un professionnel de la santé, un gestionnaire principal de la localisation) détecterait immédiatement.
Une clause conditionnelle rendue avec le mauvais sens. Un terme juridique qui signifie quelque chose de spécifique dans cette juridiction, traduit par son équivalent courant. Une dérive de registre à mi-chemin d'un long document qui sape la crédibilité professionnelle de l'ensemble.
L'échec est discret. Et les échecs silencieux en traduction professionnelle peuvent être coûteux.
Nous n'avons pas pris cette décision basée sur l'intuition. Nous avons fait tourner les modèles sur des textes sources complexes et idiomatiques (le genre de contenu que nos utilisateurs professionnels ont réellement besoin de faire traduire) et nous avons demandé à des linguistes d'évaluer les résultats.
Le résultat était clair. Les modèles avancés géraient constamment mieux la nuance, le registre et la terminologie spécifique au domaine. Les modèles moins chers étaient amplement suffisants pour un usage occasionnel. Les deux cas d'utilisation nécessitent réellement des outils différents.

La conversation que cela a suscitée en interne portait moins sur les prix et plus sur l'honnêteté. Si nous savons que les modèles fonctionnent différemment sur du contenu de qualité professionnelle, et que nos utilisateurs payants traduisent en grande partie du contenu de qualité professionnelle, alors leur donner le même modèle qu'un utilisateur gratuit qui traduit un courriel occasionnel est un déservice pour les deux.
Ofer (notre PDG) l'a dit clairement lors de notre discussion interne :
Les modèles de niveau inférieur comportent de réels risques de qualité sur des textes complexes ou idiomatiques. Mais le point le plus important est le suivant : le consensus n'est aussi bon que les modèles qui le sous-tendent. Lorsque les utilisateurs payants obtiennent des modèles plus avancés, ils n'obtiennent pas seulement de meilleurs résultats individuels — ils obtiennent un consensus plus solide. De meilleurs modèles, un meilleur consensus, des traductions plus fiables. C'est ce que signifie réellement une traduction de qualité professionnelle.
Cette façon de voir les choses m'est restée. Ce n'est pas juste un argument de coût. C'est un argument de clarté.
Les modèles d'IA plus performants coûtent significativement plus cher par jeton à exécuter. Ce n'est pas une politique de MachineTranslation.com, c'est comme ça que tous les grands fournisseurs d'IA tarifient leurs modèles phares. OpenAI, Anthropic, Google et DeepSeek réservent tous leurs modèles les plus récents et les plus performants à leurs clients payants, car ces modèles sont considérablement plus coûteux à exploiter. Exécuter notre modèle le plus avancé pour chaque traduction gratuite, chaque requête occasionnelle, chaque demande du type « que dit ce panneau », gonflerait considérablement nos coûts d'infrastructure.
Plus important encore, cela signifierait subventionner de manière croisée les cas d'utilisation à faible complexité avec le budget de calcul dont nous avons besoin pour maintenir la qualité pour les professionnels qui traduisent des documents techniques de 10 000 mots. Ce n'est pas une allocation durable ou judicieuse.
Il existe une version de cette décision qui est purement mercenaire — facturer plus, donner plus, c'est simple. Ce n'est pas réellement ce qui le motive.
Ce qui le motive, c'est que nous avons bâti une plateforme qui peut véritablement faire ressortir les différences de qualité entre les modèles d'IA. Nous avons l'outillage interne pour voir clairement ces différences. Choisir d'ignorer cette visibilité lors de la conception de nos paliers d'utilisateur serait une forme de malhonnêteté, prétendre que l'écart n'existe pas alors que nous avons des preuves de son existence.
Les utilisateurs gratuits méritent de savoir ce qu'ils obtiennent. Les utilisateurs payants méritent de savoir qu'ils obtiennent quelque chose de significativement différent. Et la différence n'est pas seulement l'accès à des modèles plus avancés, c'est l'accès à un consensus plus fort bâti à partir de ces modèles. C'est le signal de fiabilité qu'aucune IA seule ne peut fournir.
Nous sommes encore en train de peaufiner les détails de la mise en œuvre, je veux donc faire attention à ne pas promettre trop de choses précises. Mais voici l'orientation.
Les traductions du forfait gratuit continueront d'utiliser des modèles d'IA performants. Pour la majorité des tâches de traduction quotidiennes (messages courts, lecture occasionnelle, correspondance de base), les utilisateurs gratuits obtiendront des résultats précis et fiables. Ça ne changera pas.
Le niveau gratuit existe parce que nous croyons que la langue ne devrait pas être une barrière, et nous ne reviendrons pas là-dessus.
La différence sera la plus visible pour :
| Type de contenu | Pourquoi la qualité du modèle est importante ici |
|---|---|
| Documents juridiques et financiers | Clauses conditionnelles, terminologie spécifique à la juridiction, cohérence du registre |
| Documentation technique | Vocabulaire spécifique au domaine, cohérence des documents longs |
| Textes médicaux et cliniques | Précision, registre, sensibilité à l'ambiguïté |
| Contenu marketing et de marque | Traitement idiomatique, exactitude du ton, résonance culturelle |
| Paires de langues à faibles ressources | Des données d'entraînement moins nombreuses entraînent des écarts de qualité de modèle plus importants |
| Documents longs (plus de 5 000 mots) | Rétention du contexte, cohérence sur l'ensemble du document |
Pour les utilisateurs professionnels travaillant dans l'une de ces catégories, le niveau de modèle fera une réelle différence. C'est exactement pour eux que nos forfaits payants sont conçus.
Et parce que le consensus de SMART est bâti à partir de ces modèles plus avancés, les utilisateurs payants n'obtiennent pas seulement de meilleures sorties individuelles — ils obtiennent une traduction IA plus fiable, générée par les derniers modèles travaillant ensemble.
Je veux être honnête : tout n'est pas encore résolu.
Nous sommes encore en train de déterminer l'allocation exacte des modèles — quels modèles se trouvent à quel niveau, et comment nous communiquons cela clairement aux utilisateurs à l'intérieur du produit. Nous travaillons sur la logique du mur de paiement pour nous assurer que l'expérience est fluide et sans heurts. Et nous réfléchissons attentivement à la manière de présenter aux utilisateurs les informations sur la qualité du modèle d'une façon qui soit réellement utile plutôt qu'une simple allégation marketing.
Il y a aussi une question importante que nous nous posons : comment aider un utilisateur gratuit à comprendre, sur le moment, quand il a atteint un cas d'utilisation où la mise à niveau améliorerait considérablement son résultat? C'est un défi UX autant qu'un défi produit, et nous n'avons pas encore la réponse complète.
J'écrirai sur la façon dont ça se déroule une fois que ce sera en ligne. Pour l'instant, voici notre réflexion.
Si vous êtes un utilisateur payant et que vous voulez donner votre avis sur ce qui compte le plus pour vous en matière de qualité du modèle, je suis sincèrement intéressé. Laissez un message via la page de contact de MachineTranslation.com.
Parce que nos tests internes ont révélé un écart de qualité significatif entre les niveaux de modèles pour les tâches de traduction de niveau professionnel. Nous avons développé un outil pour comparer plusieurs modèles d'IA simultanément, et les données ont clairement démontré que les modèles avancés gèrent nettement mieux le contenu complexe, idiomatique et spécifique à un domaine. Le changement de palier reflète honnêtement cette réalité. Le plus grand avantage pour les utilisateurs payants est que le consensus SMART est bâti à partir de modèles plus avancés, ce qui signifie que le signal de fiabilité lui-même est plus fort.
Non. Les utilisateurs du forfait gratuit continueront d'obtenir des traductions performantes et précises pour les cas d'utilisation courants. Le changement est que les utilisateurs payants seront mis à niveau vers des modèles plus avancés, et non que les utilisateurs gratuits seront rétrogradés.
Les documents juridiques, financiers, médicaux, techniques et longs — et tout contenu dans des paires de langues moins courantes où les données d'entraînement sont moins abondantes. Pour les textes courts, simples et quotidiens, la différence entre les paliers de modèle est minimale. Le plus grand avantage pour les utilisateurs payants est que le consensus SMART est bâti à partir de modèles plus avancés, ce qui signifie que le signal de fiabilité lui-même est plus fort.
Nous sommes en train de le développer. Je publierai une mise à jour quand il sera lancé, y compris ce à quoi ressemble l'expérience dans le produit et ce que les premières données montrent.
Nous exécutons plusieurs modèles simultanément et utilisons une approche de notation basée sur le consensus pour évaluer les résultats. Notre outil de comparaison interne nous permet de tester la qualité entre les différentes catégories de modèles sur le même texte source, c'est ce qui a motivé cette décision de classification. Vous pouvez en apprendre davantage sur la façon dont le système de consensus MachineTranslation.com.com fonctionne.