June 5, 2026
Ik heb interne tests uitgevoerd op iets waar we het niet genoeg over hebben in de vertaalindustrie: niet of verschillende AI-systemen verschillend vertalen , maar of verschillende versies van dezelfde AI verschillend vertalen — en hoeveel.
Vorige week heb ik een enkele Spaanse idioom door vijf versies van ChatGPT tegelijkertijd op het interne testplatform van MachineTranslation.com laten lopen. Wat er terugkwam, deed me stoppen.
Twee versies produceerden een vertaling die, eerlijk gezegd, onzin is in het Engels. Drie versies leverden correcte idiomatische vertalingen op. En de drie correcte waren het niet met elkaar eens.
Alle vijf zijn ChatGPT. Alle vijf zijn OpenAI. Zelfde AI, ander model — en de resultaten konden niet meer verschillen.
Ik deel dit nu omdat ik denk dat het ertoe doet, niet omdat ik duidelijke antwoorden heb. Dat doe ik niet. Maar de observatie is interessant genoeg om de wereld in te brengen.
De zin die ik heb getest was llevarse el gato al agua.

Hier is wat elke versie produceerde:
| Model | Output | Idiomatisch? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | de kat naar het water dragen | ❌ Letterlijk |
| ChatGPT::GPT-4.1-NANO | de kat naar het water dragen | ❌ Letterlijk |
| ChatGPT::GPT-4.1-MINI | het succesvol afhandelen | ✅ Correct |
| ChatGPT::GPT-5.4-MINI | je zin krijgen | ✅ Gedeeltelijk |
| ChatGPT::GPT-5.4 | er als winnaar uitkomen | ✅ Correct |
De uitdrukking betekent iets moeilijks bereiken tegen de verwachtingen in, om een moeilijke overwinning te behalen. Het heeft niets te maken met katten of water. De letterlijke vertaling is geen vertaling. Het is een woord-voor-woord transcriptie van een zin die het model niet als een idioom herkende.
GPT-4o-MINI en GPT-4.1-NANO produceerden identieke uitvoer. Niet vergelijkbaar, identiek. Onze vertaalinzichten hebben dit direct gemarkeerd: GPT-4.1-nano en GPT-4o-mini delen identieke vertalingen, waarbij de nadruk ligt op letterlijke interpretatie boven idiomatische betekenis.
GPT-4.1-MINI, GPT-5.4-MINI en GPT-5.4 produceerden elk iets herkenbaar correct — maar niet hetzelfde als elkaar.
Ik wil precies zijn over waarom llevarse el gato al agua een nuttige testinvoer is in plaats van een willekeurig gekozen exemplaar.
Het is een gevestigde uitdrukking. Het komt voor in literatuur, journalistiek en alledaagse spraak. Het is niet obscuur. Elk model dat getraind is op een redelijke corpus van Spaanse tekst zou het moeten zijn tegengekomen. De vraag is niet of het model de zin heeft gezien. De vraag is wat het ermee doet.
De ergste faalmodus bij idiomatische vertaling is niet het produceren van een slechte vertaling. Het produceert een letterlijke vertaling die er acceptabel uitziet voor iemand die de doeltaal niet kent.
To carry the cat to the water is grammatically correct Engels. Het is goed gevormd. Het klinkt als iets dat iets zou kunnen betekenen. Een gebruiker die geen Spaans spreekt, zou het kunnen lezen, knikken en verder gaan — zonder ooit te weten dat de oorspronkelijke betekenis volledig verloren was gegaan.
Dat is de faalmodus waar ik om geef. Niet de voor de hand liggende fout. De onzichtbare.
Het patroon hier is niet willekeurig. De twee modellen die letterlijke vertalingen produceerden (GPT-4o-MINI en GPT-4.1-NANO) zijn beide kleinere, lichtere modellen die geoptimaliseerd zijn voor snelheid en kostenefficiëntie. De drie modellen die idiomatische vertalingen produceerden (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) vertegenwoordigen een andere generatie of parameterschaal.
Dit suggereert iets dat naar mijn mening onderbelicht is: idiomatische competentie in vertaling schaalt met modelcapaciteit op manieren die niet zichtbaar zijn in algemene benchmarks.
Algemene taalbenchmarks testen redenering, kennis, codering, wiskunde. Ze testen doorgaans niet of een model kan identificeren dat het regent pijpenstelen niet over weersomstandigheden gaat, of dat llevarse el gato al agua niet gaat over het hydrateren van een kat. Idioomtaal bevindt zich op het snijvlak van culturele kennis, contextuele inferentie en patroonherkenning — en dat snijvlak lijkt een drempel van modelcapaciteit te vereisen die kleinere modellen niet consistent halen.
Wat ik niet beweer: dat grotere modellen altijd betere vertalers zijn. Ik heb daar geen bewijs voor als algemene regel. Wat ik waarneem: dat voor idiomatische inhoud specifiek, de kloof tussen versies binnen de familie groter was dan ik had verwacht.
De meeste gebruikers die een AI-vertaaltool gebruiken, weten niet welke versie van die AI ze gebruiken. Ze openen een product, selecteren een taal paar en krijgen een uitvoer. De modelroutering is voor hen onzichtbaar.
}Dit is belangrijk op schaal. MachineTranslation.com verwerkte in een periode van 90 dagen meer dan honderdduizenden Engels-naar-Spaans vertaalopdrachten. Als een significant deel van die banen idiomatische inhoud betrof (marketingteksten, juridische taal, literaire teksten, informele communicatie) en de tool die die banen routeerde gebruikers zonder hun medeweten naar een kleiner model stuurde, dan verscheen de kat naar het water dragen in echte outputs, in echte documenten, voor echte mensen die het resultaat vertrouwden.
De vertaalindustrie vergelijkt al jaren AI-providers. DeepL versus Google. Claude tegen ChatGPT. Die vergelijkingen zijn nuttig. Maar binnen een enkele provider kan het versieverschil net zo significant zijn — en het is een verschil dat de meeste vergelijkingskaders niet meten omdat ze niet op modelversieniveau testen. Wanneer iemand zegt Ik gebruik ChatGPT voor vertaling, is die zin
niet specifiek genoeg om betekenisvol te zijn. Welke ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Het antwoord verandert de uitvoer op manieren die niet triviaal zijn, althans voor idiomatische inhoud.
Dit is het deel dat ik het interessantst vind, en ik heb nog niet helemaal uitgewerkt wat ik ervan moet maken.
De drie modellen die idiomatische vertalingen produceerden, gaven drie verschillende:
Alle drie zijn verdedigbare Engelse vertalingen van llevarse el gato al agua. Maar ze zijn niet equivalent.
Om het voor elkaar te krijgen benadrukt uitvoering tegenover moeilijkheid, je deed iets moeilijks en het lukte. Je zin krijgen benadrukt dat het resultaat dat je wilde werd bereikt, met minder nadruk op de moeilijkheid. "To come out on top" benadrukt een competitieve overwinning, winnen ten opzichte van anderen.
Het oorspronkelijke Spaanse idioom ligt het dichtst bij de eerste hiervan. De uitdrukking draagt de connotatie met zich mee van het overwinnen van weerstand, en niet simpelweg de voorkeur geven aan een bepaalde uitkomst en die werkelijkheid zien worden. Maar om je zin te krijgen en om er bovenop te komen zijn niet fout, ze zijn gewoon in verschillende richtingen onnauwkeurig. Dit roept een vraag op die ik echt moeilijk vind: wanneer drie modellen
elk een correcte maar verschillende idiomatische vertaling produceren, hoe beoordeel je dan welke de beste is? BLEU-scores worden vergeleken met een referentievertaaling — maar wie heeft de referentie geschreven, en welke van deze drie zouden ze hebben gekozen?
Onze AI-vertaalagent stelde, tot zijn eer, de juiste vraag voordat hij zich aan enige uitvoer committeerde: Wat is de bedoelde betekenis van 'llevarse el gato al agua' in deze context? Er werden drie opties aangeboden — een moeilijk doel bereiken, iets onnodigs nemen, of een risicovolle activiteit ondernemen. Die vraag is niet decoratief. Het is het mechanisme waarmee de contextuele ambiguïteit wordt opgelost voordat de vertaling definitief is.
Maar het punt blijft: drie correcte antwoorden, drie verschillende nuances van betekenis. Vertalingsevaluatietools zijn niet gebouwd voor dit soort nuance.
Ik wil eerlijk zijn over de beperkingen van wat deze test laat zien.
Eén idioom, één taalpaar, één dag interne tests. Dat is geen studie. Het is een observatie. Ik weet niet of dit patroon (kleinere modellen die standaard letterlijk vertalen, grotere modellen die idiomatisch vertalen) consistent geldt voor:
Ik weet ook niet of dit een stabiele eigenschap van deze modellen is of iets dat verschuift met updates en fine-tuning. Modelproviders publiceren geen vertalingsspecifieke wijzigingslogboeken. Een modelversie die llevarse el gato al agua vandaag correct vertaalt, kan volgende maand worden bijgewerkt, en we zouden het niet weten.
Wat ik wel weet: deze test leverde een resultaat op dat interessant genoeg is dat ik er meer van wil uitvoeren, systematischer, over meer taalparen en inhoudstypen. Wanneer ik meer te delen heb, zal ik dat doen.
Ik sluit af met de twee vragen die deze test bij me achterliet. Ik ga ze niet beantwoorden, ik heb de gegevens daar nog niet voor. Maar ik denk dat dit de juiste vragen zijn om te stellen.
Ten eerste: bij welke parameterdrempel wordt idiomatische competentie betrouwbaar?
De sprong van GPT-4o-MINI en GPT-4.1-NANO (beide letterlijk) naar GPT-4.1-MINI (idiomatisch) suggereert dat er ergens een drempel is in het parameterbereik tussen die modelgroottes waar idiomatische herkenning inschakelt. Is het consistent? Is het van toepassing op uitdrukkingen in alle talen, of hangt het ervan af hoe goed een taal vertegenwoordigd is in de trainingsgegevens? Ik weet het niet. Maar weten zou nuttig zijn voor iedereen die vertaalworkflows bouwt.
Ten tweede: wat kost modelversie-ondoorzichtigheid gebruikers op schaal?
Als een gebruiker 1.000 documenten per maand via een tool stuurt die niet bekendmaakt welke modelversie wordt gebruikt (en sommige van die documenten bevatten idiomatische inhoud), hoe vaak gebeurt de letterlijke mislukking dan onzichtbaar? Hoe zouden ze dat weten? Wat is de kosten, in reële termen, van nooit te weten te komen?
Ik denk dat dit een belangrijkere vraag is dan de meeste van de welke AI is het beste voor vertaling vergelijkingen die momenteel circuleren. Het antwoord is niet gebruik het grootste model. Het antwoord zou kunnen zijn: weet wat je gebruikt, voer je eigen tests uit op je eigen inhoud, en ga er niet van uit dat de naam van de ene provider een garantie is voor consistent gedrag binnen hun model bereik.
Dat is, althans, wat ik uit deze test haal.
Op basis van deze enkele test: kleinere, efficiëntie-geoptimaliseerde modellen binnen dezelfde AI-familie vertaalden standaard letterlijk een gevestigde Spaanse uitdrukking, terwijl grotere/nieuwere versies van hetzelfde model correcte idiomatische vertalingen produceerden. Of dit geldt voor idiomatische categorieën en taalparen, is de volgende vraag. Ik zal meer tests uitvoeren.
GPT-4.1-MINI, GPT-5.4-MINI en GPT-5.4 vertaalden llevarse el gato al agua idiomatisch — maar naar verschillende Engelse uitdrukkingen met subtiel verschillende connotaties. Dit suggereert dat de kwaliteit van idiomatische vertaling ten minste twee dimensies heeft: of het model de uitdrukking überhaupt herkent, en welke equivalente uitdrukking het selecteert uit de beschikbare opties van de doeltaal. Standaard vertaalkwaliteitsmetrieken scheiden deze twee dimensies niet duidelijk. Ik denk dat ze dat zouden moeten doen.
Deze post is gebaseerd op interne tests op het ontwikkelplatform van MachineTranslation.com. De hier getoonde multi-model versie testen is nog niet publiekelijk beschikbaar. Ik deel de bevinding omdat ik denk dat de observatie nuttig is, ongeacht waar u uw vertalingen uitvoert.