July 10, 2026
Twee woorden. Zes modellen. Drie verschillende vertaalkeuzes. Hier is wat er gebeurde toen ik 8 testzinnen door de nieuwste AI-modellen op MachineTranslation.com liet gaan, en wat de outputs eigenlijk onthullen over wanneer een model stil faalt.
Twee woorden. Dat is ziek. Zes modellen. Drie verschillende vertaalbeslissingen.
In het Japans werd het in één model weergegeven als それはやばい, waarbij de dubbelzinnigheid behouden bleef. Een ander liet het onderwerpsvoornaamwoord volledig weg en schreef de basisvorm やばい, de meest informele versie die mogelijk is. Een derde schreef それはすごい, wat de dubbelzinnigheid volledig oplost ten gunste van "verbazingwekkend," en zo de dubbele betekenis verwijdert die de zin interessant maakte. In het Vietnamees schreef één model Đỉnh vậy (slang, correct voor jeugjargon). Een ander schreef Thật tuyệt vời, grammaticaal correct, maar dichter bij "dat is werkelijk wonderbaarlijk" wanneer iemand je een meme stuurt.
Al deze opties zijn verdedigbaar. Geen van hen zijn hetzelfde. En als je vertalingen door een enkel model laat uitvoeren, zul je nooit de keuze zien die namens jou is gemaakt.
Dat is de centrale vraag die dit artikel probeert te beantwoorden. Niet welk AI-model het beste is voor vertaling in 2026 (het antwoord hangt af van taalenpaar, register, domein en zinsstructuur), maar eerder: hoe zou je weten wanneer je model de verkeerde keuze maakte? Vooral in domeinen zoals medische terminologie, juridische contracten of professionele formaliteit, waar de verkeerde keuze er exact hetzelfde uitziet als een correcte vertaling totdat een specialist het leest.
Dit is wat ik deed. Ik heb 8 testzinnen door twee ronden modellen op MachineTranslation.com gehaald: eerst een baseline van 5 veel gebruikte modellen, vervolgens een uitgebreid aanbod dat verschillende nieuwe premium-tier modelvarianten toevoegt die nu beschikbaar zijn voor betalende gebruikers. Normaal gesproken zou het vergelijken van outputs van modellen als deze afzonderlijke betaalde abonnementen bij elke provider afzonderlijk betekenen. Op MachineTranslation.com zitten ze in dezelfde vergelijkingsweergave. De taalparen waren Engels→Japans en Engels→Vietnamees. De zinsategorieën werden specifiek gekozen om probleemgebieden onder druk te testen waar modelonenigheid het meest gevolgen heeft: idiomatische uitdrukkingen, juridische terminologie, medische terminologie, formaliteitsgevoelige context en opzettelijke semantische ambiguïteit.
Een opmerking over evaluatiemethodologie: onderzoek naar machinevertaling heeft zich lange tijd afgevraagd hoe outputs automatisch kunnen worden gescoord. Metrieken zoals BLEU en COMET zoals gemeten in WMT-gedeelde taken geven nuttig geaggregeerd signaal, maar ze zijn slecht in staat om registerfouten, idiomatische fouten en terminologische precisie op te sporen, precies de categorieën die hier het meest van belang zijn. Wat je op het punt staat te lezen is output analyse, geen BLEU race.

Niet elke zin brengt een zinvol meningsverschil aan het licht. Twee van de acht tests, "Let's touch base once the dust settles on this deal" (→ Japans) en "We're burning the midnight oil to hit this launch date" (→ Vietnamees), produceerden hoge overeenstemming in beide rondes. De idiomen werden correct begrepen als idiomen. Niemand vertaalde "touch base" als het aanraken van een fysieke basis. Niemand heeft "the dust settles" vertaald als sediment dat valt.
Dit is het waard om even bij stil te staan: idiomatische Engels zakentaal wordt redelijk goed verwerkt door huidige geavanceerde modellen wanneer het idioom gemeenschappelijk genoeg is. De consensus voor "touch base" bleef stabiel in beide rondes; variatie was zuiver stilistisch, rond de vraag of je deze kwestie (deze zaak), deze deal (deze transactie), of deze zaak (deze casus) voor de bronzin zou gebruiken.

De test "tot middernacht doorwerken" is waar het interessanter werd. Elk model behalve één begreep het idioom correct. MiniMax M2.7, geïntroduceerd in Ronde 2, vertaalde "burning" letterlijk, wat " đốt đuốc" opleverde, wat "brandende fakkels" betekent. De consensus heeft het correct uitgesloten.

Het Japans is een taal met formaliteitsniveaus. De keuze van werkwoordsvorm, voornaamwoord en referentiële zelfstandig naamwoord is niet stilistisch. Het signaleert de relatie tussen spreker en ontvanger. Een bericht naar je CEO sturen met informele werkwoordsvormen is in grammaticale zin geen vertaalfout. Het is een sociale fout, en een belangrijke.
Kun je dat doorsturen? Dank je, ik waardeer het." Context: messaging aan een CEO.

De consensus verschoof toen de modelgroep uitbreidde. Het mechanisme is eenvoudig: het toevoegen van modellen die de formaliteitscontext correct lazen, verschoof de meerderheid, en de consensus volgde. Hier is het volledige spectrum van wat de modellen in Ronde 2 hebben opgeleverd:

De Vietnamese registertest bracht een ander soort formaliteitsfout aan het licht, een die subtieler is. De brontekst: "Hé, snelle vraag — ben je vrij om even te bellen?" Context: een bericht naar een klant sturen. Qwen in Ronde 1 gebruikte "mình," een eerste-persoonsvormwoord dat een informele vriendschap op gelijkvoetige basis impliceert. Elk ander model vermeed volledig zelfverwijzing in de eerste persoon, wat de veiligere professionele keuze is. Cruciaal is dat Qwen dit in Ronde 2 corrigeerde en "mình" liet vallen. De consensus in beide rondes sloot het uit.

De leverancier/klant schadevergoedingsclausule is een standaardclausule in commerciële overeenkomsten: "De leverancier zal de klant vrijwaren tegen alle vorderingen van derden voortvloeiend uit schending van deze overeenkomst."
In Ronde 1 identificeerden alle vijf modellen correct het juridische register en gebruikten de leenwoorden ベンダー (leverancier) en クライアント (klant), standaard in Japanse handelscontracten van Engelse oorsprong. Één uitzondering: GPT-4.1-NANO gebruikte 販売者 (seller) en 顧客 (customer), legitieme Japanse woorden die de formele juridische specificiteit van de geleende woordequivalenten missen.
De belangrijkere bevinding kwam naar voren in Ronde 2. Het belangrijkste onderscheid is tussen twee woorden:
Dit zijn juridisch verschillende concepten. "Indemnify" specifiek betekent een partij tegen aansprakelijkheid van derden te beschermen. 免責 is de juiste juridische term. All Round 1 modellen gebruikten 補償. In Ronde 2 was DeepSeek V4-Pro het enige model dat 免責 produceerde, en dit gebeurde alleen in Ronde 2, niet in Ronde 1.

In een contract zijn 補償 en 免責 geen synoniemen. Één betekent "we zullen je terugbetalen." De ander betekent "je bent van het begin af aan beschermd tegen de vordering." Als een vertaalplatform 補償 gebruikt waar 免責 correct is, zal een advocaat die de Japanse versie leest niet dezelfde overeenkomst zien die de Engelse versie beschrijft.
Dit is de meest consequente bevinding in de dataset. De testzin: "Dit medicijn is gecontraïndiceerd bij patiënten met een voorgeschiedenis van leveraantasting." Bron: klinische productdocumentatie. Doel: Vietnamese.
De kritieke term is "hepatische aandoening." Er zijn twee Vietnamese kandidaten:
Deze zijn klinisch duidelijk onderscheiden. Een waarschuwing voor contra-indicatie op basis van "hepatische aantasting" is van toepassing op iedereen met verminderde leverfunctie, niet alleen op degenen die volledig orgaanfalen hebben ondergaan. Het gebruik van suy gan beperkt de aangegeven populatie onjuist. Een patiënt met matige leveraantasting die "suy gan" leest, zou zichzelf mogelijk niet herkennen als de gecontraïndiceerde populatie.

Sommige bronzinnen zijn opzettelijk dubbelzinnig. "Dat is ziek" in hedendaags Engels slang betekent iets uitstekends, maar het draagt ook nog steeds zijn letterlijke betekenis met zich mee (dat wil zeggen walgelijk/vies), en de spanning tussen deze twee betekenissen is onderdeel van hoe de uitdrukking communiceert. De uitdaging voor een vertaalmodel is: behoud je de ambiguïteit, vouw je deze in tot de meest waarschijnlijke betekenis, of kies je er één en leg je je eraan vast?


De modellen in deze test zijn niet allemaal gelijkwaardig. Ze omvatten verschillende architecturen, trainingsregimes en implementatiecontexten. De Round 1 baseline omvat modellen die algemeen toegankelijk zijn. De uitgebreide Round 2-pool voegt verschillende van de nieuwste premium-tier modelvarianten toe die nu beschikbaar zijn voor betalende gebruikers op MachineTranslation.com, dezelfde tier van modellen die anders een afzonderlijk betaald account bij elke individuele provider zou betekenen.

De uitgebreide pool in Round 2 omvat modellen die geavanceerder zijn en beschikbaar voor betalende gebruikers op MachineTranslation.com. Het effect van het uitbreiden van de pool is niet uniform. In sommige tests (formaliteit/Japans) verschoof het de consensus op betekenisvolle wijze. Bij anderen (medische terminologie/Vietnamees) verdiepte de splitsing zich.

De testgegevens wijzen op twee verschillende foutencategorieën, en ze vereisen verschillende reacties.
Categorie A: Stille fouten. Formaliteitsfouten, registratiefouten, nauwkeurigheid van medische terminologie: deze produceren outputs die correct lijken. De Japanner is grammaticaal. De Vietnamees spreekt vloeiend. Er is geen oppervlaktesignaal dat iets fout is gegaan. Een eentalige gebruiker die de output van een enkel model leest, heeft geen manier om te weten dat het model een registerkeuze heeft gemaakt die een senior Japanse directeur zou opmerken, of dat een klinische term op een manier is vernauwd die de populatie waarop het van toepassing is, verandert.
Categorie B: Zichtbare fouten. MiniMax vertaalt "burning the midnight oil" als "brandende fakkels." GPT-4.1-NANO lost "That's sick" op naar het ondubbelzinnige "すごい." Deze zijn detecteerbaar, ofwel door een spreker van de doeltaal ofwel door vergelijking met andere modeloutputs.
De multi-modelelvergelijking die SMART biedt, is het meest waardevol in Categorie A. Wanneer vijf of tien modellen outputs produceren en de meeste het eens zijn over een formeel register terwijl één een informeel platte vorm Japans produceert, is het verschil zichtbaar in de vergelijkingsweergave. Een gebruiker die de doeltaal spreekt, kan de opties evalueren. Een gebruiker die niet kan zien dat een betwiste beslissing is genomen, kan bepalen of die uitspraak menselijke beoordeling rechtvaardigt.
Voor werk op documentniveau, grote bestanden, lay-outbehoudende vertaling van PDF's, contracten of klinisch materiaal, verwerkt het vermogen van het platform voor documentverwerking de bestandsstructuur zonder de opmaak te verstoren. Maar de kwaliteitsvragen die hierboven zijn opgeworpen, gelden ongeacht de bestandsgrootte. Een klinische studie van 100 pagina's waarin elk geval van "hepatische aandoening" wordt vertaald als "leverfalen" is een grotere versie van hetzelfde probleem dat in Test 2 is geïdentificeerd.
Voor de medische en juridische categorieën specifiek is menselijke verificatie de juiste waarborg. De AI Post-Editing service van Tomedes, die AI-output combineert met gecertificeerde menselijke beoordeling voor precies dit soort inhoud met hoog risico, is hiervoor ontworpen. De suy gan / suy giảm chức năng gan splitsing is precies het soort bevinding dat een dergelijke beoordeling zou moeten uitlokken, niet omdat alle modellen fout zijn, maar omdat de modellen die het meest zelfverzekerd zijn niet het meest nauwkeurig zijn.
De waarde van het zien van meerdere outputs is niet dat je altijd voor de meerderheid zult kiezen. Het is dat je zult weten dat een keuze is gemaakt, wat anders is dan aannemen dat de output voor je correct is.

Zet de acht tests naast elkaar en een patroon klopt: overeenstemming en onenigheid zijn niet willekeurig verdeeld. Idiomatische, alledaagse bedrijfstaal ("contact opnemen," "tot diep in de nacht werken") convergeerde in bijna elk model in de pool, in beide rondes. Formaliteit, juridische precisie en medische terminologie niet. De CEO-formaliteitstest schakelde van informeel naar formeel alleen toen de uitgebreide groep werd opgenomen. De schadevergoedingsclausule bracht een werkelijk juridisch onderscheid aan het licht (免責 vs. 補償) dat slechts één model in één ronde correct heeft opgelost. De medische terminologieverdeeldheid werd helemaal niet opgelost, en bleef in beide rondes ruwweg 6-om-4 staan, ongeacht welke modellen in de pool zaten.
Dat is de werkelijke bevinding, geen marketingclaim: consensus maakt niet elke zin beter, en dat hoeft ook niet. Het is het meest waardevol precies daar waar de vlotheid van een enkel model je geen reden geeft om eraan te twijfelen, en waar het fout zijn daadwerkelijk iets kost.
Er is een tweede, meer praktische laag aan deze test die het waard is om duidelijk uit te spreken. Het zelf uitvoeren van deze vergelijking betekende dat ik outputs van GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo en MiniMax M2.7 naast elkaar controleerde met de bestaande basismodellen, op één plek, op één platform. Buiten MachineTranslation.com om, dat is niet één abonnement. Het zijn er meerdere, één voor elke provider waarvan je de premium-tier wilt testen, tegen wat elke provider individueel berekent. Betalende gebruikers hier krijgen diezelfde vergelijking in één klik, voor een fractie van wat het onderhouden van vijf aparte premiumabonnementen zou kosten, zonder afstand te doen van het wat echt belangrijk is: zien waar de modellen het eens zijn, en precies weten wanneer ze het niet eens zijn.
Geen van beide is categorisch beter; het hangt af van de testcategorie. Claude Sonnet en Claude Opus kozen consequent voor de meer precieze Vietnamese medische term, en Claude Opus produceerde het meest geschikte slang voor "That's sick." Maar Claude Sonnet produceerde ook casual Japans in een formele CEO-context zin, waar GPT-5.5 het goed deed. Het rechtstreeks vergelijken van outputs is beter verdedigbaar dan het kiezen van één model en dit vertrouwen.
Er is geen; nauwkeurigheid is domeinafhankelijk. Gemini 3.5-Flash en GLM-5-Turbo produceerden het meest passende formele Japans in deze test. Beide Claude-modellen waren het meest nauwkeurig bij Vietnamese medische terminologie. DeepSeek V4-Pro was het enige model dat de juiste Japanse juridische term gebruikte, maar alleen in Ronde 2, en het produceerde informeel Japans elders. Geen enkel model domineerde in alle acht tests.
Nee, niet automatisch. Het uitbreiden van het aanbod met nieuwere premium-tier modelvarianten verschoof de consensus in de Japanse formaliteitstests van informeel naar formeel. Maar in de Vietnamese medische terminologietest bleef de verdeling ongeveer 6-om-4, ongeacht welke modellen werden opgenomen. Meer modellen brengen meer onenigheid aan het licht, wat een nuttig signaal is, maar de consensus volgt nog steeds de meerderheid, en de meerderheid is niet altijd het meest nauwkeurige antwoord.
SMART is het multi-model consensus systeem van MachineTranslation.com, dat zich uitstrekt over maximaal 22 AI-modellen van providers zoals OpenAI, Anthropic, Google en DeepSeek. Het voert een vertaling uit via meerdere modellen tegelijk en geeft de output van de meerderheidsconsensusvergelijking samen met het antwoord van elk afzonderlijk model weer, standaard, zonder dat er configuratie nodig is. De consensus verschuift wanneer de modelpool verschuift, zoals aangetoond in de Japanse formaliteitsresultaten van deze test: een informele consensus in Ronde 1 werd formeel in Ronde 2.
Geen enkel model; menselijke beoordeling is het betere antwoord. Claude-modellen kozen consequent de preciezere Vietnamese medische term, en alleen DeepSeek V4-Pro gebruikte de correcte Japanse juridische term, maar alleen in Ronde 2. De medische terminologiesplitsing werd nooit opgelost in 10 modellen, wat aangeeft dat domeinexpertise vereist is, niet dat een ander model zou moeten worden gekozen. Een gecertificeerde menselijke nabewerking review, zoals Tomedes biedt, biedt die specialistische controle.