June 10, 2026
Ik wil iets delen wat we deze week hebben besloten — niet nadat het is uitgebracht, maar terwijl we het nog aan het bouwen zijn.
We veranderen hoe AI-modellen worden toegewezen aan onze gebruikersniveaus. Betalende gebruikers op MachineTranslation.com krijgen binnenkort toegang tot geavanceerdere AI-modellen van de toonaangevende aanbieders — OpenAI, Anthropic, Google, DeepSeek en anderen. Gratis gebruikers blijven capabele, betrouwbare vertalingen krijgen — maar niet dezelfde modellen. Die kloof is bewust, en ik wil precies uitleggen waarom we deze beslissing nemen.
Ik schrijf dit liever nu, terwijl de redenering nog vers is en de beslissing nog een beetje rauw is, dan te wachten tot het live is en het te presenteren als een gelikte aankondiging. De eerlijke versie is nuttiger.
MachineTranslation.com vertaalt met 22 AI-modellen tegelijk en gebruikt een op consensus gebaseerde aanpak om de beste uitvoer te tonen. Dat is altijd de kern geweest van wat we doen — niet alles op één model inzetten, maar meerdere met elkaar vergelijken en de resultaten voor zichzelf laten spreken.
De ongemakkelijke kant van die aanpak is dat het de kwaliteitsverschillen tussen modellen heel zichtbaar maakt. We zien, elke dag, dat niet alle modellen alle tekst even goed behandelen. En lange tijd hebben we die waarneming niet laten veranderen hoe we modellen aan gebruikers toewezen.
Een paar weken geleden leidde Rachelle (onze AI-lead) ons door een interne tool die we hadden gebouwd om de vertaalkwaliteit op meerdere GPT-modellen tegelijk te testen — waaronder GPT 4.1 nano, GPT 4.1 mini, GPT 5.4 mini en andere. Je voert dezelfde brontekst in en je ziet de output van elk model naast elkaar.
Wat die tool onmiddellijk duidelijk maakt, is dit: bij eenvoudige, korte, alledaagse tekst zijn de outputs vrijwel identiek. Je kunt een kwaliteitsargument voor premium modellen echt niet baseren op 'de vergadering is om 15:00 uur'.
Maar bij alles met echte linguïstische complexiteit (idiomatische uitdrukkingen, vakterminologie, lange documenten waarin de context over duizenden woorden heen behouden moet blijven) wordt de kloof tussen de modellen groter, en wel op manieren die professioneel van belang zijn.
Dit is het onderdeel waar de vertaalindustrie volgens mij niet eerlijk genoeg over praat. Modellen van een lager niveau produceren meestal geen overduidelijk foute vertalingen. Ze produceren vertalingen die op het eerste gezicht goed lijken, maar subtiele fouten bevatten die een materiedeskundige (een advocaat, een medisch professional, een senior lokalisatiemanager) onmiddellijk zou opmerken.
Een voorwaardelijke bijzin weergegeven met de verkeerde betekenis. Een juridische term die in dat rechtsgebied iets specifieks betekent, vertaald als het alledaagse equivalent. Een registerverschuiving halverwege een lang document die de professionele geloofwaardigheid van het geheel ondermijnt.
Het falen is stil. En onopgemerkte fouten bij professionele vertalingen kunnen duur zijn.
We hebben deze beslissing niet op basis van intuïtie genomen. We hebben de modellen getest met complexe, idiomatische brontekst (het soort content dat onze professionele gebruikers daadwerkelijk moeten vertalen) en we hebben de output laten evalueren door linguïsten.
Het resultaat was duidelijk. Geavanceerde modellen behandelden nuance, register en domeinspecifieke terminologie consequent beter. De goedkopere modellen waren meer dan voldoende voor alledaags gebruik. De twee gebruiksscenario's vereisen echt verschillende tools.

Het gesprek dat dit intern teweegbracht, ging minder over de prijsstelling en meer over eerlijkheid. Als we weten dat de modellen anders presteren op professionele content, en we weten dat onze betalende gebruikers grotendeels professionele content vertalen, dan doen we beiden tekort door hun hetzelfde model te geven als een gratis gebruiker die een informele e-mail vertaalt.
Ofer (onze CEO) verwoordde het duidelijk in onze interne discussie:
Modellen van een lager niveau brengen reële kwaliteitsrisico's met zich mee voor complexe of idiomatische teksten. Maar het grotere punt is dit: consensus is maar zo goed als de modellen die erachter zitten. Wanneer betalende gebruikers geavanceerdere modellen krijgen, krijgen ze niet alleen betere individuele outputs — ze krijgen een sterkere consensus. Betere modellen, betere consensus, betrouwbaardere vertalingen. Dat is wat professionele vertaling eigenlijk betekent.
Die framing is me bijgebleven. Het is niet alleen een kostenargument. Het is een duidelijkheidsargument.
Krachtigere AI-modellen kosten aanzienlijk meer per token om te draaien. Dat is geen beleid van MachineTranslation.com, het is hoe elke grote AI-aanbieder zijn vlaggenschipmodellen prijst. OpenAI, Anthropic, Google en DeepSeek reserveren allemaal hun nieuwste, meest capabele modellen voor betalende klanten, omdat die modellen aanzienlijk duurder zijn in gebruik. Het inzetten van ons meest geavanceerde model voor elke gratis vertaling, elke informele zoekopdracht en elke 'wat staat er op dit bord'-vraag, zou onze infrastructuurkosten aanzienlijk verhogen.
Belangrijker nog, het zou betekenen dat we eenvoudige gebruiksgevallen kruissubsidiëren met het rekenbudget dat we nodig hebben om de kwaliteit te waarborgen voor professionals die technische documenten van 10.000 woorden vertalen. Dat is geen duurzame of verstandige verdeling.
Er is een versie van deze beslissing die puur mercenair is — meer vragen, meer geven, simpel. Dat is eigenlijk niet wat het aandrijft.
Wat het aandrijft, is dat we een platform hebben gebouwd dat daadwerkelijk kwaliteitsverschillen tussen AI-modellen zichtbaar kan maken. We hebben de interne tooling om die verschillen duidelijk te zien. Ervoor kiezen om die zichtbaarheid te negeren wanneer we onze gebruikersniveaus ontwerpen, zou een soort oneerlijkheid zijn, door te pretenderen dat de kloof niet bestaat terwijl we bewijs hebben dat die er wel is.
Gratis gebruikers verdienen het om te weten wat ze krijgen. Betalende gebruikers verdienen het te weten dat ze iets wezenlijk anders krijgen. En het verschil is niet alleen de toegang tot geavanceerdere modellen, het is de toegang tot een sterkere consensus die uit die modellen is opgebouwd. Dat is het betrouwbaarheidssignaal dat geen enkele AI kan bieden.
We zijn nog bezig met het uitwerken van de implementatiedetails, dus ik wil voorzichtig zijn om geen specifieke beloftes te doen. Maar dit is de richting.
Vertalingen van het gratis abonnement blijven gebruikmaken van capabele AI-modellen. Voor de meeste alledaagse vertaaltaken (korte berichten, informeel lezen, eenvoudige correspondentie) krijgen gratis gebruikers accurate, betrouwbare output. Dat verandert niet.
De gratis versie bestaat omdat we vinden dat taal geen barrière mag zijn, en daar komen we niet op terug.
Het verschil zal het meest zichtbaar zijn bij:
| Contenttype | Waarom modelkwaliteit hier van belang is |
|---|---|
| Juridische en financiële documenten | Voorwaardelijke clausules, jurisdictiespecifieke terminologie, registerconsistentie |
| Technische documentatie | Domeinspecifieke woordenschat, coherentie in lange documenten |
| Medische en klinische teksten | Precisie, register, gevoeligheid voor ambiguïteit |
| Marketing- en merkteksten | Idiomatische aanpak, tonale nauwkeurigheid, culturele resonantie |
| Talenparen met weinig resources | Minder trainingsdata betekent grotere kwaliteitsverschillen tussen modellen |
| Lange documenten (5.000+ woorden) | Contextbehoud, consistentie in het hele document |
Voor professionele gebruikers die in een van deze categorieën werken, zal het modelniveau een echt verschil maken. Dat is precies voor wie onze betaalde abonnementen bedoeld zijn.
En omdat de consensus van SMART is opgebouwd uit die meer geavanceerde modellen, krijgen betalende gebruikers niet alleen betere individuele resultaten — ze krijgen betrouwbaardere AI-vertalingen, gegenereerd door de nieuwste modellen die samenwerken.
Ik wil eerlijk zijn dat dit nog niet allemaal is opgelost.
We zijn de exacte modeltoewijzing nog aan het bepalen — welke modellen in welk niveau vallen, en hoe we dat duidelijk communiceren naar gebruikers binnen het product. We zijn de logica van de betaalmuur aan het uitwerken om ervoor te zorgen dat de ervaring naadloos is, en niet storend. En we denken zorgvuldig na over hoe we informatie over de kwaliteit van het model aan gebruikers kunnen presenteren op een manier die echt nuttig is, in plaats van alleen maar een marketingclaim.
Er is ook een reële vraag waar we mee zitten: hoe helpen we een gratis gebruiker op het moment zelf te begrijpen wanneer die een use case tegenkomt waarbij een upgrade de output aanzienlijk zou verbeteren? Dat is net zozeer een UX-uitdaging als een productuitdaging, en we hebben het volledige antwoord nog niet.
Ik zal erover schrijven hoe dit aanslaat zodra het live is. Voorlopig is dit het idee.
Als je een betalende gebruiker bent en je wilt je mening geven over wat voor jou het belangrijkst is in de kwaliteit van het model, dan ben ik oprecht geïnteresseerd. Laat een bericht achter via de MachineTranslation.com contactpagina.
Omdat uit onze interne tests een significant kwaliteitsverschil bleek tussen de modelniveaus bij professionele vertaaltaken. We hebben een tool ontwikkeld om meerdere AI-modellen tegelijk te vergelijken, en uit de data bleek duidelijk: geavanceerde modellen gaan aanzienlijk beter om met complexe, idiomatische en domeinspecifieke inhoud. De niveauwijziging weerspiegelt die realiteit eerlijk. Het grotere voordeel voor betalende gebruikers is dat de SMART-consensus is opgebouwd uit meer geavanceerde modellen, wat betekent dat het betrouwbaarheidssignaal zelf sterker is.
Nee. Gebruikers van het gratis abonnement blijven goede, nauwkeurige vertalingen krijgen voor alledaags gebruik. De verandering is dat betalende gebruikers een upgrade krijgen naar geavanceerdere modellen, niet dat gratis gebruikers een downgrade krijgen.
Juridische, financiële, medische, technische en lange documenten — en alle content in minder gangbare talenparen waar de trainingsdata schaarser is. Voor korte, eenvoudige, alledaagse tekst is het verschil tussen modelniveaus minimaal. Het grotere voordeel voor betalende gebruikers is dat de SMART-consensus is opgebouwd uit meer geavanceerde modellen, wat betekent dat het betrouwbaarheidssignaal zelf sterker is.
We zijn het nu aan het bouwen. Ik post een update wanneer het wordt verzonden, inclusief hoe de ervaring in het product eruitziet en wat de eerste gegevens laten zien.
We voeren meerdere modellen tegelijkertijd uit en gebruiken een op consensus gebaseerde scorebenadering om de outputs te evalueren. Onze interne vergelijkingstool stelt ons in staat om de kwaliteit van verschillende modelniveaus te testen op dezelfde brontekst, wat de basis vormde voor deze beslissing over de indeling. U kunt meer leren over hoe het consensus-systeem van MachineTranslation.com.com werkt.