July 10, 2026
Twee woorde. Ses modelle. Drie verskillende vertaalkeuses. Hier is wat gebeur het toe ek 8 toetssinne deur die nuutste AI-modelle beskikbaar op MachineTranslation.com laat loop het, en wat die uitlegte eintlik onthul oor wanneer 'n model stilweg misluk.
Twee woorde. "Dit is siek." Ses modelle. Drie afsonderlike vertalingsbesluite.
In Japannees het een model dit weergegee as それはやばい, wat die dubbelsinnigheid behou. Nog een het die onderwerpsvoornaamwoord heeltemal laat vaar en het die baarvorm やばい geskryf, die mees-omgangstaal weergawe moontlik. 'n Derde het geskryf それはすごい, wat die dubbelsinnigheid heeltemal oplos ten gunste van "verbazingwekkend," en die dubbele betekenis wat die frase interessant gemaak het, verwyder. In Afrikaans, skryf een model Đỉnh vậy (slang, korrek vir jeugregister). 'n Ander het geskryf Thật tuyệt vời, grammatikaal korrekt, maar nader aan die sin "dit is werklik wonderbaarlik" wanneer iemand jou 'n meme stuur.
Al hierdie is verdedigbaar. Hulle is nie dieselfde ding nie. En as jy vertalings deur 'n enkele model laat loop, sal jy nooit die keuse sien wat namens jou gemaak is nie.
Dit is die sentrale vraag wat hierdie artikel probeer beantwoord. Nie watter AI-model die beste is vir vertaling in 2026 nie (die antwoord hang af van taalpar, register, domein en sinstruktuur), maar eerder: hoe sou jy weet wanneer jou model die verkeerde keuse gemaak het? Veral in domeine soos mediese terminologie, regskontrakke, of professionele formaliteit, waar die verkeerde keuse presies soos 'n korrekte vertaling lyk totdat 'n spesialis dit lees.
Hier is wat ek gedoen het. Ek het 8 toetssinne deur twee ronde van modelle op MachineTranslation.com gestuur: eerstens 'n basislyn van 5 wyd gebruikte modelle, en daarna 'n uitgebreide groep wat verskeie van die nuutste premium-laag modelafwykings bevat wat nou aan betalende gebruikers beskikbaar is. Normaalweg sou dit beteken dat jy afsonderlike betaalde intekeninge by elke verskaffer individueel moet hê om uitsette van modelle soos hierdie te vergelyk. Op MachineTranslation.com sit hulle in dieselfde vergelykingsaansiening. Die taalpare was Engels→Japannees en Engels→Vietnamees. Die sinkaategorieë is spesifiek gekies om strestoetsing uit te voer in areas waar modelonenigheid die meeste gevolge het: idiomatiese fraseologie, regsterminologie, mediese terminologie, formaliteit-sensitiewe konteks, en opsetlike semantiese dubbelsinnigheid.
'n Opmerking oor evalueringsmetodologie: masjienleervertaling het lank al geworstel met hoe om uitlegte outomaties te skor. Metrieke soos BLEU en COMET soos gemeet in WMT-gedeelde take gee nuttige samevattende sein, maar hulle is swak in die opsporing van registerfoute, idioomtekortkominge en terminologiese presisie, presies die kategorieë wat hier die belangrikste is. Wat jy op die punt staan om te lees, is uitvoeranalise, nie 'n BLEU-wedren nie.

Nie elke sin bring 'n betekenisvolle onenigheid na vore nie. Twee van die acht toetse, "Let's touch base once the dust settles on this deal" (→ Japannees) en "We're burning the midnight oil to hit this launch date" (→ Viëtnamees), het hoë ooreenstemming in beide rondes opgelewer. Die idiome is korrek as idiome verstaan. Niemand het "touch base" as om 'n fisiese basis aan te raak vertaal. Niemand het "the dust settles" as sediment wat val vertaal nie.
Dit is die moeite werd om op in te hou: idiomatiese Engelse besigheidstal word redelik goed hanteer deur huidige grensmodelle wanneer die idioom algemeen genoeg is. Die konsensus vir "touch base" het stabiel gebly oor beide rondes; variasie was suiwer stilisties, rondom of om deze zaak (hierdie saak), deze transactie (hierdie transaksie), of deze zaak (hierdie geval) vir die bronfrases te gebruik.

Die "tot laat in die nag werk" toets is waar dinge meer interessant geword het. Elke model behalwe een het die idioom korrek verstaan. MiniMax M2.7, in Ronde 2 bekendgestel, het "burning" letterlik vertaal, wat đốt đuốc produseer, wat "brandende fakkels" beteken. Die konsensus het dit korrek uitgesluit.

Afrikaans is 'n formaliteit-gelaagde taal. Die keuse van werkwoorduitgang, voornaamwoord en verwysende naamwoordvorm is nie stilisties nie. Dit dui op die verhouding tussen spreker en ontvanger. Dit is nie 'n vertaalfout in die grammatikale sin om 'n boodskap aan jou CEO te stuur met informele werkwoordsvorme nie. Dit is 'n sosiale fout, en 'n beduidende een.
Die toetssin: Kan jy dit oorsend? Dankie, waardeer dit. Konteks: boodskappe aan 'n uitvoerende direkteur.

Die konsensus het verskuif toe die modelgroep uitgebrei het. Die meganisme is eenvoudig: die toevoeging van modelle wat die formaliteitsconteks korrek gelees het, het die meerderheid verskuif, en die konsensus het gevolg. Hier is die volledige spektrum van wat die modelle in Ronde 2 geproduseer het:

Die Viëtnamese registertoets het 'n ander soort formaliteitsfout aan die lig gebring, een wat meer subtiel is. Die bronsin: "Hé, vinnige vraag — is jy beskikbaar om op 'n oproep in te skakel?" Konteks: 'n boodskap aan 'n kliënt stuur. Qwen in Ronde 1 het "mình," 'n eersepersoonvoorvoegsel wat toevallige maatskappy-vlak vriendskap impliseer, ingesluit. Elke ander model het eersepersoonsverwysing heeltemal vermy, wat die veiliger professionele keuse is. Belangrijk is dat Qwen dit in Ronde 2 reggestel het en "mình" laat vaar het. Die konsensus in beide ronde het dit uitgesluit.

Die verkoper/kliënt skadevergoedingsklousule is 'n standaardklousule in kommersiële ooreenkome: "Die verkoper sal die kliënt teen enige vorderinge van derde partye as gevolg van 'n skending van hierdie ooreenkoms skadeloos stel."
In Ronde 1 het al vyf modelle die regsregister korrek geïdentifiseer en die leenwoorde ベンダー (verskaffer) en クライアント (kliënt) gebruik, wat standaard is in Japannese kommersiële kontrakte met Engelse oorsprong. Één uitzondering: GPT-4.1-NANO het 販売者 (verkoper) en 顧客 (klient) gebruik, wettige Japanse woorde wat die formele regsgeldigheid van die leenwoordekwivalente ontbreek.
Die belangriker bevinding het in Ronde 2 na vore gekom. Die sleutelonderskeid is tussen twee woorde:
Dit is regsbegrippe wat van mekaar verskil. "Indemnify" spesifiek beteken om 'n party teen derdeparty-aanspreeklikheid te beskerm. Skadeloosstelling is die korrekte regsterminologie. Alle Round 1-modelle het 補償 gebruik. In Ronde 2 was DeepSeek V4-Pro die enigste model wat 免責 produseer het, en dit was slegs in Ronde 2, nie Ronde 1 nie.

In 'n kontrak is 補償 en 免責 nie sinonieme nie. Een beteken "ons sal jou terugbetaal." Die ander beteken "jy word van die aanspraak in die eerste plek afskerm." Indien 'n vertalingplatform 補償 gebruik waar 免責 korrek is, sal 'n regsgeleerde wat die Japanse weergawe lees, nie dieselfde ooreenkoms sien wat die Engelse weergawe beskryf nie.
Dit is die mees gevolgtrekking bevinding in die datastel. Die toetssin: "Hierdie medikasie is gekontraïndikeer by pasiënte met 'n geskiedenis van hepatiese beperking." Bron: kliniese produkdokumentasie. Teiken: Viëtnams.
Die kritieke term is "hepatiese beperking." Daar is twee Viëtnamese kandidate:
Dit is kliniese onderskeie. 'n Teenwysingwaarskuwing gebaseer op "hepatiese beperking" is van toepassing op enige persoon met verminderde lewerfunksie, nie slegs diegene wat volledige orgaanfaling ondervind het nie. Die gebruik van suy gan vernou die aangeduide bevolking verkeerd. 'n Pasiënt met matige hepatiese beperking wat "suy gan" lees, mag hulself nie as die gekontraïndikeerde bevolking herken nie.

Sommige bronsinne is opsetlik dubbelsinnig. "Dit is siek" in hedendaagse Engelse slang beteken iets uitstekends, maar dit dra ook nog steeds sy letterlike betekenis (dit wil sê walgingwekkend/vies), en die spanning tussen daardie twee betekenisse is deel van hoe die frase kommunikeer. Die uitdaging vir 'n vertaalmodel is: behou jy die dubbelsinnigheid, vou dit toe tot die mees waarskynlike betekenis, of kies jy een en verbind jy daaraan?


Die modelle in hierdie toets is nie almal gelykwaardig nie. Hulle span verskillende argitekture, trainingsregimes en implementeringskontekste. Die Ronde 1-basislyn sluit modelle in wat wyd toeganklik is. Die uitgebreide Ronde 2-groep voeg verskeie van die nuutste premium-vlak modelafwisselings by wat nou beskikbaar is vir betalende gebruikers op MachineTranslation.com, dieselfde vlak van model wat andersins 'n aparte betaalde rekening met elke individuele verskaffer sou beteken.

Die uitgebreide groep in Ronde 2 sluit modelle in wat meer gevorderd is en beskikbaar is vir betalende gebruikers op MachineTranslation.com. Die uitwerking van die uitbreiding van die groep is nie uniform nie. In sommige toetse (formaliteit/Japans) het dit die konsensus betekenisvol verskuif. By others (mediese terminologie/Vietnamees), het die splitsing verdiep.

Die toetsdata dui op twee afsonderlike mislukkingskategorieë, en hulle vereis verskillende reaksies.
Kategorie A: Stille mislukkings. Formaliteitsfoute, registerfoute, mediese terminologiepresisie: hierdie produseer uitlegte wat korrek lyk. Die Japannees is grammatikaal. Die Vietnamees is vloeiend. Daar is geen oppervlaktesein dat iets verkeerd gegaan het. 'n Eentalige gebruiker wat 'n enkele model se uitset lees, het geen manier om te weet dat die model 'n registerkeuse gemaak het wat 'n senior Japanse uitvoerende beampte sou opmerk nie, of dat 'n kliniese term op 'n manier vernou is wat die bevolking waarop dit van toepassing is, verander het.
Kategorie B: Sigbare mislukkings. MiniMax vertaal "burning the midnight oil" as "burning torches." GPT-4.1-NANO los "That's sick" op tot die ondubbelsinnige "すごい." Hierdie is waarneembaar, óf deur 'n spreker van die doeltaal óf deur vergelyking met ander modeluitsette.
Die multi-model-vergelyking wat SMART bied, is die waardevol in Kategorie A. Wanneer vyf of tien modelle uitsette lewer en die meeste stem saam oor 'n formele register terwyl een terloopse gewone-vorm Japannees lewer, is die onenigheid sigbaar in die vergelykingsaansiening. 'n Gebruiker wat die teeldtaal praat, kan die opsies evalueer. 'n Gebruiker wat nie kan sien dat 'n betwiste besluit geneem is nie, kan besluit of daardie vonnis menslike hersiening regverdig.
Vir dokumentskaal-werk, groot lêers, uitlegbewarende vertaling van PDF's, kontrakte of kliniese materiaal, hanteer die platform se dokumentverwerkingsvermoë lêerstruktuur sonder om formatering te breek. Maar die kwaliteitsvrae wat hierbo geopper is, geld ongeag die lêergrootte. 'n 100-bladsystudie waar elke geval van "hepatiese beperking" as "lewerfaling" vertaal word, is 'n groter weergawe van dieselfde probleem wat in Toets 2 geïdentifiseer is.
Vir die mediese en regskategorieë spesifiek, is menslike verifikasie die korrekte terugslag. Tomedes se AI-nabewerking-diens, wat AI-uitset met gesertifiseerde menslike hersiening vir presies hierdie soort hoë-insetinhoud paar, is gebou vir dit. Die suy gan / suy giảm chức năng gan-splitsing is presies die soort bevinding wat daardie hersiening moet uitlok, nie omdat alle modelle verkeerd is nie, maar omdat die modelle wat die meeste selfversekerd is, nie die presiesste is nie.
Die waarde van die besigtiging van veelvoudige uitlegte is nie dat jy altyd die meerderheid sal kies nie. Dit is dat jy sal weet dat 'n keuse gemaak is, wat anders is as om aan te neem dat die uitset voor jou korrek is.

Plaas die agt toetse langs mekaar en 'n patroon hou stand: ooreenstemming en onenigheid is nie ewekansig versprei nie. Idiomatiese, alledaagse besigheidstal ("kontak maak," "tot laat in die nag werk") het in byna elke model in die groep saamgekom, in beide rondes. Formaliteit, juridische nauwkeurigheid en medische terminologie niet. Die CEO-formaliteitstoets het van informeel na formeel oorgeslaan slegs toe die uitgebreide groep ingesluit is. Die skadevergoedingsklousule het 'n werklike regstelike onderskeiding na vore gebring (免責 vs. 補償) wat slegs een model, in een ronde, korrek begrepen het. Die mediese terminologieverdeeling het nooit helemaal opgelos nie, en het ongeveer 6-tot-4 oor beide rondes gebly, ongeag watter modelle in die groep was.
Dit is die werklike bevinding, nie 'n bemarkingseis nie: konsensus maak nie elke sin beter nie, en dit hoef nie. Dit is die waardevolste presies waar 'n enkele model se vlotheid jou geen rede gee om daaraan te twyfel nie, en waar dit werklik iets kos om verkeerd te wees.
Daar is 'n tweede, meer praktiese laag van hierdie toets wat dit duidelik werd om te stel. Om hierdie vergelyking self uit te voer, moes ek uitsette van GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, en MiniMax M2.7 kontroleer en langs mekaar vergelyk met die bestaande basismodelle, op een plek, op een platform. Buite MachineTranslation.com, dit is nie een inskrywing nie. Dit is verskeie, een vir elke verskaffer waarvan jy die premiumbasis wil toets, teen wat elke verskaffer individueel hef. Betalende gebruikers hier kry daardie selfde vergelyking in een klik, teen 'n breuk van wat dit sou kos om vyf afsonderlike premium-intekeninge in stand te hou, sonder om die ding wat werklik saak maak op te gee: sien waar die modelle saamstem, en presies weet wanneer hulle nie doen nie.
Nie een is kategories beter nie; dit hang af van die toetskategorie. Claude Sonnet en Claude Opus het konsekwent die meer presiese Viëtnamse mediese term gekies, en Claude Opus het die mees toepaslike slang vir "That's sick" vervaardig. Maar Claude Sonnet het ook terloopse Japannees in 'n formele CEO-konteks sin geproduseer, waar GPT-5.5 dit reg gekry het. Direktewe vergelyking van uitsette is meer verdedigbaar as om een model te kies en dit te vertrou.
Daar is nie een nie; akkuraatheid is domeinafhanklik. Gemini 3.5-Flash en GLM-5-Turbo het die mees geskikte formele Japannees in hierdie toets gelewer. Beide Claude-modelle was die presiesste op Vietnamese mediese terminologie. DeepSeek V4-Pro was die enigste model wat die korrekte Japanse regsterm gebruik het, maar slegs in Ronde 2, en dit het elders informele Japans geproduseer. Geen enkele model het oor al agt toetse oorheers nie.
Nee, nie outomaties nie. Die uitbreiding van die groep met nuewer premium-vlak modelvariantе het die konsensus in die Japanse formaliteitstoets van informeel na formeel verskuif. Maar in die Vietnamese mediese terminologietoets het die verdeling ongeveer 6-tot-4 volgehou, ongeag watter modelle ingesluit was. Meer modelle bring meer onenigheid na vore, wat 'n nuttige sein is, maar die konsensus volg steeds die meerderheid, en die meerderheid is nie altyd die mees presiese antwoord nie.
SMART is MachineTranslation.com se multi-model konsensusstelsel wat tot 22 AI-modelle span oor verspreiders insluitend OpenAI, Anthropic, Google en DeepSeek. Dit voer 'n vertaling deur verskeie modelle gelyktydig uit en toon die meerderheidskonsensusuitset saam met elke individuele model se antwoord, by verstek, sonder enige konfigurasie nodig. Die konsensus verskuif wanneer die modelgroep verskuif, soos aangetoon in hierdie toets se Japanse formaliteitsresultaat: 'n toevallige konsensus in Ronde 1 het in Ronde 2 formeel geword.
Geen enkele model nie; menslike hersiening is die beter antwoord. Claude-modelle het konsekwent die meer presiese Viëtnamse mediese term gekies, en slegs DeepSeek V4-Pro het die korrekte Japanse regsterm gebruik, maar slegs in Ronde 2. Die mediese terminologieverdeeling het nooit oor 10 modelle heen opgelös nie, wat aandui dat domeinekspertise vereis word, nie dat 'n ander model gekies behoort te word nie. A sertifiseerde menslike naredaksie-oorsig, soos Tomedes bied, verskaf daardie spesialisasie-kontrole.