July 10, 2026
To ord. Seks modeller. Tre ulike oversettelsesvalg. Her er hva som skjedde da jeg kjørte 8 testsetninger gjennom de nyeste AI-modellene som er tilgjengelige på MachineTranslation.com, og hva resultatene faktisk avslører om når en modell svikter i stillhet.
To ord. Det er sykt. Seks modeller. Tre distinkte oversettelsesvalg.
På japansk gjorde en modell det til それはやばい, og bevarte tvetydigheten. En annen droppet subjektpronomenet helt og skrev bareformen やばい, den mest kollokiale versjonen mulig. En tredje skrev それはすごい, som løser tvetydigheten helt til fordel for "fantastisk," og fjerner den dobbelte betydningen som gjorde uttrykket interessant fra først av. På vietnamesisk skrev en modell Đỉnh vậy (slang, korrekt for ungdomsregister). En annen skrev Thật tuyệt vời, grammatikalsk korrekt, men nærmere til å si "det er virkelig underlig" når noen sender deg en meme.
Alle disse er forsvarlige. Ingen av dem er det samme. Og hvis du kjører oversettelser gjennom en enkelt modell, vil du aldri se valget som ble gjort på dine vegne.
Det er det sentrale spørsmålet som denne artikkelen prøver å besvare. Ikke hvilket AI-modell som er best for oversettelse i 2026 (svaret avhenger av språkpar, register, domene og setningsstruktur), men heller: hvordan ville du vite når modellen din gjorde det feil valget? Spesielt innen domener som medisinsk terminologi, juridiske kontrakter eller profesjonell formalitet, hvor det feil valget ser nøyaktig ut som en korrekt oversettelse inntil en spesialist leser det.
Her er hva jeg gjorde. Jeg kjørte 8 testsetninger gjennom to runder med modeller på MachineTranslation.com: først en grunnlinje med 5 mye brukte modeller, deretter en utvidet pool som legger til flere av de nyeste premium-tier modellvariantene som nå er tilgjengelige for betalende brukere. Normalt ville det å sammenligne resultater fra modeller som denne betydd separate betalte abonnementer hos hver leverandør individuelt. På MachineTranslation.com sitter de i samme sammenligningsvisning. Språkparene var engelsk→japansk og engelsk→vietnamesisk. Setningskategoriene ble valgt spesifikt for å stresstest områder der modelluenighet er mest konsekvensrik: idiomatisk formulering, juridisk terminologi, medisinsk terminologi, formalitetsfølsom kontekst og bevisst semantisk tvetydighet.
En merknad om evalueringsmetodologi: maskinoversettingsforskning har lenge slitt med hvordan man skal score resultater automatisk. Målinger som BLEU og COMET slik de måles i WMT-delte oppgaver gir nyttig samlet signal, men de er dårlige til å oppdage registerfeil, idiomfeil og terminologisk presisjon, nøyaktig de kategoriene som betyr mest her. Det du er i ferd med å lese er outputanalyse, ikke et BLEU-løp.

Ikke hver setning viser fram en meningsfull uenighet. To av de åtte testene, "Let's touch base once the dust settles on this deal" (→ japansk) og "We're burning the midnight oil to hit this launch date" (→ vietnamesisk), ga høy enighet på tvers av begge rundene. Idiomene ble korrekt forstått som idiomer. Ingen oversatte "touch base" som å berøre en fysisk base. Ingen oversatte "the dust settles" som sediment som faller.
Dette er verdt å pause på: idiomatisk engelsk forretningsspråk håndteres rimelig godt av dagens grensemodeller når idiomatikken er vanlig nok. Enigheten om "touch base" holdt seg stabil på tvers av begge rundene; variasjonen var rent stilistisk, rundt hvorvidt man skulle bruke この件 (this matter), この取引 (this deal), eller この案件 (this case) for kildefrasen.

Testen "å brenne midnattsolje" er der ting ble mer interessant. Alle modeller unntatt en forsto idiomen korrekt. MiniMax M2.7, introdusert i Runde 2, oversatte "burning" bokstavelig talt, og produserte đốt đuốc, som betyr "brennende fakler." Konsensus ekskluderte det korrekt.

Japansk er et formalitetslag språk. Valget av verbending, pronomen og referansiell substantivform er ikke stilistisk. Det signaliserer forholdet mellom taler og mottaker. Å sende en melding til administrerende direktør din ved hjelp av uformelle verbformer er ikke en oversettingsfeil i grammatisk forstand. Det er en sosial feil, og en betydelig en.
Kan du sende det over? Takk, setter pris på det. Kontekst: Sending melding til en administrerende direktør.

Konsensus skiftet når modellpoolen utvidet seg. Mekanismen er enkel: å legge til modeller som korrekt leser formalitetskonteksten, skiftet flertallet, og konsensus fulgte etter. Her er hele spekteret av det modellene produserte i Runde 2:

Den vietnamesiske registerprøven avdekket en annen type formalitetsfeil, en som er mer subtil. Kildesetningen: Hei, raskt spørsmål — er du ledig til å hoppe på en samtale? Kontekst: melding til en klient. Qwen i Runde 1 inkluderte "mình," et førstepersons pronomen som antyder uformell vennskap på likestilt nivå. Alle andre modeller unngikk førstepersons selvreferanse helt og holdent, noe som er det sikrere profesjonelle valget. Avgjørende var det at Qwen korrigerte dette i Runde 2 og fjernet "mình." Konsensus i begge rundene ekskluderte det.

Leverandør-/klientansvarsfraskrivelsesklausulen er en standardklausul i kommersielle avtaler: "Leverandøren skal holde kunden skadesløs mot eventuelle krav fra tredjeparter som oppstår fra brudd på denne avtalen."
I runde 1 identifiserte alle fem modellene korrekt det juridiske registeret og brukte låneordene ベンダー (leverandør) og クライアント (kunde), standard i japanske forretningskontrakter av engelsk opprinnelse. En unntak: GPT-4.1-NANO brukte 販売者 (selger) og 顧客 (kunde), legitime japanske ord som mangler den formelle juridiske spesifisiteten til de tilsvarende låneordene.
Det viktigere funnet dukket opp i Runde 2. Hovedskillet er mellom to ord:
Dette er juridisk sett forskjellige konsepter. "Indemnify" spesifikt betyr å beskytte en part fra tredjepartsansvar. Erstatningsansvar er det korrekte juridiske begrepet. Alle Round 1-modeller brukte 補償. I runde 2 var DeepSeek V4-Pro den eneste modellen som produserte 免責, og den gjorde det kun i runde 2, ikke i runde 1.

I en kontrakt er 補償 og 免責 ikke synonymer. En betyr "vi skal refundere deg." Den andre betyr "du er beskyttet mot kravet fra første stund." Hvis en oversettelsesplattform bruker 補償 der 免責 er korrekt, vil ikke en advokat som leser den japanske versjonen se samme avtale som den engelske versjonen beskriver.
Dette er det mest betydningsfulle funnet i datasettet. Testsetningen: "Denne medisinen er kontraindisert hos pasienter med tidligere hepatisk svikt." Kilde: klinisk produktdokumentasjon. Mål: Vietnamesisk.
Det kritiske begrepet er "hepatisk svikt." Det er to vietnamesiske kandidater:
Disse er klinisk distinkte. En kontraindikasjonsadvarsel basert på "hepatisk svikt" gjelder for alle med redusert leverfunksjon, ikke bare de som har opplevd fullstendig organsvikt. Bruk av suy gan insnever den angitte populasjonen feil. En pasient med moderat hepatisk svikt som leser "suy gan" vil kanskje ikke gjenkjenne seg selv som den kontraindisert populasjonen.

Noen kildesetninger er tvetydige med vilje. "Det er syk" i moderne engelsk slang betyr noe utmerket, men det bærer også fortsatt sin bokstavelige betydning (det vil si kvalmt/ekkelt), og spenningen mellom disse to betydningene er en del av hvordan uttrykket kommuniserer. Utfordringen for en oversettelsesmodell er: bevarer du tvetydigheten, kollapser du den til den mest sannsynlige betydningen, eller velger du en og forplikter deg?


Modellene i denne testen er ikke alle likeverdige. De spenner over ulike arkitekturer, treningsregimer og distribusjonskontekster. Runde 1-grunnlinjen inkluderer modeller som er allment tilgjengelige. Den utvidede Round 2-puljen legger til flere av de nyeste premium-tier-modellvariantene som nå er tilgjengelige for betalende brukere på MachineTranslation.com, samme tier av modell som ellers ville betydd en separat betalt konto hos hver enkelt leverandør.

Den utvidede puljen i Round 2 inkluderer modeller som er mer avanserte og tilgjengelige for betalende brukere på MachineTranslation.com. Effekten av å utvide bassenget er ikke ensartet. I noen tester (formalitet/japansk) endret det konsensus betydelig. I hos andre (medisinsk terminologi/vietnamesisk) ble splittelsen dypere.

Testdatapunktene peker på to distinkte feilkategorier, og de krever ulike responser.
Kategori A: Stille feil. Formalitetsfeil, registerfeil, presisjon i medisinsk terminologi: disse produserer utdata som ser korrekte ut. Japaneren er grammatikalsk. Vietnamesen er flytende. Det er ingen overflatesignal som indikerer at noe gikk galt. En enspråklig bruker som leser en enkelt modells utdata, har ingen måte å vite at modellen gjorde et registervalg som en senior japansk leder ville merke, eller at en klinisk term ble innsnevret på en måte som endrer populasjonen den gjelder for.
Kategori B: Synlige feil. MiniMax oversetter "burning the midnight oil" som "brenning av fakler." GPT-4.1-NANO løser "That's sick" til det entydig "すごい." Disse er gjenkjennelige, enten av en taler av målspråket eller ved sammenligning med andre modellerresultater.
Multi-modellsammenligningen som SMART gir, er mest verdifull i kategori A. Når fem eller ti modeller produserer resultater og de fleste er enige om et formelt register mens en produserer uformell japansk i enkel form, er uenigheten synlig i sammenligningsvisningen. En bruker som snakker målspråket kan evaluere alternativene. En bruker som ikke kan se at en omstridt beslutning ble tatt, kan bestemme om den setningen garanterer menneskelig gjennomgang.
For dokumentskala-arbeid, store filer, layoutbevarende oversettelse av PDF-er, kontrakter eller kliniske materialer, håndterer plattformens dokumentbehandlingsevne filstruktur uten å ødelegge formateringen. Men kvalitetsspørsmålene som ble reist ovenfor, gjelder uavhengig av filstørrelse. En 100-siders klinisk studie der hver forekomst av "hepatic impairment" er oversatt som "lever failure" er en større versjon av det samme problemet identifisert i Test 2.
For medisinsk og juridisk kategorier spesifikt, er menneskelig verifisering den riktige sikkerhetsventilet. Tomedes' AI Post-Editing-tjeneste, som kombinerer AI-output med sertifisert menneskelig gjennomgang for nøyaktig denne typen høyrisikoinnhold, er bygget for dette. Suy gan / suy giảm chức năng gan-splittingen er nøyaktig den typen funn som burde utløse denne gjennomgangen, ikke fordi alle modeller er feil, men fordi modellene som er mest sikre ikke er de mest presise.
Verdien av å se flere utganger er ikke at du alltid vil velge flertallet. Det er at du vil vite at et valg ble gjort, noe som er annerledes enn å anta at resultatet foran deg er korrekt.

Sett de åtte testene side ved side og et mønster holder seg: enighet og uenighet er ikke tilfeldig fordelt. Idiomatisk, dagligdags forretningsspråk ("ta kontakt," "arbeide sent inn i natta") konvergerte på tvers av nesten alle modellene i gruppen, i begge rundene. Formalitet, juridisk presisjon og medisinsk terminologi gjorde ikke det. Testen for CEO-formalitet skiftet fra uformell til formell bare når den utvidede gruppen ble inkludert. Erstatningsklausulen avslørte en reell juridisk distinksjon (免責 vs. 補償) som bare én modell, i én runde, fikk riktig. Den medisinske terminologisplittelsen ble aldri løst i det hele tatt, og holdt seg på omtrent 6-til-4 på tvers av begge rundene uavhengig av hvilke modeller som var i poolen.
Det er det faktiske funnet, ikke et markedsføringskrav: konsensus gjør ikke hver setning bedre, og det trenger ikke å gjøre det. Det er mest verdifullt akkurat der hvor en enkelt modells flytende språk ikke gir deg noen grunn til å tvile på den, og der det faktisk koster noe å ta feil.
Det er et annet, mer praktisk lag til denne testen som er verdt å si klart. Å kjøre denne sammenligningen selv betydde å sjekke utdata fra GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, og MiniMax M2.7 side om side med de eksisterende grunnlinjemodellene, på ett sted, på én plattform. Utenfor MachineTranslation.com er det ikke ett abonnement. Det er flere, en for hver leverandør hvis premiumtier du vil teste, til hva hver leverandør krever individuelt. Betalende brukere her får den samme sammenligningen med ett klikk, til en brøkdel av hva det ville koste å vedlikeholde fem separate premiumabonnementer, uten å gi opp det som faktisk betyr noe: å se hvor modellene er enige, og vite nøyaktig når de ikke er det.
Ingen er kategorisk bedre; det avhenger av testkategorien. Claude Sonnet og Claude Opus valgte konsekvent den mer presise vietnamesiske medisinske termen, og Claude Opus produserte det mest passende slanget for "That's sick." Men Claude Sonnet produserte også uformell japansk i en formell administrerende direktør-kontekst setning, der GPT-5.5 fikk det riktig. Å sammenligne resultater direkte er mer forsvarlig enn å velge én modell og stole på den.
Det finnes ikke én; nøyaktighet er domeneavhengig. Gemini 3.5-Flash og GLM-5-Turbo produserte det mest passende formelle japansk i denne testen. Begge Claude-modellene var mest presise på vietnamesisk medisinsk terminologi. DeepSeek V4-Pro var den eneste modellen som brukte det korrekte japanske juridiske begrepet, men bare i Runde 2, og den produserte uformell japansk andre steder. Ingen enkelt modell dominerte på tvers av alle åtte tester.
Nei, ikke automatisk. Utvidelsen av utvalget med nyere premium-tier modellvarianter skiftet konsensus fra uformell til formell i den japanske formalitetstesten. Men i den vietnamesiske medisinske terminologitesten vedvarte splittelsen på omtrent 6-til-4 uavhengig av hvilke modeller som ble inkludert. Flere modeller bringer fram mer uenighet, som er et nyttig signal, men konsensus følger fortsatt flertallet, og flertallet er ikke alltid det mest presise svaret.
SMART er MachineTranslation.com sitt multi-modell konsensussystem som spenner over opptil 22 AI-modeller fra leverandører inkludert OpenAI, Anthropic, Google og DeepSeek. Det kjører en oversettelse gjennom flere modeller samtidig og presenterer flertallskonsensusresultatet sammen med hver enkelt modells svar, som standard, uten at det kreves noen konfigurasjon. Konsensus skifter når modellpoolen skifter, som vist i denne testens japanske formalitetsresultat: en uformell konsensus i Runde 1 ble formell i Runde 2.
Ingen enkelt modell; menneskelig gjennomgang er det bedre svaret. Claude-modellene valgte konsekvent det mer presise vietnamesiske medisinsk begrepet, og bare DeepSeek V4-Pro brukte det riktige japanske juridiske begrepet, men bare i runde 2. Den medisinske terminologidellingen ble aldri løst på tvers av 10 modeller, noe som signaliserer at domenekompetanse er nødvendig, ikke at en annen modell bør velges. En sertifisert menneskelig etterredigeringsgjennomgang, slik Tomedes tilbyr, gir den spesialistkontrollen.