July 10, 2026
To ord. Seks modeller. Tre forskellige oversættelsesbeslutninger. Her er hvad der skete, da jeg kørte 8 testsetninger gennem de seneste AI-modeller, der er tilgængelige på MachineTranslation.com, og hvad outputs faktisk afslører om, hvornår en model fejler stiltiende.
To ord. Det er sygt. Seks modeller. Tre forskellige oversættelsesbeslutninger.
På japansk blev det i én model gengivet som それはやばい, hvilket bevarede tvetydigheden. En anden udelukkede helt subjektpronomenet og skrev den bare form やばい, den mest mundtlig version, der er mulig. En tredje skrev それはすごい, hvilket løser tvetydigheden helt til fordel for "fantastisk," og fjerner dermed den dobbelte betydning, der gjorde udtrykket interessant fra starten. På dansk skrev en model på vietnamesisk Đỉnh vậy (slang, korrekt for ungdomsregisteret). En anden skrev Det er virkelig vidunderligt, grammatikalsk korrekt, men tættere på at sige "det er virkelig fantastisk" når nogen sender dig et meme.
Alle disse er forsvarlige. Ingen af dem er det samme. Og hvis du kører oversættelser gennem en enkelt model, vil du aldrig se det valg, der blev truffet på dine vegne.
Det er det centrale spørgsmål, som denne artikel forsøger at besvare. Ikke hvilket AI-model der er bedst til oversættelse i 2026 (svaret afhænger af sprogpar, register, domæne og sætningsstruktur), men snarere: hvordan ville du vide, når din model gjorde det forkert? Især inden for områder som medicinsk terminologi, juridiske kontrakter eller professionel formalitet, hvor det forkerte valg ser ud præcis som en korrekt oversættelse, indtil en specialist læser det.
Her er hvad jeg gjorde. Jeg kørte 8 testsætninger gennem to runder af modeller på MachineTranslation.com: først en baseline med 5 meget anvendte modeller, derefter en udvidet pulje, der tilføjer flere af de nyeste premium-tier modelvarianterne, der nu er tilgængelige for betalende brugere. Normalt ville det at sammenligne output fra modeller som denne betyde separate betalte abonnementer hos hver enkelt udbyder. På MachineTranslation.com sidder de i samme sammenligningsvisning. Sprogparene var engelsk→japansk og engelsk→vietnamesisk. Sætningskategorierne blev valgt specifikt for at stress-teste områder, hvor modeluenighed er mest konsekvential: idiomatisk formulering, juridisk terminologi, medicinsk terminologi, formalitetsfølsom kontekst og bevidst semantisk tvetydighed.
En bemærkning om evalueringsmetodologi: maskinoversættelsesforskning har længe kæmpet med, hvordan man automatisk scorer output. Målinger som BLEU og COMET som målt i WMT-delte opgaver giver brugbart aggregeret signal, men de er dårlige til at opdage registerfejl, idiomfejl og terminologisk præcision, præcis de kategorier, der betyder mest her. Det, du er ved at læse, er outputanalyse, ikke et BLEU-løb.

Ikke enhver sætning afslører en meningsfuld uenighed. To af de otte tests, "Lad os få kontakt, når støvet lægger sig på denne aftale" (→ japansk) og "Vi arbejder på højtryk for at nå denne lancering" (→ vietnamesisk), producerede høj enighed på tværs af begge runder. Idiomerne blev korrekt forstået som idiomer. Ingen oversatte "touch base" som at røre ved en fysisk base. Ingen oversatte "the dust settles" som sediment, der falder ned.
Det er værd at holde pause ved: idiomatisk engelsk forretningssprog håndteres rimelig godt af nuværende frontier-modeller, når idiomatikken er almindelig nok. Konsensus for "touch base" forblev stabil på tværs af begge runder; variation var rent stilistisk omkring, hvorvidt man skulle bruge この件 (dette spørgsmål), この取引 (denne handel) eller この案件 (denne sag) for kildefrasen.

Testen "at brænde midnatsolie" er der, hvor tingene blev mere interessante. Alle modeller på nær én forståede idiomatisk udtryk korrekt. MiniMax M2.7, introduceret i Runde 2, oversatte "burning" bogstaveligt, hvilket producerede đốt đuốc, betyder "brændende fakler." Konsensus udelukkede det korrekt.

Japansk er et formalitetslag-sproget. Valget af verbum-endelse, pronomen og referentiel substantivform er ikke stilistisk. Det signalerer forholdet mellem taler og modtager. At sende en besked til din administrerende direktør ved hjælp af uformelle verbformer er ikke en oversættelsesfejl i grammatisk forstand. Det er en social fejl, og en betydelig sådan.
Kan du sende det over? Tak, jeg sætter pris på det." Kontekst: besked til en administrerende direktør.

Konsensus skiftede, da modelgruppen blev udvidet. Mekanismen er ligetil: tilføjelse af modeller, der korrekt læste formalitetskonteksten, skiftede flertallet, og konsensus fulgte efter. Her er det fulde spektrum af, hvad modellerne producerede i Runde 2:

Vietnamesisk registertesten afslørede en anden slags formalitetsfejl, en der er mere subtil. Kildesætningen: Hej, et hurtigt spørgsmål — har du tid til at hoppe på et opkald? Kontekst: besked til en klient. Qwen i Runde 1 inkluderede "mình," et førstepersons pronomen, der antyder uformel venskab på kammeratniveau. Alle andre modeller undgik helt og holdent førstepersons selvhenvisning, hvilket er det mere sikre professionelle valg. Afgørende var det, at Qwen korrigerede dette i Runde 2 og fjernede "mình." Konsensus i begge runder udelukkede det.

Leverandør-/klientgodtgøringssætningen er en standardklausul i kommercielle aftaler: "**Leverandøren skal holde kunden skadesløs over for ethvert tredjepartskrav, der opstår som følge af misligholdelse af denne aftale."
I runde 1 identificerede alle fem modeller korrekt det juridiske register og brugte låneordene ベンダー (leverandør) og クライアント (kunde), som er standard i japanske erhvervskontrakter af engelsk oprindelse. En undtagelse: GPT-4.1-NANO brugte 販売者 (sælger) og 顧客 (kunde), legitime japanske ord, der mangler den formelle juridiske præcision af låneordækvivalenterne.
Det vigtigere fund dukkede op i Runde 2. Hovedskellet er mellem to ord:
Disse er juridisk forskellige begreber. "Indemnify" betyder specifikt at beskytte en part mod tredjepartsansvar. Erstatningsansvar er det korrekte juridiske udtryk. Alle Round 1-modeller brugte 補償. I Runde 2 var DeepSeek V4-Pro den eneste model, der producerede 免責, og det gjorde den kun i Runde 2, ikke Runde 1.

I en kontrakt er 補償 og 免責 ikke synonymer. En betyder "vi refunderer dig." Den anden betyder "du er beskyttet mod kravet fra start." Hvis en oversættelsesplatform bruger 補償 hvor 免責 er korrekt, vil en advokat, der læser den japanske version, ikke se den samme aftale, som den engelske version beskriver.
Dette er det vigtigste fund i datasættet. Testsætningen: "Denne medicin er kontraindiceret hos patienter med en historie om hepatisk svækkelse." Kilde: klinisk produktdokumentation. Mål: Vietnamesisk.
Det kritiske udtryk er "hepatisk svækkelse." Der er to vietnamesiske kandidater:
Disse er klinisk distinkte. En kontraindikationadvarsel baseret på "hepatisk svækkelse" gælder for alle med nedsat leverfunktion, ikke kun dem, der har oplevet fuldstændig organsvigt. Brug af suy gan indsnævrer den angivne population forkert. En patient med moderat hepatisk svækkelse, som læser suy gan, kan muligvis ikke genkende sig selv som den kontraindiceret befolkning.

Nogle kildesetninger er bevidst tvetydige. "Det er sygt" betyder noget fremragende i moderne engelsk slang, men det bevarer også stadig sin bogstavelige betydning (det vil sige væmmelig/frastødende), og spændingen mellem disse to betydninger er en del af, hvordan udtrykket kommunikerer. Udfordringen for en oversættelsesmodel er: bevarer du tvetydigheden, reducerer du den til den mest sandsynlige betydning, eller vælger du en og forpligter dig?


Modellerne i denne test er ikke alle ækvivalente. De spænder over forskellige arkitekturer, træningsregimer og implementeringskontekster. Runde 1-baseline omfatter modeller, der er bredt tilgængelige. Den udvidede pulje i runde 2 tilføjer flere af de nyeste premium-tier-modelvarianterne, der nu er tilgængelige for betalende brugere på MachineTranslation.com, det samme niveau af model, som ellers ville betyde en separat betalt konto hos hver enkelt udbyder.

Den udvidede pulje i runde 2 omfatter modeller, der er mere avancerede og tilgængelige for betalende brugere på MachineTranslation.com. Effekten af at udvide puljen er ikke ensartet. I nogle tests (formalitet/japansk) skiftede det konsensus betydeligt. I hos andre (medicinsk terminologi/vietnamesisk) blev splittelsen dybere.

Testdatapunkterne peger på to forskellige fejlkategorier, og de kræver forskellige reaktioner.
Kategori A: Tavse fejl. Formalitetsfejl, registerfejl, præcision inden for medicinsk terminologi: disse producerer output, der ser korrekte ud. Japaneren er grammatikalsk korrekt. Vietnamesen er flydende. Der er intet overfladesignal om, at noget gik galt. En ensproglig bruger, der læser en enkelt models output, har ingen måde at vide på, at modellen gjorde et registervalg, som en senior japansk direktør ville bemærke, eller at et klinisk udtryk blev indsnævret på en måde, der ændrer den befolkning, det gælder for.
Kategori B: Synlige fejl. MiniMax oversætter "burning the midnight oil" som "burning torches." GPT-4.1-NANO løser "That's sick" til det utvetydige "すごい." Disse er påviselige, enten af en taler af målsproget eller ved sammenligning med andre modeloutput.
Sammenligningen af flere modeller, som SMART giver, er mest værdifuld i kategori A. Når fem eller ti modeller producerer output, og de fleste er enige om et formelt register, mens én producerer uformelt almindeligt japansk, er uenigheden synlig i sammenligningsvisningen. En bruger, der taler målsproget, kan evaluere mulighederne. En bruger, der ikke kan se, at en omstridt beslutning blev truffet, kan beslutte, hvorvidt denne sætning kræver menneskelig gennemgang.
For dokumentskala-arbejde, store filer, layoutbevarende oversættelse af PDF'er, kontrakter eller kliniske materialer, håndterer platformens dokumentbehandlingsevne filstruktur uden at ødelægge formateringen. Men kvalitetsspørgsmålene rejst ovenfor gælder uanset filstørrelse. En 100-siders klinisk undersøgelse, hvor hver forekomst af "hepatic impairment" er oversat som "lever failure", er en større version af det samme problem, der blev identificeret i Test 2.
For de medicinske og juridiske kategorier specifikt er menneskelig verifikation den korrekte sikkerhedsventil. Tomedes' AI Post-Editing-service, som kombinerer AI-output med certificeret menneskelig gennemgang for præcis denne type højrisiko-indhold, er bygget til dette. Suy gan / suy giảm chức năng gan-opdelingen er præcis den slags fund, der burde udløse denne gennemgang, ikke fordi alle modeller er forkerte, men fordi de modeller, der er mest sikre, ikke er de mest præcise.
Værdien ved at se flere resultater er ikke, at du altid vil vælge flertallet. Det er, at du vil vide, at der blev truffet et valg, hvilket er anderledes end at antage, at det output, du har foran dig, er korrekt.

Sæt de otte test side om side, og et mønster holder stand: enighed og uenighed er ikke tilfældigt fordelt. Idiomatisk, hverdagssprog inden for erhverv ("touch base," "burning the midnight oil") konvergerede på tværs af næsten alle modeller i puljen, i begge runder. Formalitet, juridisk præcision og medicinsk terminologi gjorde ikke. CEO-formalitetstesten skiftede fra uformelt til formelt kun når den udvidede pulje blev inkluderet. Erstatningsklausulen afslørede en reel juridisk skelnen (fritagelse vs. erstatning), som kun én model i én runde fik rigtigt. Den medicinske terminologi-opdeling blev aldrig løst overhovedet, og forblev på cirka 6-til-4 på tværs af begge runder uanset hvilke modeller der var i puljen.
Det er det faktiske resultat, ikke et marketingkrav: konsensus gør ikke hver sætning bedre, og det behøver det ikke. Det er mest værdifuldt præcis hvor en enkelt models flydende tale giver dig ingen grund til at tvivle på det, og hvor det faktisk koster noget at have uret.
Der er et andet, mere praktisk lag til denne test værd at sige klart. At køre denne sammenligning selv betød at kontrollere output fra GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo og MiniMax M2.7 side om side med de eksisterende baseline-modeller, på ét sted, på én platform. Uden for MachineTranslation.com er det ikke ét abonnement. Det er flere, en for hver udbyder, hvis premium-tier du vil teste, til hvad hver udbyder opkræver individuelt. Betalende brugere her får den samme sammenligning med ét klik, til en brøkdel af omkostningerne ved at vedligeholde fem separate premium-abonnementer, uden at opgive det, der faktisk betyder noget: at se hvor modellerne er enige, og vide præcis hvornår de ikke er det.
Ingen er kategorisk bedre; det afhænger af testkategorien. Claude Sonnet og Claude Opus valgte konsekvent det mere præcise vietnamesiske medicinsk udtryk, og Claude Opus producerede det mest passende slang for "That's sick." Men Claude Sonnet producerede også casual japansk i en formel CEO-kontekst sætning, hvor GPT-5.5 fik det rigtigt. At sammenligne resultater direkte er mere forsvarligt end at vælge én model og stole på den.
Der findes ikke én; nøjagtighed er domæneafhængig. Gemini 3.5-Flash og GLM-5-Turbo producerede det mest passende formelle japansk i denne test. Begge Claude-modeller var mest præcise på vietnamesisk medicinsk terminologi. DeepSeek V4-Pro var den eneste model, der brugte det korrekte japanske juridiske udtryk, men kun i runde 2, og den producerede uformelt japansk andre steder. Ingen enkelt model dominerede på tværs af alle otte test.
Nej, ikke automatisk. Udvidelsen af puljen med nyere premium-tier modelvarianterne skiftede konsensus fra uformelt til formelt i den japanske formalitetstest. Men i den vietnamesiske medicinske terminologitest forblev splittelsen på cirka 6-til-4 uanset hvilke modeller der blev inkluderet. Flere modeller fremkalder mere uenighed, hvilket er et brugbart signal, men konsensus følger stadig flertallet, og flertallet er ikke altid det mest præcise svar.
SMART er MachineTranslation.com's multi-model konsensussystem, der spænder over op til 22 AI-modeller fra udbydere som OpenAI, Anthropic, Google og DeepSeek. Det kører en oversættelse gennem flere modeller på samme tid og præsenterer flertalskonsensusudsendelsen sammen med hvert enkelt models svar som standard uden behov for konfiguration. Konsensus skifter, når modelpoolen skifter, som vist i denne tests japanske formalitetsresultat: en uformel konsensus i Runde 1 blev formel i Runde 2.
Ingen enkelt model; menneskelig gennemgang er det bedre svar. Claude-modeller valgte konsekvent det mere præcise vietnamesiske medicinsk udtryk, og kun DeepSeek V4-Pro brugte det korrekte japanske juridiske udtryk, men kun i Runde 2. Den medicinske terminologi-opdeling blev aldrig løst på tværs af 10 modeller, hvilket signalerer, at domæneekspertise er påkrævet, ikke at en anden model skal vælges. En certificeret menneskelig post-editing-gennemgang, som Tomedes tilbyder, giver denne specialistcheck.