July 10, 2026

Hvilken AI-oversætter er mest præcis i 2026? Jeg testede 10 af de seneste AI-modeller

To ord. Seks modeller. Tre forskellige oversættelsesbeslutninger. Her er hvad der skete, da jeg kørte 8 testsetninger gennem de seneste AI-modeller, der er tilgængelige på MachineTranslation.com, og hvad outputs faktisk afslører om, hvornår en model fejler stiltiende.

Hvordan ville du overhovedet vide, hvornår din model gjorde det forkerte valg?

To ord. Det er sygt. Seks modeller. Tre forskellige oversættelsesbeslutninger.

På japansk blev det i én model gengivet som それはやばい, hvilket bevarede tvetydigheden. En anden udelukkede helt subjektpronomenet og skrev den bare form やばい, den mest mundtlig version, der er mulig. En tredje skrev それはすごい, hvilket løser tvetydigheden helt til fordel for "fantastisk," og fjerner dermed den dobbelte betydning, der gjorde udtrykket interessant fra starten. På dansk skrev en model på vietnamesisk Đỉnh vậy (slang, korrekt for ungdomsregisteret). En anden skrev Det er virkelig vidunderligt, grammatikalsk korrekt, men tættere på at sige "det er virkelig fantastisk" når nogen sender dig et meme.

Alle disse er forsvarlige. Ingen af dem er det samme. Og hvis du kører oversættelser gennem en enkelt model, vil du aldrig se det valg, der blev truffet på dine vegne.

Det er det centrale spørgsmål, som denne artikel forsøger at besvare. Ikke hvilket AI-model der er bedst til oversættelse i 2026 (svaret afhænger af sprogpar, register, domæne og sætningsstruktur), men snarere: hvordan ville du vide, når din model gjorde det forkert? Især inden for områder som medicinsk terminologi, juridiske kontrakter eller professionel formalitet, hvor det forkerte valg ser ud præcis som en korrekt oversættelse, indtil en specialist læser det.

Her er hvad jeg gjorde. Jeg kørte 8 testsætninger gennem to runder af modeller på MachineTranslation.com: først en baseline med 5 meget anvendte modeller, derefter en udvidet pulje, der tilføjer flere af de nyeste premium-tier modelvarianterne, der nu er tilgængelige for betalende brugere. Normalt ville det at sammenligne output fra modeller som denne betyde separate betalte abonnementer hos hver enkelt udbyder. På MachineTranslation.com sidder de i samme sammenligningsvisning. Sprogparene var engelsk→japansk og engelsk→vietnamesisk. Sætningskategorierne blev valgt specifikt for at stress-teste områder, hvor modeluenighed er mest konsekvential: idiomatisk formulering, juridisk terminologi, medicinsk terminologi, formalitetsfølsom kontekst og bevidst semantisk tvetydighed.

Metodologi

  • Sprogpar: Engelsk → Japansk, Engelsk → Vietnamesisk
  • Runde 1 (baseline): Claude Sonnet 4-6, DeepSeek V4-Pro, Qwen 3.7-Max, GPT-4.1-NANO, Gemini 3.1-Pro-Preview
  • Runde 2 (udvidet): Alle ovenstående + Claude Opus 4-7, GPT-5.5, Gemini 3.5-Flash, GLM-5-Turbo, MiniMax M2.7
  • Testkategorier: Idiomatisk formulering (2), Juridisk/faglig terminologi (2), Medicinsk terminologi (1), Formalitetsbetinget kontekst (2), Bevidst tvetydighed (1)
  • Hvad der blev målt: Oversættelsesoutput direkte, ikke redigeringstid, TER eller numeriske fejlrater. Hvor relevant, forklares forskelle lingvistisk.
  • SMART konsensus: Hver runde inkluderer platformens multi-model konsensusoutput. SMART spænder over op til 22 AI-modeller på tværs af udbydere og kører alle tilgængelige modeller samtidigt for at opnå en konsensusoverssættelse. Konsensus skifter, når modelpoolen skifter.

En bemærkning om evalueringsmetodologi: maskinoversættelsesforskning har længe kæmpet med, hvordan man automatisk scorer output. Målinger som BLEU og COMET som målt i WMT-delte opgaver giver brugbart aggregeret signal, men de er dårlige til at opdage registerfejl, idiomfejl og terminologisk præcision, præcis de kategorier, der betyder mest her. Det, du er ved at læse, er outputanalyse, ikke et BLEU-løb.

Resultater på et øjeblik

Afsnit 1: Hvor alle modeller er enige, og hvorfor det også betyder noget

Ikke enhver sætning afslører en meningsfuld uenighed. To af de otte tests, "Lad os få kontakt, når støvet lægger sig på denne aftale" (→ japansk) og "Vi arbejder på højtryk for at nå denne lancering" (→ vietnamesisk), producerede høj enighed på tværs af begge runder. Idiomerne blev korrekt forstået som idiomer. Ingen oversatte "touch base" som at røre ved en fysisk base. Ingen oversatte "the dust settles" som sediment, der falder ned.

Det er værd at holde pause ved: idiomatisk engelsk forretningssprog håndteres rimelig godt af nuværende frontier-modeller, når idiomatikken er almindelig nok. Konsensus for "touch base" forblev stabil på tværs af begge runder; variation var rent stilistisk omkring, hvorvidt man skulle bruge この件 (dette spørgsmål), この取引 (denne handel) eller この案件 (denne sag) for kildefrasen.

Test 8: ‎"Lad os tage kontakt igen, når støvet har lagt sig om denne aftale." → japansk

Testen "at brænde midnatsolie" er der, hvor tingene blev mere interessante. Alle modeller på nær én forståede idiomatisk udtryk korrekt. MiniMax M2.7, introduceret i Runde 2, oversatte "burning" bogstaveligt, hvilket producerede đốt đuốc, betyder "brændende fakler." Konsensus udelukkede det korrekt.

Test 5: ‎"Vi brænder midnatsølien for at nå denne lanceringsdato." → vietnamesisk

Fund — Idiomer

Førende modeller håndterer generelt almindelige engelske forretningsidiomer korrekt på både japansk og vietnamesisk. Værdien af konsensus er højest på omstridte sætninger: formalitet, register og terminologi. På idiomtests tjener konsensus stadig sit formål ved at markere ægte afvigere (MiniMax's bogstavelige "brændende fakler" fejler), men den overordnede pulje er allerede enig.

Afsnit 2: Formalitetskløften

Japansk er et formalitetslag-sproget. Valget af verbum-endelse, pronomen og referentiel substantivform er ikke stilistisk. Det signalerer forholdet mellem taler og modtager. At sende en besked til din administrerende direktør ved hjælp af uformelle verbformer er ikke en oversættelsesfejl i grammatisk forstand. Det er en social fejl, og en betydelig sådan.‎

Kan du sende det over? Tak, jeg sætter pris på det." Kontekst: besked til en administrerende direktør.

Konsensus skiftede, da modelgruppen blev udvidet. Mekanismen er ligetil: tilføjelse af modeller, der korrekt læste formalitetskonteksten, skiftede flertallet, og konsensus fulgte efter. Her er det fulde spektrum af, hvad modellerne producerede i Runde 2:

Test 1: CEO sætning — fulde Round 2 modeludgange


Bemærkelsesværdig outlier — DeepSeek R2

DeepSeek V4-Pro i Round 2 producerede 送ってくれる?ありがとう、助かる。, almindelig form japansk. Det er det, du skriver til en tæt ven. Det er ikke et passende register for en besked til en administrerende direktør. Grundformen (くれる、助かる) fjerner alle høflighedsmarkører. Konsensus udelukkede det korrekt, men hvis dette var din eneste model, ville du sende en besked til din administrerende direktør svarende til en uformel tekstbesked.

Vietnamesisk registertesten afslørede en anden slags formalitetsfejl, en der er mere subtil. Kildesætningen: Hej, et hurtigt spørgsmål — har du tid til at hoppe på et opkald? Kontekst: besked til en klient. Qwen i Runde 1 inkluderede "mình," et førstepersons pronomen, der antyder uformel venskab på kammeratniveau. Alle andre modeller undgik helt og holdent førstepersons selvhenvisning, hvilket er det mere sikre professionelle valg. Afgørende var det, at Qwen korrigerede dette i Runde 2 og fjernede "mình." Konsensus i begge runder udelukkede det.

Test 6: ‎"Hej, hurtig spørgsmål — er du fri til at hoppe på et opkald?" → vietnamesisk


Fund — Registerfejl er usynlige uden sammenligning

Qwens fejl med "mình" er det klareste eksempel på, hvorfor oversættelse med kun én model er risikabel for kundevendt kommunikation: resultatet er flydende, grammatisk korrekt og naturligt klingende vietnamesisk. Der er intet at markere. Uden at se de fire andre modeller undgå førstepersons selvhenvisning, ville du ikke have noget signal om, at et registervalg blev foretaget.

Afsnit 3: Juridisk terminologi — problemet med ansvarsfritagelse

Leverandør-/klientgodtgøringssætningen er en standardklausul i kommercielle aftaler: ‎"**Leverandøren skal holde kunden skadesløs over for ethvert tredjepartskrav, der opstår som følge af misligholdelse af denne aftale."

I runde 1 identificerede alle fem modeller korrekt det juridiske register og brugte låneordene ベンダー (leverandør) og クライアント (kunde), som er standard i japanske erhvervskontrakter af engelsk oprindelse. En undtagelse: GPT-4.1-NANO brugte 販売者 (sælger) og 顧客 (kunde), legitime japanske ord, der mangler den formelle juridiske præcision af låneordækvivalenterne.

Det vigtigere fund dukkede op i Runde 2. Hovedskellet er mellem to ord:

  • 補償 (hoshō) — kompensere, refundere. At gøre nogen økonomisk hel efter et tab.
  • 免責 (menseki) — at fritages for ansvar; at holde skadesløs. At holde skadesløs over for tredjepartskrav, før de opstår.

Disse er juridisk forskellige begreber. ‎"Indemnify" betyder specifikt at beskytte en part mod tredjepartsansvar. Erstatningsansvar er det korrekte juridiske udtryk. Alle Round 1-modeller brugte 補償. I Runde 2 var DeepSeek V4-Pro den eneste model, der producerede 免責, og det gjorde den kun i Runde 2, ikke Runde 1.

Test 7: Ansvarsfritagelsesklausul → Japansk (vigtige resultater)


Konstatering — Juridisk register

DeepSeek i R2 er den eneste model, der bruger 免責, den juridisk præcise ækvivalent af "ansvarsfri". Alle andre modeller bruger 補償 (kompensere), som er semantisk relateret, men juridisk forskellig. Denne konstatering bliver kun synlig i anden runde, hvilket understreger, hvorfor en statisk, enkelt-rundes test med en fast modelpool kan misse vigtig varians.
Separat regrederer Qwen i R2 ved at skifte til 売主/買主 (sælger/køber), termer fra kommerciel salgsret snarere end serviceaftaler. Dette er en mindre passende formulering for en kontrakt, der bruger engelsk juridisk terminologi.

I en kontrakt er 補償 og 免責 ikke synonymer. En betyder "vi refunderer dig." Den anden betyder "du er beskyttet mod kravet fra start." Hvis en oversættelsesplatform bruger 補償 hvor 免責 er korrekt, vil en advokat, der læser den japanske version, ikke se den samme aftale, som den engelske version beskriver.

Afsnit 4: Medicinsk terminologi — splittelsen, der ikke blev løst

Dette er det vigtigste fund i datasættet. Testsætningen: ‎"Denne medicin er kontraindiceret hos patienter med en historie om hepatisk svækkelse." Kilde: klinisk produktdokumentation. Mål: Vietnamesisk.

Det kritiske udtryk er "hepatisk svækkelse." Der er to vietnamesiske kandidater:

  • suy gan — leversvigt. Refererer til alvorlig, akut eller kronisk slutstadium-leversvigt. En patient, der oplevede leversvigt.
  • suy giảm chức năng gan — nedsat/svækket leverfunktion. Refererer til enhver reduktion i leverfunktion, herunder mild eller moderat svækkelse.

Disse er klinisk distinkte. En kontraindikationadvarsel baseret på "hepatisk svækkelse" gælder for alle med nedsat leverfunktion, ikke kun dem, der har oplevet fuldstændig organsvigt. Brug af suy gan indsnævrer den angivne population forkert. En patient med moderat hepatisk svækkelse, som læser suy gan, kan muligvis ikke genkende sig selv som den kontraindiceret befolkning.

Test 2: Modstridende indikation sætning → Vietnamesisk (begge runder)


Kritisk fund: medicinsk terminologi

Opdelingen er 6 modeller for suy gan vs. 4 modeller for suy giảm chức năng gan i Runde 2. Flertallet, og dermed konsensus, vælger det mindre klinisk præcise udtryk. Begge Claude-modeller (Sonnet og Opus) vælger konsekvent suy giảm chức năng gan i begge runder. Splittelsen løses ikke, når puljen udvides.
Dette er det ene fund i dette datasæt, der mest direkte argumenterer for menneskelig ekspertgennemgang af medicinsk indhold. Konsensus er ikke forkert ved stemmeflertal. Det afspejler en ægte uenighed blandt grænsemodel, og denne uenighed er i sig selv information, som en oversætter har brug for at se. Dette er præcis den slags sag Tomedes' human-in-the-loop-gennemgang er bygget til.

Afsnit 5: ‎"Det er sygt" — hvad sker der, når tvetydighed er pointen

Nogle kildesetninger er bevidst tvetydige. ‎"Det er sygt" betyder noget fremragende i moderne engelsk slang, men det bevarer også stadig sin bogstavelige betydning (det vil sige væmmelig/frastødende), og spændingen mellem disse to betydninger er en del af, hvordan udtrykket kommunikerer. Udfordringen for en oversættelsesmodel er: bevarer du tvetydigheden, reducerer du den til den mest sandsynlige betydning, eller vælger du en og forpligter dig?

Japanske outputs


Vietnamesiske outputs


Fund: tvetydighed og samme-familie divergens

Claude Opus 4-7 skriver Đỉnh vậy (slang). Claude Sonnet 4-6 skriver Det er fantastisk (formelt). Dette er modsatrettede registerbeslutninger truffet af to modeller fra samme modelfamilie på det identiske twoordet input. Ingen af dem er "forkert." Tvetydigheden i "That's sick" betyder, at begge betydninger eksisterer. Men hvis dit målgruppe bruger nuværende vietnamesisk ungdomsslang, kommunikerer kun en af disse oversættelser korrekt. Konsensus gør uenigheden synlig. Uden det ved du ikke, at der blev truffet et valg.
På japansk er GPT-4.1-NANO den eneste model, der bruger すごい, som helt fjerner tvetydigheden til fordel for "fantastisk." Fem andre modeller bevarer det med やばい/ヤバい‎. Claude Opus tager den mest minimale form: bare やばい uden emne.

Afsnit 6: Hvordan modelpoolen ser ud

Modellerne i denne test er ikke alle ækvivalente. De spænder over forskellige arkitekturer, træningsregimer og implementeringskontekster. Runde 1-baseline omfatter modeller, der er bredt tilgængelige. Den udvidede pulje i runde 2 tilføjer flere af de nyeste premium-tier-modelvarianterne, der nu er tilgængelige for betalende brugere på MachineTranslation.com, det samme niveau af model, som ellers ville betyde en separat betalt konto hos hver enkelt udbyder.

Den udvidede pulje i runde 2 omfatter modeller, der er mere avancerede og tilgængelige for betalende brugere på MachineTranslation.com. Effekten af at udvide puljen er ikke ensartet. I nogle tests (formalitet/japansk) skiftede det konsensus betydeligt. I hos andre (medicinsk terminologi/vietnamesisk) blev splittelsen dybere.

Afsnit 7: Hvad det betyder, hvis du vælger en oversættelsesplatform

Testdatapunkterne peger på to forskellige fejlkategorier, og de kræver forskellige reaktioner.

Kategori A: Tavse fejl. Formalitetsfejl, registerfejl, præcision inden for medicinsk terminologi: disse producerer output, der ser korrekte ud. Japaneren er grammatikalsk korrekt. Vietnamesen er flydende. Der er intet overfladesignal om, at noget gik galt. En ensproglig bruger, der læser en enkelt models output, har ingen måde at vide på, at modellen gjorde et registervalg, som en senior japansk direktør ville bemærke, eller at et klinisk udtryk blev indsnævret på en måde, der ændrer den befolkning, det gælder for.

Kategori B: Synlige fejl. MiniMax oversætter "burning the midnight oil" som "burning torches." GPT-4.1-NANO løser "That's sick" til det utvetydige "すごい." Disse er påviselige, enten af en taler af målsproget eller ved sammenligning med andre modeloutput.

Sammenligningen af flere modeller, som SMART giver, er mest værdifuld i kategori A. Når fem eller ti modeller producerer output, og de fleste er enige om et formelt register, mens én producerer uformelt almindeligt japansk, er uenigheden synlig i sammenligningsvisningen. En bruger, der taler målsproget, kan evaluere mulighederne. En bruger, der ikke kan se, at en omstridt beslutning blev truffet, kan beslutte, hvorvidt denne sætning kræver menneskelig gennemgang.

For dokumentskala-arbejde, store filer, layoutbevarende oversættelse af PDF'er, kontrakter eller kliniske materialer, håndterer platformens dokumentbehandlingsevne filstruktur uden at ødelægge formateringen. Men kvalitetsspørgsmålene rejst ovenfor gælder uanset filstørrelse. En 100-siders klinisk undersøgelse, hvor hver forekomst af "hepatic impairment" er oversat som "lever failure", er en større version af det samme problem, der blev identificeret i Test 2.

For de medicinske og juridiske kategorier specifikt er menneskelig verifikation den korrekte sikkerhedsventil. Tomedes' AI Post-Editing-service, som kombinerer AI-output med certificeret menneskelig gennemgang for præcis denne type højrisiko-indhold, er bygget til dette. Suy gan / suy giảm chức năng gan-opdelingen er præcis den slags fund, der burde udløse denne gennemgang, ikke fordi alle modeller er forkerte, men fordi de modeller, der er mest sikre, ikke er de mest præcise.

Værdien ved at se flere resultater er ikke, at du altid vil vælge flertallet. Det er, at du vil vide, at der blev truffet et valg, hvilket er anderledes end at antage, at det output, du har foran dig, er korrekt.

Hvad otte sætninger faktisk fortalte mig

Sæt de otte test side om side, og et mønster holder stand: enighed og uenighed er ikke tilfældigt fordelt. Idiomatisk, hverdagssprog inden for erhverv ("touch base," "burning the midnight oil") konvergerede på tværs af næsten alle modeller i puljen, i begge runder. Formalitet, juridisk præcision og medicinsk terminologi gjorde ikke. CEO-formalitetstesten skiftede fra uformelt til formelt kun når den udvidede pulje blev inkluderet. Erstatningsklausulen afslørede en reel juridisk skelnen (fritagelse vs. erstatning), som kun én model i én runde fik rigtigt. Den medicinske terminologi-opdeling blev aldrig løst overhovedet, og forblev på cirka 6-til-4 på tværs af begge runder uanset hvilke modeller der var i puljen.

Det er det faktiske resultat, ikke et marketingkrav: konsensus gør ikke hver sætning bedre, og det behøver det ikke. Det er mest værdifuldt præcis hvor en enkelt models flydende tale giver dig ingen grund til at tvivle på det, og hvor det faktisk koster noget at have uret.

Der er et andet, mere praktisk lag til denne test værd at sige klart. At køre denne sammenligning selv betød at kontrollere output fra GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo og MiniMax M2.7 side om side med de eksisterende baseline-modeller, på ét sted, på én platform. Uden for MachineTranslation.com er det ikke ét abonnement. Det er flere, en for hver udbyder, hvis premium-tier du vil teste, til hvad hver udbyder opkræver individuelt. Betalende brugere her får den samme sammenligning med ét klik, til en brøkdel af omkostningerne ved at vedligeholde fem separate premium-abonnementer, uden at opgive det, der faktisk betyder noget: at se hvor modellerne er enige, og vide præcis hvornår de ikke er det.

Ofte stillede spørgsmål

1. Er ChatGPT eller Claude bedre til oversættelse?

Ingen er kategorisk bedre; det afhænger af testkategorien. Claude Sonnet og Claude Opus valgte konsekvent det mere præcise vietnamesiske medicinsk udtryk, og Claude Opus producerede det mest passende slang for "That's sick." Men Claude Sonnet producerede også casual japansk i en formel CEO-kontekst sætning, hvor GPT-5.5 fik det rigtigt. At sammenligne resultater direkte er mere forsvarligt end at vælge én model og stole på den.

2. Hvad er den mest præcise AI-oversættelsesmodel i 2026?

Der findes ikke én; nøjagtighed er domæneafhængig. Gemini 3.5-Flash og GLM-5-Turbo producerede det mest passende formelle japansk i denne test. Begge Claude-modeller var mest præcise på vietnamesisk medicinsk terminologi. DeepSeek V4-Pro var den eneste model, der brugte det korrekte japanske juridiske udtryk, men kun i runde 2, og den producerede uformelt japansk andre steder. Ingen enkelt model dominerede på tværs af alle otte test.

3. Betyder det at tilføje flere AI-modeller altid forbedrer oversættelsesnøjagtigheden?

Nej, ikke automatisk. Udvidelsen af puljen med nyere premium-tier modelvarianterne skiftede konsensus fra uformelt til formelt i den japanske formalitetstest. Men i den vietnamesiske medicinske terminologitest forblev splittelsen på cirka 6-til-4 uanset hvilke modeller der blev inkluderet. Flere modeller fremkalder mere uenighed, hvilket er et brugbart signal, men konsensus følger stadig flertallet, og flertallet er ikke altid det mest præcise svar.

4. Hvad er SMART, og hvordan fungerer det?

SMART er MachineTranslation.com's multi-model konsensussystem, der spænder over op til 22 AI-modeller fra udbydere som OpenAI, Anthropic, Google og DeepSeek. Det kører en oversættelse gennem flere modeller på samme tid og præsenterer flertalskonsensusudsendelsen sammen med hvert enkelt models svar som standard uden behov for konfiguration. Konsensus skifter, når modelpoolen skifter, som vist i denne tests japanske formalitetsresultat: en uformel konsensus i Runde 1 blev formel i Runde 2.

5. Hvilken AI-model er bedst til medicinsk eller juridisk oversættelse?

Ingen enkelt model; menneskelig gennemgang er det bedre svar. Claude-modeller valgte konsekvent det mere præcise vietnamesiske medicinsk udtryk, og kun DeepSeek V4-Pro brugte det korrekte japanske juridiske udtryk, men kun i Runde 2. Den medicinske terminologi-opdeling blev aldrig løst på tværs af 10 modeller, hvilket signalerer, at domæneekspertise er påkrævet, ikke at en anden model skal vælges. En certificeret menneskelig post-editing-gennemgang, som Tomedes tilbyder, giver denne specialistcheck.‎