June 5, 2026
Jeg har kørt interne tests på noget, vi ikke taler nok om i oversættelsesbranchen: ikke hvorvidt forskellige AI-systemer oversætter forskelligt, men hvorvidt forskellige versioner af den samme AI oversætter forskelligt – og hvor meget.
I sidste uge kørte jeg et enkelt spansk idiom gennem fem versioner af ChatGPT samtidig på MachineTranslation.com's interne testplatform. Det, der kom tilbage, stoppede mig.
To versioner producerede en oversættelse, der ærligt talt er nonsens på engelsk. Tre versioner producerede korrekte idiomatiske oversættelser. Og de tre korrekte var ikke enige med hinanden.
Alle fem er ChatGPT. Alle fem er OpenAI. Samme AI, anden model — og resultaterne kunne ikke være mere forskellige.
}Jeg deler dette nu, fordi jeg tror, det betyder noget, ikke fordi jeg har rene svar. Det gør jeg ikke. Men observationen er interessant nok til at blive bragt ud i verden.
fem GPT-versioner Frasen jeg testede var llevarse el gato al agua. Her er

hvad hver version producerede: ModelOutputIdiomatisk? ChatGPT::GPT-4o-MINIto
| carry | the cat | to the water❌ |
|---|---|---|
| Bogstavelig ChatGPT::GPT-4.1-NANOto | carry the cat to the water❌ Bogstavelig ChatGPT::GPT-4.1-MINIto | pull it |
| off successfully✅ | Korrekt ChatGPT::GPT-5.4-MINIto | get one's |
| way✅ Delvis ChatGPT::GPT-5.4to | come out on top✅ | Korrekt Frasen |
| betyder at | opnå noget | svært |
| mod alle | odds, | at |
vinde en svær sejr. Det har intet at gøre med katte eller vand. Den bogstavelige oversættelse er ikke en oversættelse. Det er en ord-for-ord transskription af en frase, som modellen ikke kunne genkende som et idiom.
GPT-4o-MINI og GPT-4.1-NANO producerede identiske resultater. Ikke ens, identisk. Vores oversættelsesindsigter markerede dette direkte: GPT-4.1-nano og GPT-4o-mini deler identiske oversættelser, hvilket understreger bogstavelig fortolkning frem for idiomatisk betydning.
GPT-4.1-MINI, GPT-5.4-MINI og GPT-5.4 producerede hver især noget genkendeligt korrekt – men ikke det samme som hinanden.
Jeg vil være præcis med hensyn til, hvorfor llevarse el gato al agua er en nyttig testinput snarere end en udvalgt én.
Det er et veletableret idiom. Det forekommer i litteratur, journalistik og daglig tale. Det er ikke obskurt. Enhver model trænet på et rimeligt korpus af spansk tekst burde have stødt på det. Spørgsmålet er ikke, om modellen har set sætningen. Spørgsmålet er, hvad den gør med det.
Den værste fejlform i idiom oversættelse er ikke at producere en dårlig oversættelse. Det producerer en bogstavelig oversættelse, der ser acceptabel ud for en person, der ikke kender målssproget.
To carry the cat to the water er grammatisk korrekt engelsk. Det er velformet. Det lyder som noget, der kunne betyde noget. En bruger, der ikke taler spansk, kunne læse det, nikke og gå videre — uden nogensinde at vide, at den oprindelige betydning var helt tabt.
Det er den fejlfunktion, jeg bekymrer mig om. Ikke den oplagte fejl. Den usynlige.
Mønsteret her er ikke tilfældigt. De to modeller, der producerede bogstavelige oversættelser (GPT-4o-MINI og GPT-4.1-NANO), er begge mindre, lettere modeller optimeret til hastighed og omkostningseffektivitet. De tre modeller, der producerede idiomatiske oversættelser (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), repræsenterer en anden generation eller parameterstørrelse.
Dette antyder noget, som jeg tror er uudforsket: idiomatisk kompetence i oversættelse skalerer med modelkapacitet på måder, der ikke er synlige i generelle benchmarks.
Generelle sprogbenchmarks tester ræsonnement, viden, kodning, matematik. De tester typisk ikke, om en model kan identificere , at det regner skomagerdrenge ikke handler om vejrforhold, eller at llevarse el gato al agua ikke handler om at hydrere en kat. Idiomer sidder i krydsfeltet mellem kulturel viden, kontekstuel inferens og mønstergenkendelse — og det krydsfelt synes at kræve en tærskel af modelkapacitet, som mindre modeller ikke konsekvent når.
Hvad jeg ikke hævder: at større modeller altid er bedre oversættere. Jeg har ikke beviser for det som en generel regel. Hvad jeg observerer: at for idiomatisk indhold specifikt, var forskellen inden for familien større, end jeg havde forventet.
De fleste brugere, der bruger et AI-oversættelsesværktøj, ved ikke, hvilken version af den AI de bruger. De åbner et produkt, vælger et sprogpar og får et output. Model-routing er usynlig for dem.
Dette betyder noget i stor skala. MachineTranslation.com behandlede over hundredtusindvis af engelsk-til-spansk oversættelsesopgaver i en enkelt 90-dages periode. Hvis en betydelig del af disse job berørte idiomatisk indhold (marketingtekster, juridisk sprog, litterær tekst, afslappet kommunikation), og værktøjet, der dirigerede disse job, sendte brugerne til en mindre model uden deres viden, så optrådte at bære katten til vandet i reelle resultater, i reelle dokumenter, for rigtige mennesker, der stolede på resultatet.
Oversættelsesindustrien har brugt år på at sammenligne AI-udbydere. DeepL versus Google. Claude versus ChatGPT. Disse sammenligninger er nyttige. Men inden for en enkelt udbyder kan versionsforskellen være lige så betydelig — og det er en forskel, som de fleste sammenligningsrammer ikke måler, fordi de ikke tester på model-versionsniveau. Når nogen siger Jeg bruger ChatGPT til oversættelse, er den sætning ikke
specifik nok til at være meningsfuld. Hvilken ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Svaret ændrer outputtet på måder , der er ikke-trivielle, i hvert fald for idiomatisk indhold.
Dette er den del, jeg finder mest interessant, og jeg har endnu ikke helt fundet ud af, hvad jeg skal mene om den.
De tre modeller, der producerede idiomatiske oversættelser, gav tre forskellige:
Alle tre er acceptable engelske gengivelser af llevarse el gato al agua. Men de er ikke ækvivalente.
At få det til at lykkes understreger udførelse mod vanskelighed, du gjorde noget svært, og det lykkedes. At få sin viljelægger vægt på det resultat, du ønskede, blev opnået, med mindre vægt på vanskeligheden. At komme ud på toppen understreger konkurrencemæssig sejr, at vinde i forhold til andre.
Det oprindelige spanske idiom ligger tættest på den første af disse. Udtrykket indebærer en overvindelse af modstand, ikke blot at foretrække et udfald og få det til at ske. Men at få sin vilje og komme ud på toppen er ikke forkert, de er bare upræcise i forskellige retninger. Dette rejser et spørgsmål, som jeg finder oprigtigt svært: når tre modeller hver
producerer en korrekt, men forskellig idiomatisk oversættelse, hvordan vurderer man så, hvilken der er bedst? BLEU-scorer sammenlignes med en referenceoversættelse – men hvem skrev referencen, og hvilken af disse tre ville de have valgt?
Vores AI-oversættelsesagent stillede, til dens ære, det rigtige spørgsmål før den forpligtede sig til noget output: Hvad er den tilsigtede betydning af 'llevarse el gato al agua' i denne sammenhæng? Tre muligheder blev tilbudt — at opnå et svært mål, at tage noget unødvendigt, eller at engagere sig i en risikabel aktivitet. Det spørgsmål er ikke dekorativt. Det er mekanismen, hvormed den kontekstuelle tvetydighed løses, før oversættelsen er færdiggjort.
Men pointen står: tre korrekte svar, tre forskellige nuancer af mening. Oversættelsesevalueringsværktøjer er ikke bygget til denne form for nuance.
Jeg vil være ærlig omkring begrænsningerne af, hvad denne test viser.
Ét idiom, ét sprogpar, én dags intern testning. Det er ikke en undersøgelse. Det er en observation. Jeg ved ikke, om dette mønster (mindre modeller som standard er bogstavelige, større modeller som opnår idiomatisk) holder konsekvent på tværs af:
Jeg ved heller ikke, om dette er en stabil egenskab ved disse modeller, eller noget der skifter med opdateringer og finjustering. Modeludbydere udgiver ikke ændringslogs specifikt for oversættelse. En modelversion, der håndterer llevarse el gato al agua korrekt i dag, kan blive opdateret næste måned, og vi ville ikke have nogen måde at vide det på.
Hvad jeg ved: denne test producerede et resultat, der var interessant nok til, at jeg vil køre flere af dem, mere systematisk, på tværs af flere sprogpar og indholdstyper. Når jeg har mere at dele, vil jeg gøre det.
Jeg vil afslutte med de to spørgsmål, som denne test efterlod mig med. Jeg vil ikke svare dem, jeg har ikke dataene til det endnu. Men jeg tror, det er de rigtige spørgsmål at stille.
Først: ved hvilken parametergrænse bliver idiomatisk kompetence pålidelig?
Springet fra GPT-4o-MINI og GPT-4.1-NANO (begge bogstavelige) til GPT-4.1-MINI (idiomatisk) antyder, at der er en grænse et sted i parameterområdet mellem disse modelstørrelser, hvor idiom genkendelse tændes. Er det konsistent? Gælder det for idiomer på tværs af alle sprog, eller afhænger det af, hvor godt et sprog er repræsenteret i træningsdataene? Jeg ved det ikke. Men at vide ville være nyttigt for enhver, der bygger oversættelsesworkflows.
For det andet: Hvad koster modelversions-uklarhed brugere i stor skala?
Hvis en bruger sender 1.000 dokumenter om måneden gennem et værktøj, der ikke oplyser, hvilken modelversion der bruges (og nogle af disse dokumenter indeholder idiomatisk indhold), hvor ofte sker den bogstavelige fejl usynligt? Hvordan ville de vide det? Hvad er prisen, i reelle termer, for aldrig at finde ud af det?
Jeg tror, det er et vigtigere spørgsmål end de fleste af de hvilken AI er bedst til oversættelse sammenligninger, der i øjeblikket cirkulerer. Svaret er ikke brug den største model. Svaret kan være: vid, hvad du bruger, kør dine egne tests på dit eget indhold, og antag ikke, at én udbyders navn er en garanti for ensartet adfærd på tværs af deres model serie.
Det er i hvert fald, hvad jeg tager med fra denne test.
Baseret på denne ene test: mindre, effektivitetsoptimerede modeller inden for samme AI-familie standardiserede til bogstavelig oversættelse af et velkendt spansk idiom, mens større/nyere versioner af den samme model producerede korrekte idiomatiske gengivelser. Om dette holder på tværs af idiomkategorier og sprogpar er det næste spørgsmål. Jeg vil køre flere tests.
GPT-4.1-MINI, GPT-5.4-MINI og GPT-5.4 oversatte alle llevarse el gato al agua idiomatisk — men til forskellige engelske udtryk med subtilt forskellige konnotationer. Dette antyder , at kvaliteten af idiomatisk oversættelse har mindst to dimensioner: om modellen overhovedet genkender idiomet, og hvilket ækvivalent udtryk den vælger fra måls অ্যাসিড tilgængelige muligheder. Standard oversættelseskvalitetsmålinger adskiller ikke disse to dimensioner rent. Jeg tror, de burde.
Dette indlæg er baseret på intern test på MachineTranslation.com's udviklingsplatform. Test af multi-modelversionen, der vises her, er endnu ikke offentligt tilgængelig. Jeg deler fundet, fordi jeg synes, observationen er nyttig, uanset hvor du udfører dine oversættelser.