June 5, 2026
Jag har kört interna tester på något vi inte pratar tillräckligt mycket om inom översättningsbranschen: inte huruvida olika AI-system översätter olika, utan huruvida olika versioner av samma AI översätter olika – och hur mycket.
Förra veckan körde jag ett enda spanskt idiom genom fem versioner av ChatGPT samtidigt på MachineTranslation.com:s interna testplattform. Vad som kom tillbaka fick mig att stanna upp.
Två versioner producerade en översättning som är, genuint, nonsens på engelska. Tre versioner producerade korrekta idiomatiska översättningar. Och de tre korrekta var inte överens med varandra.
Alla fem är ChatGPT. Alla fem är OpenAI. Samma AI, olika modell — och resultaten kunde inte vara mer olika.
Jag delar detta nu för att jag tror att det spelar roll, inte för att jag har rena svar. Det gör jag inte. Men observationen är intressant nog att sätta i världen.
Frasen jag testade var llevarse el gato al agua.

Här är vad varje version producerade:
| Modell | Utdata | Idiomatiskt? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | att bära katten till vattnet | ❌ Bokstavligt |
| ChatGPT::GPT-4.1-NANO | att bära katten till vattnet | ❌ Bokstavligt |
| ChatGPT::GPT-4.1-MINI | att lyckas med det | ✅ Korrekt |
| ChatGPT::GPT-5.4-MINI | att få sin vilja igenom | ✅ Delvis |
| ChatGPT::GPT-5.4 | att gå segrande ur striden | ✅ Korrekt |
Frasen betyder att uppnå något svårt mot alla odds, att vinna en svår seger. Det har inget att göra med katter eller vatten. Den bokstavliga översättningen är inte en översättning. Det är en ord-för-ord transkription av en fras som modellen misslyckades med att känna igen som ett idiom.
GPT-4o-MINI och GPT-4.1-NANO producerade identiska utdata. Inte liknande, identiska. Våra översiktsinsikter flaggade detta direkt: GPT-4.1-nano och GPT-4o-mini delar identiska översättningar, med betoning på bokstavlig tolkning framför idiomatiskt betydelse.
GPT-4.1-MINI, GPT-5.4-MINI och GPT-5.4 producerade var och en något igenkännbart korrekt – men inte samma som varandra.
Jag vill vara exakt med varför llevarse el gato al agua är en användbar testinput snarare än en utvald.
Det är ett väletablerat idiom. Det förekommer i litteratur, journalistik och vardagligt tal. Det är inte oklart. Varje modell som tränats på en rimlig korpus av spansk text borde ha stött på den. Frågan är inte om modellen har sett frasen. Frågan är vad den gör med det.
Det värsta misslyckandet vid idiomöversättning är inte att producera en dålig översättning. Det ger en bokstavlig översättning som ser acceptabel ut för någon som inte kan målspråket.
To carry the cat to the water är grammatiskt korrekt engelska. Det är välformulerat. Det låter som något som skulle kunna betyda något. En användare som inte talar spanska kanske läser det, nickar och går vidare — utan att någonsin veta att den ursprungliga betydelsen helt hade gått förlorad.
Det är det felaktiga beteende jag bryr mig om. Inte det uppenbara felet. Den osynliga.
Mönstret här är inte slumpmässigt. De två modellerna som producerade bokstavliga översättningar (GPT-4o-MINI och GPT-4.1-NANO) är båda mindre, lättare modeller optimerade för snabbhet och kostnadseffektivitet. De tre modellerna som producerade idiomatiska översättningar (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) representerar en annan generation eller parametrisk skala.
Detta antyder något som jag tycker är outforskat: att idiomatiska kompetenser i översättning skalar med modellkapacitet på sätt som inte är synliga i allmänna riktmärken.
Allmänna språkriktmärken testar resonemang, kunskap, kodning, matematik. De testar vanligtvis inte om en modell kan identifiera att det regnar katt och hund inte handlar om väderförhållanden, eller att llevarse el gato al agua inte handlar om att hydrera en katt. Idiom ligger i skärningspunkten mellan kulturell kunskap, kontextuell inferens och mönsterigenkänning — och den skärningspunkten verkar kräva en tröskel av modellkapacitet som mindre modeller inte konsekvent klarar.
Vad jag inte hävdar: att större modeller alltid är bättre översättare. Jag har inga bevis för det som en generell regel. Vad jag observerar: att för idiomatiskt innehåll specifikt, var klyftan mellan versioner inom familjen större än jag förväntade mig.
De flesta användare som använder ett AI-översättningsverktyg vet inte vilken version av den AI:n de använder. De öppnar en produkt, väljer ett språkpar och får en utdata. Modellrutningen är osynlig för dem.
Detta spelar roll i stor skala. MachineTranslation.com bearbetade över hundratusentals engelsk-till-spanska översättningsjobb under en enda 90-dagarsperiod. Om en betydande del av dessa jobb rörde idiomatisk innehåll (marknadsföringstexter, juridiskt språk, litterära texter, vardaglig kommunikation) och verktyget som dirigerade dessa jobb skickade användare till en mindre modell utan deras vetskap, då dök att bära katten till vattnet upp i verkliga resultat, i verkliga dokument, för verkliga människor som litade på resultatet. Översättningsbranschen har spenderat år på att jämföra AI-leverantörer. DeepL kontra Google.
Claude mot ChatGPT. Dessa jämförelser är användbara. Men inom en enda leverantör kan versionsskillnaden vara lika betydande — och det är en skillnad som de flesta jämförelse ramverk inte mäter eftersom de inte testar på modellversionsnivå. När någon säger Jag använder ChatGPT för översättning, är den meningen inte tillräckligt
specifik för att vara meningsfull. Vilken ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Svaret ändrar utdatan på sätt som är icke-triviala, åtminstone för idiomatiskt innehåll.
Det här är den del jag tycker är mest intressant, och jag har inte helt kommit underfund med vad jag ska tycka om det än.
De tre modellerna som producerade idiomatiska översättningar gav tre olika:
Alla tre är försvarbara engelska återgivningar av llevarse el gato al agua. Men de är inte likvärdiga.
Att lyckas med det betonar utförande mot svårighet, du gjorde något svårt och det fungerade. Att få sin vilja igenom betonar resultatet du ville uppnå, med mindre betoning på svårigheten. Att komma ut på topp betonar tävlingsseger, att vinna i förhållande till andra.
Det ursprungliga spanska idiom ligger närmast det första av dessa. Uttrycket har konnotationen av att övervinna motstånd, inte bara att föredra ett utfall och få det att förverkligas. Men att få sin vilja igenom och att gå segrande ur striden är inte fel, de är bara oprecisa åt olika håll. Detta väcker en fråga som jag finner genuint svår: när tre modeller var och en
producerar en korrekt men distinkt idiomatisk översättning, hur bedömer man vilken som är bäst? BLEU-poäng jämförs mot en referensöversättning – men vem skrev referensen, och vilken av dessa tre skulle de ha valt?
Vår AI-översättningsagent, till dess förtjänst, ställde rätt fråga innan den åtog sig någon utdata: Vad är den avsedda innebörden av att ta katten till vattneti den här kontexten? Tre alternativ erbjöds – att uppnå ett svårt mål, att ta något onödigt, eller att engagera sig i en riskabel aktivitet. Den frågan är inte dekorativ. Det är mekanismen genom vilken den kontextuella tvetydigheten löses innan översättningen slutförs.
Men poängen kvarstår: tre korrekta svar, tre olika nyanser av mening. Översättningsutvärderingsverktyg är inte byggda för den här typen av nyanser.
Jag vill vara ärlig om begränsningarna för vad det här testet visar.
Ett idiom, ett språkpar, en dags intern testning. Det där är inte en studie. Det är en observation. Jag vet inte om det här mönstret (mindre modeller som standardmässigt är bokstavliga, större modeller som uppnår idiomatiska) håller konsekvent över:
Jag vet inte heller om detta är en stabil egenskap hos dessa modeller eller något som skiftar med uppdateringar och finjustering. Modelleverantörer publicerar inte ändringsloggar specifika för översättning. En modellversion som hanterar llevarse el gato al agua korrekt idag kan uppdateras nästa månad, och vi skulle inte ha något sätt att veta det.
Vad jag vet: det här testet gav ett resultat som var intressant nog att jag vill köra fler av dem, mer systematiskt, över fler språkpar och innehållstyper. När jag har mer att dela med mig av, kommer jag att göra det.
Jag avslutar med de två frågorna som detta test lämnade mig med. Jag kommer inte att svara dem, jag har inte data för det än. Men jag tror att det är rätt frågor att ställa.
Först: vid vilken parametertröskel blir idiomatisk kompetens tillförlitlig?
Hoppet från GPT-4o-MINI och GPT-4.1-NANO (båda bokstavliga) till GPT-4.1-MINI (idiomatiskt) antyder att det finns en tröskel någonstans i parameterintervallet mellan dessa modellstorlekar där igenkänning av idiom slås på. Är det konsekvent? Gäller det för idiom över alla språk, eller beror det på hur välrepresenterat ett språk är i träningsdatan? Jag vet inte. Men att veta skulle vara användbart för alla som bygger översättningsarbetsflöden.
För det andra: vad kostar modellversionsopacitet användare i stor skala?
Om en användare dirigerar 1 000 dokument per månad genom ett verktyg som inte avslöjar vilken modellversion som används (och vissa av dessa dokument innehåller idiomatiskt innehåll), hur ofta sker det bokstavliga misslyckandet osynligt? Hur skulle de veta det? Vad är kostnaden, i reala termer, för att aldrig få reda på det?
Jag tror att detta är en viktigare fråga än de flesta av de vilken AI är bäst för översättning jämförelser som för närvarande cirkulerar. Svaret är inte använd den största modellen. Svaret kan vara: vet vad du använder, kör dina egna tester på ditt eget innehåll, och anta inte att en leverantörs namn är en garanti för konsekvent beteende över deras modell utbud.
Det är åtminstone vad jag tar med mig från det här testet.
Baserat på detta enda test: mindre, effektivitetsoptimerade modeller inom samma AI-familj standardiserade till bokstavlig översättning av ett väletablerat spanskt idiom, medan större/nyare versioner av samma modell producerade korrekta idiomatiska återgivningar. Huruvida detta gäller för idiomkategorier och språkpar är den nästa frågan. Jag kommer att köra fler tester.
GPT-4.1-MINI, GPT-5.4-MINI och GPT-5.4 översatte alla llevarse el gato al agua idiomatiskt – men till olika engelska uttryck med subtilt olika konnotationer. Detta antyder att kvaliteten på idiomatiska översättningar har minst två dimensioner: huruvida modellen känner igen idiomet överhuvudtaget, och vilket motsvarande uttryck den väljer bland målspråkets tillgängliga alternativ. Standardöversättningskvalitetsmått separerar inte tydligt dessa två dimensioner. Jag tycker att de borde.
Detta inlägg baseras på intern testning på MachineTranslation.com:s utvecklingsplattform. Testning av multimodellversionen som visas här är ännu inte allmänt tillgänglig. Jag delar med mig av fyndet eftersom jag tror att observationen är användbar oavsett var du kör dina översättningar.