July 10, 2026
Två ord. Sex modeller. Tre olika översättningsbeslut. Här är vad som hände när jag körde 8 testmeningar genom de senaste AI-modellerna tillgängliga på MachineTranslation.com, och vad resultaten faktiskt avslöjar om när en modell misslyckas tyst.
Två ord. Det är sjukt. Sex modeller. Tre distinkta översättningsbeslut.
På japanska renderade en modell det som それはやばい, vilket bevarade tvetydigheten. En annan släppte subjektspronomenet helt och skrev den nakna formen やばい, den mest vardagliga versionen möjlig. En tredje skrev それはすごい, vilket löser tvetydigheten helt till förmån för "fantastisk," och tar bort den dubbla betydelsen som gjorde frasen intressant från början. På vietnamesiska skrev en modell Đỉnh vậy (slang, korrekt för ungdomsregister). En annan skrev Det är verkligen underbart, grammatiskt korrekt, men närmare att säga "det är verkligen underbar" när någon skickar dig ett meme.
Alla dessa är försvarsbara. Ingen av dem är samma sak. Och om du kör översättningar genom en enda modell kommer du aldrig att se det val som gjordes för din räkning.
Det är den centrala frågan som denna artikel försöker besvara. Inte vilken AI-modell som är bäst för översättning 2026 (svaret beror på språkpar, register, domän och meningsstruktur), utan snarare: hur skulle du veta när din modell gjorde fel? Särskilt inom områden som medicinsk terminologi, juridiska kontrakt eller professionell formalitet, där det felaktiga valet ser ut exakt som en korrekt översättning tills en specialist läser det.
Här är vad jag gjorde. Jag körde 8 testmeningar genom två omgångar av modeller på MachineTranslation.com: först en baslinje med 5 allmänt använda modeller, sedan en utökad pool som lägger till flera av de nyaste premiumklassade modellvarianter som nu är tillgängliga för betalande användare. Normalt skulle det innebära separata betalda prenumerationer hos varje leverantör för att jämföra utdata från modeller som denna. På MachineTranslation.com sitter de i samma jämförelsevyn. Språkparen var engelska→japanska och engelska→vietnamesiska. Meningskategorierna valdes specifikt för att stress-testa områden där modellavvikelser är mest konsekventiella: idiomatisk formulering, juridisk terminologi, medicinsk terminologi, formalitetskänslig kontext och avsiktlig semantisk tvetydighet.
En anmärkning om utvärderingsmetodologi: maskinöversättningsforskning har länge kämpat med hur man automatiskt poängsätter resultat. Mätvärden som BLEU och COMET mätt i WMT-delade uppgifter ger användbar aggregerad signal, men de är dåliga på att upptäcka registreringsfel, idiomfel och terminologisk precision, exakt de kategorier som är viktigast här. Det du är på väg att läsa är utdataanalys, inte ett BLEU-race.

Inte varje mening framhäver en meningsfull oenighet. Två av de åtta testerna, "Let's touch base once the dust settles on this deal" (→ japanska) och "We're burning the midnight oil to hit this launch date" (→ vietnamesiska), producerade högt överensstämmelse i båda omgångarna. Idiomen förstods korrekt som idiom. Ingen översatte "touch base" som att röra en fysisk bas. Ingen översatte "the dust settles" som sediment som faller.
Det är värt att stanna upp för: idiomatisk engelsk affärsspråk hanteras ganska väl av nuvarande gränsmodeller när idiomen är tillräckligt vanlig. Konsensus för "touch base" förblev stabil över båda rundorna; variationen var rent stilistisk, kring huruvida man skulle använda この件 (denna fråga), この取引 (denna affär), eller この案件 (detta ärende) för källfrasen.

Testet "att bränna midnattsolja" är där saker och ting blev mer intressanta. Alla modeller utom en förstod idiomatiska uttrycket korrekt. MiniMax M2.7, introducerad i Round 2, översatte "burning" bokstavligt, vilket producerade đốt đuốc, vilket betyder "brinnande facklor." Konsensus uteslöt det korrekt.

Japanska är ett formalitetsskiktat språk. Valet av verbändelse, pronomen och referentiell substantivform är inte stilistisk. Det signalerar relationen mellan talare och mottagare. Att skicka ett meddelande till din VD med informella verbformer är inte ett översättningsfel i grammatisk mening. Det är ett socialt misstag, och ett betydande sådant.
Kan du skicka det över? Tack, uppskattar det." Kontext: meddelande till en VD.

Konsensus skiftade när modellpoolen expanderade. Mekanismen är enkel: att lägga till modeller som korrekt läste formalitetskontexten skiftade majoriteten, och konsensus följde. Här är det fullständiga spektrumet av vad modellerna producerade i Omgång 2:

Det vietnamesiska registertestet avslöjade en annan typ av formalitetsfel, ett som är mer subtilt. Källmeningen: Hej, snabb fråga — är du ledig för att hoppa på ett samtal? Kontext: meddelande till en klient. Qwen i omgång 1 inkluderade "mình," ett förstagranspronomen som antyder en casual kamratlig vänskap på samma nivå. Alla andra modeller undvek helt och hållet förstagranspersonlig självreferens, vilket är det säkrare professionella valet. Viktigt är att Qwen korrigerade detta i Omgång 2 och tog bort "mình." Konsensus i båda rundorna uteslöt det.

Leverantörs-/klientskadeståndsklausulen är en standardklausul i kommersiella avtal: "Leverantören ska ersätta klienten för alla tredjepartsanspråk som uppstår från brott mot detta avtal."
I omgång 1 identifierade alla fem modellerna korrekt det juridiska registret och använde låneorden ベンダー (leverantör) och クライアント (kund), standard i japanska affärskontrakt med engelskt ursprung. Ett undantag: GPT-4.1-NANO använde 販売者 (säljare) och 顧客 (kund), legitima japanska ord som saknar den formella juridiska specificitet hos motsvarande låneord.
Det viktigare resultatet framkom i Omgång 2. Huvudskillnaden är mellan två ord:
Dessa är juridiskt olika begrepp. "Indemnify" specifikt betyder att skydda en part från tredjepartsansvar. 免責 är den korrekta juridiska termen. Alla Round 1-modeller användes 補償. I omgång 2 var DeepSeek V4-Pro den enda modellen som producerade 免責, och det gjorde den endast i omgång 2, inte omgång 1.

I ett kontrakt är 補償 och 免責 inte synonymer. En betyder "vi ersätter dig." Det andra betyder "du är skyddad från anspråket från början." Om en översättningsplattform använder 補償 där 免責 är korrekt, kommer en advokat som läser den japanska versionen inte att se samma avtal som den engelska versionen beskriver.
Detta är det viktigaste resultatet i datasetet. Testmeningen: "Denna medicin är kontraindicerad hos patienter med en historik av hepatisk skada." Källa: klinisk produktdokumentation. Mål: Vietnamese.
Kritisk term är "hepatisk funktionsnedsättning." Det finns två vietnamesiska kandidater:
Dessa är kliniskt distinkta. En kontraindikationsvarning baserad på "hepatisk funktionsnedsättning" gäller för alla personer med nedsatt leverfunktion, inte bara de som har upplevt fullständigt organsvikt. Att använda suy gan begränsar den angivna populationen felaktigt. En patient med måttlig leverskada som läser suy gan kanske inte känner igen sig själv som den kontraindicerad population.

Vissa källmeningar är avsiktligt tvetydiga. "Det är sjukt" i samtida engelsk slang betyder något utmärkt, men det bär också fortfarande sin bokstavliga betydelse (det vill säga något äckligt/motbjudande), och spänningen mellan dessa två betydelser är en del av hur frasen kommunicerar. Utmaningen för en översättningsmodell är: bevarar du tvetydigheten, kollapsar du den till den mest sannolika betydelsen, eller väljer du en och förbinder dig?


Modellerna i detta test är inte alla likvärdiga. De sträcker sig över olika arkitekturer, träningsregimer och distributionssammanhang. Rund 1-utgångsvärdet innehåller modeller som är allmänt tillgängliga. Den utökade Round 2-poolen lägger till flera av de nyaste premiummodellvarianterna som nu är tillgängliga för betalande användare på MachineTranslation.com, samma nivå av modell som annars skulle innebära ett separat betalkonto hos varje enskild leverantör.

Den utökade poolen i Round 2 innehåller modeller som är mer avancerade och tillgängliga för betalande användare på MachineTranslation.com. Effekten av att utöka poolen är inte enhetlig. I några tester (formalitet/japanska) förskjöt det konsensus på ett meningsfullt sätt. Hos andra (medicinsk terminologi/vietnamesiska) fördjupades klyftan.

Testdata pekar på två distinkta felkategorier, och de kräver olika svar.
Kategori A: Tysta fel. Formella fel, registreringsfel, precision inom medicinsk terminologi: dessa producerar utdata som ser korrekta ut. Japanskan är grammatikalisk. Vietnamesen är flytande. Det finns ingen yttre signal på att något gick fel. En enspråkig användare som läser en enskild modells utdata har inget sätt att veta att modellen gjorde ett registerval som en högre japansk chef skulle märka, eller att en klinisk term begränsades på ett sätt som förändrar den population den gäller.
Kategori B: Synliga misslyckanden. MiniMax översätter "burning the midnight oil" som "burning torches." GPT-4.1-NANO löser "That's sick" till det entydiga "すごい." Dessa är upptäckbara, antingen av en talare av målspråket eller genom jämförelse med andra modellutmatningar.
Jämförelsen av flera modeller som SMART tillhandahåller är mest värdefull i kategori A. När fem eller tio modeller producerar utmatningar och de flesta är överens om ett formellt register medan en producerar vardaglig japansk grundform, är oenigheten synlig i jämförelsevyn. En användare som talar målspråket kan utvärdera alternativen. En användare som inte kan se att ett omtvistat beslut fattades kan bestämma om den meningen kräver mänsklig granskning.
För dokumentomfattande arbete, stora filer, layoutbevarande översättning av PDF-filer, kontrakt eller kliniska material, hanterar plattformens dokumentbehandlingskapacitet filstruktur utan att bryta formateringen. Men kvalitetsfrågor som tas upp ovan gäller oavsett filstorlek. En 100-sidors klinisk studie där varje förekomst av "hepatisk funktionsnedsättning" översätts som "leversvikt" är en större version av samma problem som identifierades i Test 2.
För de medicinska och juridiska kategorierna specifikt är mänsklig verifiering den korrekta säkerhetsmekanism. Tomedes' AI-efterredigeringstjänst, som kombinerar AI-utdata med certifierad mänsklig granskning för exakt denna typ av innehål med höga insatser, är byggd för detta. Suy gan / suy giảm chức năng gan-uppdelningen är exakt den typ av upptäckt som bör utlösa denna granskning, inte för att alla modeller är felaktiga, utan för att de modeller som är mest säkra inte är de mest exakta.
Värdet av att se flera utdata är inte att du alltid väljer majoriteten. Det är att du kommer att veta att ett val gjordes, vilket skiljer sig från att anta att resultatet framför dig är korrekt.

Ställ de åtta testerna sida vid sida och ett mönster håller: överenskommelse och oenighet är inte slumpmässigt fördelade. Idiomatisk, vardagligt affärsspråk ("ta kontakt," "arbeta långt in på natten") konvergerade över nästan alla modeller i poolen, i båda omgångarna. Formalitet, juridisk precision och medicinsk terminologi gjorde det inte. VD-formalitetstestet växlade från casual till formellt endast när den utökade gruppen inkluderades. Indemnifieringsklausulen avslöjade en verklig juridisk skillnad (免責 vs. 補償) som endast en modell, i en omgång, fick rätt. Den medicinska terminologidelningen löste sig aldrig alls, utan stannade på ungefär 6-till-4 över båda omgångarna oavsett vilka modeller som fanns i poolen.
Det är det faktiska resultatet, inte ett marknadsföringspåstående: konsensus gör inte varje mening bättre, och det behöver det inte. Det är mest värdefullt precis där en enskild modells flytande språk inte ger dig någon anledning att tvivla på den, och där det faktiskt kostar något att ha fel.
Det finns ett andra, mer praktiskt lager till detta test som är värt att säga tydligt. Att köra denna jämförelse själv innebar att kontrollera utdata från GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo och MiniMax M2.7 sida vid sida med de befintliga baslinjmodellerna, på ett ställe, på en plattform. Utanför MachineTranslation.com är det inte en prenumeration. Det är flera, en för varje leverantör vars premiumtier du vill testa, till vilket pris varje leverantör debiterar individuellt. Betalande användare här får samma jämförelse med ett klick, till en bråkdel av vad det skulle kosta att underhålla fem separata premiumabonnemang, utan att ge upp det som faktiskt spelar roll: att se var modellerna är överens, och veta exakt när de inte är det.
Ingen är kategoriskt bättre; det beror på testkategorin. Claude Sonnet och Claude Opus valde konsekvent den mer exakta vietnamesiska medicinska termen, och Claude Opus producerade den mest lämpliga slangen för "Det är sjukt." Men Claude Sonnet producerade också casual japanska i en formell VD-kontextsats, där GPT-5.5 fick det rätt. Att jämföra utdata direkt är mer försvarbart än att välja en modell och lita på den.
Det finns ingen; noggrannheten är domänberoende. Gemini 3.5-Flash och GLM-5-Turbo producerade det mest lämpliga formella japanskan i detta test. Båda Claude-modellerna var mest exakta på vietnamesisk medicinsk terminologi. DeepSeek V4-Pro var den enda modellen som använde den korrekta japanska juridiska termen, men bara i Omgång 2, och den producerade vardaglig japanska på andra ställen. Ingen enskild modell dominerade över alla åtta tester.
Nej, inte automatiskt. Utökningen av poolen med nyare premiumtiermodellvarianter skiftade konsensus från casual till formell i det japanska formalitetstestet. Men i det vietnamesiska medicinska terminologitestet bestod splittringen på ungefär 6-till-4 oavsett vilka modeller som inkluderades. Fler modeller framkallar mer oenighet, vilket är en användbar signal, men konsensus följer fortfarande majoriteten, och majoriteten är inte alltid det mest exakta svaret.
SMART är MachineTranslation.com:s multi-modell-konsensussystem som sträcker sig över upp till 22 AI-modeller från leverantörer inklusive OpenAI, Anthropic, Google och DeepSeek. Det kör en översättning genom flera modeller samtidigt och visar majoritetskonsensutsignalen tillsammans med varje enskild modells svar, som standard, utan någon konfiguration som behövs. Konsensus förändras när modellpoolen förändras, vilket visas i detta tests japanska formilitetsresultat: en informell konsensus i Omgång 1 blev formell i Omgång 2.
Ingen enskild modell; mänsklig granskning är det bättre svaret. Claude-modeller valde konsekvent den mer precisa vietnamesiska medicinska termen, och endast DeepSeek V4-Pro använde den korrekta japanska juridiska termen, men bara i Omgång 2. Den medicinska terminologin delades aldrig upp på ett löst sätt över 10 modeller, vilket signalerar att domänexpertis krävs, inte att en annan modell bör väljas. En certifierad mänsklig efterredigeringsgranskning, som Tomedes erbjuder, ger den specialistkontrollen.