June 5, 2026
Olen teinud sisekatseid millegi kallal, millest me translatioinitööstuses piisavalt ei räägi: mitte selles, kas erinevad tehisintellekti süsteemid tõlgivad erinevalt, vaid selles, kas sama tehisintellekti erinevad versioonid tõlgivad erinevalt – ja kui palju.
Eelmisel nädalal lasin viie ChatGPT versiooni kaudu korraga läbi ühe hispaaniakeelse idioomi MachineTranslation.com-i sisekatseplatvormil. See, mis tagasi tuli, pani mind seisma.
Kaks versiooni andsid tulemuseks tõlke, mis on ausalt öeldes inglise keeles arusaamatu. Kolm versiooni andsid õiged idiomeetilised tõlked. Ja kolm õiget ei olnud omavahel kooskõlas.
Kõik viis on ChatGPT. Kõik viis on OpenAI. Sama tehisintellekt, erinev mudel — ja väljundid ei võiks olla erinevamad.
Jagan seda nüüd, sest arvan, et see on oluline, mitte sellepärast, et mul oleks selgeid vastuseid. Mina ei. Aga vaatlus on piisavalt huvitav, et maailma tuua.
Testitud fraas oli llevarse el gato al agua.

Siin on, mida iga versioon tootis:
| Mudel | Väljund | Idioomiline? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | kass veeni viima | ❌ Sõnaline |
| ChatGPT::GPT-4.1-NANO | kass veeni viima | ❌ Sõnaline |
| ChatGPT::GPT-4.1-MINI | saavutama selle edukalt | ✅ Õige |
| ChatGPT::GPT-5.4-MINI | saama oma tahtmist mööda | ✅ Osaline |
| ChatGPT::GPT-5.4 | peale jääma | ✅ Õige |
Fraas tähendab saavutama midagi rasket vastupidi ootustele, saavutama raske võidu. Sellel pole mingit pistmist kasside ega veega. Otsetõlge pole tõlge. See on sõna-sõnalt transkriptsioon fraasist, mida mudel ei suutnud ära tunda idioomina.
GPT-4o-MINI ja GPT-4.1-NANO tootsid identsed väljundid. Mitte sarnane, identne. Meie tõlkeanalüüs tuvastas selle otse: GPT-4.1-nano ja GPT-4o-mini jagavad identseid tõlkeid, rõhutades sõnasõnalist tõlgendamist idioomaatilise tähenduse asemel.
GPT-4.1-MINI, GPT-5.4-MINI ja GPT-5.4 tootsid igaüks midagi äratuntavalt õiget – aga mitte üksteisega sama.
Ma tahan täpselt selgitada, miks llevarse el gato al agua on kasulik testsisend, mitte valikuliselt valitud üks.
See on väljakujunenud idioom. See esineb kirjanduses, ajakirjanduses ja igapäevases kõnes. See ei ole ebaselge. Iga mudel, mis on treenitud mõistlikul hispaaniakeelsel tekstikorpusel , peaks sellega kokku puutuma. Küsimus ei ole selles, kas mudel on fraasi näinud. Küsimus on see, mida ta sellega teeb.
Halvim ebaõnnestumisviis idioomide tõlkimisel ei ole halva tõlke tootmine. See toodab sõnasõnalist tõlget, mis näeb välja vastuvõetav inimesele, kes sihtkeelt ei tunne.
To carry the cat to the water on grammatiliselt korrektne inglise keel. See on korrektne. See kõlab nagu midagi, mis võiks midagi tähendada. Hispaania keelt mitteoskav kasutaja võiks seda lugeda, noogutada ja edasi liikuda — teadmata, et algne tähendus oli täielikult kadunud.
See on see ebaõnnestumise režiim, millest ma hoolin. Mitte ilmne viga. Nähtamatu üks.
Siinne muster pole juhuslik. Kaks mudelit, mis tootsid sõnasõnalisi tõlkeid (GPT-4o-MINI ja GPT-4.1-NANO), on mõlemad väiksemad, kergemad mudelid, mis on optimeeritud kiiruse ja kulutõhususe jaoks. Kolm mudelit, mis tootsid idiomaatilisi tõlkeid (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), esindavad erinevat põlvkonda või parameetrite skaalat.
See viitab millelegi, mida ma arvan, et on vähe uuritud: idiomaatiline kompetentsus tõlkimisel kasvab koos mudeli võimekusega viisidel, mis ei ole üldistes võrdlustestides nähtavad.
Üldised keelevõrdlustestid testivad arutlust, teadmisi, kodeerimist, matemaatikat. Nad tavaliselt ei testi, kas mudel suudab tuvastada , et vihma sajab kasse ja koeri ei puuduta ilmastikuolusid, või et llevarse el gato al agua ei puuduta kassi niisutamist. Idioomid asuvad kultuuriteadmiste, kontekstuaalse järelduse ja mustrite äratundmise ristumiskohal — ja see ristumiskoht näib vajavat mudeli võimekuse lävendit, mida väiksemad mudelid ei suuda järjekindlalt ületada.
Mida ma ei väida: et suuremad mudelid on alati paremad tõlkijad. Mul pole selle kohta tõendeid üldise reeglina. Mida ma märkan: et just idioomilise sisu puhul oli perekonnasisese versiooni erinevus suurem, kui ma ootasin.
Enamik kasutajaid, kes kasutavad tehisintellekti tõlketööriista, ei tea, millist versiooni sellest tehisintellektist nad kasutavad. Nad avavad toote, valivad keelepaari ja saavad väljundi. Mudelite marsruutimine on nende jaoks nähtamatu.
See on oluline suuremahuliselt. MachineTranslation.com töötles ühe 90-päevase perioodi jooksul üle saja tuhande inglise-hispaania tõlketöö. Kui puudutas märkimisväärne osa neist töödest idioomilist sisu (turundustekstid, juriidiline keel, kirjanduslik tekst, vaba suhtlus) ja tööriist, mis neid töid suunas, suunas kasutajaid teadmata väiksemasse mudelisse, siis ilmus kassi vette kandmine tegelikes väljundites, tegelikes dokumentides, tegelikele inimestele, kes usaldasid tulemust.
Tõlkijate tööstus on aastaid võrrelnud AI pakkujaid. DeepL versus Google. Claude versus ChatGPT. Need võrdlused on kasulikud. Kuid ühe teenusepakkuja piires võib versioonide erinevus olla sama suur ning seda erinevust enamik võrdlusraamistikke ei mõõda, kuna nad ei testi mudeli versiooni tasemel. Kui keegi ütleb Ma kasutan tõlkimiseks ChatGPT-d, siis see lause ei
ole piisavalt täpne, et olla sisukas. Milline ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Vastus muudab väljundit viisidel , mis on mitte-triviaalsed, vähemalt idioomse sisu puhul.
See on osa, mis mind kõige rohkem huvitab ja ma pole veel täielikult aru saanud, mida sellest arvata.
Kolm mudelit, mis andsid idioomseid tõlkeid, andsid kolm erinevat tõlget:
Kõik kolm on õigustatud ingliskeelsed tõlked väljendile llevarse el gato al agua. Kuid need ei ole samaväärsed.
Selle õnnestumiseks rõhutab täitmist raskuse vastu, sa tegid midagi rasket ja see õnnestus. Oma tahtmist saada rõhutab soovitud tulemuse saavutamist, vähem rõhutades raskust. Peale jääma rõhutab konkurentsivõitu, võitu teiste suhtes.
Originaalne hispaaniakeelne väljend on kõige lähedasem esimesele neist. Väljendil on ülekaalu tähendus, mitte lihtsalt ühe tulemuse eelistamine ja selle realiseerumine. Aga saama oma tahtmist ja peale jääma ei ole valed, need on lihtsalt erinevates suundades ebatäpsed.
See tekitab küsimuse, mida pean ausalt raskeks: kui kolm mudelit annavad igaüks õige, kuid erineva idioomilise tõlke, kuidas hinnata, milline neist on parim? BLEU-skoorid võrreldakse ühe viittõlkega – aga kes selle viite kirjutas ja millise kolmest nad oleksid valinud?
Meie tehisintellekti tõlkija küsis oma au olla õige küsimuse enne mis tahes väljundi andmist: Mis on 'llevarse el gato al agua' kavatsuslik tähendus selles kontekstis? Pakuti kolme varianti – raske eesmärgi saavutamine, millegi mittevajaliku võtmine või riskantse tegevusega tegelemine. See küsimus ei ole dekoratiivne. See on mehhanism, mille abil kontekstuaalne ebaselgus lahendatakse enne tõlke lõpuleviimist.
Kuid punkt jääb: kolm õiget vastust, kolm erinevat tähendusvarjundit. Tõlke hindamise tööriistu ei ole loodud sellise nüansi jaoks.
tahan olla aus selle suhtes, mida see test näitab.
Üks idioom, üks keelepaar, üks päev sisekatsetusi. See ei ole uuring. See on tähelepanek. Ma ei tea, kas see muster (väiksemad mudelid vaikimisi sõnasõnalised, suuremad mudelid idiomaatilised) kehtib järjepidevalt:
Samuti ei tea ma, kas see on nende mudelite stabiilne omadus või midagi, mis muutub värskenduste ja täpsustamise käigus. Mudelite pakkujad ei avalda tõlkimisele spetsiifilisi muudatuste logisid. Mudeli versioon, mis käsitleb llevarse el gato al agua täna õigesti , võib järgmisel kuul uuendatud saada ja meil poleks sellest mingit aimu.
Mida ma tean: see test andis tulemuse, mis oli piisavalt huvitav , et tahan neid rohkem ja süstemaatilisemalt läbi viia, rohkemate keelepaaride ja sisutüüpide osas. Kui mul on rohkem jagada, siis jagan.
Lõpetan kahe küsimusega, mis see test mulle jättis. Ma ei vasta neile, mul pole selleks veel andmeid. Aga ma arvan, et need on õiged küsimused, mida esitada.
Esiteks: millise parameetri künnise juures muutub idioomiline pädevus usaldusväärseks?
Hüpe GPT-4o-MINI ja GPT-4.1-NANO (mõlemad sõnasõnalised) GPT-4.1-MINI (idioomiline) juurde viitab sellele, et nende mudelite suuruste vahelisel parameetrite vahemikus on mingi künnis, kus idioomide tuvastamine sisse lülitub. Kas see on järjepidev? Kas see kehtib idioomide kohta kõigis keeltes või sõltub see sellest, kui hästi on keel treeningandmetes esindatud? Ma ei tea. Kuid teadmine oleks kasulik kõigile, kes loovad tõlketöövooge.
Teiseks: kui palju maksab mudeliversiooni läbipaistmatus kasutajatele suures mahus?
Kui kasutaja suunab tööriista kaudu 1000 dokumenti kuus, mis ei avalda, millist mudeliversiooni kasutatakse (ja mõned neist dokumentidest sisaldavad idioomilist sisu), kui sageli toimub sõnasõnaline tõrge nähtamatult? Kust nemad teaksid? Mis on tegelik hind selle eest, et kunagi teada ei saa?
Minu arvates on see tähtsam küsimus kui enamik praegu ringlevatest võrdlustest teemal milline tehisintellekt on parim tõlkimiseks. Vastus ei ole kasuta suurimat mudelit. Vastus võib olla: tea, mida sa kasutad, tee oma teste oma sisuga ja ära eelda, et ühe pakkuja nimi on garantii järjepidevaks käitumiseks nende mudelite ulatuses.
See on vähemalt see, mida ma sellest testist välja võtan.
Selle ühe testi põhjal: väiksemad, efektiivsusele optimeeritud mudelid samast AI-perekonnast tõlkisid vaikimisi sõnasõnaliselt väljakujunenud hispaaniakeelset idioomi, samas kui suuremad/uuemad versioonid samast mudelist tootsid õigeid idiomaatilisi tõlkeid. Kas see kehtib idioomikategooriate ja keelepaaride puhul, on järgmine küsimus. Teen rohkem teste.
GPT-4.1-MINI, GPT-5.4-MINI ja GPT-5.4 tõlkisidllevarse el gato al agua idiomaticult — aga erinevatesse ingliskeelsetesse väljenditesse, millel olid peened erinevused tähendustes. See viitab , et idioomilise tõlke kvaliteedil on vähemalt kaks mõõdet: kas mudel tunneb idioomi üldse ära ja millise samaväärse väljendi see sihtkeele olemasolevate valikute hulgast valib. Standardse tõlkimise kvaliteedimõõdikud ei lahuta neid kahte mõõdet selgelt. Ma arvan, et nad peaksid.
See post põhineb ettevõtte MachineTranslation.com arendusplatvormi sisemisel testimisel. Siin näidatud mitme mudeli versioonitestimine ei ole veel avalikult saadaval. Jagan seda leidmisteavet, sest arvan, et tähelepanek on kasulik olenemata sellest, kus te oma tõlkeid teostate.