June 5, 2026
Olen tehnyt sisäisiä testejä jostakin, mistä emme puhu tarpeeksi käännösalalla: ei siitä, kääntävätkö eri tekoälyjärjestelmät eri tavalla, vaan siitä, kääntävätkö saman tekoälyn eriversioteri tavalla – ja kuinka paljon.
Viime viikolla testasin yhtä espanjalaista idiomia viidellä ChatGPT-versiolla samanaikaisesti MachineTranslation.comin sisäisellä testialustalla. Mitä sain takaisin, pysäytti minut.
Kaksi versiota tuotti käännöksen, joka on todella järjetön englanniksi. Kolme versiota tuotti oikeat idiomatic käännökset. Ja kolme oikeaa eivät olleet keskenään yhtä mieltä.
Kaikki viisi ovat ChatGPT. Kaikki viisi ovat OpenAI. Sama tekoäly, eri malli — ja tulokset eivät voisi olla erilaisempia.
Jaan tämän nyt, koska mielestäni sillä on merkitystä, enkä siksi, että minulla olisi selkeitä vastauksia. En. Mutta havainto on riittävän mielenkiintoinen, jotta se tuodaan julki.
jota testasin, oli llevarse el gato al agua. Tässä on, mitä kukin versio

tuotti: MalliTulosteIdiomaattinen? ChatGPT::GPT-4o-MINIkantaa
| kissa | veteen❌ | Kirjaimellinen ChatGPT::GPT-4.1-NANOkantaa |
|---|---|---|
| kissa veteen❌ Kirjaimellinen ChatGPT::GPT-4.1-MINIonnistua | siinä✅ Oikein ChatGPT::GPT-5.4-MINIsaada | tahtonsa |
| läpi✅ Osittainen ChatGPT::GPT-5.4selviytyä | voittajana✅ Oikein Lause | tarkoittaa |
| vaikean | asian saavuttamista | vastoin |
| odotuksia, | kovan | voiton |
| saavuttamista. |
Sillä ei ole mitään tekemistä kissojen tai veden kanssa. Kirjaimellinen käännös ei ole käännös. Se on sana sanalta transkriptio lauseesta, jota malli ei tunnistanut idiomiksi.
GPT-4o-MINI ja GPT-4.1-NANO tuottivat identtiset tulosteet. Ei samanlainen, identtinen. Käännösvinkkimme tunnistivat tämän suoraan: GPT-4.1-nano ja GPT-4o-mini jakavat identtiset käännökset, korostaen kirjaimellista tulkintaa idiomeihin liittyvän merkityksen sijaan.
GPT-4.1-MINI, GPT-5.4-MINI ja GPT-5.4 tuottivat kukin jotain tunnistettavasti oikeaa – mutta eivät toistensa kaltaista.
Haluan olla tarkka siitä, miksi llevarse el gato al agua on hyödyllinen testisyöte eikä valikoitu sellainen.
Se on vakiintunut idiomi. Se esiintyy kirjallisuudessa, journalismissa ja arkipuheessa. Se ei ole hämärä. Mikä tahansa kohtuullisella espanjankielisellä tekstillä koulutettu malli olisi sen kohdannut. Kysymys ei ole siitä, onko malli nähnyt kyseisen ilmaisun. Kysymys on, mitä sillä tehdään.
Pahin epäonnistumistapa idiomien kääntämisessä ei ole huonon käännöksen tuottaminen. Se tuottaa kirjaimellisen käännöksen, joka näyttää hyväksyttävältä jollekin, joka ei tunne kohdekieltä.
Kantaa kissa veteen on kieliopillisesti oikeaa englantia. Se on muodollisesti oikein. Kuulostaa joltain, jolla voisi olla merkitystä. Espanjaa puhumaton käyttäjä saattaisi lukea sen, nyökätä ja jatkaa matkaansa – tietämättä, että alkuperäinen merkitys oli täysin kadonnut.
Tuo on se epäonnistumistila, josta välitän. Ei ilmeinen virhe. Näkymätön yksi.
Tämä kuvio ei ole satunnainen. Kahden mallin, jotka tuottivat kirjaimellisia käännöksiä (GPT-4o-MINI ja GPT-4.1-NANO), ovat molemmat pienempiä, kevyempiä malleja, jotka on optimoitu nopeuteen ja kustannustehokkuuteen. Kolme idiomaattisia käännöksiä tuottanutta mallia (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) edustavat eri sukupolvea tai parametrien skaalaa.
Tämä viittaa johonkin, mitä mielestäni ei ole tutkittu tarpeeksi: idiomaattinen osaaminen käännöksissä skaalautuu mallin kapasiteetin myötä tavoilla, jotka eivät näy yleisissä vertailuaineistoissa.
Yleiset kielivertailuaineistot testaavat päättelyä, tietoa, koodausta, matematiikkaa. Ne eivät tyypillisesti testaa, pystyykö malli tunnistamaan , että sataa kissoja ja koiria ei liity sääolosuhteisiin, tai että llevarse el gato al agua ei liity kissan nesteytykseen. Idiomit sijaitsevat kulttuurituntemuksen, asiayhteyteen perustuvan päättelyn ja kuvioiden tunnistamisen risteyksessä — ja tämä risteys näyttää vaativan mallin kapasiteetin kynnysarvoa, jota pienemmät mallit eivät johdonmukaisesti ylitä.
Mitä en väitä: että suuremmat mallit olisivat aina parempia kääntäjiä. Minulla ei ole todisteita siitä yleisenä sääntönä. Mitä minä havaitsen: että nimenomaan idiomaattisen sisällön kohdalla perheen sisäinen versioero oli suurempi kuin odotin.
Useimmat tekoälykäännöstyökalua käyttävät käyttäjät eivät tiedä, mitä versiota kyseisestä tekoälystä he käyttävät. He avaavat tuotteen, valitsevat kieliparin ja saavat tulosteen. Reititys on heille näkymätöntä.
Tällä on merkitystä laajassa mittakaavassa. MachineTranslation.com käsitteli yli satojatuhansia englanti-espanja-käännöstehtäviä yhden 90 päivän jakson aikana. Jos merkittävä osa näistä töistä koski idiomaticista sisältöä (markkinointitekstejä, lakikieltä, kirjallisia tekstejä, arkista viestintää) ja työkalu ohjasi käyttäjiä pienempään malliin heidän tietämättään, silloin kantaa kissa veteen ilmestyi todellisiin tuloksiin, todellisiin asiakirjoihin, todellisille ihmisille, jotka luottivat tulokseen.
Käännösteollisuus on käyttänyt vuosia vertaillen tekoälypalveluntarjoajia. DeepL vastaan Google. Claude vastaan ChatGPT. Nuo vertailut ovat hyödyllisiä. Mutta yhden palveluntarjoajan sisällä versioero voi olla yhtä merkittävä – ja se on ero, jota useimmat vertailukehykset eivät mittaa, koska ne eivät testaa malliversiotasolla. Kun joku sanoo Käytän ChatGPT:tä käännöksiin, tuo lause ei ole riittävän tarkka
ollakseen merkityksellinen. Mikä ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Vastaus muuttaa tulostetta tavoilla , jotka eivät ole merkityksettömiä, ainakaan idiomaticisen sisällön osalta.
Tämä on mielestäni mielenkiintoisin osa, enkä ole vielä täysin ymmärtänyt, mitä siitä pitäisi ajatella.
Kolme mallia, jotka tuottivat idiomaticisia käännöksiä, antoivat kolme erilaista käännöstä:
Kaikki kolme ovat puolustettavia englanninkielisiä käännöksiä ilmaisulle llevarse el gato al agua. Mutta ne eivät ole vastaavia.
Onnistua korostaa suorittamista vaikeuksia vastaan, teit jotain vaikeaa ja se toimi. Saada tahtonsa läpikorostaa haluamasi lopputuloksen saavuttamista, vähemmän korostaen vaikeutta. Pärjätä ylitse muiden korostaa kilpailullista voittoa, voittamista suhteessa muihin.
Alkuperäinen espanjalainen sanonta on lähimpänä ensimmäistä näistä. Ilmaisuun liittyy vastarinnan voittamisen merkitys, ei pelkästään yhden lopputuloksen suosiminen ja sen toteutuminen. Mutta saada tahtonsa läpi ja pärjätä eivät ole vääriä, ne ovat vain epätarkkoja eri suuntiin.
Tämä herättää kysymyksen, jonka koen aidosti vaikeaksi: kun kolme mallia tuottaa kukin oikean, mutta erilaisen idiomaticisen käännöksen, miten arvioit, mikä niistä on paras? BLEU-pisteet vertaavat yhteen vertailukäännökseen – mutta kuka kirjoitti vertailukäännöksen ja minkä näistä kolmesta he olisivat valinneet?
Tekoälykäännöstoimistomme kysyi ansionsa mukaan oikean kysymyksen ennen minkään tulosteen antamista: Mitä tarkoitetaan ilmauksella 'llevarse el gato al agua' tässä yhteydessä? Tarjolla oli kolme vaihtoehtoa – vaikean tavoitteen saavuttaminen, tarpeettoman asian ottaminen tai riskialttiiseen toimintaan ryhtyminen. Tuo kysymys ei ole koristeellinen. Se on mekanismi, jolla asiayhteydestä johtuva moniselitteisyys ratkaistaan ennen käännöksen viimeistelyä.
Mutta asia pysyy: kolme oikeaa vastausta, kolme erilaista merkityksen vivahteita. Käännösten arviointityökaluja ei ole rakennettu tämänkaltaista vivahteikkuutta varten.
Haluan olla rehellinen siitä, mitä tämä testi näyttää rajoitetusti.
Yksi idiomi, yksi kielipari, yksi päivä sisäistä testausta. Tuo ei ole tutkimus. Se on havainto. En tiedä, pitääkö tämä kuvio (pienemmät mallit oletuksena kirjaimellisia, suuremmat mallit idiomeja saavuttavia) johdonmukaisesti paikkansapitävänä:
En myöskään tiedä, onko tämä vakaa ominaisuus näissä malleissa vai jotain, joka muuttuu päivitysten ja hienosäädön myötä. Mallien tarjoajat eivät julkaise käännöskohtaisia muutostietoja. Malliversio, joka käsittelee llevarse el gato al agua oikein tänään, saatetaan päivittää ensi kuussa, emmekä tietäisi siitä mitään.
Mitä tiedän: tämä testi tuotti riittävän mielenkiintoisen tuloksen , että haluan suorittaa niitä enemmän, järjestelmällisemmin, useammilla kielipareilla ja sisältötyypeillä. Kun minulla on enemmän jaettavaa, jaan.
Lopetan kahdella kysymyksellä, jotka tämä koe jätti mieleeni. En vastaa niihin, minulla ei ole vielä tietoja siihen. Mutta uskon, että ne ovat oikeita kysymyksiä.
Ensinnäkin: millä parametrirajalla idiomatic competence tulee luotettavaksi?
Hyppy GPT-4o-MINI:stä ja GPT-4.1-NANO:sta (molemmat kirjaimellisia) GPT-4.1-MINI:hin (idiomatic) viittaa siihen, että mallikokojen välillä on jossain parametrialueella raja, jossa idiomin tunnistus kytkeytyy päälle. Onko se johdonmukaista? Koskeeko se idiomaattisia ilmaisuja kaikissa kielissä, vai riippuuko se siitä, kuinka hyvin kieli on edustettuna harjoitusdatassa? En tiedä. Mutta tieto olisi hyödyllinen kaikille käännöstyönkulkuja rakentaville.
Toiseksi: mitä malliversion läpinäkymättömyys maksaa käyttäjille laajassa mittakaavassa?
Jos käyttäjä reitittää 1 000 asiakirjaa kuukaudessa työkalun kautta, joka ei paljasta, mitä malliversiota käytetään (ja jotkin näistä asiakirjoista sisältävät idiomeja), kuinka usein kirjaimellinen virhe tapahtuu näkymättömästi? Mistä he tietäisivät sen? Mikä on todellinen hinta siitä, ettei koskaan saa tietää?
Mielestäni tämä on tärkeämpi kysymys kuin suurin osa tällä hetkellä kiertävistä mikä tekoäly on paras käännöksiin -vertailuista. Vastaus ei ole käytä suurinta mallia. Vastaus voi olla: tiedä mitä käytät, tee omat testit omalla sisällölläsi, äläkä oleta, että yhden palveluntarjoajan nimi takaa yhdenmukaisen toiminnan heidän malliensa valikoimassa.
Ainakin näin minä tulkitsen tämän testin.
Tämän yhden testin perusteella: pienemmät, tehokkuusoptimoituneet mallit samasta tekoälyperheestä käänsivät oletusarvoisesti kirjaimellisesti vakiintuneen espanjankielisen idiomin, kun taas samojen mallien suuremmat/uudemmat versiot tuottivat oikeita idiomaticisia käännöksiä. Seuraava kysymys on, pitääkö tämä paikkansa kielikuvakategorioiden ja kieliparien välillä. Suoritan lisää testejä.
GPT-4.1-MINI, GPT-5.4-MINI ja GPT-5.4 käänsivät kaikki llevarse el gato al agua idiomatic-kielessä – mutta eri englanninkielisiin ilmaisuiksi, joilla oli hienovaraisesti erilaisia konnotaatioita. Tämä viittaa siihen, että idiomaattisen käännöksen laadulla on vähintään kaksi ulottuvuutta: tunnistaako malli idiomaattisen ilmauksen lainkaan ja minkä vastaavan ilmauksen se valitsee kohdekielen käytettävissä olevista vaihtoehdoista. Standardit käännöslaatumittarit eivät erottele näitä kahta ulottuvuutta selkeästi. Minusta heidän pitäisi.
Tämä julkaisu perustuu sisäiseen testaukseen MachineTranslation.comin kehitysalustalla. Tässä esitetty monimalliversion testaus ei ole vielä julkisesti saatavilla. Jaan löydöksen, koska mielestäni havainto on hyödyllinen riippumatta siitä, missä käännöksiäsi suoritat.