June 5, 2026

Sama tekoäly, eri malli – ja käännökset eivät voisi olla erilaisempia

Olen tehnyt sisäisiä testejä jostakin, mistä emme puhu tarpeeksi käännösalalla: ei siitä, kääntävätkö eri tekoälyjärjestelmät eri tavalla, vaan siitä, kääntävätkö saman tekoälyn eriversioteri tavalla – ja kuinka paljon.

Viime viikolla testasin yhtä espanjalaista idiomia viidellä ChatGPT-versiolla samanaikaisesti MachineTranslation.comin sisäisellä testialustalla. Mitä sain takaisin, pysäytti minut.

Kaksi versiota tuotti käännöksen, joka on todella järjetön englanniksi. Kolme versiota tuotti oikeat idiomatic käännökset. Ja kolme oikeaa eivät olleet keskenään yhtä mieltä.

Kaikki viisi ovat ChatGPT. Kaikki viisi ovat OpenAI. Sama tekoäly, eri malli — ja tulokset eivät voisi olla erilaisempia.

Jaan tämän nyt, koska mielestäni sillä on merkitystä, enkä siksi, että minulla olisi selkeitä vastauksia. En. Mutta havainto on riittävän mielenkiintoinen, jotta se tuodaan julki.

Sisällysluettelo

  • Testi: Yksi espanjalainen idiomi, viisi GPT-versiota
  • Miksi tämä idiomi on hyvä testitapaus
  • Mitä kirjaimellinen ja idiominomainen jako kertoo meille siitä, miten nämä mallit koulutettiin
  • Johtopäätös, josta kukaan ei näytä puhuvan
  • Jopa oikeat käännökset olivat keskenään eri mieltä
  • Mitä en vielä tiedä
  • Kaksi tutkimuskysymystä, joita kannattaa pohtia

Testi: Yksi espanjalainen idiomi, viisi GPT-versiota Lause,

jota testasin, oli llevarse el gato al agua. Tässä on, mitä kukin versio


tuotti: MalliTulosteIdiomaattinen? ChatGPT::GPT-4o-MINIkantaa

kissa                      veteen❌                          Kirjaimellinen ChatGPT::GPT-4.1-NANOkantaa
kissa veteen❌ Kirjaimellinen ChatGPT::GPT-4.1-MINIonnistua siinä✅ Oikein ChatGPT::GPT-5.4-MINIsaada tahtonsa
läpi✅ Osittainen ChatGPT::GPT-5.4selviytyä voittajana✅ Oikein Lause tarkoittaa
vaikean asian saavuttamista vastoin
odotuksia, kovan voiton
saavuttamista.‎

Sillä ei ole mitään tekemistä kissojen tai veden kanssa. Kirjaimellinen käännös ei ole käännös. Se on sana sanalta transkriptio lauseesta, jota malli ei tunnistanut idiomiksi.

GPT-4o-MINI ja GPT-4.1-NANO tuottivat identtiset tulosteet. Ei samanlainen, identtinen. Käännösvinkkimme tunnistivat tämän suoraan: GPT-4.1-nano ja GPT-4o-mini jakavat identtiset käännökset, korostaen kirjaimellista tulkintaa idiomeihin liittyvän merkityksen sijaan.

GPT-4.1-MINI, GPT-5.4-MINI ja GPT-5.4 tuottivat kukin jotain tunnistettavasti oikeaa – mutta eivät toistensa kaltaista.

Miksi tämä idiomi on hyvä testitapaus

Haluan olla tarkka siitä, miksi llevarse el gato al agua on hyödyllinen testisyöte eikä valikoitu sellainen.

Se on vakiintunut idiomi. Se esiintyy kirjallisuudessa, journalismissa ja arkipuheessa. Se ei ole hämärä. Mikä tahansa kohtuullisella espanjankielisellä tekstillä koulutettu malli olisi sen kohdannut. Kysymys ei ole siitä, onko malli nähnyt kyseisen ilmaisun. Kysymys on, mitä sillä tehdään.

Pahin epäonnistumistapa idiomien kääntämisessä ei ole huonon käännöksen tuottaminen. Se tuottaa kirjaimellisen käännöksen, joka näyttää hyväksyttävältä jollekin, joka ei tunne kohdekieltä.

Kantaa kissa veteen on kieliopillisesti oikeaa englantia. Se on muodollisesti oikein. Kuulostaa joltain, jolla voisi olla merkitystä. Espanjaa puhumaton käyttäjä saattaisi lukea sen, nyökätä ja jatkaa matkaansa – tietämättä, että alkuperäinen merkitys oli täysin kadonnut.

Tuo on se epäonnistumistila, josta välitän. Ei ilmeinen virhe. Näkymätön yksi.

Mitä kirjaimellisen ja idiomaticin jako kertoo meille siitä, miten näitä malleja koulutettiin

Tämä kuvio ei ole satunnainen. Kahden mallin, jotka tuottivat kirjaimellisia käännöksiä (GPT-4o-MINI ja GPT-4.1-NANO), ovat molemmat pienempiä, kevyempiä malleja, jotka on optimoitu nopeuteen ja kustannustehokkuuteen. Kolme idiomaattisia käännöksiä tuottanutta mallia (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) edustavat eri sukupolvea tai parametrien skaalaa.

Tämä viittaa johonkin, mitä mielestäni ei ole tutkittu tarpeeksi: idiomaattinen osaaminen käännöksissä skaalautuu mallin kapasiteetin myötä tavoilla, jotka eivät näy yleisissä vertailuaineistoissa.

Yleiset kielivertailuaineistot testaavat päättelyä, tietoa, koodausta, matematiikkaa. Ne eivät tyypillisesti testaa, pystyykö malli tunnistamaan , että sataa kissoja ja koiria ei liity sääolosuhteisiin, tai että llevarse el gato al agua ei liity kissan nesteytykseen. Idiomit sijaitsevat kulttuurituntemuksen, asiayhteyteen perustuvan päättelyn ja kuvioiden tunnistamisen risteyksessä — ja tämä risteys näyttää vaativan mallin kapasiteetin kynnysarvoa, jota pienemmät mallit eivät johdonmukaisesti ylitä.

Mitä en väitä: että suuremmat mallit olisivat aina parempia kääntäjiä. Minulla ei ole todisteita siitä yleisenä sääntönä. Mitä minä havaitsen: että nimenomaan idiomaattisen sisällön kohdalla perheen sisäinen versioero oli suurempi kuin odotin.

Se, että kukaan ei näytä puhuvan siitä

Useimmat tekoälykäännöstyökalua käyttävät käyttäjät eivät tiedä, mitä versiota kyseisestä tekoälystä he käyttävät. He avaavat tuotteen, valitsevat kieliparin ja saavat tulosteen. Reititys on heille näkymätöntä.

Tällä on merkitystä laajassa mittakaavassa. MachineTranslation.com käsitteli yli satojatuhansia englanti-espanja-käännöstehtäviä yhden 90 päivän jakson aikana. Jos merkittävä osa näistä töistä koski idiomaticista sisältöä (markkinointitekstejä, lakikieltä, kirjallisia tekstejä, arkista viestintää) ja työkalu ohjasi käyttäjiä pienempään malliin heidän tietämättään, silloin kantaa kissa veteen ilmestyi todellisiin tuloksiin, todellisiin asiakirjoihin, todellisille ihmisille, jotka luottivat tulokseen.

Käännösteollisuus on käyttänyt vuosia vertaillen tekoälypalveluntarjoajia. DeepL vastaan Google. Claude vastaan ChatGPT. Nuo vertailut ovat hyödyllisiä. Mutta yhden palveluntarjoajan sisällä versioero voi olla yhtä merkittävä – ja se on ero, jota useimmat vertailukehykset eivät mittaa, koska ne eivät testaa malliversiotasolla. Kun joku sanoo Käytän ChatGPT:tä käännöksiin, tuo lause ei ole riittävän tarkka

ollakseen merkityksellinen. Mikä ChatGPT? Nano? 4o-mini? ‎4.1-mini? 5.4? Vastaus muuttaa tulostetta tavoilla , jotka eivät ole merkityksettömiä, ainakaan idiomaticisen sisällön osalta.

Jopa oikeat käännökset olivat keskenään eri mieltä

Tämä on mielestäni mielenkiintoisin osa, enkä ole vielä täysin ymmärtänyt, mitä siitä pitäisi ajatella.

Kolme mallia, jotka tuottivat idiomaticisia käännöksiä, antoivat kolme erilaista käännöstä:

  • GPT-4.1-MINI: to pull it off successfully
  • GPT-5.4-MINI: to get one's way
  • GPT-5.4: to come out on top

Kaikki kolme ovat puolustettavia englanninkielisiä käännöksiä ilmaisulle llevarse el gato al agua‎. Mutta ne eivät ole vastaavia.

Onnistua korostaa suorittamista vaikeuksia vastaan, teit jotain vaikeaa ja se toimi. Saada tahtonsa läpikorostaa haluamasi lopputuloksen saavuttamista, vähemmän korostaen vaikeutta. ‎ Pärjätä ylitse muiden korostaa kilpailullista voittoa, voittamista suhteessa muihin.

Alkuperäinen espanjalainen sanonta on lähimpänä ensimmäistä näistä. Ilmaisuun liittyy vastarinnan voittamisen merkitys, ei pelkästään yhden lopputuloksen suosiminen ja sen toteutuminen. Mutta saada tahtonsa läpi ja pärjätä eivät ole vääriä, ne ovat vain epätarkkoja eri suuntiin.

Tämä herättää kysymyksen, jonka koen aidosti vaikeaksi: kun kolme mallia tuottaa kukin oikean, mutta erilaisen idiomaticisen käännöksen, miten arvioit, mikä niistä on paras? BLEU-pisteet vertaavat yhteen vertailukäännökseen – mutta kuka kirjoitti vertailukäännöksen ja minkä näistä kolmesta he olisivat valinneet?

Tekoälykäännöstoimistomme kysyi ansionsa mukaan oikean kysymyksen ennen minkään tulosteen antamista: Mitä tarkoitetaan ilmauksella 'llevarse el gato al agua' tässä yhteydessä?‎ Tarjolla oli kolme vaihtoehtoa – vaikean tavoitteen saavuttaminen, tarpeettoman asian ottaminen tai riskialttiiseen toimintaan ryhtyminen. Tuo kysymys ei ole koristeellinen. Se on mekanismi, jolla asiayhteydestä johtuva moniselitteisyys ratkaistaan ennen käännöksen viimeistelyä.

Mutta asia pysyy: kolme oikeaa vastausta, kolme erilaista merkityksen vivahteita. Käännösten arviointityökaluja ei ole rakennettu tämänkaltaista vivahteikkuutta varten.

Mitä en vielä tiedä

Haluan olla rehellinen siitä, mitä tämä testi näyttää rajoitetusti.

Yksi idiomi, yksi kielipari, yksi päivä sisäistä testausta. Tuo ei ole tutkimus. Se on havainto. En tiedä, pitääkö tämä kuvio (pienemmät mallit oletuksena kirjaimellisia, suuremmat mallit idiomeja saavuttavia) johdonmukaisesti paikkansapitävänä:

  • Muut espanjalaiset idiomit
  • Muut kieliparit, joilla on rikas idiomaattinen perinne (Arabia, Japani, Venäjä tulevat kaikki mieleen)
  • Ei-idiomaattinen sisältö, jossa ero ei päde
  • Reunatapaukset, joissa pienempi malli saa idioomin oikein ja suurempi malli epäonnistuu siinä

En myöskään tiedä, onko tämä vakaa ominaisuus näissä malleissa vai jotain, joka muuttuu päivitysten ja hienosäädön myötä. Mallien tarjoajat eivät julkaise käännöskohtaisia muutostietoja. Malliversio, joka käsittelee llevarse el gato al agua oikein tänään, saatetaan päivittää ensi kuussa, emmekä tietäisi siitä mitään.

Mitä tiedän: tämä testi tuotti riittävän mielenkiintoisen tuloksen , että haluan suorittaa niitä enemmän, järjestelmällisemmin, useammilla kielipareilla ja sisältötyypeillä. Kun minulla on enemmän jaettavaa, jaan.

Kaksi tutkimuskysymystä, joita kannattaa pohtia

Lopetan kahdella kysymyksellä, jotka tämä koe jätti mieleeni. En vastaa niihin, minulla ei ole vielä tietoja siihen. Mutta uskon, että ne ovat oikeita kysymyksiä.

Ensinnäkin: millä parametrirajalla idiomatic competence tulee luotettavaksi?

Hyppy GPT-4o-MINI:stä ja GPT-4.1-NANO:sta (molemmat kirjaimellisia) GPT-4.1-MINI:hin (idiomatic) viittaa siihen, että mallikokojen välillä on jossain parametrialueella raja, jossa idiomin tunnistus kytkeytyy päälle.‎ Onko se johdonmukaista? Koskeeko se idiomaattisia ilmaisuja kaikissa kielissä, vai riippuuko se siitä, kuinka hyvin kieli on edustettuna harjoitusdatassa? En tiedä. Mutta tieto olisi hyödyllinen kaikille käännöstyönkulkuja rakentaville.

Toiseksi: mitä malliversion läpinäkymättömyys maksaa käyttäjille laajassa mittakaavassa?

Jos käyttäjä reitittää 1 000 asiakirjaa kuukaudessa työkalun kautta, joka ei paljasta, mitä malliversiota käytetään (ja jotkin näistä asiakirjoista sisältävät idiomeja), kuinka usein kirjaimellinen virhe tapahtuu näkymättömästi? Mistä he tietäisivät sen? Mikä on todellinen hinta siitä, ettei koskaan saa tietää?

Mielestäni tämä on tärkeämpi kysymys kuin suurin osa tällä hetkellä kiertävistä mikä tekoäly on paras käännöksiin -vertailuista.‎ Vastaus ei ole käytä suurinta mallia. Vastaus voi olla: tiedä mitä käytät, tee omat testit omalla sisällölläsi, äläkä oleta, että yhden palveluntarjoajan nimi takaa yhdenmukaisen toiminnan heidän malliensa valikoimassa.

Ainakin näin minä tulkitsen tämän testin.

Tutkimuskysymykset

1. Ennustaako mallikoko luotettavasti idiomaticisen käännöksen laatua?

Tämän yhden testin perusteella: pienemmät, tehokkuusoptimoituneet mallit samasta tekoälyperheestä käänsivät oletusarvoisesti kirjaimellisesti vakiintuneen espanjankielisen idiomin, kun taas samojen mallien suuremmat/uudemmat versiot tuottivat oikeita idiomaticisia käännöksiä. Seuraava kysymys on, pitääkö tämä paikkansa kielikuvakategorioiden ja kieliparien välillä. Suoritan lisää testejä.

2. Miksi kolme oikeaa idiomatic-käännöstä tuotti kolme merkityksellisesti erilaista tulosta?

GPT-4.1-MINI, GPT-5.4-MINI ja GPT-5.4 käänsivät kaikki llevarse el gato al agua idiomatic-kielessä – mutta eri englanninkielisiin ilmaisuiksi, joilla oli hienovaraisesti erilaisia konnotaatioita. Tämä viittaa siihen, että idiomaattisen käännöksen laadulla on vähintään kaksi ulottuvuutta: tunnistaako malli idiomaattisen ilmauksen lainkaan ja minkä vastaavan ilmauksen se valitsee kohdekielen käytettävissä olevista vaihtoehdoista. Standardit käännöslaatumittarit eivät erottele näitä kahta ulottuvuutta selkeästi. Minusta heidän pitäisi.


Tämä julkaisu perustuu sisäiseen testaukseen MachineTranslation.comin kehitysalustalla. Tässä esitetty monimalliversion testaus ei ole vielä julkisesti saatavilla. Jaan löydöksen, koska mielestäni havainto on hyödyllinen riippumatta siitä, missä käännöksiäsi suoritat.