June 5, 2026
Provodim interne testove na nečemu o čemu ne govorimo dovoljno u prevoditeljskoj industriji: ne o tome prevode li različiti AI sustavi različito, već prevode li različite verzije istog AI sustavarazličito — i za koliko.
Prošli tjedan sam kroz pet verzija ChatGPT-a istovremeno na internetskoj platformi za testiranje MachineTranslation.com provukao jedan španjolski idiom. Ono što se vratilo me zaustavilo.
Dvije verzije proizvele su prijevod koji je, iskreno, besmislica na engleskom. Tri verzije proizvele su ispravne idiomatske prijevode. A tri ispravna se nisu slagala međusobno.
Svi pet su ChatGPT. Svi pet su OpenAI. Ista AI, drugačiji model — a izlazi ne mogu biti drugačiji.
Dijelim ovo sada jer mislim da je važno, ne zato što imam jasne odgovore. Ne. Ali promatranje je dovoljno zanimljivo da se iznese u javnost.
Fraza koju sam testirao bila je llevarse el gato al agua.

Evo što je svaka verzija proizvela:
| Model | Izlaz | Idiomatski? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | odnijeti mačku u vodu | ❌ Doslovno |
| ChatGPT::GPT-4.1-NANO | odnijeti mačku u vodu | ❌ Doslovno |
| ChatGPT::GPT-4.1-MINI | uspješno to izvesti | ✅ Točno |
| ChatGPT::GPT-5.4-MINI | ostvariti svoje | ✅ Djelomično |
| ChatGPT::GPT-5.4 | izaći na kraj | ✅ Točno |
Fraza znači postići nešto teško unatoč izgledima, izvojevati tešku pobjedu. Nema to nikakve veze s mačkama ili vodom. Doslovni prijevod nije prijevod. To je doslovni prijepis fraze koju model nije uspio prepoznati kao idiom.
GPT-4o-MINI i GPT-4.1-NANO proizveli su identične izlaze. Ne slično, identično. Naši uvidi u prijevod ovo su izravno označili: GPT-4.1-nano i GPT-4o-mini dijele identične prijevode, naglašavajući doslovno tumačenje umjesto idiomatskog značenja.
GPT-4.1-MINI, GPT-5.4-MINI i GPT-5.4 svaki su proizveli nešto prepoznatljivo ispravno — ali ne isto kao ostali.
Želim precizirati zašto je llevarse el gato al agua koristan testni unos, a ne odabrani.
To je dobro uspostavljen idiom. Pojavljuje se u književnosti, novinarstvu i svakodnevnom govoru. Nije nejasno. Bilo koji model obučen na razumnom korpusu španjolskog teksta trebao bi ga naići. Pitanje nije u tome je li model vidio frazu. Pitanje je što s tim čini.
Najgori način neuspjeha u prijevodu idioma nije loš prijevod. Proizvodi doslovni prijevod koji izgleda prihvatljivo nekome tko ne zna ciljni jezik.
To carry the cat to the water je gramatički ispravan engleski. Dobro je oblikovano. Zvuči kao nešto što bi moglo nešto značiti. Korisnik koji ne govori španjolski to bi mogao pročitati, kimnuti i nastaviti dalje — nikada ne znajući da je izvorni smisao potpuno izgubljen.
To je način kvara koji me zanima. Nije očita pogreška. Nevidljivi.Što
ovdje nije slučajan. Dva modela koja su proizvela doslovne prijevode (GPT-4o-MINI i GPT-4.1-NANO) oba su manja, lakša modela optimizirana za brzinu i isplativost. Tri modela koja su proizvela idiomatske prijevode (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) predstavljaju drugu generaciju ili razmjer parametara.
Ovo sugerira nešto što mislim da nije dovoljno istraženo: idiomatska kompetencija u prevođenju raste s kapacitetom modela na načine koji nisu vidljivi u općim mjerilima.
Opća jezična mjerila testiraju rasuđivanje, znanje, kodiranje, matematiku. Oni obično ne testiraju može li model identificirati da pada kiša kao iz kabla se ne odnosi na vremenske uvjete, ili da llevarse el gato al agua se ne odnosi na hidratizaciju mačke. Idiomi se nalaze na sjecištu kulturnog znanja, kontekstualnog zaključivanja i prepoznavanja obrazaca — i čini se da to sjecište zahtijeva prag kapaciteta modela koji manji modeli ne dosljedno ne prelaze.
Ono što ne tvrdim: da su veći modeli uvijek bolji prevoditelji. Nemam dokaza za to kao opće pravilo. Ono što primjećujem: da je za idiomatski sadržaj specifično, jaz između verzija unutar obitelji bio veći nego što sam očekivao.
Većina korisnika koji koriste alat za AI prijevod ne znaju koju verziju tog AI-ja koriste. Otvaraju proizvod, odabiru jezični par i dobivaju izlaz. Маршрутизация модели для них невидима.
Это имеет значение в больших масштабах. MachineTranslation.com je obradio preko stotina tisuća poslova prevođenja s engleskog na španjolski u jednom 90-dnevnom razdoblju. Ako je značajan dio tih poslova obuhvaćao idiomatski sadržaj (marketinški tekstovi, pravni jezik, književni tekstovi, neformalna komunikacija), a alat koji je te poslove usmjeravao upućivao je korisnike na manji model bez njihovog znanja, tada se nositi mačku u vodu pojavljivalo u stvarnim izlazima, u stvarnim dokumentima, za stvarne ljude koji su vjerovali rezultatu.
Industrija prevođenja godinama uspoređuje AI pružatelje usluga. DeepL protiv Googlea. Claude protiv ChatGPT-a. Ta usporedba su korisna. Ali unutar jednog davatelja usluga, jaz u verzijama može biti jednako značajan — i to je jaz koji većina okvira za usporedbu ne mjeri jer ne testiraju na razini verzije modela. Kad netko kaže Koristim ChatGPT za prijevod, ta rečenica nije
dovoljno precizna da bi bila smislena. Koji ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Odgovor mijenja izlaz na načine koji nisu trivijalni, barem za idiomatski sadržaj.
Ovo je dio koji mi je najzanimljiviji, i još nisam u potpunosti shvatio što da napravim s tim.
Tri modela koja su proizvela idiomatske prijevode dala su tri različita prijevoda:
Sva tri su obranjiva engleska prikaza izraza llevarse el gato al agua. Ali nisu ekvivalentni.
Uspjeti naglašava izvedbu nasuprot poteškoći, ti si učinio nešto teško i uspjelo je. Da se postigne svoje naglašava postizanje željenog ishoda, s manjim naglaskom na poteškoće. Izaći na vrh naglašava natjecateljsku pobjedu, pobjedu u odnosu na druge.
Izvorni španjolski idiom najbliži je prvom od ovih. Fraza nosi konotaciju prevladavanja otpora, a ne jednostavnog preferiranja jednog ishoda i njegovog ostvarenja. Ali dobiti svoj put i izaći na vrh nisu pogrešni, samo su neprecizni u različitim smjerovima.
Ovo postavlja pitanje koje mi je uistinu teško: kada tri modela svaki proizvedu točan, ali različit idiomatski prijevod, kako procijeniti koji je najbolji? BLEU rezultati se uspoređuju s jednom referentnom prijevodom — ali tko je napisao referencu i koju bi od ove tri odabrao?
Naš AI prevoditeljski agent, na svoju sreću, postavio je pravo pitanje prije nego što se obvezao na bilo koji izlaz: Kakvo je namjeravano značenje izraza 'llevarse el gato al agua' u ovom kontekstu? Ponudile su se tri mogućnosti – postići težak cilj, uzeti nešto nepotrebno ili se upustiti u rizičnu aktivnost. To pitanje nije ukrasno. Mehanizam je kojim se kontekstualna nejasnoća rješava prije nego što se prijevod finalizira.
Ali poanta ostaje: tri točna odgovora, tri različite nijanse značenja. Alati za procjenu prijevoda nisu izgrađeni za ovakvu nijansu.
Želim biti iskren u vezi s ograničenjima onoga što ovaj test pokazuje.
Jedan idiom, jedan jezični par, jedan dan internog testiranja. To nije studija. To je zapažanje. Ne znam drži li se ovaj obrazac (manji modeli zadano doslovno, veći modeli postižu idiomatski) dosljedno:
Također ne znam je li ovo stabilno svojstvo ovih modela ili nešto što se mijenja s ažuriranjima i finim podešavanjem. Davatelji modela ne objavljuju zapisnike promjena specifične za prijevod. Verzija modela koja danas ispravno obrađuje llevarse el gato al agua može se sljedeći mjesec ažurirati, a mi ne bismo imali načina da to znamo.
Ono što znam: ovaj test je proizveo rezultat dovoljno zanimljiv da želim provesti još njih, sustavnije, na više jezičnih parova i vrsta sadržaja. Kad budem imao više toga za podijeliti, podijelit ću.
Završit ću s dva pitanja koja su mi ostala nakon ovog testa. Neću im odgovoriti, još nemam podatke za to. Ali mislim da su to prava pitanja za postaviti.
Prvo: na kojem prag parametara idiomatska kompetencija postaje pouzdana? Skok s GPT-4o-MINI
i GPT-4.1-NANO (oba doslovna) na GPT-4.1-MINI (idiomatski) sugerira da postoji prag negdje u rasponu parametara između tih veličina modela gdje se prepoznavanje idioma uključuje. Je li dosljedno? Primjenjuje li se to na frazeme u svim jezicima ili ovisi o tome koliko je neki jezik dobro zastupljen u podacima za treniranje? Ne znam. Ali znanje bi bilo korisno svima koji grade prevoditeljske radne procese.
Drugo: koliko neprozirnost verzije modela košta korisnike u velikom obimu?
Ako korisnik mjesečno provuče 1.000 dokumenata kroz alat koji ne otkriva koja se verzija modela koristi (a neki od tih dokumenata sadrže idiomatski sadržaj), koliko se često stvarno propadanje događa nevidljivo? Kako bi oni znali? Koja je cijena, u stvarnim terminima, nikada ne saznati?
Mislim da je to važnije pitanje od većine koji je AI najbolji za prevođenje usporedbi koje trenutno kruže. Odgovor nije koristite najveći model. Odgovor bi mogao biti: znajte što koristite, provedite vlastite testove na vlastitom sadržaju i nemojte pretpostavljati da je ime jednog davatelja jamstvo dosljednog ponašanja u cijelom njihovom rasponu modela.
To je, barem, ono što ja izvlačim iz ovog testa.
Ovaj post temelji se na internom testiranju na razvojnoj platformi MachineTranslation.com. Ispitivanje više modela prikazano ovdje još nije javno dostupno. Dijelim ovo otkriće jer mislim da je opažanje korisno bez obzira na to gdje provodite svoje prijevode.