June 5, 2026

Tāda pati mākslīgā intelekta sistēma, cits modelis — un tulkojumi nevarētu būt atšķirīgāki

Esmu veicis iekšējos testus par kaut ko, par ko mēs nepietiekami runājam tulkošanas nozarē: nevis par to, vai dažādas mākslīgā intelekta sistēmas tulko atšķirīgi, bet gan par to, vai dažādas tās pašas mākslīgā intelekta versijas tulko atšķirīgi — un par cik daudz.

Pagājušajā nedēļā es izmantoju vienu spāņu idiomu caur piecām ChatGPT versijām vienlaicīgi MachineTranslation.com iekšējā testēšanas platformā. Tas, kas nāca atpakaļ, mani apturēja.

Divas versijas radīja tulkojumu, kas patiešām ir nesaprotams angļu valodā. Trīs versijas radīja pareizus idiomātiskus tulkojumus. Un trīs pareizie nesakrita savā starpā.

Visi pieci ir ChatGPT. Visi pieci ir OpenAI. Tāda pati mākslīgā intelekta sistēma, cits modelis — un rezultāti nevarētu būt atšķirīgāki.

}Es dalos ar to tagad, jo uzskatu, ka tas ir svarīgi, nevis tāpēc, ka man ir skaidras atbildes. Es nē. Bet novērojums ir pietiekami interesants, lai to nodotu pasaulei.

Saturs

  • Tests: Viena spāņu idiomas, piecas GPT versijas
  • Kāpēc šī idioma ir labs testa gadījums
  • Ko burtiskā-idiomātiskā sadalīšana mums stāsta par to, kā šie modeļi tika apmācīti
  • Implikācija, par kuru, šķiet, neviens nerunā
  • Pat pareizie tulkojumi atšķīrās savā starpā
  • Ko es vēl nezinu
  • Divi pētījumu jautājumi, par kuriem vērts padomāt

Tests: Viena spāņu idiomas, piecas GPT versijas

Frāze, ko testēju, bija llevarse el gato al agua.


Šeit ir tas, ko katra versija saražoja:

Modelis                                          Izvade                                               Idiomātiski?
ChatGPT::GPT-4o-MINI iznest kaķi uz ūdens ❌ Burtiski
ChatGPT::GPT-4.1-NANO iznest kaķi uz ūdens ❌ Burtiski
ChatGPT::GPT-4.1-MINI panākt to veiksmīgi ✅ Pareizi
ChatGPT::GPT-5.4-MINI panākt savu ✅ Daļēji
ChatGPT::GPT-5.4 izkļūt uz augšu ✅ Pareizi

Frāze nozīmē sasniegt kaut ko grūtu pretēji izredzēm, panākt grūtu uzvaru. Tam nav nekāda sakara ar kaķiem vai ūdeni. Burtiskais tulkojums nav tulkojums. Tā ir vārds pa vārdam transkripcija frāzei, kuru modelis nespēja atpazīt kā idioma.

GPT-4o-MINI un GPT-4.1-NANO radīja identiskus rezultātus. Nav līdzīgs, identisks. Mūsu tulkošanas ieskati to atzīmēja tieši: GPT-4.1-nano un GPT-4o-mini kopīgo identiskus tulkojumus, uzsverot burtisku interpretāciju, nevis idiātisko nozīmi.

GPT-4.1-MINI, GPT-5.4-MINI un GPT-5.4 katrs radīja kaut ko atpazīstami pareizu — bet ne tādu pašu kā cits.

Kāpēc šī idioma ir labs testa gadījums

Es vēlos precīzi izskaidrot, kāpēc llevarse el gato al agua ir noderīga testa ievade, nevis izvēlēta.

Tā ir labi pazīstama idioma. Tas parādās literatūrā, žurnālistikā un ikdienas runā. Tas nav neskaidrs. Jebkurš modelis, kas apmācīts uz saprātīga spāņu valodas tekstu kopuma, tam būtu saskāries. Jautājums nav par to, vai modelis ir redzējis frāzi. Jautājums ir, ko tas ar to dara.

Sliktākais kļūmes veids idiomātu tulkošanā nav slikta tulkojuma radīšana. Tas rada burtisku tulkojumu, kas izskatās pieņemami kādam, kurš nezina mērķvalodu.

To carry the cat to the water ir gramatiski pareiza angļu valoda. Tas ir pareizi veidots. Tas izklausās pēc kaut kā, kam varētu būt nozīme. Lietotājs, kurš nerunā spāniski, to varētu izlasīt, pamāt un doties tālāk — nekad nezinot, ka sākotnējā nozīme tika pilnībā zaudēta.

} Tas ir kļūmes režīms, kas mani interesē. Nav acīmredzama kļūda. Neredzamais.

Ko burtiskā uz idiomātisko sadalījums mums stāsta par to, kā tika apmācīti šie modeļi. Šis modelis nav

nejaušs. Abi modeļi, kas radīja burtiskus tulkojumus (GPT-4o-MINI un GPT-4.1-NANO), ir mazāki , vieglāki modeļi, kas optimizēti ātrumam un izmaksu efektivitātei. Trīs modeļi, kas radīja idiomātiskus tulkojumus (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), pārstāv citu paaudzi vai parametru mērogu.

Tas liecina par kaut ko, ko, manuprāt, nav pietiekami izpētīts: idiomātiskā kompetence tulkošanā palielinās līdz ar modeļa jaudu veidos, kas nav redzami vispārējos etalonos.

Vispārējie valodu etaloni testē spriešanu, zināšanas, kodēšanu, matemātiku. Viņi parasti nepārbauda, vai modelis spēj identificēt , ka lietains kaķis un suns nav saistīts ar laikapstākļiem, vai ka llevarse el gato al agua nav par kaķa mitrināšanu. Idiomas atrodas kultūras zināšanu, kontekstuālās secināšanas un modeļu atpazīšanas krustpunktā — un šis krustpunkts šķiet prasa tādu modeļu jaudas slieksni, ko mazāki modeļi ne konsekventi sasniedz.

Ko es neapgalvoju: ka lielāki modeļi vienmēr ir labāki tulki. Man nav pierādījumu par to kā vispārīgu likumu. Ko es novēroju: ka tieši idiomatiskam saturam radniecības versiju atšķirība bija lielāka, nekā es gaidīju.

Implikācija, par kuru, šķiet, neviens nerunā

Lielākā daļa lietotāju, kas izmanto AI tulkošanas rīku, nezina, kuru AI versiju viņi izmanto. Viņi atver produktu, izvēlas valodu pāri un saņem rezultātu. Maršrutēšana modelim ir neredzama.

Tas ir svarīgi mērogā. MachineTranslation.com apstrādāja vairākus simtus tūkstošu tulkošanas darbu no angļu uz spāņu valodu vienā 90 dienu periodā. Ja ievērojama daļa no šiem darbiem ietvēra idiomātisku saturu (mārketinga tekstus, juridisko valodu, literārus tekstus, ikdienas saziņu) un rīks, kas novirzīja šos darbus, bez viņu ziņas novirzīja lietotājus uz mazāku modeli, tad nest kaķi uz ūdens parādījās reālos rezultātos, reālos dokumentos, reāliem cilvēkiem, kuri uzticējās rezultātam.

Tulkošanas industrija gadiem ilgi ir salīdzinājusi AI nodrošinātājus. DeepL pret Google. Claude pret ChatGPT. Tās salīdzinājumi ir noderīgi. Taču viena pakalpojumu sniedzēja ietvaros versiju atšķirība var būt tikpat nozīmīga — un tā ir atšķirība, ko lielākā daļa salīdzināšanas sistēmu nemēra, jo tās netestē modeļa versiju līmenī.

Kad kāds saka Es izmantoju ChatGPT tulkošanai, šis teikums nav pietiekami precīzs, lai būtu jēgpilns. Kuru ChatGPT? Nano? 4o-mini? ‎4.1-mini? 5.4? Atbilde maina izvadi veidos , kas ir neiedomājami, vismaz idiomatiskam saturam.

Pat pareizie tulkojumi atšķīrās savā starpā

Šī ir daļa, kas man šķiet visinteresantākā, un es vēl neesmu pilnībā izdomājis, ko ar to iesākt.

Trīs modeļi, kas radīja idiomatiskus tulkojumus, sniedza trīs atšķirīgus tulkojumus:

  • GPT-4.1-MINI: to pull it off successfully
  • GPT-5.4-MINI: to get one's way
  • GPT-5.4: to come out on top

Visi trīs ir attaisnojami angļu valodas tulkojumi frāzei llevarse el gato al agua‎. Bet tie nav ekvivalenti.

Lai to izdarītu uzsver izpildījumu pret grūtībām, tu izdarīji kaut ko grūtu, un tas izdevās. Panākt savu uzsver vēlamā rezultāta sasniegšanu, mazāk uzsverot grūtības. Izvirzīties virs citiem uzsver konkurences uzvaru, uzvaru attiecībā pret citiem.

Oriģinālā spāņu idiomatiskā izteiksme ir vistuvāk pirmajam no šiem. Frāzei ir nozīme pārvarēt pretestību, nevis vienkārši dot priekšroku vienam iznākumam un ļaut tam notikt. Taču panākt savu un izkļūt uz augšu nav nepareizi, tie vienkārši ir neprecīzi dažādos virzienos.

Tas rada jautājumu, ko es uzskatu par patiesi grūtu: kad trīs modeļi katrs rada pareizu, bet atšķirīgu idiātisku tulkojumu, kā jūs novērtējat, kurš ir labākais? BLEU rādītāji tiek salīdzināti ar vienu atsauces tulkojumu — bet kurš uzrakstīja atsauci un kuru no šiem trim viņš būtu izvēlējies?

Mūsu AI tulkošanas aģents, godīgi sakot, uzdeva pareizo jautājumu pirms jebkura rezultāta apstiprināšanas: Kāda ir paredzētā nozīme frāzei llevarse el gato al agua šajā kontekstā? Tika piedāvātas trīs iespējas — sasniegt grūtu mērķi, paņemt kaut ko nevajadzīgu vai iesaistīties riskantā darbībā. Šis jautājums nav dekoratīvs. Tā ir mehānisma, ar kuru kontekstuālā nenoteiktība tiek atrisināta pirms tulkojuma pabeigšanas.

Bet doma paliek: trīs pareizas atbildes, trīs dažādas nozīmes nianses. Tulkošanas novērtēšanas rīki nav paredzēti šādai smalkjēgai niansēšanai.

To, ko es vēl nezinu,

vēlos būt godīgs par to, ko šis tests parāda.

Viens idioms, viens valodu pāris, viena diena iekšējās testēšanas. Tā nav pētījums. Tā ir novērojums. Es nezinu, vai šis modelis (mazāki modeļi, kas pēc noklusējuma ir burtiski, lielāki modeļi, kas sasniedz idiomatiskumu) pastāvīgi attiecas uz:

  • Citi spāņu idiomi
  • Citi valodu pāri ar bagātām idiomu tradīcijām (nāk prātā arābu, japāņu, krievu valoda)
  • Neidiomatisks saturs, kurā atšķirība nav piemērojama
  • Robežgadījumi, kur mazāks modelis pareizi atrisina idiomātismu, bet lielāks to nokavē

Es arī nezinu, vai šī ir stabilu īpašību šiem modeļiem, vai kaut kas, kas mainās ar atjauninājumiem un precizēšanu. Modeļu nodrošinātāji nepublicē tulkošanas specifiskus izmaiņu žurnālus. Modeļa versija, kas šodien pareizi apstrādā llevarse el gato al agua, nākamajā mēnesī var tikt atjaunināta, un mums nebūtu nekādas ziņas.

Zinu gan: šis tests radīja pietiekami interesantu rezultātu , ka es vēlos veikt vairāk šādu testu, sistemātiskāk, vairākos valodu pāros un satura veidos. Kad man būs vairāk ko dalīties, es to darīšu.

Divi pētījuma jautājumi, par kuriem vērts padomāt

Noslēgšu ar diviem jautājumiem, kas man radās šī testa laikā. Es uz tiem neatbildēšu , man vēl nav datu, lai to izdarītu. Bet es domāju, ka tie ir pareizie jautājumi, ko uzdot.

Pirmkārt: pie kāda parametru sliekšņa idiomatiskā kompetence kļūst uzticama?

Pāreja no GPT-4o-MINI un GPT-4.1-NANO (abas burtiskas) uz GPT-4.1-MINI (idiomatiska) liecina, ka starp šiem modeļu izmēriem ir kāds slieksnis parametru diapazonā, kurā ieslēdzas idiomu atpazīšana. Vai tas ir konsekvents? Vai tas attiecas uz idiomas visās valodās, vai tas ir atkarīgs no tā, cik labi valoda ir pārstāvēta apmācības datos? Es nezinu. Bet zināšanas būtu noderīgas ikvienam, kas veido tulkošanas darba plūsmas.

Otrkārt: cik maksā modeļa versijas necaurredzamība lietotājiem lielā mērogā?

Ja lietotājs mēnesī caur rīku, kas nedeklarē, kura modeļa versija tiek izmantota, novirza 1000 dokumentus (un daži no šiem dokumentiem satur idiomātisku saturu), cik bieži notiek burtiskā kļūme neredzami? Kā viņi to zinātu? Kāda ir reālā cena par to, ka nekad neuzzināsim?

Manuprāt, tas ir svarīgāks jautājums nekā lielākā daļa pašlaik izplatīto salīdzinājumu par tēmu kura mākslīgā intelekta programma ir vislabākā tulkošanai.‎ Atbilde nav izmantojiet lielāko modeli. Atbilde varētu būt: zināt, ko lietojat, veiciet savus testus uz savu saturu un neuzskatiet, ka viena pakalpojumu sniedzēja nosaukums ir garantija konsekventai rīcībai visā viņu modeļu klāstā.

Tas, vismaz, ir tas, ko es secinu no šī testa.

Pētniecības jautājumi

1. Vai modeļa izmērs uzticami prognozē idiomatiskās tulkošanas kvalitāti?

Pamatojoties uz šo vienu testu: mazāki, efektivitātei optimizēti modeļi tās pašas mākslīgā intelekta saimes ietvaros pēc noklusējuma tulkoja burtiski labi zināmu spāņu idiomu, savukārt lielākas/jaunākas versijas tam pašam modelim radīja pareizus idiomatiskus tulkojumus. Vai tas attiecas uz idiomiskām kategorijām un valodu pāriem, ir nākamais jautājums. Es veikšu vairāk testu.

2. Kāpēc trīs pareizi idiomatiskie tulkojumi radīja trīs jēgpilni atšķirīgus rezultātus?

GPT-4.1-MINI, GPT-5.4-MINI un GPT-5.4 visi idiomātiski tulkoja llevarse el gato al agua — bet dažādās angļu frāzēs ar smalki atšķirīgām konotācijām. Tas liek domāt, ka idiomatiskās tulkošanas kvalitātei ir vismaz divas dimensijas: vai modelis vispār atpazīst idiomu un kuru atbilstošo izteiksmi tas izvēlas no mērķvalodas pieejamajām opcijām. Standarta tulkošanas kvalitātes metrikas skaidri nenosaka šīs divas dimensijas. Es domāju, ka viņiem vajadzētu.


Šis ieraksts ir balstīts uz iekšējiem testiem MachineTranslation.com izstrādes platformā. Šeit parādītā daudzmodu versiju testēšana vēl nav publiski pieejama. Es dalos ar atklājumu, jo uzskatu, ka novērojums ir noderīgs neatkarīgi no tā, kur veicat tulkojumus.