June 5, 2026
Mi faris internajn testojn pri io, pri kio ni ne parolas sufiĉe en la traduka industrio: ne ĉu malsamaj AI-sistemoj tradukas malsame, sed ĉu malsamaj versioj de la sama AI tradukas malsame — kaj kiom multe.
Pasintan semajnon mi testis ununuran hispanan idiomaĵon per kvin versioj de ChatGPT samtempe sur la interna testplatformo de MachineTranslation.com. Kio revenis haltigis min.
Du versioj produktis tradukon, kiu estas, vere, sensencaĵo en la angla. Tri versioj produktis ĝustajn idiomecajn tradukojn. Kaj la tri ĝustaj ne interkonsentis.
Ĉiuj kvin estas ChatGPT. Ĉiuj kvin estas OpenAI. Sama AI, malsama modelo — kaj la rezultoj ne povus esti pli malsamaj.
Mi dividas tion nun ĉar mi pensas, ke ĝi gravas, ne ĉar mi havas klarajn respondojn. Mi ne. Sed la observado estas sufiĉe interesa por meti en la mondon.
La frazo, kiun mi testis, estis llevarse el gato al agua.

Jen kion ĉiu versio produktis:
| Modelo | Eligo | Idioma? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | porti la katon al la akvo | ❌ Laŭvorta |
| ChatGPT::GPT-4.1-NANO | porti la katon al la akvo | ❌ Laŭvorta |
| ChatGPT::GPT-4.1-MINI | atingi ĝin sukcese | ✅ Korekta |
| ChatGPT::GPT-5.4-MINI | atingi sian volon | ✅ Parta |
| ChatGPT::GPT-5.4 | eliri venka | ✅ Korekta |
La frazo signifas atingi ion malfacilan kontraŭ la probabloj, atingi malfacilan venkon. Ĝi tute ne rilatas al katoj aŭ akvo. La la traduko ne estas traduko. Ĝi estas vorto-post-vorta transskribo de frazo, kiun la modelo ne sukcesis rekoni kiel idiomaĵo.
GPT-4o-MINI kaj GPT-4.1-NANO produktis identajn rezultojn. Ne simila, identa. Niaj Tradukaj Perspektivoj flampunktis tion rekte: GPT-4.1-nano kaj GPT-4o-mini dividas identajn tradukojn, emfazante laŭvortan interpreton super idiomatika signifo.
GPT-4.1-MINI, GPT-5.4-MINI, kaj GPT-5.4 ĉiu produktis ion rekoneble ĝustan — sed ne la saman kiel la aliaj.
Mi volas esti preciza pri tio, kial llevarse el gato al agua estas utila testenigaĵo prefere ol elektita unu.
Ĝi estas bone establita idiomo. Ĝi aperas en literaturo, ĵurnalismo, kaj ĉiutaga parolado. Ne estas obskura. Iom da modelo trejnita sur racia kolekto de hispana teksto devus esti renkontinta ĝin. La demando ne estas ĉu la modelo vidis la frazon. La demando estas kion ĝi faras kun ĝi.
La plej malbona fiasko-reĝimo en idioma tradukado ne estas produkti malbonan tradukon. Ĝi produktas laŭvortan tradukon kiu aspektas akceptebla por iu kiu ne konas la celan lingvon.
Porti la katon al la akvo estas gramatike ĝusta en la angla. Ĝi estas bone formita. Ĝi sonas kiel io, kio povus signifi ion. Uzanto, kiu ne parolas la hispanan, povus legi ĝin, kapjesi kaj pluiri — neniam sciante, ke la originala signifo tute perdiĝis.
Tio estas la fiaskoreĝimo, pri kiu mi zorgas. Ne la evidenta eraro. La nevidebla unu.
tie ne estas hazarda. La du modeloj, kiuj produktis laŭvortajn tradukojn (GPT-4o-MINI kaj GPT-4.1-NANO), estas ambaŭ pli malgrandaj, pli malpezaj modeloj optimumigitaj por rapido kaj kosta efikeco. La tri modeloj, kiuj produktis idiomecajn tradukojn (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), reprezentas malsaman generacion aŭ skalon de parametroj.
Tio sugestas ion, kion mi pensas, ke estas nesufiĉe esplorita: idiomeca kompetenteco en tradukado skaliĝas kun modelkapacito en manieroj, kiuj ne estas videblaj en ĝeneralaj referencpunktoj.
Ĝeneralaj lingvaj referencpunktoj testas rezonadon, scion, kodigon, matematikon. Ili ne kutime testas ĉu modelo povas identigi ke pluvas katojn kaj hundojn ne temas pri veterkondiĉoj, aŭ ke llevarse el gato al agua ne temas pri hidratado de kato. Idiomoj sidas ĉe la intersekciĝo de kultura scio, kunteksta inferenco, kaj rekono de ŝablonoj — kaj tiu intersekciĝo ŝajnas postuli sojlon de modelkapablo, kiun pli malgrandaj modeloj ne konsekvence superas.
Kion mi ne asertas: ke pli grandaj modeloj ĉiam estas pli bonaj tradukistoj. Mi ne havas pruvojn por tio kiel ĝenerala regulo. Kion mi observas: ke por idioma enhavo specife, la ene-familia versia interspaco estis pli granda ol mi atendis.
Plej multaj uzantoj, kiuj uzas AI-tradukilon, ne scias, kiun version de tiu AI ili uzas. Ili malfermas produkton, elektas lingvoparon , kaj ricevas eligon. La modelavojado estas nevidebla al ili.
Tio gravas laŭ skalo. MachineTranslation.com prilaboris pli ol centmilojn da tradukaj laboroj el la angla al la hispana en ununura 90-taga periodo. Se signifa parto de tiuj laboroj tuŝis idioman enhavon (merkatada teksto, jura lingvo, literatura teksto, hazarda komunikado) kaj la ilo, kiu direktis tiujn laborojn, sendis uzantojn al pli malgranda modelo sen ilia scio, tiam porti la katon al la akvo aperis en realaj rezultoj, en realaj dokumentoj, por realaj homoj, kiuj fidis la rezulton.
La traduka industrio pasigis jarojn komparante AI-provizantojn. DeepL kontraŭ Google. Claude kontraŭ ChatGPT. Tiu komparo estas utila. Sed ene de ununura provizanto, la versia interspaco povas esti same signifa — kaj ĝi estas interspaco, kiun plej multaj komparaj kadroj ne mezuras, ĉar ili ne testas je la modelo-versia nivelo.
Kiam iu diras Mi uzas ChatGPT por tradukado, tiu frazo ne estas sufiĉe specifa por esti signifa. Kiun ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? La respondo ŝanĝas la eliron en manieroj kiuj estas netrivialaj, almenaŭ por idioma enhavo.
Tio estas la parto, kiun mi trovas plej interesa, kaj mi ankoraŭ ne plene komprenis kion fari pri ĝi.
La tri modeloj, kiuj produktis idiomaticajn tradukojn, donis tri malsamajn:
Ĉiuj tri estas defendeblaj anglaj tradukoj de llevarse el gato al agua. Sed ili ne estas ekvivalentaj.
Por sukcesi emfazas plenumon kontraŭ malfacileco, vi faris ion malfacilan kaj ĝi funkciis. Por atingi sian volon emfazas la rezulton, kiun vi deziris, ke ĝi estu atingita, kun malpli da emfazo sur la malfacileco. Venki emfazas konkurencivan venkon, venkante rilate al aliaj.
La originala hispana idiomaĵo plej proksimas al la unua el ĉi tiuj. La frazo portas la konotacion de venkado de rezisto, ne simple preferi unu rezulton kaj havigi ĝin realiĝi. Sed atingi sian volon kaj eliri venke ne estas malĝuste, ili simple estas neprecizaj en malsamaj direktoj.
Tio levas demandon, kiun mi trovas vere malfacila: kiam tri modeloj ĉiu produktas ĝustan sed malsaman idioman tradukon, kiel vi taksas, kiu estas la plej bona? BLEU-poentaroj komparas kontraŭ unu referenca traduko — sed kiu verkis la referencon, kaj kiun el tiuj tri ili estus elektintaj?
Nia AI Traduka Agento, al sia kredito, demandis la ĝustan demandon antaŭ ol kompromiti al iu ajn eligo: Kio estas la celita signifo de 'llevarse el gato al agua' en ĉi tiu kunteksto? Tri ebloj estis ofertitaj — atingi malfacilan celon, preni ion nenecesan, aŭ okupiĝi pri riska agado. Tiu demando ne estas ornama. Ĝi estas la mekanismo per kiu la kunteksta ambigueco estas solvita antaŭ ol la traduko estas finpretigita.
Sed la punkto restas: tri ĝustaj respondoj, tri malsamaj nuancoj de signifo. Tradukadaj taksiloj ne estas konstruitaj por tia nuanco.
Mi volas esti honesta pri la limoj de tio, kion ĉi tiu provo montras.
Unu idiomaĵo, unu lingvoparo, unu tago de interna testado. Tio ne estas studo. Ĝi estas observado. Mi ne scias ĉu ĉi tiu ŝablono (pli malgrandaj modeloj defaŭlte al laŭvorta, pli grandaj modeloj atingante idioman) tenas konstante trans:
Mi ankaŭ ne scias ĉu ĉi tio estas stabila eco de ĉi tiuj modeloj aŭ io, kio ŝanĝiĝas kun ĝisdatigoj kaj tajlorado. Modelaj provizantoj ne publikigas traduk-specifajn ŝanĝajn protokolojn. Modela versio, kiu ĝuste traktas llevarse el gato al agua hodiaŭ, povus esti ĝisdatigita venontmonate, kaj ni ne havus manieron scii pri tio.
Kion mi scias: ĉi tiu testo produktis rezulton sufiĉe interesan ke mi volas fari pli da ili, pli sisteme, trans pli da lingvaj paroj kaj enhavaj tipoj. Kiam mi havos pli por dividi, mi faros tion.
Mi fermos per la du demandoj, kiujn ĉi tiu testo lasis al mi. Mi ne respondos al ili, mi ne havas la datumojn por fari tion ankoraŭ. Sed mi pensas, ke ili estas la ĝustaj demandoj por demandi.
Unue: ĉe kia parametra sojlo la idiomatika kompetenteco fariĝas fidinda? La salto de GPT-4o-MINI
kaj GPT-4.1-NANO (ambaŭ literalaj) al GPT-4.1-MINI (idiomatika) sugestas, ke ekzistas sojlo ie en la parametra gamo inter tiuj modelaj grandecoj, kie la idioma rekono ekfunkcias. Ĉu ĝi estas konsekvenca? Ĉu ĝi validas por idiomaĵoj en ĉiuj lingvoj, aŭ ĉu ĝi dependas de kiom bone reprezentita estas lingvo en la trejnaj datumoj? Mi ne scias. Sed scii utilus por iu ajn konstruanta tradukajn laborfluojn.
Due: kiom kostas al uzantoj la opakeco de modelversio laŭ skalo?
Se uzanto sendas 1 000 dokumentojn monate tra ilo, kiu ne malkaŝas, kiu modelversio estas uzata (kaj kelkaj el tiuj dokumentoj enhavas idioman enhavon), kiom ofte la laŭvorta malsukceso okazas nevideble? Kiel ili scius? Kio estas la kosto, en realaj terminoj, de neniam ekscii?
Mi pensas, ke tio estas pli grava demando ol plejmulto el la kiu AI estas plej bona por tradukado komparoj nuntempe cirkulantaj. La respondo ne estas uzu la plej grandan modelon. La respondo povus esti: sciu, kion vi uzas, faru viajn proprajn testojn pri via propra enhavo, kaj ne supozu, ke la nomo de unu provizanto garantias koheran konduton tra ilia modela gamo.
Tio, almenaŭ, estas tio, kion mi prenas el ĉi tiu testo.
Surbaze de ĉi tiu ununura provo: pli malgrandaj, efikec-optimumigitaj modeloj ene de la sama AI-familio defaŭlte tradukis laŭvorte hispanan idiomon bone establitan, dum pli grandaj/pli novaj versioj de la sama modelo produktis ĝustajn idioman tradukojn. Ĉu tio validas trans idiomkategorioj kaj lingvaj paroj estas la sekva demando. Mi faros pliajn testojn.
GPT-4.1-MINI, GPT-5.4-MINI, kaj GPT-5.4 ĉiuj tradukis llevarse el gato al agua idiomece — sed en malsamajn anglajn esprimojn kun subtile malsamaj konotacioj. Tio sugestas , ke la kvalito de idioma traduko havas almenaŭ du dimensiojn: ĉu la modelo entute rekonesas la idiomaĵon, kaj kiun ekvivalentan esprimon ĝi elektas el la disponeblaj ebloj de la cellingvo . Normaj tradukaj kvalitaj metrikoj ne klare apartigas tiujn du dimensiojn. Mi pensas, ke ili devus.
Tiu ĉi afiŝo baziĝas sur interna testado ĉe la evoluiga platformo de MachineTranslation.com. La mult-modela versia testado montrita ĉi tie ne estas ankoraŭ publike havebla. Mi dividas la trovon, ĉar mi pensas, ke la observo estas utila sendepende de kie vi faras viajn tradukojn.