June 5, 2026
Qed nagħmel testijiet interni fuq xi ħaġa li ma nitkellmux biżżejjed dwarha fl-industrija tat-traduzzjoni: mhux jekk sistemi differenti ta' l-AI jittraduċux b'mod differenti, imma jekk verżjonijiet differenti tal-istess AI jittraduċux b'mod differenti — u b'kemm.
Il-ġimgħa li għaddiet għaddejt idiom Spanjola waħda minn ħames verżjonijiet ta' ChatGPT simultanjament fuq il-pjattaforma tat-testing interna ta' MachineTranslation.com. Dak li ħareġ waqqafni.
Żewġ verżjonijiet ipproduċew traduzzjoni li, tassew, hija bla sens bl-Ingliż. Tliet verżjonijiet ipproduċew traduzzjonijiet idiomatici korretti. U t-tlieta korretti ma qablux ma' xulxin.
Kollha ħamsa huma ChatGPT. Kollha ħamsa huma OpenAI. Same AI, different model — u l-outputs ma jistgħux ikunu aktar differenti.
Qed naqsam dan issa għax naħseb li hu importanti, mhux għax għandi tweġibiet ċari. M'għandix. Iżda l-osservazzjoni hija interessanti biżżejjed biex titpoġġi fid-dinja.
Il-frażi ttestjajt kienet llevarse el gato al agua.

Hawn dak li pproduċa kull verżjoni:
| Mudell | Output | Idiomatiku? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | to carry the cat to the water | ❌ Letterali |
| ChatGPT::GPT-4.1-NANO | to carry the cat to the water | ❌ Letterali |
| ChatGPT::GPT-4.1-MINI | to pull it off successfully | ✅ Korrett |
| ChatGPT::GPT-5.4-MINI | to get one's way | ✅ Parzjali |
| ChatGPT::GPT-5.4 | to come out on top | ✅ Korrett |
Il-frażi tfisser li tikseb xi ħaġa diffiċli kontra l-probabbiltà, li tirbaħ rebħa iebsa. M'għandha x'taqsam xejn mal-qtates jew mal-ilma. It-traduzzjoni litterali mhijiex traduzzjoni. Hija traskrizzjoni kelma b'kelma ta' frażi li l-mudell naqas milli jagħraf bħala idiom.
GPT-4o-MINI u GPT-4.1-NANO pproduċew outputs identiċi. Mhux simili, identiku. L-Insights tat-Traduzzjoni tagħna identifikaw dan direttament: GPT-4.1-nano u GPT-4o-mini jaqsmu traduzzjonijiet identiċi, u jenfasizzaw interpretazzjoni letterali fuq tifsira idiomatika.
GPT-4.1-MINI, GPT-5.4-MINI, u GPT-5.4 kull wieħed ipproduċew xi ħaġa rikonoxxibbli korretta — iżda mhux l-istess bħal xulxin.
Irrid inkun preċiż dwar għaliex llevarse el gato al agua hija input ta' test utli pjuttost milli waħda magħżula b'mod selettiv.
Hija idiom stabbilita sew. Jidher fil-letteratura, fil-ġurnaliżmu, u fid-diskors ta' kuljum. Mhux oskur. Kull mudell imħarreġ fuq korp raġonevoli ta' test bl-Ispanjol għandu jkun iltaqa' miegħu. Il-mistoqsija mhijiex jekk il-mudell hux ra l-frażi. Il-mistoqsija hija x'jagħmel bih.
L-agħar mod ta'falliment fit-traduzzjoni ta'idiomi mhuwiex li tipproduċi traduzzjoni ħażina. Qed tipproduċi traduzzjoni letterali li tidher aċċettabbli lil xi ħadd li ma jafx il-lingwa fil-mira.
To carry the cat to the water hija bl-Ingliż grammatikalment korretta. Huwa fformattat sew. Jidher bħal xi ħaġa li tista' tfisser xi ħaġa. Utent li ma jitkellimx bl-Ispanjol jista' jaqrah, jgħid iva, u jkompli – qatt ma jaf li t-tifsira oriġinali ntilfet għal kollox.
Dak hu l-falliment li jimpurtani minnu. Mhux l-iżball ovvju. Dak li wieħed ma jidhirlux.
Il-mudell hawnhekk mhuwiex każwali. Iż-żewġ mudelli li pproduċew traduzzjonijiet litterali (GPT-4o-MINI u GPT-4.1-NANO) huma t-tnejn mudelli iżgħar, eħfef ottimizzati għall-veloċità u l-effiċjenza fl-ispiża. It-tliet mudelli li pproduċew traduzzjonijiet idiomatici (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) jirrappreżentaw ġenerazzjoni differenti jew skala ta' parametri.
Dan jissuġġerixxi xi ħaġa li naħseb li mhix esplorata biżżejjed: il-kompetenza idiomatika fit-traduzzjoni tikber bil-kapaċità tal-mudell b'modi li mhumiex viżibbli fil-benchmarks ġenerali.
Il-benchmarks ġenerali tal-lingwa jittestjaw raġunament, għarfien, kodifikazzjoni, matematika. Ma jittestjawx tipikament jekk mudell jista' jidentifika li xita' qattus u kelb mhix dwar kundizzjonijiet tat-temp, jew li llevarse el gato al agua mhix dwar l-idratazzjoni ta' qattus. L-idiomi jinsabu fl-intersezzjoni ta' għarfien kulturali, inferenza kontekstwali, u rikonoxximent ta' mudelli — u dik l-intersezzjoni tidher li teħtieġ limitu ta' kapaċità tal-mudell li mudelli iżgħar ma jaqsmux b'mod konsistenti.
Dak li m'inix qed niddikjara: li mudelli akbar huma dejjem tradutturi aħjar. M'għandix evidenza għal dak bħala regola ġenerali. Dak li qed ninnota: li għal kontenut idiomatiku speċifikament, id-differenza fil-familja kienet akbar milli stennejt.
Il-biċċa l-kbira tal-utenti li jużaw għodda ta' traduzzjoni bl-AI ma jafux liema verżjoni ta' dik l-AI qed jużaw. Jiftħu prodott, jagħżlu lingwa par, u jiksbu output. Ir-rotta tal-mudell hija inviżibbli għalihom.
Dan jimportax fuq skala kbira. MachineTranslation.com ipproċessat aktar minn mijiet ta' eluf ta' impjiegi ta' traduzzjoni mill-Ingliż għall-Ispanjol f'perjodu wieħed ta' 90 jum. Jekk porzjoni sinifikanti ta' dawk l-impjiegi messet kontenut idjomatiku (copywriting, lingwa legali, test letterarju, komunikazzjoni każwali) u l-għodda li tibgħat dawk l-impjiegi kienet qed tidderiġi lill-utenti lejn mudell iżgħar mingħajr ma jkunu jafu, allura biex iġġib il-qattus fl-ilma kien qed jidher f'outputs reali, f'dokumenti reali, għal nies reali li fidu ir-riżultat.
L-industrija tat-traduzzjoni qattgħet snin tqabbel fornituri tal-AI. DeepL kontra Google. Claude kontra ChatGPT. Dawk il-paraguni huma utli. Imma fi ħdan fornitur wieħed, id-differenza fil-verżjoni tista' tkun importanti daqskemm—u hija differenza li l-biċċa l-kbira tal-qafas ta' paragun ma jkejlux għax ma jittestjawx fil-livell tal-verżjoni tal-mudell.
Meta xi ħadd jgħid Nuża ChatGPT għat-traduzzjoni, dik is-sentenza mhix speċifika biżżejjed biex tkun sinifikanti. Liema ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? It-tweġiba tbiddel l-output b'modi li mhumiex trivjali, għall-inqas għal kontenut idjomatiku.
Din hija l-parti li nsib l-aktar interessanti, u għadni ma fhimtx kompletament x'għandi nagħmel biha.
It-tliet mudelli li pproduċew traduzzjonijiet idjomatiku taw tliet traduzzjonijiet differenti:
It-tlieta huma rappreżentazzjonijiet Ingliżi li jistgħu jiġu difiżi ta' llevarse el gato al agua. Iżda mhumiex ekwivalenti.
Biex tirnexxi jenfasizza l-eżekuzzjoni kontra d-diffikultà, int għamilt xi ħaġa iebsa u rnexxiet. Li tikseb dak li trid jenfasizza ir-riżultat li xtaqt li jinkiseb, b'inqas enfasi fuq id-diffikultà. Biex toħroġ fuq nett tenfasizza rebħa kompetittiva, tirbaħ relattivament għal oħrajn.
L-idioma oriġinali bl-Ispanjol hija l-eqreb għall-ewwel waħda minn dawn. Il-frażi ġġorr il-konnotazzjoni li tegħleb ir-reżistenza, mhux sempliċement tippreferi riżultat wieħed u jkollok materjalizzat. Imma li tikseb dak li trid u to come out on top mhumiex ħżiena, huma biss mhux preċiżi f'direzzjonijiet differenti. Dan iqajjem mistoqsija li nsibha tassew diffiċli: meta tliet mudelli kull
wieħed jipproduċi traduzzjoni idiomatika korretta iżda differenti, kif tevalwa liema hija l-aħjar? Il-punteġġi BLEU jitqabblu ma' traduzzjoni ta' referenza waħda — iżda min kiteb ir-referenza, u liema minn dawn it-tlieta kienu jagħżlu? L-Aġent tat-Traduzzjoni AI tagħna, għall-mertu tiegħu, staqsa l-mistoqsija
t-tajba qabel ma jimpenja ruħu għal xi output: X'inhu l-intenzjoni ta' 'llevarse el gato al agua' f'dan il-kuntest? Tliet għażliet kienu offruti — li jintlaħaq għan diffiċli, li jittieħed xi ħaġa bla bżonn, jew li wieħed jidħol f'attività ta' riskju. Diken li hija mhux dekorattiva. Hu l-mekkaniżmu li bih l-ambigwità kontestwali tiġi solvuta qabel ma t-traduzzjoni tiġi finalizzata.
Imma l-punt jibqa': tliet tweġibiet korretti, tliet sfumaturi ta' tifsira differenti. Għodda ta' valutazzjoni tat-traduzzjoni mhumiex mibnija għal dan it-tip ta' sfumatura.
Irrid inkun onest dwar il-limiti ta' dak li juri dan it-test.
Idjoma waħda, par lingwi wieħed, ġurnata ta' test intern. Dak mhux studju. Hija osservazzjoni. Ma nafx jekk dan il-mudell (mudelli iżgħar li awtomatikament jagħtu interpretazzjoni letterali, mudelli akbar li jiksbu interpretazzjoni idiomatika) huwiex konsistenti madwar:
Lanqas ma nafx jekk din hijiex proprjetà stabbli ta' dawn il- mudelli jew xi ħaġa li tinbidel bl-aġġornamenti u l-fine-tuning. Il-fornituri tal-mudelli ma jippubblikawx changelogs speċifiċi għat-traduzzjoni. Verżjoni ta' mudell li tittratta llevarse el gato al agua b'mod korrett illum tista' tiġi aġġornata x-xahar id-dieħel, u ma jkollniex mod kif nafu.
Dak li naf: dan it-test ipproduċa riżultat interessanti biżżejjed biex irrid nagħmel aktar minnhom, b'mod aktar sistematiku, fuq aktar pari ta' lingwi u tipi ta' kontenut. Meta' ser naqsam aktar, nagħmel hekk.
Se nagħlaq biż-żewġ mistoqsijiet li ħallili dan it-test. Mhux se nwieġeb lilhom, m'għandix id-dejta biex nagħmel dan għalissa. Imma naħseb li huma l-mistoqsijiet it-tajbin li wieħed jistaqsi.
L-ewwel: f'liema limitu ta' parametri l-kompetenza idiomatika ssir affidabbli? Il-qabża minn GPT-4o-MINI
u GPT-4.1-NANO (it-tnejn litterali) għal GPT-4.1-MINI (idiomatiku) tissuġġerixxi li hemm limitu x'imkien fil-firxa tal-parametri bejn dawk id-daqsijiet tal-mudell fejn ir-rikonoxximent tal-idiomi jinxtegħel. Huwa konsistenti? Tapplika għall-idiomi fil-lingwi kollha, jew tiddependi fuq kemm lingwa hija rappreżentata sew fid-dejta tat-taħriġ? Ma nafx. Imma l-għarfien ikun utli għal kull min jibni flussi ta' xogħol ta' traduzzjoni.
It-tieni: kemm jiswew lill-utenti l-opaċità tal-verżjoni tal-mudell fuq skala kbira?
Jekk utent jibgħat 1,000 dokumenti fix-xahar permezz ta' għodda li ma tiżvelax liema verżjoni tal-mudell qed tintuża (u xi minn dawk id-dokumenti jkun fihom kontenut idiomatiku), kemm-il darba qed jiġri il-falliment litterali b'mod inviżibbli? Kif kienu jafu? X'inhu l-ispiża, f'termini reali, ta' qatt ma nsiru nafu?
Naħseb li din hija mistoqsija aktar importanti mill-biċċa l-kbira tal- paraguni ta' liema AI hija l-aħjar għat-traduzzjoni li qed jiċċirkolaw bħalissa. It-tweġiba mhix uża l-akbar mudell. It-tweġiba tista' tkun: taf x'qed tuża, agħmel it-testijiet tiegħek fuq il-kontenut tiegħek stess, u tikkunċertax li l-isem ta' fornitur wieħed huwa garanzija ta' mġiba konsistenti fil-firxa tal-mudelli tagħhom .
Dik, għall-inqas, hija dak li qed nieħu minn dan it-test.
Abbażi ta' dan it-test wieħed: mudelli iżgħar, ottimizzati għall-effiċjenza fl-istess familja ta' AI defaultjaw għal traduzzjoni litterali ta' idioma Spanjola stabbilita sew, filwaqt li verżjonijiet akbar/ġodda tal- istess mudell ipproduċew rendimenti idiomatika korretti. Jekk dan japplika għall-kategoriji idiomatiku u l-pari lingwistiċi huwa l-kwistjoni li jmiss. Se nagħmel aktar testijiet.
GPT-4.1-MINI, GPT-5.4-MINI, u GPT-5.4 kollha ttraduċew "llevarse" el gato al agua b'mod idjomatiku — iżda f'espressjonijiet Ingliżi differenti b'konnotazzjonijiet sottili differenti. Dan jissuġġerixxi li l-kwalità tat-traduzzjoni idiomatika għandha mill-inqas żewġ dimensjonijiet: jekk il-mudell jirrikonoxxix l-idioma xejn, u liema espressjoni ekwivalenti jagħżel mill-għażliet disponibbli fil-lingwa mira. Il-metriċi standard tal-kwalità tat-traduzzjoni ma jisseparawx b'mod ċar dawn iż-żewġ dimensjonijiet. Naħseb li għandhom.
Dan il-post huwa bbażat fuq ittestjar intern fuq il-pjattaforma ta' żvilupp ta' MachineTranslation.com. It-testing tal-verżjoni b'ħafna mudelli muri hawnhekk għadu mhux disponibbli pubblikament. Qed naqsam is-sejbien għax naħseb li l-osservazzjoni hija utli irrispettivament minn fejn tmexxi t-traduzzjonijiet tiegħek.