June 5, 2026
Nimekuwa nikifanya majaribio ya ndani kwenye kitu ambacho hatuzungumzii vya kutosha katika tasnia ya utafsiri: sio kama mifumo tofauti ya AI hutafsiri tofauti, lakini kama matoleo tofauti ya AI sawa hutafsiri tofauti - na kwa kiasi gani.
Wiki iliyopita nilipitia nahau moja ya Kihispania kupitia matoleo matano ya ChatGPT wakati huo huo kwenye jukwaa la majaribio la ndani la MachineTranslation.com. Kilichorudi kilinisimamisha.
Matoleo mawili yalitoa tafsiri ambayo, kwa kweli, haina maana kwa Kiingereza. Matoleo matatu yalitengeneza tafsiri sahihi za kimazoea. Na zile tatu sahihi hazikukubaliana. Zote tano ni
ChatGPT. Zote tano ni OpenAI. AI sawa, modeli tofauti — na matokeo hayawezi kuwa tofauti zaidi.
Ninashiriki hii sasa kwa sababu nadhani ni muhimu, si kwa sababu nina majibu safi. Sifanyi. Lakini uchunguzi huo unavutia vya kutosha kuuweka ulimwenguni.
Kifungu nilichojaribu kilikuwa llevarse el gato al agua.

Hapa kuna kile kila toleo lilitoa:
| Model | Output | Idiomatic? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | kumpeleka paka majini | ❌ Kihalisi |
| ChatGPT::GPT-4.1-NANO | kumpeleka paka majini | ❌ Kihalisi |
| ChatGPT::GPT-4.1-MINI | kufanikiwa kuipata | ✅ Sahihi |
| ChatGPT::GPT-5.4-MINI | kupata unachotaka | ✅ Sehemu |
| ChatGPT::GPT-5.4 | kutoka juu | ✅ Sahihi |
Kifungu kinamaanisha kufikia kitu kigumu dhidi ya vikwazo, kwa kufanikiwa ushindi mgumu. Hakuna uhusiano wowote na paka au maji. Tafsiri ya kweli si tafsiri. Ni tafsiri ya neno kwa neno ya kifungu ambacho mfumo ulishindwa kutambua kama nahau.
GPT-4o-MINI na GPT-4.1-NANO zilitengeneza matokeo sawa. Sio sawa, sawa kabisa. Maarifa yetu ya Tafsiri yaliangazia hili moja kwa moja: GPT-4.1-nano na GPT-4o-mini zinashiriki tafsiri zinazofanana, zikisisitiza tafsiri halisi kuliko maana ya nahau.
GPT-4.1-MINI, GPT-5.4-MINI, na GPT-5.4 kila moja ilitoa kitu kinachotambulika kuwa sahihi — lakini si sawa na kingine.
Ninataka kuwa sahihi kuhusu kwa nini llevarse el gato al agua ni pembejeo muhimu ya majaribio badala ya ile iliyochaguliwa kwa makini.
Ni nahau iliyoanzishwa vizuri. Inaonekana katika fasihi, uandishi wa habari, na hotuba ya kila siku. Si ya ajabu. Kielelezo chochote kilichofunzwa kwa mkusanyiko mzuri wa maandishi ya Kihispania kinapaswa kukutana nacho. Swali si kama mfumo umeona kifungu hicho. Swali ni nini hufanya nayo.
Hali mbaya zaidi ya kushindwa katika tafsiri ya nahau si kutoa tafsiri mbaya . Inazalisha tafsiri ya moja kwa moja ambayo inaonekana kukubalika kwa mtu ambaye hajui lugha lengwa.
Kubeba paka majini ni lugha ya Kiingereza iliyo sahihi kisarufi. Imeundwa vizuri. Inasikika kama kitu ambacho kinaweza kumaanisha kitu. Mtumiaji ambaye hasemi Kihispania anaweza akaisoma, akaitikia kwa kichwa, na kuendelea — kamwe hakujua maana ya asili ilipotea kabisa.
Hiyo ndiyo hali ya kushindwa ambayo ninaijali. Sio kosa la dhahiri. Yule asiyeonekana.
Mchoro hapa si wa kubahatisha. Mifumo miwili iliyotoa tafsiri za maandishi (GPT-4o-MINI na GPT-4.1-NANO) zote ni mifumo midogo, nyepesi iliyoboreshwa kwa ajili ya kasi na ufanisi wa gharama. Miundo mitatu ambayo ilitoa tafsiri za kawaida (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) inawakilisha kizazi tofauti au kiwango cha vigezo.
Hii inapendekeza kitu ambacho nadhani hakijachunguzwa vya kutosha: uwezo wa kawaida katika tafsiri huongezeka kwa uwezo wa modeli kwa njia ambazo hazionekani katika vipimo vya jumla.
Vipimo vya jumla vya lugha hupima hoja, maarifa, kuandika, hisabati. Kwa kawaida hawaendani kupima kama mfumo unaweza kutambua kwamba mvua inanyesha sana haihusiani na hali ya hewa, au kwamba llevarse el gato al agua haihusiani na kumnywesha paka maji. Nahau hukaa kwenye makutano ya maarifa ya kitamaduni, dhana ya muktadha na utambuzi wa ruwaza — na makutano hayo yanaonekana kuhitaji kiwango cha uwezo wa mfumo ambacho mifumo midogo haiendi kuzidi mara kwa mara.
Ninachodai: kwamba mifumo mikubwa huwa watafsiri bora kila wakati. Sina ushahidi wa hilo kama sheria ya jumla. Ninachokiona: kwamba kwa maudhui ya nahau hasa, pengo la toleo ndani ya familia lilikuwa kubwa kuliko nilivyotarajia.
Watumiaji wengi wanaotumia zana ya kutafsiri ya AI hawajui ni toleo gani la AI hiyo wanayotumia. Wanafungua bidhaa, huchagua jozi ya lugha , na kupata matokeo. Usambazaji wa modeli hauwazi kwao.
Hii huleta maana inapofanywa kwa kiwango kikubwa. MachineTranslation.com ilichakata zaidi ya kazi za tafsiri za Kiingereza-kwa-Kihispania mamia ya maelfu katika kipindi kimoja cha siku 90. Ikiwa sehemu kubwa ya kazi hizo iligusa maudhui ya lugha (nakala za uuzaji, lugha ya kisheria, maandishi ya fasihi, mawasiliano ya kawaida) na zana iliyoelekeza kazi hizo iliwaelekeza watumiaji kwenye modeli ndogo bila kujua, basi kubeba paka majini ilikuwa inaonekana katika matokeo halisi, katika hati halisi, kwa watu halisi walioamini matokeo. Sekta ya tafsiri imetumia miaka mingi kulinganisha watoa huduma wa AI. DeepL dhidi ya
Google. Claude dhidi ya ChatGPT. Hiyo ulinganisho ni muhimu. Lakini ndani ya mtoa huduma mmoja, pengo la toleo linaweza kuwa kubwa tu — na ni pengo ambalo mifumo mingi ya kulinganisha haipimi kwa sababu haijaribu katika kiwango cha toleo la modeli.
Mtu anaposema Ninatumia ChatGPT kwa tafsiri, sentensi hiyo haitoshi kuwa na maana. ChatGPT gani? Nano? 4o-mini? 4.1-mini? 5.4? Jibu hubadilisha matokeo kwa njia ambazo si rahisi, angalau kwa maudhui ya kawaida.
Hii ndiyo sehemu ninayoona ya kuvutia zaidi, na bado sijafahamu kikamilifu nini cha kufanya nayo.
Mifumo mitatu iliyotoa tafsiri za kawaida ilitoa tatu tofauti:
Zote tatu zinaweza kutetewa kama tafsiri za Kiingereza za llevarse el gato al agua. Lakini si sawa.
Ili kuifanikisha inasisitiza utekelezaji dhidi ya ugumu, wewe ulifanya kitu kigumu na kilifanikiwa. Kupata kile unachotaka kunasisitiza matokeo uliyotaka yakifikiwa, huku kukiwa na mkazo mdogo juu ya ugumu. Kutoka juu inasisitiza ushindi wa ushindani, kushinda jamaa na wengine.
Nahau ya asili ya Kihispania inakaa karibu na ya kwanza kati ya hizi. Maneno hayo yana maana ya kushinda upinzani, sio tu kupendelea matokeo moja na kuifanya itimie. Lakini kupata mtu anachotaka na kujitokeza juu si vibaya, ni kutoa maelezo yasiyo sahihi kwa njia tofauti.
Hii inaleta swali ambalo hupata ugumu kweli: wakati mifumo mitatu kila moja inatoa tafsiri sahihi lakini tofauti ya nahau, unafanyaje kutathmini ni ipi iliyo bora? Matija ya BLEU hulinganishwa na tafsiri moja ya marejeleo — lakini nani aliandika marejeleo, na ni yupi kati ya haya matatu angechagua? Wakala wetu wa Tafsiri wa AI, kwa sifa yake, aliuliza
swali sahihi kabla ya kujitolea kwa matokeo yoyote: Ni nini maana ya 'llevarse el gato al agua' katika muktadha huu? Chaguo tatu zilitolewa — kufikia lengo gumu, kuchukua kitu kisicho cha lazima, au kujihusisha na shughuli hatari. Swali hilo si la kupamba tu. Ni utaratibu ambao kutoelewana kwa muktadha kunatatuliwa kabla ya tafsiri kukamilishwa.
Lakini hoja inasimama: majibu matatu sahihi, vivuli vitatu tofauti vya maana. Zana za kutathmini tafsiri hazijajengwa kwa aina hii ya hila.
Ninataka kuwa mkweli kuhusu mipaka ya kile ambacho jaribio hili linaonyesha.
Nahau moja, jozi moja ya lugha, siku moja ya upimaji wa ndani. Hiyo si utafiti. Ni uchunguzi. Sijui kama muundo huu (miundo midogo ikipendelea tafsiri ya moja kwa moja, miundo mikuu ikipata tafsiri sanifu) unashikilia kwa uthabiti katika:
Pia sijui kama hii ni tabia thabiti ya miundo hii au kitu kinachobadilika na masasisho na urekebishaji. Watoa huduma wa miundo hawachapishi ajenda za mabadiliko mahususi kwa tafsiri. Toleo la muundo linaloshughulikia llevarse el gato al agua kwa usahihi leo linaweza kusasishwa mwezi ujao, na hatutakuwa na njia ya kujua.
Ninachojua: jaribio hili lilitoa matokeo ya kuvutia hivi kwamba ninataka kuendesha zaidi, kwa utaratibu zaidi, katika jozi zaidi za lugha na aina za maudhui. Nitakapokuwa na mengi ya kushiriki, nitafanya hivyo.
Nitaishia kwa maswali mawili ambayo mtihani huu ulinibakiza nayo. Sita wajibu, sina data ya kufanya hivyo bado. Lakini nadhani ni maswali sahihi ya kuuliza.
Kwanza: katika kiwango gani cha kigezo ujuzi wa lugha ya kiasili unakuwa wa kuaminika? Rukwama kutoka GPT-4o-MINI
na GPT-4.1-NANO (zote mbili za maana halisi) hadi GPT-4.1-MINI (ya kiasili) inapendekeza kuwa kuna kiwango mahali fulani katika safu ya kigezo kati ya saizi hizo za modeli ambapo utambuzi wa nahau huwashwa. Je, inalingana? Je, inatumika kwa nahau katika lugha zote, au inategemea jinsi lugha inavyowakilishwa katika data ya mafunzo? Sijui. Lakini kujua kungekuwa muhimu kwa mtu yeyote anayeunda michakato ya tafsiri.
Pili: gharama ya kutofichua toleo la modeli kwa watumiaji kwa kiwango kikubwa ni ipi?
Ikiwa mtumiaji anapitia hati 1,000 kwa mwezi kupitia zana ambayo haifichui ni toleo gani la modeli linatumika (na baadhi ya hati hizo zina maudhui ya nahau), ni mara ngapi kushindwa kwa kweli kunatokea bila kuonekana? Wangalijuezaje? Ni gharama gani, kwa kweli, ya kutojua kamwe?
Nadhani hii ni swali muhimu zaidi kuliko majaribio mengi ya AI ipi ni bora kwa tafsiri yanayozunguka kwa sasa. Jibu si tumia mfumo mkuu zaidi. Jibu huenda likawa: jua unachotumia, fanya yako mwenyewe majaribio kwenye maudhui yako mwenyewe, na usidhanie kwamba jina la mtoa huduma mmoja ni dhamana ya tabia thabiti katika safu yao ya mifumo .
Hiyo, angalau, ndiyo ninayochukua kutoka kwa jaribio hili.
Kulingana na jaribio hili moja: modeli ndogo, zilizoboreshwa kwa ufanisi ndani ya familia sawa ya AI zilitoa tafsiri halisi ya nahau maarufu ya Kihispania, wakati matoleo makubwa/mapya zaidi ya modeli sawa yalitoa tafsiri sahihi za nahau. Iwe hii inashikilia katika aina za nahau na jozi za lugha ndio swali linalofuata. Nitaendesha vipimo zaidi.
na GPT-5.4 zote zilitafsiri llevarse el gato al agua kwa njia ya nahau — lakini katika misemo tofauti ya Kiingereza yenye maana tofauti kidogo. Hii inapendekeza kwamba ubora wa tafsiri ya nahau una vipimo viwili au zaidi: ama mfumo unatambua nahau hiyo kabisa, na ni msamiati upi wa kulinganisha unaochaguliwa kutoka kwa chaguo zinazopatikana za lugha lengwa. Vipimo vya kawaida vya ubora wa tafsiri havifafanui kwa uwazi vipimo hivi viwili. Nadhani wanapaswa.
Chapisho hili linatokana na majaribio ya ndani kwenye jukwaa la maendeleo la MachineTranslation.com. Upimaji wa matoleo mengi ya modeli ulioonyeshwa hapa bado haujapatikana kwa umma. Ninashiriki matokeo kwa sababu nadhani uchunguzi huo ni muhimu bila kujali unafanya tafsiri zako wapi.