July 10, 2026
Maneno mawili. Mifano sita. Maamuzi matatu tofauti ya tafsiri. Hiki ndicho kilichotokea nilipokuwa nikijaribu sentensi 8 za mtihani kupitia mifumo ya AI ya hivi karibuni inayopatikana kwenye MachineTranslation.com, na matokeo yaliyofika yanaonyesha kwa nini modeli inashindwa kwa kimya.
Maneno mawili. Hiyo ni mbaya. Mifano sita. Maamuzi matatu tofauti ya tafsiri.
Katika Kijapani, modeli moja ilitengeneza kama それはやばい, ikihifadhi utata. Mwingine akaacha kiwakilishi cha somo kabisa na akandika fomu tupu やばい, toleo lenye lugha ya kawaida sana. Mtu wa tatu aliandika それはすごい, ambayo hutatua utata kabisa kwa niaba ya "ya kushangilia," na kuondoa maana mbili ambayo iliyofanya kauli hiyo kuwa ya kuvutia mwanzoni. Katika Kiivu, mfano mmoja uliandika Đỉnh vậy (lugha ya mitaani, sahihi kwa kiwango cha vijana). Mwingine aliandika Hiyo ni ajabu sana, kwa sarufi sahihi, lakini karibu na kusema "hiyo ni ajabu halisi" wakati mtu akakutumia ujumbe wa meme.
Zote za hizi zinaweza kutetewa. Hakuna kati yao ni kitu kimoja. Na ikiwa unafanya tafsiri kupitia modeli moja tu, hutaweza kamwe kuona chaguo ambalo lilibadilishwa kwa niaba yako.
Hiyo ndio swali kuu ambalo makala hii inajaribu kujibu. Si si, si kwa lugha nyingi (jozi ya lugha, usajili, kikoa, na muundo wa sentensi), lakini badala yake: ungeweza kujua vipi mfano wako wa AI ulifanya simu mbaya? Hasa katika vikoa kama istilahi za kimatibabu, mikataba ya kisheria, au rasmi ya kitaaluma, ambapo simu mbaya inaonekana sawa na tafsiri sahihi hadi mtaalamu anaisoma.
Hii ndio niliyofanya. Nilitumia sentensi 8 za mtihani kupitia raundi mbili za miundo kwenye MachineTranslation.com: kwanza msingi wa miundo 5 inayotumiwa sana, kisha mkusanyiko ulioongezwa ambao unaongeza baadhi ya miundo mipya ya kiwango cha premium sasa inayopatikana kwa watumiaji wanaolipia. Kawaida, kulinganisha matokeo kutoka kwa mifumo kama hii kungemaanisha kuwa na wagojwa tofauti waliolipwa na kila mtoa huduma kwa mtu binafsi. Kwenye MachineTranslation.com, wanakaa katika muonekano sawa wa kulinganisha. Jozi za lugha zilikuwa Kiingereza→Kijapani na Kiingereza→Kivietinamu. Kategoria za sentensi zillichaguliwa mahsusi ili kujaribu maeneo ambapo kutokubaliana kwa modeli ni muhimu zaidi: maneno ya kiisimu, istilahi za kisheria, istilahi za kimatibabu, muktadha wenye heshima, na kutokuwa na wazi kwa makusudi.
Kumbuka juu ya mbinu ya tathmini: utafiti wa tafsiri ya mashine umekuwa nao matatizo ya jinsi ya kusambaza matokeo kiotomatiki. Vipimo kama BLEU na COMET kama ilivyopimwa katika kazi za pamoja za WMT vinatoa ishara muhimu ya jumla, lakini havina uwezo wa kugunduza hitilafu za rejista, kushindwa kwa maneno ya kawaida, na usahihi wa istilahi, hasa kategoria ambazo ni muhimu zaidi hapa. Kile unachokaribia kusoma ni uchambuzi wa matokeo, si mbio za BLEU.

Si kila sentensi inayoonyesha kutokubaliana kunakosababisha. Mbili kati ya mitihani minane, "Tukamatane baada ya mavumbi kutulia kwenye mkataba huu" (→ Kijapani) na "Tunachoma mafuta ya usiku kufikia tarehe hii ya uzinduzi" (→ Kivietinamu), zilizalisha makubaliano makubwa katika raundi zote mbili. Matamshi hayo yalieleweka kwa usahihi kama matamshi. Hakuna mtu aliyetafsiri "touch base" kama kugusa msingi halisi. Hakuna mtu aliyetafsiri "the dust settles" kama udongo unaozama.
Hii ni muhimu kusimama juu yake: lugha ya biashara ya Kiingereza ya kiidiomu inashughulikiwa vizuri na miundo ya sasa ya kuzamia wakati idiom ni ya kawaida ya kutosha. Makubaliano kuhusu "kuwasiliana" ulikaa imara katika raundi zote mbili; tofauti ilikuwa ni mtindo tu, kuhusu kama kutumia هذه المسألة (jambo hili), هذه الصفقة (biashara hii), au هذه الحالة (kesi hii) kwa maneno ya chanzo.

Jaribio la "kuchoma mafuta ya usiku wa manane" ndipo mambo yalipovutia zaidi. Kila mtindo isipokuwa mmoja ulifahamu vizuri msemo huo. MiniMax M2.7, iliyoletwa katika Round 2, ilitafsiri "burning" kwa kiharusi, ikitoa đốt đuốc, maana yake "burning torches." Muafaka huo uliitengana kwa usahihi.

Kijapani ni lugha yenye tabaka la rasmi. Chaguo la kigezo cha kitenzi, kiambishi, na muundo wa nomino ya kumbukumbu si kwa mtindo. Inasonyeza uhusiano kati ya msemaji na mpokeaji. Kutuma ujumbe kwa CEO yako kwa kutumia aina za kitenzi zisizofanikiwa si kosa la tafsiri kwa maana ya sarufi. Ni kosa la kijamii, na kosa kubwa sana.
Sentensi ya mtihani: Unaweza kutuma hiyo? Asante, ninataka kukamatia. Muktadhafu: Kuwasiliana na Mkurugenzi Mtendaji.

Maafikiano yalibadilika wakati kundi la mtindo lilipanuka. Utaratibu ni rahisi: kuongeza miundo inayosoma kwa usahihi muktadha wa rasmi ilisogeza wengi, na makubaliano yalifuata. Hapa kuna wigo kamili wa kile ambacho miundo ilizalisha katika Raundi ya 2:

Jaribio la usajili wa Kiingereza lilipakua aina tofauti ya kosa la rasmi, lile ambalo ni nyingi zaidi. Sentensi ya chanzo: "Jambo, swali haraka — je, una wakati wa kupiga simu?" Muktadha: kutuma ujumbe kwa mteja. Qwen katika Raundi ya 1 ilijumuisha "mình," kitenzi cha kila mtu kinachoshurutisha urafiki wa kiwango cha wenzi wenye furaha. Kila mfano mwingine uliepuuza kujirejelea kwa wingi wa kwanza kabisa, ambayo ni chaguo salama la kitaaluma. Muhimu, Qwen ilirekebisha hii katika Round 2 na kuondoa "mình." Mkutano wa maoni katika raundi zote mbili uliuondoa.

Sentensi ya kulinda mtu binafsi/mteja ni kauli ya kawaida katika mikataba ya kibiashara: "Muuzaji atakuwa na wajibu wa kulinda mteja dhidi ya madai yoyote ya pande tatu yanayotokana na ukiukaji wa makubaliano haya."
Katika Raundi ya 1, miundo yote mitano ilitambua kwa usahihi rejista ya kisheria na kutumia maneno ya mkopo ベンダー (muuzaji) na クライアント (mteja), yaliyo ya kawaida katika mikataba ya kibiashara ya Kijapani yenye asili ya Kiingereza. Isipokuwa moja: GPT-4.1-NANO ilitumia 販売者 (muuzaji) na 顧客 (mteja), maneno ya Kijapani halali ambayo hayakuwa na mahitaji ya kisheria ya maneno ya kigeni yanayolingana.
Matokeo muhimu zaidi yalitokea katika Raundi ya 2. Kiunganisho kikuu ni kati ya maneno mawili:
Hizi ni dhana tofauti kisheria. "Indemnify" kwa mahsusi inamaanisha kulinda upande mmoja kutokana na wajibu wa pande za tatu. 免責 ni neno sahihi la kisheria. Modeli zote za Round 1 zilitumia 補償. Katika Raundi ya 2, DeepSeek V4-Pro ilikuwa modeli pekee inayozalisha 免責, na ilifanya hivyo katika Raundi ya 2 tu, si Raundi ya 1.

Katika kontrakti, 補償 na 免責 si visawe. Moja inamaanisha "tutakurudisha pesa zako." Nyingine inamaanisha "wewe unalindwa kutokana na dai tangu mwanzo." Ikiwa jukwaa la tafsiri linatumia 補償 mahali ambapo 免責 ni sahihi, wakili anayesoma toleo la Kijapani hautaona makubaliano sawa na ile inayoelezwa na toleo la Kiingereza.
Hii ni matokeo muhimu zaidi katika seti ya data. Sentensi ya jaribio: "Dawa hii haipaswi kutumika kwa wagonjwa wenye historia ya kuoza kwa ini." Chanzo: nyaraka za bidhaa za kliniki. Lengo: Kigeni.
Neno muhimu ni "ulemavu wa ini." Kuna wagombea wawili wa Kivietinamu:
Hizi ni tofauti sana kwa kliniki. Onyo ya kuzuia kwa msingi wa "kupungua kwa kazi ya ini" inatumika kwa mtu yeyote anaye na kazi iliyopungua ya ini, si tu wale ambao walipata kushindwa kabisa kwa ajili ya kiwango cha kazi cha kila kitu. Kutumia suy gan hupunguza idadi ya watu iliyoonyeshwa kwa njia isiyosahihi. Mgonjwa mwenye kuzorota kwa wastani wa ini ambaye anasoma suy gan huenda asijitambue kama idadi ya watu ambao haiwezi kutumia dawa hii.

Baadhi ya sentensi za chanzo ni zenye maana nyingi kwa muundo. "Hiyo ni kizunguzungu" katika lugha ya Kiingereza ya sasa inamaanisha kitu kizuri sana, lakini pia bado ina maana yake halisi (yaani kitu kinachosababisha chuki/kitu kigeuzi), na mvutano kati ya maana hizo mbili ndio sehemu ya jinsi msemo huo unavyowasiliana. Changamoto kwa modeli ya tafsiri ni: je, unabaki ambiguity, kuianguka kwa maana inayowezekana zaidi, au kuchagua moja na kujitolea?


Modeli katika jaribio hili si sawa kabisa. Wanayumba miundo mbalimbali, mifumo ya mafunzo, na muktadha wa utekelezaji. Msingi wa Raundi ya 1 unajumuisha miundo inayopatikana kwa urahisi. Hazina iliyoongezwa ya Round 2 inaongeza mifumo kadhaa ya kiwango cha juu cha premium ambayo sasa inapatikana kwa watumiaji wanaolipa kwa MachineTranslation.com, kiwango sawa cha mifumo ambacho vinginevyo kingemaanisha akaunti tofauti iliyolipwa na kila mtoa huduma binafsi.

Hazina iliyoongezwa katika Round 2 inajumuisha mifumo ambayo ni ya juu zaidi na inapatikana kwa watumiaji wanaolipa kwa MachineTranslation.com. Athari ya kupanua kundi sio sawa. Katika baadhi ya mitihani (rasmi/Kijapani), iliBadilisha makubaliano kwa njia muhimu. Kwa wengine (istilahi za kimatibabu/Kivietinamu), mgawanyiko uliozidi kuwa malalika.

Data ya jaribio inaonyesha kategoria mbili tofauti za kushindwa, na zinahitaji majibu tofauti.
Kategoria A: Kushindwa kimya. Hitilafu za rasmi, hitilafu za kiwango, usahihi wa istilahi za kimatibabu: hizi hutoa matokeo yanayoonekana kuwa sahihi. Kijapani ni sahihi kigramtiki. Mwanzo wa Kigeni anayesema Kiswahili kwa fluent. Hakuna dalili ya uso inayoonyesha kwamba kitu chochote kilienda vibaya. Mtumiaji anayesoma lugha moja tu bila kuwa na furaha ya kusoma matokeo ya modeli nyingi haina njia ya kujua kwamba modeli hiyo ilifanya chaguo la register ambalo mkuu mkuu wa Kijapani angezingatia, au kwamba neno la kliniki lilipunguzwa kwa njia ambayo inabadilisha idadi ya watu inayotumika.
Kategoria B: Kushindwa kuonekana. MiniMax inatafsiri "burning the midnight oil" kama "kuchoma taa." GPT-4.1-NANO inakamatua "That's sick" kuwa "Hiyo ni kizunguzungu." au "Hiyo ni nzuri sana." Hizi zinaweza kugundulika, kwa njia ya msemaji wa lugha ya lengo au kwa kulinganisha na matokeo mengine ya mfano.
Kulinganisha kwa mifano mingi ambacho SMART inatoa kunafaa zaidi katika Kategoria A. Wakati mifano mitano au kumi inazalisha matokeo na wengi wanakubaliana juu ya kiwango rasmi wakati mmoja inazalisha Kijapani cha kawaida kwa fomu rahisi, kutokubaliana kunaweza kuonekana katika mtazamo wa kulinganisha. Mtumiaji anayezungumza lugha ya lengo anaweza kutathmini chaguo za hizo. Mtumiaji ambaye hawezi kuona kwamba uamuzi uliogombewa ulifanywa, na kuamua kama sentensi hiyo inahitaji ukaguzi wa binadamu.
Kwa kazi ya kiwango cha hati, faili kubwa, tafsiri inayohifadhi muundo wa PDF, mikataba, au nyenzo za kliniki, uwezo wa usindikaji wa hati wa jukwaa hushughulikia muundo wa faili bila kuvunja muundo. Lakini maswali ya ubora yaliyotolewa hapo juu yanatumika bila kujali ukubwa wa faili. Utafiti wa kliniki wa kurasa 100 ambapo kila mfano wa "hepatic impairment" unatafsiriwa kama "liver failure" ni toleo kubwa la tatizo lile lile lililogunduliwa katika Jaribio la 2.
Kwa kategoria za kimatibabu na kisheria haswa, uthibitisho wa binadamu ni kizuizi sahihi. Huduma ya Tomedes' ya AI Post-Editing, ambayo inaoanisha matokeo ya AI na ukaguzi uliohamirishwa wa binadamu kwa aina hii haswa ya maudhui ya jukumu kubwa, imejengwa kwa hii. Kazi ya kuona matokeo mengi si kwamba utachagua kila wakati wengi. Mgawanyiko wa suy gan / suy giảm chức năng gan ni kile cha aina ambayo inapaswa kuanzisha ukaguzi huo, si kwa sababu mifano yote ni makosa, lakini kwa sababu mifano ambayo ina ujinga zaidi si sahihi zaidi.
Ni kwamba utajua kwamba chaguo lilibadilika, ambalo ni tofauti na kudhani kwamba matokeo yaliyo mbele yako ni sahihi.

Weka majaribio nane kando kando na muundo unashikilia: makubaliano na kutokubaliana hayajasambazwa bila mpangilio. Lugha ya biashara ya kila siku na maneno ya kiistaara ("kuwasiliana," "kufanya kazi sana usiku") ilikubaliana katika karibu kila muundo katika kundi hilo, katika zamu zote mbili. Rasmi, usahihi wa kisheria, na istilahi za kimatibabu hazikufanya. Mtihani wa rasmi wa CEO ulibadilika kutoka kwa mtindo wa kawaida hadi rasmi tu baada ya kundi lililopanuliwa kujumuishwa. Kifungu cha kulipiza madhimani kilichotokeza tofauti halisi ya kisheria (kutokuwa na hatia vs. kulipwa fidia) ambayo kielelezo kimoja tu, katika raundi moja tu, kilichokamatia kwa usahihi. Mgawanyiko wa istilahi za kimatibabu haukutatuliwa kabisa, ukibaki karibu 6-kwa-4 katika raundi zote mbili bila kujali ni miundo ipi iliyokuwa katika kundi.
Hii ndiyo matokeo halisi, si dai la uuzaji: makubaliano hayafanyi kila sentensi kuwa nzuri, na hayahitaji kufanya hivyo. Ni muhimu zaidi mahali ambapo fluency ya modeli moja haitakupatia sababu ya kuishangilia, na mahali ambapo kuwa na makosa kunakostana kitu halisi.
Kuna tabaka la pili, la vitendo zaidi la jaribio linalostahili kusemwa wazi. Kuendesha ulinganisho huu mwenyewe kulikuza kuangalia matokeo kutoka GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, na MiniMax M2.7 kando kwa kando na miundo ya msingi iliyopo, mahali pamoja, kwenye jukwaa moja. Nje ya MachineTranslation.com, hiyo si subscription moja. Ni kadhaa, moja kwa kila mtoa huduma ambaye unataka kujaribu kiwango chake cha premium, kwa bei yoyote ambayo kila mtoa huduma anatoza kwa mtu binafsi. Watumiaji wanaolipa hapa wanakuwa na kulinganisha sawa katika klik moja, kwa sehemu ya gharama ya kudumisha miundombinu mitano tofauti ya usajili wa premium, bila kuacha kitu kinachohitaji: kuona mahali ambapo miundo inakubaliana, na kujua haswa wakati haiwezi.
Hakuna ambaye ni bora kwa jumla; inategemea kategoria ya mtihani. Claude Sonnet na Claude Opus kila wakati walichagua neno la kimatibabu la Kichina kinachofaa zaidi, na Claude Opus alizalisha slang inayofaa zaidi kwa "That's sick." Lakini Claude Sonnet pia ilitoa Kijapani cha kawaida katika sentensi ya muktadha wa CEO rasmi, ambapo GPT-5.5 ilifanya kwa usahihi. Kulinganisha matokeo moja kwa moja ni salama zaidi kuliko kuchagua modeli moja na kuiamini.
Hakuna; usahihi unategemea kikoa. Gemini 3.5-Flash na GLM-5-Turbo zalizalisha Kijapani rasmi kinachofaa zaidi katika jaribio hili. Mifumo yote ya Claude ilikuwa sahihi zaidi katika istilahi za kimatibabu za Kigeni. DeepSeek V4-Pro ndilo pekee la modeli iliyotumia neno sahihi la kisheria cha Kijapani, lakini tu katika Raundi ya 2, na ilitoa Kijapani cha kawaida mahali pengine. Hakuna modeli moja iliyotawala katika majaribio yote yanane.
Hapana, si kiotomatiki. Kupanua kundi la mifumo ya kiwango cha juu mpya kubadilisha makubaliano kutoka rasmi hadi rasmi katika jaribio la adabu ya Kijapani. Lakini katika mtihani wa istilahi za kimatibabu za Kividhani, mgawanyiko uliendelea kuwa takriban 6-hadi-4 bila kujali ni miundo ipi iliyojumuishwa. Modeli zaidi husababisha kutokubaliana zaidi, ambayo ni ishara muhimu, lakini makubaliano bado yanafuata wengi, na wengi sio kila wakati jibu sahihi zaidi.
SMART ni mfumo wa makubaliano ya multi-model wa MachineTranslation.com, unaoenea hadi kwa mifumo 22 ya AI katika wabonge ikiwemo OpenAI, Anthropic, Google, na DeepSeek. Inafanya tafsiri kupitia mifumo mingi wakati mmoja na kuonyesha matokeo ya ushindi wa wengi pamoja na jibu la kila mfumo binafsi, kwa chaguo-msingi, bila haja ya usanidi. Muktadha hubadilika wakati kundi la mfano hubadilika, kama inavyoonyeshwa katika matokeo ya utendaji wa lugha ya Kijapani ya jaribio hili: muktadha wa kawaida katika Raundi ya 1 ikawa rasmi katika Raundi ya 2.
Hakuna modeli moja; ukaguzi wa binadamu ndio jibu bora. Miundo ya Claude kila wakati ilichagua neno la kimatibabu cha Kiarabu zaidi sahihi, na DeepSeek V4-Pro pekee ilitumia neno sahihi la kisheria cha Kijapani, lakini tu katika Raundi ya 2. Utengano wa istilahi za kimatibabu haukuweza kutatuliwa katika mifumo 10, ambayo inaonyesha kwamba ujinga wa kikoa unahitajika, si kwamba muundo tofauti unapaswa kuchaguliwa. Ukaguzi wa uhariri wa baada ya tafsiri uliothibitishwa na binadamu, kama anavyotoa Tomedes, hutoa ukaguzi huo wa kitaalamu.