July 10, 2026
Dalawang salita. Anim na modelo. Tatlong iba't ibang desisyon sa pagsasalin. Ito ang nangyari noong pinagsama ko ang 8 test sentences sa pamamagitan ng pinakabagong AI models na available sa MachineTranslation.com, at kung ano talaga ang ipinapakita ng mga output tungkol sa kung kailan nabibigo ang isang model nang tahimik.
Dalawang salita. Yan ay nakakahawa. Anim na modelo. Tatlong natatanging desisyon sa pagsasalin.
Sa Hapon, isang modelo ay ginawa itong それはやばい, na pinapanatili ang kalabuan. Ang isa pang bumaba sa subject pronoun nang buo at nagsulat ng bare form やばい, ang pinaka-colloquial na bersyon na posible. Ang isang pangatlo ay nagsulat それはすごい, na lubos na nalulutas ang kalabuan pabor lamang sa "kahanga-hanga," at inalis ang doble kahulugan na ginawa ang parirala na kawili-wili sa unang lugar. Sa Vietnamese, isang modelo ang nagsulat Đỉnh vậy (slang, tama para sa youth register). Isa pang nagsulat Thật tuyệt vời, grammatically tama, ngunit mas malapit sa pagsasabi ng "iyon ay tunay na kahanga-hanga" kapag nagpadala sa iyo ng meme ang isang tao.
Lahat ng ito ay maaaring ipagtanggol. Wala sa kanila ang pareho. At kung kayo ay gumagamit ng mga pagsasalin sa pamamagitan ng isang modelo lamang, hindi ninyo makikita ang pagpipilian na ginawa para sa inyo.
Iyan ang pangunahing tanong na sinisikap na sagutin ng artikulong ito. Hindi kung aling AI model ang pinakamahusay para sa pagsasalin noong 2026 (ang sagot ay nakadepende sa wika pares, register, domain, at istraktura ng pangungusap), kundi sa halip: paano mo malalaman kung ang iyong modelo ay gumawa ng maling desisyon? Lalo na sa mga larangan tulad ng medikal na terminolohiya, mga legal na kontrata, o propesyonal na pormalidad, kung saan ang maling desisyon ay mukhang eksakto na pagsasalin hanggang sa basahin ito ng isang espesyalista.
Narito ang ginawa ko. Nagpatakbo ako ng 8 test sentences sa pamamagitan ng dalawang round ng models sa MachineTranslation.com: una ay isang baseline ng 5 malawak na ginagamit na models, pagkatapos ay isang pinalawak na pool na nagdadagdag ng ilang sa pinakabagong premium-tier model variants na available na ngayon sa mga paying users. Karaniwang, ang paghahambing ng mga output mula sa mga modelo tulad nito ay nangangahulugang magkakahiwalay na may bayad na subscription sa bawat provider nang indibidwal. Sa MachineTranslation.com, sila ay nakaposisyon sa parehong view ng paghahambing. Ang mga pares ng wika ay English→Japanese at English→Vietnamese. Ang mga kategorya ng pangungusap ay pinili nang partikular upang subukan ang mga lugar kung saan ang hindi pagkakasundo ng modelo ay pinakamahalaga: idiomatic na phrasing, legal na terminolohiya, medikal na terminolohiya, kontekstong sensitibo sa pagiging pormal, at sinadyang semantic ambiguity.
Isang tala sa metodolohiya ng pagsusuri: mahabang panahon nang nagsikap ang pananaliksik sa pagsasalin ng makina kung paano awtomatikong iskor ang mga output. Ang mga sukatan tulad ng BLEU at COMET na sinusukat sa mga WMT shared tasks ay nagbibigay ng kapaki-pakinabang na pandaigdigang signal, ngunit sila ay mahina sa pagtukoy ng mga error sa register, pagkabigo ng idiom, at katumpakan ng terminolohiya, eksakto ang mga kategoryang mahalaga dito. Ang iyong basahin ay output analysis, hindi isang BLEU race.

Hindi bawat pangungusap ay nagpapakita ng makabuluhang hindi pagkakasundo. Dalawa sa walong pagsusulit, "Let's touch base once the dust settles on this deal" (→ Japanese) at "We're burning the midnight oil to hit this launch date" (→ Vietnamese), ay nagdulot ng mataas na kasunduan sa parehong round. Ang mga idiom ay tama naming naintindihan bilang mga idiom. Walang nagsalin ng "touch base" bilang pagpapahawak ng isang pisikal na base. Walang nagsalin ng "the dust settles" bilang sediment na nahuhulog.
Ito ay karapat-dapat na tigilan: ang idiomatic na wika ng negosyo sa Ingles ay medyo mahusay na hinawakan ng mga kasalukuyang frontier models kapag ang idiom ay sapat na karaniwan. Ang consensus para sa "touch base" ay nananatiling matatag sa parehong round; ang variation ay purong stylistic lamang, tungkol sa kung gagamitin ang "ang bagay na ito" (this matter), "ang deal na ito" (this deal), o "ang case na ito" (this case) para sa source phrase.

Ang pagsubok na "pagsunog ng langis sa hatinggabi" ang kung saan naging mas kawili-wili ang mga bagay-bagay. Lahat ng modelo maliban sa isa ay tama ang pag-unawa sa idiom. MiniMax M2.7, na ipinakilala sa Round 2, ay literal na nagsalin ng "burning," na nagbunga ng đốt đuốc, na nangangahulugang "burning torches." Ang consensus ay tama na hindi kasama ito.

Ang Hapon ay isang wika na may mga layer ng pagiging pormal. Ang pagpili ng pandiwang wakas, pangalan, at anyo ng referensyal na pangalan ay hindi estilo. Ito ay nagpapakita ng relasyon sa pagitan ng nagsasalita at tumatanggap. Ang pagpapadala ng mensahe sa iyong CEO gamit ang casual na mga anyo ng pandiwa ay hindi isang translation error sa grammatikal na kahulugan. Ito ay isang social error, at isang malaking isa.
Ang test sentence: Maaari mong ipadala iyon? Salamat, appreciate ko yan. Konteksto: pagmemensahe sa isang CEO.

Ang consensus ay nagbago nang lumaki ang modelo ng pool. Ang mekanismo ay simple: ang pagdagdag ng mga modelo na tama na nagbabasa ng konteksto ng pagiging pormal ay nagbago ng karamihan, at ang consensus ay sumunod. Narito ang buong spectrum ng kung ano ang ginawa ng mga modelo sa Round 2:

Ang Vietnamese register test ay nagpakita ng ibang uri ng formality error, na mas subtle. Ang orihinal na pangungusap: "Hoy, mabilis na tanong — libre ka ba para sumali sa isang tawag?" Konteksto: pagmemensahe sa isang kliyente. Si Qwen sa Round 1 ay nagsama ng "mình," isang first-person pronoun na nagpapahiwatig ng casual peer-level friendship. Ang bawat ibang modelo ay lubos na naiwasan ang unang-persona na self-reference, na siyang mas ligtas na propesyonal na pagpipilian. Mahalagang napansin, inayos ng Qwen ito sa Round 2 at tinanggal ang "mình." Ang consensus sa parehong round ay hindi kasama ito.

Ang pangako ng vendor/kliyente na magbayad ng pinsala ay isang karaniwang klawsula sa mga komersyal na kasunduan: "Ang nagbebenta ay dapat magbigay ng proteksyon sa kliyente laban sa anumang mga reklamo ng ikatlong partido na nagmula sa paglabag sa kasunduang ito."
Sa Round 1, tamang natukoy ng lahat ng limang modelo ang legal na rehistro at ginamit ang mga hiram na salitang ベンダー (nagbebenta) at クライアント (kliyente), na karaniwan sa mga kontratang komersyal ng Japan na may pinagmulang Ingles. Isang eksepsyon: Ang GPT-4.1-NANO ay gumamit ng 販売者 (nagbebenta) at 顧客 (customer), mga lehitimong salitang Hapones na kulang sa pormal na legal na pagiging partikular ng mga katumbas na salitang hiniram.
Ang mas mahalagang paghahanap ay lumitaw sa Round 2. Ang pangunahing pagkakaiba ay nasa pagitan ng dalawang salita:
Ang mga ito ay iba't ibang konsepto sa legal na aspeto. Ang "indemnify" ay nangangahulugang protektahan ang isang partido mula sa pananagutan sa ikatlong partido. Ang 免責 ay ang tamang legal na termino. Lahat ng Round 1 na mga modelo ay gumamit ng 補償. Sa Round 2, ang DeepSeek V4-Pro ay ang tanging modelo na gumawa ng 免責, at ginawa nito ito sa Round 2 lamang, hindi sa Round 1.

Sa isang kontrata, ang 補償 at 免責 ay hindi mga kasingkahulugan. Ang isa ay nangangahulugang "babayaran ka namin." Ang iba ay nangangahulugang "kayo ay protektado mula sa claim sa simula pa lamang." Kung ang isang platform ng pagsasalin ay gumagamit ng 補償 kung saan ang 免責 ang tama, ang isang abogado na nagbabasa ng bersyon sa Hapon ay hindi makikita ang parehong kasunduan na inilarawan ng bersyon sa Ingles.
Ito ang pinaka-mahalaga at may pinakamalaking epekto na natuklasan sa dataset. Ang pangungusap na pagsubok: "Ang gamotong ito ay kontraindikado sa mga pasyenteng may kasaysayan ng hepatic impairment." Pinagmulan: klinikal na dokumentasyon ng produkto. Target: Vietnamese.
Ang kritikal na termino ay "hepatic impairment." May dalawang kandidatong Vietnamese:
Ang mga ito ay klinikal na natatangi. Ang isang babala ng kontraindikasyon batay sa "hepatic impairment" ay nalalapat sa sinumang may nabawasang function ng atay, hindi lamang sa mga nakaranas ng kumpletong kabiguan ng organ. Ang paggamit ng suy gan ay hindi tama na nagpapaliit ng ipinahiwatig na populasyon. Ang isang pasyente na may katamtamang pagkasira ng atay na nagbabasa ng "suy gan" ay maaaring hindi makilala ang kanilang sarili bilang ang contraindicated na populasyon.

Ang ilang mga source na pangungusap ay sadyang kalabuan. "Ang 'That's sick' sa modernong English slang ay nangangahulugang kahanga-hanga o napakaganda, ngunit nananatili pa rin itong may literal na kahulugan (iyon ay nakakasawa o nakakasuklam), at ang tensyon sa pagitan ng dalawang kahulugang ito ay bahagi ng kung paano nakikipag-ugnayan ang parirala." Ang hamon para sa isang modelo ng pagsasalin ay: pinapanatili mo ba ang kalabuan, binabawasan ito sa pinaka-malamang na kahulugan, o pumipili ka ng isa at nagsasangkot?


Ang mga modelo sa pagsusubok na ito ay hindi lahat katumbas. Sila ay sumasaklaw sa iba't ibang arkitektura, mga rehimen ng pagsasanay, at mga konteksto ng paglulunsad. Ang Round 1 baseline ay nagsasama ng mga modelo na malawak na accessible. Ang pinalawak na Round 2 pool ay nagdadagdag ng maraming pinakabagong premium-tier model variants na available na ngayon sa mga paying users sa MachineTranslation.com, ang parehong tier ng model na kung hindi man ay nangangahulugang isang hiwalay na paid account sa bawat indibidwal na provider.

Ang pinalawak na pool sa Round 2 ay kinabibilangan ng mga models na mas advanced at available sa mga paying users sa MachineTranslation.com. Ang epekto ng pagpapalaki ng pool ay hindi pantay. Sa ilang mga pagsusulit (pormalidad/Hapon), ito ay nagbago ng consensus nang malaki. Sa iba (medikal na terminolohiya/Vietnamese), ang pagkakaiba ay lumalalim pa.

Ang test data ay tumutukoy sa dalawang natatanging kategorya ng kabiguan, at nangangailangan sila ng iba't ibang mga tugon.
Kategorya A: Mga tahimik na kabiguan. Mga kamaliang pormal, mga kamaliang register, katumpakan ng medikal na terminolohiya: ang mga ito ay gumagawa ng mga output na mukhang tama. Ang Hapones ay grammatical. Ang Vietnamese ay marunong. Walang surface signal na may kahit anong napigil. Ang isang monolingual na gumagamit na nagbabasa ng output ng isang modelo ay walang paraan upang malaman na ang modelo ay gumawa ng pagpili sa rehistrong isang senior na Japanese executive ay mapapansin, o na ang isang klinikal na termino ay pinaliit sa isang paraan na nagbabago sa populasyon na ito ay naaangkop.
Category B: Nakikitang pagkabigo. MiniMax ang pagsasalin ng "burning the midnight oil" bilang "burning torches." GPT-4.1-NANO ay nagresolba ng "That's sick" sa walang-ambigong "すごい." Ang mga ito ay maaaring matukoy, alinman ng isang nagsasalita ng target na wika o sa pamamagitan ng paghahambing sa ibang output ng modelo.
Ang multi-model na paghahambing na ibinibigay ng SMART ay pinakamahalaga sa Kategorya A. Kapag limang o sampung mga modelo ay gumagawa ng output at karamihan ay sumasang-ayon sa isang pormal na register habang ang isa ay gumagawa ng casual na plain-form na Hapon, ang hindi pagkakasundo ay makikita sa view ng paghahambing. Ang isang user na nagsasalita ng target na wika ay maaaring suriin ang mga opsyon. Ang isang user na hindi makakakita na ang isang pinaglalabanan na desisyon ay ginawa, at magpasya kung ang ganitong pangungusap ay nangangailangan ng pagsusuri ng tao.
Para sa trabaho sa antas ng dokumento, malalaking file, pagsasalin na nagpapanatili ng layout ng mga PDF, kontrata, o klinikal na materyales, ang kakayahan ng platform na magproseso ng dokumento ay humahawak ng istraktura ng file nang hindi sinisira ang pagpapahusay. Ngunit ang mga katanungan tungkol sa kalidad na itinataas sa itaas ay naaangkop anuman ang laki ng file. Ang isang 100-pahinang klinikal na pag-aaral kung saan bawat pagkakataon ng "hepatic impairment" ay isinasalin bilang "liver failure" ay isang mas malaking bersyon ng parehong problema na natukoy sa Test 2.
Para sa medikal at legal na mga kategorya partikular, ang human verification ay ang tamang backstop. Ang AI Post-Editing service ng Tomedes, na pinagsasama ang AI output na may certified human review para sa eksaktong ganitong uri ng high-stakes content, ay itinayo para dito. Ang suy gan / suy giảm chức năng gan split ay eksaktong uri ng paghahanap na dapat magdulot ng pagsusuring iyon, hindi dahil lahat ng mga modelo ay mali, kundi dahil ang mga modelo na pinaka-kumpiyansa ay hindi ang pinaka-tumpak.
Ang halaga ng pagtingin sa maraming output ay hindi na palagi mong pipiliin ang karamihan. Ito ay na kaya mong malaman na ang isang pagpili ay ginawa, na iba sa pag-aakala na ang output sa harap mo ay tama.

Ilagay ang walong pagsubok nang magkakasama at ang isang pattern ay tumatagal: ang pagsang-ayon at hindi pagsang-ayon ay hindi random na ipinamamahagi. Ang idiomatic, pang-araw-araw na wika sa negosyo ("makipag-ugnayan," "magtrabaho nang gabi-gabi") ay nagsama-sama sa halos bawat modelo sa pool, sa parehong round. Ang pormalidad, legal na katumpakan, at medikal na terminolohiya ay hindi. Ang pagsubok ng CEO-formality ay lumipat mula sa casual tungo sa pormal lamang kapag kasama na ang pinalawak na pool. Ang indemnification clause ay nagpakita ng isang tunay na legal na pagkakaiba (免責 vs. 補償) na isang modelo lamang, sa isang round, ang nakuha nang tama. Ang terminolohiya sa medikal ay hindi kailanman lubos na nalutas, na nananatiling humigit-kumulang 6-sa-4 sa parehong round anuman ang mga modelo na nasa pool.
Iyan ang aktwal na paghahanap, hindi isang claim sa marketing: ang consensus ay hindi ginagawang mas mahusay ang bawat pangungusap, at hindi ito kailangang gawin. Ito ay pinaka-mahalaga kung saan ang paggalaw ng isang modelo ay nagbibigay sa iyo ng walang dahilan na mag-atubiling ito, at kung saan ang pagkakamali ay talagang may gastos.
May pangalawang, mas praktikal na layer sa pagsusulit na ito na karapat-dapat sabihin nang malinaw. Ang paggawa ng comparison na ito sa aking sarili ay nangangahulugang sinusuri ang mga output mula sa GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, at MiniMax M2.7 nang magkakasama sa isang lugar, sa isang platform. Sa labas ng MachineTranslation.com, iyan ay hindi isang subscription. Marami itong mga subscription, isa para sa bawat provider na gusto mong subukan ang premium tier, sa anumang presyo na hiwalay na sinasaad ng bawat provider. Ang mga nagbabayad na user dito ay makakakuha ng parehong paghahambing sa isang click lamang, sa isang bahagi lamang ng gastos ng pagpapanatili ng limang magkakahiwalay na premium subscriptions, nang hindi sinasacrifice ang bagay na tunay na mahalaga: makita kung saan sumasang-ayon ang mga modelo, at malaman nang eksakto kung kailan sila hindi sumasang-ayon.
Walang kategoryang mas mahusay; ito ay nakadepende sa kategorya ng pagsusulit. Si Claude Sonnet at Claude Opus ay patuloy na pumili ng mas tumpak na medikal na termino sa Vietnamese, at si Claude Opus ay gumawa ng pinakaangkop na slang para sa "That's sick." Pero ang Claude Sonnet ay nagproduce din ng casual na Hapon sa isang formal na CEO-context na pangungusap, kung saan ang GPT-5.5 ay nakakuha ng tama. Ang direktang paghahambing ng mga output ay mas mapagkakatiwalaan kaysa pumili ng isang modelo at magtiwala dito.
Walang isa; ang katumpakan ay nakadepende sa larangan. Ang Gemini 3.5-Flash at GLM-5-Turbo ay gumawa ng pinakaangkop na pormal na Hapon sa pagsusulong na ito. Ang parehong Claude models ay pinaka-tumpak sa Vietnamese medical terminology. Ang DeepSeek V4-Pro ay ang tanging modelo na gumamit ng tamang legal na terminong Hapones, ngunit lamang sa Round 2, at gumawa ito ng casual na Hapones sa ibang lugar. Walang isang modelo lamang ang nanguna sa lahat ng walong pagsusulit.
Hindi, hindi awtomatiko. Ang pagpapalaki ng pool gamit ang mas bagong premium-tier na variant ng modelo ay nagbago ng consensus mula sa casual tungo sa formal sa Japanese formality test. Ngunit sa Vietnamese medical terminology test, ang paghahati ay patuloy na umabot sa humigit-kumulang 6-to-4 anuman ang mga modelo na kasama. Maraming mga modelo ang nagpapakita ng mas maraming hindi pagkakasundo, na isang kapaki-pakinabang na signal, ngunit ang consensus ay sumusunod pa rin sa karamihan, at ang karamihan ay hindi palaging ang pinakaeksaktong sagot.
Ang SMART ay multi-model consensus system ng MachineTranslation.com, na sumasaklaw sa hanggang 22 AI models mula sa mga provider tulad ng OpenAI, Anthropic, Google, at DeepSeek. Ito ay tumatakbo ng pagsasalin sa pamamagitan ng maraming mga modelo nang sabay-sabay at ipinapakita ang output ng karamihan-consensus kasama ang bawat indibidwal na sagot ng modelo, bilang default, nang walang kailangang pagsasaayos. Ang consensus ay nagbabago kapag ang modelo pool ay nagbabago, tulad ng ipinakita sa Japanese formality result ng test na ito: ang isang casual consensus sa Round 1 ay naging formal sa Round 2.
Walang iisang modelo; ang pagsusuri ng tao ang mas magandang sagot. Ang mga Claude models ay patuloy na pumili ng mas tumpak na Vietnamese medical term, at ang DeepSeek V4-Pro lamang ay gumamit ng tamang Japanese legal term, ngunit lamang sa Round 2. Ang medikal na terminolohiya ay hindi kailanman nalutas sa buong 10 modelo, na nagpapahiwatig na kailangan ng kadalubhasaan sa larangan, hindi na dapat pumili ng ibang modelo. Isang sertipikadong pagsusuri ng post-editing ng tao, tulad ng inaalok ng Tomedes, ay nagbibigay ng espesyalistang pagsusuring iyon.