July 10, 2026
Kaks sõna. Kuus mudelit. Kolm erinevat tõlkeotust. Siin on see, mis juhtus, kui käivitasin 8 testilauset uusimate MachineTranslation.com-is saadaolevate AI-mudelite kaudu, ja mida väljundid tegelikult paljastab selle kohta, millal mudel vaikselt ebaõnnestub.
Kaks sõna. "See on lahe." Kuus mudelit. Kolm erinevat tõlkeotust.
Jaapani keeles renderdas üks mudel selle kui それはやばい, säilitades mitmetähenduslikkuse. Teine jättis subjekti pronoomeni täielikult välja ja kirjutas paljanda kuju やばい, mis on võimalik kõige arusaadavam versioon. Kolmas kirjutas それはすごい, mis lahendab ebaselguse täielikult "hämmastava" kasuks, eemaldades topeltmõtte, mis tegi fraasi alguses huvitavaks. Eesti keeles kirjutas üks mudel Đỉnh vậy (slängi, õige noorte registri jaoks). Teine kirjutas Thật tuyệt vời, grammatiliselt korrektne, kuid lähedasem ütlusele "see on tõeliselt imeline", kui keegi saadab sulle meemi.
Kõik need on kaitstavad. Ükski neist ei ole sama asi. Ja kui käitate tõlkeid ühe mudeli kaudu, ei näe te kunagi valikut, mis tehti teie nimel.
See on keskne küsimus, millele käesolev artikkel püüab vastata. Mitte milline AI-mudel on parim tõlkimiseks 2026. aastal (vastus sõltub keelepaari, registrist, valdkonnast ja lauseehitusest), vaid pigem: kuidas teaksite, et teie mudel tegi vale otsuse? Eriti valdkondades nagu meditsiiniterminoloogia, juriidilised lepingud või professionaalne formaalsus, kus vale otsus näeb välja täpselt nagu õige tõlge, kuni spetsialist seda loeb.
Siin on see, mida ma tegin. Juhtisin 8 testlauset läbi kahe mudelite vooru MachineTranslation.com-is: esmalt 5 laialdaselt kasutatava mudeli baasjoone, seejärel laiendatud kogumi, mis lisab mitu uusimat premium-taseme mudeli varianti, mis on nüüd saadaval tasuliste kasutajate jaoks. Tavaliselt tähendaks selliste mudelite väljundite võrdlemist eraldi tasuliste tellimuste võtmist iga pakkuja juures eraldi. MachineTranslation.com-il istuvad nad samas võrdlusvaates. Keelepaari olid inglise→jaapani ja inglise→vietnami. Lause kategooriad valiti spetsiaalselt selleks, et testida alasid, kus mudeli lahkarvamused on kõige olulisemad: idioomsed väljendid, juriidiline terminoloogia, meditsiiniline terminoloogia, ametlikkusele tundlik kontekst ja tahtlik semantiline mitmetähenduslikkus.
Märkus hindamismeetodoloogia kohta: masinõpe on pikka aega võidelnud sellega, kuidas väljundeid automaatselt hinnata. Sellised mõõdikud nagu BLEU ja COMET , nagu mõõdetakse WMT ühisülesannetes , annavad kasulikku koondandmete signaali, kuid nad on halvad registrivigu, idioomide ebaõnnestumisi ja terminoloogilist täpsust tuvastama, just need kategooriad, mis siin kõige rohkem olulised on. Mida sa oled lugemisele asumas, on väljundi analüüs, mitte BLEU võistlus.

Mitte iga lause ei too esile tähenduslikku erimeelsust. Kaks kaheksast testist, "Let's touch base once the dust settles on this deal" (→ jaapani keel) ja "We're burning the midnight oil to hit this launch date" (→ vietnami keel), andsid kõrge kokkuleppimuse mõlemas voorus. Idioomid mõisteti õigesti idioomidena. Keegi ei tõlkinud fraasi "touch base" kui füüsilise aluse puudutamist. Keegi ei tõlkinud "the dust settles" kui setimendina langevat tolmu.
See on väärt peatumist: idiomatiline inglise ärikeel on praeguste piiriteooria mudelite poolt piisavalt hästi käsitletud, kui idioom on piisavalt levinud. Konsensus "touch base" jäi stabiilseks mõlemas voorus; variatsioon oli puhtalt stiililine, kas kasutada この件 (see asi), この取引 (see tehing) või この案件 (see juhtum) lähteteksti fraasi jaoks.

Test "keskööõli põletamine" on koht, kus asjad läksid huvitavamaks. Kõik mudelid peale ühe mõistsid idioomu õigesti. MiniMax M2.7, kasutusele võetud 2. voorus, tõlkis "burning" sõnasõnaliselt, tekitades põlev leekide, mis tähendab "põlevaid sokleid." Konsensus välistus selle õigesti.

Jaapani keel on formaalsuse kihtidega keel. Verbi lõpu, asesõna ja referentsiaalse nimisõna vormi valik ei ole stilistiline. See signaliseerib kõneleja ja adressaadi vahelist suhet. Oma tegevjuhile sõnumi saatmine mitteformaalse verbivormiga ei ole grammatilises mõttes tõlkeviga. See on sotsiaalse vea näide, ja märkimisväärne üks.
Kas saad selle üle saata? Aitah, hindan seda. Kontekst: teadet saatmine tegevjuhile.

Konsensus muutus, kui mudelivalik laienes. Mehhanism on lihtne: mudelid, mis õigesti loevad formaalsuse konteksti, nihutasid enamuse ja konsensus järgnes. Siin on täielik spekter sellest, mida mudelid Round 2 tootis:

Vietnami registri test paljastas teistsuguse vormistuse vea, mis on peenem. Lähtelause: "Hei, kiire küsimus — kas sa saad hetkeks kõnele tulla?" Kontekst: kliendile sõnumi saatmine. Qweni 1. voorus kasutas sõna "mình", mis on esimese isiku asesõna, mis viitab mitteformaalse võrdväärse sõprusele. Kõik teised mudelid vältisid täielikult esimese isiku eneseviitamist, mis on turvalisem professionaalne valik. Oluliselt, Qwen parandas seda 2. voorus ja jättis "mình" ära. Konsensus mõlemas voorus välistus selle.

Müüja/kliendi kaitseklausel on standardne säte kaubanduslepingutes: "Müüja peab hüvitama kliendile kõik kolmandate osapoolte nõuded, mis tulenevad käesoleva lepingu rikkumisest."
1. voorus tuvastasid kõik viis mudelit õigesti juriidilise registri ja kasutasid laensõnu ベンダー (tarnija) ja クライアント (klient), mis on standardsed ingliskeelse päritoluga Jaapani ärilepingutes. Üks erand: GPT-4.1-NANO kasutas 販売者 (müüja) ja 顧客 (klient), seaduslikke jaapani sõnu, millel puudub laenusõnade vormide formaalne juriidiline täpsus.
Olulisem leid ilmnes 2. ringis. Peamine erinevus on kahe sõna vahel:
Need on juriidiliselt erinevad mõisted. Kaitse pool kolmanda osapoole vastutusest - see on "indemnify" spetsiifiline tähendus. 免責 on õige juriidiline termin. Kõik 1. ringi mudelid kasutasid 補償. 2. ringis oli DeepSeek V4-Pro ainus mudel, mis tootis 免責, ja ta tegi seda ainult 2. ringis, mitte 1. ringis.

Lepingus ei ole 補償 ja 免責 sünonüümid. Üks tähendab "me hüvitame teile." Teine tähendab "te olete nõude eest algusest peale kaitstud". Kui tõlkeplatvorm kasutab 補償 seal, kus 免責 on õige, ei näe jaapani keeles juriidilist dokumenti lugev advokaat sama lepingut, mida ingliskeelne versioon kirjeldab.
See on andmestikus kõige olulisem leid. Testlause: "See ravim on vastunäidustatud patsientidel, kellel on maksapuudulikkuse ajalugu." Allikas: kliinilise toote dokumentatsioon. Sihtkeel: Vietnami.
Kriitiliseks terminiks on "maksafunktsiooni häire". Seal on kaks Vietnami kandidaati:
Need on kliiniliselt erinevad. Vastunäidustuse hoiatus, mis põhineb "maksafunktsiooni häirel", kehtib kõigile, kellel on vähenenud maksafunktsioon, mitte ainult neile, kes on kogenud täielikku organite riknemist. Suy gani kasutamine kitsendab näidatud populatsiooni valesti. Patsient, kellel on keskmine maksafunktsiooni häire ja kes loeb suy gan, ei pruugi end vastu näidustusega populatsioonina ära tunda.

Mõned lähtekohad on tahtlikult mitmetähenduslikud. "See on haige" kaasaegses inglise slängis tähendab midagi suurepärast, kuid see kannab endiselt ka selle sõnasõnalist tähendust (st midagi, mis on haigustav/vastik), ja nende kahe tähenduse vaheline pinge on osa sellest, kuidas fraas suhtleb. Väljakutse tõlkemudelile on: kas säilitada mitmetähenduslikkus, viia see kokku kõige tõenäolisema tähenduseni või valida üks ja jääda selle juurde?


Selle testi mudelid ei ole kõik samaväärsed. Here is the translation: 1. ringi baasvariant sisaldab laialdaselt kättesaadavaid mudeleid. Laiendatud 2. vooru kogum lisab mitu uusimat premium-taseme mudelivarianti, mis on nüüd saadaval MachineTranslation.com maksva kasutajatele, sama taseme mudel, mis muidu tähendaks eraldi tasuliste kontode avamist iga üksiku pakkuja juures.

Laiendatud kogum 2. voorus sisaldab mudeleid, mis on arenenum ja saadaval MachineTranslation.com maksva kasutajatele. Basseini laiendamise mõju ei ole ühtlane. Mõnedes testides (formaalsus/jaapani keel) muutis see konsensust oluliselt. Teistes (meditsiinilises terminoloogias/vietnami keeles) sügavenes lõhe.

Testandmed osutavad kahele erinevale rikete kategooriale ja need nõuavad erinevaid vastuseid.
Kategooria A: Vaikimisi rikked. Formaalsuse vead, registri vead, meditsiinilise terminoloogia täpsus: need tekitavad väljundeid, mis näevad õiged välja. Jaapani keel on grammatiliselt korrektne. Vietnamlane räägib sujuvalt. Puudub pinnaline märk, et midagi läks valesti. Ühekeelne kasutaja, kes loeb ühe mudeli väljundit, ei saa teada, et mudel tegi registri valikut, mida märkaks kõrge positsiooniga jaapani juht, või et kliiniline termin oli kitsendatud sel viisil, mis muudab populatsiooni, millele see kehtib.
Kategooria B: Nähtavad ebaõnnestumised. MiniMax tõlkis "burning the midnight oil" kui "põletada küünlaid." GPT-4.1-NANO lahendab "That's sick" üheselt mõistetavaks "すごい"-ks. Neid on võimalik tuvastada kas sihtkeele kõneleja poolt või võrdlemise teel teiste mudeli väljunditega.
Mitme mudeli võrdlus, mida SMART pakub, on kõige väärtuslikum A-kategoorias. Kui viis või kümme mudelit toodavad väljundeid ja enamik neist nõustub ametliku registriga, samas kui üks toodab mitteformaalne lihtvorm jaapani keelt, on lahkarvamused nähtavad võrdlusvaatest. Kasutaja, kes räägib sihtkeel, saab hinnata valikuid. Kasutaja, kes ei näe, et vastuoluline otsus tehti, saab otsustada, kas see otsus nõuab inimese ülevaatust.
Dokumendi tasandi töö puhul, suurte failide puhul, paigutust säilitava PDF-ide, lepingute või kliiniliste materjalide tõlkimisel käsitleb platvormi dokumendi töötlemise võimalus faili struktuuri ilma vormingut rikkumata. Kuid ülaltoodud kvaliteedinõuded kehtivad sõltumata faili suurusest. 100-leheküljelises kliinilises uuringus, kus "maksafunktsiooni häire" tõlgitakse igal juhul kui "maksakahjustus", on sama probleem, mida tuvastati testis 2, suuremas mahus.
Meditsiini- ja juriidiliste kategooriate puhul on inimese poolt tehtud kontrollimine õige lahendus. Tomedesi tehisintellekti järeltöötlusteenused, mis ühendavad tehisintellekti väljundi sertifitseeritud inimese ülevaatusega täpselt selliste kõrge riskiga sisude jaoks, on selleks loodud. Suy gan / suy giảm chức năng gan jagunemine on täpselt selline leid, mis peaks käivitama selle ülevaatuse, mitte seetõttu, et kõik mudelid on valesti, vaid seetõttu, et mudelid, mis on kõige enesekindlamad, ei ole kõige täpsemad.
Mitme väljundi nägemise väärtus ei ole see, et te valite alati enamus. See, et teile on teada, et valik tehti, mis erineb sellest, et eeldada, et teie ees olev väljund on õige.

Asetage kaheksa testi kõrvuti ja muster kehtib: nõustumine ja erimeelsus ei ole juhuslikult jaotunud. Idioomaatiline, igapäevane ärikeel ("ühendust võtmine", "öö keskel töömine") oli peaaegu kõigis mudelites ühesugune mõlemas voorus. Formaalsus, juriidiline täpsus ja meditsiiniterminoloogia ei. Tegevjuhi-formaalsuse test muutus mitteformaalsest formaalseks ainult siis, kui kaasati laiendatud ring. Hüvitisklausel paljastas tegeliku õiguslikku eristust (免責 vs. 補償), mille sai õigesti aru ainult üks mudel ühes voorus. Meditsiiniliste terminite jagamine ei lahenenud kunagi, jäädes mõlemas voorus ligikaudu 6-4 suhtesse olenemata sellest, millised mudelid kogumis olid.
See on tegelik leid, mitte turundusväide: konsensus ei tee iga lauset paremaks ja see pole vajalikgi. See kõige väärtuslikum on täpselt seal, kus ühe mudeli sujuvus ei anna sulle põhjust selles kahelda, ja kus valesti olemine tegelikult midagi maksab.
Sellel testil on teine, praktilisem kiht, mis tasub selgelt välja öelda. Selle võrdluse ise läbiviimine tähendas GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo ja MiniMax M2.7 väljundite kontrollimist kõrvuti olemasolevate baasmudeligate, ühes kohas, ühel platvormil. Väljaspool MachineTranslation.com-i, see ei ole üks tellimus. See mitut, üks iga pakkuja jaoks, kelle premium taseme soovid testida, olenemata sellest, mida iga pakkuja eraldi maksab. Maksva kasutajad saavad siin sama võrdluse ühe klõpsuga, murdosa hinnaga, mis maksaks viie eraldi premium tellimuse säilitamine, ilma et loobuksid asjast, mis tegelikult loeb: näha, kus mudelid kokku langevad, ja teada täpselt, millal nad ei lange.
Kumbki pole kategooriliselt parem; see sõltub testi kategooriast. Claude Sonnet ja Claude Opus valisid järjepidevalt täpsema vietnami meditsiinilise termini ja Claude Opus tootis kõige sobivama slängi väljendile "That's sick." Kuid Claude Sonnet tootis ka juhusliku jaapani keele ametlikus tegevjuhi konteksti lauses, kus GPT-5.5 sai selle õigesti. Väljundite otsene võrdlemine on kaitstavamalt kui ühe mudeli valimine ja sellele usaldamine.
Ühtegi pole; täpsus sõltub valdkonnast. Gemini 3.5-Flash ja GLM-5-Turbo tõid selles testis välja kõige sobivama formaalse jaapani keele. Mõlemad Claude mudelid olid kõige täpsemad Vietnami meditsiinilise terminoloogia puhul. DeepSeek V4-Pro oli ainus mudel, mis kasutas õiget jaapani juriidilist terminit, kuid ainult 2. voorus, ja see tootis mujal juhusliku jaapani keelt. Ükski mudel ei domineerinud kõigis kaheksas testis.
Ei, mitte automaatselt. Kaasnemate mudelite lisamine premium-tasemega variandid laiendas ühiskonnatunnetust jaapani formaalsuse testis mitteformaalsest formaalseks. Kuid Vietnami meditsiiniliste terminite testis püsis jaotus ligikaudu 6-4 suhtes sõltumata sellest, milliseid mudeleid kaasati. Rohkem mudeleid toob esile rohkem erimeelsust, mis on kasulik signaal, kuid konsensus järgib endiselt enamust, ja enamus ei ole alati kõige täpsem vastus.
SMART on MachineTranslation.com'i mitmemudelilise konsensussüsteemi, mis hõlmab kuni 22 tehisintellekti mudelit pakkujatelt, sealhulgas OpenAI, Anthropic, Google ja DeepSeek. See alltekst käib korraga mitme mudeli kaudu ja kuvatakse enamuskonsensusliku väljundi kõrvuti iga üksiku mudeli vastusega, vaikimisi ilma seadistamist vajamata. Konsensus muutub, kui mudelite kogum muutub, nagu näidatud selle testi jaapani keele ametlikkuse tulemuses: mitteformaalne konsensus 1. voorus muutus 2. voorus ametlikuks.
Ühtegi üksikut mudelit pole; inimese ülevaatus on parem vastus. Claude'i mudelid valisid järjepidevalt täpsema vietnami meditsiinilise termini, ja ainult DeepSeek V4-Pro kasutas õiget jaapani juriidilist terminit, kuid ainult 2. voorus. Meditsiinilise terminoloogia jaotus ei lahenenud kunagi 10 mudeli vahel, mis näitab, et on vaja domeeni ekspertiisi, mitte seda, et tuleks valida erinev mudel. A sertifitseeritud inimese järelredigeerimise ülevaatus, nagu Tomedes pakub, tagab selle spetsialistliku kontrolli.