July 10, 2026
Dvi žodžiai. Šeši modeliai. Trys skirtingi vertimo sprendimai. Štai kas atsitiko, kai aš paleidau 8 bandymo sakinius per naujausius AI modelius, prieinamus MachineTranslation.com, ir ką iš tikrųjų atskleidžia rezultatai apie tai, kada modelis tyliai nepavyksta.
Du žodžiai. "Tai baisu." Šeši modeliai. Trys skirtingi vertimo sprendimai.
Japonų kalboje vienas modelis jį išvertė kaip それはやばい, išsaugodamas dviprasmybę. Kitas visiškai atmetė subjekto įvardį ir parašė nuodinę formą やばい, kiek tik įmanoma kolokvialesnę versiją. Trečiasis parašė それはすごい, kuris visiškai išsprendžia dviprasmybę „nuostabus" naudai, pašalinant dvigubą reikšmę, kuri padarė frazę įdomią iš pradžių. Lietuvoje vienas modelis parašė Đỉnh vậy (slengas, teisingai jaunimo žargoną). Kitas parašė Tai tikrai nuostabu, gramatiškai taisyklinga, bet arčiau sakant "tai tikrai nuostabu", kai kas nors tau atsiuntė memelį.
Visi šie variantai yra ginčytini. Nė vienas iš jų nėra tas pats dalykas. Ir jei vertinate per vieną modelį, niekada nematysite pasirinkimo, kuris buvo atliktas jūsų vardu.
Tai yra centrinė klausimas, į kurį šis straipsnis bando atsakyti. Ne kuris dirbtinio intelekto modelis yra geriausias vertimui 2026 m. (atsakymas priklauso nuo kalbų poros, registro, srities ir sakinio struktūros), o greičiau: kaip jūs žinotumėte, kai jūsų modelis priėmė klaidingą sprendimą? Ypač tokiose srityse kaip medicininė terminologija, teisiniai kontraktai ar profesionali formalumas, kur klaidingas sprendimas atrodo lygiai taip pat kaip teisingas vertimas, kol jį perskaito specialistas.
Štai ką aš padariau. Aš paleidiniu 8 bandymų sakinius per du modelių raundus svetainėje MachineTranslation.com: pirmiausia bazinį 5 plačiai naudojamų modelių, tada išplėstą grupę, kuri prideda kelis naujausius premium klasės modelio variantus, dabar prieinamus mokėjusiems vartotojams. Paprastai lyginant šių modelių išvestis reikėtų atskirų mokamų prenumeratų pas kiekvieną teikėją atskirai. Svetainėje MachineTranslation.com jie yra toje pačioje palyginimo rodinyje. Kalbų poros buvo Anglų→Japonų ir Anglų→Vietnamiečių. Sakinio kategorijos buvo pasirinktos specialiai tam, kad išbandytų sritis, kuriose modelio nesutarimai yra labiausiai reikšmingi: idiomatinės frazės, teisinė terminologija, medicininė terminologija, formalumui jautrūs kontekstai ir sąmoningas semantinis dviprasmingumas.
Pastaba dėl vertinimo metodologijos: mašininis vertimas ilgą laiką kovojo su tuo, kaip automatiškai įvertinti išvestis. Tokios metrikos kaip BLEU ir COMET , išmatuotos WMT bendruose užduotyse , suteikia naudingą bendrą signalą, tačiau jos blogai aptinka registracijos klaidas, idiomų trūkumus ir terminologinį tikslumą, būtent tas kategorijas, kurios čia yra svarbiausios. Tai, ką jūs ketinate skaityti, yra išvesties analizė, o ne BLEU lenktynės.

Ne kiekvienas sakinys išryškina prasmingą nesutarimą. Du iš aštuonių testų, „Let's touch base once the dust settles on this deal" (→ Japonų) ir „We're burning the midnight oil to hit this launch date" (→ Vietnamiečių), pasiekė aukštą sutarimą abiem raundais. Frazeologizmai buvo teisingai suprastu kaip frazeologizmai. Niekas nevertė "touch base" kaip fizinio pagrindo liečiimo. Niekas nevertė „the dust settles" kaip nuosėdų krintančios.
Verta čia sustoti: idiomine anglų verslo kalba yra pakankamai gerai tvarkoma dabartinių pažangiausių modelių, kai idioma yra pakankamai dažna. Sutarimas dėl "susisiekti" išliko stabilus abiem etapais; variacija buvo grynai stilistinė, apie tai, ar naudoti この件 (šis klausimas), この取引 (šis sandoris), ar この案件 (šis atvejis) šaltinio frazei.

Testas "deginti vidurnakčio alyvą" buvo ten, kur viskas tapo įdomiau. Visi modeliai išskyrus vieną teisingai suprato frazeologizmą. MiniMax M2.7, įvesta 2-ame raunde, pažodžiui išvertė „burning", sukurdama đốt đuốc, reiškiančią „degančias žvakes". Konsensusas teisingai jį išskyrė.

Japonų kalba yra formalumo sluoksniais sudaryta kalba. Veiksmažodžio galūnės, įvardžio ir referentinio daiktavardžio formos pasirinkimas nėra stilistinis. Tai signalizuoja ryšį tarp kalbėtojo ir adresato. Žefui savo vadovui siųsti žinutę naudojant šnekamąsias veiksmažodžio formas nėra vertimo klaida gramatikos prasme. Tai socialinė klaida, ir reikšminga.
Bandinio sakinys: Ar galite tai nusiųsti? Dėkui, tai labai vertinu." Kontekstas: žinutė vadovui.

Konsensusas pasikeitė, kai modelio telkinys išsiplėtė. Mekanizmas yra paprastas: pridėjus modelius, kurie teisingai skaito formalumo kontekstą, pasikeitė dauguma, ir konsensusas juos sekė. Čia pateikiamas visas modelių pagamintų rezultatų spektras 2-ame raunde:

Vietnamiečių registracijos testas atskleidė kitokią formalumo klaidą, kuri yra subtilesnė. Šaltinio sakinys: Hei, greita klausimas — ar tu laisvas/laisva paskambinti? Kontekstas: žinutės siuntimas klientui. Pirmame rate Qwen panaudojo „mình" – pirmo asmens įvardį, kuris reiškia neoficialią bendrapavardę draugystę. Visi kiti modeliai visiškai vengė pirmojo asmens savęs nuorodos, o tai yra saugesnis profesionalus pasirinkimas. Svarbu pažymėti, kad Qwen tai ištaisė 2-ame raunde ir išmetė „mình". Sutarimas abiejuose raunduose jį išskyrė.

Pardavėjo/kliento atlygintinų nuostolių sąlyga yra standartinė komercinio susitarimo nuostata: "Tiekėjas turės atlyginti klientui bet kokius trečiųjų šalių ieškinius, kylančius iš šio susitarimo pažeidimo."
1 raunde visi penki modeliai teisingai atpažino teisinį registrą ir naudojo skolinius ベンダー (tiekėjas) ir クライアント (klientas), standartinius japonų komercinėse sutartyse su angliška kilme. Viena išimtis: GPT-4.1-NANO naudojo 販売者 (pardavėjas) ir 顧客 (klientas), teisėtus japonų žodžius, kuriems trūksta skolintų žodžių ekvivalentų formalaus juridinio specifičumo.
Svarbesnis rezultatas pasirodė 2-ame rate. Pagrindinė distinkcija yra tarp dviejų žodžių:
Tai yra teisiniai skirtingi konceptai. „Indemnify" konkrečiai reiškia apsaugoti šalį nuo trečiųjų šalių atsakomybės. 免責 yra teisingas juridinis terminas. Visi 1-ojo raundo modeliai naudojo 補償. 2 raunde DeepSeek V4-Pro buvo vienintelis modelis, kuris sukūrė 免責, ir jis tai padarė tik 2 raunde, o ne 1 raunde.

Kontakte 補償 ir 免責 nėra sinonimai. Vienas reiškia "mes jums grąžinsime pinigus." Kitas reiškia "jūs esate apsaugoti nuo pretenzijos iš pat pradžių." Jei vertimo platforma naudoja 補償 ten, kur 免責 yra teisingas, teisininkas, skaitantis Japonijos versiją, nematys tos pačios sutarties, kurią aprašo anglų versija.
Tai yra svarbiausias rezultatas duomenų rinkinyje. Testinis sakinys: Šis vaistas yra kontraindikuojamas pacientams, turintiems hepatinės funkcijos sutrikimo istorijos. Šaltinis: klinikinės produkto dokumentacija. Tikslas: Vietnamietis.
Kritinis terminas yra „kepenų funkcijos sutrikimai". Yra du vietnamiečių kandidatai:
Tai yra kliniškai skirtingi. Kontraindikacijos įspėjimas, pagrįstas "kepenų funkcijos sutrikimu", taikomas bet kuriam asmeniui, kurio kepenų funkcija yra sumažėjusi, o ne tik tiems, kurie patyrė visišką organo nepakankamumą. Naudojant suy gan neteisingai susiaurinamas nurodyta populiacija. Pacientas, turintis vidutinį kepenų funkcijos sutrikimą, kuris skaito "suy gan", gali neatpažinti savęs kaip kontraindikuotą populiaciją.

Kai kurie šaltinio sakiniai yra dviprasmiški pagal dizainą. „Tai baisu" šiuolaikiniame anglų slengo žargone reiškia ką nors puikaus, bet jis taip pat išlaiko savo tiesiogią reikšmę (tai yra siaubinga/paniekinanti), ir įtampa tarp šių dviejų reikšmių yra dalis to, kaip šis žodis komunikuoja. Iššūkis vertimo modeliui yra: ar jūs išsaugote dviprasmybę, ją sutraukiate į labiausiai tikėtiną reikšmę, ar pasirenkate vieną ir jai atsidedikuojate?


Šiame teste esantys modeliai nėra visi lygiaverčiai. Jie apima skirtingas architektūras, mokymo režimus ir diegimo kontekstus. Pirmojo raundo bazinė versija apima plačiai prieinamus modelius. Išplėstinis 2-asis raundas apima kelis naujausius premium lygio modelių variantus, dabar prieinamus mokantys vartotojai MachineTranslation.com svetainėje, tą pačią modelio kategoriją, kuri kitaip reikštų atskirą mokamą paskyrą su kiekvienu atskirų teikėju.

Išplėstinis 2-ojo raundo fondas apima modelius, kurie yra pažangesni ir prieinami mokantys vartotojai MachineTranslation.com svetainėje. Išplėtus fondą, poveikis nėra vienodas. Kai kuriuose testuose (formalumas/japonų kalba) tai reikšmingai pasikeitė konsensusą. Kituose (medicininė terminologija/vietnamiečių), skirtumas pagilėjo.

Bandymų duomenys rodo dvi skirtingas gedimų kategorijas, ir joms reikalingi skirtingi atsakymai.
A kategorija: Tylūs nesėkmenai. Formalumo klaidos, registro klaidos, medicininės terminologijos tikslumas: šie aspektai sukuria išvestis, kurios atrodo teisingos. Japonų kalba yra gramatiškai taisyklinga. Vietnamietis sklandžiai kalba. Nėra jokio paviršiaus signalo, kad kažkas būtų negerai. Vienakalbis vartotojas, skaitantis vieno modelio išvestį, negali žinoti, kad modelis padarė registro pasirinkimą, kurį pastebėtų aukštas Japonijos vadovas, arba kad klininis terminas buvo susiaurintas tokiu būdu, kuris keičia populiaciją, kuriai jis taikomas.
B kategorija: Matomi trūkumai. MiniMax išvertė "burning the midnight oil" kaip "burning torches." GPT-4.1-NANO išsprendžia "That's sick" į nedviprasmę "すごい." Tai yra aptinkama, arba tikslinės kalbos kalbėtojo, arba lyginant su kitais modelio rezultatais.
Kelių modelių palyginimas, kurį teikia SMART, yra labiausiai vertingas A kategorijoje. Kai penki arba dešimt modelių sukuria rezultatus ir dauguma sutinka dėl formalaus registro, o vienas sukuria neoficialią paprastą japonų formą, nesutarimas yra matomas palyginimo rodinyje. Vartotojas, kalbantis tiksline kalba, gali įvertinti variantus. Vartotojas, kuris negali matyti, kad buvo priimtas ginčijamas sprendimas, gali nuspręsti, ar tas nuosprendis nusipelno žmogiškojo peržiūrėjimo.
Dėl dokumento lygio darbų, didelių failų, maketą išsaugančio PDF, sutarčių ar klinikinės medžiagos vertimo, platformos dokumento apdorojimo galimybė tvarko failo struktūrą nesulaužydama formatavimo. Tačiau aukščiau iškeltus kokybės klausimus taikytina nepaisant failo dydžio. 100 puslapių klinikinė studija, kurioje kiekvienas "hepatinės funkcijos sutrikimo" atvejis išverstas kaip "kepenų nepakankamumo" yra didesnė to paties problemos versija, nustatyta 2 teste.
Medicinai ir teisinėms kategorijoms konkrečiai, žmogaus patvirtinimas yra teisingas atsarginis variantas. Tomedes' AI Post-Editing paslauga, kuri sujungia AI išvestį su sertifikuotu žmogaus peržiūra būtent tokiam didelio rizikos turiniui, yra sukurta tam. Suy gan / suy giảm chức năng gan skirtis yra būtent tokia išvada, kuri turėtų suaktyvinti tą peržiūrą, ne todėl, kad visi modeliai yra klaidingi, bet todėl, kad modeliai, kurie yra labiausiai pasitikintys, nėra tiksliausi.
Kelių išvesties variantų vertė nėra ta, kad visada pasirinksite didžiausią dalį. Tai, kad žinosite, jog pasirinkimas buvo atliktas, o tai skiriasi nuo prielaidos, kad jūsų priekyje esantis rezultatas yra teisingas.

Padėkite aštuonis testus vienas šalia kito ir išlaikytas modelis: sutarimas ir nesutarimas nėra atsitiktinai pasiskirstę. Idiomatinė, kasdienė verslo kalba („susisiekti", „dirbti naktimis") suartėjo beveik visose modelio grupės versijose abiem ratais. Formalumas, teisinė tikslumas ir medicininė terminologija neatitiko. Vadovo formalumo testas pasikeitė iš neoficialaus į oficialų tik įtraukus išplėstą grupę. Atlygintinimo sąlyga atskleidė tikrą teisinį skirtumą (免責 vs. 補償), kurį teisingai suprato tik vienas modelis, tik viename raunde. Medicininės terminologijos skirtumas niekada nebuvo išspręstas, išlikdamas maždaug 6 prieš 4 abiejuose raunduose, nepaisant to, kurie modeliai buvo telkinyje.
Tai yra tikrasis atradimas, o ne rinkodaros teiginys: sutarimas nepadaro kiekvieno sakinio geresniu, ir jis to neturi daryti. Tai yra labiausiai vertinga būtent ten, kur vieno modelio sklandumas nesuteikia jums jokios priežasties jį suabejoti, ir kur klaida iš tikrųjų kažką kainuoja.
Yra antrasis, praktiškesnis šio testo sluoksnis, kuris verta aiškiai pasakyti. Norint atlikti šį palyginimą pats, turėjau patikrinti GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo ir MiniMax M2.7 išvestis viena šalia kitos su esamais baziniais modeliais, viename vietoje, vienoje platformoje. Už MachineTranslation.com ribų tai nėra viena prenumerata. Tai keletas, po vieną kiekvienam teikėjui, kurio premium lygį norite išbandyti, už kiekvieną sumą, kurią teikėjas ima atskirai. Mokantys naudotojai čia gauna tą patį palyginimą vienu spustelėjimu, už dalį to, ką kainuotų penkių atskirų premium prenumeratų palaikymas, neprarandant to, kas iš tikrųjų svarbu: matydami, kur modeliai sutinka, ir žinodami tiksliai, kada jie nesutinka.
Nei vienas nėra kategoriškai geresnis; tai priklauso nuo testo kategorijos. Claude Sonnet ir Claude Opus nuosekliai pasirinko tikslesnį vietnamiečių medicininį terminą, o Claude Opus sukūrė labiausiai tinkamą slengo frazę "That's sick." Tačiau Claude Sonnet taip pat sukūrė šnekamąją japoniškąją kalbą formaliame vadovo kontekste, kur GPT-5.5 tai atliko teisingai. Tiesioginis išvesties palyginimas yra labiau apgynamas nei pasirinkti vieną modelį ir jam pasitikėti.
Jo nėra; tikslumas priklauso nuo srities. Šiame teste „Gemini 3.5-Flash" ir „GLM-5-Turbo" sukūrė labiausiai tinkamą formalųjį japonų kalbą. Abu Claude modeliai buvo tiksliausiai naudojami vietnamiečių medicininei terminologijai. DeepSeek V4-Pro buvo vienintelis modelis, kuris panaudojo teisingą japoniškąjį teisinį terminą, bet tik 2-ame rate, o kitur jis gamino šnekamąją japoniškąją kalbą. Joks vienas modelis neišsiskyrė visose aštuoniose bandymuose.
Ne, ne automatiškai. Išplėtus modelio variantų su aukštesniu pakopavimu rinkinį, sutarimas Japonijos formalumo teste pasikeitė iš neoficialaus į oficialų. Tačiau Vietnamo medicinos terminologijos teste skirtumas išliko maždaug 6 prieš 4 santykiu, nepriklausomai nuo to, kurie modeliai buvo įtraukti. Daugiau modelių išryškina daugiau nesutarimo, kuris yra naudingas signalas, tačiau konsensusas vis tiek seka daugumą, o dauguma ne visada yra tiksliausias atsakymas.
SMART yra MachineTranslation.com daugiamodelinis konsensuso sistema, apimanti iki 22 dirbtinio intelekto modelių iš tiekėjų, įskaitant OpenAI, Anthropic, Google ir DeepSeek. Jis vienu metu vykdo vertimą per kelis modelius ir pateikia daugumą sutariančią išvestį kartu su kiekvieno atskiro modelio atsakymu, pagal numatytuosius nustatymus, be jokios konfigūracijos. Konsensusas pasikeičia, kai pasikeičia modelio telkinys, kaip parodyta šio testo japoniškos formalumo rezultate: neoficialus konsensusas 1-ame raunde tapo oficialus 2-ame raunde.
Nėra vieno modelio; žmogaus peržiūra yra geresnė atsakymo. Claude modeliai nuosekliai pasirinkdavo tikslesnį vietnamiečių medicininį terminą, o tik DeepSeek V4-Pro panaudojo teisingą japonų teisinį terminą, bet tik 2-ame raunde. Medicininės terminologijos skaidymas niekada nebuvo išspręstas per 10 modelių, o tai rodo, kad reikalinga dalykinė kompetencija, o ne pasirinkimas kito modelio. A sertifikuotas žmogaus redagavimo patikrinimas, kaip siūlo „Tomedes", suteikia tą specialistų patikrinimą.