July 10, 2026
Dve slová. Šesť modelov. Tri rôzne rozhodnutia o preklade. Takto sa stalo, keď som spustil 8 testovacích viet cez najnovšie modely umelej inteligencie dostupné na MachineTranslation.com, a čo výstupy skutočne odhalujú o tom, keď model zlyhá ticho.
Dve slová. To je choré. Šesť modelov. Tri odlišné rozhodnutia pri preklade.
V japončine jeden model vykreslil ako それはやばい, čím si zachoval nejednoznačnosť. Jeden z nich úplne vynechal subjektové zámeno a napísal holú formu やばい, čo je najhovornejšia možná verzia. Tretí napísal それはすごい, čo úplne vyrieši nejednoznačnosť v prospech slova „úžasný", pričom odstráni dvojitý význam, ktorý vetu spôsoboval zaujímavosťou. V angličtine jeden model napísal Đỉnh vậy (slang, správne pre mládežnícky register). Ďalší napísal Thật tuyệt vời, gramaticky správne, ale bližšie k vyjadreniu "to je skutočne úžasné" keď vám niekto posiela mém.
Všetky tieto sú obhájiteľné. Žiadny z nich nie je to isté. A ak spúšťate preklady cez jediný model, nikdy neuvidíte voľbu, ktorá bola urobená v vašom mene.
To je centrálna otázka, na ktorú sa tento článok pokúša odpovedať. Nie ktorý AI model je najlepší na preklad v roku 2026 (odpoveď závisí od jazykového páru, registra, domény a štruktúry vety), ale skôr: ako by ste vedeli, keď váš model urobil chybnú voľbu? Zvlášť v oblastiach ako medicínska terminológia, právne zmluvy alebo profesionálna formalita, kde chybná voľba vyzerá presne ako správny preklad, kým ho neprečíta špecialista.
Takto som to urobil. Spustil som 8 testovacích viet cez dva kola modelov na MachineTranslation.com: najprv základný súbor 5 široko používaných modelov, potom rozšírený súbor, ktorý pridáva niekoľko najnovších variantov modelov prémiových tried teraz dostupných platiacim používateľom. Normálne by porovnávanie výstupov z modelov ako je tento znamenalo samostatné platené predplatné u každého poskytovateľa individuálne. Na MachineTranslation.com sú v rovnakom porovnávacom zobrazení. Jazykové páry boli angličtina→japončina a angličtina→vietnamčina. Kategórie viet boli zvolené špecificky na testovanie oblastí, kde je nezhoda modelu najdôležitejšia: idiomatické frázy, právna terminológia, medicínska terminológia, kontext závislý od formálnosti a úmyselná sémantická nejednoznačnosť.
Poznámka k metodológii hodnotenia: výskum strojového prekladu sa dlho potýkal s tým, ako automaticky hodnotiť výstupy. Metriky ako BLEU a COMET merané v zdieľaných úlohách WMT poskytujú užitočný agregovaný signál, ale sú slabé pri detekcii chýb v registri, zlyhaniach idiómov a terminologickej presnosti, čo sú presne kategórie, ktoré sú tu najdôležitejšie. Čo sa chystáte čítať, je analýza výstupu, nie preteky BLEU.

Nie každá veta odhalí zmysluplný nezhodu. Dva z ôsmich testov, "Let's touch base once the dust settles on this deal" (→ Japončina) a "We're burning the midnight oil to hit this launch date" (→ Vietnamčina), vykazovali vysokú zhodu v oboch kolách. Idiomy boli správne pochopené ako idiomy. Nikto nepreložil "touch base" ako dotýkanie sa fyzickej základne. Nikto nepreložil "the dust settles" ako sediment padajúci.
Stojí za to na tom pozastaviť sa: idiomatický anglický obchodný jazyk je pomerne dobre zvládaný súčasnými hraničnými modelmi, keď je idiom dostatočne bežný. Zhoda na "touch base" zostala stabilná v oboch kolách; variácia bola čisto štýlistická, okolo toho, či použiť この件 (táto záležitosť), この取引 (táto dohoda), alebo この案件 (tento prípad) pre zdrojovú frázu.

Test „práca do polnoci" je miesto, kde sa veci stali zaujímavejšími. Každý model okrem jedného správne pochopil idiom. MiniMax M2.7, predstavený v Round 2, preložil "burning" doslova, čím vzniklo đốt đuốc, čo znamená "horiace fakľe." Konsenzus ho správne vylúčil.

Japončina je jazyk s vrstvami formality. Voľba slovesného zakončenia, zámena a referenčnej formy podstatného mena nie je štylová záležitosť. Signalizuje vzťah medzi hovoriacim a príjemcom. Poslanie správy vášmu generálnemu riaditeľovi pomocou neformálnych slovesných foriem nie je chyba v preklade v gramatickom zmysle. Je to sociálna chyba, a významná.
Testovacia veta: Môžeš mi to poslať? Ďakujem, oceňujem to." Kontext: posielanie správy generálnemu riaditeľovi.

Konsenzus sa posunul, keď sa rozšíril fond modelov. Mechanizmus je jednoduchý: pridanie modelov, ktoré správne čítali kontext formálnosti, posunulo väčšinu a konsenzus nasledoval. Toto je úplné spektrum toho, čo modely vytvorili v Kole 2:

Test vietnamského registra odhalil iný druh chyby formality, ktorá je jemnejšia. Zdrojová veta: Hej, rýchla otázka — máš čas na hovor? Kontext: správa klientovi. Qwen v 1. kole obsahoval "mình," osobné zámeno prvej osoby, ktoré implikuje neformálne priateľstvo na rovnakej úrovni. Všetky ostatné modely sa úplne vyhli sebareferencii v prvej osobe, čo je bezpečnejšia profesionálna voľba. Rozhodujúco, Qwen to opravil v 2. kole a vypustil "mình." Konsenzus v oboch kolách ho vylúčil.

Veta o náhrade škody medzi dodávateľom a klientom je štandardnou doložkou v obchodných dohodách: "Dodávateľ bude odškodzovať klienta voči akýmkoľvek nárokům tretích strán vyplývajúcim z porušenia tejto dohody."
V 1. kole všetkých päť modelov správne identifikovalo právny register a použilo výpožičky ベンダー (dodávateľ) a クライアント (klient), štandardné v japonských obchodných zmluvách anglického pôvodu. Jedna výnimka: GPT-4.1-NANO použil 販売者 (predávajúci) a 顧客 (zákazník), legitímne japonské slová, ktorým chýba formálna právna špecifickosť ekvivalentov cudzích slov.
Dôležitejší nález sa objavil v 2. kole. Kľúčový rozdiel je medzi dvoma slovami:
Ide o právne odlišné pojmy. "Indemnify" konkrétne znamená chrániť stranu pred zodpovednosťou voči tretím stranám. 免責 je správny právny termín. Všetky modely z 1. kola používali 補償. V Round 2 bol DeepSeek V4-Pro jediným modelom, ktorý vytvoril 免責, a urobil to iba v Round 2, nie v Round 1.

V zmluve nie sú 補償 a 免責 synonymá. Jeden znamená "budeme vám to refundovať." Druhý znamená "ste chránení pred nárokom už od začiatku." Ak prekladateľská platforma používa 補償 tam, kde je správne 免責, právnik čítajúci japanскú verziu neuvidí rovnakú dohodu, ktorú opisuje anglická verzia.
Toto je najvýznamnejší nález v súbore údajov. Testovacia veta: "Tento liek je kontraindikovaný u pacientov s históriou poškodenia pečene." Zdroj: klinická dokumentácia produktu. Cieľ: Vietnamčina.
Kritickým termínom je "hepatálne poškodenie." Existujú dvaja vietnamskí kandidáti:
Ide o klinicky odlišné stavy. Varovanie o kontraindikácii založené na "poškodení pečene" sa vzťahuje na každého s oslabením funkcie pečene, nielen na tých, ktorí zažili úplné zlyhanie orgánu. Použitie suy gan nesprávne zužuje uvedenú populáciu. Pacient s miernym poškodením pečene, ktorý čita suy gan, si nemusí uvedomiť, že patrí do kontraindikovanej populácie.

Niektoré zdrojové vety sú zámerné nejednoznačné. "To je chorý" v súčasnom anglickom slangu znamená niečo vynikajúce, ale stále nesie aj svoj doslovný význam (teda niečo, čo je odporné/ošklivé), a napätie medzi týmito dvoma významami je súčasťou toho, ako táto fráza komunikuje. Výzvou pre prekladový model je: zachováte nejednoznačnosť, zrútite ju na najpravdepodobnejší význam, alebo si vyberiete jeden a zaviažete sa?


Modely v tomto teste nie sú všetky ekvivalentné. Obejmujú rôzne architektúry, tréningové režimy a kontexty nasadenia. Základná línia 1. kola zahŕňa modely, ktoré sú široko dostupné. Rozšírený pool v 2. kole pridáva niekoľko najnovších variantov modelov prémiového stupňa, ktoré sú teraz dostupné platiacim používateľom na MachineTranslation.com, rovnakej úrovne modelov, ktoré by inak znamenali samostatný platený účet u každého jednotlivého poskytovateľa.

Rozšírený pool v 2. kole obsahuje pokročilejšie modely, ktoré sú dostupné platiacim používateľom na MachineTranslation.com. Vplyv rozšírenia fondu nie je jednotný. V niektorých testoch (formalita/japončina) to výrazne posunulo konsenzus. U iných (medicínska terminológia/vietnamčina) sa rozdelenie prehĺbilo.

Testovací údaje poukazujú na dve odlišné kategórie zlyhaní a vyžadujú si rôzne odpovede.
Kategória A: Tiché zlyhania. Chyby formality, chyby registra, presnosť medicínskej terminológie: tieto produkujú výstupy, ktoré vyzerajú správne. Japončina je gramatická. Vietnamec je plynulý. Neexistuje žiadny povrchový signál, že by sa niečo pokazilo. Monolingválny používateľ čítajúci výstup jedného modelu nemá žiadny spôsob, ako zistiť, že model urobil voľbu registra, ktorú by si všimol vysoký japonský manažér, alebo že klinický termín bol zúžený spôsobom, ktorý mení populáciu, na ktorú sa vzťahuje.
Kategória B: Viditeľné chyby. MiniMax prekladá "burning the midnight oil" ako "burning torches." GPT-4.1-NANO rozlišuje "That's sick" na jednoznačné "すごい." Tieto sú detekovateľné, buď hovorcom cieľového jazyka alebo porovnaním s inými výstupmi modelu.
Porovnanie viacerých modelov, ktoré poskytuje SMART, je najcennejšie v kategórii A. Keď päť alebo desať modelov vytvárajú výstupy a väčšina sa zhoduje na formálnom registri, zatiaľ čo jeden vytvárajú neformálnu jednoduchú formu japončiny, nesúhlas je viditeľný v zobrazení porovnania. Používateľ, ktorý hovorí cieľovým jazykom, môže vyhodnotiť možnosti. Používateľ, ktorý to nevidí, môže vidieť, že bolo prijaté spochybňované rozhodnutie, a rozhodnúť sa, či táto veta ospravedlňuje ľudskú kontrolu.
Pre prácu v rozsahu dokumentov, veľké súbory, preklad PDF s ochranou rozloženia, zmluvy alebo klinické materiály, schopnosť platformy spracovávať dokumenty spracúva štruktúru súboru bez narušenia formátovania. Ale otázky kvality uvedené vyššie platia bez ohľadu na veľkosť súboru. Klinická štúdia s 100 stranami, kde je každý výskyt výrazu "hepatálna insuficiencia" preložený ako "zlyhanie pečene", je väčšou verziou rovnakého problému identifikovaného v Teste 2.
Pre medicínske a právne kategórie špecificky je ľudská verifikácia správnym záchytným mechanizmom. Služba AI Post-Editingu spoločnosti Tomedes, ktorá spája výstup AI s certifikovanou ľudskou kontrolou presne pre tento druh vysoko rizikového obsahu, je na to vytvorená. Rozdelenie suy gan / suy giảm chức năng gan je presne taký typ zistenia, ktoré by malo spustiť túto kontrolu, nie preto, že všetky modely sú nesprávne, ale preto, že modely, ktoré sú najviac presvedčené, nie sú najpresnejšie.
Hodnota videnia viacerých výstupov nie je v tom, že si vždy vyberiete väčšinu. Je to také to, že budete vedieť, že bola urobená voľba, čo sa líši od predpokladu, že výstup pred vami je správny.

Položte osem testov vedľa seba a vzor sa potvrdí: zhoda a nezhoda nie sú náhodne rozdelené. Idiomatické, každodenné obchodné výrazy ("kontaktovať sa", "pracovať do neskorých hodín") sa zbiehali v takmer každom modeli v súbore, v oboch kolách. Formalita, právna presnosť a medicínska terminológia nie. Test CEO-formality sa zmenil z neformálneho na formálny len po zahrnutí rozšíreného súboru. Klauzula o náhrade škody odhalila skutočný právny rozdiel (免責 vs. 補償), ktorý správne pochopil len jeden model v jednom kole. Medicínska terminológia sa nikdy úplne nerozdelia, zostala približne v pomere 6 ku 4 v oboch kolách bez ohľadu na to, ktoré modely boli v množine.
To je skutočný nález, nie marketingové tvrdenie: konsenzus neurobí každú vetu lepšou a nemusí to robiť. Je najcennejší práve tam, kde plynulosť jediného modelu vám nedáva žiadny dôvod na pochybnosti, a kde byť na omyle skutočne niečo stojí.
Existuje druhá, praktickejšia vrstva tohto testu, ktorá stojí za jasné uvedenie. Spustenie tohto porovnania samotným znamenalo kontrolu výstupov z GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo a MiniMax M2.7 vedľa seba s existujúcimi základnými modelmi na jednom mieste na jednej platforme. Mimo MachineTranslation.com to nie je jedno predplatné. Ide o niekoľko, jeden pre každého poskytovateľa, ktorého prémiovú úroveň chcete testovať, za čokoľvek, čo si jednotliví poskytovatelia účtujú. Platení používatelia tu získajú rovnaké porovnanie jedným kliknutím, za zlomok toho, čo by stálo údržba piatich samostatných prémiových predplatných, bez toho, aby sa vzdali veci, ktorá naozaj záleží: vidieť, kde sa modely zhodujú, a vedieť presne kedy sa nezhodujú.
Ani jeden nie je kategoricky lepší; závisí to od kategórie testu. Claude Sonnet a Claude Opus si dôsledne vyberali presnejší vietnamský medicínsky termín a Claude Opus vytvoril najvhodnejší slang pre "To je chorý." Ale Claude Sonnet tiež vyprodukoval neformálnu japončinu vo formálnej vete v kontexte generálneho riaditeľa, kde GPT-5.5 to dostala správne. Porovnávanie výstupov priamo je obhajovateľnejšie ako vybrať jeden model a dôverovať mu.
Neexistuje žiadny; presnosť je závislá od domény. Gemini 3.5-Flash a GLM-5-Turbo vyprodukovaly v tomto teste najvhodnejšiu formálnu japončinu. Obidva Claude modely boli najpresnejšie pri vietnamskej medicínskej terminológii. DeepSeek V4-Pro bol jediným modelom, ktorý použil správny japonský právny termín, ale iba v druhom kole, a inde produkoval hovorovú japončinu. Žiadny jednotný model nedominoval vo všetkých ôsmich testoch.
Nie, nie automaticky. Rozšírenie skupiny o novšie varianty modelov prémiového stupňa posunulo konsenzus z neformálneho na formálny v teste japonskej formálnosti. Ale v teste vietnamskej medicínskej terminológie pretrvávala rozdelenie približne v pomere 6 ku 4 bez ohľadu na to, ktoré modely boli zahrnuté. Viac modelov vytvára viac nezhody, čo je užitočný signál, ale konsenzus stále nasleduje väčšinu, a väčšina nie je vždy najpresnejšou odpoveďou.
SMART je systém viacnásobného konsenzu MachineTranslation.com, ktorý pokrýva až 22 modelov AI od poskytovateľov vrátane OpenAI, Anthropic, Google a DeepSeek. Spúšťa preklad cez viacero modelov naraz a zobrazuje výstup s väčšinovým konsenzom spolu s odpoveďou každého jednotlivého modelu, štandardne bez potreby konfigurácie. Konsenzus sa posúva, keď sa posúva pool modelov, ako je to vidieť v teste formality japončiny v tomto teste: neformálny konsenzus v 1. kole sa stal formálnym v 2. kole.
Žiadny jediný model; ľudská kontrola je lepšia odpoveď. Modely Claude konzistentne volili presnejší vietnamský medicínsky termín a iba DeepSeek V4-Pro použil správny japonský právny termín, ale len v 2. kole. Medicínska terminológia sa nikdy nerozdelila konzistentne v 10 modeloch, čo signalizuje, že je potrebná odbornosť v danej oblasti, nie že by sa mal vybrať iný model. Certifikovaná recenzia postredakcie človekom, ako ju ponúka Tomedes, poskytuje túto špecializovanú kontrolu.