July 10, 2026
Dvě slova. Šest modelů. Tři různá rozhodnutí o překladu. Zde je to, co se stalo, když jsem spustil 8 testovacích vět přes nejnovější modely AI dostupné na MachineTranslation.com, a co výstupy vlastně odhalují o tom, kdy model selhává tiše.
Dvě slova. To je úžasné. Šest modelů. Tři odlišná rozhodnutí při překladu.
V japonštině jej jeden model převedl jako それはやばい, čímž zachoval nejednoznačnost. Další zcela vypustil podmět a napsal holou formu やばい, nejhovorověji možnou verzi. Třetí napsal それはすごい, což zcela odstraňuje nejednoznačnost ve prospěch "úžasný", a odstraňuje tak dvojí význam, který větu činil zajímavou. V češtině jeden model napsal Đỉnh vậy (slang, správné pro mládežnický registr). Další napsal Thật tuyệt vời, gramaticky správný, ale blíže k tomu říci "to je opravdu nádherné", když vám někdo pošle meme.
Všechny tyto možnosti jsou obhajitelné. Žádný z nich není totéž. A pokud spouštíte překlady prostřednictvím jednoho modelu, nikdy neuvidíte volbu, která byla učiněna vaším jménem.
To je ústřední otázka, kterou se tento článek snaží zodpovědět. Nejde o to, který AI model je nejlepší pro překlad v roce 2026 (odpověď závisí na jazykové dvojici, registru, doméně a struktuře věty), ale spíše: jak byste věděli, kdy váš model udělal špatné rozhodnutí? Zvláště v oborech jako lékařská terminologie, právní smlouvy nebo profesionální formalita, kde špatné rozhodnutí vypadá přesně jako správný překlad, dokud ho neprečte specialista.
Zde je to, co jsem udělal. Prošel jsem 8 testovacích vět dvěma koly modelů na MachineTranslation.com: nejprve základní sadu 5 široce používaných modelů, poté rozšířený soubor, který přidává několik nejnovějších variant modelů prémiové úrovně nyní dostupných placeným uživatelům. Normálně by porovnávání výstupů z modelů jako je tento znamenalo samostatné placené předplatné u každého poskytovatele zvlášť. Na webu MachineTranslation.com jsou zobrazeny v téže porovnávací tabulce. Jazykové páry byly angličtina→japonština a angličtina→vietnamština. Kategorie vět byly vybrány speciálně k testování oblastí, kde jsou neshody modelů nejdůležitější: idiomatické fráze, právní terminologie, lékařská terminologie, kontexty citlivé na formalitu a záměrná sémantická nejednoznačnost.
Poznámka k metodologii hodnocení: výzkum strojového překladu se dlouhodobě potýká s tím, jak automaticky hodnotit výstupy. Metriky jako BLEU a COMET měřené v úlohách sdílených WMT poskytují užitečný agregovaný signál, ale jsou špatné při detekci chyb registru, selhání idiomů a terminologické přesnosti, přesně v kategoriích, které zde nejvíce záleží. To je analýza výstupu, kterou se chystáte číst, ne závod BLEU.

Ne každá věta vyvolá smysluplný nesouhlas. Dva z osmi testů, „Pojďme si promluvit, až se situace kolem této dohody uklidní" (→ japonština) a „Pracujeme na plný výkon, abychom stihl tento launch" (→ vietnamština), vykazovaly vysokou shodu v obou kolech. Idiomy byly správně pochopeny jako idiomy. Nikdo nepřeložil "touch base" jako fyzické dotýkání se základny. Nikdo nepřeložil "the dust settles" jako usazování sedimentu.
Stojí za to se na tom pozastavit: idiomatický anglický obchodní jazyk je současnými špičkovými modely rozumně dobře zvládán, když je idiom dostatečně běžný. Shoda na "touch base" zůstala stabilní v obou kolech; variace byla čistě stylistická, kolem toho, zda použít この件 (tato záležitost), この取引 (tato transakce), nebo この案件 (tento případ) pro zdrojovou frázi.

Test "práce do půlnoci" je tam, kde se věci staly zajímavějšími. Každý model kromě jednoho správně pochopil idiom. MiniMax M2.7, představený v Kole 2, doslova přeložil "burning", čímž vzniklo đốt đuốc, což znamená "hořící pochodně." Konsenzus jej správně vyloučil.

Japonština je jazyk s vrstvami formality. Volba slovesného zakončení, zájmena a referenčního tvaru podstatného jména není stylistická. Signalizuje vztah mezi mluvčím a příjemcem. Poslání zprávy vašemu generálnímu řediteli pomocí neformálních slovesných forem není chyba překladu v gramatickém smyslu. Je to společenská chyba, a významná.
Můžeš mi to poslat? Děkuji, oceňuji to." Kontext: zpráva CEO.

Konsenzus se posunul, když se fond modelů rozšířil. Mechanismus je jednoduchý: přidání modelů, které správně čtou kontext formality, posunulo většinu, a konsenzus následoval. Zde je úplné spektrum toho, co modely vytvořily v Kole 2:

Vietnamský registrační test odhalil jiný druh chyby formality, který je subtilnější. Zdrojová věta: "Hej, rychlá otázka — máš čas na krátký hovor?" Kontext: zpráva klientovi. Qwen v 1. kole použil "mình," první osobní zájmeno, které implikuje neformální přátelství na úrovni vrstevníků. Všechny ostatní modely se zcela vyhnuly sebereferencím v první osobě, což je bezpečnější profesionální volba. Zásadně Qwen toto opravil v Kole 2 a vypustil "mình." Konsenzus v obou kolách jej vyloučil.

Věta o náhradě škody mezi prodávajícím/klientem je standardní klauzule v obchodních dohodách: "Prodávající se zavazuje nahradit klientovi veškeré škody vyplývající z porušení této smlouvy."
V 1. kole všech pět modelů správně rozpoznalo právní registr a použilo výpůjčky ベンダー (dodavatel) a クライアント (klient), standardní v japonských obchodních smlouvách anglického původu. Jedna výjimka: GPT-4.1-NANO používal 販売者 (prodávající) a 顧客 (zákazník), legitimní japonská slova, která postrádají formální právní specifičnost ekvivalentů půjčených slov.
Důležitější zjištění se objevilo v Kole 2. Klíčový rozdíl je mezi dvěma slovy:
Jedná se o právně odlišné pojmy. "Indemnify" specificky znamená chránit stranu před odpovědností vůči třetím stranám. Náhrada škody je správný právní termín. Všechny modely z 1. kola používaly 補償. V Round 2 byla DeepSeek V4-Pro jedinou modelou, která vyprodukovala 免責, a to pouze v Round 2, nikoli v Round 1.

Ve smlouvě nejsou 補償 a 免責 synonyma. Jeden znamená "vrátíme vám peníze." Druhý znamená "jste chráněni před nárokem již od počátku." Pokud překladatelská platforma používá 補償 tam, kde je správné 免責, právník čtoucí japonskou verzi neuvidí stejnou dohodu, kterou popisuje verze v angličtině.
Toto je nejdůležitější zjištění v datovém souboru. Testovací věta: "Toto léčivo je kontraindikováno u pacientů s anamnézou poškození jater." Zdroj: klinická dokumentace produktu. Cíl: Vietnamský.
Kritickým termínem je "hepatální poškození." Jsou dva vietnamští kandidáti:
Jedná se o klinicky odlišné stavy. Upozornění na kontraindikaci založené na "poškození jater" se vztahuje na kohokoli se sníženou funkcí jater, nejen na ty, kteří zažili úplné selhání orgánu. Použití suy gan nesprávně zužuje uvedenou populaci. Pacient se středně těžkou poruchou funkce jater, který čte "suy gan", si nemusí uvědomit, že patří do kontraindikované populace.

Některé zdrojové věty jsou záměrně nejasné. „To je skvělé" v současné anglické slangové řeči znamená něco vynikajícího, ale stále si zachovává svůj doslovaný význam (tedy něco odsuzuhodného/odpudivého), a napětí mezi těmito dvěma významy je součástí toho, jak se tato fráze komunikuje. Výzvou pro model překladu je: zachováte nejasnost, zredukujete ji na nejpravděpodobnější význam, nebo si vyberete jeden a zavážete se mu?


Modely v tomto testu nejsou všechny ekvivalentní. Zahrnují různé architektury, trénovací režimy a kontexty nasazení. Základní sada Round 1 zahrnuje modely, které jsou široce dostupné. Rozšířený pool Round 2 přidává několik nejnovějších variant modelů prémiové úrovně nyní dostupných pro platící uživatele na MachineTranslation.com, stejné úrovně modelů, které by jinak znamenaly samostatný placený účet u každého jednotlivého poskytovatele.

Rozšířený pool v Round 2 zahrnuje pokročilejší modely dostupné pro platící uživatele na MachineTranslation.com. Účinek rozšíření fondu není jednotný. V některých testech (formalita/japonština) to výrazně posunulo konsenzus. U některých (lékařská terminologie/vietnamština) se rozdělení prohloubilo.

Testovací data poukazují na dvě odlišné kategorie selhání a vyžadují různé odpovědi.
Kategorie A: Tiché selhání. Chyby formality, chyby registru, přesnost lékařské terminologie: ty produkují výstupy, které vypadají správně. Japonština je gramatická. Vietnamec je plynulý. Neexistuje žádný povrchový signál, že by se něco pokazilo. Monolingvní uživatel čtoucí výstup jednoho modelu nemá žádný způsob, jak zjistit, že model učinil volbu registru, kterou by si všimla vysoká japonská manažerka, nebo že byl klinický termín zúžen způsobem, který mění populaci, na kterou se vztahuje.
Kategorie B: Viditelné selhání. MiniMax překládá "burning the midnight oil" jako "pálení pochodní." GPT-4.1-NANO řeší "That's sick" na jednoznačné "すごい." Jsou detekovatelné buď mluvčím cílového jazyka, nebo porovnáním s jinými výstupy modelu.
Porovnání více modelů, které poskytuje SMART, je nejcennější v kategorii A. Když pět nebo deset modelů vytváří výstupy a většina se shoduje na formálním registru, zatímco jeden vytváří neformální jednoduchou formu japonštiny, je nesouhlas viditelný v zobrazení porovnání. Uživatel, který mluví cílovým jazykem, může vyhodnotit možnosti. Uživatel, který nevidí, že bylo učiněno sporné rozhodnutí, může rozhodnout, zda věta vyžaduje lidskou kontrolu.
Pro práci v měřítku dokumentu, velké soubory, překlad PDF s zachováním rozložení, smlouvy nebo klinické materiály, schopnost platformy zpracovávat dokumenty zpracovává strukturu souboru bez porušení formátování. Ale otázky týkající se kvality uvedené výše se vztahují bez ohledu na velikost souboru. Klinická studie o 100 stranách, kde je každý výskyt „hepatální insuficience" přeložen jako „selhání jater", je větší verzí stejného problému identifikovaného v Testu 2.
Konkrétně pro medicínské a právní kategorie je lidská verifikace správným řešením. Služba AI Post-Editingu společnosti Tomedes, která kombinuje výstup AI s certifikovanou lidskou kontrolou právě pro tento druh obsahu s vysokým rizikem, je na to připravena. Rozdělení suy gan / suy giảm chức năng gan je přesně ten typ nálezu, který by měl spustit tuto kontrolu, ne proto, že všechny modely jsou špatné, ale proto, že modely, které jsou nejvíce sebevědomé, nejsou nejpřesnější.
Hodnota vidění více výstupů není v tom, že si vždy vyberete majoritu. Jde o to, že budete vědět, že byla učiněna volba, což se liší od předpokladu, že výstup před vámi je správný.

Když si osm testů vedle sebe položíte, vydrží vzorec: souhlas a nesouhlas nejsou náhodně rozděleny. Idiomatický, každodenní obchodní jazyk ("touch base", "burning the midnight oil") se sblížil téměř u každého modelu v souboru v obou kolech. Formalita, právní přesnost a medicínská terminologie ne. Test formality CEO se změnil z neformálního na formální pouze poté, co byl zahrnut rozšířený soubor. Klauzule o náhradě škody odhalila skutečný právní rozdíl (免責 vs. 補償), který správně pochopil pouze jeden model v jednom kole. Medicínská terminologie se nikdy zcela nevyřešila, zůstala přibližně v poměru 6 ku 4 v obou kolech bez ohledu na to, které modely byly v souboru.
To je skutečný nález, ne marketingové tvrzení: shoda nezlepšuje každou větu a nemusí to dělat. Je nejcennější právě tam, kde plynulost jednoho modelu vám nedává žádný důvod na něj pochybovat, a kde být na omylu skutečně něco stojí.
Existuje druhá, více praktická vrstva tohoto testu, kterou stojí za to uvést jasně. Spuštění tohoto srovnání vlastními silami znamenalo kontrolu výstupů z GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo a MiniMax M2.7 vedle sebe se stávajícími základními modely na jednom místě, na jedné platformě. Mimo MachineTranslation.com to není jedno předplatné. Jde o několik, jeden pro každého poskytovatele, jehož prémiovou úroveň chcete testovat, za cenu, kterou si každý poskytovatel účtuje jednotlivě. Placeční uživatelé zde získají stejné srovnání jedním kliknutím za zlomek toho, co by stálo údržba pěti samostatných prémiových předplatných, aniž by se vzdali toho, na čem skutečně záleží: vidět, kde se modely shodují, a vědět přesně, kdy se neshodují.
Ani jeden není kategoricky lepší; záleží na kategorii testu. Claude Sonnet a Claude Opus konzistentně volili přesnější vietnamský medicínský termín a Claude Opus vytvořil nejpříhodnější slang pro "To je skvělé." Ale Claude Sonnet také vyprodukoval neformální japonštinu ve větě formálního kontextu generálního ředitele, kde GPT-5.5 to zvládl správně. Porovnávání výstupů přímo je obhajitelnější než výběr jednoho modelu a jeho důvěřování.
Neexistuje žádný; přesnost je závislá na doméně. Gemini 3.5-Flash a GLM-5-Turbo vytvořily v tomto testu nejvhodnější formální japonštinu. Oba modely Claude byly nejpřesnější v případě vietnamské lékařské terminologie. DeepSeek V4-Pro byl jediným modelem, který použil správný japonský právní termín, ale pouze v Kole 2, a jinde produkoval neformální japonštinu. Žádný jediný model nedominoval ve všech osmi testech.
Ne, ne automaticky. Rozšíření fondu novějšími variantami modelů prémiové úrovně posunulo konsenzus z neformálního na formální v japonském testu formality. Ale v testu vietnamské lékařské terminologie přetrvávala rozdělení přibližně v poměru 6 ku 4 bez ohledu na to, které modely byly zahrnuty. Více modelů odhaluje více neshod, což je užitečný signál, ale konsenzus stále následuje většinu, a většina není vždy nejpřesnější odpovědí.
SMART je systém vícenásobného konsenzu společnosti MachineTranslation.com, který zahrnuje až 22 AI modelů od poskytovatelů včetně OpenAI, Anthropic, Google a DeepSeek. Spouští překlad přes více modelů najednou a zobrazuje výstup většinového konsenzu spolu s odpovědí každého jednotlivého modelu, ve výchozím nastavení bez potřeby jakékoli konfigurace. Konsenzus se mění, když se změní pool modelů, jak je vidět v tomto testu výsledku japonské formality: neformální konsenzus v Kole 1 se stal formálním v Kole 2.
Žádný jediný model; lidská kontrola je lepší odpověď. Modely Claude konzistentně volily přesnější vietnamský medicínský termín a pouze DeepSeek V4-Pro použil správný japonský právní termín, ale pouze v druhém kole. Medicínská terminologie se nikdy nerozhodla napříč 10 modely, což signalizuje, že je vyžadována odbornost v oboru, nikoli že by měl být vybrán jiný model. Recenzovaná lidská post-editace, kterou nabízí Tomedes, poskytuje právě takovou odbornou kontrolu.