July 10, 2026

Ktorý AI prekladateľ je najpresnejší v roku 2026? Testoval som 10 najnovších modelov AI

Dve slová. Šesť modelov. Tri rôzne rozhodnutia o preklade. Takto sa stalo, keď som spustil 8 testovacích viet cez najnovšie modely umelej inteligencie dostupné na MachineTranslation.com, a čo výstupy skutočne odhalujú o tom, keď model zlyhá ticho.

Ako by ste vôbec vedeli, keď váš model urobil zlú voľbu?

Dve slová. To je choré. Šesť modelov. Tri odlišné rozhodnutia pri preklade.

V japončine jeden model vykreslil ako それはやばい, čím si zachoval nejednoznačnosť. Jeden z nich úplne vynechal subjektové zámeno a napísal holú formu やばい, čo je najhovornejšia možná verzia. Tretí napísal それはすごい, čo úplne vyrieši nejednoznačnosť v prospech slova „úžasný", pričom odstráni dvojitý význam, ktorý vetu spôsoboval zaujímavosťou. V angličtine jeden model napísal Đỉnh vậy (slang, správne pre mládežnícky register). Ďalší napísal Thật tuyệt vời, gramaticky správne, ale bližšie k vyjadreniu "to je skutočne úžasné" keď vám niekto posiela mém.

Všetky tieto sú obhájiteľné. Žiadny z nich nie je to isté. A ak spúšťate preklady cez jediný model, nikdy neuvidíte voľbu, ktorá bola urobená v vašom mene.

To je centrálna otázka, na ktorú sa tento článok pokúša odpovedať. Nie ktorý AI model je najlepší na preklad v roku 2026 (odpoveď závisí od jazykového páru, registra, domény a štruktúry vety), ale skôr: ako by ste vedeli, keď váš model urobil chybnú voľbu? Zvlášť v oblastiach ako medicínska terminológia, právne zmluvy alebo profesionálna formalita, kde chybná voľba vyzerá presne ako správny preklad, kým ho neprečíta špecialista.

Takto som to urobil. Spustil som 8 testovacích viet cez dva kola modelov na MachineTranslation.com: najprv základný súbor 5 široko používaných modelov, potom rozšírený súbor, ktorý pridáva niekoľko najnovších variantov modelov prémiových tried teraz dostupných platiacim používateľom. Normálne by porovnávanie výstupov z modelov ako je tento znamenalo samostatné platené predplatné u každého poskytovateľa individuálne. Na MachineTranslation.com sú v rovnakom porovnávacom zobrazení. Jazykové páry boli angličtina→japončina a angličtina→vietnamčina. Kategórie viet boli zvolené špecificky na testovanie oblastí, kde je nezhoda modelu najdôležitejšia: idiomatické frázy, právna terminológia, medicínska terminológia, kontext závislý od formálnosti a úmyselná sémantická nejednoznačnosť.

Metodológia

  • Jazykové páry: Angličtina → Japončina, Angličtina → Vietnamčina
  • Kolo 1 (základný stav): Claude Sonnet 4-6, DeepSeek V4-Pro, Qwen 3.7-Max, GPT-4.1-NANO, Gemini 3.1-Pro-Preview
  • Kolo 2 (rozšírené): Všetky vyššie uvedené + Claude Opus 4-7, GPT-5.5, Gemini 3.5-Flash, GLM-5-Turbo, MiniMax M2.7
  • Testované kategórie: Idiomatické frázy (2), Právna/odborná terminológia (2), Medicínska terminológia (1), Kontext závislý od formálnosti (2), Úmyselná nejednoznačnosť (1)
  • Čo sa meralo: Výstup prekladu priamo, nie čas úpravy, TER ani číselné miery chýb. Kde je to relevantné, rozdiely sú vysvetlené lingvisticky.
  • Konsenzus SMART: Každé kolo zahŕňa výstup viacmodálneho konsenzu platformy. SMART zahŕňa až 22 modelov AI od rôznych poskytovateľov a spúšťa všetky dostupné modely súčasne, aby sa získal konsenzuálny preklad. Konsenzus sa posúva, keď sa posúva fond modelov.

Poznámka k metodológii hodnotenia: výskum strojového prekladu sa dlho potýkal s tým, ako automaticky hodnotiť výstupy. Metriky ako BLEU a COMET merané v zdieľaných úlohách WMT poskytujú užitočný agregovaný signál, ale sú slabé pri detekcii chýb v registri, zlyhaniach idiómov a terminologickej presnosti, čo sú presne kategórie, ktoré sú tu najdôležitejšie. Čo sa chystáte čítať, je analýza výstupu, nie preteky BLEU.

Výsledky na prvý pohľad

Časť 1: Kde sa všetky modely zhodujú a prečo je to tiež dôležité

Nie každá veta odhalí zmysluplný nezhodu. Dva z ôsmich testov, "Let's touch base once the dust settles on this deal" (→ Japončina) a "We're burning the midnight oil to hit this launch date" (→ Vietnamčina), vykazovali vysokú zhodu v oboch kolách. Idiomy boli správne pochopené ako idiomy. Nikto nepreložil "touch base" ako dotýkanie sa fyzickej základne. Nikto nepreložil "the dust settles" ako sediment padajúci.

Stojí za to na tom pozastaviť sa: idiomatický anglický obchodný jazyk je pomerne dobre zvládaný súčasnými hraničnými modelmi, keď je idiom dostatočne bežný. Zhoda na "touch base" zostala stabilná v oboch kolách; variácia bola čisto štýlistická, okolo toho, či použiť この件 (táto záležitosť), この取引 (táto dohoda), alebo この案件 (tento prípad) pre zdrojovú frázu.

Test 8: ‎"Ozvime sa znova, keď sa okolo tejto dohody upokoja veci." → japončinu

Test „práca do polnoci" je miesto, kde sa veci stali zaujímavejšími. Každý model okrem jedného správne pochopil idiom. MiniMax M2.7, predstavený v Round 2, preložil "burning" doslova, čím vzniklo đốt đuốc, čo znamená "horiace fakľe." Konsenzus ho správne vylúčil.

Test 5: ‎"Pálime polnočný olej, aby sme splnili tento dátum spustenia." → vietnamčinu

Zistenie — Idiómy

Špičkové modely vo všeobecnosti správne spracúvajú bežné anglické obchodné idiómy v japončine aj vietnamčine. Hodnota konsenzu je najvyššia v sporných vetách: formálnosť, register a terminológia. Pri testoch idiómov konsenzus stále plní svoju úlohu tým, že označuje skutočné odľahlosti (MiniMaxov doslový "horiacich fakieľ" zlyhávajú), ale celkový súbor sa už zhoduje.

Časť 2: Formálna priepasť

Japončina je jazyk s vrstvami formality. Voľba slovesného zakončenia, zámena a referenčnej formy podstatného mena nie je štylová záležitosť. Signalizuje vzťah medzi hovoriacim a príjemcom. Poslanie správy vášmu generálnemu riaditeľovi pomocou neformálnych slovesných foriem nie je chyba v preklade v gramatickom zmysle. Je to sociálna chyba, a významná.

Testovacia veta: Môžeš mi to poslať? Ďakujem, oceňujem to." Kontext: posielanie správy generálnemu riaditeľovi.

Konsenzus sa posunul, keď sa rozšíril fond modelov. Mechanizmus je jednoduchý: pridanie modelov, ktoré správne čítali kontext formálnosti, posunulo väčšinu a konsenzus nasledoval. Toto je úplné spektrum toho, čo modely vytvorili v Kole 2:

Test 1: CEO veta — úplné výstupy modelu Round 2


Pozoruhodná odchýlka — DeepSeek R2

DeepSeek V4-Pro v Round 2 vyprodukoval 送ってくれる?ありがとう、助かる。, jednoduchá forma japončiny. Toto je to, čo napíšeš blízkemu priateľovi. Nie je to vhodný register na správu určenú generálnemu riaditeľovi. Jednoduchá forma (くれる、助かる) odstraňuje všetky značky úcty. Konsenzus to správne vylúčil, ale keby bol toto váš jediný model, poslali by ste správu svojmu generálnemu riaditeľovi v podobe neformálnej správy.

Test vietnamského registra odhalil iný druh chyby formality, ktorá je jemnejšia. Zdrojová veta: Hej, rýchla otázka — máš čas na hovor? Kontext: správa klientovi. Qwen v 1. kole obsahoval "mình," osobné zámeno prvej osoby, ktoré implikuje neformálne priateľstvo na rovnakej úrovni. Všetky ostatné modely sa úplne vyhli sebareferencii v prvej osobe, čo je bezpečnejšia profesionálna voľba. Rozhodujúco, Qwen to opravil v 2. kole a vypustil "mình." Konsenzus v oboch kolách ho vylúčil.

Test 6: ‎"Hej, rýchla otázka — máš čas na hovor?" → vietnamčinu


Zistenie — Chyby registra sú bez porovnania neviditeľné

Chyba Qwenu so slovom "mình" je najjasnejším príkladom toho, prečo je preklad pomocou jediného modelu riskantný pri komunikácii s klientmi: výsledkom je plynulá, gramaticky správna a prirodzene znejúca vietnamčina. Nie je nič na označenie. Bez videnia ostatných štyroch modelov by ste nemali žiadny signál, že bola urobená voľba registra bez vyhýbania sa sebareferencii v prvej osobe.

Časť 3: Právna terminológia — problém 免責

Veta o náhrade škody medzi dodávateľom a klientom je štandardnou doložkou v obchodných dohodách: ‎"Dodávateľ bude odškodzovať klienta voči akýmkoľvek nárokům tretích strán vyplývajúcim z porušenia tejto dohody."

V 1. kole všetkých päť modelov správne identifikovalo právny register a použilo výpožičky ベンダー (dodávateľ) a クライアント (klient), štandardné v japonských obchodných zmluvách anglického pôvodu. Jedna výnimka: GPT-4.1-NANO použil 販売者 (predávajúci) a 顧客 (zákazník), legitímne japonské slová, ktorým chýba formálna právna špecifickosť ekvivalentov cudzích slov.

Dôležitejší nález sa objavil v 2. kole. Kľúčový rozdiel je medzi dvoma slovami:

  • 補償 (hoshō) — kompenzovať, refundovať. Urobiť niekoho finančne celého po strate.
  • 免責 (menseki) — oslobodiť od zodpovednosti; poskytnúť náhradu. Držať bez zodpovednosti voči tvrdeniam tretích strán predtým, ako sa materializujú.

Ide o právne odlišné pojmy. ‎"Indemnify" konkrétne znamená chrániť stranu pred zodpovednosťou voči tretím stranám. 免責 je správny právny termín. Všetky modely z 1. kola používali 補償. V Round 2 bol DeepSeek V4-Pro jediným modelom, ktorý vytvoril 免責, a urobil to iba v Round 2, nie v Round 1.

Test 7: Klauzula o náhrade škody → Japončina (kľúčové výstupy)


Zistenie — Právny register

DeepSeek v R2 je jediný model, ktorý používa 免責, právne presný ekvivalent výrazu "náhrada škody". Každý iný model používa 補償 (kompenzovať), čo je sémanticky súvisejúce, ale právne odlišné. Tento nález sa stáva viditeľným až v druhom kole, čo zdôrazňuje, prečo statický test v jednom kole s pevným fondom modelov môže vynechať dôležitú variabilitu.
Osobitne sa Qwen v R2 zhoršuje prepnutím na 売主/買主 (predávajúci/kupujúci), termíny z obchodného práva predaja skôr ako z dohôd o poskytovaní služieb. Toto je menej vhodný rámec pre zmluvu, ktorá používa anglickú právnu terminológiu.

V zmluve nie sú 補償 a 免責 synonymá. Jeden znamená "budeme vám to refundovať." Druhý znamená "ste chránení pred nárokom už od začiatku." Ak prekladateľská platforma používa 補償 tam, kde je správne 免責, právnik čítajúci japanскú verziu neuvidí rovnakú dohodu, ktorú opisuje anglická verzia.

Časť 4: Medicínska terminológia — rozdelenie, ktoré sa nevyriešilo

Toto je najvýznamnejší nález v súbore údajov. Testovacia veta: ‎"Tento liek je kontraindikovaný u pacientov s históriou poškodenia pečene." Zdroj: klinická dokumentácia produktu. Cieľ: Vietnamčina.

Kritickým termínom je "hepatálne poškodenie." Existujú dvaja vietnamskí kandidáti:

  • suy gan — zlyhanie pečene. Vzťahuje sa na ťažké, akútne alebo chronické zlyhávanie pečene v konečnom štádiu. Pacient, ktorý zažil zlyhanie pečene.
  • suy giảm chức năng gan — znížená/poškodená funkcia pečene. Vzťahuje sa na akékoľvek zníženie funkcie pečene, vrátane miernich alebo stredne ťažkých porúch.

Ide o klinicky odlišné stavy. Varovanie o kontraindikácii založené na "poškodení pečene" sa vzťahuje na každého s oslabením funkcie pečene, nielen na tých, ktorí zažili úplné zlyhanie orgánu. Použitie suy gan nesprávne zužuje uvedenú populáciu. Pacient s miernym poškodením pečene, ktorý čita suy gan, si nemusí uvedomiť, že patrí do kontraindikovanej populácie.

Test 2: Kontradikcia veta → Vietnamčina (obe kolá)


Kritický nález: medicínska terminológia

Rozdelenie je 6 modelov pre suy gan vs. 4 modely pre suy giảm chức năng gan v 2. kole. Väčšina, a teda aj konsenzus, si vyberá menej klinicky presný termín. Obidva Claude modely (Sonnet a Opus) konzistentne vyberajú suy giảm chức năng gan v oboch kolách. Rozdelenie sa nevyrieši, keď sa fond rozšíri.
Toto je jediný objav v tomto súbore údajov, ktorý najvýraznejšie argumentuje v prospech ľudskej odbornej kontroly medicínskeho obsahu. Konsenzus sa nemýli väčšinovým hlasovaním. Odráža skutočný nezhod medzi špičkovými modelmi a tento nezhod je sám osebe informácia, ktorú musí prekladateľ vidieť. Toto je presne ten typ prípadu na ktorý je Tomedes' ľudská kontrola vytvorená.

Časť 5: ‎"To je chorá vec" — čo sa stane, keď je nejednoznačnosť zámerom

Niektoré zdrojové vety sú zámerné nejednoznačné. ‎"To je chorý" v súčasnom anglickom slangu znamená niečo vynikajúce, ale stále nesie aj svoj doslovný význam (teda niečo, čo je odporné/ošklivé), a napätie medzi týmito dvoma významami je súčasťou toho, ako táto fráza komunikuje. Výzvou pre prekladový model je: zachováte nejednoznačnosť, zrútite ju na najpravdepodobnejší význam, alebo si vyberiete jeden a zaviažete sa?

Japonské výstupy


Vietnamské výstupy


Zistenie: nejednoznačnosť a divergencia v rámci tej istej rodiny

Claude Opus 4-7 napíše Đỉnh vậy (slang). Claude Sonnet 4-6 píše Naozaj úžasné (formálne). Toto sú opačné rozhodnutia o registri prijaté dvoma modelmi z tej istej rodiny modelov na identických dvoj-slovných vstupoch. Ani jeden nie je "nesprávny." Nejednoznačnosť vo výraze "That's sick" znamená, že existujú obe interpretácie. Ale ak vaša cieľová skupina používa súčasnú vietnamskú slang mládeže, len jeden z týchto prekladov komunikuje správne. Konsenzus robí nezhodu viditeľnou. Bez toho neviete, že bola urobená voľba.
V japončine je GPT-4.1-NANO jediný model, ktorý používa すごい, čo úplne eliminuje nejednoznačnosť v prospech „úžasný". Päť ďalších modelov to zachováva s やばい/ヤバい‎. Claude Opus nadobúda najminimálnejšiu formu: holé やばい bez subjektu.

Časť 6: Ako vyzerá pool modelov

Modely v tomto teste nie sú všetky ekvivalentné. Obejmujú rôzne architektúry, tréningové režimy a kontexty nasadenia. Základná línia 1. kola zahŕňa modely, ktoré sú široko dostupné. Rozšírený pool v 2. kole pridáva niekoľko najnovších variantov modelov prémiového stupňa, ktoré sú teraz dostupné platiacim používateľom na MachineTranslation.com, rovnakej úrovne modelov, ktoré by inak znamenali samostatný platený účet u každého jednotlivého poskytovateľa.

Rozšírený pool v 2. kole obsahuje pokročilejšie modely, ktoré sú dostupné platiacim používateľom na MachineTranslation.com. Vplyv rozšírenia fondu nie je jednotný. V niektorých testoch (formalita/japončina) to výrazne posunulo konsenzus. U iných (medicínska terminológia/vietnamčina) sa rozdelenie prehĺbilo.

Časť 7: Co to znamená, ak si vyberáte prekladateľskú platformu

Testovací údaje poukazujú na dve odlišné kategórie zlyhaní a vyžadujú si rôzne odpovede.

Kategória A: Tiché zlyhania. Chyby formality, chyby registra, presnosť medicínskej terminológie: tieto produkujú výstupy, ktoré vyzerajú správne. Japončina je gramatická. Vietnamec je plynulý. Neexistuje žiadny povrchový signál, že by sa niečo pokazilo. Monolingválny používateľ čítajúci výstup jedného modelu nemá žiadny spôsob, ako zistiť, že model urobil voľbu registra, ktorú by si všimol vysoký japonský manažér, alebo že klinický termín bol zúžený spôsobom, ktorý mení populáciu, na ktorú sa vzťahuje.

Kategória B: Viditeľné chyby. MiniMax prekladá "burning the midnight oil" ako "burning torches." GPT-4.1-NANO rozlišuje "That's sick" na jednoznačné "すごい." Tieto sú detekovateľné, buď hovorcom cieľového jazyka alebo porovnaním s inými výstupmi modelu.

Porovnanie viacerých modelov, ktoré poskytuje SMART, je najcennejšie v kategórii A. Keď päť alebo desať modelov vytvárajú výstupy a väčšina sa zhoduje na formálnom registri, zatiaľ čo jeden vytvárajú neformálnu jednoduchú formu japončiny, nesúhlas je viditeľný v zobrazení porovnania. Používateľ, ktorý hovorí cieľovým jazykom, môže vyhodnotiť možnosti. Používateľ, ktorý to nevidí, môže vidieť, že bolo prijaté spochybňované rozhodnutie, a rozhodnúť sa, či táto veta ospravedlňuje ľudskú kontrolu.

Pre prácu v rozsahu dokumentov, veľké súbory, preklad PDF s ochranou rozloženia, zmluvy alebo klinické materiály, schopnosť platformy spracovávať dokumenty spracúva štruktúru súboru bez narušenia formátovania. Ale otázky kvality uvedené vyššie platia bez ohľadu na veľkosť súboru. Klinická štúdia s 100 stranami, kde je každý výskyt výrazu "hepatálna insuficiencia" preložený ako "zlyhanie pečene", je väčšou verziou rovnakého problému identifikovaného v Teste 2.

Pre medicínske a právne kategórie špecificky je ľudská verifikácia správnym záchytným mechanizmom. Služba AI Post-Editingu spoločnosti Tomedes, ktorá spája výstup AI s certifikovanou ľudskou kontrolou presne pre tento druh vysoko rizikového obsahu, je na to vytvorená. Rozdelenie suy gan / suy giảm chức năng gan je presne taký typ zistenia, ktoré by malo spustiť túto kontrolu, nie preto, že všetky modely sú nesprávne, ale preto, že modely, ktoré sú najviac presvedčené, nie sú najpresnejšie.

Hodnota videnia viacerých výstupov nie je v tom, že si vždy vyberiete väčšinu. Je to také to, že budete vedieť, že bola urobená voľba, čo sa líši od predpokladu, že výstup pred vami je správny.

Čo mi vlastne povedalo osem viet

Položte osem testov vedľa seba a vzor sa potvrdí: zhoda a nezhoda nie sú náhodne rozdelené. Idiomatické, každodenné obchodné výrazy ("kontaktovať sa", "pracovať do neskorých hodín") sa zbiehali v takmer každom modeli v súbore, v oboch kolách. Formalita, právna presnosť a medicínska terminológia nie. Test CEO-formality sa zmenil z neformálneho na formálny len po zahrnutí rozšíreného súboru. Klauzula o náhrade škody odhalila skutočný právny rozdiel (免責 vs. 補償), ktorý správne pochopil len jeden model v jednom kole. Medicínska terminológia sa nikdy úplne nerozdelia, zostala približne v pomere 6 ku 4 v oboch kolách bez ohľadu na to, ktoré modely boli v množine.

To je skutočný nález, nie marketingové tvrdenie: konsenzus neurobí každú vetu lepšou a nemusí to robiť. Je najcennejší práve tam, kde plynulosť jediného modelu vám nedáva žiadny dôvod na pochybnosti, a kde byť na omyle skutočne niečo stojí.

Existuje druhá, praktickejšia vrstva tohto testu, ktorá stojí za jasné uvedenie. Spustenie tohto porovnania samotným znamenalo kontrolu výstupov z GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo a MiniMax M2.7 vedľa seba s existujúcimi základnými modelmi na jednom mieste na jednej platforme. Mimo MachineTranslation.com to nie je jedno predplatné. Ide o niekoľko, jeden pre každého poskytovateľa, ktorého prémiovú úroveň chcete testovať, za čokoľvek, čo si jednotliví poskytovatelia účtujú. Platení používatelia tu získajú rovnaké porovnanie jedným kliknutím, za zlomok toho, čo by stálo údržba piatich samostatných prémiových predplatných, bez toho, aby sa vzdali veci, ktorá naozaj záleží: vidieť, kde sa modely zhodujú, a vedieť presne kedy sa nezhodujú.

Často kladené otázky

1. Je ChatGPT alebo Claude lepší na preklad?

Ani jeden nie je kategoricky lepší; závisí to od kategórie testu. Claude Sonnet a Claude Opus si dôsledne vyberali presnejší vietnamský medicínsky termín a Claude Opus vytvoril najvhodnejší slang pre "To je chorý." Ale Claude Sonnet tiež vyprodukoval neformálnu japončinu vo formálnej vete v kontexte generálneho riaditeľa, kde GPT-5.5 to dostala správne. Porovnávanie výstupov priamo je obhajovateľnejšie ako vybrať jeden model a dôverovať mu.

2. Ktorý je najpresnejší model AI prekladu v roku 2026?

Neexistuje žiadny; presnosť je závislá od domény. Gemini 3.5-Flash a GLM-5-Turbo vyprodukovaly v tomto teste najvhodnejšiu formálnu japončinu. Obidva Claude modely boli najpresnejšie pri vietnamskej medicínskej terminológii. DeepSeek V4-Pro bol jediným modelom, ktorý použil správny japonský právny termín, ale iba v druhom kole, a inde produkoval hovorovú japončinu. Žiadny jednotný model nedominoval vo všetkých ôsmich testoch.

3. Či pridávanie viacerých modelov AI vždy zlepšuje presnosť prekladu?

Nie, nie automaticky. Rozšírenie skupiny o novšie varianty modelov prémiového stupňa posunulo konsenzus z neformálneho na formálny v teste japonskej formálnosti. Ale v teste vietnamskej medicínskej terminológie pretrvávala rozdelenie približne v pomere 6 ku 4 bez ohľadu na to, ktoré modely boli zahrnuté. Viac modelov vytvára viac nezhody, čo je užitočný signál, ale konsenzus stále nasleduje väčšinu, a väčšina nie je vždy najpresnejšou odpoveďou.

4. Čo je SMART a ako funguje?

SMART je systém viacnásobného konsenzu MachineTranslation.com, ktorý pokrýva až 22 modelov AI od poskytovateľov vrátane OpenAI, Anthropic, Google a DeepSeek. Spúšťa preklad cez viacero modelov naraz a zobrazuje výstup s väčšinovým konsenzom spolu s odpoveďou každého jednotlivého modelu, štandardne bez potreby konfigurácie. Konsenzus sa posúva, keď sa posúva pool modelov, ako je to vidieť v teste formality japončiny v tomto teste: neformálny konsenzus v 1. kole sa stal formálnym v 2. kole.

5. Ktorý AI model je najlepší pre medicínsky alebo právny preklad?

Žiadny jediný model; ľudská kontrola je lepšia odpoveď. Modely Claude konzistentne volili presnejší vietnamský medicínsky termín a iba DeepSeek V4-Pro použil správny japonský právny termín, ale len v 2. kole. Medicínska terminológia sa nikdy nerozdelila konzistentne v 10 modeloch, čo signalizuje, že je potrebná odbornosť v danej oblasti, nie že by sa mal vybrať iný model. Certifikovaná recenzia postredakcie človekom, ako ju ponúka Tomedes, poskytuje túto špecializovanú kontrolu.‎