June 5, 2026
Provádím interní testy něčeho, o čem v překladatelském průmyslu nemluvíme dostatečně : ne o tom, zda různé systémy AI překládají odlišně, ale zda různé verze téže AI překládají odlišně – a o kolik.
Minulý týden jsem na interní testovací platformě MachineTranslation.com současně otestoval jeden španělský idiom na pěti verzích ChatGPT . To, co se vrátilo, mě zarazilo.
Dvě verze vyprodukovaly překlad, který je v angličtině skutečně nesmyslný. Tři verze přeložily správné idiomatické překlady. A ty tři správné se neshodovaly.
Všech pět je ChatGPT. Všech pět je OpenAI. Stejná AI, jiný model — a výstupy se nemohou lišit víc.
}Sdílím to teď, protože si myslím, že na tom záleží, ne proto, že mám čisté odpovědi. Nemám. Ale pozorování je natolik zajímavé, že stojí za to ho zveřejnit. Obsah
Fráze, kterou jsem testoval, byla llevarse el gato al agua.

Zde je to, co každá verze vyprodukovala:
| Model | Výstup | Idiomatické? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | vzít kočku k vodě | ❌ Doslovný |
| ChatGPT::GPT-4.1-NANO | vzít kočku k vodě | ❌ Doslovný |
| ChatGPT::GPT-4.1-MINI | dokázat to úspěšně | ✅ Správně |
| ChatGPT::GPT-5.4-MINI | prosazovat svou vůli | ✅ Částečně |
| ChatGPT::GPT-5.4 | vyjít na vrchol | ✅ Správně |
Fráze znamená dosáhnout něčeho obtížného navzdory nepřízni osudu, úspěšně vyhrát těžký boj. Nemá to nic společného s kočkami ani s vodou. Doslovný překlad není překlad. Je to slovo od slova přepis fráze, kterou se model nepodařilo rozpoznat jako idiom.
GPT-4o-MINI a GPT-4.1-NANO vygenerovaly identické výstupy. Ne podobné, identické. Naše Překladatelské poznatky toto přímo označily: GPT-4.1-nano a GPT-4o-mini sdílejí identické překlady, přičemž zdůrazňují doslovný výklad nad idiomatickým významem.
GPT-4.1-MINI, GPT-5.4-MINI a GPT-5.4 každý vyprodukoval něco rozpoznatelně správného – ale ne stejného jako ostatní.
Chci být přesný ohledně toho, proč je llevarse el gato al agua užitečným vstupním testem, nikoli náhodně vybraným.
Je to zavedený idiom. Objevuje se v literatuře, žurnalistice a běžné řeči. Není to nejasné. Jakýkoli model trénovaný na rozumném korpusu španělského textu by se s ním měl setkat. Otázka nezní, zda model danou frázi viděl. Otázkou je, co s tím dělá. Nejhorší způsob selhání při překladu
idiomů není vytvoření špatného překladu. Produkuje doslovný překlad, který vypadá přijatelně pro někoho, kdo nezná cílový jazyk.
„Přinést kočku k vodě“ je gramaticky správná angličtina. Je správně formátován. Zní to jako něco, co by mohlo něco znamenat. Uživatel, který nemluví španělsky, si to může přečíst, přikývnout a jít dál — aniž by věděl, že původní význam byl zcela ztracen.
To je chybový stav, na kterém mi záleží. Ne zjevná chyba. Neviditelný.
Vzor zde není náhodný. Dva modely, které produkovaly doslovné překlady (GPT-4o-MINI a GPT-4.1-NANO), jsou oba menší, lehčí modely optimalizované pro rychlost a nákladovou efektivitu. Tři modely, které produkovaly idiomatické překlady (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), představují jinou generaci nebo škálu parametrů.
To naznačuje něco, co si myslím, že je nedostatečně prozkoumané: idiomatická kompetence v překladu roste s kapacitou modelu způsoby, které nejsou viditelné v obecných benchmarkech.
Obecné jazykové benchmarky testují uvažování, znalosti, kódování, matematiku. Obvykle netestují, zda model dokáže identifikovat , že prší kočky a psy se netýká povětrnostních podmínek, nebo že llevarse el gato al agua se netýká hydratace kočky. Idiomy sedí na průsečíku kulturního poznání, kontextové inference a rozpoznávání vzorů — a tento průsečík se zdá vyžadovat prahovou hodnotu kapacity modelu, kterou menší modely konzistentně nedosahují.
Co netvrdím: že větší modely jsou vždy lepší překladatelé. Nemám pro to jako obecné pravidlo důkaz. Co pozoruji: že u idiomatického obsahu konkrétně byla meziverzní verze v rámci rodiny větší, než jsem čekal.
Většina uživatelů, kteří používají nástroj pro překlad pomocí AI, neví, kterou verzi té AI používají. Otevřou produkt, vyberou jazykový pár a získají výstup. Směrování modelu je pro ně neviditelné.
}Na rozsahu na tom záleží. MachineTranslation.com zpracoval přes stovky tisíc překladů z angličtiny do španělštiny během jediného 90denního období. Pokud by významná část těchto úkolů zahrnovala idiomatický obsah (marketingové texty, právní jazyk, literární texty, běžná komunikace) a nástroj, který tyto úkoly zpracovával, směroval uživatele k menšímu modelu bez jejich vědomí, pak by se „nést kočku k vodě“ objevovalo ve skutečných výstupech, ve skutečných dokumentech, pro skutečné lidi, kteří výsledku důvěřovali.
Překladatelský průmysl roky porovnává poskytovatele AI. DeepL versus Google. Claude versus ChatGPT. Ta srovnání jsou užitečná. Ale v rámci jednoho poskytovatele může být rozdíl ve verzích stejně významný – a je to rozdíl, který většina srovnávacích rámců neměří, protože netestují na úrovni verzí modelů.
Když někdo řekne „Používám ChatGPT na překlad“, tato věta není dostatečně specifická, aby byla smysluplná. Který ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Odpověď mění výstup způsoby , které jsou nezanedbatelné, alespoň pro idiomatický obsah.
Toto je část, která mi přijde nejzajímavější a ještě jsem úplně nepřišel na to, co si o ní myslet.
Tři modely, které vyprodukovaly idiomatické překlady, daly tři různé:
Všechny tři jsou obhajitelné anglické ztvárnění fráze llevarse el gato al agua. Ale nejsou rovnocenné.
„Zvládnout to“ zdůrazňuje provedení proti obtížnosti, něco jste udělali těžkého a ono to fungovalo. Prosazovat svou vůli zdůrazňuje dosažení požadovaného výsledku s menším důrazem na obtížnost. Vyhrát (doslova vyjít na vrchol) zdůrazňuje soutěžní vítězství, vítězství ve vztahu k ostatním.
Původní španělské rčení je nejblíže první z těchto možností. Fráze nese konotaci překonání odporu, nikoli pouhého upřednostnění jednoho výsledku a jeho uskutečnění. Ale prosazovat svou a zvítězit nejsou špatně, jsou jen nepřesné různými směry.
To vyvolává otázku, kterou považuji za skutečně obtížnou: když tři modely každý vytvoří správný, ale odlišný idiomatický překlad, jak určíte, který je nejlepší? Skóre BLEU se porovnávají s referenčním překladem – ale kdo referenční překlad napsal a který z těchto tří by si vybral?
Náš agent pro překlad umělou inteligencí si ke své cti položil správnou otázku předtím, než se zavázal k jakémukoli výstupu: Jaký je zamýšlený význam výrazu 'llevarse el gato al agua' v tomto kontextu? Byly nabídnuty tři možnosti – dosáhnout obtížného cíle, vzít si něco zbytečného nebo se pustit do riskantní činnosti. Ta otázka není okrasná. Je to mechanismus, kterým se kontextová nejednoznačnost řeší před dokončením překladu.
Ale pointa zůstává: tři správné odpovědi, tři různé odstíny významu. Nástroje pro hodnocení překladu nejsou pro tento druh nuancí vytvořeny . Co ještě nevím
Chci být upřímný ohledně limitů toho, co tento test ukazuje.
Jeden idiom, jeden jazykový pár, jeden den interního testování. To není studie. Je to pozorování. Nevím, zda tento vzorec (menší modely se drží doslovného překladu, větší modely dosahují idiomatického) platí konzistentně napříč:
Také nevím, zda je to stabilní vlastnost těchto modelů, nebo něco, co se mění s aktualizacemi a doladěním. Poskytovatelé modelů nezveřejňují změny specifické pro překlad. Verze modelu, která dnes správně zvládá llevarse el gato al agua, může být příští měsíc aktualizována a my bychom o tom nevěděli.
Co vím: tento test přinesl výsledek natolik zajímavý , že chci provést další, systematičtější testy napříč více jazykovými páry a typy obsahu. Až budu mít více co sdílet, udělám to.
Na závěr uvedu dvě otázky, které mi tento test zanechal. Nebudu na ně odpovídat, ještě na to nemám data. Ale myslím, že jsou to správné otázky.
Zaprvé: při jaké prahové hodnotě parametrů se idiomatická kompetence stává spolehlivou?
Přechod z GPT-4o-MINI a GPT-4.1-NANO (oba doslovné) na GPT-4.1-MINI (idiomatický) naznačuje, že někde v rozsahu parametrů mezi těmito velikostmi modelů existuje práh, kde se rozpoznávání idiomů zapíná. Je to konzistentní? Vztahuje se to na idiomy napříč všemi jazyky, nebo to závisí na tom, jak dobře je jazyk zastoupen v trénovacích datech? Nevím. Ale znalost by byla užitečná pro každého, kdo vytváří překladové pracovní postupy.
Za druhé: kolik stojí uživatelům neprůhlednost verze modelu ve velkém měřítku?
Pokud uživatel zpracuje 1 000 dokumentů měsíčně nástrojem, který nezveřejňuje, která verze modelu se používá (a některé z těchto dokumentů obsahují idiomatický obsah), jak často dochází k doslovnému selhání neviditelně? Jak by to věděli? Jaké jsou skutečné náklady na to, že se to nikdy nedozvíme?
Myslím si, že je to důležitější otázka než většina porovnání „která AI je nejlepší pro překlad“, která v současnosti kolují. Odpověď není „použijte největší model.“ Odpověď může být: vědět, co používáte, provádět vlastní testy na vlastním obsahu a nepředpokládat, že název jednoho poskytovatele je zárukou konzistentního chování napříč jeho modelovou řadou.
To je přinejmenším to, co z tohoto testu vyplývá.
Na základě tohoto jediného testu: menší, na efektivitu optimalizované modely ze stejné rodiny AI ve výchozím nastavení doslovně překládaly zavedený španělský idiom, zatímco větší/novější verze stejného modelu produkovaly správné idiomatické ztvárnění. Zda to platí napříč kategoriemi idiomů a jazykovými páry, je další otázka. Provedu další testy.
GPT-4.1-MINI, GPT-5.4-MINI a GPT-5.4 přeložilyllevarse el gato al agua idiomaticky – ale do různých anglických výrazů s jemně odlišnými konotacemi. Toto naznačuje , že kvalita idiomatického překladu má přinejmenším dva rozměry: zda si model idiom vůbec uvědomí a jaký ekvivalentní výraz vybere z dostupných možností cílového jazyka. Standardní metriky kvality překladu tyto dva rozměry čistě neodlišují. Myslím, že by měli.
Tento příspěvek je založen na interním testování na vývojové platformě MachineTranslation.com. Testování více modelů, které je zde uvedeno, ještě není veřejně dostupné. Sdílím toto zjištění, protože si myslím, že toto pozorování je užitečné bez ohledu na to, kde provádíte své překlady.