June 5, 2026
Vykonával som interné testy na niečom, o čom sa v prekladateľskom priemysle dostatočne nehovorí: nie o tom, či rôzne systémy AI prekladajú odlišne, ale či rôzne verzie tej istej AI prekladajú odlišne — a o koľko.
Minulý týždeň som na internej testovacej platforme MachineTranslation.com simultánne spustil jeden španielsky idióm cez päť verzií ChatGPT. To, čo sa vrátilo, ma zastavilo.
Dve verzie vytvorili preklad, ktorý je v angličtine skutočne nezmyselný. Tri verzie vytvorili správne idiomatické preklady. A tri správne sa nezhodovali.
Všetkých päť je ChatGPT. Všetkých päť sú OpenAI. Rovnaká AI, iný model — a výstupy sa nemohli líšiť viac.
Zdieľam to teraz, pretože si myslím, že na tom záleží, nie preto, že mám čisté odpovede. Neviem. Pozorovanie je však dostatočne zaujímavé na to, aby sa dostalo do sveta.
Fráza, ktorú som testoval, bola llevarse el gato al agua.

Tu je, čo vyprodukovala každá verzia:
| Model | Výstup | Idiómatické? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | preniesť mačku k vode | ❌ Doslovné |
| ChatGPT::GPT-4.1-NANO | preniesť mačku k vode | ❌ Doslovné |
| ChatGPT::GPT-4.1-MINI | úspešne to zvládnuť | ✅ Správne |
| ChatGPT::GPT-5.4-MINI | dosiahnuť svoje | ✅ Čiastočné |
| ChatGPT::GPT-5.4 | vyjsť víťazne | ✅ Správne |
Táto fráza znamená dosiahnuť niečo ťažké napriek prekážkam, vybojovať ťažké víťazstvo. Nemá to nič spoločné s mačkami ani vodou. Doslovný preklad nie je preklad. Je to doslovný prepis frázy, ktorú model nedokázal rozpoznať ako idióm.
GPT-4o-MINI a GPT-4.1-NANO vytvorili identické výstupy. Nie podobné, identické. Naše Prekladové Zistenia priamo na to upozornili: GPT-4.1-nano a GPT-4o-mini zdieľajú identické preklady, zdôrazňujúc doslovnú interpretáciu pred idiomatickým významom.
GPT-4.1-MINI, GPT-5.4-MINI a GPT-5.4 každý vyprodukoval niečo rozpoznateľne správne — ale nie to isté ako navzájom.
Chcem byť presný v tom, prečo je llevarse el gato al agua užitočným testovacím vstupom, a nie vybraným.
Je to dobre zavedený idióm. Objavuje sa v literatúre, žurnalistike, a každodennej reči. Nie je to nejasné. Každý model trénovaný na primeranom korpuse španielskeho textu by sa s ním mal stretnúť. Otázka nie je, či model videl frázu. Otázka je, čo s tým robí.
Najhorší spôsob zlyhania pri preklade idiómov nie je vytvorenie zlého prekladu. Vytvára doslovný preklad, ktorý vyzerá prijateľne pre niekoho, kto nepozná cieľový jazyk.
Nosiť mačku k vode je gramaticky správna angličtina. To je korektné. Znie to ako niečo, čo by mohlo niečo znamenať. Používateľ, ktorý nehovorí po španielsky, by si to mohol prečítať, prikývnuť a ísť ďalej — nikdy sa nedozvie, že pôvodný význam bol úplne stratený.
To je režim zlyhania, na ktorom mi záleží. Nie tá zjavná chyba. Ten neviditeľný.
Vzor tu nie je náhodný. Dva modely, ktoré vytvorili doslovné preklady (GPT-4o-MINI a GPT-4.1-NANO), sú oba menšie, ľahšie modely optimalizované pre rýchlosť a nákladovú efektívnosť. Tri modely, ktoré produkovali idiomatické preklady (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), predstavujú inú generáciu alebo škálu parametrov.
To naznačuje niečo, čo je podľa mňa málo preskúmané: idiomatická kompetencia v preklade sa škáluje s kapacitou modelu spôsobmi, ktoré nie sú viditeľné v všeobecných benchmarkoch.
Všeobecné jazykové benchmarky testujú uvažovanie, vedomosti, kódovanie, matematiku. Zvyčajne netestujú, či model dokáže identifikovať že prší ako z krhly nie je o poveternostných podmienkach, alebo že llevarse el gato al agua nie je o hydratácii mačky. Idiomy sa nachádzajú na priesečníku kultúrnych znalostí, kontextovej inferencie a rozpoznávania vzorov — a zdá sa, že tento priesečník vyžaduje prah kapacity modelu, ktorý menšie modely nedokážu dôsledne prekročiť.
Čo netvrdím: že väčšie modely sú vždy lepšími prekladateľmi. Nemám na to dôkazy ako na všeobecné pravidlo. Čo pozorujem: že konkrétne pre idiomatický obsah, rozdiel vo verziách v rámci rodiny bol väčší, než som očakával.
Väčšina používateľov, ktorí používajú nástroj na preklad s umelou inteligenciou, nevie, ktorú verziu tejto AI používajú. Otvoria produkt, vyberú jazykový pár a dostanú výstup. Smerovanie modelu je pre nich neviditeľné.
Na tom záleží vo veľkom rozsahu. MachineTranslation.com spracoval viac ako státisíce prekladov z angličtiny do španielčiny za jedno 90-dňové obdobie. Ak významná časť týchto úloh zahŕňala idiomatický obsah (marketingové texty, právny jazyk, literárne texty, bežná komunikácia) a nástroj, ktorý tieto úlohy smeroval, presmerovával používateľov na menší model bez ich vedomia, potom sa nosiť mačku k vode objavovalo v skutočných výstupoch, v skutočných dokumentoch, pre skutočných ľudí, ktorí dôverovali výsledku.
Prekladateľský priemysel strávil roky porovnávaním poskytovateľov AI. DeepL verzus Google. Claude vs. ChatGPT. Tie porovnania sú užitočné. Ale v rámci jedného poskytovateľa môže byť rozdiel vo verziách rovnako významný — a je to rozdiel, ktorý väčšina porovnávacích rámcov nemeria, pretože netestujú na úrovni verzie modelu.
Keď niekto povie „Používam ChatGPT na preklad,“ táto veta nie je dostatočne špecifická, aby bola zmysluplná. Ktorý ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Odpoveď mení výstup spôsobmi ktoré sú netriviálne, aspoň pre idiomatický obsah.
Toto je časť, ktorú považujem za najzaujímavejšiu, a ešte som úplne neprišiel na to, čo si o tom myslieť.
Tri modely, ktoré vytvorili idiomatické preklady, dali tri rôzne:
Všetky tri sú obhájiteľné anglické preklady výrazu llevarse el gato al agua. Ale nie sú ekvivalentné.
Zvládnuť to zdôrazňuje úspešné vykonanie napriek ťažkostiam, ty si urobil niečo ťažké a podarilo sa to. Dostať si svoje zdôrazňuje dosiahnutie výsledku, ktorý ste chceli, s menším dôrazom na ťažkosť. Vyjsť navrch zdôrazňuje súťažné víťazstvo, víťazstvo voči ostatným.
Pôvodný španielsky idióm je najbližšie k prvému z nich. Fráza nesie konotáciu prekonávania odporu, nie jednoducho preferovať jeden výsledok a nechať ho zhmotniť sa. Ale presadiť si svoje a zvíťaziť nie sú nesprávne, sú len nepresné, každé iným smerom.
Toto vyvoláva otázku, ktorú považujem za skutočne ťažkú: keď tri modely každý vytvorí správny, ale odlišný idiomatický preklad, ako vyhodnotíte, ktorý je najlepší? Skóre BLEU sa porovnáva s referenčným prekladom — ale kto napísal referenciu a ktorú z týchto troch by si vybrali?
Náš prekladateľský agent AI, k jeho cti, položil správnu otázku predtým, než sa zaviazal k akémukoľvek výstupu: Aký je zamýšľaný význam 'llevarse el gato al agua' v tomto kontexte? Tri možnosti boli ponúknuté — dosiahnuť náročný cieľ, vziať niečo zbytočné, alebo zapojiť sa do rizikovej činnosti. Táto otázka nie je dekoratívna. Je to mechanizmus, pomocou ktorého sa kontextuálna dvojznačnosť vyrieši predtým, ako sa preklad dokončí.
Ale podstata zostáva: tri správne odpovede, tri rôzne odtiene významu. Nástroje na hodnotenie prekladu nie sú stavané pre tento druh nuansy.
Chcem byť úprimný o limitoch toho, čo tento test ukazuje.
Jeden idióm, jeden jazykový pár, jeden deň interného testovania. To nie je štúdia. Je to pozorovanie. Neviem, či tento vzor (menšie modely predvolene dosahujú doslovný preklad, väčšie modely dosahujú idiomatický) platí dôsledne naprieč:
Taktiež neviem, či je to stabilná vlastnosť týchto modelov alebo niečo, čo sa mení s aktualizáciami a dolaďovaním. Poskytovatelia modelov nezverejňujú zoznamy zmien špecifické pre preklad. Verzia modelu, ktorá dnes správne spracuje llevarse el gato al agua, môže byť aktualizovaná budúci mesiac a my by sme nemali ako to vedieť.
Čo viem: tento test priniesol dostatočne zaujímavý výsledok že chcem spustiť viac takýchto testov, systematickejšie, naprieč viacerými jazykovými pármi a typmi obsahu. Keď budem mať viac na zdieľanie, urobím tak.
Na záver uvediem dve otázky, ktoré mi tento test zanechal. Nebudem na ne odpovedať, nemám na to ešte dáta. Ale myslím si, že sú to správne otázky na položenie.
Po prvé: pri akom prahu parametrov sa idiomatická kompetencia stáva spoľahlivou?
Skok z GPT-4o-MINI a GPT-4.1-NANO (obe doslovné) na GPT-4.1-MINI (idiomatické) naznačuje, že niekde v rozsahu parametrov medzi týmito veľkosťami modelov existuje prah, kde sa zapína rozpoznávanie idiómov . Je to konzistentné? Vzťahuje sa to na idiómy vo všetkých jazykoch, alebo to závisí od toho, ako dobre je zastúpený jazyk v tréningových dátach? Neviem. Ale vedieť by bolo užitočné pre každého, kto vytvára prekladové pracovné postupy.
Po druhé: čo stojí používateľov neprehľadnosť verzie modelu vo veľkom rozsahu?
Ak používateľ smeruje 1 000 dokumentov mesačne cez nástroj, ktorý nezverejňuje, ktorá verzia modelu sa používa (a niektoré z týchto dokumentov obsahujú idiomatický obsah), ako často dochádza k doslovnému zlyhaniu neviditeľne? Ako by to vedeli? Aká je v skutočnosti cena toho, že sa to nikdy nedozvieme?
Myslím si, že toto je dôležitejšia otázka ako väčšina porovnaní „ktorá AI je najlepšia na preklad“, ktoré momentálne kolujú. Odpoveďou nie je „použiť najväčší model.“ Odpoveďou môže byť: vedieť, čo používate, spustiť si vlastné testy na vlastnom obsahu a nepredpokladať, že názov jedného poskytovateľa je zárukou konzistentného správania naprieč ich modelovým radom.
To je prinajmenšom to, čo si z tohto testu odnášam.
Na základe tohto jediného testu: menšie, na efektivitu optimalizované modely v rámci rovnakej rodiny AI predvolene prekladali doslovne dobre zavedený španielsky idióm, zatiaľ čo väčšie/novšie verzie rovnakého modelu vytvorili správne idiomatické preklady. Či to platí naprieč kategóriami idiómov a jazykovými pármi, je ďalšou otázkou. Spustím ďalšie testy.
GPT-4.1-MINI, GPT-5.4-MINI a GPT-5.4 všetky preložili llevarse el gato al agua idiomaticky — ale do rôznych anglických výrazov s jemne odlišnými konotáciami. To naznačuje , že kvalita idiomatického prekladu má aspoň dve dimenzie: či model vôbec rozpozná idióm, a ktorý ekvivalentný výraz si vyberie z dostupných možností cieľového jazyka. Štandardné metriky kvality prekladu čisto neoddeľujú tieto dve dimenzie. Myslím, že by mali.
Tento príspevok je založený na internom testovaní na vývojovej platforme MachineTranslation.com. Tu zobrazené testovanie viacmodelových verzií ešte nie je verejne dostupné. Zdieľam tento poznatok, pretože si myslím, že toto pozorovanie je užitočné bez ohľadu na to, kde spúšťate svoje preklady.