June 5, 2026
Ég hef verið að prófa innanhúss á einhverju sem við tölum ekki nógu mikið um í þýðingariðnaðinum: ekki hvort mismunandi gervigreindarkerfi þýði mismunandi, heldur hvort mismunandi útgáfur af sömu gervigreindinni þýði mismunandi — og hversu mikið.
Í síðustu viku prófaði ég eitt spænskt orðatiltæki í gegnum fimm útgáfur af ChatGPT samtímis á innanhúss prófunarvettvangi MachineTranslation.com. Það sem kom til baka stoppaði mig.
Tvær útgáfur skiluðu þýðingu sem er, sannarlega, vitleysa á enska. Þrjár útgáfur framleiddu réttar málfræðilegar þýðingar. Og þau þrjú réttu voru ekki sammála hvert öðru.
Öll fimm eru ChatGPT. Allir fimm eru OpenAI. Sama gervigreind, önnur gerð — og útkoman gæti ekki verið ólíkari.
Ég deili þessu núna vegna þess að ég tel að það skipti máli, ekki vegna þess að ég hafi skýr svör. Ég geri það ekki. En athugunin er áhugaverð nógu til að koma henni út í heiminn.
Setningin sem ég prófaði var llevarse el gato al agua.

Hér er hvað hver útgáfa framleiddi:
| Fyrirmynd | Úttak | Orðatiltæki? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | að bera köttinn á vatnið | ❌ Bókstaflegt |
| ChatGPT::GPT-4.1-NANO | að bera köttinn á vatnið | ❌ Bókstaflegt |
| ChatGPT::GPT-4.1-MINI | að ná því fram með góðum árangri | ✅ Rétt |
| ChatGPT::GPT-5.4-MINI | að fá sitt fram | ✅ Hlutbundið |
| ChatGPT::GPT-5.4 | að komast á toppinn | ✅ Rétt |
Setningin þýðir að ná einhverju erfiðu gegn öllum líkindum, að ná erfiðum sigri. Það hefur ekkert með ketti eða vatn að gera. Hin bókstaflega þýðing er ekki þýðing. Þetta er orðrétt tilvitnun í orðasamband sem líkanið greindi ekki sem orðatiltæki. GPT-4o-MINI og GPT-4.1-NANO framleiddu einsleita
niðurstöðu. Ekki svipað, eins. Innri greiningar okkar á þýðingum bentu beint á þetta: „GPT-4.1-nano og GPT-4o-mini deila eins og er sömu þýðingum, leggja áherslu á bókstaflega útskýringu frekar en orðtaksfræðilega merkingu.“
GPT-4.1-MINI, GPT-5.4-MINI og GPT-5.4 framleiddu hver um sig eitthvað sem var auðþekkjanlega rétt – en ekki það sama og hver annar.
Ég vil vera nákvæmur um hvers vegna llevarse el gato al agua er gagnlegt inntak í prófunum frekar en valið slatta.
Þetta er vel þekkt orðtak. Það kemur fyrir í bókmenntum, blaðamennsku og daglegu tali. Það er ekki óljóst. Hver líkan sem er þjálfað á eðlilegu safni spænskra texta ætti að hafa séð það. Spurningin er ekki hvort líkanið hafi séð setninguna. Spurningin er hvað hún gerir við það.
Versta bilunarmátið í orðtakum er ekki að framleiða slæma þýðingu. Það er að framleiða bókstaflega þýðingu sem lítur út viðunandi út fyrir einhvern sem þekkir ekki markmálið.
„Að bera köttinn að vatninu“ er málfræðilega rétt enska. Það er rétt myndað. Þetta hljómar eins og eitthvað sem gæti þýtt eitthvað. Notandi sem talar ekki spænsku gæti lesið það, hnykkt og haldið áfram — án þess að vita nokkurn tíma að upprunaleg merking glataðist algjörlega.
Það er bilunarmátinn sem ég hef áhyggjur af. Ekki augljós mistök. Hinn ósýnilegi.
Munstrið hér er ekki tilviljun. Tvær gerðirnar sem framleiddu bókstaflegar þýðingar (GPT-4o-MINI og GPT-4.1-NANO) eru báðar minni, léttari gerðir sem eru sérsniðnar fyrir hraða og kostnaðarhagkvæmni. Þrjár gerðirnar sem framleiddu málfræðilega réttar þýðingar (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) tákna aðra kynslóð eða stærðarbreytu.
Þetta bendir til þess sem ég held að hafi verið vanrannsakað: málfræðileg hæfni í þýðingu vex með getu líkansins á vegu sem eru ekki sýnilegir í almennum viðmiðum.
Almenn viðmið fyrir tungumál prófa rökhugsun, þekkingu, forritun, stærðfræði. Þeir prófa venjulega ekki hvort líkan geti greint að það rigni köttum og hundum snýst ekki um veðurskilyrði, eða að llevarse el gato al agua snýst ekki um að gefa kött vatn. Orðatiltæki eru á tímamótum menningarlegrar þekkingar, samhengisbundinnar ályktunar og mynsturgreiningar — og þessi tímamót virðast krefjast þröskulds á getu líkans sem minni líkön ná ekki stöðugt.
Það sem ég er ekki að fullyrða: að stærri líkön séu alltaf betri þýðendur. Ég hef engar sannanir fyrir því sem almenn regla. Það sem ég er að fylgjast með: að fyrir sérstakt hugtaksinnihald, var munurinn á milli útgáfna innan fjölskyldu stærri en ég bjóst við.
Flestir notendur sem nota gervigreindartæki til þýðinga vita ekki hvaða útgáfu af þeirri gervigreind þeir eru að nota. Þeir opna vöru, velja tungumálapar og fá útkomu. Rútunni líkansins er ósýnileg fyrir þá.
Þetta skiptir máli í stórum stíl. MachineTranslation.com vann yfir hundruð þúsunda ensku-til-spænsku þýðingarverkefna á einu 90 daga tímabili. Ef verulegur hluti af þeim störfum snerti ívilnandi efni (markaðssetningarefni, lagalegt mál, bókmenntatexti, frjálsleg samskipti) og tólið sem beindi þeim störfum vísaði notendum á minni líkan án vitundar þeirra, þá birtist „að bera köttinn á vatnið“ í raunverulegum úttökum, í raunverulegum skjölum, fyrir raunverulegt fólk sem treysti niðurstöðunni.
Þýðingariðnaðurinn hefur eytt árum í að bera saman AI-veitendur. DeepL á móti Google. Claude á móti ChatGPT. Þessar samanburðir eru gagnlegir. En innan eins veitanda getur útgáfubilið verið jafn merkilegt – og það er bil sem flestir samanburðarrammar mæla ekki vegna þess að þeir prófa ekki á stigi líkansútgáfu.
Þegar einhver segir „Ég nota ChatGPT til að þýða,“ er þessi setning ekki nægilega sértæk til að vera merkileg. Hvaða ChatGPT? Nano? 4o-mini? 4.1-lítill? 5.4? Svarið breytir úttakinu á vegu sem eru ekki ómerkjanlegir, að minnsta kosti fyrir orðræðuinnihald.
Þetta er sá hluti sem mér finnst áhugaverðastur, og ég hef ekki ennþá áttað mig á því hvað ég á að gera við það.
Þrjár gerðirnar sem framleiddu orðræðarþýðingar gáfu þrjár ólíkar þýðingar:
Allar þrjár eru varnarverðar enskar útfærslur á llevarse el gato al agua. En þau eru ekki jafngild.
„Að ná því fram“ leggur áherslu á framkvæmd gegn erfiðleikum, þú gerðir eitthvað erfitt og það gekk upp. Að fá sínu framgengt leggur áherslu á að ná fram því sem þú vildir, með minni áherslu á erfiðleikana. Að komast á toppinn leggur áherslu á samkeppnis sigur, að vinna miðað við aðra.
Upprunalega spænska orðatiltækið er næst því fyrsta af þessum. Setningin hefur í för með sér merkingu þess að sigrast á mótspyrnu, ekki bara að kjósa eitt útkomu og láta hana rætast. En að fá sínu framgengt og að standa uppi sem sigurvegari eru ekki röng, þau eru bara óljós í mismunandi áttir.
Þetta vekur spurningu sem mér finnst raunverulega erfið: þegar þrjár gerðir framleiða hver sína réttu en ólíku málsplakandi þýðingu, hvernig metur maður hver sé best? BLEU-stigin bera saman við viðmiðunarþýðingu — en hver skrifaði viðmiðunina og hverja af þessum þremur hefði hann/hún valið?
Gervigreindarþýðingamiðlari okkar, til að hans/hennar heiðurs, spurði réttu spurningarinnar áður en hann/hún skuldbatt sig til neinnar úttaks: Hver er ætlað merkingu 'llevarse el gato al agua' í þessu samhengi? Þrír valkostir voru í boði — að ná erfiðu markmiði, að taka eitthvað óþarft, eða að taka þátt í áhættusömri starfsemi. Þessi spurning er ekki skrautleg. Þetta er vélbúnaðurinn sem ákvarðar tvíræðni samhengis áður en þýðing er fullgerð.
En málið stendur: þrjár réttar niðurstöður, þrír mismunandi merkingu. Þýðingarmatstæki eru ekki byggð fyrir þessa tegund af blæbrigðum.
Ég vil vera heiðarlegur um takmarkanir þess sem þessi próf sýna.
Eitt orðatiltæki, eitt tungumálapar, einn dagur af innri prófunum. Það er ekki rannsókn. Þetta er athugun. Ég veit ekki hvort þetta mynstur (minni módel sem fara sjálfgefið í bókstaflega merkingu, stærri módel sem ná málsháttum) heldur stöðugt yfir:
Ég veit heldur ekki hvort þetta er stöðugur eiginleiki þessara módela eða eitthvað sem breytist með uppfærslum og fínstillingu. Módelveitendur gefa ekki út breytingaskrár sem tengjast þýðingum. Módelútgáfa sem meðhöndlar llevarse el gato al agua rétt í dag gæti verið uppfærð næsta mánuð, og við myndum ekki hafa neina leið til að vita það.
Það sem ég veit: þessi próf framleiddu niðurstöðu sem var nógu áhugaverð að ég vil prófa fleiri af þeim, kerfisbundnari, yfir fleiri tungumálapör og innihaldstegundir. Þegar ég hef meira að deila, mun ég gera það.
Ég mun ljúka með þeim tveimur spurningum sem þessi próf skildu mig eftir með. Ég ætla ekki að svara þeim, ég hef ekki gögnin til þess ennþá. En ég held að þetta séu réttu spurningarnar til að spyrja.
Fyrst: við hvaða þröskuld á stærðargráðu verður málfræðileg hæfni áreiðanleg?
Stökkið frá GPT-4o-MINI og GPT-4.1-NANO (bæði bókstafleg) til GPT-4.1-MINI (málfræðileg) bendir til þess að það sé þröskuldur einhvers staðar í stærðargráðu milli þeirra módelstærða þar sem orðatiltækjaþekking kviknar. Er það í samræmi? Á það við um orðatiltæki á öllum tungumálum, eða veltur það á því hversu vel tungumál er fulltrúi í þjálfunargögnum? Ég veit það ekki. En vitneskjan væri gagnleg fyrir hvern sem er að byggja upp þýðingarferla.
Annað: hvað kostar ónærsæi líkanútgáfa notendur í stórum stíl?
Ef notandi sendir 1.000 skjöl á mánuði í gegnum tól sem gefur ekki upp hvaða líkanútgáfa er notuð (og sum af þessum skjölum innihalda orðasambönd), hversu oft er hin bókstaflega bilun að gerast ósýnilega? Hvernig myndu þeir vita það? Hver er kostnaðurinn, í raunverulegum skilningi, af því að vita aldrei?
Ég held að þetta sé mikilvægari spurning en flestar af þeim samanburðum um hvaða gervigreind er best til þýðinga sem nú eru á rólu. Svarið er ekki „notaðu stærsta líkanið.“ Svarið gæti verið: vita hvað þú ert að nota, gerðu þínar eigin prófanir á þínu eigin efni, og ekki gera ráð fyrir að nafn eins veitanda sé trygging fyrir stöðugri hegðun innan úrvals þeirra af líkönum .
Það er, að minnsta kosti, það sem ég tek út úr þessu prófi.
líkön innan sömu gervigreindar fjölskyldu sjálfgefið til bókstaflegrar þýðingar á vel stofnuðu spænsku orðtaki, á meðan stærri/nýrri útgáfur af sama líkani framleiddu réttar táknrænar myndir. Hvort þetta gildir fyrir allar flokka málshátta og tungumálapör er næsta spurning. Ég mun keyra fleiri próf.
GPT-4.1-MINI, GPT-5.4-MINI og GPT-5.4 þýddu öll llevarse el gato al agua málsháttarfræðilega – en yfir í mismunandi ensk orðasambönd með fíngerðum mismun í merkingu. Þetta bendir til þess að gæði í hugverkaþýðingum hafi að minnsta kosti tvo þætti: hvort líkanið þekkir hugverkið yfirleitt, og hvaða jafngilding það velur úr tiltækum valkostum markmálsins. Staðlaðar gæðamælingar fyrir þýðingar aðgreina ekki þessar tvær víddir á hreinan hátt. Ég held að þeir ættu það.
Þessi færsla byggir á innri prófunum á þróunarvettvangi MachineTranslation.com. Fjölmódelprófunin sem sýnd er hér er ekki enn opinberlega fáanleg. Ég deili þessari niðurstöðu vegna þess að ég tel að athugunin sé gagnleg, óháð því hvar þú framkvæmir þýðingar þínar.