June 5, 2026
Ek het interne toetse gedoen op iets waaroor ons nie genoeg praat nie in die vertaalbedryf: nie of verskillende KI-stelsels vertaal nie verskillend, maar of verskillende weergawes van dieselfde KI vertaal verskillend — en hoeveel.
Verlede week het ek 'n enkele Spaanse idioom deur vyf weergawes van ChatGPT gelyktydig op MachineTranslation.com se interne toetsplatform laat loop. Wat teruggekom het, het my laat stop.
Twee weergawes het 'n vertaling opgelewer wat werklik onsin in Engels is. Drie weergawes het korrekte idiomatiese vertalings opgelewer. En die drie korrekte het nie met mekaar saamgestem nie.
Al vyf is ChatGPT. Al vyf is OpenAI. Dieselfde KI, ander model — en die uitsette kon nie meer verskil nie.
Ek deel dit nou omdat ek dink dit is belangrik, nie omdat ek duidelike antwoorde het nie. Ek nie. Maar die waarneming is interessant genoeg om in die wêreld te plaas.
Die frase wat ek getoets het, was llevarse el gato al agua.

Hier is wat elke weergawe geproduseer het:
| Model | Uitset | Idioomagtig? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | om die kat na die water te dra | ❌ Letterlik |
| ChatGPT::GPT-4.1-NANO | om die kat na die water te dra | ❌ Letterlik |
| ChatGPT::GPT-4.1-MINI | om dit suksesvol te doen | ✅ Korrek |
| ChatGPT::GPT-5.4-MINI | om jou sin te kry | ✅ Gedeeltelik |
| ChatGPT::GPT-5.4 | om bo uit te kom | ✅ Korrek |
Die frase beteken om iets moeiliks te bereik teen die verwagtinge in, om n harde oorwinning te behaal. Dit het niks met katte of water te doen nie. Die letterlike vertaling is nie 'n vertaling nie. Dit is 'n woord-vir-woord transkripsie van 'n frase wat die model nie as 'n idioom kon herken nie.
GPT-4o-MINI en GPT-4.1-NANO het identiese uitsette geproduseer. Nie soortgelyk nie, identies. Ons Vertaling-insigte het dit direk uitgelig: GPT-4.1-nano en GPT-4o-mini deel identiese vertalings, wat die klem lê op letterlike interpretasie bo idiomatiese betekenis.
GPT-4.1-MINI, GPT-5.4-MINI, en GPT-5.4 het elk iets herkenbaar korrek geproduseer — maar nie dieselfde as mekaar nie.
Ek wil presies wees oor waarom llevarse el gato al agua 'n nuttige toetsinvoer is eerder as een wat uitgesoek is.
Dit is 'n gevestigde idioom. Dit verskyn in literatuur, joernalistiek, en alledaagse spraak. Dit is nie duister nie. Enige model wat op 'n redelike korpus Spaanse teks opgelei is, behoort dit teëgekom het. Die vraag is nie of die model die frase gesien het nie. Die vraag is wat dit daarmee doen.
Die ergste mislukkingswyse in idiomatiese vertaling is nie om 'n slegte vertaling te produseer nie. Dit produseer 'n letterlike vertaling wat aanvaarbaar lyk vir iemand wat nie die teikentaal ken nie.
Om die kat na die water te dra is grammatikaal korrekte Engels. Dit is goed gevorm. Dit klinkt soos iets wat iets kon beteken. 'n Gebruiker wat nie Spaans praat nie, kan dit lees, knik en aangaan — nooit wetende dat die oorspronklike betekenis heeltemal verlore gegaan het.
Dit is die mislukkingsmodus waaroor ek omgee. Nie die voor die hand liggende fout nie. Die onsigbare een.
Die patroon hier is nie lukraak nie. Die twee modelle wat letterlike vertalings geproduseer het (GPT-4o-MINI en GPT-4.1-NANO) is albei kleiner, ligter modelle wat geoptimaliseer is vir spoed en koste-effektiwiteit. Die drie modelle wat idiomatiese vertalings geproduseer het (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) verteenwoordig 'n ander generasie of parameter skaal.
Dit dui op iets wat ek dink onderontgin is: idiomatiese bevoegdheid in vertaling skaal met modelkapasiteit op maniere wat nie sigbaar is in algemene maatstawwe nie.
Algemene taalmaatstawwe toets redenasie, kennis, kodering, wiskunde. Hulle toets gewoonlik nie of 'n model kan identifiseer dat dit reën katte en honde nie oor weerstoestande handel nie, of dat llevarse el gato al agua nie daaroor handel om 'n kat te hidreer nie. Idioom sit op die kruising van kulturele kennis, kontekstuele afleiding, en patroonherkenning — en daardie kruising blyk 'n drempel van modelkapasiteit te vereis wat kleiner modelle nie konsekwent haal nie.
Wat ek nie beweer nie: dat groter modelle altyd beter vertalers is. Ek het nie bewyse daarvoor as 'n algemene reël nie. Wat ek waarneem: dat vir idiomatiese inhoud spesifiek, die binne-familie weergawe gaping groter was as wat ek verwag het.
Die meeste gebruikers wat 'n KI-vertalinginstrument gebruik, weet nie watter weergawe van daardie KI hulle gebruik nie. Hulle maak 'n produk oop, kies 'n taal paar, en kry 'n uitset. Die modelroetering is vir hulle onsigbaar.
Dit maak saak op skaal. MachineTranslation.com het in 'n enkele 90-dae tydperk meer as honderde duisende Engels-na-Spaans vertaalwerk afgehandel. As 'n beduidende gedeelte van daardie werksgeleenthede idiomatiese inhoud (bemarkingskopie, regsterminologie, literêre teks, toevallige kommunikasie) aangeraak het en die instrument wat daardie werksgeleenthede gerig het, gebruikers na 'n kleiner model gelei het sonder hul medewete, dan het om die kat na die water te dra in werklike uitsette, in werklike dokumente, vir regte mense wat die resultaat vertrou het, verskyn.
Die vertaalbedryf het jare lank AI-verskaffers vergelyk. DeepL teenoor Google. Claude teenoor ChatGPT. Daardie vergelykings is bruikbaar. Maar binne 'n enkele verskaffer kan die weergawe-gaping net so beduidend wees — en dit is 'n gaping wat die meeste vergelykingsraamwerke nie meet nie omdat hulle nie op die model-weergawe-vlak toets nie. Wanneer iemand sê Ek gebruik ChatGPT vir vertaling, is daardie sin nie
spesifiek genoeg om betekenisvol te wees nie. Watter ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Die antwoord verander die uitset op maniere wat nie-triviaal is nie, ten minste vir idiomatiese inhoud.
Dit is die deel wat ek die interessantste vind, en ek het nog nie heeltemal uitgewerk wat ek daarvan moet maak nie.
Die drie modelle wat idiomatiese vertalings geproduseer het, het drie verskillende gegee:
Al drie is verdedigbare Engelse weergawes van llevarse el gato al agua. Maar hulle is nie gelykwaardig nie.
Om dit reg te kry beklemtoon uitvoering teen moeilikheid, jy het iets moeiliks gedoen en dit het gewerk. Om jou sin te kry beklemtoon die uitkoms wat jy wou hê, met minder klem op die moeilikheid. Om bo te kom beklemtoon mededingende oorwinning, wen in verhouding tot ander.
Die oorspronklike Spaanse idioom is die naaste aan die eerste hiervan. Die frase dra die konnotasie van weerstand oorkom, nie bloot een uitkoms verkies en dit laat realiseer nie. Maar om sy sin te kry en om bo uit te kom is nie verkeerd nie, dit is net in verskillende rigtings onakkuraat.
Dit lei tot 'n vraag wat ek waarlik moeilik vind: wanneer drie modelle elk 'n korrekte maar duidelike idiomatiese vertaling lewer, hoe evalueer jy watter een die beste is? BLEU-tellings vergelyk met 'n verwysingvertaling — maar wie het die verwysing geskryf, en watter een van hierdie drie sou hulle gekies het?
Ons KI-vertalingagent, tot sy krediet, het die regte vraag gevra voordat hy enige uitvoer gedoen het: Wat is die bedoelde betekenis van 'llevarse el gato al agua' in hierdie konteks? Drie opsies is aangebied — om 'n moeilike doel te bereik, om iets onnodigs te neem, of om 'n riskante aktiwiteit aan te pak. Daardie vraag is nie dekoratief nie. Dit is die meganisme waardeur die kontekstuele dubbelsinnigheid opgelos word voordat die vertaling gefinaliseer word.
Maar die punt bly: drie korrekte antwoorde, drie verskillende skakerings van betekenis. Vertaluevalueringsinstrumente is nie gebou vir hierdie soort nuanses nie.
Ek wil eerlik wees oor die beperkinge van wat hierdie toets toon.
Een idioom, een taalpaar, een dag van interne toetsing. Dit is nie 'n studie nie. Dit is 'n waarneming. Ek weet nie of hierdie patroon (kleiner modelle wat verstek na letterlik, groter modelle wat idiomaties bereik) konsekwent oor die volgende hou nie:
Ek weet ook nie of dit 'n stabiele eienskap van hierdie modelle is of iets wat met opdaterings en fynpassing verskuif. Modelverskaffers publiseer nie veranderinglogs spesifiek vir vertalings nie. 'n Modelweergawe wat llevarse el gato al agua vandag korrek hanteer, kan volgende maand opgedateer word, en ons sou geen manier hê om te weet nie.
Wat ek wel weet: hierdie toets het 'n resultaat opgelewer wat interessant genoeg is dat ek meer daarvan wil doen, meer sistematies, oor meer taalpare en inhoudtipes. Wanneer ek meer het om te deel, sal ek.
te dink Ek sal afsluit met die twee vrae wat hierdie toets my gelaat het. Ek gaan hulle nie antwoord nie, ek het nog nie die data om dit te doen nie. Maar ek dink dis die regte vrae om te vra.
Eerstens: by watter parameterdrempel word idiomatiese bevoegdheid betroubaar? Die sprong van GPT-4o-MINI
en GPT-4.1-NANO (albei letterlik) na GPT-4.1-MINI (idiomaties) dui daarop dat daar 'n drempel iewers in die parameterreeks tussen daardie modelgroottes is waar idiomeherkenning aanskakel. Is dit konsekwent? Is dit van toepassing op idiome oor alle tale nie, of hang dit af van hoe goed 'n taal verteenwoordig word in die opleidingsdata? Ek weet nie. Maar om te weet sal nuttig wees vir enigiemand wat vertaalvloeie bou.
Tweedens: wat kos modelweergawe-onopsigtelikheid gebruikers op skaal?
As 'n gebruiker 1 000 dokumente per maand deur 'n hulpmiddel stuur wat nie openbaar watter modelweergawe gebruik word nie (en sommige van daardie dokumente bevat idiomatiese inhoud), hoe gereeld gebeur die letterlike mislukking onsigbaar? Hoe sou hulle weet? Wat is die koste, in werklike terme, daarvan om nooit uit te vind nie?
Ek dink dit is 'n belangriker vraag as die meeste van die watter KI is die beste vir vertaling vergelykings wat tans sirkuleer. Die antwoord is nie gebruik die grootste model nie. Die antwoord mag wees: weet wat jy gebruik, voer jou eie toetse uit op jou eie inhoud, en moenie aanvaar dat een verskaffer se naam 'n waarborg is van konsekwente gedrag oor hul model reeks nie.
Dit is, ten minste, wat ek uit hierdie toets neem.
Gebaseer op hierdie enkele toets: kleiner, doeltreffendheids-geoptimaliseerde modelle binne dieselfde KI-familie het verstek gegaan na letterlike vertaling van 'n gevestigde Spaanse idiomatiese uitdrukking, terwyl groter/nuwer weergawes van dieselfde model korrekte idiomatiese vertalings opgelewer het. Of hierdie geld oor idiomatiese kategorieë en taalpare heen, is die volgende vraag. Ek sal meer toetse doen.
GPT-4.1-MINI, GPT-5.4-MINI, en GPT-5.4 het almal llevarse el gato al agua idiomaties vertaal — maar in verskillende Engelse uitdrukkings met subtiel verskillende konnotasies. Dit dui daarop dat idiomatiese vertaalgehalte minstens twee dimensies het: of die model die idioom hoegenaamd herken, en watter ekwivalente uitdrukking dit uit die teikentaal se beskikbare opsies kies. Standaard vertaalgehaltemaatstawwe skei hierdie twee dimensies nie duidelik nie . Ek dink hulle moet.
Hierdie plasing is gebaseer op interne toetsing op MachineTranslation.com se ontwikkelingsplatform. Die multi-model weergawe toetsing wat hier getoon word, is nog nie publiek beskikbaar nie. Ek deel die bevinding omdat ek dink die waarneming nuttig is, ongeag waar jy jou vertalings laat loop.