June 5, 2026
Am efectuat teste interne la ceva despre care nu vorbim suficient în industria traducerilor: nu dacă diferite sisteme AI traduc diferit, ci dacă diferite versiuni ale aceluiași AI traduc diferit — și cu cât.
Săptămâna trecută am introdus un singur idiom spaniol în cinci versiuni de ChatGPT simultan pe platforma internă de testare a MachineTranslation.com. Ce a ieșit m-a oprit.
Două versiuni au produs o traducere care, sincer, nu are sens în engleză. Trei versiuni au produs traduceri idiomatice corecte. Și cei trei corecți nu au fost de acord între ei.
Toți cinci sunt ChatGPT. Toate cinci sunt OpenAI. Stoc AI, alt model — iar rezultatele nu puteau fi mai diferite.
} Împărtășesc asta acum pentru că cred că contează, nu pentru că am răspunsuri clare. Nu am. Dar observația este suficient de interesantă pentru a fi făcută publică.
Expresia pe care am testat-o a fost llevarse el gato al agua.

Iată ce a produs fiecare versiune:
| Model | Output | Idiomatic? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | to carry the cat to the water | ❌ Literal |
| ChatGPT::GPT-4.1-NANO | to carry the cat to the water | ❌ Literal |
| ChatGPT::GPT-4.1-MINI | to pull it off successfully | ✅ Correct |
| ChatGPT::GPT-5.4-MINI | to get one's way | ✅ Partial |
| ChatGPT::GPT-5.4 | to come out on top | ✅ Correct |
Expresia înseamnă a realiza ceva dificil împotriva tuturor șanselor, a obține o victorie grea. Nu are nicio legătură cu pisicile sau apa. Traducerea literală nu este o traducere. Este o transcriere cuvânt cu cuvânt a unei fraze pe care modelul nu a reușit să o recunoască drept idiom.
GPT-4o-MINI și GPT-4.1-NANO au produs rezultate identice. Nu similar, identic. Traducerile noastre au semnalat acest lucru direct: GPT-4.1-nano și GPT-4o-mini au traduceri identice, subliniind interpretarea literală în detrimentul sensului idiomatic.
GPT-4.1-MINI, GPT-5.4-MINI și GPT-5.4 au produs fiecare ceva recunoscut ca fiind corect — dar nu același lucru.
Vreau să fiu precis cu privire la motivul pentru care llevarse el gato al agua este un input de test util, mai degrabă decât unul ales la întâmplare.
Este un idiom bine stabilit. Apare în literatură, jurnalism și limbajul curent. Nu este obscur. Orice model antrenat pe un corpus rezonabil de text în limba spaniolă ar fi trebuit să-l întâlnească. Întrebarea nu este dacă modelul a văzut fraza. Întrebarea este ce face cu ea.
Cel mai prost mod de eșec în traducerea idiomurilor nu este producerea unei traduceri proaste. Produce o traducere literală care pare acceptabilă pentru cineva care nu cunoaște limba țintă.
„A duce pisica la apă” este o expresie englezească corectă gramatical. Este bine format. Pare ceva ce ar putea însemna ceva. Un utilizator care nu vorbește spaniolă ar putea să citească, să dea din cap și să meargă mai departe — fără să știe niciodată că sensul original a fost pierdut complet.
Acesta este modul de eșec de care îmi pasă. Nu eroarea evidentă. Cel invizibil.
Modelul de aici nu este aleatoriu. Cele două modele care au produs traduceri literale (GPT-4o-MINI și GPT-4.1-NANO) sunt ambele modele mai mici, mai ușoare, optimizate pentru viteză și eficiență a costurilor. Cele trei modele care au produs traduceri idiomatice (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) reprezintă o generație diferită sau o scară de parametri diferită.
Acest lucru sugerează ceva ce cred că este subexplorat: competența idiomatică în traducere scalează cu capacitatea modelului în moduri care nu sunt vizibile în benchmark-urile generale.
Benchmark-urile lingvistice generale testează raționamentul, cunoștințele, codarea, matematica. În mod obișnuit, nu se testează dacă un model poate identifica că plouă cu găleata nu se referă la condițiile meteorologice, sau că a lua pisica la apă nu se referă la hidratarea unei pisici. Expresiile idiomatice se află la intersecția dintre cunoștințele culturale, inferența contextuală și recunoașterea modelelor — iar acea intersecție pare să necesite un prag de capacitate a modelului pe care modelele mai mici nu îl ating în mod constant.
Ce nu susțin: că modelele mai mari sunt întotdeauna traducători mai buni. Nu am dovezi pentru asta ca regulă generală. Ceea ce observ eu: că pentru conținut idiomatic în mod specific, decalajul versiunilor în cadrul familiei a fost mai mare decât mă așteptam.
Majoritatea utilizatorilor care folosesc un instrument de traducere AI nu știu ce versiune a acelui AI folosesc. Deschid un produs, selectează o pereche de limbi și obțin un rezultat. Rutarea modelului este invizibilă pentru ei.
Acest lucru contează la scară. MachineTranslation.com a procesat peste sute de mii de traduceri din engleză în spaniolă într-o singură perioadă de 90 de zile. Dacă o porțiune semnificativă dintre acele locuri de muncă atingea conținut idiomatic (copywriting de marketing, limbaj juridic, text literar, comunicare informală) și instrumentul care direcționa acele locuri de muncă trimitea utilizatorii către un model mai mic fără știrea lor, atunci „a duce pisica la apă” apărea în rezultate reale, în documente reale, pentru oameni reali care aveau încredere în rezultat.
Industria de traduceri a petrecut ani de zile comparând furnizorii de AI. DeepL versus Google. Claude versus ChatGPT. Acele comparații sunt utile. Dar în cadrul unui singur furnizor, decalajul de versiune poate fi la fel de semnificativ — și este un decalaj pe care majoritatea cadrelor de comparație nu îl măsoară, deoarece nu testează la nivelul versiunii modelului. Când cineva spune „Folosesc ChatGPT pentru traducere”, acea propoziție nu este suficient
de specifică pentru a fi relevantă. Ce ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Răspunsul modifică ieșirea în moduri care nu sunt triviale, cel puțin pentru conținutul idiomatic.
Aceasta este partea pe care o găsesc cea mai interesantă și încă nu am înțeles pe deplin ce să fac cu ea.
Cele trei modele care au produs traduceri idiomatice au oferit trei traduceri diferite:
Toate cele trei sunt redări englezești apărabile ale expresiei llevarse el gato al agua. Dar nu sunt echivalente.
A reuși pune accent pe execuție în fața dificultății, ai făcut ceva greu și a funcționat. A-și obține ce vreasubliniază rezultatul dorit, cu mai puțin accent pe dificultate. „A ieși învingător” subliniază victoria competitivă, câștigul în raport cu ceilalți.
Idiomul spaniol original este cel mai apropiat de prima dintre acestea. Expresia implică depășirea rezistenței, nu pur și simplu preferința pentru un rezultat și materializarea acestuia. Dar „a-și vedea de treabă” și „a ieși învingător” nu sunt greșite, sunt doar imprecise în direcții diferite. Acest lucru ridică o întrebare pe care o găsesc cu adevărat dificilă: atunci când trei modele
produc fiecare o traducere idiomatică corectă, dar distinctă, cum evaluezi care este cea mai bună? Scorurile BLEU sunt comparate cu o traducere de referință — dar cine a scris referința și pe care dintre acestea trei ar fi ales-o?
Agentul nostru de traducere AI, spre lauda sa, a pus întrebarea potrivită înainte de a se angaja la orice ieșire: Care este sensul intenționat al expresiei „a duce pisica la apă” în acest context? Au fost oferite trei opțiuni — să atingi un obiectiv dificil, să iei ceva inutil sau să te angajezi într-o activitate riscantă. Acea întrebare nu este decorativă. Este mecanismul prin care ambiguitatea contextuală este rezolvată înainte ca traducerea să fie finalizată.
Dar ideea rămâne: trei răspunsuri corecte, trei nuanțe diferite de sens. Instrumentele de evaluare a traducerilor nu sunt construite pentru acest gen de nuanță.
Vreau să fiu sincer cu privire la limitele a ceea ce arată acest test.
O expresie idiomatică, o pereche de limbi, o zi de testare internă. Aceasta nu este un studiu. Este o observație. Nu știu dacă acest model (modelele mai mici implicit literale, modelele mai mari idiomatice) se menține constant în alte expresii idiomatice spaniole
De asemenea, nu știu dacă aceasta este o proprietate stabilă a acestor modele sau ceva ce se schimbă odată cu actualizările și ajustările fine. Furnizorii de modele nu publică jurnale de modificări specifice traducerii. O versiune a modelului care gestionează corect llevarse el gato al agua astăzi ar putea fi actualizată luna viitoare și nu am avea cum să știm.
Ce știu: acest test a produs un rezultat suficient de interesant încât vreau să rulez mai multe, mai sistematic, pe mai multe perechi de limbi și tipuri de conținut. Când voi avea mai multe de împărtășit, o voi face.
Voi încheia cu cele două întrebări pe care acest test mi le-a lăsat. Nu am să le răspund, nu am încă datele necesare pentru asta. Dar cred că acestea sunt întrebările potrivite de pus.
În primul rând: la ce prag de parametri devine fiabilă competența idiomatică ?
Saltul de la GPT-4o-MINI și GPT-4.1-NANO (ambele literale) la GPT-4.1-MINI (idiomatic) sugerează că există un prag undeva în intervalul de parametri dintre acele dimensiuni de modele unde recunoașterea idiomatică se activează. Este consecvent? Se aplică la idiome din toate limbile, sau depinde de cât de bine reprezentată este o limbă în datele de antrenament? Nu știu. Dar cunoașterea ar fi utilă oricui construiește fluxuri de lucru de traducere.
În al doilea rând: cât îi costă utilizatorii opacitatea versiunii modelului la scară largă?
Dacă un utilizator direcționează 1.000 de documente pe lună printr-un instrument care nu dezvăluie ce versiune a modelului este utilizată (și unele dintre acele documente conțin conținut idiomatic), cât de des se întâmplă eșecul literal invizibil? Cum ar ști ei? Care este costul, în termeni reali, al faptului de a nu afla niciodată?
Cred că aceasta este o întrebare mai importantă decât majoritatea comparațiilor de tipul „care inteligență artificială este cea mai bună pentru traducere” care circulă în prezent. Răspunsul nu este „folosește cel mai mare model.” Răspunsul ar putea fi: știi ce folosești, rulează-ți propriile teste pe propriul conținut și nu presupune că numele unui furnizor este o garanție a unui comportament consecvent în gama lor de modele .
Asta, cel puțin, este ceea ce rețin din acest test.
Pe baza acestui singur test: modelele mai mici, optimizate pentru eficiență din aceeași familie AI au implicit traducerea literală a unui idiom spaniol bine stabilit, în timp ce versiunile mai mari/mai noi ale aceluiași model au produs redări idiomatice corecte. Dacă acest lucru se aplică categoriilor de idiome și perechilor lingvistice este următoarea întrebare. Voi rula mai multe teste.
GPT-4.1-MINI, GPT-5.4-MINI și GPT-5.4 au tradus idiomaticllevarse el gato al agua — dar în expresii englezești diferite, cu conotații subtil diferite. Acest lucru sugerează că calitatea traducerii idiomatice are cel puțin două dimensiuni: dacă modelul recunoaște idiomul în sine și ce expresie echivalentă selectează dintre opțiunile disponibile în limba țintă. Metricile standard de calitate a traducerii nu separă clar aceste două dimensiuni. Cred că ar trebui.
Această postare se bazează pe testarea internă pe platforma de dezvoltare a MachineTranslation.com. Testarea multi-model prezentată aici nu este încă disponibilă publicului. Împărtășesc descoperirea deoarece cred că observația este utilă indiferent de locul unde efectuați traducerile.