July 10, 2026
Două cuvinte. Șase modele. Trei decizii de traducere diferite. Iată ce s-a întâmplat când am rulat 8 propoziții de test prin cele mai recente modele de inteligență artificială disponibile pe MachineTranslation.com, și ce dezvăluie de fapt rezultatele despre momentul în care un model eșuează în tăcere.
Două cuvinte. Asta e grozavă. Șase modele. Trei decizii de traducere distincte.
În limba japoneză, un model a redus-o ca それはやばい, păstrând ambiguitatea. Altul a omis pronumele subiect în întregime și a scris forma simplă やばい, versiunea cea mai colocvială posibilă. Un al treilea a scris それはすごい, ceea ce rezolvă ambiguitatea în întregime în favoarea „uimitor", eliminând dubla semnificație care făcea fraza interesantă la început. În vietnamita, un model a scris Đỉnh vậy (argou, corect pentru registrul tineretului). Un altul a scris Thật tuyệt vời, gramatical corect, dar mai apropiat de a spune "asta e cu adevărat minunat" când cineva îți trimite un meme.
Toate acestea sunt apărabile. Nici unul dintre ele nu este același lucru. Și dacă rulezi traduceri printr-un singur model, nu vei vedea niciodată alegerea care a fost făcută în numele tău.
Aceasta este întrebarea centrală pe care acest articol încearcă să o răspundă. Nu care model de IA este cel mai bun pentru traducere în 2026 (răspunsul depinde de perechea de limbi, registru, domeniu și structura propoziției), ci mai degrabă: cum ai ști când modelul tău a luat decizia greșită? Mai ales în domenii precum terminologia medicală, contractele juridice sau formalitatea profesională, unde decizia greșită arată exact ca o traducere corectă până când o citește un specialist.
Iată ce am făcut. Am rulat 8 propoziții de test prin două runde de modele pe MachineTranslation.com: mai întâi o bază de referință cu 5 modele utilizate pe scară largă, apoi un set extins care adaugă mai multe dintre cele mai noi variante de modele din categoria premium disponibile acum pentru utilizatorii plătitori. De obicei, compararea rezultatelor din modele precum aceasta ar însemna abonamente plătite separate la fiecare furnizor individual. Pe MachineTranslation.com, ei se află în aceeași vizualizare de comparație. Perechile de limbi erau engleza→japoneză și engleza→vietnameză. Categoriile de propoziții au fost alese în mod specific pentru a testa zonele în care dezacordul modelului este cel mai consecvent: expresii idiomatice, terminologie juridică, terminologie medicală, context sensibil la formalitate și ambiguitate semantică deliberată.
O notă privind metodologia de evaluare: cercetarea în traducerea automată s-a confruntat de mult timp cu cum să evalueze automat rezultatele. Metrici precum BLEU și COMET măsurate în sarcinile partajate WMT oferă un semnal agregat util, dar sunt slabe în detectarea erorilor de registru, eșecurilor idiomatice și preciziei terminologice, exact categoriile care sunt cele mai importante aici. Ceea ce urmează să citiți este o analiză a rezultatelor, nu o cursă BLEU.

Nu fiecare propoziție evidențiază un dezacord semnificativ. Două dintre cele opt teste, "Let's touch base once the dust settles on this deal" (→ Japoneză) și "We're burning the midnight oil to hit this launch date" (→ Vietnameză), au produs un acord ridicat în ambele runde. Idiomurile au fost înțelese corect ca idiomuri. Nimeni nu a tradus "touch base" ca atingând o bază fizică. Nimeni nu a tradus "the dust settles" ca sediment care cade.
Merită să ne oprim asupra acestui lucru: limbajul idiomativ englezesc al afacerilor este tratate în mod rezonabil de modelele de frontieră actuale atunci când idiomul este suficient de comun. Consensul pentru "touch base" a rămas stabil în ambele runde; variația a fost pur stilistică, în jurul alegerii între この件 (această problemă), この取引 (acest acord), sau この案件 (acest caz) pentru fraza sursă.

Testul „arderea uleiului de la miezul nopții" este acolo unde lucrurile au devenit mai interesante. Fiecare model, cu excepția unuia, a înțeles corect idiomul. MiniMax M2.7, introdus în Runda 2, a tradus literal "burning", producând đốt đuốc, cu sensul de "torțe în flăcări." Consensul l-a exclus corect.

Limba japoneză este o limbă stratificată din punct de vedere al formalității. Alegerea terminației verbale, pronumelui și formei numelui referențial nu este stilistică. Semnalează relația dintre vorbitor și destinatar. A trimite un mesaj directorului general folosind forme verbale informale nu este o eroare de traducere în sens gramatical. Este o eroare socială, și una semnificativă.
Poți să-mi trimiți asta? Mulțumesc, apreciez asta." Context: mesajul unui CEO.

Consensul s-a schimbat când池 de modele s-a extins. Mecanismul este simplu: adăugarea de modele care citesc corect contextul formalității a schimbat majoritatea, iar consensul a urmat. Iată spectrul complet al ceea ce au produs modelele în Runda 2:

Testul de registru vietnamez a evidențiat un alt tip de eroare de formalitate, una mai subtilă. Propoziția sursă: Hei, o întrebare rapidă — ești liber să suni? Context: mesaj către un client. Qwen în Runda 1 a inclus "mình," un pronume de persoană întâi care implică o prietenie casual la nivel de egal. Fiecare alt model a evitat complet referința la persoana întâi, ceea ce este alegerea profesională mai sigură. Cu o importanță deosebită, Qwen a corectat aceasta în Runda 2 și a eliminat "mình." Consensul din ambele runde a exclus-o.

Propoziția de indemizare vendor/client este o clauză standard în acordurile comerciale: "**Furnizorul va despăgubi clientul împotriva oricăror revendicări ale terților care rezultă din încălcarea acestui acord."
În Runda 1, toate cele cinci modele au identificat corect registrul juridic și au folosit împrumuturile ベンダー (furnizor) și クライアント (client), standard în contractele comerciale japoneze de origine engleză. O excepție: GPT-4.1-NANO a folosit 販売者 (seller) și 顧客 (customer), cuvinte japoneze legitime care nu au specificitatea juridică formală a echivalentelor de împrumut lingvistic.
Descoperirea mai importantă a apărut în Runda 2. Distincția cheie este între două cuvinte:
Acestea sunt concepte diferite din punct de vedere legal. „Indemnify" înseamnă în mod specific să protejezi o parte de răspunderea față de terți. 免責 este termenul juridic corect. Toate modelele din Runda 1 au folosit 補償. În Runda 2, DeepSeek V4-Pro a fost singurul model care a produs 免責, și a făcut-o doar în Runda 2, nu în Runda 1.

Într-un contract, 補償 și 免責 nu sunt sinonime. Unu înseamnă "vă vom rambursa." Celălalt înseamnă "ești protejat de pretenție chiar de la început." Dacă o platformă de traducere folosește 補償 unde 免責 este corect, un avocat care citește versiunea în limba japoneză nu va vedea același acord pe care îl descrie versiunea în limba engleză.
Aceasta este cea mai importantă descoperire din set de date. Propoziția de test: "Acest medicament este contraindication la pacienții cu antecedente de insuficiență hepatică." Sursă: documentație de produs clinic. Țintă: Vietnamez.
Termenul critic este "insuficiență hepatică." Există doi candidați vietnamezi:
Acestea sunt distinct din punct de vedere clinic. O avertisment de contraindicație bazat pe "insuficiență hepatică" se aplică oricărei persoane cu funcție hepatică redusă, nu doar celor care au suferit eșec complet al organului. Utilizarea suy gan restrânge incorect populația indicată. Un pacient cu afectare hepatică moderată care citește suy gan ar putea să nu se recunoască ca fiind partea contraindică a populației.

Unele propoziții sursă sunt ambigue prin design. „Asta-i bolnav" în argoul englez contemporan înseamnă ceva excelent, dar păstrează și sensul literal (adică ceva dezgustător/respingător), iar tensiunea dintre aceste două sensuri face parte din modul în care fraza comunică. Provocarea pentru un model de traducere este: păstrezi ambiguitatea, o reduci la sensul cel mai probabil, sau alegi una și te angajezi?


Modelele din acest test nu sunt toate echivalente. Ei acoperă arhitecturi diferite, regimuri de antrenament și contexte de implementare. Linia de bază din Runda 1 include modele care sunt ușor accesibile. Grupul extins din Runda 2 adaugă mai multe dintre cele mai noi variante de modele de nivel premium acum disponibile pentru utilizatorii plătitori pe MachineTranslation.com, același nivel de model care ar însemna altfel un cont plătit separat cu fiecare furnizor individual.

Grupul extins din Runda 2 include modele care sunt mai avansate și disponibile pentru utilizatorii plătitori pe MachineTranslation.com. Efectul extinderii bazinului nu este uniform. În unele teste (formalitate/japoneză), a schimbat consensul în mod semnificativ. La alții (terminologie medicală/vietnameza), diviziunea s-a aprofundat.

Datele de test indică două categorii distincte de eșec și necesită răspunsuri diferite.
Categoria A: Eșecuri silențioase. Erori de formalitate, erori de registru, precizie în terminologia medicală: acestea produc rezultate care par corecte. Limba japoneză este gramaticală. Vietnamezul este fluent. Nu există niciun semnal la suprafață că ceva a mers prost. Un utilizator monolingv citind rezultatul unui singur model nu are nicio modalitate de a ști că modelul a făcut o alegere de registru pe care o ar observa un executiv senior japonez, sau că un termen clinic a fost restrâns într-un mod care schimbă populația căreia i se aplică.
Categoria B: Eșecuri vizibile. MiniMax traducând "burning the midnight oil" ca "burning torches." GPT-4.1-NANO rezolvând "That's sick" la "すごい" neambiguu. Acestea sunt detectabile, fie de către un vorbitor al limbii țintă, fie prin comparație cu alte rezultate ale modelului.
Comparația multi-model pe care o oferă SMART este cea mai valoroasă în Categoria A. Când cinci sau zece modele produc rezultate și majoritatea sunt de acord cu privire la un registru formal, în timp ce unul produce japoneză simplă și casual, dezacordul este vizibil în vizualizarea de comparație. Un utilizator care vorbește limba țintă poate evalua opțiunile. Un utilizator care nu poate vedea că o decizie contestată a fost luată, și poate decide dacă acea propoziție justifică o revizuire umană.
Pentru lucrul la nivel de document, fișiere mari, traducerea care păstrează aspectul PDF-urilor, contractelor sau materialelor clinice, capacitatea de procesare a documentelor a platformei gestionează structura fișierelor fără a rupe formatarea. Dar întrebările privind calitatea ridicate mai sus se aplică indiferent de dimensiunea fișierului. Un studiu clinic de 100 de pagini în care fiecare instanță de "hepatic impairment" este tradusă ca "liver failure" este o versiune mai mare a aceleiași probleme identificate în Testul 2.
Pentru categoriile medicale și juridice în special, verificarea umană este mecanismul corect de control. Serviciul de Post-Editare AI al Tomedes, care asociază rezultatul AI cu revizuirea umană certificată pentru exact acest tip de conținut cu mize mari, este construit pentru aceasta. Împărțirea suy gan / suy giảm chức năng gan este exact genul de constatare care ar trebui să declanșeze această revizuire, nu pentru că toate modelele sunt greșite, ci pentru că modelele care sunt cele mai sigure nu sunt cele mai precise.
Valoarea de a vedea mai multe rezultate nu este că vei alege întotdeauna majoritatea. Este că vei ști că a fost făcută o alegere, ceea ce este diferit de a presupune că rezultatul din fața ta este corect.

Pune cele opt teste una lângă alta și un model se menține: acordul și dezacordul nu sunt distribuite aleatoriu. Limbajul idiomativ și cotidian din afaceri ("a lua legătura", "a lucra până noaptea târziu") a conversat în aproape fiecare model din grup, în ambele runde. Formalitatea, precizia juridică și terminologia medicală nu au. Testul de formalitate al CEO-ului s-a schimbat de la casual la formal doar o singură dată când a fost inclusă池 extinsă. Clauza de despăgubire a scos la iveală o adevărată distincție juridică (免責 vs. 補償) pe care doar un model, într-o singură rundă, a înțeles-o corect. Terminologia medicală nu s-a rezolvat niciodată, rămânând la aproximativ 6 la 4 în ambele runde, indiferent de care modele erau în grup.
Aceasta este constatarea reală, nu o afirmație de marketing: consensul nu face mai bună fiecare propoziție și nici nu trebuie să o facă. Este cel mai valoros exact acolo unde fluența unui singur model nu-ți dă niciun motiv să o pui la îndoială, și acolo unde a greși costă cu adevărat ceva.
Există un al doilea strat, mai practic, al acestui test care merită enunțat clar. Efectuarea acestei comparații personal a însemnat verificarea rezultatelor din GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo și MiniMax M2.7 unul lângă altul cu modelele de bază existente, într-un singur loc, pe o singură platformă. În afara MachineTranslation.com, aceasta nu este o singură abonare. Sunt mai multe, una pentru fiecare furnizor al cărui nivel premium dorești să-l testezi, la orice preț percepe individual fiecare furnizor. Utilizatorii plătiți de aici obțin aceeași comparație într-un singur clic, la o fracțiune din costul menținerii a cinci abonamente premium separate, fără a renunța la ceea ce contează cu adevărat: a vedea unde sunt de acord modelele și a știi exact când nu sunt.
Niciunul nu este categoric mai bun; depinde de categoria de test. Claude Sonnet și Claude Opus au ales în mod constant termenul medical vietnamez mai precis, iar Claude Opus a produs argoul cel mai potrivit pentru "That's sick." Dar Claude Sonnet a produs și japoneză casual într-o propoziție în context formal de CEO, unde GPT-5.5 a înțeles corect. Compararea directă a rezultatelor este mai defensabilă decât alegerea unui model și încrederea în acesta.
Nu există unul; acuratețea depinde de domeniu. Gemini 3.5-Flash și GLM-5-Turbo au produs cel mai potrivit japonez formal în acest test. Ambele modele Claude au fost cel mai precise pe terminologia medicală vietnameză. DeepSeek V4-Pro a fost singurul model care a folosit termenul juridic japonez corect, dar doar în Runda 2, și a produs japoneză casual în alte locuri. Niciun model nu a dominat în toate cele opt teste.
Nu, nu în mod automat. Extinderea grupului cu variante de model de nivel premium mai noi a deplasat consensul de la casual la formal în testul de formalitate japoneză. Dar în testul de terminologie medicală vietnameză, diviziunea a persistat la aproximativ 6 la 4, indiferent de care modele au fost incluse. Mai multe modele evidențiază mai mult dezacord, care este un semnal util, dar consensul urmează în continuare majoritatea, iar majoritatea nu este întotdeauna răspunsul cel mai precis.
SMART este sistemul de consens multi-model al MachineTranslation.com, care se extinde pe până la 22 modele de IA de la furnizori inclusiv OpenAI, Anthropic, Google și DeepSeek. Rulează o traducere prin mai multe modele simultan și afișează rezultatul consensului majorității alături de răspunsul fiecărui model individual, implicit, fără a fi necesară nicio configurare. Consensul se schimbă atunci când池ul de modele se schimbă, așa cum se arată în rezultatul formalității japoneze din acest test: un consens casual din Runda 1 a devenit formal în Runda 2.
Niciun model unic; răspunsul mai bun este revizuirea umană. Modelele Claude au ales în mod consistent termenul medical vietnamez mai precis, iar DeepSeek V4-Pro a folosit singur termenul juridic japonez corect, dar doar în Runda 2. Terminologia medicală divizată nu s-a rezolvat niciodată în 10 modele, ceea ce semnalează că este necesară expertiza în domeniu, nu că ar trebui aleasă un alt model. O revizuire certificată de post-editare umană, așa cum oferă Tomedes, oferă acea verificare specializată.