July 10, 2026
Dvije riječi. Šest modela. Tri različita prevodilačka odluka. Evo šta se desilo kada sam pokrenuo 8 test rečenica kroz najnovije AI modele dostupne na MachineTranslation.com, i šta izlazi zapravo otkrivaju o tome kada model tiho ne uspe.
Dve reči. To je bolešno. Šest modela. Tri različita prijevodna rješenja.
Na japanskom jeziku, jedan model ga je prikazao kao それはやばい, čuvajući dvosmislenost. Jedan je potpuno izbacio subjektnu zamjenicu i napisao golim oblikom やばい, najkolokvijalniju verziju moguću. Treći je napisao それはすごい, što u potpunosti razrješava dvosmislenost u korist "nevjerovatno," uklanjajući dvostruko značenje koje je činilo frazu zanimljivom na prvom mjestu. U Vietnamese jeziku, jedan model je napisao Đỉnh vậy (sleng, ispravno za omladinski registar). Drugi je napisao Zaista je nevjerovatno, gramatički ispravan, ali bliži tome što znači "to je zaista čudesno" kada vam neko pošalje meme poruku.
Svi ovi primjeri su branljivi. Nijedan od njih nije ista stvar. I ako prevodite kroz jedan model, nikada nećete vidjeti izbor koji je napravljen u vaše ime.
To je centralno pitanje na koje ovaj članak pokušava odgovoriti. Nije koje je AI model najbolji za prevod 2026. godine (odgovor zavisi od jezika, registra, domene i strukture rečenice), već: kako biste znali kada je vaš model pogriješio? Posebno u domenama kao što su medicinska terminologija, pravni ugovori ili profesionalna formalnost, gdje pogrešan izbor izgleda točno kao ispravan prevod sve dok ga ne pročita stručnjak.
Evo što sam ja učinio. Prosledio sam 8 test rečenica kroz dva kruga modela na MachineTranslation.com: prvo baznu liniju od 5 široko korišćenih modela, zatim prošireni skup koji dodaje nekoliko najnovijih varijanti modela premium-tier koje su sada dostupne korisnicima koji plaćaju. Obično bi poređenje rezultata modela kao što je ovaj značilo odvojene plaćene pretplate kod svakog pružaoca usluga posebno. Na MachineTranslation.com-u, oni se nalaze u istoj pogledu za poređenje. Jezični parovi su bili engleski→japanski i engleski→vijetnamski. Kategorije rečenica su odabrane specifično da testiraju područja gdje je neslaganje modela najznačajnije: idiomatske fraze, pravnu terminologiju, medicinsku terminologiju, kontekst osjetljiv na formalnost i namjerno semantičku dvosmislenost.
Napomena o metodologiji evaluacije: istraživanje mašinskog prevođenja dugo se bori sa time kako automatski oceniti izlaze. Metrike poput BLEU-a i COMET-a kako se mjere u WMT zajedničkim zadacima daju koristan agregirani signal, ali su loše u otkrivanju grešaka registra, neuspjeha idioma i terminološke preciznosti, upravo kategorije koje su ovdje najvažnije. Ono što ćete pročitati je analiza rezultata, a ne BLEU trka.

Nije svaka rečenica površina značajnog neusklađivanja. Dva od osam testova, "Hajde da se čujemo kada se prašina slegne oko ovog dogovora" (→ japanski) i "Radimo dan i noć da bismo dostigli ovaj rok lansiranja" (→ vijetnamski), proizveli su visok stepen slaganja u oba kruga. Idiomi su bili ispravno razumljeni kao idiomi. Niko nije preveo "touch base" kao dodiranje fizičke baze. Niko nije preveo "the dust settles" kao sediment koji pada.
Ovo je vrijedno da se zaustavimo: idiomatski engleski poslovni jezik je razumno dobro obrađen od strane trenutnih frontier modela kada je idiom dovoljno čest. Konsenzus za "touch base" ostao je stabilan kroz oba kruga; varijacija je bila čisto stilska, oko toga da li koristiti この件 (ova stvar), この取引 (ovaj posao), ili この案件 (ovaj slučaj) za izvornu frazu.

Test "paljenja ulja do kasno u noć" je tamo gdje su stvari postale zanimljivije. Svaki model osim jednog je pravilno razumio idiom. MiniMax M2.7, predstavljen u Rundi 2, doslovno preveden kao "paljenje", proizvodeći đốt đuốc, što znači "paljenje baklje." Konsenzus je to pravilno isključio.

Japanski je jezik sa slojevima formalnosti. Izbor glagolskog nastavka, zamjenice i referencijalnog oblika imenice nije stilistički. Označava odnos između govornika i primatelja. Slanje poruke vašem izvršnom direktoru koristeći neformalne oblike glagola nije greška u prevodu u gramatičkom smislu. To je društvena greška, i značajna je.
Možeš li to poslati? Hvala, cijenim to." Kontekst: Slanje poruke izvršnom direktoru.

Konsenzus se promenio kada se bazen modela proširio. Mehanizam je jednostavan: dodavanje modela koji su pravilno čitali kontekst formalnosti pomaknulo je većinu, a konsenzus je uslijedio. Evo je potpunog spektra onoga što su modeli proizveli u Rundi 2:

Vijetnamski test registra je otkrio drugačiju vrstu greške u formalnosti, onu koja je suptilnija. Izvorna rečenica: Hej, brzo pitanje — jesi li slobodan/slobodna da se javimo na poziv? Kontekst: slanje poruke klijentu. Qwen u prvoj rundi je uključio "mình," zamjenicu prvog lica koja implicira neformalan odnos na razini vršnjaka. Svi ostali modeli su potpuno izbjegavali samopreferencu u prvom licu, što je sigurniji profesionalni izbor. Ključno, Qwen je to ispravila u Rundi 2 i izbacila "mình." Konsenzus u oba kruga je isključio.

Rečenica o odštetama između prodavca/klijenta je standardna klauzula u komercijalnim ugovorima: "Prodavač će nadoknaditi klijenta za sve zahtjeve trećih strana koji proizlaze iz kršenja ovog ugovora."
U Rundi 1, svih pet modela je ispravno prepoznalo pravni registar i koristilo posuđenice ベンダー (dobavljač) i クライアント (klijent), standardne u japanskim komercijalnim ugovorima engleskog porijekla. Jedna iznimka: GPT-4.1-NANO je koristio 販売者 (prodavač) i 顧客 (kupac), legitimne japanske riječi koje nemaju formalnu pravnu specifičnost ekvivalenata pozajmljenica.
Važnije otkriće se pojavilo u Rundi 2. Ključna razlika je između dvije riječi:
Ovo su pravno različiti koncepti. "Indemnify" specifično znači zaštititi stranu od odgovornosti prema trećim licima. Oslobođenje od odgovornosti je ispravan pravni termin. Svi modeli iz 1. runde koristili su 補償. U drugoj rundi, DeepSeek V4-Pro je bio jedini model koji je proizveo 免責, i to je učinio samo u drugoj rundi, ne u prvoj rundi.

U ugovoru, 補償 i 免責 nisu sinonimi. Jedan znači "mi ćemo vam nadoknaditi." Drugi znači "od početka ste zaštićeni od tužbe." Ako platforma za prevod koristi 補償 gde je 免責 ispravno, advokat koji čita japansku verziju neće videti isti ugovor koji opisuje engleska verzija.
Ovo je najznačajnije otkriće u skupu podataka. Testna rečenica: "Ovaj lijek je kontraindikovan kod pacijenata sa istorijom oštećenja jetre." Izvor: klinička dokumentacija proizvoda. Cilj: Vijetnamski.
Kritičan termin je "oštećenje jetre." Postoji dva vijetnamska kandidata:
Ova su klinički različita. Upozorenje o kontraindikaciji na osnovu "oštećenja jetre" primjenjuje se na sve osobe sa smanjena funkcijom jetre, ne samo na one koje su doživjele potpuno zatajenje organa. Korišćenje suy gan pogrešno sužava navedenu populaciju. Pacijent sa umjerenim oštećenjem jetre koji čita suy gan možda se neće prepoznati kao kontraindicirano stanovništvo.

Neke izvorne rečenice su namerno dvosmislene. "To je bolesno" u savremenom engleskom slengu znači nešto odličko, ali zadržava i svoje doslovno značenje (odnosno, nešto što je odvratno/gadno), i napetost između ta dva značenja je dio kako fraza komunicira. Izazov za model prijevoda je: da li čuvate dvosmislenost, svodite je na najvjerovatnije značenje, ili birate jedno i obavezujete se?


Modeli u ovom testu nisu svi ekvivalentni. Oni obuhvataju različite arhitekture, režime obuke i kontekste primjene. Osnovna linija 1. kola uključuje modele koji su široko dostupni. Prošireni bazen u Rundi 2 dodaje nekoliko najnovijih varijanti modela premium-nivoa sada dostupnih plaćajućim korisnicima na MachineTranslation.com, isti nivo modela koji bi inače značio odvojen plaćeni račun sa svakim pojedinačnim pružaocem.

Prošireni bazen u Rundi 2 uključuje modele koji su napredniji i dostupni plaćajućim korisnicima na MachineTranslation.com. Učinak proširenja bazena nije ujednačen. U nekim testovima (formalnost/japanski), to je značajno promenilo konsenzus. U ostalima (medicinska terminologija/vijetnamski), podjela se produbila.

Testni podaci pokazuju na dvije različite kategorije neuspjeha, i one zahtijevaju različite odgovore.
Kategorija A: Tiha neuspjeha. Greške u formalnosti, greške u registru, preciznost medicinske terminologije: ove stvari proizvode izlaze koji izgledaju ispravno. Japanski je gramatičan. Vijetnamac je tečan. Nema nikakve vanjske indicije da je nešto pošlo po zlu. Monolingvalni korisnik koji čita izlaz jednog modela nema načina da zna da je model napravio izbor registra koji bi primijetio viši japanski izvršni direktor, ili da je klinički termin sužen na način koji mijenja populaciju na koju se primjenjuje.
Kategorija B: Vidljivi neuspjesi. MiniMax prevodi "burning the midnight oil" kao "paljenje baklji." GPT-4.1-NANO rješava "To je bolešno" na nedvosmisleno "すごい." Ova su vidljiva, bilo od strane govornika ciljnog jezika ili poređenjem sa drugim izlazima modela.
Poređenje više modela koje pruža SMART je najvrjednije u Kategoriji A. Kada pet ili deset modela proizvede izlaze i većina se slaže na formalnom registru dok jedan proizvodi neformalni oblik japanskog, nesuglasica je vidljiva u prikazu poređenja. **Korisnik koji govori ciljni jezik može procijeniti opcije.** Korisnik koji ne može vidjeti da je donesena osporavana odluka, može odlučiti da li ta presuda opravdava ljudsku provjeru.
Za rad na razini dokumenta, velike datoteke, prijevod PDFa koji čuva izgled, ugovore ili kliničke materijale, mogućnost obrade dokumenata platforme rukuje strukturom datoteke bez narušavanja formatiranja. Ali pitanja kvalitete koja su gore navedena primjenjuju se bez obzira na veličinu datoteke. Klinička studija od 100 stranica gdje je svaki primjer "hepatske insuficijencije" preveden kao "zatajenje jetre" je veća verzija istog problema identificiranog u Testu 2.
Za medicinske i pravne kategorije specifično, ljudska verifikacija je ispravan zaustavljač. Tomedes' AI usluga post-uređivanja, koja kombinuje AI rezultat sa sertifikovanom ljudskom revizijom upravo za ovu vrstu sadržaja visokog rizika, je izgrađena za ovo. Podjela suy gan / suy giảm chức năng gan je upravo onakva vrsta nalaza koja bi trebala pokrenuti taj pregled, ne zato što su svi modeli pogrešni, već zato što modeli koji su najsamouvereni nisu i najprecizniji.
Vrijednost viđanja više izlaza nije što ćete uvijek odabrati većinu. To je što ćeš znati da je izbor učinjen, što se razlikuje od pretpostavke da je rezultat pred tobom ispravan.

Postavi osam testova jedan pored drugog i obrazac se održava: slaganje i neslaganje nisu nasumično distribuirani. Idiomatski, svakodnevni poslovni jezik ("uspostaviti kontakt," "raditi do kasno u noć") konvergirao je kod gotovo svakog modela u skupu, u oba kruga. Formalnost, pravna preciznost i medicinska terminologija nisu. Test CEO-formalnosti se promenio sa neformalno na formalno samo kada je uključen prošireni skup. Klauzula o naknadi štete je otkrila pravu pravnu razliku (免責 vs. 補償) koju je samo jedan model, u jednoj rundi, pravilno razumio. Medicinska terminologija se nikada nije u potpunosti razriješila, ostajući na otprilike 6 prema 4 u oba kruga bez obzira koji su modeli bili u skupu.
To je stvarni nalaz, a ne marketinška tvrdnja: konsenzus ne čini svaku rečenicu boljom, i ne mora. Najprecijenije je upravo tamo gdje fluentnost jednog modela ne daje vam nikakav razlog da sumnjate u njega, i gdje greška zapravo nešto košta.
Postoji drugi, praktičniji sloj ovog testa koji je vrijedno jasno navesti. Pokretanje ovog poređenja samog po sebi značilo je provjeru izlaza iz GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo i MiniMax M2.7 jedan pored drugog s postojećim modelima bazeline, na jednom mjestu, na jednoj platformi. Izvan MachineTranslation.com, to nije jedna pretplata. To je nekoliko, jedan za svakog pružatelja čiji premium tier želite testirati, po cijeni koju svaki pružatelj pojedinačno naplaćuje. Plaćajući korisnici ovdje dobijaju istu usporedbu jednim klikom, za dio cijene održavanja pet odvojenih premium pretplata, bez odricanja od onoga što zaista važi: vidjeti gdje se modeli slažu, i znati točno kada se ne slažu.
Nijedan nije kategorički bolji; zavisi od kategorije testa. Claude Sonnet i Claude Opus su dosljedno birali precizniji vijetnamski medicinski termin, a Claude Opus je proizveo najprikladniju sleng za "To je bolesno." Ali Claude Sonnet je također proizveo neformalni japanski u formalnoj CEO-kontekstnoj rečenici, gdje je GPT-5.5 bio u pravu. Direktno poređenje izlaza je branljivije nego odabiranje jednog modela i vjerovanje u njega.
Nema jednog; točnost ovisi o domeni. Gemini 3.5-Flash i GLM-5-Turbo proizveli su najprikladniji formalni japanski u ovom testu. Oba Claude modela su bila najpreciznija na vijetnamskoj medicinskoj terminologiji. DeepSeek V4-Pro je bio jedini model koji je koristio ispravan japanski pravni termin, ali samo u Rundi 2, i proizvodio je neformalni japanski na drugim mjestima. Nijedan model nije dominirao u svih osam testova.
Ne, ne automatski. Proširenje bazena sa novijim varijantama modela premium-tier pomjerilo je konsenzus sa casual na formalno u japanskom testu formalnosti. Ali u testu vijetnamske medicinske terminologije, podjela je perzistirala na otprilike 6 prema 4 bez obzira na to koji su modeli bili uključeni. Više modela površina više nesuglasica, što je koristan signal, ali konsenzus i dalje slijedi većinu, a većina nije uvijek najprecizniji odgovor.
SMART je MachineTranslation.com-ov multi-model konsenzus sistem, koji obuhvata do 22 AI modela od pružatelja uključujući OpenAI, Anthropic, Google i DeepSeek. Pokreće prijevod kroz više modela istovremeno i prikazuje izlaz većinskog konsenzusa zajedno s odgovorom svakog pojedinog modela, prema zadanoj postavci, bez potrebe za konfiguracijom. Konsenzus se mijenja kada se bazen modela pomjeri, kao što je prikazano rezultatom japanske formalnosti ovog testa: neformalni konsenzus u Kolu 1 postao je formalan u Kolu 2.
Nema jedinstvenog modela; ljudski pregled je bolji odgovor. Claude modeli su dosljedno birali precizniji vijetnamski medicinski termin, a samo je DeepSeek V4-Pro koristio ispravan japanski pravni termin, ali samo u Rundi 2. Medicinska terminologija se nikada nije razriješila u 10 modela, što signalizira da je potrebna stručnjačka znanja iz domene, a ne da bi se trebao odabrati drugačiji model. A sertificiran ljudski pregled nakon uređivanja, kao što nudi Tomedes, pruža tu stručnjačku provjeru.