July 10, 2026
Dvije riječi. Šest modela. Tri različita prijevodna odluka. Evo što se dogodilo kada sam prosljeđio 8 test rečenica kroz najnovije AI modele dostupne na MachineTranslation.com, i što rezultati zapravo otkrivaju o tome kada model tiho ne uspije.
Dvije riječi. To je bolešno. Šest modela. Tri različita prijevodna rješenja.
U japanskom jeziku, jedan je model to prikazao kao それはやばい, čuvajući dvosmislenost. Jedan je potpuno izbacio subjektnu zamjenicu i napisao golu formu やばい, najkolokvijalnije moguću verziju. Treći je napisao それはすごい, što u potpunosti razrješava dvosmislenost u korist "nevjerojatno", uklanjajući dvostruko značenje koje je činilo frazu zanimljivom na početku. Na hrvatskom jeziku, jedan je model napisao Đỉnh vậy (sleng, ispravno za mladinski registar). Drugi je napisao Thật tuyệt vời, gramatički ispravan, ali bliži izjavi "to je zaista čudesno" kada ti netko pošalje meme poruku.
Svi ovi primjeri su branljivi. Nijedan od njih nije ista stvar. A ako prevodite kroz jedan model, nikada nećete vidjeti izbor koji je napravljen u vašem imenu.
To je centralno pitanje na koje ovaj članak pokušava odgovoriti. Nije koje je AI modela najbolja za prijevod 2026. godine (odgovor ovisi o jezičnom paru, registru, domeni i strukturi rečenice), već: kako biste znali kada je vaš model pogriješio? Posebno u domenama kao što su medicinska terminologija, pravni ugovori ili profesionalna formalnost, gdje pogrešan izbor izgleda točno kao ispravan prijevod dok ga ne pročita stručnjak.
Evo što sam ja učinio. Proslavio sam 8 test rečenica kroz dva kruga modela na MachineTranslation.com: prvo baznu liniju od 5 široko korištenih modela, zatim prošireni skup koji dodaje nekoliko najnovijih varijanti premium-tier modela sada dostupnih korisnicima koji plaćaju. Obično bi uspoređivanje rezultata modela kao što je ovaj značilo zasebne plaćene pretplate kod svakog pružatelja usluga posebno. Na MachineTranslation.com-u, nalazi se u istom prikazu usporedbe. Jezični parovi su bili engleski→japanski i engleski→vijetnamski. Kategorije rečenica odabrane su specifično kako bi se testirale oblasti gdje je nesuglasje modela najznačajnije: idiomatski izrazi, pravna terminologija, medicinska terminologija, kontekst osjetljiv na formalnost i namjerna semantička dvosmislenost.
Napomena o metodologiji evaluacije: istraživanje strojnog prijevoda dugo se bori s tim kako automatski bodovati izlaze. Metrike poput BLEU i COMET kako su mjerene u WMT zajedničkim zadacima daju koristan agregirani signal, ali su loše u otkrivanju grešaka registra, neuspjeha idiotizama i terminološke preciznosti, upravo kategorije koje su ovdje najvažnije. Ono što ćete sada čitati je analiza rezultata, a ne BLEU trka.

Nije svaka rečenica površina značajnog nesuglasja. Dva od osam testova, "Let's touch base once the dust settles on this deal" (→ japanski) i "We're burning the midnight oil to hit this launch date" (→ vijetnamski), proizveli su visoku suglasnost u oba kruga. Idiomi su pravilno razumljeni kao idiomi. Nitko nije preveo "touch base" kao dodirivanje fizičke baze. Nitko nije preveo "the dust settles" kao taloženje sedimenta.
Vrijedi se zadržati na tome: idiomatski engleski poslovni jezik je razumno dobro obrađen od strane trenutnih vrhunskih modela kada je idiom dovoljno čest. Konsenzus za "touch base" ostao je stabilan u oba kruga; varijacija je bila čisto stilska, oko toga treba li koristiti この件 (ova stvar), この取引 (ovaj posao), ili この案件 (ovaj slučaj) za izvornu frazu.

Test "rada do ponoći" ondje su stvari postale zanimljivije. Svaki model osim jednog je ispravno razumio idiom. MiniMax M2.7, predstavljen u Rundi 2, doslovno je preveo "burning", što je rezultiralo s đốt đuốc, što znači "gorući bakljama." Konsenzus je to ispravno isključio.

Japanski je jezik slojevit po formalnosti. Izbor glagolskog završetka, zamjenice i referencijalnog oblika imenice nije stilski. Signalizira odnos između govornika i primatelja. Slanje poruke vašem izvršnom direktoru koristeći nepristojna glagolska oblika nije greška u prijevodu u gramatičkom smislu. To je društvena greška, i značajna je.
Možeš li to poslati? Hvala, cijenim to." Kontekst: Poruka izvršnom direktoru.

Konsenzus se promijenio kada se bazin modela proširio. Mehanizam je jednostavan: dodavanje modela koji su pravilno čitali kontekst formalnosti pomaknulo je većinu, a konsenzus je uslijedio. Evo punog spektra onoga što su modeli proizveli u Krugu 2:

Vijetnamski test registra je otkrio drugačiju vrstu greške u formalnosti, onu koja je subtilnija. Izvorna rečenica: "Hej, brzo pitanje — slobodan li si za poziv?" Kontekst: slanje poruke klijentu. Qwen u 1. krugu je uključio "mình," zamjenicu prve osobe koja implicira neformalno prijateljstvo na razini vršnjaka. Svi ostali modeli su potpuno izbjegavali samoreferencu u prvom licu, što je sigurniji profesionalni izbor. Ključno je da je Qwen to ispravila u 2. krugu i izbacila "mình." Konsenzus u oba kruga ga je isključio.

Rečenica o naknadi štete između prodavatelja/klijenta je standardna klauzula u komercijalnim ugovorima: "**Prodavač će nadoknaditi klijenta od bilo kojih zahtjeva trećih strana koji proizlaze iz kršenja ovog ugovora.**"
U 1. krugu svih pet modela ispravno je prepoznalo pravni registar i koristilo posuđenice ベンダー (dobavljač) i クライアント (klijent), standardne u japanskim trgovačkim ugovorima engleskog podrijetla. Jedna iznimka: GPT-4.1-NANO koristio je 販売者 (prodavač) i 顧客 (kupac), legitimne japanske riječi koje nemaju formalnu pravnu specifičnost ekvivalenata posuđenica.
Važnije otkriće pojavilo se u Drugoj rundi. Ključna razlika je između dvije riječi:
Ovo su pravno različiti koncepti. "Indemnify" specifično znači zaštititi stranu od odgovornosti prema trećim stranama. 免責 je ispravan pravni termin. Svi modeli iz 1. kruga koristili su 補償. U Krugu 2, DeepSeek V4-Pro bio je jedini model koji je proizveo 免責, i to samo u Krugu 2, ne u Krugu 1.

U ugovoru, 補償 i 免責 nisu sinonimi. "Jedan" znači "nadoknaditi ćemo vam." Drugi znači "od početka ste zaštićeni od tužbe." Ako platforma za prijevod koristi 補償 gdje je 免責 ispravno, odvjetnik koji čita japansku verziju neće vidjeti isti ugovor koji engleski verzija opisuje.
Ovo je najznačajnije otkriće u skupu podataka. Testna rečenica: "Ovaj lijek je kontraindiciran u bolesnika s anamnezom oštećenja jetre." Izvor: klinička dokumentacija proizvoda. Cilj: Vijetnamski.
Kritičan termin je "oštećenje jetre." Postoje dva vijetnamska kandidata:
Ova su klinički različita. Upozorenje o kontraindikaciji na osnovu "oštećenja jetre" primjenjuje se na sve osobe sa smanjenom funkcijom jetre, a ne samo na one koje su doživjele potpuni kolaps organa. Korištenje suy gan pogrešno suzuje navedenu populaciju. Pacijent s umjerenim oštećenjem jetre koji čita "suy gan" možda se ne bi prepoznao kao kontraindicirano stanovništvo.

Neke izvorišne rečenice su namjerno nejasne. "To je bolestan" u suvremenom engleskom slengu znači nešto izvrsno, ali i dalje nosi i svoje doslovno značenje (to jest odvratno/grozno), a napetost između ta dva značenja dio je kako fraza komunicira. Izazov za model prijevoda je: čuvaš li dvosmislenost, svodiš je na najvjerovatnije značenje ili odabereš jedno i prihvatiš se toga?


Modeli u ovom testu nisu svi ekvivalentni. Oni obuhvaćaju različite arhitekture, režime treniranja i kontekste primjene. Osnovna linija Round 1 uključuje modele koji su široko dostupni. Prošireni bazen za 2. kolo dodaje nekoliko najnovijih varijanti modela premium-razreda sada dostupnih plaćajućim korisnicima na MachineTranslation.com, isti razred modela koji bi inače značio odvojeni plaćeni račun sa svakim pojedinim pružateljem usluga.

Prošireni bazen u 2. kolu uključuje modele koji su napredniji i dostupni plaćajućim korisnicima na MachineTranslation.com. Učinak proširenja bazena nije ujednačen. U nekim testovima (formalnost/japanski), to je značajno promijenilo konsenzus. U drugima (medicinska terminologija/vijetnamski), podjela se produbila.

Testni podaci pokazuju na dvije različite kategorije neuspjeha, a one zahtijevaju različite odgovore.
Kategorija A: Tiha neuspjeha. Greške u formalnosti, greške u registru, preciznost medicinske terminologije: ove stvari proizvode rezultate koji izgledaju ispravno. Japanski je gramatičan. Vijetnamac je tečan. Nema površinskog znaka da se nešto nije dogodilo. Jednojezični korisnik koji čita izlaz jednog modela nema način da zna da je model napravio izbor registra koji bi primijetio viši japanski izvršni direktor, ili da je klinički pojam sužen na način koji mijenja populaciju na koju se odnosi.
Kategorija B: Vidljivi neuspjesi. MiniMax prevodi "raditi do kasno u noć" kao "paliti baklje." GPT-4.1-NANO rješava "That's sick" u nedvosmisleno "すごい." Ova su vidljiva, bilo od strane govornika ciljnog jezika ili usporedbom s drugim izlazima modela.
Usporedba više modela koju pruža SMART najvrjednija je u kategoriji A. Kada pet ili deset modela proizvede izlaze i većina se slaže oko formalnog registra dok jedan proizvodi casual oblik japanskog, nesuglasje je vidljivo u prikazu usporedbe. Korisnik koji govori ciljni jezik može procijeniti opcije. Korisnik koji ne može vidjeti da je donesena osporavana odluka može odlučiti je li ta presuda vrijedna ljudskog pregleda.
Za rad na razini dokumenta, velike datoteke, prijevod PDFa koji čuva izgled, ugovore ili kliničke materijale, mogućnost obrade dokumenata platforme upravlja strukturom datoteke bez narušavanja formatiranja. Ali se pitanja kvalitete postavljena gore primjenjuju bez obzira na veličinu datoteke. Klinička studija od 100 stranica gdje je svaki primjer "hepatalne insuficijencije" preveden kao "zatajenje jetre" veća je verzija istog problema identificiranog u Testu 2.
Za medicinske i pravne kategorije specifično, ljudska provjera je ispravan zaštitni mehanizam. Tomedes' usluga AI naknadne obrade, koja kombinira AI izlaz s certificiranom ljudskom revizijom upravo za ovu vrstu sadržaja s visokim rizikom, izgrađena je za ovo. Podjela suy gan / suy giảm chức năng gan je upravo onakva vrsta nalaza koja bi trebala pokrenuti taj pregled, ne zato što su svi modeli pogrešni, već zato što modeli koji su najsigurniji nisu i najprecizniji.
Vrijednost pregleda više izlaza nije što ćete uvijek odabrati većinu. To je što ćeš znati da je izbor napravljen, što je drugačije od pretpostavljanja da je rezultat ispred tebe ispravan.

Postavi osam testova jedan pored drugoga i obrazac se održava: slaganje i neslaganje nisu nasumično distribuirani. Idiomatski, svakodnevni poslovni jezik ("uspostaviti kontakt," "raditi do kasno u noć") konvergirao je u gotovo svakom modelu iz grupe, u oba kruga. Formalnost, pravna preciznost i medicinska terminologija nisu. Test formalnosti CEO-a promijenio je smjer sa neformalnog na formalan samo kada je uključen prošireni skup. Klauzula o naknadi štete otkrivila je stvarnu pravnu razliku (免責 vs. 補償) koju je samo jedan model, u jednoj rundi, pravilno razumio. Medicinska terminologija nikada se nije u potpunosti razriješila, ostajući na približno omjeru 6 prema 4 u oba kruga bez obzira na to koji su modeli bili u skupini.
To je stvarni nalaz, a ne marketinška tvrdnja: konsenzus ne čini svaku rečenicu boljom, niti mora. Najvrjednije je upravo gdje fluentnost jednog modela vam ne daje razloga da joj ne vjerujete, i gdje je biti u krivu zapravo skupo.
Postoji drugi, praktičniji sloj ovog testa koji vrijedi jasno navesti. Pokretanje ovoga usporedbe sam znači provjera izlaza iz GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, i MiniMax M2.7 usporedno s postojećim bazičnim modelima, na jednom mjestu, na jednoj platformi. Izvan MachineTranslation.com-a, to nije jedna pretplata. To je nekoliko, jedan za svakog pružatelja čiji premium nivo želite testirati, po cijeni koju svaki pružatelj pojedinačno naplaćuje. Plaćeni korisnici ovdje dobivaju istu usporedbu jednim klikom, za dio cijene održavanja pet odvojenih premium pretplata, bez odricanja od onoga što je zapravo važno: vidjeti gdje se modeli slažu i znati točno kada se ne slažu.
Nijedan nije kategorički bolji; ovisi o kategoriji testa. Claude Sonnet i Claude Opus dosljedno su birali precizniji vijetnamski medicinski izraz, a Claude Opus je proizveo najprikladniju sleng za "To je bolno." Ali je Claude Sonnet također proizveo casual japanski u formalnoj CEO-kontekstnoj rečenici, gdje je GPT-5.5 to dobio ispravno. Direktno uspoređivanje rezultata je branljivije nego odabir jednog modela i vjerovanje u njega.
Nema ga; točnost ovisi o domeni. Gemini 3.5-Flash i GLM-5-Turbo proizveli su najprikladniji formalni japanski u ovom testu. Oba Claude modela bila su najpreciznija na vijetnamskoj medicinskoj terminologiji. DeepSeek V4-Pro bio je jedini model koji je koristio ispravan japanski pravni izraz, ali samo u Rundi 2, a proizvodio je neformalan japanski na drugim mjestima. Nijedan pojedinačni model nije dominirao u svih osam testova.
Ne, ne automatski. Proširenje bazena s novijim varijantama modela premium razreda pomaknulo je konsenzus s neformalnog na formalni u japanskom testu formalnosti. Ali u testu vijetnamske medicinske terminologije, podjela je bila stabilna na otprilike 6 prema 4, bez obzira koji su modeli bili uključeni. Više modela površi više nesuglasica, što je koristan signal, ali konsenzus i dalje slijedi većinu, a većina nije uvijek najtačniji odgovor.
SMART je MachineTranslation.com-ov sustav konsenzusa s više modela koji obuhvaća do 22 AI modela od pružatelja usluga kao što su OpenAI, Anthropic, Google i DeepSeek. Izvršava prijevod kroz više modela istovremeno i prikazuje izlaz većinskog konsenzusa zajedno s odgovorom svakog pojedinog modela, standardno, bez potrebe za konfiguracijom. Konsenzus se mijenja kada se bazen modela mijenja, kao što je pokazano u rezultatu japanske formalnosti ovog testa: neformalni konsenzus u 1. krugu postao je formalan u 2. krugu.
Nema jedinstvenog modela; ljudska provjera je bolji odgovor. Claude modeli su dosljedno birali precizniji vijetnamski medicinski izraz, a samo je DeepSeek V4-Pro koristio točan japanski pravni izraz, ali samo u drugoj rundi. Medicinska terminologija se nikada nije razriješila u 10 modela, što signalizira da je potrebna stručnost iz domene, a ne da bi se trebao odabrati drugi model. A certificirani pregled ljudske post-obrade, kao što nudi Tomedes, pruža tu stručnjačku provjeru.