July 10, 2026
Dve besedi. Šest modelov. Tri različne odločitve pri prevodu. Evo kaj se je zgodilo, ko sem 8 testnih stavkov pognал skozi najnovejše modele umetne inteligence, dostopne na MachineTranslation.com, in kaj rezultati dejansko razkrivajo o tem, kdaj model tiho odpove.
Dve besedi. To je bolno. Šest modelov. Tri različne odločitve pri prevodu.
V japonščini je en model to izrazil kot それはやばい, pri čemer je ohranil dvojumnost. Drugi je popolnoma izpustil osebni zaimek in napisal samo osnovno obliko やばい, najbolj pogovorno različico, ki je mogoča. Tretji je napisal それはすごい, kar v celoti razrešuje dvoumnost v prid "čudovitega," in s tem odstrani dvojni pomen, ki je frazo sprva naredil zanimivo. V slovenščini je en model napisal Đỉnh vậy (sleng, pravilno za mladinski register). Drugi je napisal Thật tuyệt vời, grammatično pravilno, vendar bližje temu, da bi rekel "to je res čudovito" ko ti nekdo pošlje meme.
Vse te možnosti so branljive. Nobeden od njih ni ista stvar. In če prevajate skozi en sam model, nikoli ne boste videli izbire, ki je bila narejena v vašem imenu.
To je osrednje vprašanje, na katerega poskuša odgovoriti ta članek. Ne kateri AI model je najboljši za prevajanje leta 2026 (odgovor je odvisen od jezikovnega para, registra, domene in strukture stavka), temveč: kako bi vedeli, da je vaš model napravil napako? Posebej v domenah, kot so medicinska terminologija, pravni pogodbi ali strokovna formalnost, kjer napačen odgovor izgleda popolnoma enak kot pravilen prevod, dokler ga ne prebere specialist.
Evo kaj sem naredil. Sem spustil 8 testnih stavkov skozi dva kroga modelov na MachineTranslation.com: najprej osnovno primerjavo 5 široko uporabljenih modelov, nato pa razširjeni nabor, ki dodaja več najnovejših variant modelov premium-tier, ki so zdaj dostopne plačljivim uporabnikom. Običajno bi primerjava rezultatov modelov, kot je ta, pomenila ločene plačane naročnine pri vsakem ponudniku posebej. Na MachineTranslation.com se nahajajo v istem primerjalniku. Jezikovni pari so bili angleščina→japonščina in angleščina→vietnamščina. Kategorije stavkov so bile izbrane posebej za testiranje področij, kjer je nestrinjanje modelov najbolj posledično: idiomatski izrazi, pravna terminologija, medicinska terminologija, kontekst občutljiv na formalnost in namerna semantična dvoumnost.
Opomba o metodologiji vrednotenja: raziskovanje strojnega prevajanja se že dolgo spopada s tem, kako samodejno oceniti rezultate. Metriki kot BLEU in COMET , kot so izmerjene v skupnih nalogah WMT , dajejo uporabne skupne signale, vendar so slabe pri odkrivanju napak v registru, neuspehov idiomov in terminološke natančnosti, kar je prav tiste kategorije, ki so tukaj najpomembnejše. Tisto, kar se boš prebral, je analiza rezultatov, ne dirka za BLEU.

Ne vsaka poved izkaže smiselno nestrinjanje. Dva od osmih testov, "Let's touch base once the dust settles on this deal" (→ japonščina) in "We're burning the midnight oil to hit this launch date" (→ vietnamščina), sta proizvedla visoko soglasje v obeh krogih. Idiomi so bili pravilno razumljeni kot idiomi. Nihče ni prevedel "touch base" kot dotikanja fizične baze. Nihče ni prevedel "the dust settles" kot padanje usedline.
To je vredno premisleka: idiomatski angleški poslovni jezik je razmeroma dobro obdelan s trenutnimi vrhunskimi modeli, kadar je idiom dovolj pogost. Soglasje za "touch base" je ostalo stabilno v obeh krogih; variacija je bila čisto stilistična, glede na to, ali uporabiti この件 (ta zadeva), この取引 (ta dogovor) ali この案件 (ta primer) za izvirno frazo.

Test "kurjenja polnočnega olja" je tam, kjer so stvari postale bolj zanimive. Vsak model razen enega je pravilno razumel idiom. MiniMax M2.7, predstavljen v 2. krogu, je dobesedno prevedel "burning" in proizvedel đốt đuốc, kar pomeni "gorečih bakel." Soglasje ga je pravilno izključilo.

Japonščina je jezik s plastmi formalnosti. Izbira glagolskega končaja, zaimka in referenčne oblike samostalnika ni stilistična. Označuje razmerje med govorcem in prejemnikom. Pošiljanje sporočila svojemu izvršnemu direktorju z neuradnimi oblikami glagola ni napaka pri prevodu v slovničnem smislu. To je družbena napaka, in precejšnja.
Ali mi lahko to pošleš? Hvala, cenjem to." Kontekst: sporočanje direktorju.

Soglasje se je spremenilo, ko se je bazen modelov razširil. Mehanizem je preprost: dodajanje modelov, ki so pravilno razumeli kontekst formalnosti, je spremenilo večino, in konsenz je sledil. Tukaj je celoten spekter tega, kar so modeli proizvedli v 2. krogu:

Vietnamski register test je razkril drugačno vrsto napake v formalnosti, ki je bolj subtilna. Izvirni stavek: "Hej, hitro vprašanje — si prosto/a, da se javimo na klic?" Kontekst: sporočilo stranki. Qwen v 1. krogu je vključil "mình," osebni zaimek prve osebe, ki implicira neformalno prijateljstvo na ravni vrstnikov. Vsi drugi modeli so se popolnoma izognili samoreferenci v prvi osebi, kar je varnejša strokovna izbira. Ključno je, da je Qwen to popravil v 2. krogu in izpustil »mình«. Soglasje v obeh krogih je to izključilo.

Stavek o odpravi odgovornosti med prodajalcem in kupcem je standardna klavzula v trgovinskih pogodbah: "Prodajalec mora nadomestiti stranko za vse zahtevke tretjih oseb, ki izhajajo iz kršitve te pogodbe."
V 1. krogu so vseh pet modelov pravilno prepoznalo pravni register in uporabili izposojenke ベンダー (dobavitelj) in クライアント (stranka), standardne v japonskih poslovnih pogodbah angleškega izvora. Ena izjema: GPT-4.1-NANO je uporabil 販売者 (prodajalec) in 顧客 (kupec), legitimne japonske besede, ki jim primanjkuje formalne pravne specifičnosti enakovrednih tujih besed.
Bolj pomemben rezultat se je pojavil v 2. krogu. Ključna razlika je med dvema besedama:
To so pravno različni pojmi. "Indemnify" posebej pomeni zaščititi stranko pred odgovornostjo tretjih oseb. Odškodnina je pravilen pravni izraz. Vsi modeli Round 1 so uporabljali 補償. V 2. krogu je bil DeepSeek V4-Pro edini model, ki je proizvajal 免責, in to samo v 2. krogu, ne v 1. krogu.

V pogodbi 補償 in 免責 nista sopomenki. Ena pomeni "povrnili vam bomo." Drugi pomeni "v prvi vrsti ste zaščiteni pred zahtevkom." Če prevajalska platforma uporablja 補償 kjer je 免責 pravilna, pravnik, ki bere japonsko različico, ne bo videl iste pogodbe, kot jo opisuje angleška različica.
To je najbolj pomemben rezultat v naboru podatkov. Testni stavek: "To zdravilo je kontraindicirano pri bolnikih z zgodovino jetrne motnje." Vir: klinična dokumentacija izdelka. Cilj: Vietnamščina.
Kritični izraz je "jetrna okvara." Obstajata dva vietnamska kandidata:
To so klinično različna. Opozorilo o kontraindikaciji na podlagi "jetrne motnje" velja za vse osebe z zmanjšano funkcijo jeter, ne le za tiste, ki so doživele popolno odpoved organa. Uporaba suy gan nepravilno zoži navedeno populacijo. Pacient z zmerno jetrno okvaro, ki bere suy gan, se morda ne bi prepoznal kot kontraindicirano populacijo.

Nekateri izvirni stavki so namerno dvoumni. "To je bolno" v sodobni angleški sliki pomeni nekaj odličnega, vendar ima tudi še vedno svoj dobesedni pomen (to je grozljivo/odvratno), in napetost med tema dvema pomenom je del tega, kako fraza komunicira. Izziv za model prevoda je: ali ohranite dvoumnost, jo zrušite na najbolj verjetno pomensko, ali izberete eno in se zavežete?


Modeli v tem testu niso vsi enakovredni. Zajemajo različne arhitekture, režime usposabljanja in kontekste uvedbe. Osnovni nivo 1. kroga vključuje modele, ki so široko dostopni. Razširjeni bazen Round 2 dodaja več najnovejših variant modelov premium-nivoja, ki so zdaj na voljo plačljivim uporabnikom na MachineTranslation.com, enaka raven modelov, ki bi sicer pomenila ločen plačljiv račun pri vsakem posameznem ponudniku.

Razširjeni bazen v Round 2 vključuje modele, ki so naprednejši in dostopni plačljivim uporabnikom na MachineTranslation.com. Učinek razširitve bazena ni enak. V nekaterih testih (formalnost/japonščina) je to smiselno spremenilo soglasje. Pri drugih (medicinska terminologija/vietnamščina) se je razdelitev poglobila.

Testni podatki kažejo na dve različni kategoriji napak, in zahtevajo drugačne odgovore.
Kategorija A: Tiha odpoved. Napake v formalnosti, napake v registru, natančnost medicinske terminologije: te proizvajajo rezultate, ki izgledajo pravilni. Japonščina je slovnično pravilna. Vietnamec je tekoč. Ni nobenega površinskega znaka, da bi se kaj narobe zgodilo. Enojezični uporabnik, ki bere izhod enega samega modela, nima možnosti vedeti, da je model izbral register, ki bi ga opazil visoki japonski direktor, ali da je klinični izraz zožen na način, ki spremeni populacijo, na katero se nanaša.
Kategorija B: Vidni napaki. MiniMax prevaja "burning the midnight oil" kot "sežiganje bakel." GPT-4.1-NANO razrešuje "That's sick" v nedvoumno "すごい." Te so zaznane, bodisi s strani govorca ciljnega jezika bodisi s primerjavo z drugimi izhodi modela.
Primerjava več modelov, ki jo zagotavlja SMART, je najbolj dragocena v kategoriji A. Ko pet ali deset modelov proizvede izhode in se večina strinja glede formalnega registra, medtem ko eden proizvede casual navaden oblik japonščine, je nesoglasje vidno v pogledu primerjave. Uporabnik, ki govori ciljni jezik, lahko oceni možnosti. Uporabnik, ki ne more videti, da je bila sprejeta sporjena odločitev, in se odločiti, ali ta sodba upravičuje pregled s strani človeka.
Za delo na ravni dokumenta, velike datoteke, ohranitev postavitve pri prevajanju PDF-jev, pogodb ali kliničnih materialov, sposobnost obdelave dokumentov platforme upravlja strukturo datoteke brez prekinitve oblikovanja. Toda zgornja vprašanja o kakovosti veljajo ne glede na velikost datoteke. Študija s 100 stranmi, kjer je vsak primer "hepatske okvare" preveden kot "odpoved jeter", je večja različica iste težave, identificirane v testu 2.
Za medicinske in pravne kategorije posebej je človeška preverjanja pravilna zavarovalka. Storitev Tomedes' AI Post-Editing, ki povezuje izhod AI s certificiranim človeško pregledom za prav to vrsto vsebine z visokim tveganjem, je namenjena za to. Razdelitev suy gan / suy giảm chức năng gan je točno tista vrsta ugotovitve, ki bi morala sprožiti to pregled, ne ker so vsi modeli napačni, ampak ker modeli, ki so najbolj prepričani, niso najbolj natančni.
Vrednost pogleda več rezultatov ni v tem, da boste vedno izbrali večino. Je to, da boste vedeli, da je bila izbira narejena, kar se razlikuje od predpostavke, da je rezultat pred vami pravilen.

Postavite osem testov drug ob drugega in vzorec se drži: soglasje in nesoglasje niso naključno porazdeljena. Idiomatski, vsakodnevni poslovni jezik ("vzpostaviti stik," "delati do poznih ur") se je zbližal v skoraj vseh modelih v skupini, v obeh krogih. Formalnost, pravna natančnost in medicinska terminologija niso. Test formalnosti CEO se je spremenil iz neformalne v formalno samo enkrat, ko je bil vključen razširjeni nabor. Klavzula o odškodnini je razkrila resnično pravno razliko (免責 vs. 補償), ki jo je samo en model, v enem krogu, pravilno razumel. Medicinska terminologija se ni nikoli popolnoma razrešila, ostala je približno 6 proti 4 v obeh krogih, ne glede na to, kateri modeli so bili v bazenu.
To je dejansko ugotovitev, ne marketinški zahtevek: soglasje ne izboljša vsakega stavka in tudi ne mora. Najbolj je dragoceno ravno tam, kjer tekoča govorica enega modela ne daje razloga za dvom, in kjer je biti v zmoti dejansko nekaj stane.
Obstaja druga, bolj praktična plast tega testa, ki je vredno jasno navedti. Če bi to primerjavo izvedel sam, bi moral preverjati rezultate GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo in MiniMax M2.7 drug ob drugem z obstoječimi osnovnimi modeli, na enem mestu, na eni platformi. Izven MachineTranslation.com to ni ena naročnina. To je več naročnin, ena za vsakega ponudnika, čigar premium raven želite testirati, po ceni, ki jo zaračuna vsak ponudnik posebej. Plačani uporabniki tukaj dobijo isto primerjavo z enim klikom, za ulomek stroškov, ki bi jih stali pet ločenih premium naročnin, brez odrekanja stvari, ki je res pomembna: videti, kje se modeli ujemajo, in vedeti natanko, kdaj se ne ujemajo.
Nobeden ni kategorično boljši; odvisno je od kategorije testa. Claude Sonnet in Claude Opus sta dosledno izbrala natančnejši vietnamski medicinski izraz, Claude Opus pa je proizvedel najprimernejši sleng za "To je super." Toda je Claude Sonnet v formalnem kontekstu stavka CEO-ja tudi proizvedel neuradni japonski jezik, kjer je GPT-5.5 dobil prav. Primerjava rezultatov neposredno je bolj obranljiva kot izbira enega modela in zaupanje vanj.
Ni ga; natančnost je odvisna od področja. Gemini 3.5-Flash in GLM-5-Turbo sta v tem testu proizvedla najbolj primerno formalno japonščino. Oba Claude modela sta bila najbolj natančna pri vietnamski medicinski terminologiji. DeepSeek V4-Pro je bil edini model, ki je uporabil pravilen japonski pravni izraz, vendar le v 2. krogu, in je v drugih delih proizvedel priložnostno japonščino. Noben sam model ni prevladal v vseh osmih testih.
Ne, ne samodejno. Razširitev bazena z novejšimi varianto modelov premium-razreda je spremenila soglasje s priležnostnega na formalno v japonskem testu formalnosti. Toda v testu vietnamske medicinske terminologije se je razdelitev ohranila pri približno razmerju 6 proti 4, ne glede na to, kateri modeli so bili vključeni. Več modelov površinsko kaže več nestrinjanja, kar je koristen signal, vendar se soglasje še vedno drži večine, in večina ni vedno najbolj natančen odgovor.
SMART je večmodelni konsenzusni sistem MachineTranslation.com, ki obsega do 22 AI modelov različnih ponudnikov, vključno z OpenAI, Anthropic, Google in DeepSeek. Izvaja prevod skozi več modelov hkrati in prikaže rezultat večinskega soglasja skupaj z odgovori vsakega posameznega modela, privzeto brez potrebne konfiguracije. Soglasje se spremeni, ko se bazen modelov spremeni, kot je prikazano v rezultatu japonske formalnosti tega testa: neformalno soglasje v 1. krogu je postalo formalno v 2. krogu.
Ni enega samega modela; človeški pregled je boljši odgovor. Modeli Claude so dosledno izbrali natančnejši vietnamski medicinski izraz, medtem ko je DeepSeek V4-Pro sam uporabil pravilen japonski pravni izraz, vendar samo v 2. krogu. Medicinska terminologija se nikoli ni razdelila konsistentno med 10 modeli, kar signalizira, da je potrebna domensko znanje, ne pa izbira drugega modela. Certificiran pregled po urejanju s strani človeka, kot ga ponuja Tomedes, zagotavlja ta strokovni pregled.