July 10, 2026
Divi vārdi. Seši modeļi. Trīs dažādi tulkošanas lēmumi. Lūk, kas notika, kad es izpildīju 8 testa teikumus caur jaunākajiem AI modeļiem, kas pieejami MachineTranslation.com, un ko izvadi patiesībā atklāj par to, kad modelis klusumā neizdodas.
Divi vārdi. Tas ir slimīgi. Seši modeļi. Trīs atšķirīgi tulkošanas lēmumi.
Japāņu valodā viens modelis to renderēja kā それはやばい, saglabājot neskaidrību. Vēl viens pilnībā atmeta subjekta vietniekvārdu un uzrakstīja tikai pamatformu やばい, vispieņemtāko iespējamo versiju. Trešais uzrakstīja それはすごい, kas pilnībā atrisina neskaidrību par labu "apbrīnojamam," noņemot dubulto nozīmi, kas padarīja frāzi interesantu pirmajā vietā. Vietnamiesu valodā viens modelis rakstīja Đỉnh vậy (slengs, pareizi jaunatnes reģistram). Cits rakstīja Tas ir patiešām brīnumains, gramatiski pareizi, bet tuvāk teiktajam "tas ir patiešām brīnumains", kad kāds jums nosūta mēmu ziņojumu.
Visi šie varianti ir aizstāvējami. Neviens no tiem nav tas pats. Un ja jūs palaižat tulkojumus caur vienu modeli, jūs nekad neredzēsit izvēli, kas tika pieņemta jūsu vārdā.
Šis ir centrālais jautājums, uz kuru šis raksts mēģina atbildēt. Ne kurš AI modelis ir labākais tulkošanai 2026. gadā (atbilde ir atkarīga no valodu pāra, reģistra, domēna un teikuma struktūras), bet drīzāk: kā jūs zinātu, kad jūsu modelis pieņēma nepareizu lēmumu? Īpaši tādos domēnos kā medicīniskā terminoloģija, juridiskā līgumi vai profesionāla formalitāte, kur nepareizais lēmums izskatās tieši tāpat kā pareiza tulkošana, līdz speciālists to izlasa.
Lūk, ko es darīju. Es palaidzu 8 testa teikumus caur diviem modeļu kārtām vietnē MachineTranslation.com: vispirms izmantoju 5 plaši izmantotu modeļu pamatversiju, pēc tam paplašinātu kopumu, kas ietver vairākus jaunākos premium klases modeļu variantus, kas tagad ir pieejami maksas lietotājiem. Parasti, lai salīdzinātu rezultātus no modeļiem, piemēram, šis, būtu nepieciešami atsevišķi apmaksāti abonamenti pie katra sniedzēja atsevišķi. Vietnē MachineTranslation.com viņi atrodas vienā un tajā pašā salīdzinājuma skatā. Valodu pāri bija angļu→japāņu un angļu→vjetnamiešu. Testu kategorijas tika izvēlētas specifīski, lai pārbaudītu jomas, kur modeļu nesaskaņa ir visvairāk nozīmīga: idiomātiskas frāzes, juridiskā terminoloģija, medicīniskā terminoloģija, formālo jūtīguma konteksts un apzināta semantiska neskaidrība.
Piezīme par novērtēšanas metodiku: mašīntulkošanas pētniecība ilgi cīnījusies ar to, kā automātiski novērtēt izvades rezultātus. Tādi rādītāji kā BLEU un COMET , kā mērīts WMT koplietošanas uzdevumos , sniedz noderīgu kopējā signāla, bet tie ir vāji reģistra kļūdu, idiomatiskas izteiksmes neizdošanās un terminoloģiskās precizitātes noteikšanā, tieši tās kategorijas, kas šeit ir svarīgākās. Tas, ko jūs gatavojaties lasīt, ir izvades analīze, nevis BLEU sacensības.

Ne katra teikuma pamatā ir jēgpilna domstarpība. Divi no astoņiem testiem, "Let's touch base once the dust settles on this deal" (→ japāņu valoda) un "We're burning the midnight oil to hit this launch date" (→ vjetnamiešu valoda), radīja augstu vienošanos abās kārtās. Idiomas tika pareizi saprasti kā idiomas. Neviens nepārtulkoja "touch base" kā fiziskas bāzes pieskaršanos. Neviens nepārtulkoja "the dust settles" kā nogulsnes krišanu.
Tas ir vērts apstāties: idiomātiskā angļu valodas biznesa leksika ir pietiekami labi apstrādāta ar pašreizējiem avangarda modeļiem, ja idioma ir pietiekami izplatīta. Vienprātība par "touch base" palika stabila abās kārtās; variācija bija tīri stilistiska, ap jautājumu, vai izmantot この件 (šis jautājums), この取引 (šis darījums), vai この案件 (šis gadījums) avota frāzei.

Tests "degt pusnakts eļļu" ir tas, kur lietas kļuva interesantākas. Visi modeļi, izņemot vienu, pareizi saprata idiomatisko izteiksmi. MiniMax M2.7, ieviests 2. kārtā, burtiski tulkoja "burning", radot đốt đuốc, kas nozīmē "degošas fakeles." Konsensuss to pareizi izslēdza.

Japāņu valoda ir formalitātes slāņiem bagāta valoda. Darbības vārda beigu, vietniekvārda un referenciālā lietvārda formas izvēle nav stilistiska. Tas signalizē attiecības starp runātāju un saņēmēju. Ziņojuma sūtīšana jūsu izpilddirektoram, izmantojot neformālas darbības vārdu formas, gramatikas ziņā nav tulkošanas kļūda. Tas ir sociāla kļūda, un būtiska.
Vai tu to vari nosūtīt? Paldies, pateicos par to." Konteksts: ziņojumvietne ar ģenerāldirektoru.

Vienprātība mainījās, kad modeļu kopa paplašinājās. Mehānisms ir vienkāršs: pievienojot modeļus, kas pareizi nolasa formalitātes kontekstu, tika pārbīdīta vairākums, un konsensuss tam sekoja. Lūk, pilns spektrs tam, ko modeļi radīja 2. kārtā:

Vjetnames reģistra tests atklāja cita veida formalitātes kļūdu, kas ir smalkāka. Avota teikums: Hei, ātrs jautājums — vai tu vari piedalīties zvānā? Konteksts: ziņas sūtīšana klientam. Pirmajā kārtā Qwen iekļāva "mình," pirmās personas vietniekvārdu, kas nozīmē neformālu vienaudžu līmeņa draudzību. Visi pārējie modeļi pilnībā izvairījās no pirmās personas pašatsaucēm, kas ir drošāka profesionāla izvēle. Svarīgi, ka Qwen to izlaboja 2. kārtā un izlaida "mình." Vienprātība abās kārtās to izslēdza.

Piegādātāja/klienta atlīdzinājuma teikums ir standarta klauzula komercdarījumos: "**Piegādātājs kompensēs klientam jebkādus trešo pušu prasījumus, kas izriet no šī līguma pārkāpuma."
1. kārtā visi pieci modeļi pareizi identificēja juridisko reģistru un izmantoja aizguvumus ベンダー (piegādātājs) un クライアント (klients), kas ir standarta japāņu komerclīgumos ar angļu izcelsmi. Viena izņēmuma gadījumā: GPT-4.1-NANO izmantoja 販売者 (pārdevējs) un 顧客 (klients), leģitīmus japāņu vārdus, kuriem trūkst aizdevuma vārdu ekvivalentu formālās juridiskās specifiskuma.
Svarīgāks atklājums parādījās 2. kārtā. Galvenā atšķirība ir starp diviem vārdiem:
Šie ir juridiski atšķirīgi jēdzieni. "Indemnify" konkrēti nozīmē aizsargāt pusi no trešās puses atbildības. 免責 ir pareizais juridiskais termins. Visi 1. kārtas modeļi izmantoja 補償. 2. kārtā DeepSeek V4-Pro bija vienīgais modelis, kas radīja 免責, un to darīja tikai 2. kārtā, nevis 1. kārtā.

Kontraktā 補償 un 免責 nav sinonīmi. Viens nozīmē "mēs jums atlīdzināsim." Otrs nozīmē "jūs esat aizsargāti no prasības jau no paša sākuma." Ja tulkošanas platforma izmanto 補償, kur 免責 ir pareizi, jurists, kurš lasa japāņu versiju, neredzēs to pašu nolīgumu, ko apraksta angļu versija.
Šis ir nozīmīgākais atklājums datu kopā. Testa teikums: "Šis medikaments ir kontraindicēts pacientiem ar aknu funkcijas traucējumu vēsturi." Avots: klīniskā produkta dokumentācija. Mērķis: Vietnamiesu.
Kritiskais termins ir "hepatāla disfunkcija." Ir divi Vjetnamiešu kandidāti:
Tie ir klīniski atšķirīgi. Kontraindicējuma brīdinājums, kas balstīts uz "aknu funkcijas traucējumiem", attiecas uz jebkuru personu ar samazinātu aknu funkciju, nevis tikai uz tiem, kuri piedzīvoja pilnīgu orgāna mazspēju. Izmantojot suy gan, nepareizi sašaurina norādīto populāciju. Pacients ar vidēji smagu aknu disfunkciju, kurš lasa suy gan, var neatpazīt sevi kā kontraindicētu populāciju.

Dažas avota teikumi ir neskaidri pēc nolūka. "Tas ir slimīgi" mūsdienu angļu slenģī nozīmē kaut ko izcilu, bet tas joprojām saglabā arī savu tiešo nozīmi (tas ir riebīgs/pretīgs), un spriedze starp šīm divām nozīmēm ir daļa no tā, kā frāze komunikē. Izaicinājums tulkošanas modelim ir: vai jūs saglabājat neskaidrību, sagrupsējat to uz visvarbūtīgāko nozīmi, vai izvēlaties vienu un apņematies to?


Modeļi šajā testā nav visi līdzvērtīgi. Viņi aptver dažādas arhitektūras, apmācības režīmus un izvietošanas kontekstus. 1. kārtas pamatmodels ietver modeļus, kas ir plaši pieejami. Paplašinātais 2. kārtas fonds pievieno vairākus jaunākos premium līmeņa modeļu variantus, kas tagad ir pieejami maksājošiem lietotājiem vietnē MachineTranslation.com, tāds pats modeļu līmenis, kas citādi nozīmētu atsevišķu apmaksātu kontu katram atsevišķam sniedzējam.

Paplašinātais fonds 2. kārtā ietver modeļus, kas ir progresīvāki un pieejami maksājošiem lietotājiem vietnē MachineTranslation.com. Pūļa paplašināšanas ietekme nav vienmērīga. Dažos testos (formalitāte/japāņu valoda) tas nozīmīgi pārbīda konsensu. Citos (medicīniskajā terminoloģijā/vjetnamietis), sadalījums padziļinājās.

Testa dati norāda uz divām atšķirīgām kļūdu kategorijām, un tām nepieciešamas dažādas atbildes.
A kategorija: Klusas neveiksmes. Formalitātes kļūdas, reģistra kļūdas, medicīniskās terminoloģijas precizitāte: šie rada rezultātus, kas izskatās pareizi. Japāņu valoda ir gramatiska. Vietnamietis runā courantly. Nav nekāda virsējā signāla, ka kaut kas būtu nogājis greizi. Monolingvālam lietotājam, kurš lasa viena modeļa izvadi, nav iespējas uzzināt, ka modelis veica reģistra izvēli, ko pamanītu senjors Japānes vadītājs, vai ka klīniskais termins tika sašaurināts tā, ka tas mainīja populāciju, uz kuru tas attiecas.
Kategorija B: Redzami kļūmes. MiniMax tulko "burning the midnight oil" kā "dedzināt lukturīšus." GPT-4.1-NANO "That's sick" tulko uz nedvīvseju "すごい." Šie ir atklājami, vai nu mērķvalodas runātāja, vai arī salīdzinājumā ar citiem modeļu izvadiem.
Vairāku modeļu salīdzinājums, ko nodrošina SMART, ir visvērtīgākais A kategorijā. Kad pieci vai desmit modeļi rada izvadus un lielākā daļa piekrīt formālam reģistram, bet viens rada neformālu vienkāršu japāņu valodu, nesaskaņa ir redzama salīdzinājuma skatā. Lietotājs, kurš runā mērķvalodā, var novērtēt iespējas. Lietotājs, kurš to neredzētu, var redzēt, ka tika pieņemts apstrīdēts lēmums, un izlemt, vai šis spriedums ir vērts cilvēka pārskatīšanai.
Dokumentu mēroga darbiem, lieliem failiem, PDF, līgumu vai klīnisko materiālu izkārtojuma saglabājošai tulkošanai platforma apstrādā failu struktūru, nesabojājot formatējumu. Bet iepriekš minētie kvalitātes jautājumi attiecas neatkarīgi no faila lieluma. 100 lappuses klīniskā pētījuma, kurā katrs "aknu disfunkcijas" gadījums ir tulkots kā "aknu mazspēja", ir lielāka versija no tādas pašas problēmas, kas identificēta 2. testā.
Medicīnas un juridiskajām kategorijām īpaši cilvēka verifikācija ir pareizais drošības mehānisms. Tomedes' AI Post-Editing serviss, kas apvieno mākslīgā intelekta rezultātus ar sertificētu cilvēka pārbaudi tieši šāda veida augsta riska saturam, ir izstrādāts šim nolūkam. Suy gan / suy giảm chức năng gan sadalījums ir tieši tāds atradums, kas būtu jāizraisa šim pārskatam, nevis tāpēc, ka visi modeļi ir nepareizi, bet gan tāpēc, ka modeļi, kas ir visvairāk pārliecināti, nav visvairāk precīzi.
Vairāku izvadu redzēšanas vērtība nav tāda, ka jūs vienmēr izvēlēsities vairākumu. Tas ir tāds, ka jūs zināsiet, ka izvēle tika pieņemta, kas atšķiras no pieņēmuma, ka izvade jūsu priekšā ir pareiza.

Novietojiet astoņus testus blakus un modelis iztur: vienošanās un domstarpības nav nejauši sadalītas. Idiomātiska, ikdienas biznesa valoda ("sazināties", "strādāt līdz vēlam naktij") konverģēja gandrīz visos modeļos kopā, abās kārtās. Formalitāte, juridiskā precizitāte un medicīniskā terminoloģija nē. Prezidenta formalitātes tests pārvērtās no neformāla uz formālu tikai tad, kad tika iekļauts paplašinātais kandidātu saraksts. Atlīdzinājuma klauzula atklāja reālu juridisko atšķirību (免責 vs. 補償), ko tikai viens modelis vienā kārtā pareizi saprata. Medicīniskās terminoloģijas sadalījums nekad pilnībā neatrisināts, paliekot aptuveni 6 pret 4 abās kārtās neatkarīgi no tā, kuri modeļi bija fondā.
Tas ir faktiskais atklājums, nevis mārketinga apgalvojums: vienprātība nepadara katru teikumu labāku, un tam nav jābūt. Tas ir visvērtīgākais tieši tur, kur viena modeļa plūdums jums nedod iemesla par to šaubīties, un kur kļūdīšanās faktiski kaut ko maksā.
Šim testam ir otrais, praktiski nozīmīgāks slānis, kas ir vērts skaidri norādīt. Šī salīdzinājuma veikšana pašam nozīmēja GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo un MiniMax M2.7 izvadu pārbaudīšanu blakus esošajiem pamatmodeļiem vienā vietā, vienā platformā. Ārpus MachineTranslation.com, tas nav viena abonēšana. Tas ir vairāki, pa vienam katram sniedzējam, kura premium līmeni vēlaties pārbaudīt, par to, ko katrs sniedzējs atsevišķi maksā. Maksājošie lietotāji šeit saņem tādu pašu salīdzinājumu vienā klikšķī, par daļu no tā, kas maksātu piecas atsevišķas premium abonementu uzturēšanu, bez atteikšanās no tā, kas patiešām svarīgi: redzēt, kur modeļi piekrīt, un zināt tieši, kad viņi to nedara.
Neviens nav kategoriju ziņā labāks; tas ir atkarīgs no testa kategorijas. Claude Sonnet un Claude Opus konsekventi izvēlējās precīzāku vietnamiešu medicīnisko terminu, un Claude Opus radīja piemērotāko slengu frāzei "That's sick." Bet Claude Sonnet arī radīja neformālu japāņu valodu formālā CEO konteksta teikumā, kur GPT-5.5 to izdarīja pareizi. Tiešo izvadu salīdzināšana ir aizstāvējama labāk nekā viena modeļa izvēle un tam uzticēšanās.
Nav viena; precizitāte ir atkarīga no jomas. Gemini 3.5-Flash un GLM-5-Turbo šajā testā radīja visvairāk atbilstošo formālo japāņu valodu. Abi Claude modeļi bija visvairāk precīzi vietnamiešu medicīniskajā terminoloģijā. DeepSeek V4-Pro bija vienīgais modelis, kas izmantoja pareizo japāņu juridisko terminu, bet tikai 2. kārtā, un citur tas radīja neformālu japāņu valodu. Neviens vienīgais modelis nepārņēma visos astoņos testos.
Nē, ne automātiski. Pūļa paplašināšana ar jaunākajiem premium klases modeļu variantiem pārbīdīja konsensusu no neformāla uz formālu Japāņu formalitātes testā. Bet Vjetnamiešu medicīnas terminoloģijas testā šķelšanās saglabājās aptuveni 6 pret 4 neatkarīgi no tā, kuri modeļi tika iekļauti. Vairāk modeļu parādās vairāk domstarpību, kas ir noderīgs signāls, bet vienprātība joprojām seko vairākumam, un vairākums ne vienmēr ir precīzākā atbilde.
SMART ir MachineTranslation.com daudzmodeļu konsensusu sistēma, kas aptver līdz 22 AI modeļiem no sniedzējiem, tostarp OpenAI, Anthropic, Google un DeepSeek. Tas vienlaicīgi palaiž tulkojumu caur vairākiem modeļiem un parāda vairākuma konsensusu ieguldījumu kopā ar katra atsevišķa modeļa atbildi pēc noklusējuma bez konfigurācijas nepieciešamības. Konsenss mainās, mainoties modeļu kopai, kā parādīts šī testa japāņu formalitātes rezultātā: neformāls konsenss 1. kārtā kļuva formāls 2. kārtā.
Nav viena modeļa; labāka atbilde ir cilvēka pārskatīšana. Claude modeļi konsekventi izvēlējās precīzāko vietnamiešu medicīnisko terminu, un tikai DeepSeek V4-Pro izmantoja pareizo japāņu juridisko terminu, bet tikai 2. kārtā. Medicīniskās terminoloģijas sadalījums nekad netika atrisināts 10 modeļos, kas norāda, ka nepieciešama domēna ekspertīze, nevis tas, ka būtu jāizvēlas cits modelis. A sertificēts cilvēka pēcrediģēšanas pārskats, kā piedāvā Tomedes, nodrošina šo speciālistu pārbaudi.