July 10, 2026
Tvö orð. Sex módel. Þrjár mismunandi þýðingarákvarðanir. Hér er það sem gerðist þegar ég keyrði 8 prófunarsetningar í gegnum nýjustu gervigreindarlíkön sem eru fáanleg á MachineTranslation.com, og hvað úttakin sýna í raun um það þegar líkan bilar þögult.
Tvö orð. Það er ógeðslegt. Sex módel. Þrjár aðgreindar þýðingarákvarðanir.
Á japönsku flutti ein gerð hana sem それはやばい, og varðveitti tvíræðni. Annar slopp persónuforneafnið alveg og skrifaði beina formið やばい, þá mest orðalagið sem mögulegt er. Þriðji ritaði それはすごい, sem leysir tvíræðni algjörlega í þágu "ótrúlegur," og fjarlægir tvöfalda merkingu sem gerði setninguna áhugaverða í fyrstu. Á íslensku skrifaði ein líkan Đỉnh vậy (slangur, rétt fyrir unglingamál). Annar skrifaði Thật tuyệt vời, málhljóðlega rétt, en nær því að segja "það er sannarlega dásama" þegar einhver sendir þér myndbandsmem.
Allt þetta er varanlegt. Engin þeirra eru það sama. Og ef þú ert að keyra þýðingar í gegnum eina líkan, muntu aldrei sjá valið sem var tekið fyrir þína hönd.
Það er miðlæga spurningin sem þessi grein er að reyna að svara. Ekki hvaða gervigreindarlíkan er best fyrir þýðingu árið 2026 (svarið fer eftir tungumálapöri, málstíl, sviði og setningafyrirbyggingu), heldur frekar: hvernig myndir þú vita þegar líkanið þitt gerði ranga ákvarðun? Sérstaklega á sviðum eins og læknisfræðilegri hugtakanotkun, lagalegum samningum eða faglegri formlegheit, þar sem röng ákvarðan lítur nákvæmlega eins út og rétt þýðing þar til sérfræðingur les hana.
Hér er það sem ég gerði. Ég keyrði 8 prófunarsetningar í gegnum tvær umferðir af líkönum á MachineTranslation.com: fyrst grunnlínu með 5 víðtækum líkönum sem eru mikið notuð, síðan útvíkkað safn sem bætir við nokkrum af nýjustu úrvalslíkönum sem nú eru fáanleg fyrir borgandi notendur. Venjulega myndu samanburðir á úttak frá líkönum eins og þessu þýða að greiða fyrir sérstakar áskriftir hjá hverjum þjónustuaðila fyrir sig. Á MachineTranslation.com sitja þeir í sömu samanburðarútsýn. Tungumálapörin voru Enska→Japanska og Enska→Vítnamska. Setningaflokkar voru valdir sérstaklega til að prófa svæði þar sem ósamstaða líkana er mest mikilvæg: málsgreinir, lagahugtök, læknisfræðileg hugtök, formlegheitarfallandi samhengi og viljandi merkingarfræðileg tvíræðni.
Athugasemd um aðferðafræði mats: rannsóknir á vélþýðingu hafa lengi glímt við það hvernig á að skora úttakið sjálfkrafa. Mælikvarðar eins og BLEU og COMET eins og mælt er í sameiginlegum verkefnum WMT veita gagnlegt samanlagt merki, en þeir eru slakir á því að greina skráarvillur, misheppnaða orðatiltæki og hugtakasafn, nákvæmlega þær flokkar sem skipta mestu máli hér. Það sem þú ert að finna að lesa er framleiðslugreining, ekki BLEU keppni.

Ekki kemur fram marktæk ágreiningur í hverri setningu. Tveir af átta prófunum, "Let's touch base once the dust settles on this deal" (→ Japanska) og "We're burning the midnight oil to hit this launch date" (→ Vítnamska), skiluðu háu samkomulagi á báðum umferðum. Orðatiltækin voru rétt skilin sem orðatiltæki. Enginn þýddi "touch base" sem að snerta eðlilega grunna. Engin þýðing túlkaði "the dust settles" sem setföll sem fellur niður.
Þetta er þess virði að staldra við: fagmál á ensku í viðskiptum er þokkalega vel meðhöndlað af núverandi fremstu gervigreindarlíkönum þegar málið er nógu algengt. Samstaðan um "snerta grunninn" hélst stöðug í báðum umferðum; breytileiki var eingöngu stílbundinn, um hvort nota ætti この件 (þetta mál), この取引 (þessi samningur), eða この案件 (þetta verkefni) fyrir upprunalegu setninguna.

Prófið „að brenna miðnæturolíu" er þar sem hlutirnir urðu áhugaverðari. Öll líkön nema einn skildu orðasambandið rétt. MiniMax M2.7, kynnt í 2. umferð, þýddi "brennandi" bókstaflega og framleiddi đốt đuốc, sem þýðir "brennandi kynlingar." Samstaðan útilokaði það með réttu.

Japanska er tungumál með formleika lög. Val á sagnorðaendingu, fornafni og vísunarnafnformi er ekki stílbundin. Það gefur til kynna samband milli þess sem talar og viðtakanda. Að senda skilaboð til forstjóra þíns með óformlegum sögnarformum er ekki þýðingarvilla í málfræðilegum skilningi. Það er félagsleg villa, og veruleg ein.
Getur þú sent það yfir? Takk, það er dýrðlegt. Samhengi: skilaboð til forstjóra.

Sátt breyttist þegar hópur líkana stækkaði. Kerfi málsins er einfalt: með því að bæta við líkönum sem lestu formlegheitasamhengið rétt færðist meirihlutinn, og samstaðan fylgdi í kjölfarið. Hér er allt úrvalið af því sem líkönin framleiddu í 2. umferð:

Vietnamska formlegheitarprófið kom í ljós aðra tegund formlegheitarvillu, eina sem er fínlegri. Upprunasetningin: Halló, fljótt spurning — ertu laus til að hoppa á símtal? Samhengi: skilaboð til viðskiptavinar. Qwen í 1. umferð innihélt "mình," persónuforneafn í fyrstu persónu sem felur í sér óformleg jafningasambönd. Öll önnur líkön forðuðust algjörlega sjálfsvísun í fyrstu persónu, sem er öruggari faglegur kostur. Mikilvægt er að Qwen leiðrétti þetta í 2. umferð og fór með "mình." Sátt í báðum umferðum útilokaði það.

Setning um skaðabætur milli seljanda/viðskiptavinar er staðlaus ákvæði í viðskiptasamningum: "Seljandi skal bæta kaupanda fyrir allar kröfur þriðja aðila sem stafa af broti á þessum samningi."
Í umferð 1 greindu öll fimm líkönin réttilega lagalegt málsnið og notuðu tökuorðin ベンダー (birgir) og クライアント (viðskiptavinur), sem eru staðlað í japönskum viðskiptasamningum af enskum uppruna. Ein undantekning: GPT-4.1-NANO notaði 販売者 (seller) og 顧客 (customer), lögmæt japönsk orð sem skortir formlega lagalega sérhæfingu lánorðajafngilda.
Mikilvægari niðurstaða kom fram í 2. umferð. Aðalmunurinn er á milli tveggja orða:
Þetta eru lagalega mismunandi hugtök. "Indemnify" þýðir nákvæmlega að verja aðila gegn ábyrgð þriðja aðila. 免責 er rétt lagalegt hugtak. Öll Round 1 módel notuðu 補償. Í 2. umferð var DeepSeek V4-Pro eina líkanið sem framleiddi 免責, og það gerði það aðeins í 2. umferð, ekki 1. umferð.

Í samningi eru 補償 og 免責 ekki samheiti. Einn þýðir "við endurgreiðum þér." Hinn þýðir "þú ert varinn gegn kröfunni frá upphafi." Ef þýðingarvettvangur notar 補償 þar sem 免責 er rétt, mun lögfræðingur sem les japanska útgáfuna ekki sjá sömu samkomulagið sem ensku útgáfan lýsir.
Þetta er mikilvægasta niðurstaðan í gagnasafninu. Prófunarsetningin: Þessi lyf eru ekki ætluð fyrir sjúklinga með sögu um lifrarskerta. Heimild: klínísk vöruSkjöl. Markmál: Vetneskur.
Mikilvæga hugtakið er "lifrar skert virkni." Það eru tveir vietnamskir frambjóðendur:
Þetta eru klínísk aðgreind. Viðvörun um andnægju sem byggir á "skertri lifrarstarfsemi" á við um alla sem eru með minnkaða lifrarstarfsemi, ekki bara þá sem hafa orðið fyrir algjöru bilun líffæra. Notkun suy gan þrengir tilgreinda þýðingu rangt. Sjúklingur með miðlungs hepaðskemmdir sem les suy gan gæti ekki þekkt sig sem andstæðu hóp.

Sumar upprunasetningar eru tvíræðar af ásetningi. "Það er ógeðslegt" í samtímamáli ensku slangri þýðir eitthvað framúrskarandi, en það gegnir enn sinni bókstafslegu merkingu (það er skapandi/viðbjóðslegt), og spennan milli þessara tveggja merkinga er hluti af því hvernig setningin tjáir sig. Áskorunin fyrir þýðingarlíkan er: geturðu varðveitt tvíræðni, fellt hana saman í líklegasta merkinguna, eða valið eina og skuldbundið þig?


Líkönin í þessari prófi eru ekki öll jafngild. Þeir spanna mismunandi arkitektúra, þjálfunaraðferðir og dreifingarkontexta. 1. umferð grunnlínan inniheldur gerðir sem eru víðlega aðgengilegar. Útvíkkuð laug 2. umferðar bætir við nokkrum af nýjustu iðkum úrvalsgæða sem nú eru fáanlegir fyrir borgandi notendur á MachineTranslation.com, sama stig líkans sem myndi að öðrum kosti þýða sérstakan greiddan reikning hjá hverjum einstökum veitanda.

Útvíkkuð laug í 2. umferð inniheldur líkön sem eru fullkomnari og fáanleg fyrir borgandi notendur á MachineTranslation.com. Áhrif þess að stækka hópinn eru ekki jöfn. Í sumum prófum (formlegheit/japönsk), breyttist samstaðan þýðingarlega. Hjá öðrum (læknisfræðileg hugtök/Víetnam) dýpkaðist klofningurinn.

Prófunargögnin benda til tveggja aðskildra bilunarflokka og þeir krefjast mismunandi viðbragða.
Flokkur A: Þögul bilun. Formlegir villur, skrástillir villur, nákvæmni læknisfræðilegrar hugtakanotunar: þetta framleiðir úttök sem líta út fyrir að vera rétt. Japanski er málfræðilega rétt. Vietnamski er fljótandi. Það er engin yfirborðsmerki um að eitthvað hafi farið úrskeiðis. Einmáls notandi sem les úttak frá einu líkani hefur engan leið til að vita að líkanið gerði skráningarval sem eldri japanski framkvæmdastjóri myndu taka eftir, eða að klínískt hugtak var þrengað á þann hátt sem breytir þeim hópi sem það á við um.
Flokkur B: Sýnileg bilun. MiniMax þýðir "burning the midnight oil" sem "burning torches." GPT-4.1-NANO leysti "That's sick" í ótvíræðu "すごい." Þetta eru greinileg, annað hvort fyrir málhafa markmiðsmálsins eða með samanburði á öðrum framleiðslum líkana.
Fjölmódelsamanburðurinn sem SMART veitir er mest dýrðlegur í flokki A. Þegar fimm eða tíu líkön framleiða úttök og flestir eru sammála um formlega skrá á meðan ein framleiðir óformleg einfalt japanskt, er ósamkomulagið sýnilegt í samanburðarútsýninni. Notandi sem talar markmálið getur metið valkostina. Notandi sem getur ekki séð að umdeild ákvörðun var tekin getur ákveðið hvort sú setning þarf mannlega endurskoðun.
Fyrir vinnu á skjölastigi, stór skrár, útlitshaldandi þýðingu PDF-skjala, samninga eða klínísks efnis, geta skjalavinnslugeta vettvangsins séð um skjalabyggingu án þess að brjóta sniðið. En þeim endalaust, en gæðaspurningarnar sem settar voru fram hér að ofan eiga við óháð skráarstærð. 100 blaðsíðna klínísk rannsókn þar sem hver tilvik af "hepatísku skerðingu" er þýtt sem "lifrarbilunar" er stærri útgáfa af sama vandamálinu sem greint var í prófi 2.
Fyrir læknisfræði- og lagaflokka sérstaklega er mannversk sannprófun rétt bakstopp. Tomedes' AI-eftirritstjórnarþjónusta, sem sameinar AI-úttak með vottuðum mannlegum endurskoðun fyrir nákvæmlega þessa tegund háhættuefnis, er byggð fyrir þetta. Suy gan / suy giảm chức năng gan skiptingin er nákvæmlega sú tegund niðurstöðu sem ætti að koma af stað þeirri endurskoðun, ekki vegna þess að öll módel séu röng, heldur vegna þess að módelin sem eru mest sjálfsörugg eru ekki nákvæmust.
Gildi þess að sjá margar úttakir er ekki að þú veljir alltaf meirihlutann. Það er það að þú munt vita að val var gert, sem er frábrugðið því að gera ráð fyrir að úttakið fyrir framan þig sé rétt.

Settu átta prófanirnar hlið við hlið og mynstur heldur sér: samkomulag og ósamkomulag eru ekki dreifð af handahófi. Orðasambönd og daglegur viðskiptamál ("touch base," "burning the midnight oil") sameinuðust í næstum öllum líkönum í safninu, í báðum umferðum. Formlegt tungumál, lagaleg nákvæmni og læknisfræðileg hugtök gerðu það ekki. Próf um formlegt framkomulag forstjóra skipti úr óformlegri yfir í formlega framkomu aðeins þegar stærri hópur var tekinn með. Skaðabótaákvæðið leiddi í ljós raunverulegan lagalegan mun (免責 vs. 補償) sem aðeins ein gerð, í einni umferð, komst að því að rétt væri. Læknisfræðileg hugtökaflutningur var aldrei leystur, heldur stóð hann við um það bil 6-til-4 hlutfall í báðum umferðum óháð því hvaða líkön voru í safninu.
Það er raunverulegi niðurstaðan, ekki markaðskrafa: samstaða gerir ekki hverja setningu betri, og hún þarf ekki að gera það. Það er mest dýrmæt þar sem flæði eins líkans gefur þér engar ástæður til að efast um það, og þar sem það að hafa rangt getur kostað eitthvað.
Það er annað, hagnýtara lag á þessu prófi sem vert er að fullyrða skýrt. Að keyra þennan samanburð sjálf(ur) þýddi að athuga úttök frá GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, og MiniMax M2.7 hlið við hlið með fyrirliggjandi grunnlínulíkönum, á einum stað, á einni vettvangi. Utan MachineTranslation.com, það er ekki ein áskrift. Það eru nokkrar, ein fyrir hvern veitanda sem þú vilt prófa úrvalsgetu hans, á því verði sem hver veitandi rukkar fyrir sig. Greiðandi notendur hér fá sömu samanburð með einum smelli, fyrir brot af því sem það myndi kosta að viðhalda fimm aðskildum úrvalsskráningum, án þess að gefa eftir því sem skiptir raunverulega máli: að sjá hvar líkönin eru sammála, og vita nákvæmlega hvenær þau eru það ekki.
Hvorugt er ótakmarkað betra; það fer eftir prófunarkategóríunni. Claude Sonnet og Claude Opus völdu stöðugt nákvæmari vietnamska læknistermina, og Claude Opus framleiddi hið viðeigandi slangur fyrir "That's sick." En þó að Claude Sonnet framleiddi óformlegt japanskt í formlegri framkvæmdastjóra-samhengis setningu, þar sem GPT-5.5 fór það rétt. Að bera framleiðslu beint saman er varðandi en að velja eina líkan og treysta henni.
Það er engin; nákvæmni er háð sviðinu. Gemini 3.5-Flash og GLM-5-Turbo framleiddu formlegustu japönsku á þessu prófi. Báðir Claude líkön voru nákvæmust við vietnamska læknistækniorðaforða. DeepSeek V4-Pro var eina líkanið sem notaði rétta japanska lagahugtök, en aðeins í 2. umferð, og það framleiddi frjálslegt japanskt annars staðar. Engin ein tegund var ríkjandi á öllum átta prófunum.
Nei, ekki sjálfkrafa. Að stækka safnið með nýrri úrvali úrvals líkana breitti samstöðu frá óformlegri yfir í formlega í japanska formlegheitsprófinu. En ensku læknisorðabók prófinu fyrir Víetnam hélt klofningurinn áfram við um 6 á móti 4 óháð því hvaða líkön voru notuð. Fleiri líkön koma fram með meiri ósamkomulag, sem er gagnlegur merki, en samstaðan fylgir samt meirihlutanum, og meirihlutinn er ekki alltaf nákvæmasta svarið.
SMART er fjölmótunarkerfið fyrir samstöðu MachineTranslation.com, sem spannar allt að 22 gervigreindarlíkön frá veitendum þar á meðal OpenAI, Anthropic, Google og DeepSeek. Það keyrir þýðingu í gegnum mörg líkön samtímis og birtir úttak meirihlutasamstöðu við hlið svar hvers einstaks líkans, sjálfgefið, án þess að þörf sé á stillingum. Samstaða breytist þegar líkanaflokki breytist, eins og sést í niðurstöðu japönsku formlegni þessa prófs: óformleg samstaða í 1. umferð varð formleg í 2. umferð.
Engin ein líkan; mannleg endurskoðun er betri svar. Claude líkönin völdu stöðugt nákvæmari vietnamska læknisfræðilega hugtakið, og DeepSeek V4-Pro einn notaði rétta japanska lagalega hugtakið, en aðeins í 2. umferð. Læknisfræðileg hugtökunin skiptist aldrei upp á 10 gerðum, sem gefur til kynna að sérfræðiþekking á sviðinu sé nauðsynleg, ekki að velja ætti aðra gerð. Faglegur endurskoðun með mannlegri eftirvinnslu, eins og Tomedes býður upp á, veitir þá sérhæfðu athugun.