July 10, 2026
Два словы. Шэсць мадэлей. Тры розныя рашэнні пра перакладу. Вось што адбылося, калі я прапусцiў 8 тэставых сказаў праз найноўшыя мадэлі штучнага інтэлекту, даступныя на MachineTranslation.com, і што вывады на самай справе раскрываюць пра тое, калі мадэль мовча не справляецца.
Два словы. Гэта клёва. Шэсць мадэлей. Тры розныя рашэнні пры перакладзе.
У японскай мове адзін мадэль перадаў гэта як それはやばい, захоўваючы неадназначнасць. Ещё адзін цалкам апусціў прадметны займенник і напісаў голую форму やばい, найбольш разговорны варыянт з магчымых. Трэцяя напісала それはすごい, што цалкам вырашае неадназначнасць на карысць слова "дзівосны", выдаляючы двайны сэнс, які зробіў фразу цікавай з самага пачатку. На вьетнамскай мове адзін мадэль напісаў Đỉnh vậy (сленг, правільна для моладзевага рэгістра). Іншы напісаў Тое сапраўды чудоўна, граматычна правільна, але больш блізка да выказвання "тое сапраўды дзіўнае" калі хтось адпраўляе вам мем.
Усе гэтыя варыянты абаронныя. Ніхто з іх не адзін і той жа. А калі вы запускаеце пераклады праз адну мадэль, вы ніколі не ўбачыце выбар, зроблены ў вашу карысць.
Гэта цэнтральнае пытанне, на якое гэты артыкул спрабуе адказаць. Не тое, які мадэль ШІ лепшая для перакладу ў 2026 годзе (адказ залежыць ад пары моў, рэгістра, дамена і структуры сказа), а скарэй: як бы вы ведалі, калі ваша мадэль прынесла памылковы рашэнне? Асабліва ў такіх дамэнах, як медыцынская тэрміналогія, юрыдычныя кантракты ці прафесійная фармальнасць, дзе памылковы рашэнне выглядае сапраўды як правільны пераклад, пакуль спецыяліст яго не прачытае.
Вось што я зрабіў. Я запусцiў 8 тэставых сказаў праз дзве раўнды мадэлей на MachineTranslation.com: спачатку базавы набор з 5 шырока выкарыстоўваных мадэлей, а потым расшыраны пул, які дадае некалькі новых варыянтаў мадэлей преміум-класа, даступных для платных карыстальнікаў. Звычайна, параўнанне вывадаў ад мадэляў, падобных гэтаму, азначала б асобныя платныя падпіскі ў кожнага пастаўшчыка паасобку. На MachineTranslation.com яны сядзяць у адным выглядзе параўнання. Пары моў былі англійская→японская і англійская→в'етнамская. Катэгорыі прапаноў былі выбраны спецыяльна для тэставання вобласцей, дзе неадзінства мадэлей найбольш значнае: ідыяматычныя фразы, юрыдычная тэрміналогія, медычная тэрміналогія, кантэкст, чувальны да фармальнасці, і наўмысная семантычная неадназначнасць.
Заўвага аб методалогіі ацэнкі: даследаванне машыннага перакладу доўга змаганалася з тым, як аўтаматычна ацэньваць вывады. Метрыкі як BLEU і COMET , вымеранныя ў агульных задачах WMT , даюць карысны агрэгаваны сігнал, але яны слаба выяўляюць памылкі рэгістра, недахопы ў ідыёмах і тэрміналагічную дакладнасць, менавіта катэгорыі, якія найбольш важныя тут. Тое, што вы збіраецеся чытаць, - гэта аналіз вывада, а не гонка BLEU.

Не кожны сказ паказвае значны разногалос. Два з восьмі тэстаў, "Let's touch base once the dust settles on this deal" (→ Japanese) і "We're burning the midnight oil to hit this launch date" (→ Vietnamese), паказалі высокую ўзгодненасць у абодвух раундах. Ідыёмы былі правільна зразумены як ідыёмы. Ніхто не перакладаў "touch base" як дакранення да фізічнай базы. Ніхто не перакладаў "the dust settles" як "сядзіменты падаюць".
Варта на гэтым спыніцца: ідіяматычная англійская дзелавая мова дастаткова добра апрацоўваецца сучаснымі мадэлямі на мяжы, калі ідіёма дастаткова распаўсюджаная. Консенсус адносна "touch base" заставаўся стабільным у абодвух раундах; варыяцыя была чыста стылістычнай, вакол таго, ці выкарыстоўваць この件 (гэтая справа), この取引 (гэтая угода), або この案件 (гэты выпадак) для зыходнай фразы.

Тэст "паленне поўначнага алею" — гэта месца, дзе рэчы сталі больш цікавымі. Кожная мадэль, акрамя адной, правільна зразумела фразеалагізм. MiniMax M2.7, прадстаўлены ў Раўндзе 2, перавёў "burning" літаральна, вырабляючы đốt đuốc, што значыць "гарячыя факелы." Консенсус правільна выключыў яго.

Японская мова - гэта мова з шарамі фармальнасці. Выбар канчатка дзеяслова, займенніка і рэферэнцыйнай формы іменніка не з'яўляецца стылістычным. Ён сігналізуе аб адносінах паміж гаворцом і адрасатам. Адправленне паведамлення вашаму генеральнаму дырэктару, выкарыстоўваючы непрацоўныя формы дзеяслова, не з'яўляецца памылкай перакладу ў граматычным сэнсе. Гэта сацыяльная памылка, і значная адна.
Тэставы сказ: Ты можаш гэта адправіць? Дзякуй, ацэню гэта. Кантэкст: паведамленне генеральнаму дырэктару.

Кансенсус змяніўся, калі расшырыўся пул мадэлей. Механізм простий: дадаванне мадэлей, якія правільна чытаюць кантэкст фармальнасці, зрушыла большасць, і кансенсус пайшоў за ім. Вось поўны спектр таго, што мадэлі вырабілі ў Раунде 2:

Вьетнамскі рэгістр тэста выявіў іншы тып памылкі фармальнасці, адзін, які больш тонкі. Зыходны сказ: Слухай, хуткае пытанне — ты свабодны, каб скочыць на выклік? Кантэкст: паведамленне кліенту. Qwen у першым раўндзе ўключыў "mình," займеннік першай асобы, які азначае непрацёмны дружбу на ўзроўні аднапакоўцаў. Усе іншыя мадэлі цалкам уникалі першаперсоннага самаспасылання, што з'яўляецца больш бяспечным прафесійным выбарам. Крыніцы, Qwen выправіў гэта ў Раунде 2 і выпусціў "mình." Консенсус у абодвух раундах яго выключыў.

Прапанова аб індэмніфікацыі паміж вендарам і клієнтам з'яўляецца стандартным пунктам у камерцыйных дагаворах: "Пастаўшчык павінен адшкодаваць клієнта ад любых прэтэнзій трэцяй стараны, вынікаючых з парушэння гэтай угоды."
У 1-м раундзе ўсе пяць мадэляў правільна вызначылі юрыдычны рэгістр і выкарысталі запазычаныя словы ベンダー (пастаўшчык) і クライアント (кліент), стандартныя ў японскіх камерцыйных кантрактах англійскага паходжання. Адзін выняток: GPT-4.1-NANO выкарыстаў 販売者 (seller) і 顧客 (customer), легітымныя японскія словы, якім не хапае фармальнай юрыдычнай спецыфічнасці эквівалентаў запазычаных словаў.
Больш важны вынік з'явіўся ў Раўндзе 2. Ключавое адрозненне паміж двума словамі:
Гэта юрыдычна розныя канцэпцыі. "Indemnify" конкрэтна азначае абарону стараны ад адказнасці перад трэцімі асобамі. 免責 - гэта правільны юрыдычны тэрмін. Усе мадэлі Round 1 выкарыстоўвалі 補償. У Раунде 2 DeepSeek V4-Pro была адзінай мадэллю, якая вырабіла 免責, і яна зрабіла гэта толькі ў Раунде 2, а не ў Раунде 1.

У кантрактзе 補償 і 免責 не з'яўляюцца сінонімамі. Адзін азначае "мы вам вярнём грошы." Другое значит "вы защищены ад претэнзіі з самага пачатку." Калі платформа перакладу выкарыстоўвае 補償 там, дзе 免責 правільна, адвокат, які чытае японскую версію, не ўбачыць той жа змовы, якую апісвае англійская версія.
Гэта найбольш значны вынік у наборы дадзеных. Тэставы сказ: "Гэты лекавы сродак противапаказаны пацыентам з гісторыяй печаночнай дысфункцыі." Крыніца: клінічная дакументацыя прадукту. Мэта: Вьетнамскі.
Крытычны тэрмін - "печаночнае пашкоджанне." Ёсць два в'етнамскія кандыдаты:
Гэтыя станы клінічна адрозніваюцца. Папярэджанне аб супярэчнасцях на аснове "печаночнай дысфункцыі" адносіцца да любога чалавека са зніжанай функцыяй печані, а не толькі да тых, хто перажыў поўны адказ органа. Выкарыстанне suy gan неправільна звужае указаную папуляцыю. Пацыент з умеранай печаночнай недастатковасцю, які чытае "suy gan", можа не прызнаць сябе ў контрапаказанай групе насельніцтва.

Некаторыя зыходныя сказы намеренна неадназначныя. "Гэта хвора" у сучаснаму англійскім сленгу азначае нешта выдатнае, але яно таксама ўсё яшчэ мае сваё літаральнае значэнне (гэта значыць адвратнае/гнусавое), і напружанне паміж гэтымі двума значэннямі - гэта частка таго, як фраза камунікуе. Вызов для мадэлі перакладу: ці захоўваеш ты неадназначнасць, звяртаеш яе да найбольш верагоднага значэння, ці выбіраеш адно і прыхіляешся да яго?


Мадэлі ў гэтым тэсце не ўсе эквівалентныя. Яныохопліваюць розныя архітэктуры, рэжымы навучання і кантэксты развёртвання. Раунд 1 базавая лінія ўключае мадэлі, якія шырока даступныя. Расшыраны пул Round 2 дадае некалькі новейшых варыянтаў мадэлей прэміум-узроўня, цяпер даступных плацячым карыстальнікам на MachineTranslation.com, того ж узроўня мадэлі, які іначай азначаў бы асобны плацяны рахунак у кожнага асобнага пастаўшчыка.

Расшыраны пул у Round 2 ўключае мадэлі, якія больш прадвінутыя і даступны плацячым карыстальнікам на MachineTranslation.com. Эфект расшырэння басейна неаднаўны. У некаторых тэстах (фармальнасць/японскі), ён значна змяніў кансенсус. У іншых (медычная тэрміналогія/В'етнамская), раскол паглыбіўся.

Тэставыя дадзеныя паказваюць на дзве адрозныя катэгорыі збояў, і яны патрабуюць розных адказаў.
Катэгорыя А: Бесшумныя збоі. Памылкі фармальнасці, памылкі рэгістра, дакладнасць медыцынскай тэрміналогіі: гэтыя памылкі вырабляюць вывады, якія выглядаюць правільна. Японская мова граматычна. Вьетнамец бегло говорит. Няма ніякіх вонкавых сігналаў, што што-небудзь пайшло не так. Монолінгвальны карыстальнік, чытаючы выхад адной мадэлі, не мае спосабу ведаць, што мадэль зрабіла выбар рэгістра, які заўважыў бы старшы японскі кіраўнік, ці што клінічны тэрмін быў звужаны так, як змяняе папуляцыю, да якой ён адносіцца.
Катэгорыя B: Видимыя адмоўленні. MiniMax перакладае "burning the midnight oil" як "burning torches." GPT-4.1-NANO разбірае "That's sick" на адназначны "すごい." Гэта вызначальныя, альбо па дыктору мовы-мішэні, альбо па параўнанні з іншымі выхадамі мадэлі.
Параўнанне мультымадэляў SMART найбольш каштоўнае ў катэгорыі A. Калі пяць ці дзесяць мадэляў вырабляюць выхады і большасць пагаджаецца з фармальным рэгістрам, а адзін вырабляе паўседзённы простая форма японскай мовы, разыходжанне видимо ў прадстаўленні параўнання. Карыстальнік, які гаворыць на мове-мішэні, можа ацаніць варыянты. Карыстальнік, які не можа ўбачыць, што было прынята спрэчная рашэнне, і вырашыць, ці варта гэта прапанова перагледзець чалавекам.
Для работы на ўзроўні дакумента, вялікіх файлаў, перакладу з захаваннем макета PDF-файлаў, кантрактаў або клінічных матэрыялаў, магчымасць платформы па апрацоўцы дакументаў справляецца са структурай файла без парушэння фарматавання. Але пытанні якасці, пакінутыя вышэй, прымяняюцца незалежна ад памеру файла. Клінічне дослідження на 100 старонках, дзе кожны выпадак "печаночнай недастатковасці" перакладаецца як "печаночная недастатковасць", — гэта большая версія той жа праблемы, выяўленай у Тэсце 2.
Для медыцынскіх і юрыдычных катэгорый, у прыватнасці, праверка чалавекам — гэта правільны спосаб кантролю. Сэрвіс пост-рэдагавання AI Tomedes, які спалучае вывад AI з сертыфікаванай праверкай чалавека менавіта для такога кантэнту з высокім ступенем ризыку, пабудаваны для гэтага. Расцепленне функцыі печэнкі / зніжэнне функцыі печэнкі - гэта менавіта той від знаходжання, які павінен выклікаць гэты агляд, не таму, што ўсе мадэлі памыляюцца, а таму, што мадэлі, якія найбольш упэўнены, не з'яўляюцца найбольш дакладнымі.
Каштоўнасць прагляду некалькіх выхадаў не ў тым, што вы заўсёды выбярэце большасць. Гэта значыць, што вы будзеце ведаць, што выбар быў зроблены, што адрозніваецца ад здагадкі, што вывад перад вамі правільны.

Пастаўце восем тэстаў рядам, і шаблон трымаецца: пагода і незгода не размяркаваны выпадкова. Ідыёматычная, штодзённая дзелавая мова ("звязацца", "працаваць ночамі") збегалася амаль у кожнай мадэлі ў пуле, у абодвух раундах. Фармальнасць, юрыдычная дакладнасць і медыцынская тэрміналогія не. Тэст на фармальнасць генеральнага дырэктара змяніўся з неафіцыйнага на афіцыйны толькі пасля ўключэння пашыранай групы. Клаўза аб відшкодаванні выявіла рэальнае юрыдычнае адрозненне (免責 vs. 補償), якое толькі адна мадэль у адным раунде правільна зразумела. Медыцынская тэрміналогія так і не была разрэшана ўвогуле, застаючыся на прыблізна 6 да 4 у абодвух раундах незалежна ад таго, якія мадэлі былі ў пуле.
Гэта актуальны вынік, а не маркетынгавая заява: кансенсус не робіць кожны сказ лепшым, і ён не павінен гэта рабіць. Гэта найбольш каштоўна менавіта там, дзе плыннасць адзінай мадэлі не дае вам ніякіх прычын сумнявацца, і дзе памылка на самай справе нешта коштуе.
Ёсць другі, больш практычны пласт гэтага тэста, варты ясна сказаць. Праводжанне гэтага параўнання самастойна азначала праверку вывадаў GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo і MiniMax M2.7 побач з існуючымі базавымі мадэлямі ў адным месцы на адной платформе. Па-за межамі MachineTranslation.com, гэта не адна падпіска. Гэта кілька, па адной для кожнага правайдэра, чыйны прэміум-ўзровень вы хочаце тэставаць, па той цэне, якую кожны правайдэр зарадзіць індывідуальна. Плацячыя карыстальнікі тут атрымліваюць тое ж параўнанне адным клікам, за частку кошту ўтрымання пяці асобных прэміум-подпісак, без адмовы ад таго, што сапраўды важна: бачыць, дзе мадэлі сагласныя, і ведаць дакладна, калі яны не сагласныя.
Ні адзін не з'яўляецца катэгарычна лепшым; гэта залежыць ад катэгорыі тэста. Claude Sonnet і Claude Opus паслядоўна выбіралі больш дакладны в'етнамскі медыцынскі тэрмін, а Claude Opus стварыў найбольш адпаведны сленг для "That's sick." Але Claude Sonnet таксама вырабіў паўсядзённую японскую мову ў фармальным кантэксце CEO-сказа, дзе GPT-5.5 атрымаў правільны адказ. Параўноўванне вывадаў непасрэдна больш абаронна, чым выбар адной мадэлі і даверанне ёй.
Яе няма; дакладнасць залежыць ад домена. Gemini 3.5-Flash і GLM-5-Turbo вырабілі найбольш адпаведны фармальны японскі у гэтым тэсце. Абодва мадэлі Claude былі найбольш дакладнымі ў В'етнамскай медыцынскай тэрміналогіі. DeepSeek V4-Pro быў адзіным мадэлем, які выкарыстаў правільны японскі юрыдычны тэрмін, але толькі ў раўндзе 2, і ён вырабляў паўседневны японскі ў іншых месцах. Ні адна мадэль не дамінавала ва ўсіх восьмі тэстах.
Не, не аўтаматычна. Пашырэнне пула з новымі варыянтамі мадэлей прэміум-класа змяніла кансенсус з непрыналежнага на фармальны ў японскім тэсце фармальнасці. Але ў вьетнамскім тэсце медыцынскай тэрміналогіі расцеп захаваўся прыблізна ў суадносінах 4 да 6 незалежна ад таго, якія мадэлі былі ўключаны. Больш мадэлей выяўляе больш разыходжанняў, што з'яўляецца карысным сігналам, але кансенсус усё ж ідзе ў след за большасцю, а большасць не заўсёды дае найбольш дакладны адказ.
SMART - гэта мультымодэльная сістэма кансенсуса MachineTranslation.com, якая ахоплівае да 22 мадэлей ШІ ад правайдэраў, уключаючы OpenAI, Anthropic, Google і DeepSeek. Ён запускае пераклад праз некалькі мадэлей адначасова і выводзіць вынік большасці-кансенсусу разам з адказам кожнай асобнай мадэлі, па змаўчанні, без неабходнасці канфігурацыі. Кансенсус змяняецца, калі змяняецца пул мадэляў, як паказана ў тэсце японскай фармальнасці гэтага тэста: неафіцыйны кансенсус у раунде 1 стаў фармальным у раунде 2.
Адзінай мадэлі няма; чалавечы агляд - гэта лепшы адказ. Модэлі Claude паслядоўна выбіралі больш дакладны В'етнамскі медыцынскі тэрмін, а DeepSeek V4-Pro адзін выкарыстаў правільны японскі юрыдычны тэрмін, але толькі ў Раўндзе 2. Медыцынская тэрміналогія так і не была вырашана на ўсіх 10 мадэлях, што сігналізуе аб неабходнасці дамэннага экспертызу, а не аб тым, што варта выбраць іншую мадэль. A сертыфікаваны чалавечы рэдактарскі агляд, як прапаноўвае Tomedes, забяспечвае гэты спецыялізаваны кантроль.