July 10, 2026
Два слова. Шість моделей. Три різні рішення щодо перекладу. Ось що сталося, коли я пропустив 8 тестових речень через найновіші моделі штучного інтелекту, доступні на MachineTranslation.com, і що насправді розкривають результати щодо того, коли модель мовчки дає збій.
Два слова. Це класно. Шість моделей. Три різні рішення щодо перекладу.
Японською мовою одна модель передала це як それはやばい, збереживши двозначність. Один повністю опустив займенник підмета і написав голу форму やばい, найбільш розмовну версію з можливих. Третій написав それはすごい, що повністю розв'язує неоднозначність на користь "дивовижного", видаляючи подвійне значення, яке робило фразу цікавою з самого початку. У В'єтнамській мові один модель написав Đỉnh vậy (сленг, правильно для молодіжного реєстру). Інший написав Thật tuyệt vời, граматично правильно, але ближче до того, щоб сказати "це справді чудово" коли хтось надсилає вам мем.
Усі ці варіанти є обґрунтованими. Жоден з них не є однаковим. А якщо ви запускаєте переклади через одну модель, ви ніколи не побачите вибір, зроблений від вашого імені.
Це центральне питання, на яке намагається відповісти ця стаття. Не те, який AI-модель найкраща для перекладу в 2026 році (відповідь залежить від мовної пари, регістру, домену та структури речення), а скоріше: як би ви знали, коли ваша модель прийняла неправильне рішення? Особливо в таких доменах, як медична термінологія, юридичні контракти або професійна формальність, де неправильне рішення виглядає точно як правильний переклад, поки його не прочитає спеціаліст.
Ось що я зробив. Я запустив 8 тестових речень через дві раунди моделей на MachineTranslation.com: спочатку базовий набір з 5 широко використовуваних моделей, а потім розширений набір, який додає кілька найновіших варіантів моделей преміум-класу, доступних для платних користувачів. Зазвичай, порівняння результатів роботи моделей на кшталт цієї означало б окремі платні підписки у кожного постачальника окремо. На MachineTranslation.com вони знаходяться в одному виді порівняння. Мовні пари були англійська→японська та англійська→в'єтнамська. Категорії речень були обрані спеціально для тестування областей, де розбіжність моделей найбільш суттєва: ідіоматичні вирази, юридична термінологія, медична термінологія, контекст, чутливий до формальності, та навмисна семантична неоднозначність.
Примітка щодо методології оцінювання: дослідження машинного перекладу давно борються з тим, як автоматично оцінювати результати. Метрики на кшталт BLEU та COMET , виміряні в спільних завданнях WMT , надають корисний сукупний сигнал, але вони погано виявляють помилки реєстру, невдачі ідіом та термінологічну точність, саме в тих категоріях, які мають найбільше значення тут. Те, що ви збираєтесь прочитати, є аналізом результатів, а не гонкою BLEU.

Не кожне речення викликає змістовну незгоду. Два з восьми тестів, "Let's touch base once the dust settles on this deal" (→ японська) та "We're burning the midnight oil to hit this launch date" (→ в'єтнамська), показали високу узгодженість в обох раундах. Ідіоми були правильно зрозумілі як ідіоми. Ніхто не перекладав "touch base" як дотик до фізичної бази. Ніхто не перекладав "the dust settles" як осадок, що падає.
Варто на цьому зупинитися: ідіоматична англійська ділова мова досить добре обробляється сучасними передовими моделями, коли ідіома достатньо поширена. Консенсус щодо "touch base" залишався стабільним у обох раундах; варіація була суто стилістичною, навколо того, чи використовувати この件 (цей питання), この取引 (цей договір), або この案件 (цей випадок) для вихідної фрази.

Тест "спалювання опівнічної олії" — ось де все стало цікавішим. Усі моделі, крім однієї, правильно зрозуміли цей вислів. MiniMax M2.7, представлений у Раунді 2, перекладав "burning" буквально, створюючи đốt đuốc, що означає "горючі смолоскипи". Консенсус правильно його виключив.

Японська мова — це мова з багатошаровою формальністю. Вибір закінчення дієслова, займенника та форми референційного іменника не є стилістичним. Це сигналізує про взаємозв'язок між мовцем і одержувачем. Надсилання повідомлення вашому генеральному директору з використанням невимушених форм дієслова не є помилкою перекладу в граматичному сенсі. Це соціальна помилка, і значна.
Тестове речення: Ти можеш це надіслати? Дякую, дуже це цінюю." Контекст: повідомлення генеральному директору.

Консенсус змінився, коли розширився пул моделей. Механізм простий: додавання моделей, які правильно читають контекст формальності, змістило більшість, і консенсус послідував. Ось повний спектр того, що моделі створили в Раунді 2:

Тест В'єтнамського реєстру виявив інший вид помилки формальності, один, що є тонкішим. Вихідне речення: Слухай, швидке питання — ти вільний, щоб зв'язатися по телефону? Контекст: повідомлення клієнту. Qwen у першому раунді включив "mình," займенник першої особи, який передбачає невимушене дружелюбне спілкування на рівні однолітків. Усі інші моделі повністю уникали самовідносин від першої особи, що є безпечнішим професійним вибором. Найважливіше, що Qwen виправив це у Раунді 2 і видалив "mình." Консенсус в обох раундах його виключив.

Речення про відшкодування збитків постачальником/клієнтом є стандартною статтею в комерційних угодах: "**Поставщик повинен відшкодувати клієнту будь-які претензії третіх сторін, що виникають внаслідок порушення цієї угоди.**"
У Раунді 1 усі п'ять моделей правильно визначили юридичний регістр і використали запозичення ベンダー (постачальник) і クライアント (клієнт), стандартні в японських комерційних договорах англійського походження. Одне виключення: GPT-4.1-NANO використав 販売者 (seller) та 顧客 (customer), легітимні японські слова, які не мають формальної юридичної специфічності еквівалентів запозичених слів.
Більш важливе відкриття виникло в Раунді 2. Ключова відмінність між двома словами:
Це юридично різні концепції. «Indemnify» конкретно означає захистити сторону від відповідальності перед третіми особами. 免責 є правильним юридичним терміном. Усі моделі Раунду 1 використовували 補償. У Раунді 2 DeepSeek V4-Pro була єдиною моделлю, яка створила 免責, і вона зробила це лише в Раунді 2, а не в Раунді 1.

У контракті 補償 та 免責 не є синонімами. Один означає "ми вам відшкодуємо." Інший означає "ви захищені від претензії з самого початку". Якщо платформа перекладу використовує 補償 там, де 免責 є правильним, адвокат, який читає японську версію, не побачить ту саму угоду, яку описує англійська версія.
Це найбільш значиме відкриття в наборі даних. Тестове речення: Це лікарське засіб протипоказаний пацієнтам з історією порушення функції печінки. Джерело: клінічна документація продукту. Ціль: Вʼєтнамський.
Критичним терміном є "печінкова недостатність." Є два в'єтнамські кандидати:
Це клінічно відмінні. Попередження про протипоказання на основі "порушення функції печінки" стосується будь-якої особи зі зниженою функцією печінки, а не лише тих, хто перенесли повну органну недостатність. Використання suy gan неправильно звужує вказану популяцію. Пацієнт з помірним порушенням функції печінки, який читає "suy gan", може не визнати себе як протипоказану популяцію.

Деякі вихідні речення навмисно двозначні. "Це хворобливо" у сучасному англійському сленгу означає щось чудове, але воно також зберігає своє буквальне значення (тобто огидне/відразливе), і напруження між цими двома значеннями є частиною того, як фраза передає сенс. Завдання для моделі перекладу полягає в наступному: ви зберігаєте двозначність, звужуєте її до найбільш ймовірного значення чи вибираєте одне і дотримуєтесь його?


Моделі в цьому тесті не всі еквівалентні. Вони охоплюють різні архітектури, режими навчання та контексти розгортання. Базова лінія Раунду 1 включає моделі, які широко доступні. Розширений пул Round 2 додає кілька найновіших варіантів моделей преміум-класу, які тепер доступні платним користувачам на MachineTranslation.com, того ж рівня моделей, які в іншому випадку означали б окремий платний рахунок у кожного окремого постачальника.

Розширений пул у Round 2 включає моделі, які є більш просунутими та доступні платним користувачам на MachineTranslation.com. Вплив розширення басейну неоднорідний. У деяких тестах (формальність/японська мова) це значно змінило консенсус. У інших (медична термінологія/В'єтнамська), розкол поглибився.

Тестові дані вказують на дві різні категорії збоїв, і вони вимагають різних відповідей.
Категорія A: Тихі збої. Помилки формальності, помилки регістру, точність медичної термінології: вони створюють результати, які виглядають коректно. Японська мова є граматичною. Вʼєтнамець вільно говорить. Немає жодних зовнішніх ознак того, що щось пішло не так. Монолінгвальний користувач, який читає результат роботи однієї моделі, не має можливості дізнатися, що модель зробила вибір регістру, який помітив би старший японський керівник, або що клінічний термін був звужений таким чином, що змінює популяцію, до якої він застосовується.
Категорія B: Видимі помилки. MiniMax перекладає "burning the midnight oil" як "burning torches." GPT-4.1-NANO розв'язує "That's sick" до однозначного "すごい." Це можна виявити або носієм цільової мови, або порівнянням з іншими результатами моделей.
Багатомодельне порівняння, яке надає SMART, найбільш цінне в категорії A. Коли п'ять або десять моделей виробляють результати і більшість погоджується на формальний реєстр, а одна виробляє випадкову простої форми японської мови, незгода видна в представленні порівняння. Користувач, який говорить мовою-мішенню, може оцінити варіанти. Користувач, який не може побачити, що було прийнято оспорюване рішення, може вирішити, чи потребує це речення людського перегляду.
Для роботи в масштабі документа, великих файлів, перекладу PDF-файлів з збереженням макета, контрактів або клінічних матеріалів, можливість обробки документів платформи обробляє структуру файлів без порушення форматування. Але питання якості, порушені вище, застосовуються незалежно від розміру файлу. 100-сторінкове клінічне дослідження, де кожен випадок "порушення функції печінки" перекладається як "печінкова недостатність", є більшою версією тієї ж проблеми, виявленої в Тесті 2.
Для медичної та юридичної категорій, зокрема, людська перевірка є правильним запобіжником. Служба постредагування AI компанії Tomedes, яка поєднує вихідні дані AI із сертифікованим людським рецензуванням саме для такого контенту з високими ставками, була розроблена для цього. Розщеплення suy gan / suy giảm chức năng gan — це саме той тип знахідки, який повинен спровокувати цей перегляд, не тому, що всі моделі неправильні, а тому, що моделі, які найбільш впевнені, не є найточнішими.
Цінність перегляду декількох результатів полягає не в тому, що ви завжди виберете більшість. Це означає, що ви знатимете, що вибір був зроблений, що відрізняється від припущення, що результат перед вами є правильним.

Поставте вісім тестів поруч, і закономірність утримується: згода та незгода розподіляються не випадково. Ідіоматична, повсякденна ділова мова ("зв'язатися", "працювати до пізної ночі") була однаковою майже у всіх моделей у пулі, в обох раундах. Формальність, юридична точність та медична термінологія не мали. Тест CEO-формальності змінився з невимушеного на формальний лише після включення розширеної групи. Клаузула про відшкодування шкоди виявила справжню юридичну різницю (免責 vs. 補償), яку лише одна модель в одному раунді правильно зрозуміла. Медична термінологія ніколи повністю не була узгоджена, залишаючись приблизно на рівні 6 до 4 в обох раундах незалежно від того, які моделі були в пулі.
Це фактичне знахідка, а не маркетингова заява: консенсус не робить кожне речення кращим, і йому це не потрібно. Це найбільш цінно саме там, де вільне володіння однією моделлю не дає вам жодної причини сумніватися в ній, і де помилка насправді щось коштує.
Існує другий, більш практичний рівень цього тесту, який варто сформулювати ясно. Проведення цього порівняння самостійно означало перевірку результатів роботи GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo та MiniMax M2.7 поруч із існуючими базовими моделями в одному місці на одній платформі. Поза межами MachineTranslation.com це не одна підписка. Це кілька, по одній для кожного постачальника, чий преміум-рівень ви хочете протестувати, за будь-якою ціною, яку кожен постачальник встановлює індивідуально. Платні користувачі тут отримують те саме порівняння одним клацанням, за частку вартості утримання п'яти окремих преміум-підписок, не відмовляючись від того, що насправді важливо: бачити, де моделі збігаються, і точно знати, коли вони не збігаються.
Жоден не є категорично кращим; це залежить від категорії тесту. Claude Sonnet і Claude Opus послідовно обирали точніший в'єтнамський медичний термін, а Claude Opus створив найбільш відповідний сленг для вислову "That's sick." Але Claude Sonnet також створив невимушену японську мову у формальному реченні контексту генерального директора, де GPT-5.5 це зробив правильно. Порівняння результатів безпосередньо є більш обґрунтованим, ніж вибір однієї моделі та довіра до неї.
Такої немає; точність залежить від галузі. Gemini 3.5-Flash та GLM-5-Turbo створили найбільш відповідну формальну японську мову в цьому тесті. Обидві моделі Claude були найточнішими в термінології в'єтнамської медицини. DeepSeek V4-Pro була єдиною моделлю, яка використала правильний японський юридичний термін, але лише в раунді 2, і вона виробляла невимушену японську мову в інших місцях. Жодна окрема модель не домінувала у всіх восьми тестах.
Ні, не автоматично. Розширення набору новіших варіантів моделей преміум-класу змістило консенсус з невимушеного на формальний у тесті японської ввічливості. Але у тесті в'єтнамської медичної термінології розділення збереглося приблизно на рівні 6 до 4 незалежно від того, які моделі були включені. Більше моделей виявляють більше розбіжностей, що є корисним сигналом, але консенсус все ще слідує більшості, а більшість не завжди дає найточнішу відповідь.
SMART — це багатомодельна система консенсусу MachineTranslation.com, яка охоплює до 22 моделей штучного інтелекту від провайдерів, включаючи OpenAI, Anthropic, Google та DeepSeek. Він запускає переклад через кілька моделей одночасно і виводить результат консенсусу більшості разом із відповіддю кожної окремої моделі, за замовчуванням, без необхідності налаштування. Консенсус змінюється, коли змінюється набір моделей, як показано в результаті японської формальності цього тесту: неформальний консенсус у Раунді 1 став формальним у Раунді 2.
Немає однієї моделі; людський огляд — це краща відповідь. Моделі Claude послідовно обирали більш точний в'єтнамський медичний термін, а DeepSeek V4-Pro один використав правильний японський юридичний термін, але лише у Раунді 2. Медична термінологія так і не була узгоджена в 10 моделях, що сигналізує про необхідність спеціалізованих знань, а не про вибір іншої моделі. Сертифікована перевірка постредагування людиною, як пропонує Tomedes, забезпечує цю спеціалізовану перевірку.