June 5, 2026
Я проводжу внутрішні тести чогось, про що ми недостатньо говоримо в галузі перекладу: не про те, чи перекладають різні системи ШІ по-різному, а про те, чи різні версії того самого ШІ перекладають по-різному — і наскільки.
Минулого тижня я запустив один іспанський ідіоматичний вислів через п'ять версій ChatGPT одночасно на внутрішній тестовій платформі MachineTranslation.com. Те, що вийшло, мене зупинило.
Дві версії дали переклад, який, щиро кажучи, є нісенітницею англійською мовою. Три версії дали правильні ідіоматичні переклади. А три правильні відповіді не збігалися між собою. Усі п'ять — це
ChatGPT. Усі п'ять — OpenAI. Такий самий ШІ, інша модель — і результати не могли бути більш різними.
}Я ділюся цим зараз, тому що вважаю, що це важливо, а не тому, що маю чіткі відповіді. Я ні. Але спостереження достатньо цікаве, щоб випустити його у світ.
Фраза, яку я тестував, була llevarse el gato al agua.

Ось що видала кожна версія:
| Модель | Вивід | Ідіоматично? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | нести кота до води | ❌ Буквально |
| ChatGPT::GPT-4.1-NANO | нести кота до води | ❌ Буквально |
| ChatGPT::GPT-4.1-MINI | зробити це успішно | ✅ Правильно |
| ChatGPT::GPT-5.4-MINI | досягти свого | ✅ Частково |
| ChatGPT::GPT-5.4 | вийти переможцем | ✅ Правильно |
Фраза означає досягти чогось складного всупереч обставинам, здобути важку перемогу. Це не має нічого спільного з котами чи водою. Буквальний переклад не є перекладом. Це дослівний запис фрази, яку модель не змогла розпізнати як ідіому.
GPT-4o-MINI та GPT-4.1-NANO видали ідентичні результати. Не схожі, ідентичні. Наші перекладацькі інсайти позначили це безпосередньо: GPT-4.1-nano та GPT-4o-mini мають однакові переклади, наголошуючи на буквальному тлумаченні, а не на ідіоматичному значенні.
GPT-4.1-MINI, GPT-5.4-MINI та GPT-5.4 кожен видав щось впізнавано правильне — але не однакове.
Я хочу бути точним щодо того, чому llevarse el gato al agua є корисним тестовим вхідним даними, а не випадково обраним.
Це добре встановлена ідіома. Він з'являється в літературі, журналістиці та повсякденній мові. Це не є незрозумілим. Будь-яка модель, навчена на розумному корпусі іспанського тексту, повинна була його зустріти. Питання не в тому, чи бачила модель цю фразу. Питання полягає в тому, що він з цим робить.
Найгірший сценарій збою при перекладі ідіом — це не отримання поганого перекладу. Це створює дослівний переклад, який виглядає прийнятним для того, хто не знає цільової мови.
To carry the cat to the water (буквально нести кота до води) є граматично правильним англійським висловом. Це добре сформовано. Звучить як щось, що може щось означати. Користувач, який не розмовляє іспанською, може прочитати це, кивнути і піти далі — ніколи не знаючи, що початковий зміст був повністю втрачений.
Це той режим збою, який мене хвилює. Не очевидна помилка. Незримий.
Закономірність тут не випадкова. Дві моделі, які дали буквальні переклади (GPT-4o-MINI та GPT-4.1-NANO), є меншими , легшими моделями, оптимізованими для швидкості та економічної ефективності. Три моделі, які дали ідіоматичні переклади (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), представляють інше покоління або масштаб параметрів.
Це свідчить про те, що, на мою думку, недостатньо досліджено: ідіоматична компетентність у перекладі масштабується з потужністю моделі так, як це не видно на загальних бенчмарках.
Загальні мовні бенчмарки тестують міркування, знання, кодування, математику. Вони зазвичай не перевіряють, чи може модель визначити , що йде дощ як з відра не стосується погодних умов, або що llevarse el gato al agua не стосується зволоження кота. Ідіоми знаходяться на перетині культурних знань, контекстуальних висновків та розпізнавання образів — і цей перетин, здається, вимагає такого рівня потужності моделі, який менші моделі не послідовно досягають.
Чого я не стверджую: що більші моделі завжди є кращими перекладачами. Я не маю доказів цього як загального правила. Те, що я спостерігаю: що для ідіоматичного контенту зокрема, розрив між версіями в межах сім'ї був більшим, ніж я очікував.
Більшість користувачів, які використовують інструмент перекладу зі штучним інтелектом, не знають, яку версію цього ШІ вони використовують. Вони відкривають продукт, вибирають мовну пару і отримують результат. Маршрутизація моделі для них невидима.
Це має значення у великих масштабах. MachineTranslation.com обробив понад сотні тисяч завдань з перекладу з англійської на іспанську за один 90-денний період. Якщо значна частина цих завдань стосувалася ідіоматичного контенту (маркетингові тексти, юридична мова, літературні тексти, повсякденне спілкування), а інструмент, який розподіляв ці завдання, без відома користувачів спрямовував їх до меншої моделі, то фраза «нести кота до води» з’являлася в реальних результатах, у реальних документах, для реальних людей, які довіряли результату. Індустрія перекладів роками порівнювала постачальників ШІ. DeepL проти Google.
Клод проти ChatGPT. Ці порівняння є корисними. Але в межах одного постачальника розрив у версіях може бути таким же значним — і це розрив, який більшість порівняльних фреймворків не вимірюють, оскільки вони не тестують на рівні версій моделі. Коли хтось каже «Я використовую ChatGPT для перекладу», це речення недостатньо конкретне, щоб бути значущим.
Який ChatGPT? Нано? 4o-міні? 4.1-міні? 5.4? Відповідь змінює вихідні дані нетривіальними способами , принаймні для ідіоматичного контенту.
Це та частина, яка мене найбільше цікавить, і я ще не до кінця зрозумів, що з цим робити.
Три моделі, які дали ідіоматичні переклади, надали три різні варіанти:
Усі три є прийнятними англійськими перекладами llevarse el gato al agua. Але вони не еквівалентні.
Зробити це наголошує на виконанні всупереч труднощам, ви зробили щось складне, і це спрацювало. Домогтися свогонаголошує на досягненні бажаного результату, менше наголошуючи на труднощах. «Вийти переможцем» підкреслює змагальну перемогу, виграш відносно інших.
Оригінальний іспанський вислів найближчий до першого з них. Фраза несе відтінок подолання опору, а не простого вибору одного результату та його реалізації. Але «домогтися свого» і «вийти переможцем» не є неправильними, вони просто неточні в різних напрямках. Це ставить питання, яке я вважаю справді складним: коли три моделі кожна дає правильний, але відмінний ідіоматичний переклад, як оцінити, який з них
найкращий? Оцінки BLEU порівнюються з эталонним перекладом — але хто написав еталон, і який із цих трьох вони б обрали?
Наш агент перекладу зі штучним інтелектом, до його честі, поставив правильне запитання перед тим, як надати будь-який результат: Яке значення фразеологізму «llevarse el gato al agua» мається на увазі в цьому контексті? Було запропоновано три варіанти: досягти важкої мети, взяти щось непотрібне або зайнятися ризикованою діяльністю. Це питання не є декоративним. Це механізм, за допомогою якого контекстна неоднозначність вирішується перед остаточним перекладом.
Але суть залишається: три правильні відповіді, три різні відтінки значення. Інструменти оцінки перекладу не створені для такого роду нюансів.
Я хочу бути чесним щодо обмежень того, що показує цей тест.
Один ідіоматичний вислів, одна мовна пара, один день внутрішнього тестування. Це не дослідження. Це спостереження. Я не знаю, чи ця закономірність (менші моделі за замовчуванням використовують буквальний переклад, більші моделі досягають ідіоматичного) послідовно зберігається для:
Я також не знаю, чи є це стабільною властивістю цих моделей, чи чимось, що змінюється з оновленнями та доналаштуванням. Постачальники моделей не публікують списки змін, специфічних для перекладу. Модель, яка сьогодні правильно обробляє llevarse el gato al agua, може бути оновлена наступного місяця, і ми не матимемо жодного способу дізнатися про це.
Що я знаю: цей тест дав результат, настільки цікавий , що я хочу провести більше таких тестів, більш систематично, для більшої кількості мовних пар та типів контенту. Коли мені буде чим поділитися, я це зроблю.
Я закінчу двома питаннями, які залишилися в мене після цього тесту. Я не буду їм відповідати, у мене ще немає даних для цього. Але я думаю, що це правильні запитання, які варто поставити.
По-перше: при якому параметричному порозі ідіоматична компетентність стає надійною?
Перехід від GPT-4o-MINI та GPT-4.1-NANO (обидва буквальні) до GPT-4.1-MINI (ідіоматичний) свідчить про те, що існує поріг десь у діапазоні параметрів між цими розмірами моделей, де вмикається розпізнавання ідіом. Це послідовно? Чи стосується це ідіом усіма мовами, чи це залежить від того, наскільки добре представлена мова в навчальних даних? Я не знаю. Але знання було б корисним для будь-кого, хто створює робочі процеси перекладу.
Друге: скільки коштує непрозорість версії моделі для користувачів у великих масштабах?
Якщо користувач щомісяця обробляє 1000 документів за допомогою інструменту, який не розкриває, яка версія моделі використовується (і деякі з цих документів містять ідіоматичний контент), як часто буде відбуватися буквальний збій непомітно? Як вони дізнаються? Яка вартість, у реальному вираженні, того, щоб ніколи не дізнатися?
Я вважаю, що це набагато важливіше питання, ніж більшість порівнянь «який ШІ найкраще підходить для перекладу», які зараз поширюються. Відповідь полягає не в тому, щоб «використовувати найбільшу модель». Відповідь може бути такою: know знайте, що ви використовуєте, проводьте власні тести на власному контенті й не припускайте, що ім'я одного постачальника є гарантією однакової поведінки для всього ряду його моделей.
Це, принаймні, те, що я виніс із цього тесту.
Виходячи з цього єдиного тесту: менші, оптимізовані за ефективністю моделі в межах однієї родини ШІ за замовчуванням перекладали дослівно відомий іспанський ідіоматичний вислів, тоді як більші/новіші версії тієї ж моделі дали правильні ідіоматичні переклади. Чи справджується це для категорій ідіом та мовних пар — це наступне питання. Я проведу більше тестів.
GPT-4.1-MINI, GPT-5.4-MINI та GPT-5.4 переклалиllevarse el gato al agua ідіоматично — але в різні англійські вирази з тонкими відмінностями у конотаціях. Це свідчить , що якість ідіоматичного перекладу має принаймні два виміри: чи розпізнає модель ідіому взагалі, і який еквівалентний вираз вона обирає з доступних варіантів цільової мови. Стандартні метрики якості перекладу не чітко розділяють ці два виміри. Я думаю, їм слід.
Цей допис базується на внутрішньому тестуванні на платформі розробки MachineTranslation.com. Багатомодельне тестування версій, показане тут, ще не є загальнодоступним. Я ділюся цим висновком, тому що вважаю, що спостереження корисне незалежно від того, де ви виконуєте переклади.