June 5, 2026

Такий самий ШІ, інша модель — і переклади не могли бути різними

Я проводжу внутрішні тести чогось, про що ми недостатньо говоримо в галузі перекладу: не про те, чи перекладають різні системи ШІ по-різному, а про те, чи різні версії того самого ШІ перекладають по-різному — і наскільки.

Минулого тижня я запустив один іспанський ідіоматичний вислів через п'ять версій ChatGPT одночасно на внутрішній тестовій платформі MachineTranslation.com. Те, що вийшло, мене зупинило.

Дві версії дали переклад, який, щиро кажучи, є нісенітницею англійською мовою. Три версії дали правильні ідіоматичні переклади. А три правильні відповіді не збігалися між собою. Усі п'ять — це

ChatGPT. Усі п'ять — OpenAI. Такий самий ШІ, інша модель — і результати не могли бути більш різними.

}Я ділюся цим зараз, тому що вважаю, що це важливо, а не тому, що маю чіткі відповіді. Я ні. Але спостереження достатньо цікаве, щоб випустити його у світ.

Зміст

  • Тест: Одна іспанська ідіома, п’ять версій GPT
  • Чому ця ідіома є гарним тестовим випадком
  • Що розділення від буквального до ідіоматичного говорить нам про те, як ці моделі були навчені
  • Наслідок, про який, здається, ніхто не говорить
  • Навіть правильні переклади не збігалися
  • Чого я ще не знаю
  • Два дослідницькі питання, над якими варто подумати

Тест: Один іспанський ідіоматичний вислів, п’ять версій GPT

Фраза, яку я тестував, була llevarse el gato al agua.


Ось що видала кожна версія:

Модель                                          Вивід                                               Ідіоматично?
ChatGPT::GPT-4o-MINI нести кота до води ❌ Буквально
ChatGPT::GPT-4.1-NANO нести кота до води ❌ Буквально
ChatGPT::GPT-4.1-MINI зробити це успішно ✅ Правильно
ChatGPT::GPT-5.4-MINI досягти свого ✅ Частково
ChatGPT::GPT-5.4 вийти переможцем ✅ Правильно

Фраза означає досягти чогось складного всупереч обставинам, здобути важку перемогу. Це не має нічого спільного з котами чи водою. Буквальний переклад не є перекладом. Це дослівний запис фрази, яку модель не змогла розпізнати як ідіому.

GPT-4o-MINI та GPT-4.1-NANO видали ідентичні результати. Не схожі, ідентичні. Наші перекладацькі інсайти позначили це безпосередньо: GPT-4.1-nano та GPT-4o-mini мають однакові переклади, наголошуючи на буквальному тлумаченні, а не на ідіоматичному значенні.

GPT-4.1-MINI, GPT-5.4-MINI та GPT-5.4 кожен видав щось впізнавано правильне — але не однакове.

Чому ця ідіома є гарним тестовим випадком

Я хочу бути точним щодо того, чому llevarse el gato al agua є корисним тестовим вхідним даними, а не випадково обраним.

Це добре встановлена ідіома. Він з'являється в літературі, журналістиці та повсякденній мові. Це не є незрозумілим. Будь-яка модель, навчена на розумному корпусі іспанського тексту, повинна була його зустріти. Питання не в тому, чи бачила модель цю фразу. Питання полягає в тому, що він з цим робить.

Найгірший сценарій збою при перекладі ідіом — це не отримання поганого перекладу. Це створює дослівний переклад, який виглядає прийнятним для того, хто не знає цільової мови.

To carry the cat to the water (буквально нести кота до води) є граматично правильним англійським висловом. Це добре сформовано. Звучить як щось, що може щось означати. Користувач, який не розмовляє іспанською, може прочитати це, кивнути і піти далі — ніколи не знаючи, що початковий зміст був повністю втрачений.

Це той режим збою, який мене хвилює. Не очевидна помилка. Незримий.

Що розкол між буквальним і ідіоматичним говорить нам про те, як тренувалися ці моделі

Закономірність тут не випадкова. Дві моделі, які дали буквальні переклади (GPT-4o-MINI та GPT-4.1-NANO), є меншими , легшими моделями, оптимізованими для швидкості та економічної ефективності. Три моделі, які дали ідіоматичні переклади (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), представляють інше покоління або масштаб параметрів.

Це свідчить про те, що, на мою думку, недостатньо досліджено: ідіоматична компетентність у перекладі масштабується з потужністю моделі так, як це не видно на загальних бенчмарках.

Загальні мовні бенчмарки тестують міркування, знання, кодування, математику. Вони зазвичай не перевіряють, чи може модель визначити , що йде дощ як з відра не стосується погодних умов, або що llevarse el gato al agua не стосується зволоження кота. Ідіоми знаходяться на перетині культурних знань, контекстуальних висновків та розпізнавання образів — і цей перетин, здається, вимагає такого рівня потужності моделі, який менші моделі не послідовно досягають.

Чого я не стверджую: що більші моделі завжди є кращими перекладачами. Я не маю доказів цього як загального правила. Те, що я спостерігаю: що для ідіоматичного контенту зокрема, розрив між версіями в межах сім'ї був більшим, ніж я очікував.

Наслідок, про який, здається, ніхто не говорить

Більшість користувачів, які використовують інструмент перекладу зі штучним інтелектом, не знають, яку версію цього ШІ вони використовують. Вони відкривають продукт, вибирають мовну пару і отримують результат. Маршрутизація моделі для них невидима.

Це має значення у великих масштабах. MachineTranslation.com обробив понад сотні тисяч завдань з перекладу з англійської на іспанську за один 90-денний період. Якщо значна частина цих завдань стосувалася ідіоматичного контенту (маркетингові тексти, юридична мова, літературні тексти, повсякденне спілкування), а інструмент, який розподіляв ці завдання, без відома користувачів спрямовував їх до меншої моделі, то фраза «нести кота до води» з’являлася в реальних результатах, у реальних документах, для реальних людей, які довіряли результату. Індустрія перекладів роками порівнювала постачальників ШІ. DeepL проти Google.‎

Клод проти ChatGPT. Ці порівняння є корисними. Але в межах одного постачальника розрив у версіях може бути таким же значним — і це розрив, який більшість порівняльних фреймворків не вимірюють, оскільки вони не тестують на рівні версій моделі. Коли хтось каже «Я використовую ChatGPT для перекладу», це речення недостатньо конкретне, щоб бути значущим.‎

Який ChatGPT? Нано? 4o-міні? ‎4.1-міні? 5.4? Відповідь змінює вихідні дані нетривіальними способами , принаймні для ідіоматичного контенту.

Навіть «правильні» переклади розходилися між собою

Це та частина, яка мене найбільше цікавить, і я ще не до кінця зрозумів, що з цим робити.

Три моделі, які дали ідіоматичні переклади, надали три різні варіанти:

  • GPT-4.1-MINI: to pull it off successfully
  • GPT-5.4-MINI: to get one's way
  • GPT-5.4: to come out on top

Усі три є прийнятними англійськими перекладами llevarse el gato al agua‎. Але вони не еквівалентні.

Зробити це наголошує на виконанні всупереч труднощам, ви зробили щось складне, і це спрацювало. Домогтися свогонаголошує на досягненні бажаного результату, менше наголошуючи на труднощах. ‎«Вийти переможцем» підкреслює змагальну перемогу, виграш відносно інших.

Оригінальний іспанський вислів найближчий до першого з них. Фраза несе відтінок подолання опору, а не простого вибору одного результату та його реалізації. Але «домогтися свого» і «вийти переможцем» не є неправильними, вони просто неточні в різних напрямках. Це ставить питання, яке я вважаю справді складним: коли три моделі кожна дає правильний, але відмінний ідіоматичний переклад, як оцінити, який з них

найкращий?‎ Оцінки BLEU порівнюються з эталонним перекладом — але хто написав еталон, і який із цих трьох вони б обрали?

Наш агент перекладу зі штучним інтелектом, до його честі, поставив правильне запитання перед тим, як надати будь-який результат: Яке значення фразеологізму «llevarse el gato al agua» мається на увазі в цьому контексті? Було запропоновано три варіанти: досягти важкої мети, взяти щось непотрібне або зайнятися ризикованою діяльністю.‎ Це питання не є декоративним. Це механізм, за допомогою якого контекстна неоднозначність вирішується перед остаточним перекладом.

Але суть залишається: три правильні відповіді, три різні відтінки значення. Інструменти оцінки перекладу не створені для такого роду нюансів.

Чого я ще не знаю

Я хочу бути чесним щодо обмежень того, що показує цей тест.

Один ідіоматичний вислів, одна мовна пара, один день внутрішнього тестування. Це не дослідження. Це спостереження. Я не знаю, чи ця закономірність (менші моделі за замовчуванням використовують буквальний переклад, більші моделі досягають ідіоматичного) послідовно зберігається для:

  • Інших іспанських ідіом
  • Інших мовних пар з багатими ідіоматичними традиціями (на думку спадають арабська, японська, російська)
  • Неідіоматичного контенту, де розходження не застосовується
  • Граничних випадків, коли менша модель правильно розуміє ідіому, а більша її пропускає

Я також не знаю, чи є це стабільною властивістю цих моделей, чи чимось, що змінюється з оновленнями та доналаштуванням. Постачальники моделей не публікують списки змін, специфічних для перекладу. Модель, яка сьогодні правильно обробляє llevarse el gato al agua, може бути оновлена наступного місяця, і ми не матимемо жодного способу дізнатися про це.

Що я знаю: цей тест дав результат, настільки цікавий , що я хочу провести більше таких тестів, більш систематично, для більшої кількості мовних пар та типів контенту. Коли мені буде чим поділитися, я це зроблю.

Два дослідницькі питання, над якими варто подумати

Я закінчу двома питаннями, які залишилися в мене після цього тесту. Я не буду їм відповідати, у мене ще немає даних для цього. Але я думаю, що це правильні запитання, які варто поставити.

По-перше: при якому параметричному порозі ідіоматична компетентність стає надійною?

Перехід від GPT-4o-MINI та GPT-4.1-NANO (обидва буквальні) до GPT-4.1-MINI (ідіоматичний) свідчить про те, що існує поріг десь у діапазоні параметрів між цими розмірами моделей, де вмикається розпізнавання ідіом. Це послідовно? Чи стосується це ідіом усіма мовами, чи це залежить від того, наскільки добре представлена мова в навчальних даних? Я не знаю. Але знання було б корисним для будь-кого, хто створює робочі процеси перекладу.

Друге: скільки коштує непрозорість версії моделі для користувачів у великих масштабах?

Якщо користувач щомісяця обробляє 1000 документів за допомогою інструменту, який не розкриває, яка версія моделі використовується (і деякі з цих документів містять ідіоматичний контент), як часто буде відбуватися буквальний збій непомітно? Як вони дізнаються? Яка вартість, у реальному вираженні, того, щоб ніколи не дізнатися?

Я вважаю, що це набагато важливіше питання, ніж більшість порівнянь «який ШІ найкраще підходить для перекладу», які зараз поширюються. Відповідь полягає не в тому, щоб «використовувати найбільшу модель». Відповідь може бути такою: know знайте, що ви використовуєте, проводьте власні тести на власному контенті й не припускайте, що ім'я одного постачальника є гарантією однакової поведінки для всього ряду його моделей.

Це, принаймні, те, що я виніс із цього тесту.

Дослідницькі питання

1. Чи надійно розмір моделі прогнозує якість ідіоматичного перекладу?

Виходячи з цього єдиного тесту: менші, оптимізовані за ефективністю моделі в межах однієї родини ШІ за замовчуванням перекладали дослівно відомий іспанський ідіоматичний вислів, тоді як більші/новіші версії тієї ж моделі дали правильні ідіоматичні переклади. Чи справджується це для категорій ідіом та мовних пар — це наступне питання. Я проведу більше тестів.

2. Чому три «правильні» ідіоматичні переклади дали три суттєво різні результати?

GPT-4.1-MINI, GPT-5.4-MINI та GPT-5.4 переклалиllevarse el gato al agua ідіоматично — але в різні англійські вирази з тонкими відмінностями у конотаціях. Це свідчить , що якість ідіоматичного перекладу має принаймні два виміри: чи розпізнає модель ідіому взагалі, і який еквівалентний вираз вона обирає з доступних варіантів цільової мови. Стандартні метрики якості перекладу не чітко розділяють ці два виміри. Я думаю, їм слід.


Цей допис базується на внутрішньому тестуванні на платформі розробки MachineTranslation.com. Багатомодельне тестування версій, показане тут, ще не є загальнодоступним. Я ділюся цим висновком, тому що вважаю, що спостереження корисне незалежно від того, де ви виконуєте переклади.