June 5, 2026

Тот же ИИ, другая модель — и переводы не могли быть более разными

Я провожу внутренние тесты чего-то, о чем мы недостаточно говорим в индустрии переводов: не о том, переводят ли разные ИИ-системы по-разному, а о том, переводят ли разные версии одного и того же ИИпо-разному — и насколько.

На прошлой неделе я прогнал одну испанскую идиому через пять версий ChatGPT одновременно на внутренней тестовой платформе MachineTranslation.com. Результат меня остановил.

Две версии выдали перевод, который, честно говоря, является бессмыслицей на английском языке. Три версии дали правильный идиоматический перевод. И три правильных не согласились друг с другом. Все пять —

ChatGPT. Все пять — это OpenAI. Тот же ИИ, другая модель — и результаты не могли быть более разными.

}Я делюсь этим сейчас, потому что считаю, что это важно, а не потому, что у меня есть четкие ответы. Я нет. Но наблюдение достаточно интересно, чтобы вынести его на публику.

Оглавление

  • Тест: Одна испанская идиома, пять версий GPT
  • Почему эта идиома является хорошим тестовым случаем
  • Что разделение буквального и идиоматического говорит нам о том, как эти модели были обучены
  • Последствия, о которых, кажется, никто не говорит
  • Даже правильные переводы не совпадали друг с другом
  • Чего я еще не знаю
  • Два исследовательских вопроса, над которыми стоит задуматься

Тест: Одна испанская идиома, пять версий GPT

Фраза, которую я протестировал, была llevarse el gato al agua.


Вот что выдала каждая версия:

Модель                                          Вывод                                               Идиоматично?
ChatGPT::GPT-4o-MINI отнести кошку к воде ❌ Буквально
ChatGPT::GPT-4.1-NANO отнести кошку к воде ❌ Буквально
ChatGPT::GPT-4.1-MINI успешно справиться ✅ Правильно
ChatGPT::GPT-5.4-MINI добиться своего ✅ Частично
ChatGPT::GPT-5.4 выйти победителем ✅ Правильно

Фраза означает добиться чего-то трудного вопреки всему, одержать трудную победу. Это не имеет никакого отношения к кошкам или воде. Буквальный перевод — это не перевод. Это дословная транскрипция фразы, которую модель не смогла распознать как идиому.

GPT-4o-MINI и GPT-4.1-NANO выдали идентичные результаты. Не похоже, идентично. Наши аналитические данные по переводу отметили это напрямую: ‎«GPT-4.1-nano и GPT-4o-mini выдают идентичные переводы, делая упор на буквальную интерпретацию, а не на идиоматическое значение.»

GPT-4.1-MINI, GPT-5.4-MINI и GPT-5.4 каждый выдал что-то узнаваемо правильное — но не одинаковое.

Почему эта идиома является хорошим тестовым случаем

Я хочу точно объяснить, почему llevarse el gato al agua является полезным тестовым вводом, а не выбранным произвольно.

Это устоявшаяся идиома. Он встречается в литературе, журналистике и повседневной речи. Это не неясно. Любая модель, обученная на разумном корпусе испанского текста, должна была с ним столкнуться. Вопрос не в том, видел ли модель эту фразу. Вопрос в том, что он с этим делает.

Самый худший сценарий при переводе идиом — это не получение плох ого перевода. Это дает дословный перевод, который выглядит приемлемым для того, кто не знает целевого языка.

«Нести кошку к воде» — грамматически правильное английское выражение. Это хорошо сформировано. Похоже на что-то, что может что-то значить. Пользователь, не говорящий по-испански, может прочитать это, кивнуть и пойти дальше — так и не узнав, что первоначальный смысл был полностью утерян.

Это тот сценарий отказа, который меня волнует. Не очевидная ошибка. Невидимый.

Что разделение от буквального к идиоматическому говорит нам о том, как эти модели обучались

Здесь нет случайного совпадения. Две модели, которые произвели буквальные переводы (GPT-4o-MINI и GPT-4.1-NANO), обе являются меньшими , более легкими моделями, оптимизированными для скорости и экономической эффективности. Три модели, которые дали идиоматичные переводы (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), представляют собой другое поколение или масштаб параметров.

Это предполагает нечто, что, на мой взгляд, недостаточно исследовано: идиоматическая компетентность в переводе масштабируется с мощностью модели способами, которые не видны в общих бенчмарках.

Общие языковые бенчмарки тестируют рассуждение, знания, программирование, математику. Они обычно не проверяют, может ли модель определить , что льет как из ведра — это не про погодные условия, или что llevarse el gato al agua — это не про увлажнение кошки. Идиомы находятся на пересечении культурных знаний, контекстуальных выводов и распознавания образов — и это пересечение, похоже, требует такого уровня мощности модели, который меньшие модели не стабильно достигают.

Что я не утверждаю: что большие модели всегда лучше переводчики. У меня нет доказательств этого как общего правила. Что я наблюдаю: что для идиоматического контента в частности, разрыв между версиями внутри семьи был больше, чем я ожидал.

Подразумевается, что никто, кажется, не говорит об этом

Большинство пользователей, которые используют инструмент ИИ-перевода, не знают, какую версию этого ИИ они используют. Они открывают продукт, выбирают языковую пару и получают результат. Маршрутизация модели для них невидима.

}Это имеет значение в больших масштабах. MachineTranslation.com обработала более сотен тысяч переводов с английского на испанский за один 90-дневный период. Если значительная часть этих рабочих мест касалась идиоматического контента (маркетинговые тексты, юридический язык, литературные тексты, повседневное общение), а инструмент, направляющий эти рабочие места, направлял пользователей к меньшей модели без их ведома, то «нести кота к воде» появлялось в реальных результатах, в реальных документах, для реальных людей, которые доверяли результату. Индустрия перевода годами сравнивала поставщиков ИИ. DeepL против Google.‎

Клод против ChatGPT. Эти сравнения полезны. Но в рамках одного поставщика разрыв в версиях может быть таким же значительным — и это разрыв, который большинство сравнительных фреймворков не измеряют, поскольку они не тестируют на уровне версий моделей. Когда кто-то говорит «Я использую ChatGPT для перевода», это предложение недостаточно конкретно, чтобы быть осмысленным.‎

Какой ChatGPT? Нано? 4o-мини? ‎4.1-мини? 5.4? Ответ изменяет вывод нетривиальным образом , по крайней мере, для идиоматического контента.

Даже «правильные» переводы расходились друг с другом

Это та часть, которая мне кажется наиболее интересной, и я еще не до конца разобрался, что с этим делать.

Три модели, которые дали идиоматические переводы, дали три разных перевода:

  • GPT-4.1-MINI: «успешно справиться»
  • GPT-5.4-MINI: «добиться своего»
  • GPT-5.4: «выйти победителем»

Все три являются приемлемыми английскими переводами выражения llevarse el gato al agua‎. Но они не эквивалентны.

Справиться подчеркивает исполнение против сложности, вы сделали что-то трудное, и это сработало. ‎«добиться своего» подчеркивает достижение желаемого результата, уделяя меньше внимания трудностям. ‎«Выйти победителем» подчеркивает соревновательную победу, победу над другими.

Оригинальная испанская идиома ближе всего к первому из них. Выражение несет в себе оттенок преодоления сопротивления, а не простого предпочтения одного исхода и его реализации. Но «добиться своего» и «выйти победителем» не являются неправильными, они просто неточны в разных направлениях. Это поднимает вопрос, который я считаю действительно сложным: когда три модели дают правильный, но отличающийся идиоматический перевод, как определить, какой из них

лучший?‎ Оценки BLEU сравниваются с эталонным переводом — но кто написал эталон, и какой из этих трех он бы выбрал?

Наш агент ИИ-перевода, к его чести, задал правильный вопрос, прежде чем приступить к какому-либо выводу: Какой подразумеваемый смысл у выражения 'llevarse el gato al agua' в данном контексте?‎ Были предложены три варианта — достичь трудной цели, взять что-то ненужное или заняться рискованным делом.‎ Этот вопрос не носит декоративного характера. Это механизм, с помощью которого контекстная неоднозначность разрешается до того, как перевод будет окончательно утвержден.

Но суть остается: три правильных ответа, три разных оттенка смысла. Инструменты оценки перевода не созданы для такой тонкости.

Чего я еще не знаю

Я хочу быть честным в отношении ограничений того, что показывает этот тест.

Одна идиома, одна языковая пара, один день внутреннего тестирования. Это не исследование. Это наблюдение. Я не знаю, сохраняется ли эта закономерность (меньшие модели по умолчанию используют буквальный перевод, а более крупные достигают идиоматического) последовательно для: Другие испанские идиомы Другие языковые пары с богатыми идиоматическими традициями (на ум приходят арабский, японский, русский) Неидиоматический контент, где различие неприменимо Крайние случаи, когда меньшая модель правильно понимает идиому, а большая — нет. Я также не знаю, является ли это стабильным свойством этих моделей или чем-то, что меняется с обновлениями и дообучением. Поставщики моделей не публикуют журналы изменений, специфичные для перевода. Модель, которая сегодня правильно обрабатывает

  • «llevarse el gato al agua», может быть обновлена
  • в следующем месяце, и мы не будем знать об этом. Что я знаю: этот тест дал достаточно интересный результат, чтобы я захотел провести больше таких тестов,
  • более систематически, для большего числа
  • языковых пар и типов контента.‎

Когда мне будет чем поделиться, я поделюсь.

Два исследовательских вопроса, над которыми стоит задуматься

Я закончу двумя вопросами, которые остались у меня после этого теста. Я не буду на них отвечать, у меня пока нет для этого данных. Но я думаю, что это правильные вопросы, которые стоит задать.

Во-первых: при каком пороговом значении параметров идиоматическая компетенция становится надежной?

Переход от GPT-4o-MINI и GPT-4.1-NANO (оба буквальные) к GPT-4.1-MINI (идиоматический) предполагает, что существует порог где-то в диапазоне параметров между этими размерами моделей, где распознавание идиом включается. Это последовательно? Применяется ли это к идиомам на всех языках, или это зависит от того, насколько хорошо язык представлен в обучающих данных? Я не знаю. Но знание было бы полезно любому, кто создает рабочие процессы перевода.

Второй вопрос: какова цена непрозрачности версий моделей для пользователей в больших масштабах?

Если пользователь направляет 1000 документов в месяц через инструмент, который не раскрывает, какая версия модели используется (и некоторые из этих документов содержат идиоматический контент), как часто происходит буквальный сбой незаметно? Откуда им знать? Какова реальная цена того, что мы никогда не узнаем?

Я думаю, это более важный вопрос, чем большинство сравнений какой ИИ лучше для перевода, которые сейчас распространяются. Ответ не в том, чтобы «использовать самую большую модель». Ответ может быть таким: знать, что вы используете, проводить собственные тесты на собственном контенте и не предполагать, что название одного поставщика является гарантией последовательного поведения во всем его модельном ряду.

По крайней мере, это то, что я вынес из этого теста.

Исследовательские вопросы

1. Надежно ли размер модели предсказывает качество идиоматического перевода?

Исходя из этого единственного теста: меньшие, оптимизированные по эффективности модели в рамках одного семейства ИИ по умолчанию переводили дословно устоявшееся испанское идиоматическое выражение, в то время как более крупные/новые версии той же модели давали правильные идиоматические переводы. Держится ли это для категорий идиом и языковых пар — вот следующий вопрос. Я проведу больше тестов.

2. Почему три «правильных» идиоматических перевода дали три осмысленно разных результата?

GPT-4.1-MINI, GPT-5.4-MINI и GPT-5.4 перевелиllevarse el gato al agua идиоматически — но в разные английские выражения с едва уловимыми различиями в коннотациях. Это предполагает , что качество идиоматического перевода имеет по крайней мере два измерения: распознает ли модель идиому вообще, и какое эквивалентное выражение она выбирает из доступных вариантов целевого языка. Стандартные метрики качества перевода не четко разделяют эти два аспекта. Я думаю, им следует.


Этот пост основан на внутренних тестах на платформе разработки MachineTranslation.com. Многомодельное тестирование версий, показанное здесь, еще не доступно для публичного использования. Я делюсь находкой, потому что считаю, что это наблюдение полезно независимо от того, где вы выполняете переводы.