July 10, 2026
Два слова. Шесть моделей. Три различных решения по переводу. Вот что произошло, когда я пропустил 8 тестовых предложений через последние доступные модели ИИ на MachineTranslation.com, и что результаты на самом деле раскрывают о том, когда модель молча дает сбой.
Два слова. Это больно. Шесть моделей. Три отдельных решения по переводу.
На японском языке одна модель передала это как それはやばい, сохраняя двусмысленность. Другой полностью опустил подлежащее местоимение и написал голую форму やばい, самую разговорную версию из возможных. Третий написал それはすごい, что полностью разрешает неоднозначность в пользу "удивительный", убирая двойное значение, которое делало фразу интересной с самого начала. На вьетнамском языке одна модель написала Đỉnh vậy (сленг, правильно для молодежного регистра). Другой написал Thật tuyệt vời, грамматически правильно, но ближе к выражению "это действительно чудесно", когда кто-то отправляет вам мем.
Все это защитимо. Ни один из них не одно и то же. И если вы запускаете переводы через одну модель, вы никогда не увидите выбор, сделанный от вашего имени.
Это центральный вопрос, на который пытается ответить данная статья. Не о том, какая модель ИИ лучше всего подходит для перевода в 2026 году (ответ зависит от языковой пары, регистра, области и структуры предложения), а скорее: как бы вы узнали, когда ваша модель допустила ошибку? Особенно в таких областях, как медицинская терминология, юридические контракты или профессиональный стиль общения, где неправильный вызов выглядит точно так же, как правильный перевод, пока его не прочитает специалист.
Вот что я сделал. Я запустил 8 тестовых предложений через две серии моделей на MachineTranslation.com: сначала базовый набор из 5 широко используемых моделей, затем расширенный пул, который добавляет несколько новейших вариантов моделей премиум-класса, доступных платным пользователям. Обычно сравнение результатов моделей, подобных этой, означало бы отдельные платные подписки у каждого поставщика по отдельности. На MachineTranslation.com они находятся в одном и том же представлении для сравнения. Языковые пары были английский→японский и английский→вьетнамский. Категории предложений были выбраны специально для проверки областей, где разногласия моделей наиболее значительны: идиоматические выражения, юридическая терминология, медицинская терминология, контекст, чувствительный к стилю, и преднамеренная семантическая двусмысленность.
Примечание о методологии оценки: исследования машинного перевода давно борются с тем, как автоматически оценивать результаты. Такие метрики, как BLEU и COMET , измеряемые в общих задачах WMT , дают полезный совокупный сигнал, но они плохо выявляют ошибки регистра, неудачи с идиоматическими выражениями и терминологическую точность, то есть именно те категории, которые здесь имеют наибольшее значение. То, что вы собираетесь прочитать, является анализом результатов, а не гонкой BLEU.

Не каждое предложение выявляет значимое разногласие. Два из восьми тестов, "Let's touch base once the dust settles on this deal" (→ японский) и "We're burning the midnight oil to hit this launch date" (→ вьетнамский), показали высокое согласие в обоих раундах. Идиомы были правильно поняты как идиомы. Никто не переводил "touch base" как касание физической базы. Никто не переводил "the dust settles" как осадок, падающий вниз.
Стоит на этом остановиться: идиоматический английский деловой язык достаточно хорошо обрабатывается современными передовыми моделями, когда идиома достаточно распространена. Консенсус по поводу "touch base" остался стабильным в обоих раундах; вариация была чисто стилистической, вокруг того, использовать ли この件 (этот вопрос), この取引 (эта сделка) или この案件 (этот случай) для исходной фразы.

Тест "жечь полуночное масло" — вот где всё стало интереснее. Все модели, кроме одной, правильно поняли идиому. MiniMax M2.7, представленный во втором раунде, буквально перевел "burning" как "burning torches" (горящие факелы), создав đốt đuốc, что означает "горящие факелы". Консенсус правильно исключил это.

Японский язык — это язык с многоуровневой формальностью. Выбор окончания глагола, местоимения и формы референциального существительного не является стилистическим. Это сигнализирует об отношении между говорящим и получателем. Отправка сообщения вашему генеральному директору с использованием неформальных глагольных форм не является ошибкой перевода в грамматическом смысле. Это социальная ошибка, и довольно значительная.
Тестовое предложение: Ты можешь это отправить? Спасибо, я это ценю. Контекст: переписка с генеральным директором.

Консенсус сместился, когда расширился пул моделей. Механизм прост: добавление моделей, которые правильно считывают контекст формальности, сдвинуло большинство, и консенсус последовал. Вот полный спектр того, что модели произвели во втором раунде:

Вьетнамский тест регистра выявил другой вид ошибки формальности, более тонкий. Исходное предложение: «Эй, быстрый вопрос — ты свободен, чтобы прыгнуть на звонок?» Контекст: сообщение клиенту. Цвэнь в первом раунде использовал "mình," местоимение первого лица, которое подразумевает непринужденную дружбу между равными. Все остальные модели полностью избегали самоссылок от первого лица, что является более безопасным профессиональным выбором. Importantly, Qwen corrected this in Round 2 and removed "mình Консенсус в обоих раундах исключил это.

Предложение об индемнификации продавца/клиента является стандартным пунктом в коммерческих соглашениях: "Поставщик должен возместить клиенту убытки от любых претензий третьих лиц, вытекающих из нарушения настоящего соглашения."
В Раунде 1 все пять моделей правильно определили юридический регистр и использовали заимствования ベンダー (поставщик) и クライアント (клиент), стандартные в японских коммерческих договорах английского происхождения. Одно исключение: GPT-4.1-NANO использовал 販売者 (продавец) и 顧客 (покупатель), законные японские слова, которым не хватает формальной юридической специфичности эквивалентов заимствованных слов.
Более важный результат появился во втором раунде. Ключевое различие между двумя словами:
Это юридически различные концепции. «Indemnify» конкретно означает защиту стороны от ответственности перед третьими лицами. 免責 является правильным юридическим термином. All Round 1 models used компенсацию. На втором раунде DeepSeek V4-Pro была единственной моделью, которая произвела 免責, и она сделала это только на втором раунде, а не на первом.

В контракте 補償 и 免責 не являются синонимами. «Один» означает «мы вам возместим». Другое означает "вы защищены от претензии с самого начала". Если платформа перевода использует 補償 где 免責 является правильным, адвокат, читающий японскую версию, не увидит то же соглашение, которое описывает английская версия.
Это наиболее значительный вывод в наборе данных. Тестовое предложение: "Этот препарат противопоказан пациентам с историей нарушения функции печени." Источник: документация клинического продукта. Цель: Вьетнамский.
Критический термин — «печеночная недостаточность». Есть два вьетнамских кандидата:
Это клинически различные состояния. Предупреждение о противопоказании на основе "нарушения функции печени" применяется к любому человеку со сниженной функцией печени, а не только к тем, кто испытал полный отказ органа. Использование suy gan неправильно сужает указанную совокупность. Пациент с умеренным нарушением функции печени, который читает "суй ган", может не признать себя в числе противопоказанной популяции.

Некоторые исходные предложения намеренно двусмысленны. «То болезненно» в современном английском сленге означает что-то отличное, но это также сохраняет своё буквальное значение (то есть отвратительное/омерзительное), и напряжение между этими двумя значениями является частью того, как фраза передаёт смысл. Вызов для модели перевода заключается в следующем: вы сохраняете неоднозначность, сводите её к наиболее вероятному значению или выбираете одно и придерживаетесь его?


Модели в этом тесте не все эквивалентны. Они охватывают различные архитектуры, режимы обучения и контексты развертывания. Исходный уровень Раунда 1 включает модели, которые широко доступны. Расширенный пул Round 2 добавляет несколько новейших вариантов моделей премиум-уровня, теперь доступных платным пользователям на MachineTranslation.com, того же уровня модели, который в противном случае означал бы отдельный платный аккаунт у каждого отдельного поставщика.

Расширенный пул в Round 2 включает модели, которые более продвинуты и доступны платным пользователям на MachineTranslation.com. Эффект расширения пула неравномерен. В некоторых тестах (формальность/японский язык) это значительно изменило консенсус. У других (медицинская терминология/вьетнамский), раскол углубился.

Тестовые данные указывают на две отдельные категории сбоев, и они требуют различных ответов.
Категория A: Бесшумные сбои. Ошибки формальности, ошибки регистра, неточность медицинской терминологии: они производят выходные данные, которые выглядят правильно. Японский язык грамматически правильный. Вьетнамец свободно говорит по-английски. Нет никаких внешних признаков того, что что-то пошло не так. Монолингвальный пользователь, читающий выходные данные одной модели, не может узнать, что модель сделала выбор регистра, который заметил бы старший японский руководитель, или что клинический термин был сужен таким образом, который изменяет население, к которому он применяется.
Категория B: Видимые ошибки. MiniMax переводит "burning the midnight oil" как "burning torches." GPT-4.1-NANO разрешает "That's sick" на однозначное "すごい." Это можно обнаружить либо носителем целевого языка, либо путём сравнения с другими выходными данными модели.
Сравнение нескольких моделей, которое предоставляет SMART, наиболее ценно в Категории A. Когда пять или десять моделей производят выходные данные и большинство согласны на формальный регистр, в то время как одна производит случайный простой японский язык, несогласие видно в представлении сравнения. Пользователь, говорящий на целевом языке, может оценить варианты. Пользователь, который не может увидеть, что было принято оспариваемое решение, и решить, требует ли это предложение проверки человеком.
Для работы с документами в полном объеме, больших файлов, сохраняющего макет перевода PDF-файлов, контрактов или клинических материалов, возможность обработки документов платформы обрабатывает структуру файла без нарушения форматирования. Но вопросы качества, поднятые выше, применимы независимо от размера файла. Клиническое исследование на 100 страницах, где каждый случай "нарушения функции печени" переводится как "печеночная недостаточность", является увеличенной версией той же проблемы, выявленной в Тесте 2.
Для медицинской и юридической категорий в частности, проверка человеком является правильной гарантией качества. Сервис постредактирования AI компании Tomedes, который объединяет выходные данные AI с сертифицированной проверкой человеком именно для такого высокорисковго контента, создан для этого. Разделение suy gan / suy giảm chức năng gan — это именно тот вид находки, который должен вызвать такой пересмотр, не потому что все модели неправильны, а потому что модели, которые наиболее уверены, не являются наиболее точными.
Ценность просмотра нескольких выходов не в том, что вы всегда выберете большинство. Дело в том, что вы будете знать, что был сделан выбор, что отличается от предположения о том, что результат перед вами правильный.

Поставьте восемь тестов рядом, и закономерность сохраняется: согласие и несогласие распределены не случайным образом. Идиоматический, повседневный деловой язык («связаться», «работать до поздна») сходился почти во всех моделях в обоих раундах. Формальность, юридическая точность и медицинская терминология не соответствовали. Тест на формальность генерального директора изменился с неформального на формальный только после включения расширенного пула. Пункт об возмещении убытков выявил реальное юридическое различие (免責 vs. 補償), которое только одна модель в одном раунде правильно поняла. Медицинская терминология так и не была согласована, оставаясь примерно в соотношении 6 к 4 в обоих раундах независимо от того, какие модели были в пуле.
Это фактический результат, а не маркетинговое утверждение: консенсус не делает каждое предложение лучше, и в этом нет необходимости. Это наиболее ценно именно там, где беглость одной модели не дает вам причин сомневаться в ней, и где ошибка действительно что-то стоит.
Есть второй, более практический уровень этого теста, который стоит сформулировать ясно. Проведение этого сравнения самостоятельно означало проверку выходных данных GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo и MiniMax M2.7 рядом с существующими базовыми моделями в одном месте на одной платформе. Вне MachineTranslation.com это не одна подписка. Это несколько подписок, по одной для каждого поставщика, премиум-уровень которого вы хотите протестировать, по цене, которую каждый поставщик устанавливает индивидуально. Платящие пользователи здесь получают то же самое сравнение в один клик, за небольшую часть стоимости поддержания пяти отдельных премиум-подписок, не отказываясь от того, что действительно имеет значение: видеть, где модели согласны, и точно знать, когда они не согласны.
Ни один из них не является категорически лучше; это зависит от категории теста. Claude Sonnet и Claude Opus последовательно выбирали более точный вьетнамский медицинский термин, а Claude Opus создал наиболее подходящий сленг для фразы "That's sick." Но Claude Sonnet также создал непринужденный японский язык в предложении формального контекста генерального директора, где GPT-5.5 справился правильно. Сравнение результатов напрямую более обоснованно, чем выбор одной модели и доверие ей.
Её нет; точность зависит от области применения. Gemini 3.5-Flash и GLM-5-Turbo продемонстрировали наиболее подходящий формальный японский язык в этом тесте. Оба модели Claude были наиболее точны в отношении вьетнамской медицинской терминологии. DeepSeek V4-Pro была единственной моделью, которая использовала правильный японский юридический термин, но только во втором раунде, и она производила повседневный японский язык в других местах. Ни одна модель не доминировала во всех восьми тестах.
Нет, не автоматически. Расширение набора моделей более новыми вариантами премиум-класса сдвинуло консенсус с неформального на формальный в тесте японской вежливости. Но в тесте вьетнамской медицинской терминологии разделение сохранялось примерно в соотношении 6 к 4 независимо от того, какие модели были включены. Больше моделей выявляют больше разногласий, что является полезным сигналом, но консенсус по-прежнему следует большинству, а большинство не всегда дает наиболее точный ответ.
SMART — это многомодельная система консенсуса MachineTranslation.com, охватывающая до 22 моделей ИИ от поставщиков, включая OpenAI, Anthropic, Google и DeepSeek. Он запускает перевод через несколько моделей одновременно и выводит результат большинства наряду с ответом каждой отдельной модели, по умолчанию, без необходимости конфигурации. Консенсус смещается при смещении пула моделей, как показано в результате японской формальности этого теста: случайный консенсус в Раунде 1 стал формальным в Раунде 2.
Нет единой модели; лучший ответ - проверка человеком. Модели Claude последовательно выбирали более точный вьетнамский медицинский термин, а DeepSeek V4-Pro в одиночку использовал правильный японский юридический термин, но только во втором раунде. Медицинская терминология так и не была согласована между 10 моделями, что указывает на необходимость привлечения специалистов в данной области, а не на выбор другой модели. Сертифицированная проверка постредактирования человеком, как предлагает Tomedes, обеспечивает эту специализированную проверку.