June 5, 2026
Правя вътрешни тестове на нещо, за което не говорим достатъчно в преводаческата индустрия: не дали различните AI системи превеждат по различен начин, а дали различни версии на един и същ AI превеждат по различен начин — и с колко.
Миналата седмица пуснах един испански идиом през пет версии на ChatGPT едновременно на вътрешната тестова платформа на MachineTranslation.com. Това, което се върна, ме спря.
Две версии произведоха превод, който е, наистина, безсмислица на английски език. Три версии произведоха правилни идиоматични преводи. А трите верни не се съгласяваха помежду си.
Всичките пет са ChatGPT. Всичките пет са OpenAI. Същият ИИ, различен модел — и резултатите не биха могли да бъдат по-различни.
Споделям това сега, защото смятам, че е важно, а не защото имам ясни отговори. Не. Но наблюдението е достатъчно интересно, за да бъде представено на света. Съдържание Тестът:
Фразата, която тествах, беше llevarse el gato al agua.

Ето какво произведе всяка версия:
| Модел | Изход | Идиоматично? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | да занесеш котката до водата | ❌ Буквално |
| ChatGPT::GPT-4.1-NANO | да занесеш котката до водата | ❌ Буквално |
| ChatGPT::GPT-4.1-MINI | да го направиш успешно | ✅ Правилно |
| ChatGPT::GPT-5.4-MINI | да постигнеш своето | ✅ Частично |
| ChatGPT::GPT-5.4 | да излезеш на върха | ✅ Правилно |
Фразата означава да постигнеш нещо трудно въпреки шансовете, да извоюваш трудна победа. Няма нищо общо с котки или вода. Буквален превод не е превод. Това е буквално транскрипция на фраза, която моделът не успя да разпознае като идиом.
GPT-4o-MINI и GPT-4.1-NANO произведоха идентични резултати. Не сходни, идентични. Нашите преводически прозрения маркираха това директно: GPT-4.1-nano и GPT-4o-mini споделят идентични преводи, наблягайки на буквален превод пред идиоматично значение.
GPT-4.1-MINI, GPT-5.4-MINI и GPT-5.4 всеки произведе нещо разпознаваемо правилно — но не и същото като другите.
Искам да бъда точен защо llevarse el gato al agua е полезен тестов вход, а не подбран такъв.
Това е утвърден идиом. Среща се в литературата, журналистиката и ежедневната реч. Не е неясно. Всеки модел, обучен на разумен корпус от испански текст, би трябвало да го е срещал. Въпросът не е дали моделът е видял фразата. Въпросът е какво прави с него.
Най-лошият сценарий на провал при превод на идиоми не е получаването на лош превод. Той произвежда буквален превод, който изглежда приемлив за някой, който не знае целевия език.
„Да занесеш котката до водата“ е граматически правилен английски език. Това е правилно оформено. Звучи като нещо, което би могло да означава нещо. Потребител, който не говори испански, може да го прочете, да кимне и да продължи напред — никога не знаейки, че оригиналното значение е изгубено изцяло.
Това е режимът на отказ, който ме интересува. Не очевидната грешка. Невидимият. Какво ни казва разделението от буквално към идиоматично за това как са обучени тези модели
Моделът тук не е случаен. Двата модела, които произведоха буквални преводи (GPT-4o-MINI и GPT-4.1-NANO), са по-малки, по-леки модели, оптимизирани за скорост и ценова ефективност. Трите модела, които произведоха идиоматични преводи (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), представляват различно поколение или мащаб на параметрите.
Това предполага нещо, което според мен е недостатъчно проучено: идиоматичната компетентност при превода се мащабира с капацитета на модела по начини, които не се виждат в общите бенчмаркове.
Общите езикови бенчмаркове тестват разсъждение, знания, кодиране, математика. Те обикновено не тестват дали един модел може да идентифицира , че падат като из ведро не е свързано с метеорологичните условия, или че llevarse el gato al agua не е свързано с хидратирането на котка. Идиомите се намират на пресечната точка на културното познание, контекстуалното заключение и разпознаването на модели — и тази пресечна точка изглежда изисква праг на капацитета на модела, който по-малките модели не постоянно достигат.
Какво не твърдя: че по-големите модели винаги са по-добри преводачи. Нямам доказателства за това като общо правило. Това, което наблюдавам: че за идиоматично съдържание конкретно, разликата между версиите в рамките на семейството беше по-голяма, отколкото очаквах.
Повечето потребители, които използват инструмент за AI превод, не знаят коя версия на този AI използват. Те отварят продукт, избират езикова двойка и получават резултат. Маршрутизацията на модела е невидима за тях.
Това има значение в голям мащаб. MachineTranslation.com обработи над стотици хиляди превода от английски на испански за период от 90 дни. Ако значителна част от тези работни места са били свързани с идиоматично съдържание (маркетингови текстове, правен език, литературен текст, ежедневна комуникация) и инструментът, който е насочвал тези работни места, е насочвал потребителите към по-малък модел без тяхно знание, тогава да занесеш котката до водата се е появявало в реални резултати, в реални документи, за реални хора, които са се доверили на резултата. Преводаческата индустрия е прекарала години в сравняване на AI доставчици. DeepL срещу Google.
Клод срещу ЧатДжиПиТи. Тези сравнения са полезни. Но в рамките на един доставчик, разликата във версиите може да бъде също толкова значителна — и това е разлика, която повечето рамки за сравнение не измерват, защото не тестват на ниво модел-версия. Когато някой каже „Използвам ChatGPT за превод“, това изречение не е достатъчно конкретно, за да бъде смислено.
Кой ChatGPT? Нано? 4o-мини? 4.1-мини? 5.4? Отговорът променя изхода по начини , които не са тривиални, поне за идиоматично съдържание.
Това е частта, която намирам за най-интересна и все още не съм напълно разбрал какво да правя с нея.
Трите модела, които произведоха идиоматични преводи, дадоха три различни:
И трите са защитими английски преводи на llevarse el gato al agua. Но те не са еквивалентни.
Да се справиш набляга на изпълнението спрямо трудността, ти си направил нещо трудно и то е проработило. Да си постигнеш своетонабляга на постигането на желания резултат, с по-малко ударение върху трудността. „Излизам на върха“ подчертава конкурентна победа, печелене спрямо другите.
Оригиналният испански идиом е най-близък до първия от тях. Фразата носи конотацията за преодоляване на съпротива, а не просто предпочитане на един изход и неговото осъществяване. Но „да постигнеш своето“ и „да излезеш победител“ не са грешни, те просто са неточни в различни посоки. Това повдига въпрос, който намирам за наистина труден: когато три модела произведат правилен, но различен идиоматичен превод, как оценявате кой е
най-добрият? BLEU резултатите се сравняват с a референтен превод — но кой е написал референцията и кой от тези три би избрал?
Нашият AI преводачески агент, за негова чест, зададе правилния въпрос преди да се ангажира с какъвто и да е изход: Какво е предвиденото значение на „llevarse el gato al agua“ в този контекст? Предложени бяха три възможности — да се постигне трудна цел, да се вземе нещо ненужно или да се предприеме рискована дейност. Този въпрос не е декоративен. Това е механизмът, чрез който контекстуалната двусмислица се разрешава, преди преводът да бъде финализиран.
Но въпросът остава: три верни отговора, три различни нюанса на значението. Инструментите за оценка на превода не са създадени за подобна нюансираност.
искам да бъда честен относно ограниченията на това, което този тест показва.
Един идиом, една езикова двойка, един ден вътрешно тестване. Това не е проучване. Това е наблюдение. Не знам дали този модел (по-малките модели по подразбиране са буквални, по-големите модели постигат идиоматичност) се задържа последователно в:
Също така не знам дали това е стабилно свойство на тези модели или нещо, което се променя с актуализации и фина настройка. Доставчиците на модели не публикуват регистри за промени, специфични за превода. Версия на модел, която днес обработва llevarse el gato al agua правилно , може да бъде актуализирана следващия месец и ние няма да имаме начин да разберем.
Това, което знам: този тест даде резултат, достатъчно интересен , че искам да проведа още такива, по-систематично, в повече езикови двойки и типове съдържание. Когато имам повече да споделя, ще го направя.
Ще завърша с двата въпроса, които този тест ми остави. Няма да им отговоря, все още нямам данните за това. Но мисля, че това са правилните въпроси, които трябва да се зададат.
Първо: при какъв праг на параметри идиоматичната компетентност става надеждна?
Преходът от GPT-4o-MINI и GPT-4.1-NANO (и двете буквални) към GPT-4.1-MINI (идиоматичен) предполага, че съществува праг някъде в диапазона на параметрите между тези размери на моделите, където разпознаването на идиоми се включва. Съвместимо ли е? Прилага ли се за идиоми във всички езици, или зависи от това колко добре е представен даден език в данните за обучение? Не знам. Но знанието би било полезно за всеки, който изгражда работни процеси за превод.
Второ: каква е цената на непрозрачността на версиите на модела за потребителите в голям мащаб?
Ако потребител препраща 1000 документа на месец през инструмент, който не разкрива коя версия на модела се използва (а някои от тези документи съдържат идиоматично съдържание), колко често буквалният провал се случва невидимо? Как биха могли да знаят? Каква е цената, в реални измерения, никога да не разберем?
Мисля, че това е по-важен въпрос от повечето от сравненията кой ИИ е най-добър за превод, които в момента циркулират. Отговорът не е „използвайте най-големия модел“ . Отговорът може да бъде: знайте какво използвате, направете свои собствени тестове върху собственото си съдържание и не предполагайте, че името на един доставчик е гаранция за последователно поведение в целия му модел обхват.
Това, поне, е това, което аз извличам от този тест.
Въз основа на този единствен тест: по-малки, оптимизирани за ефективност модели от същото AI семейство по подразбиране превеждаха буквално утвърден испански идиом, докато по-големи/по-нови версии на същия модел произведоха правилни идиоматични преводи. Дали това важи за категориите идиоми и езиковите двойки е следващият въпрос. Ще направя още тестове.
GPT-4.1-MINI, GPT-5.4-MINI и GPT-5.4 преведоха llevarse el gato al agua идиоматично — но в различни английски изрази с фино различни конотации. Това предполага , че качеството на идиоматичния превод има поне две измерения: дали моделът разпознава идиома изобщо и кой еквивалентен израз избира от наличните опции на целевия език. Стандартните показатели за качество на превода не разграничават ясно тези две измерения. Мисля, че трябва.
Тази публикация се основава на вътрешно тестване на платформата за разработка на MachineTranslation.com. Мултимоделното тестване на версии, показано тук, все още не е публично достъпно. Споделям откритието, защото смятам, че наблюдението е полезно, независимо къде извършвате преводите си.