June 5, 2026
Я праводжу ўнутраныя тэсты чагосьці, пра што мы недастаткова гаворым у перакладніцкай індустрыі: не пра тое, ці перакладаюць розныя сістэмы ШІ па-рознаму, а пра тое, ці розныя версіі аднаго і таго ж ШІ перакладаюць па-рознаму — і наколькі.
На мінулым тыдні я прапусціў адзін іспанскі ідыём праз пяць версій ChatGPT адначасова на ўнутранай тэставай платформе MachineTranslation.com. Тое, што атрымалася, мяне спыніла.
Дзве версіі далі пераклад, які, шчыра кажучы, з'яўляецца бязглуздзіцай на англійскай мове. Тры версіі далі правільныя ідыёматычныя пераклады. І тры правільныя не пагадзіліся адзін з адным. Усе пяць —
ChatGPT. Усе пяцёра — OpenAI. Той жа ШІ, іншая мадэль — і вынікі не маглі быць больш рознымі.
Я дзелюся гэтым зараз, таму што лічу, што гэта важна, а не таму, што ў мяне ёсць дакладныя адказы. Я не. Але назіранне дастаткова цікавае, каб выпусціць яго ў свет.
Фраза, якую я тэставаў, была llevarse el gato al agua.

Вось што атрымала кожная версія:
| Мадэль | Вывад | Ідыяматычна? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | перанесці ката да вады | ❌ Літаральна |
| ChatGPT::GPT-4.1-NANO | перанесці ката да вады | ❌ Літаральна |
| ChatGPT::GPT-4.1-MINI | дамагчыся поспеху | ✅ Правільна |
| ChatGPT::GPT-5.4-MINI | дамагчыся свайго | ✅ Часткова |
| ChatGPT::GPT-5.4 | выйсці пераможцам | ✅ Правільна |
Фраза азначае дасягнуць чагосьці цяжкага насуперак усім шанцам, выйграць цяжкую перамогу. Гэта не мае ніякага дачынення да катоў ці вады. Даслоўны пераклад не з'яўляецца перакладам. Гэта пабуквенная транскрыпцыя фразы, якую мадэль не змагла распазнаць як ідыёму.
GPT-4o-MINI і GPT-4.1-NANO далі ідэнтычныя вынікі. Не падобны, ідэнтычны. Нашы аналітычныя дадзеныя перакладу адзначылі гэта неадкладна: GPT-4.1-nano і GPT-4o-mini маюць ідэнтычныя пераклады, падкрэсліваючы літаральнае тлумачэнне замест ідыяматычнага значэння.
GPT-4.1-MINI, GPT-5.4-MINI і GPT-5.4 кожны стварылі нешта распазнавальна правільнае — але не аднолькавае адзін з адным.
Я хачу дакладна растлумачыць, чаму llevarse el gato al agua з'яўляецца карысным тэставым уваходам, а не выбраным выпадкова.
Гэта добра ўсталяваны ідыём. З'яўляецца ў літаратуры, журналістыцы і паўсядзённай мове. Гэта не незразумела. Любая мадэль, навучаная на разумным корпусе іспанскага тэксту, павінна была сутыкнуцца з ім. Пытанне не ў тым, ці бачыла мадэль гэтую фразу. Пытанне у тым, што ён з гэтым робіць.
Самы горшы сцэнар збою пры перакладзе ідыём - гэта не атрымаць дрэнны пераклад. Гэта дае даслоўны пераклад, які выглядае прымальным для таго, хто не ведае мэтавай мовы.
«Нёс кот вады» — гэта граматычна правільная англійская мова. Гэта мае правільную структуру. Гэта гучыць як нешта, што можа нешта значыць. Карыстальнік, які не размаўляе па-іспанску, можа прачытаць гэта, кіўнуць і прайсці далей — ніколі не ведаючы, што арыгінальны сэнс быў цалкам страчаны.
Гэта той збой, які мяне хвалюе. Не відавочная памылка. Незрозумілы. Незрозумілы.
Тут няма выпадковага ўзору. Дзве мадэлі, якія стварылі даслоўныя пераклады (GPT-4o-MINI і GPT-4.1-NANO), з'яўляюцца меншымі і больш лёгкімі мадэлямі, аптымізаванымі для хуткасці і эканамічнай эфектыўнасці. Тры мадэлі, якія стварылі ідыяматычныя пераклады (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), прадстаўляюць іншае пакаленне або маштаб параметраў.
Гэта сведчыць аб тым, што, на мой погляд, недастаткова даследавана: ідыяматычная кампетэнтнасць у перакладзе маштабуецца з ёмістасцю мадэлі такім чынам, што не бачна ў агульных бенчмарках.
Агульныя моўныя бенчмаркі правяраюць разважанне, веды, кадаванне, матэматыку. Яны звычайна не правяраюць, ці можа мадэль вызначыць , што ідзе дождж з кошкамі і сабакамі не звязана з умовамі надвор'я, ці што llevarse el gato al agua не азначае паіць ката. Ідыёмы знаходзяцца на скрыжаванні культурных ведаў, кантэкстуальных высноў і распазнавання вобразаў — і гэта скрыжаванне, здаецца, патрабуе парога магутнасці мадэлі, які меншыя мадэлі не пастаянна пераадольваюць.
Чаго я не сцвярджаю: што большыя мадэлі заўсёды лепшыя перакладчыкі. Я не маю доказаў гэтага як агульнага правіла. Што я назіраю: што для ідыяматычнага зместу, у прыватнасці, разрыў паміж версіямі ўнутры сям'і быў большым, чым я чакаў.
Большасць карыстальнікаў, якія выкарыстоўваюць інструмент перакладу AI, не ведаюць, якую версію гэтага AI яны выкарыстоўваюць. Яны адкрываюць прадукт, выбіраюць моўную пару і атрымліваюць вынік. Маршрутызацыя мадэлі для іх непрыкметная.
Гэта мае значэнне ў вялікіх маштабах. MachineTranslation.com апрацавала больш за сотні тысяч перакладаў з англійскай на іспанскую за адзін 90-дзённы перыяд. Калі значная частка гэтых заданняў датычылася ідыёматычнага зместу (маркетынгавыя тэксты, юрыдычная мова, літаратурныя тэксты, паўсядзённая камунікацыя), а інструмент накіроўваў карыстальнікаў да меншай мадэлі без іх ведама, тады пераносіць ката да вады з'яўлялася ў рэальных вывадах, у рэальных дакументах, для рэальных людзей, якія давяралі выніку.
Індустрыя перакладаў гадамі параўноўвала пастаўшчыкоў ІІ. DeepL супраць Google. Клод супраць ChatGPT. Тыя параўнанні карысныя . Але ў межах аднаго пастаўшчыка разрыў у версіях можа быць такім жа значным — і гэта разрыў, які большасць сістэм параўнання не вымяраюць, бо яны не тэстуюць на ўзроўні версій мадэляў. Калі хтосьці кажа: «Я выкарыстоўваю ChatGPT для перакладу», гэтага сказа недастаткова, каб быць значным.
Які ChatGPT? Нана? 4o-міні? 4.1-міні? 5.4? Адказ змяняе вывад нетривиальными спосабамі , прынамсі, для ідыяматычнага зместу.
Гэта тая частка, якая мне здаецца найбольш цікавай, і я яшчэ не зусім зразумеў, што з ёй рабіць.
Тры мадэлі, якія далі ідыяматычныя пераклады, далі тры розныя:
Усе тры з'яўляюцца прымальнымі англійскімі перакладамі llevarse el gato al agua. Але яны не эквівалентныя.
Зрабіць гэта падкрэслівае выкананне насуперак цяжкасцям, вы зрабiлi нешта складанае, i гэта атрымалася. Дамагчыся свайгопадкрэслівае дасягненне жаданага выніку, з меншым акцэнтам на цяжкасці. выйсці на першае месца падкрэслівае перамогу ў спаборніцтве, перамогу над іншымі.
Арыгінальны іспанскі выраз найбольш блізкі да першага з іх. Выраз мае адценне пераадолення супраціву, а не простага перавагі аднаго выніку і яго матэрыялізацыі. Але дамагчыся свайго і выйсці пераможцам не з'яўляюцца няправільнымі, яны проста недакладныя ў розных напрамках.
Гэта ўзнімае пытанне, якое я лічу сапраўды складаным: калі тры мадэлі кожная дае правільны, але адрозны ідыяматычны пераклад, як ацаніць, які з іх лепшы? BLEU-ацэнкі параўноўваюцца з эталонным перакладам — але хто напісаў эталон, і які з гэтых трох яны б выбралі?
Наш AI-агент па перакладзе, да яго гонару, задаў правільнае пытанне перад тым, як прыступіць да любога вываду: Якое прызначэнне мае llevarse el gato al agua у гэтым кантэксце? Было прапанавана тры варыянты — дасягнуць складанай мэты, узяць нешта непатрэбнае або заняцца рызыкоўнай дзейнасцю. Гэтае пытанне не з'яўляецца дэкаратыўным. Гэта механізм, з дапамогай якога кантэкстная неадназначнасць вырашаецца перад завяршэннем перакладу.
Але галоўнае застаецца: тры правільныя адказы, тры розныя адценні значэння. Інструменты ацэнкі перакладу не створаны для такой тонкасці.
Я хачу быць шчырым адносна абмежаванняў таго, што паказвае гэты тэст.
Адзін ідыём, адна моўная пара, адзін дзень унутранага тэсціравання. Гэта не даследаванне. Гэта назіранне. Я не ведаю, ці гэты ўзор (меншыя мадэлі па змаўчанні літаральныя, большыя мадэлі ідыяматычныя) захоўваецца паслядоўна для:
Я таксама не ведаю, ці з'яўляецца гэта стабільнай уласцівасцю гэтых мадэляў, ці нешта, што змяняецца з абнаўленнямі і дадатковай наладкай. Пастаўшчыкі мадэляў не публікуюць спісы змен, спецыфічныя для перакладу. Мадэль, якая сёння правільна апрацоўвае llevarse el gato al agua, можа быць абноўлена ў наступным месяцы, і мы не будзем ведаць.
Што я ведаю: гэты тэст даў дастаткова цікавы вынік , каб я хацеў правесці больш такіх тэстаў, больш сістэматычна, па большай колькасці моўных пар і тыпаў зместу. Калі мне будзе больш чым падзяліцца, я падзялюся.
Я скончу двума пытаннямі, якія пакінуў мне гэты тэст. Я не буду ім адказваць, у мяне пакуль няма для гэтага даных. Але я думаю, што гэта правільныя пытанні, якія трэба задаць.
Першае: пры якім парозе параметраў ідыяматычная кампетэнтнасць становіцца надзейнай?
Пераход ад GPT-4o-MINI і GPT-4.1-NANO (абодва літаральныя) да GPT-4.1-MINI (ідэматычны) сведчыць аб тым, што існуе парог дзесьці ў дыяпазоне параметраў паміж гэтымі памерамі мадэляў, дзе ўключаецца распазнаванне ідыём. Ці гэта адпавядае? Ці распаўсюджваецца гэта на ідыёмы ва ўсіх мовах, ці гэта залежыць ад таго, наколькі добра мова прадстаўлена ў навучальных даных? Я не ведаю. Але веданне будзе карысным для тых, хто стварае працоўныя працэсы перакладу.
Другое: колькі каштуе непразрыстасць версіі мадэлі для карыстальнікаў у вялікім маштабе?
Калі карыстальнік накіроўвае 1000 дакументаў у месяц праз інструмент, які не раскрывае, якая версія мадэлі выкарыстоўваецца (і некаторыя з гэтых дакументаў утрымліваюць ідыёматычны змест), як часта адбываецца літаральны збой нябачна? Як яны б ведалі? Які кошт, у рэальных умовах, ніколі не даведацца?
Я думаю, што гэта больш важнае пытанне, чым большасць параўнанняў які ШІ лепшы для перакладу, якія зараз распаўсюджваюцца. Адказ не выкарыстоўвайце самую вялікую мадэль. Адказ можа быць: ведайце, што вы выкарыстоўваеце, правядзіце ўласныя тэсты на ўласным змесціве і не мяркуйце, што назва аднаго пастаўшчыка з'яўляецца гарантыяй паслядоўнай працы ва ўсім яго асартыменце мадэляў.
Гэта, прынамсі, тое, што я выношу з гэтага тэсту.
Зыходзячы з гэтага адзінага тэсту: меншыя, аптымізаваныя па эфектыўнасці мадэлі у межах аднаго сямейства ІІ па змаўчанні перакладалі літаральна добра ўсталяваную іспанскую ідыёму, у той час як большыя/новыя версіі той жа мадэлі стваралі правільныя ідыяматычныя пераклады. Ці захаваецца гэта для катэгорый ідыём і моўных пар, гэта наступнае пытанне. Я правяду больш тэстаў.
GPT-4.1-MINI, GPT-5.4-MINI і GPT-5.4 усе пераклалі llevarse el gato al agua ідыяматычна — але ў розныя англійскія выразы з ледзь прыкметнымі адрозненнямі ў значэнні. Гэта мяркуе , што якасць ідыяматычнага перакладу мае прынамсі два вымярэнні: ці распазнае мадэль ідыёму наогул, і якое эквівалентнае выраз яна выбірае са даступных варыянтаў мэтавай мовы. Стандартныя метрыкі якасці перакладу не выразьліва аддзяляюць гэтыя два вымярэньні. Я думаю, ім варта.
Гэты пост заснаваны на ўнутраным тэсціраванні на платформе распрацоўкі MachineTranslation.com. Шматмадэльнае тэсціраванне версій, паказанае тут, яшчэ недаступна для грамадскасці. Я дзялюся знаходкай, таму што лічу, што назіранне карысна незалежна ад таго, дзе вы выконваеце пераклады.