June 5, 2026
Przeprowadziłem wewnętrzne testy czegoś, o czym za mało mówimy w branży tłumaczeniowej: nie tego, czy różne systemy AI tłumaczą inaczej, ale tego, czy różne wersje tego samego AI tłumaczą inaczej — i o ile.
W zeszłym tygodniu przepuściłem jedno hiszpańskie idiom przez pięć wersji ChatGPT jednocześnie na wewnętrznej platformie testowej MachineTranslation.com. To, co wróciło, zatrzymało mnie.
Dwie wersje wygenerowały tłumaczenie, które jest, szczerze mówiąc, nonsensem w języku angielskim. Trzy wersje wyprodukowały poprawne tłumaczenia idiomatyczne. A te trzy poprawne nie zgadzały się ze sobą.
Wszystkie pięć to ChatGPT. Wszystkie pięć to OpenAI. Ta sama sztuczna inteligencja, inny model — a wyniki nie mogłyby być bardziej różne.
} Dzielę się tym teraz, ponieważ uważam, że to ważne, a nie dlatego, że mam czyste odpowiedzi. Nie. Ale obserwacja jest na tyle interesująca, że można ją przedstawić światu. Spis treści
Przetestowałem frazę llevarse el gato al agua.

Oto, co wyprodukowała każda wersja:
| Model | Wyjście | Idiomatyczne? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | przenieść kota do wody | ❌ Dosłowne |
| ChatGPT::GPT-4.1-NANO | przenieść kota do wody | ❌ Dosłowne |
| ChatGPT::GPT-4.1-MINI | osiągnąć coś z sukcesem | ✅ Poprawne |
| ChatGPT::GPT-5.4-MINI | postawić na swoim | ✅ Częściowe |
| ChatGPT::GPT-5.4 | wyjść zwycięsko | ✅ Poprawne |
Zwrot oznacza osiągnięcie czegoś trudnego wbrew przeciwnościom, odniesienie trudnego zwycięstwa. Nie ma to nic wspólnego z kotami ani wodą. Dosłowne tłumaczenie nie jest tłumaczeniem. Jest to transkrypcja słowo w słowo frazy, której model nie rozpoznał jako idiomu.
GPT-4o-MINI i GPT-4.1-NANO wygenerowały identyczne wyniki. Niepodobne, identyczne. Nasze Wnioski Tłumaczeniowe oznaczyły to bezpośrednio: „GPT-4.1-nano i GPT-4o-mini udostępniają identyczne tłumaczenia, kładąc nacisk na dosłowne tłumaczenie zamiast idiomatycznego znaczenia.”
GPT-4.1-MINI, GPT-5.4-MINI i GPT-5.4 wygenerowały coś rozpoznawalnie poprawnego – ale nie takiego samego jak pozostałe.
Chcę być precyzyjny co do tego, dlaczego llevarse el gato al agua jest użytecznym wejściem testowym, a nie wybranym arbitralnie.
Jest to ugruntowany idiom. Pojawia się w literaturze, dziennikarstwie i mowie potocznej. Nie jest to niejasne. Każdy model wytrenowany na rozsądnym korpusie tekstów hiszpańskich powinien się z nim zetknąć. Pytanie nie polega na tym, czy model widział to wyrażenie. Pytanie brzmi, co z tym robi.
Najgorszym scenariuszem porażki w tłumaczeniu idiomów nie jest stworzenie złego tłumaczenia. Produkuje dosłowne tłumaczenie, które wygląda akceptowalnie dla kogoś, kto nie zna języka docelowego.
„To carry the cat to the water” to gramatycznie poprawne angielskie zdanie. Jest dobrze uformowany. Brzmi to jak coś, co mogłoby coś znaczyć. Użytkownik, który nie mówi po hiszpańsku, mógłby to przeczytać, skinąć głową i przejść dalej — nigdy nie wiedząc, że pierwotne znaczenie zostało całkowicie utracone.
To jest tryb awarii, na którym mi zależy. Nie oczywisty błąd. Niewidzialny.
Wzór ten nie jest przypadkowy. Dwa modele, które wygenerowały dosłowne tłumaczenia (GPT-4o-MINI i GPT-4.1-NANO), to mniejsze, lżejsze modele zoptymalizowane pod kątem szybkości i efektywności kosztowej. Trzy modele, które wygenerowały idiomatyczne tłumaczenia (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), reprezentują inną generację lub skalę parametrów.
Sugeruje to coś, co moim zdaniem jest niedostatecznie zbadane: zdolność idiomatyczna w tłumaczeniu skaluje się wraz z możliwościami modelu w sposób, który nie jest widoczny w ogólnych benchmarkach.
Ogólne benchmarki językowe testują rozumowanie, wiedzę, kodowanie, matematykę. Zazwyczaj nie testują, czy model potrafi zidentyfikować , że pada deszczem kotów i psów nie dotyczy warunków pogodowych, ani że llevarse el gato al agua nie dotyczy nawadniania kota. Idiomy znajdują się na przecięciu wiedzy kulturowej, wnioskowania kontekstowego i rozpoznawania wzorców — a to przecięcie wydaje się wymagać progu zdolności modelu, którego mniejsze modele nie konsekwentnie przekraczają.
Czego nie twierdzę: że większe modele są zawsze lepszymi tłumaczami. Nie mam dowodów na to jako ogólną zasadę. To, co obserwuję: że w przypadku treści idiomatycznych, luka między wersjami w rodzinie była większa, niż się spodziewałem.
Większość użytkowników narzędzi do tłumaczenia AI nie wie, której wersji tej AI używa. Otwierają produkt, wybierają parę języków i otrzymują wynik. Routing modelu jest dla nich niewidoczne.
Ma to znaczenie w dużej skali. MachineTranslation.com przetworzył setki tysięcy zleceń tłumaczeń z angielskiego na hiszpański w ciągu jednego 90-dniowego okresu. Jeśli znacząca część tych zadań dotyczyła treści idiomatycznych (teksty marketingowe, język prawniczy, teksty literackie, komunikacja potoczna), a narzędzie kierujące te zadania kierowało użytkowników do mniejszego modelu bez ich wiedzy, to nieść kota do wody pojawiało się w rzeczywistych wynikach, w rzeczywistych dokumentach, dla rzeczywistych ludzi, którzy ufali wynikowi. Branża tłumaczeniowa od lat porównuje dostawców AI. DeepL kontra Google.
Claude kontra ChatGPT. Te porównania są przydatne. Ale w ramach jednego dostawcy luka w wersjach może być równie znacząca — i jest to luka, której większość ram porównawczych nie mierzy, ponieważ nie testują one na poziomie wersji modelu.
Kiedy ktoś mówi „Używam ChatGPT do tłumaczenia”, to zdanie nie jest wystarczająco precyzyjne, aby miało znaczenie. Który ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Odpowiedź zmienia wyniki w sposób niebanalny, przynajmniej w przypadku treści idiomatycznych.
To jest część, która mnie najbardziej intryguje i jeszcze nie do końca zrozumiałem, co o niej myśleć.
Trzy modele, które wyprodukowały idiomatyczne tłumaczenia, dały trzy różne wyniki:
Wszystkie trzy są obronnymi angielskimi tłumaczeniami llevarse el gato al agua. Ale nie są one równoważne.
To pull it off podkreśla wykonanie wbrew trudnościom, zrobiłeś coś trudnego i się udało. Dopiąć swegopodkreśla osiągnięcie pożądanego rezultatu, z mniejszym naciskiem na trudności. Wyjść na szczyt podkreśla zwycięstwo konkurencyjne, wygraną w stosunku do innych.
Oryginalne hiszpańskie powiedzenie jest najbliższe pierwszemu z nich. Zwrot ten niesie ze sobą konotację pokonania oporu, a nie po prostu preferowania jednego wyniku i jego urzeczywistnienia. Ale „postawić na swoim” i „wyjść zwycięsko” nie są złe, są po prostu niedokładne w różnych kierunkach. Rodzi to pytanie, które uważam za naprawdę trudne: kiedy trzy modele generują
poprawne, ale odmienne tłumaczenia idiomatyczne, jak ocenić, które jest najlepsze? Wyniki BLEU porównuje się z tłumaczeniem referencyjnym — ale kto napisał referencję i którą z tych trzech by wybrał?
Nasz Agent Tłumaczeniowy AI, co zasługuje na pochwałę, zadał właściwe pytanie zanim zdecydował się na jakikolwiek wynik: Jakie jest zamierzone znaczenie wyrażenia llevarse el gato al agua w tym kontekście? Zaproponowano trzy opcje — osiągnięcie trudnego celu, wzięcie czegoś niepotrzebnego lub podjęcie ryzykownej działalności. To pytanie nie jest ozdobne. Jest to mechanizm, dzięki któremu niejednoznaczność kontekstowa jest rozwiązywana przed sfinalizowaniem tłumaczenia.
Ale punkt pozostaje: trzy poprawne odpowiedzi, trzy różne odcienie znaczenia. Narzędzia do oceny tłumaczeń nie są stworzone z myślą o tego typu niuansach.
Chcę być szczery co do ograniczeń tego, co pokazuje ten test.
Jedno idiom, jedna para językowa, jeden dzień testów wewnętrznych. To nie jest badanie. To jest obserwacja. Nie wiem, czy ten wzorzec (mniejsze modele domyślnie dosłowne, większe modele idiomatyczne) utrzymuje się konsekwentnie w:
Nie wiem również, czy jest to stabilna cecha tych modeli, czy coś, co zmienia się wraz z aktualizacjami i dostrajaniem. Dostawcy modeli nie publikują dzienników zmian specyficznych dla tłumaczeń. Model, który dziś poprawnie obsługuje llevarse el gato al agua, może zostać zaktualizowany w przyszłym miesiącu i nie będziemy o tym wiedzieć.
Wiem jedno: ten test przyniósł wynik na tyle interesujący , że chcę przeprowadzić więcej takich testów, bardziej systematycznie, w większej liczbie par językowych i typów treści. Kiedy będę miał więcej do przekazania, zrobię to.
Zakończę dwoma pytaniami, które nasunęły mi się podczas tego testu. Nie zamierzam na nie odpowiadać, nie mam jeszcze na to danych. Ale myślę, że to właściwe pytania do zadania.
Po pierwsze: przy jakim progu parametrów kompetencja idiomatyczna staje się wiarygodna?
Przeskok z GPT-4o-MINI i GPT-4.1-NANO (oba dosłowne) do GPT-4.1-MINI (idiomatycznego) sugeruje, że istnieje próg gdzieś w zakresie parametrów między tymi rozmiarami modeli, gdzie rozpoznawanie idiomów włącza się. Czy to jest spójne? Czy dotyczy to idiomów we wszystkich językach, czy zależy to od tego, jak dobrze reprezentowany jest dany język w danych treningowych? Nie wiem. Ale wiedza byłaby przydatna dla każdego, kto tworzy przepływy pracy tłumaczeniowe.
Po drugie: jaki jest koszt ukrywania wersji modelu dla użytkowników na dużą skalę?
Jeśli użytkownik przesyła 1000 dokumentów miesięcznie przez narzędzie, które nie ujawnia, która wersja modelu jest używana (a niektóre z tych dokumentów zawierają treści idiomatyczne), jak często dosłowna porażka dzieje się niewidocznie? Skąd mieliby wiedzieć? Jaki jest koszt, w realnych terminach, nigdy się nie dowiedzieć?
Myślę, że to ważniejsze pytanie niż większość porównań która sztuczna inteligencja jest najlepsza do tłumaczenia, które obecnie krążą. Odpowiedź nie brzmi „użyj największego modelu”. Odpowiedź może brzmieć: wiedz, czego używasz, przeprowadzaj własne testy na własnych treściach i nie zakładaj, że nazwa jednego dostawcy jest gwarancją spójnego zachowania w całej jego gamie modeli .
Tak przynajmniej wynika z tego testu.
Na podstawie tego pojedynczego testu: mniejsze, zoptymalizowane pod kątem wydajności modele w ramach tej samej rodziny SI domyślnie tłumaczyły dosłownie ugruntowane hiszpańskie idiomy, podczas gdy większe/nowsze wersje tego samego modelu produkowały poprawne idiomy. Czy to prawda w odniesieniu do kategorii idiomów i par językowych, to kolejne pytanie. Przeprowadzę więcej testów.
GPT-4.1-MINI, GPT-5.4-MINI i GPT-5.4 przetłumaczyłyllevarse el gato al agua idiomatycznie — ale na różne angielskie wyrażenia o subtelnie różnych konotacjach. Sugestuje to , że jakość tłumaczenia idiomatycznego ma co najmniej dwa wymiary: czy model w ogóle rozpoznaje idiom, i które równoważne wyrażenie wybiera spośród dostępnych opcji w języku docelowym. Standardowe metryki jakości tłumaczenia nie oddzielają tych dwóch wymiarów w czysty sposób. Myślę, że powinni.
Ten post opiera się na wewnętrznych testach na platformie deweloperskiej MachineTranslation.com. Wielomodelowe testy wersji, które tu przedstawiono, nie są jeszcze publicznie dostępne. Udostępniam to odkrycie, ponieważ uważam, że obserwacja jest przydatna niezależnie od tego, gdzie wykonujesz tłumaczenia.