logo

MachineTranslation.comBy Tomedes

Modo seguro
lock-icon
diamond icon

Go Unlimited

diamond icon

Go Unlimited

  • right arrowLoginright arrow
search-icon
  • Afrikaans
  • Albanian (Shqip)
  • Amharic (አማርኛ)
  • Arabic (العربية)
  • Belarusian (Беларуская)
  • Bengali (বাংলা)
  • Bosnian (Bosanski)
  • Bulgarian (Български)
  • Burmese (မြန်မာစာ)
  • Catalan (Català)
  • Central Atlas Tamazight (Tamaziɣt)
  • Chinese-Simplified (简体中文)
  • Chinese-Traditional (繁體中文)
  • Croatian (Hrvatski)
  • Czech (Čeština)
  • Danish (Dansk)
  • Dutch (Nederlands)
  • English
  • Esperanto
  • Estonian (Eesti)
  • Filipino (Tagalog)
  • Finnish (Suomi)
  • French (Français)
  • French-Canada (Français-Canada)
  • Galician (Galego)
  • Georgian (ქართული)
  • German (Deutsch)
  • Greek (Ελληνικά)
  • Guarani (Avañe'ẽ)
  • Haitian Creole (Kreyòl Ayisyen)
  • Hausa
  • Hebrew (עברית)
  • Hindi (हिन्दी)
  • Hungarian (Magyar)
  • Icelandic (Íslenska)
  • Igbo
  • Indonesian (Bahasa Indonesia)
  • Italian (Italiano)
  • Japanese (日本語)
  • Khmer (ខ្មែរ)
  • Korean (한국어)
  • Latvian (Latviešu)
  • Lingala (Lingála)
  • Lithuanian (Lietuvių)
  • Malagasy
  • Malay (Bahasa Melayu)
  • Maltese (Malti)
  • Norwegian-Bokmål (Norsk-Bokmål)
  • Oromo (Afaan Oromoo)
  • Polish (Polski)
  • Portuguese-Brazil (Português-Brasil)
  • Portuguese-Portugal (Português-Portugal)
  • Quechua (Runa Simi)
  • Romanian (Română)
  • Russian (Русский)
  • Serbian (Српски)
  • Slovak (Slovenčina)
  • Slovenian (Slovenščina)
  • Somali (Soomaaliga)
  • Spanish (Español)
  • Swahili (Kiswahili)
  • Swedish (Svenska)
  • Tamil (தமிழ்)
  • Thai (ไทย)
  • Tigrinya (ትግርኛ)
  • Tswana (Setswana)
  • Turkish (Türkçe)
  • Ukrainian (Українська)
  • Urdu (اردو)
  • Vietnamese (Tiếng Việt)
  • Wolof
  • Xhosa (IsiXhosa)
  • Yoruba (Yorùbá)
  • Zulu (IsiZulu)
Voltar
Adicionar créditos
logo

Com a confiança de milhões de usuários em todo o mundo, o MachineTranslation.com já entregou bilhões de traduções de alta qualidade em diversos idiomas e formatos. A MachineTranslation.com é um tradutor de IA gratuito desenvolvido pela Tomedes para tornar a tradução por IA acessível, precisa e segura para todos. A plataforma traduz tanto textos quanto documentos extensos, mantendo intacto o layout original. Ele usa SMART Para fornecer a tradução mais confiável, comparamos os resultados de 22 modelos de IA e selecionamos automaticamente a versão em que a maioria das IAs concorda.

Empresa

Sobre nós
Entre em contato
Iniciar sessão
Inscrever-se

Menu

Perguntas frequentesPreçosAPIBlogIdiomas

Idiomas em demanda

Inglês para Português (Brasil)
Espanhol para Português (Brasil)
Português (Brasil) para Inglês
Japonês para Português (Brasil)
Árabe para Português (Brasil)
Espanhol (Espanha) para Português (Brasil)

Empresa

Sobre nós
Entre em contato
Iniciar sessão
Inscrever-se

Menu

Perguntas frequentesPreçosAPIBlogIdiomas

Idiomas em demanda

Inglês para Português (Brasil)
Espanhol para Português (Brasil)
Português (Brasil) para Inglês
Japonês para Português (Brasil)
Árabe para Português (Brasil)
Espanhol (Espanha) para Português (Brasil)
g2iso_certificate_1iso_certificate_2
google_playapple_app
phone_icon
US: +1 985 239 0142 | UK: +44 1615 096140
mail_iconcontact@machinetranslation.com
social iconsocial iconsocial iconsocial icon
Globearrow
search-icon
  • Afrikaans
  • Albanian (Shqip)
  • Amharic (አማርኛ)
  • Arabic (العربية)
  • Belarusian (Беларуская)
  • Bengali (বাংলা)
  • Bosnian (Bosanski)
  • Bulgarian (Български)
  • Burmese (မြန်မာစာ)
  • Catalan (Català)
  • Central Atlas Tamazight (Tamaziɣt)
  • Chinese-Simplified (简体中文)
  • Chinese-Traditional (繁體中文)
  • Croatian (Hrvatski)
  • Czech (Čeština)
  • Danish (Dansk)
  • Dutch (Nederlands)
  • English
  • Esperanto
  • Estonian (Eesti)
  • Filipino (Tagalog)
  • Finnish (Suomi)
  • French (Français)
  • French-Canada (Français-Canada)
  • Galician (Galego)
  • Georgian (ქართული)
  • German (Deutsch)
  • Greek (Ελληνικά)
  • Guarani (Avañe'ẽ)
  • Haitian Creole (Kreyòl Ayisyen)
  • Hausa
  • Hebrew (עברית)
  • Hindi (हिन्दी)
  • Hungarian (Magyar)
  • Icelandic (Íslenska)
  • Igbo
  • Indonesian (Bahasa Indonesia)
  • Italian (Italiano)
  • Japanese (日本語)
  • Khmer (ខ្មែរ)
  • Korean (한국어)
  • Latvian (Latviešu)
  • Lingala (Lingála)
  • Lithuanian (Lietuvių)
  • Malagasy
  • Malay (Bahasa Melayu)
  • Maltese (Malti)
  • Norwegian-Bokmål (Norsk-Bokmål)
  • Oromo (Afaan Oromoo)
  • Polish (Polski)
  • Portuguese-Brazil (Português-Brasil)
  • Portuguese-Portugal (Português-Portugal)
  • Quechua (Runa Simi)
  • Romanian (Română)
  • Russian (Русский)
  • Serbian (Српски)
  • Slovak (Slovenčina)
  • Slovenian (Slovenščina)
  • Somali (Soomaaliga)
  • Spanish (Español)
  • Swahili (Kiswahili)
  • Swedish (Svenska)
  • Tamil (தமிழ்)
  • Thai (ไทย)
  • Tigrinya (ትግርኛ)
  • Tswana (Setswana)
  • Turkish (Türkçe)
  • Ukrainian (Українська)
  • Urdu (اردو)
  • Vietnamese (Tiếng Việt)
  • Wolof
  • Xhosa (IsiXhosa)
  • Yoruba (Yorùbá)
  • Zulu (IsiZulu)

2026 MachineTranslation.com by Tomedes

Políticas LegaisPolítica de Cookies

Experimente o melhor em tradução de IA.

June 5, 2026

Ta sama SI, inny model — a tłumaczenia nie mogłyby być bardziej różne

Przeprowadziłem wewnętrzne testy czegoś, o czym za mało mówimy w branży tłumaczeniowej: nie tego, czy różne systemy AI tłumaczą inaczej, ale tego, czy różne wersje tego samego AI tłumaczą inaczej — i o ile.

W zeszłym tygodniu przepuściłem jedno hiszpańskie idiom przez pięć wersji ChatGPT jednocześnie na wewnętrznej platformie testowej MachineTranslation.com. To, co wróciło, zatrzymało mnie.

Dwie wersje wygenerowały tłumaczenie, które jest, szczerze mówiąc, nonsensem w języku angielskim. Trzy wersje wyprodukowały poprawne tłumaczenia idiomatyczne. A te trzy poprawne nie zgadzały się ze sobą.

Wszystkie pięć to ChatGPT. Wszystkie pięć to OpenAI. Ta sama sztuczna inteligencja, inny model — a wyniki nie mogłyby być bardziej różne.

} Dzielę się tym teraz, ponieważ uważam, że to ważne, a nie dlatego, że mam czyste odpowiedzi. Nie. Ale obserwacja jest na tyle interesująca, że można ją przedstawić światu. Spis treści

Test:‎

  • Jedno hiszpańskie idiomy, pięć wersji GPT
  • Dlaczego ten idiom jest dobrym przypadkiem testowym
  • Co podział na dosłowne i idiomatyczne mówi nam o tym, jak te modele były trenowane
  • Implikacja, o której nikt zdaje się nie mówić
  • Nawet poprawne tłumaczenia nie zgadzały się ze sobą
  • Czego jeszcze nie wiem
  • Dwa pytania badawcze, nad którymi warto się zastanowić

Test: Jedno hiszpańskie idiomy, pięć wersji GPT

Przetestowałem frazę llevarse el gato al agua.


Oto, co wyprodukowała każda wersja:

Model                                              Wyjście                                               Idiomatyczne?
ChatGPT::GPT-4o-MINI przenieść kota do wody ❌ Dosłowne
ChatGPT::GPT-4.1-NANO przenieść kota do wody ❌ Dosłowne
ChatGPT::GPT-4.1-MINI osiągnąć coś z sukcesem ✅ Poprawne
ChatGPT::GPT-5.4-MINI postawić na swoim ✅ Częściowe
ChatGPT::GPT-5.4 wyjść zwycięsko ✅ Poprawne

Zwrot oznacza osiągnięcie czegoś trudnego wbrew przeciwnościom, odniesienie trudnego zwycięstwa. Nie ma to nic wspólnego z kotami ani wodą. Dosłowne tłumaczenie nie jest tłumaczeniem. Jest to transkrypcja słowo w słowo frazy, której model nie rozpoznał jako idiomu.

GPT-4o-MINI i GPT-4.1-NANO wygenerowały identyczne wyniki. Niepodobne, identyczne. Nasze Wnioski Tłumaczeniowe oznaczyły to bezpośrednio: ‎„GPT-4.1-nano i GPT-4o-mini udostępniają identyczne tłumaczenia, kładąc nacisk na dosłowne tłumaczenie zamiast idiomatycznego znaczenia.”

GPT-4.1-MINI, GPT-5.4-MINI i GPT-5.4 wygenerowały coś rozpoznawalnie poprawnego – ale nie takiego samego jak pozostałe.

Dlaczego ten idiom stanowi dobry przypadek testowy

Chcę być precyzyjny co do tego, dlaczego llevarse el gato al agua jest użytecznym wejściem testowym, a nie wybranym arbitralnie.

Jest to ugruntowany idiom. Pojawia się w literaturze, dziennikarstwie i mowie potocznej. Nie jest to niejasne. Każdy model wytrenowany na rozsądnym korpusie tekstów hiszpańskich powinien się z nim zetknąć. Pytanie nie polega na tym, czy model widział to wyrażenie. Pytanie brzmi, co z tym robi.

Najgorszym scenariuszem porażki w tłumaczeniu idiomów nie jest stworzenie złego tłumaczenia. Produkuje dosłowne tłumaczenie, które wygląda akceptowalnie dla kogoś, kto nie zna języka docelowego.

„To carry the cat to the water” to gramatycznie poprawne angielskie zdanie. Jest dobrze uformowany. Brzmi to jak coś, co mogłoby coś znaczyć. Użytkownik, który nie mówi po hiszpańsku, mógłby to przeczytać, skinąć głową i przejść dalej — nigdy nie wiedząc, że pierwotne znaczenie zostało całkowicie utracone.

To jest tryb awarii, na którym mi zależy. Nie oczywisty błąd. Niewidzialny.

Co podział na dosłowne i idiomatyczne mówi nam o tym, jak te modele były trenowane.

Wzór ten nie jest przypadkowy. Dwa modele, które wygenerowały dosłowne tłumaczenia (GPT-4o-MINI i GPT-4.1-NANO), to mniejsze, lżejsze modele zoptymalizowane pod kątem szybkości i efektywności kosztowej. Trzy modele, które wygenerowały idiomatyczne tłumaczenia (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), reprezentują inną generację lub skalę parametrów.

Sugeruje to coś, co moim zdaniem jest niedostatecznie zbadane: zdolność idiomatyczna w tłumaczeniu skaluje się wraz z możliwościami modelu w sposób, który nie jest widoczny w ogólnych benchmarkach.

Ogólne benchmarki językowe testują rozumowanie, wiedzę, kodowanie, matematykę. Zazwyczaj nie testują, czy model potrafi zidentyfikować , że pada deszczem kotów i psów nie dotyczy warunków pogodowych, ani że llevarse el gato al agua nie dotyczy nawadniania kota. Idiomy znajdują się na przecięciu wiedzy kulturowej, wnioskowania kontekstowego i rozpoznawania wzorców — a to przecięcie wydaje się wymagać progu zdolności modelu, którego mniejsze modele nie konsekwentnie przekraczają.

Czego nie twierdzę: że większe modele są zawsze lepszymi tłumaczami. Nie mam dowodów na to jako ogólną zasadę. To, co obserwuję: że w przypadku treści idiomatycznych, luka między wersjami w rodzinie była większa, niż się spodziewałem.

Implikacja, o której nikt zdaje się nie mówić

Większość użytkowników narzędzi do tłumaczenia AI nie wie, której wersji tej AI używa. Otwierają produkt, wybierają parę języków i otrzymują wynik. Routing modelu jest dla nich niewidoczne.

Ma to znaczenie w dużej skali. MachineTranslation.com przetworzył setki tysięcy zleceń tłumaczeń z angielskiego na hiszpański w ciągu jednego 90-dniowego okresu. Jeśli znacząca część tych zadań dotyczyła treści idiomatycznych (teksty marketingowe, język prawniczy, teksty literackie, komunikacja potoczna), a narzędzie kierujące te zadania kierowało użytkowników do mniejszego modelu bez ich wiedzy, to nieść kota do wody pojawiało się w rzeczywistych wynikach, w rzeczywistych dokumentach, dla rzeczywistych ludzi, którzy ufali wynikowi. Branża tłumaczeniowa od lat porównuje dostawców AI. DeepL kontra Google.‎

Claude kontra ChatGPT. Te porównania są przydatne. Ale w ramach jednego dostawcy luka w wersjach może być równie znacząca — i jest to luka, której większość ram porównawczych nie mierzy, ponieważ nie testują one na poziomie wersji modelu.

Kiedy ktoś mówi „Używam ChatGPT do tłumaczenia”, to zdanie nie jest wystarczająco precyzyjne, aby miało znaczenie. Który ChatGPT? Nano? 4o-mini? ‎4.1-mini? 5.4? Odpowiedź zmienia wyniki w sposób niebanalny, przynajmniej w przypadku treści idiomatycznych.

Nawet „poprawne” tłumaczenia różniły się od siebie

To jest część, która mnie najbardziej intryguje i jeszcze nie do końca zrozumiałem, co o niej myśleć.

Trzy modele, które wyprodukowały idiomatyczne tłumaczenia, dały trzy różne wyniki:

  • GPT-4.1-MINI: „to pull it off successfully”
  • GPT-5.4-MINI: „to get one's way”
  • GPT-5.4: „to come out on top”

Wszystkie trzy są obronnymi angielskimi tłumaczeniami llevarse el gato al agua‎. Ale nie są one równoważne.

To pull it off podkreśla wykonanie wbrew trudnościom, zrobiłeś coś trudnego i się udało. Dopiąć swegopodkreśla osiągnięcie pożądanego rezultatu, z mniejszym naciskiem na trudności. Wyjść na szczyt podkreśla zwycięstwo konkurencyjne, wygraną w stosunku do innych.

Oryginalne hiszpańskie powiedzenie jest najbliższe pierwszemu z nich. Zwrot ten niesie ze sobą konotację pokonania oporu, a nie po prostu preferowania jednego wyniku i jego urzeczywistnienia. Ale „postawić na swoim” i „wyjść zwycięsko” nie są złe, są po prostu niedokładne w różnych kierunkach. Rodzi to pytanie, które uważam za naprawdę trudne: kiedy trzy modele generują

poprawne, ale odmienne tłumaczenia idiomatyczne, jak ocenić, które jest najlepsze? Wyniki BLEU porównuje się z tłumaczeniem referencyjnym — ale kto napisał referencję i którą z tych trzech by wybrał?

Nasz Agent Tłumaczeniowy AI, co zasługuje na pochwałę, zadał właściwe pytanie zanim zdecydował się na jakikolwiek wynik: Jakie jest zamierzone znaczenie wyrażenia llevarse el gato al agua w tym kontekście?‎ Zaproponowano trzy opcje — osiągnięcie trudnego celu, wzięcie czegoś niepotrzebnego lub podjęcie ryzykownej działalności. To pytanie nie jest ozdobne. Jest to mechanizm, dzięki któremu niejednoznaczność kontekstowa jest rozwiązywana przed sfinalizowaniem tłumaczenia.

Ale punkt pozostaje: trzy poprawne odpowiedzi, trzy różne odcienie znaczenia. Narzędzia do oceny tłumaczeń nie są stworzone z myślą o tego typu niuansach.

Tego, czego jeszcze nie wiem

Chcę być szczery co do ograniczeń tego, co pokazuje ten test.

Jedno idiom, jedna para językowa, jeden dzień testów wewnętrznych. To nie jest badanie. To jest obserwacja. Nie wiem, czy ten wzorzec (mniejsze modele domyślnie dosłowne, większe modele idiomatyczne) utrzymuje się konsekwentnie w:

  • Inne hiszpańskie idiomy
  • Inne pary językowe z bogatymi tradycjami idiomatycznymi (przychodzą na myśl arabski, japoński, rosyjski)
  • Treści nieidiomatyczne, gdzie rozróżnienie nie ma zastosowania
  • Przypadki graniczne, w których mniejszy model poprawnie oddaje idiom, a większy go pomija

Nie wiem również, czy jest to stabilna cecha tych modeli, czy coś, co zmienia się wraz z aktualizacjami i dostrajaniem. Dostawcy modeli nie publikują dzienników zmian specyficznych dla tłumaczeń. Model, który dziś poprawnie obsługuje llevarse el gato al agua, może zostać zaktualizowany w przyszłym miesiącu i nie będziemy o tym wiedzieć.

Wiem jedno: ten test przyniósł wynik na tyle interesujący , że chcę przeprowadzić więcej takich testów, bardziej systematycznie, w większej liczbie par językowych i typów treści. Kiedy będę miał więcej do przekazania, zrobię to.

Dwa pytania badawcze, nad którymi warto się zastanowić

Zakończę dwoma pytaniami, które nasunęły mi się podczas tego testu. Nie zamierzam na nie odpowiadać, nie mam jeszcze na to danych. Ale myślę, że to właściwe pytania do zadania.

Po pierwsze: przy jakim progu parametrów kompetencja idiomatyczna staje się wiarygodna?

Przeskok z GPT-4o-MINI i GPT-4.1-NANO (oba dosłowne) do GPT-4.1-MINI (idiomatycznego) sugeruje, że istnieje próg gdzieś w zakresie parametrów między tymi rozmiarami modeli, gdzie rozpoznawanie idiomów włącza się. Czy to jest spójne? Czy dotyczy to idiomów we wszystkich językach, czy zależy to od tego, jak dobrze reprezentowany jest dany język w danych treningowych? Nie wiem. Ale wiedza byłaby przydatna dla każdego, kto tworzy przepływy pracy tłumaczeniowe.

Po drugie: jaki jest koszt ukrywania wersji modelu dla użytkowników na dużą skalę?

Jeśli użytkownik przesyła 1000 dokumentów miesięcznie przez narzędzie, które nie ujawnia, która wersja modelu jest używana (a niektóre z tych dokumentów zawierają treści idiomatyczne), jak często dosłowna porażka dzieje się niewidocznie? Skąd mieliby wiedzieć? Jaki jest koszt, w realnych terminach, nigdy się nie dowiedzieć?

Myślę, że to ważniejsze pytanie niż większość porównań która sztuczna inteligencja jest najlepsza do tłumaczenia, które obecnie krążą. Odpowiedź nie brzmi „użyj największego modelu”. Odpowiedź może brzmieć: wiedz, czego używasz, przeprowadzaj własne testy na własnych treściach i nie zakładaj, że nazwa jednego dostawcy jest gwarancją spójnego zachowania w całej jego gamie modeli .

Tak przynajmniej wynika z tego testu.

Pytania badawcze

1. Czy rozmiar modelu niezawodnie przewiduje jakość tłumaczenia idiomatycznego?

Na podstawie tego pojedynczego testu: mniejsze, zoptymalizowane pod kątem wydajności modele w ramach tej samej rodziny SI domyślnie tłumaczyły dosłownie ugruntowane hiszpańskie idiomy, podczas gdy większe/nowsze wersje tego samego modelu produkowały poprawne idiomy. Czy to prawda w odniesieniu do kategorii idiomów i par językowych, to kolejne pytanie. Przeprowadzę więcej testów.

2. Dlaczego trzy „poprawne” idiomatyczne tłumaczenia dały trzy znacząco różne wyniki?

GPT-4.1-MINI, GPT-5.4-MINI i GPT-5.4 przetłumaczyłyllevarse el gato al agua idiomatycznie — ale na różne angielskie wyrażenia o subtelnie różnych konotacjach. Sugestuje to , że jakość tłumaczenia idiomatycznego ma co najmniej dwa wymiary: czy model w ogóle rozpoznaje idiom, i które równoważne wyrażenie wybiera spośród dostępnych opcji w języku docelowym. Standardowe metryki jakości tłumaczenia nie oddzielają tych dwóch wymiarów w czysty sposób. Myślę, że powinni.


Ten post opiera się na wewnętrznych testach na platformie deweloperskiej MachineTranslation.com. Wielomodelowe testy wersji, które tu przedstawiono, nie są jeszcze publicznie dostępne. Udostępniam to odkrycie, ponieważ uważam, że obserwacja jest przydatna niezależnie od tego, gdzie wykonujesz tłumaczenia.