July 10, 2026
Dwa słowa. Sześć modeli. Trzy różne decyzje tłumaczeniowe. Oto co się stało, gdy przepuściłem 8 zdań testowych przez najnowsze modele AI dostępne na MachineTranslation.com, i co wyniki faktycznie ujawniają o tym, kiedy model zawodzi w ciszy.
Dwa słowa. To jest chore. Sześć modeli. Trzy odrębne decyzje translatorskie.
W języku japońskim jeden model oddał to jako それはやばい, zachowując dwuznaczność. Inny całkowicie pominął zaimek podmiotowy i napisał formę голą やばい, możliwą najbardziej kolokwialną wersję. Trzeci napisał それはすごい, co całkowicie rozwiązuje niejednoznaczność na korzyść „zdumiewający", usuwając podwójne znaczenie, które uczyniło to wyrażenie interesującym. W wietnamskim jeden model napisał Đỉnh vậy (slang, poprawne dla rejestru młodzieżowego). Inny napisał Thật tuyệt vời, gramatycznie poprawny, ale bliższy stwierdzeniu "to jest naprawdę cudowne" gdy ktoś wysyła ci mema.
Wszystkie z nich są do obrony. Żaden z nich nie jest tym samym. A jeśli przeprowadzasz tłumaczenia przez jeden model, nigdy nie zobaczysz wyboru dokonanego w Twoim imieniu.
To jest główne pytanie, na które ten artykuł próbuje odpowiedzieć. Nie które model AI jest najlepszy do tłumaczenia w 2026 roku (odpowiedź zależy od pary języków, rejestru, domeny i struktury zdania), ale raczej: jak byś wiedział, kiedy Twój model podjął złą decyzję? Szczególnie w dziedzinach takich jak terminologia medyczna, umowy prawne lub formalność zawodowa, gdzie złą decyzję wygląda dokładnie jak prawidłowe tłumaczenie, dopóki specjalista go nie przeczyta.
Oto co zrobiłem. Przepuściłem 8 zdań testowych przez dwie rundy modeli na MachineTranslation.com: najpierw przez bazę 5 szeroko stosowanych modeli, a następnie przez rozszerzoną pulę, która dodaje kilka najnowszych wariantów modeli premium dostępnych dla użytkowników płacących. Zwykle porównywanie wyników modeli takich jak ten wymagałoby osobnych płatnych subskrypcji u każdego dostawcy indywidualnie. Na MachineTranslation.com znajdują się w tym samym widoku porównawczym. Pary języków to angielski→japoński i angielski→wietnamski. Kategorie zdań zostały wybrane specjalnie w celu przeprowadzenia testów obciążeniowych w obszarach, gdzie niezgodność modeli jest najbardziej konsekwencjna: frazeologia idiomatyczna, terminologia prawna, terminologia medyczna, kontekst wrażliwy na formalność i celowa dwuznaczność semantyczna.
Uwaga na temat metodologii oceny: badania nad maszynowym tłumaczeniem od dawna borykają się z tym, jak automatycznie oceniać wyniki. Metryki takie jak BLEU i COMET mierzone w zadaniach wspólnych WMT dają użyteczny sygnał zagregowany, ale słabo wykrywają błędy rejestru, niepowodzenia idiomatyczne i precyzję terminologiczną, czyli dokładnie kategorie, które mają tutaj największe znaczenie. To co masz zamiar przeczytać to analiza wyników, a nie wyścig BLEU.

Nie każde zdanie ujawnia znaczącą niezgodność. Dwa z ośmiu testów, "Let's touch base once the dust settles on this deal" (→ japoński) i "We're burning the midnight oil to hit this launch date" (→ wietnamski), wykazały wysoką zgodność w obu rundach. Idiomy zostały prawidłowo zrozumiane jako idiomy. Nikt nie przetłumaczył wyrażenia "touch base" jako dotykania fizycznej bazy. Nikt nie tłumaczył "the dust settles" jako opadającego osadu.
Warto się na tym zatrzymać: potoczny angielski język biznesu jest dość dobrze obsługiwany przez obecne modele graniczne, gdy idiom jest wystarczająco powszechny. Konsensus dla "touch base" pozostał stabilny w obu rundach; zmienność była czysto stylistyczna, dotycząca tego, czy użyć この件 (ta sprawa), この取引 (ta transakcja), czy この案件 (ten przypadek) dla frazy źródłowej.

Test „palenia nocnej oliwy" to moment, w którym sprawy stały się bardziej interesujące. Każdy model z wyjątkiem jednego poprawnie zrozumiał idiom. MiniMax M2.7, wprowadzony w Rundzie 2, dosłownie przetłumaczył "burning", tworząc đốt đuốc, co oznacza "płonące pochodnie". Konsensus słusznie go wykluczył.

Język japoński jest językiem warstwowym pod względem formalności. Wybór końcówki czasownika, zaimka i formy rzeczownika referencyjnego nie jest kwestią stylu. Sygnalizuje związek między mówiącym a odbiorcą. Wysłanie wiadomości do swojego dyrektora generalnego przy użyciu nieformalnych form czasownika nie jest błędem translacji w sensie gramatycznym. To jest błąd społeczny, i znaczący.
Zdanie testowe: Czy możesz to przesłać? Dziękuję, dziękuję za to. Kontekst: wiadomość do dyrektora generalnego.

Konsensus zmienił się, gdy rozszerzył się zbiór modeli. Mechanizm jest prosty: dodanie modeli, które prawidłowo odczytywały kontekst formalności, przesunęło większość, a konsensus poszedł za tym. Oto pełne spektrum tego, co modele wytworzyły w Rundzie 2:

Test rejestru wietnamskiego ujawnił inny rodzaj błędu formalności, który jest bardziej subtelny. Zdanie źródłowe: Hej, szybkie pytanie — czy masz czas na rozmowę? Kontekst: wiadomość do klienta. Qwen w Rundzie 1 użyła "mình", zaimka pierwszej osoby, który implikuje casualową przyjaźń na poziomie równych. Każdy inny model całkowicie unikał odniesienia do siebie w pierwszej osobie, co jest bezpieczniejszym wyborem zawodowym. Kluczowe jest to, że Qwen poprawił to w Rundzie 2 i usunął "mình." Konsensus w obu rundach go wykluczył.

Zdanie dotyczące odszkodowania sprzedawcy/klienta jest standardową klauzulą w umowach handlowych: "Sprzedawca będzie ubezpieczać klienta przed wszelkimi roszczeniami stron trzecich wynikającymi z naruszenia niniejszej umowy."
W Rundzie 1 wszystkie pięć modeli poprawnie zidentyfikowało rejestr prawny i użyło zapożyczeń ベンダー (dostawca) i クライアント (klient), standardowych w japońskich umowach handlowych o angielskim pochodzeniu. Jeden wyjątek: GPT-4.1-NANO użył 販売者 (seller) i 顧客 (customer), uzasadnionych słów japońskich, którym brakuje formalnej precyzji prawnej odpowiedników zapożyczonych.
Bardziej istotne odkrycie pojawiło się w Rundzie 2. Kluczowe rozróżnienie dotyczy dwóch słów:
To są prawnie różne koncepcje. "Indemnify" konkretnie oznacza ochronę strony przed odpowiedzialnością wobec osób trzecich. 免責 jest prawidłowym terminem prawnym. Wszystkie modele z rundy 1 używały 補償. W Rundzie 2 DeepSeek V4-Pro był jedynym modelem, który wyprodukował 免責, i zrobił to tylko w Rundzie 2, a nie w Rundzie 1.

W umowie 補償 i 免責 nie są synonimami. "One" oznacza "zwrócimy ci pieniądze." Drugi oznacza "jesteś chroniony przed roszczeniem już na samym początku". Jeśli platforma tłumaczeniowa używa 補償 gdzie 免責 jest poprawne, prawnik czytający wersję japońską nie zobaczy tej samej umowy, którą opisuje wersja angielska.
To jest najważniejsze odkrycie w zbiorze danych. Zdanie testowe: "Ten lek jest przeciwwskazany u pacjentów z wywiadem zaburzeń funkcji wątroby." Źródło: dokumentacja produktu klinicznego. Cel: Wietnam.
Krytycznym terminem jest "upośledzenie funkcji wątroby". Są dwaj kandydaci wietnamskich:
Są one klinicznie odrębne. Ostrzeżenie o przeciwwskazaniu oparte na "upośledzeniu czynności wątroby" dotyczy każdej osoby ze zmniejszoną funkcją wątroby, a nie tylko tych, które doświadczyły całkowitej niewydolności narządu. Użycie suy gan zawęża wskazaną populację nieprawidłowo. Pacjent z umiarkowanym upośledzeniem funkcji wątroby, który czyta suy gan, może nie rozpoznać się jako populacja, dla której lek jest przeciwwskazany.

Niektóre zdania źródłowe są celowo dwuznaczne. "To jest chore" we współczesnym angielskim slangu oznacza coś doskonałego, ale nadal nosi też swoje dosłowne znaczenie (czyli coś odrażającego/obrzydliwego), a napięcie między tymi dwoma znaczeniami jest częścią tego, jak fraza się komunikuje. Wyzwaniem dla modelu tłumaczenia jest: czy zachować niejednoznaczność, zwinąć ją do najbardziej prawdopodobnego znaczenia, czy wybrać jedno i się przy nim trzymać?


Modele w tym teście nie są równoważne. Obejmują różne architektury, reżimy treningowe i konteksty wdrażania. Linia bazowa Rundy 1 obejmuje modele, które są szeroko dostępne. Rozszerzona pula Round 2 dodaje kilka najnowszych wariantów modeli premium dostępnych teraz dla płacących użytkowników na MachineTranslation.com, tego samego poziomu modelu, który w innym przypadku oznaczałby osobne płatne konto u każdego indywidualnego dostawcy.

Rozszerzona pula w Round 2 zawiera modele, które są bardziej zaawansowane i dostępne dla płacących użytkowników na MachineTranslation.com. Wpływ rozszerzenia puli nie jest jednolity. W niektórych testach (formalność/japoński) znacząco zmienił konsensus. W innych przypadkach (terminologia medyczna/wietnamski) podział się pogłębił.

Dane testowe wskazują na dwie odrębne kategorie błędów i wymagają one różnych odpowiedzi.
Kategoria A: Ciche błędy. Błędy formalne, błędy rejestru, precyzja terminologii medycznej: te elementy tworzą wyniki, które wyglądają poprawnie. Japoński jest gramatyczny. Wietnamczyk płynnie się posługuje językiem. Nie ma żadnego sygnału na powierzchni, że coś poszło nie tak. Użytkownik mówiący tylko jednym językiem, czytający wynik z jednego modelu, nie ma możliwości poznania, że model dokonał wyboru rejestru, który zauważyłby wysoki rangą japoński dyrektor, lub że termin kliniczny został zawężony w sposób, który zmienia populację, do której się odnosi.
Kategoria B: Widoczne błędy. MiniMax tłumaczący "burning the midnight oil" jako "burning torches." GPT-4.1-NANO rozwiązuje "That's sick" na jednoznaczne "すごい." Te są wykrywalne, albo przez mówiącego w języku docelowym, albo poprzez porównanie z innymi wynikami modelu.
Porównanie wielu modeli, które zapewnia SMART, jest najbardziej wartościowe w Kategorii A. Gdy pięć lub dziesięć modeli produkuje wyniki i większość zgadza się na rejestr formalny, podczas gdy jeden produkuje potoczną japońszczyznę w formie zwykłej, niezgoda jest widoczna w widoku porównania. Użytkownik mówiący w języku docelowym może ocenić opcje. Użytkownik, który nie może zobaczyć, że podjęto sprzeczną decyzję, może zdecydować, czy zdanie to wymaga przeglądu człowieka.
W przypadku pracy na poziomie dokumentu, dużych plików, tłumaczenia zachowującego układ plików PDF, umów lub materiałów klinicznych, możliwość przetwarzania dokumentów platformy obsługuje strukturę pliku bez naruszania formatowania. Ale powyższe pytania dotyczące jakości mają zastosowanie niezależnie od rozmiaru pliku. Studia kliniczna licząca 100 stron, w której każde wystąpienie terminu "hepatic impairment" jest tłumaczone jako "liver failure", stanowi większą wersję tego samego problemu zidentyfikowanego w Teście 2.
W przypadku kategorii medycznych i prawnych, weryfikacja człowieka jest właściwym zabezpieczeniem. Usługa Post-Editingu AI firmy Tomedes, która łączy wynik AI ze sprawdzeniem przez certyfikowanego człowieka, została stworzona właśnie dla tego rodzaju treści o wysokiej stawce. Podziału suy gan / suy giảm chức năng gan jest dokładnie tym rodzajem odkrycia, które powinno wyzwolić tę przegląd, nie dlatego, że wszystkie modele są błędne, ale dlatego, że modele, które są najbardziej pewne, nie są najbardziej precyzyjne.
Wartość widzenia wielu wyników nie polega na tym, że zawsze wybierzesz większość. To jest, że będziesz wiedzieć, że dokonano wyboru, co różni się od założenia, że wynik przed tobą jest poprawny.

Postaw osiem testów obok siebie a wzór się utrzymuje: zgoda i niezgoda nie są losowo rozłożone. Idiomatyczne, codzienny język biznesowy ("nawiązać kontakt", "pracować do późna w nocy") zbiegł się w prawie każdym modelu z puli, w obu rundach. Formalność, precyzja prawna i terminologia medyczna nie. Test formalności CEO zmienił się z nieformalnego na formalny tylko wtedy, gdy uwzględniono rozszerzoną pulę. Klauzula odszkodowania ujawniła rzeczywistą różnicę prawną (免責 vs. 補償), którą tylko jeden model w jednej rundzie zrozumiał prawidłowo. Terminologia medyczna nigdy nie została całkowicie rozstrzygnięta, utrzymując się na poziomie około 6 do 4 w obu rundach niezależnie od tego, które modele znajdowały się w puli.
To jest rzeczywistym ustaleniem, a nie twierdzeniem marketingowym: konsensus nie czyni każdego zdania lepszym i nie musi tego robić. Jest to najbardziej wartościowe dokładnie tam, gdzie płynność pojedynczego modelu nie daje ci powodu, aby w niego wątpić, i gdzie bycie w błędzie faktycznie coś kosztuje.
Istnieje druga, bardziej praktyczna warstwa tego testu warta wyraźnego stwierdzenia. Uruchomienie tego porównania samodzielnie oznaczało sprawdzenie wyników z GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo i MiniMax M2.7 obok siebie z istniejącymi modelami bazowymi, w jednym miejscu, na jednej platformie. Poza MachineTranslation.com, to nie jest jedna subskrypcja. To kilka, po jednym dla każdego dostawcy, którego warstwę premium chcesz przetestować, za cenę, którą każdy dostawca pobiera indywidualnie. Płacący użytkownicy tutaj otrzymują to samo porównanie jednym klikniięciem, za ułamek tego, co kosztowałoby utrzymywanie pięciu oddzielnych subskrypcji premium, bez rezygnacji z rzeczy, która naprawdę się liczy: widzenia, gdzie modele się zgadzają, i wiedzy dokładnie, kiedy się nie zgadzają.
Żaden nie jest kategorycznie lepszy; to zależy od kategorii testu. Claude Sonnet i Claude Opus konsekwentnie wybierały bardziej precyzyjny wietnamski termin medyczny, a Claude Opus wyprodukował najbardziej odpowiedni slang na określenie "To jest zajebiste." Ale Claude Sonnet również wyprodukował przypadkowy japoński w zdaniu z formalnym kontekstem CEO, gdzie GPT-5.5 zrobił to prawidłowo. Porównywanie wyników bezpośrednio jest bardziej uzasadnione niż wybór jednego modelu i zaufanie mu.
Nie ma jednego; dokładność zależy od domeny. Gemini 3.5-Flash i GLM-5-Turbo wyprodukowały najbardziej odpowiedni formalny japoński w tym teście. Oba modele Claude wykazały największą precyzję w odniesieniu do wietnamskiej terminologii medycznej. DeepSeek V4-Pro był jedynym modelem, który użył prawidłowego japońskiego terminu prawnego, ale tylko w Rundzie 2, a w innych miejscach produkował potoczny japoński. Żaden pojedynczy model nie dominował we wszystkich ośmiu testach.
Nie, nie automatycznie. Rozszerzenie puli o nowsze warianty modeli w kategorii premium przesunęło konsensus z nieformalnego na formalny w japońskim teście formalności. Ale w teście terminologii medycznej w języku wietnamskim podział utrzymywał się na poziomie około 6 do 4, niezależnie od tego, które modele zostały uwzględnione. Więcej modeli ujawnia więcej niezgody, co jest użytecznym sygnałem, ale konsensus nadal podąża za większością, a większość nie zawsze jest najbardziej precyzyjną odpowiedzią.
SMART to wielomodelowy system konsensusu MachineTranslation.com, obejmujący do 22 modeli AI od dostawców takich jak OpenAI, Anthropic, Google i DeepSeek. Uruchamia tłumaczenie przez wiele modeli jednocześnie i wyświetla wynik większościowego konsensusu obok odpowiedzi każdego modelu, domyślnie, bez konieczności konfiguracji. Konsensus zmienia się, gdy zmienia się pula modeli, co pokazuje wynik formalności japońskiej w tym teście: nieformalny konsensus w Rundzie 1 stał się formalny w Rundzie 2.
Brak jednego modelu; ludzka weryfikacja to lepsze rozwiązanie. Modele Claude konsekwentnie wybierały bardziej precyzyjny wietnamski termin medyczny, a DeepSeek V4-Pro jako jedyny użył prawidłowego japońskiego terminu prawniczego, ale tylko w Rundzie 2. Terminologia medyczna nigdy nie została rozwiązana konsekwentnie w 10 modelach, co sygnalizuje, że wymagana jest wiedza dziedzinowa, a nie wybór innego modelu. Certyfikowana recenzja postedycji przez człowieka, tak jak oferuje Tomedes, zapewnia tę specjalistyczną kontrolę.