June 10, 2026
Chcę podzielić się czymś, co zdecydowaliśmy w tym tygodniu — nie po tym, jak zostało to wysłane, ale podczas gdy wciąż to budujemy.
Zmieniamy sposób alokacji modeli AI w naszych poziomach użytkowników. Płacący użytkownicy na MachineTranslation.com wkrótce uzyskają dostęp do bardziej zaawansowanych modeli AI od wiodących dostawców — OpenAI, Anthropic, Google, DeepSeek i innych. Darmowi użytkownicy nadal będą otrzymywać wydajne, niezawodne tłumaczenia — ale nie te same modele. Ta luka jest celowa i chcę dokładnie wyjaśnić, dlaczego podejmujemy tę decyzję.
Wolę napisać to teraz, kiedy uzasadnienie jest świeże, a decyzja jest jeszcze trochę surowa, niż czekać, aż będzie to aktywne i przedstawić to jako dopracowane ogłoszenie. Uczciwa wersja jest bardziej użyteczna.
MachineTranslation.com tłumaczy jednocześnie za pomocą 22 modeli AI i wykorzystuje podejście oparte na konsensusie, aby przedstawić najlepszy wynik. To zawsze było sednem tego, co robimy — nie stawiając wszystkiego na jeden model, ale porównując kilka i pozwalając wynikom mówić samym za siebie.
Niekomfortową stroną tego podejścia jest to, że sprawia, iż różnice w jakości między modelami stają się bardzo widoczne. Widzimy, każdego dnia, że nie wszystkie modele radzą sobie z każdym tekstem równie dobrze. I przez długi czas nie pozwoliliśmy, aby ta obserwacja zmieniła sposób, w jaki przydzielaliśmy modele użytkownikom.
Kilka tygodni temu Rachelle (nasza liderka AI) zaprezentowała nam wewnętrzne narzędzie, które zbudowaliśmy do testowania jakości tłumaczeń jednocześnie w wielu modelach GPT — w tym GPT 4.1 nano, GPT 4.1 mini, GPT 5.4 mini i innych. Wprowadzasz ten sam tekst źródłowy i widzisz wynik każdego modelu obok siebie.
To, co to narzędzie od razu jasno pokazuje, to: w przypadku prostego, krótkiego, codziennego tekstu, wyniki są niemal identyczne. Naprawdę nie da się uzasadnić argumentu jakościowego dla modeli premium w przypadku spotkanie jest o 15:00.
Ale w przypadku czegokolwiek o prawdziwej złożoności językowej (frazeologia idiomatyczna, terminologia dziedzinowa, długie dokumenty, gdzie kontekst musi być przeniesiony przez tysiące słów) różnica między modelami się powiększa, i powiększa się w sposób, który ma znaczenie zawodowe.
To jest ta część, o której, jak sądzę, branża tłumaczeniowa nie mówi wystarczająco szczerze. Modele niższej klasy zazwyczaj nie generują oczywiście błędnych tłumaczeń. Generują tłumaczenia, które na pierwszy rzut oka wydają się poprawne, ale zawierają subtelne błędy, które ekspert w danej dziedzinie (prawnik, lekarz, starszy menedżer ds. lokalizacji) natychmiast by wychwycił.
Zdanie warunkowe oddane z błędnym znaczeniem. Termin prawny, który oznacza coś konkretnego w danej jurysdykcji, przetłumaczony jako jego potoczny odpowiednik. Dryf rejestru w połowie długiego dokumentu, który podważa profesjonalną wiarygodność całości.
Ta wada jest cicha. A ciche niepowodzenia w profesjonalnym tłumaczeniu mogą być kosztowne.
Nie podjęliśmy tej decyzji na podstawie intuicji. Przeprowadziliśmy testy modeli na złożonym, idiomatycznym tekście źródłowym (rodzaju treści, które nasi profesjonalni użytkownicy faktycznie potrzebują przetłumaczyć) i poprosiliśmy lingwistów o ocenę wyników.
Wynik był jasny. Zaawansowane modele radziły sobie konsekwentnie lepiej z niuansami, rejestrem i terminologią dziedzinową. Tańsze modele były w zupełności wystarczające do okazjonalnego użytku. Te dwa przypadki użycia naprawdę wymagają różnych narzędzi.

Rozmowa, którą to wywołało wewnętrznie, dotyczyła mniej cen, a bardziej uczciwości. Jeśli wiemy, że modele działają inaczej w przypadku treści profesjonalnych, i wiemy, że nasi płacący użytkownicy w dużej mierze tłumaczą treści profesjonalne, wówczas dawanie im tego samego modelu co darmowemu użytkownikowi, który tłumaczy swobodny e-mail, jest krzywdzące dla obu stron.
Ofer (nasz CEO) wyraził to wprost w naszej wewnętrznej dyskusji:
Modele niższego poziomu niosą ze sobą realne ryzyko jakości w przypadku złożonego lub idiomatycznego tekstu. Ale większa kwestia jest taka: konsensus jest tylko tak dobry, jak modele, które za nim stoją. Kiedy płacący użytkownicy otrzymują bardziej zaawansowane modele, nie dostają tylko lepszych pojedynczych wyników — uzyskują silniejszy konsensus. Lepsze modele, lepszy konsensus, bardziej niezawodne tłumaczenia. To właśnie oznacza profesjonalne tłumaczenie.
To ujęcie zapadło mi w pamięć. To nie tylko argument kosztowy. To argument za jasnością.
Bardziej wydajne modele AI kosztują znacznie więcej za token w eksploatacji. To nie jest polityka MachineTranslation.com, tak właśnie każdy główny dostawca AI wycenia swoje flagowe modele. OpenAI, Anthropic, Google i DeepSeek wszystkie rezerwują swoje najnowsze, najbardziej zaawansowane modele dla płacących klientów, ponieważ te modele są znacznie droższe w eksploatacji. Uruchamianie naszego najbardziej zaawansowanego modelu dla każdego darmowego tłumaczenia, każdego swobodnego zapytania, każdego zapytania typu „co mówi ten znak” znacznie zwiększyłoby nasze koszty infrastruktury.
Co ważniejsze, oznaczałoby to wzajemne subsydiowanie przypadków użycia o niskiej złożoności budżetem obliczeniowym, którego potrzebujemy do utrzymania jakości dla profesjonalistów tłumaczących 10 000-słowne dokumenty techniczne. To nie jest zrównoważona ani rozsądna alokacja.
Istnieje wersja tej decyzji, która jest czysto merkantylna — pobieraj więcej, dawaj więcej, proste. To nie jest tak naprawdę to, co tym kieruje.
Tym, co tym kieruje, jest to, że zbudowaliśmy platformę, która może rzeczywiście ujawnić różnice w jakości między modelami AI. Mamy wewnętrzne narzędzia, aby wyraźnie zobaczyć te różnice. Ignorowanie tej widoczności podczas projektowania naszych poziomów użytkowników byłoby rodzajem nieuczciwości, udawaniem, że luka nie istnieje, mimo że mamy dowody na jej istnienie.
Darmowi użytkownicy zasługują na to, by wiedzieć, co otrzymują. Płacący użytkownicy zasługują na to, by wiedzieć, że otrzymują coś znacząco innego. I różnica to nie tylko dostęp do bardziej zaawansowanych modeli, ale dostęp do silniejszego konsensusu zbudowanego z tych modeli. To jest sygnał niezawodności, którego żadna pojedyncza sztuczna inteligencja nie może zapewnić.
Nadal dopracowujemy szczegóły implementacji, więc chcę być ostrożny, aby nie obiecywać zbyt wielu konkretów. Ale oto kierunek.
Tłumaczenia w ramach darmowego planu będą nadal korzystać z wydajnych modeli AI. Dla większości codziennych zadań tłumaczeniowych (krótkie wiadomości, swobodne czytanie, podstawowa korespondencja), darmowi użytkownicy otrzymają dokładne, niezawodne tłumaczenia. To się nie zmienia.
Darmowy poziom istnieje, ponieważ wierzymy, że język nie powinien być barierą, i nie wycofujemy się z tego.
Różnica będzie najbardziej widoczna w przypadku:
| Typ treści | Dlaczego jakość modelu ma tu znaczenie |
|---|---|
| Dokumenty prawne i finansowe | Klauzule warunkowe, terminologia specyficzna dla jurysdykcji, spójność rejestru |
| Dokumentacja techniczna | Słownictwo specyficzne dla dziedziny, spójność długich dokumentów |
| Teksty medyczne i kliniczne | Precyzja, rejestr, wrażliwość na dwuznaczność |
| Teksty marketingowe i wizerunkowe | Idiomatyczne ujęcie, dokładność tonu, rezonans kulturowy |
| Pary językowe o niskich zasobach | Mniejsza ilość danych treningowych oznacza większe luki w jakości modelu |
| Długie dokumenty (ponad 5000 słów) | Zachowanie kontekstu, spójność w całym dokumencie |
Dla profesjonalnych użytkowników pracujących w którejkolwiek z tych kategorii, poziom modelu zrobi prawdziwą różnicę. Właśnie dla nich stworzono nasze płatne plany.
A ponieważ konsensus SMART jest budowany na podstawie tych bardziej zaawansowanych modeli, płacący użytkownicy otrzymują nie tylko lepsze indywidualne wyniki — otrzymują bardziej niezawodne tłumaczenia AI, generowane przez najnowsze modele współpracujące ze sobą.
Chcę być szczery, że to jeszcze nie wszystko zostało rozwiązane.
Nadal ustalamy dokładny przydział modeli — które modele znajdują się na którym poziomie i jak jasno komunikujemy to użytkownikom w produkcie. Pracujemy nad logiką paywalla, aby upewnić się, że doświadczenie jest płynne, a nie szarpane. I starannie rozważamy, jak przedstawić użytkownikom informacje o jakości modelu w sposób, który jest naprawdę użyteczny, a nie tylko chwytem marketingowym.
Mamy też do rozwiązania ważne pytanie, które nas nurtuje: jak pomóc darmowemu użytkownikowi zrozumieć, w danej chwili, kiedy natrafili na przypadek użycia, w którym ulepszenie znacząco poprawiłoby ich wyniki? To wyzwanie UX w takim samym stopniu, jak produktowe, i nie mamy jeszcze pełnej odpowiedzi.
Napiszę o tym, jak to się sprawdzi, gdy już będzie aktywne. Na razie, takie są przemyślenia.
Jeśli jesteś płacącym użytkownikiem i chcesz wyrazić swoją opinię na temat tego, co jest dla ciebie najważniejsze w jakości modelu, jestem szczerze zainteresowany. Wyślij wiadomość za pośrednictwem strony kontaktowej MachineTranslation.com.
Ponieważ nasze wewnętrzne testy wykazały znaczącą różnicę w jakości między poziomami modeli w profesjonalnych zadaniach tłumaczeniowych. Zbudowaliśmy narzędzie do jednoczesnego porównywania wielu modeli AI, a dane jasno pokazały: zaawansowane modele znacznie lepiej radzą sobie ze złożonymi, idiomatycznymi i specyficznymi dla danej dziedziny treściami. Zmiana poziomu uczciwie odzwierciedla tę rzeczywistość. Większą korzyścią dla płacących użytkowników jest to, że konsensus SMART jest budowany na podstawie bardziej zaawansowanych modeli, co oznacza, że sam sygnał niezawodności jest silniejszy.
Nie. Użytkownicy darmowego planu nadal będą otrzymywać sprawne, dokładne tłumaczenia do codziennych zastosowań. Zmiana polega na tym, że płacący użytkownicy zostaną ulepszeni do bardziej zaawansowanych modeli, a nie na tym, że darmowi użytkownicy zostaną zdegradowani.
Dokumenty prawne, finansowe, medyczne, techniczne oraz obszerne dokumenty — oraz wszelkie treści w mniej popularnych parach językowych, gdzie dane szkoleniowe są rzadsze. Dla krótkiego, prostego, codziennego tekstu, różnica między poziomami modeli jest minimalna. Większą korzyścią dla płacących użytkowników jest to, że konsensus SMART jest budowany z bardziej zaawansowanych modeli, co oznacza, że sam sygnał niezawodności jest silniejszy.
Budujemy to teraz. Opublikuję aktualizację, gdy zostanie wysłana, w tym jak wygląda doświadczenie w produkcie i co pokazują wczesne dane.
Uruchamiamy jednocześnie wiele modeli i stosujemy oparte na konsensusie podejście do punktacji, aby ocenić wyniki. Nasze wewnętrzne narzędzie porównawcze pozwala nam testować jakość w różnych poziomach modeli na tym samym tekście źródłowym, co zadecydowało o tej decyzji dotyczącej poziomowania. Możesz dowiedzieć się więcej o tym, jak działa system konsensusu MachineTranslation.com.com.