September 25, 2026
A GPT-3, GPT-4 és GPT-5 modelleket öt év és több architektúra-generáció választja el egymástól, de a fordítás szempontjából hasznos kérdés nem az, hogy „melyik a legokosabb”. Ennél szűkebb: pontosan mi változott abban, ahogyan ezek a modellek a nyelv azon részeit kezelik, amelyek nem fordíthatók le szó szerint – mint például az idiómák, a kétértelműség és a nyelvi regiszter? A fejlődés konkrét területeken, konkrét pontokon ment végbe, és nem egyenes vonalban haladt a régebbitől az újabb felé.
Az OpenAI 2020-ban adta ki a GPT-3-at, még a MachineTranslation.com saját tesztelési programjának létezése előtt, így az itt leírtak egyike sem minősül saját fejlesztésű benchmarknak. Ez jól dokumentált történelem, nem pedig belső teszteredmény. A GPT-3 volt az első olyan modell a maga nemében, amely feladatspecifikus tanítás nélkül is képes volt gördülékeny, emberinek hangzó szöveget generálni több nyelven, ami valódi mérföldkővé tette. Kifejezetten a fordítás terén ez a gördülékenység valódi kockázatot teremtett: a GPT-3 képes volt magabiztos, jól megformált mondatot létrehozni a célnyelven, amely mégis hibás volt, miközben a kimeneten semmi sem jelezte, hogy hiba történt volna.
A GPT-4 2023 márciusában indult, és a MachineTranslation.com saját modelltesztelése nagyjából ennél a generációnál kapcsolódik be. A fejlődés valós, de egyenetlen volt. A kétértelmű angol „That's sick” kifejezés japánra fordításának tesztelésekor a GPT-4.1-nano volt az egyetlen a hat tesztelt modell közül, amely a kifejezés szándékos kettős jelentését egyetlen értelmezésre szűkítette le, míg a másik öt megőrizte az eredeti kifejezés által szándékolt kétértelműséget. Az idiómák még nagyobb gyengeséget jelentettek: a spanyol „llevarse el gato al agua” idiómát egyszerre öt GPT-verzión átfuttatva a kisebb GPT-4o-mini és a GPT-4.1-nano egyaránt ugyanazt a szó szerinti, hibás fordítást adta, teljesen elvétve az idióma értelmét.
Ugyanez a minta máshol is megmutatkozott. Egy német idiómát, az „ich verstehe nur Bahnhof”-ot nyolc GPT- és Claude-alverzión futtatták át, és kifejezetten a GPT-4o-mini fordította szó szerint és helytelenül, miközben ugyanabban a tesztben egy kisebb, újabb modell, a GPT-4.1-nano eltalálta. A generáció és a modellméret nem függött össze következetesen, amit a MachineTranslation.com modellverzió-tesztelése részletesebben is tárgyal.
Az OpenAI a GPT-5-öt olyan egységes rendszerként mutatta be, amely a feladattól függően egy gyors alapértelmezett modell és egy mélyebb következtető modell között irányítja a kéréseket, ami strukturális változást jelent a GPT-4 egymodelles felépítéséhez képest. Az OpenAI saját GPT-5 System Cardja szerint a modell általános tényszerű hibaaránya nagyjából 45%-kal alacsonyabb, mint a GPT-4-é, és 80%-kal alacsonyabb, mint a GPT-3-é – ez az általános megbízhatóságbeli nyereség kifejezetten a fordításnál is megmutatkozik. A MachineTranslation.com tesztelése ott mutatja a legvilágosabb előrelépést, ahol a GPT-4-korszak modelljei a leginkább küzdöttek: ugyanannál a spanyol idiómánál, amelyet a GPT-4o-mini és a GPT-4.1-nano elhibázott, a GPT-5.4-mini és a GPT-5.4 egyaránt helyes, idiomatikus fordítást adott; mindegyik kissé eltérően fogalmazta meg, de mindkettő megértette magát az idiómát.

A generációk közötti szakadék nem folyamatos emelkedést mutatott. Szinte teljes egészében az idiomatikus és kétértelmű nyelvezetre koncentrálódott. Egyszerű szövegek esetén a GPT-4-korszak és a GPT-5-korszak modelljei szinte azonos pontszámot érnek el.
| GPT-3 | GPT-4 | GPT-5 | |
|---|---|---|---|
| Megjelenés | 2020 | 2023. március | 2025, jelenleg a GPT-5.4/5.5-nél tart |
| Jelenleg elérhető | Nem, kivezetve | Csak API-n keresztül, a ChatGPT-ből kivezetve | Igen, a jelenlegi generáció |
| Idiómák kezelése | A MachineTranslation.com nem tesztelte (megelőzi a programot) | Nem következetes; több idiómát teljesen elvétett | Helyesen kezelte ugyanazokat az idiómákat, amelyeket a GPT-4 elvétett |
| Standard üzleti szöveg | A MachineTranslation.com nem tesztelte | Erős, szinte teljesen megegyezik a későbbi modellekkel | Erős, szinte teljesen megegyezik a GPT-4-gyel |
Ez az utolsó szempont lényeges: egy standard üzleti kifejezés, a „please confirm receipt of this document” németre fordítását vizsgáló külön teszt szinte teljesen azonos eredményt hozott minden tesztelt modellnél, beleértve a GPT-4o-mini-t és a GPT-5 generációs modelleket is. A generációk közötti szakadék kifejezetten az átvitt értelmű és kétértelmű nyelvezetre korlátozódik, nem pedig egy általános minőségbeli különbség.
Nem. Egy héber idióma modellcsaládok közötti tesztelése során a GPT-5.4-mini és a GPT-5.4 ugyanannak a kifejezésnek két különböző, részleges értelmezését adta, és egyik sem volt teljesen helyes, miközben egy régebbi, nem kapcsolódó modell közelebb járt a megoldáshoz. Egy újabb modell nem jelent automatikusan pontosabb működést, és egy nagyobb vagy frissebb modell sem automatikusan a biztonságosabb választás egy adott mondat esetében.
A GPT-3 és a GPT-4 már kivezetésre került a ChatGPT-ből; a GPT-4 már csak az OpenAI API-ján keresztül érhető el a meglévő integrációkhoz. A jelenlegi generáció, a GPT-5.4 és a GPT-5.5 az, amit a MachineTranslation.com ma futtat, és versenyképesen teljesít más szolgáltatók jelenlegi modelljeivel szemben, bár nem minden nyelvpár esetében egyöntetűen jobb. Ha szeretné részletesebben látni, hogyan viszonyulnak egymáshoz a jelenlegi GPT alverziók, valamint az olyan modellekhez képest, mint a Claude és a DeepSeek, tekintse meg a MachineTranslation.com közvetlen alverzió-tesztelését, amely mélyebbre ás, mint amire egy generációs áttekintés képes.
Egy nagyszabású lokalizációs program szempontjából a legfontosabb megállapítás nem az, hogy „a GPT-5 veri a GPT-3-at”. Sokkal inkább az, hogy a modell verziója – és nem pusztán a modellcsalád – határozza meg, hogy egy adott idióma vagy félreérthető kifejezés helyesen kerül-e lefordításra, és ez minden nyelvpárra igaz, nem csak az itt bemutatott néhányra. Ez leginkább az olyan tartalmaknál számít, amelyek eleve a hangnemre és az átvitt értelmű kifejezésekre támaszkodnak, különösen a marketinganyagoknál és a felhasználók által generált tartalmaknál, ahol egyetlen szó szerint lefordított idióma megváltoztathatja egy bejegyzés vagy hirdetés teljes értelmét. Egy olyan program, amely több tucat nyelvre ültet át tartalmat, minden egyes nyelven pontosan ilyen kifejezésekbe fog ütközni. A MachineTranslation.com alverzió-tesztelési sorozata és a teljes modell-összehasonlító tesztelése részletesebben is foglalkozik ezzel. A platform megközelítése – miszerint minden fordításnál a jelenlegi GPT-modelleket több mint 20 egyéb modell mellett futtatja – kifejezetten azért létezik, mert egyetlen modell verziótörténete sem jelent önmagában elég megbízható garanciát.
A GPT-3 viszonylag jól kezelte az egyszerű szövegeket, de komolyan küszködött minden idiómával vagy kétértelmű kifejezéssel. A GPT-4 jelentősen csökkentette ezt a különbséget, de néhány valóban kétértelmű kifejezést még mindig egyetlen jelentésre szűkített le ahelyett, hogy megőrizte volna a kétértelműséget. A GPT-5 későbbi alverziói helyesen kezelték azokat az idiómákat, amelyeket a korábbi, GPT-4-korszakbeli modellek szó szerint és hibásan fordítottak le.
Nem. A MachineTranslation.com saját tesztelése során talált olyan eseteket, amikor egy kisebb, újabb alverzió felülteljesített egy nagyobb, régebbi verziót, a generációk közötti minőségi különbség pedig inkább az idiómákra vagy az átvitt értelmű nyelvezetre korlátozódik, semmint általános, mindent átfogó javulást jelentene.
Nem. Mindkettőt kivezették a ChatGPT-ből, és újabb, GPT-5 generációs modellekkel váltották fel őket. A GPT-4 már csak az OpenAI API-ján keresztül érhető el a meglévő integrációkhoz, nem pedig aktuális, végfelhasználók számára elérhető opcióként.
A MachineTranslation.com az aktuális GPT-5 generációs modelleket futtatja (a GPT-5.4-et és a GPT-5.5-öt, a csomagszinttől függően) több mint 20 egyéb AI-modellel együtt minden fordításnál, ahelyett, hogy kizárólag a GPT-re támaszkodna.
A GPT-5 generációs modellek versenyképesen teljesítenek, de nem egyöntetűen jobbak az olyan modelleknél, mint a Claude, a Gemini vagy a DeepSeek. Különböző nyelvpárok és tartalomtípusok esetén más-más modellek bizonyulnak jobbnak, ezért a MachineTranslation.com közvetlenül egymással veti össze őket ahelyett, hogy egyet választana ki alapértelmezettként.