July 10, 2026
Két szó. Hat modell. Három különböző fordítási döntés. Íme, mi történt, amikor 8 tesztmondatot futtattam végig a MachineTranslation.com-on elérhető legújabb AI-modelleken, és mit árulnak el valójában a kimenetek arról, hogy mikor bukik meg csendesen egy modell.
Két szó. Ez beteg. Hat modell. Három különálló fordítási döntés.
Japánban egy modell úgy fordította le それはやばい, megőrizve a kétértelműséget. Egy másik teljesen elhagyta a tárgy személyes névmást, és a nyers formát írta やばい, a lehető legközvetlenebb verzió. Egy harmadik azt írta それはすごい, amely teljesen feloldja a kétértelműséget az "Amazing" javára, és eltávolítja azt a kettős jelentést, amely az eredeti kifejezést érdekessé tette. Vietnamiban nyelvben egy modell ezt írta Đỉnh vậy (szleng, helyes a fiatalok nyelvhasználatában). Egy másik azt írta Thật tuyệt vời, nyelvtanilag helyes, de közelebb áll ahhoz, hogy azt mondjuk "ez valóban csodálatos", amikor valaki egy mém-et küld neked.
Mindezek védekezhetőek. Egyikük sem ugyanaz a dolog. És ha egyetlen modellen keresztül futtatod a fordításokat, soha nem fogod látni azt a választást, amelyet a te helyedben meghoztak.
Ez az a központi kérdés, amelyre ez a cikk próbál választ adni. Nem arról, hogy melyik AI-modell a legjobb a fordításhoz 2026-ban (a válasz a nyelvpártól, a regisztertől, a doméntől és a mondatszerkezettől függ), hanem: hogyan tudnád meg, amikor a modelled rossz döntést hozott? Különösen olyan területeken, mint az orvosi terminológia, jogi szerződések vagy szakmai formalitás, ahol a rossz döntés pontosan úgy néz ki, mint egy helyes fordítás, amíg egy szakember el nem olvassa.
Így cselekedtem. 8 tesztmondatot futtattam végig két modellkörön az MachineTranslation.com oldalon: először egy alapvonal 5 széles körben használt modellel, majd egy bővített készlettel, amely több, a legújabb prémium szintű modellvariánst tartalmaz, amelyek jelenleg a fizetős felhasználók számára érhetők el. Normálisan az ilyen modellek kimenetének összehasonlítása azt jelentené, hogy külön-külön fizetett előfizetéseket kellene kötni az egyes szolgáltatóknál. A MachineTranslation.com webhelyen ugyanabban az összehasonlító nézetben találhatók. A nyelvpárok az angol→japán és angol→vietnami voltak. A mondatkategóriákat kifejezetten azoknak a területeknek a stressztesztjére választották, ahol a modellek közötti nézeteltérés a legfontosabb: idiomatikus kifejezések, jogi terminológia, orvosi terminológia, formalitásra érzékeny kontextus és szándékos szemantikai kétértelműség.
Megjegyzés az értékelési módszertanról: a gépi fordítási kutatás hosszú ideje küzd azzal, hogy hogyan lehet automatikusan pontozni a kimeneteket. Az olyan metrikák, mint a BLEU és a COMET , amelyeket a WMT megosztott feladatokban mérnek, hasznos összesített jelet adnak, de rosszak a regiszter hibák, idiomatikus kifejezések kudarcai és terminológiai pontosság felismerésében, pontosan azok a kategóriák, amelyek itt a legfontosabbak. Az, amit most olvasni fogsz, kimeneti elemzés, nem pedig egy BLEU verseny.

Nem minden mondat jelent értelmes nézeteltérést. A nyolc teszt közül kettő, a "Let's touch base once the dust settles on this deal" (→ Japán) és a "We're burning the midnight oil to hit this launch date" (→ Vietnami) magas egyezést mutatott mindkét fordulóban. Az idiómákat helyesen idiómákként értelmezték. Senki nem fordította le a "touch base"-t úgy, hogy egy fizikai bázist érinti. Senki nem fordította le a "the dust settles" kifejezést úgy, hogy "üledék lehullik".
Érdemes ezen megállni: az idiomatikus angol üzleti nyelv meglehetősen jól kezelhető a jelenlegi csúcstechnológiás modellek által, amikor az idiomatikus kifejezés elég gyakori. A "touch base" kifejezésre vonatkozó konszenzus mindkét körben stabil maradt; a variáció tisztán stilisztikai volt, attól függően, hogy a この件 (this matter), a この取引 (this deal), vagy a この案件 (this case) kifejezéseket használták-e a forrásszöveghez.

Az "éjfélig dolgozás" teszt az, ahol a dolgok érdekesebbé váltak. Egy modell kivételével minden modell helyesen értelmezte az idiómát. MiniMax M2.7, a Round 2-ben bemutatott modell, szó szerint fordította a "burning" szót, így "égő fáklyák" jelentésű kifejezést hozva létre đốt đuốc. A konszenzus helyesen kizárta.

A japán egy formalitás-rétegzett nyelv. Az ige végződésének, a névmásnak és a referenciális főnév alakjának választása nem stilisztikai jellegű. Ez jelzi a beszélő és a címzett közötti kapcsolatot. Egy üzenet küldése a vezérigazgatónak informális igealakokkal nem nyelvtani értelemben fordítási hiba. Ez társadalmi hiba, és jelentős is.
Tudod elküldeni azt? Köszönöm, értékelem. Kontextus: egy vezérigazgatónak üzenetezés.

A konszenzus akkor változott meg, amikor a modellkészlet kibővült. A mechanizmus egyértelmű: az olyan modellek hozzáadása, amelyek helyesen értelmezik a formalitás kontextusát, eltolódást okozott a többségben, és a konszenzus követte azt. Íme a teljes spektruma annak, amit a modellek a 2. körben létrehoztak:

A vietnami regiszter teszt egy másik típusú formalitási hibát tárt fel, amely sokkal finomabb. A forrásmondat: "Szia, gyors kérdés — szabadban vagy egy hívásra?" Kontextus: üzenet küldése egy ügyfélnek. Az 1. körben a Qwen a "mình" szót használta, amely egy első személyű névmás, amely alkalmi, egyenrangú barátságot jelent. Minden más modell teljesen elkerülte az első személyű önhivatkozást, amely a biztonságosabb szakmai választás. Döntően a Qwen ezt a 2. körben korrigálta, és elhagyta a "mình"-t. A konszenzus mindkét körben kizárta.

Az eladó/ügyfél kártérítési záradéka a kereskedelmi megállapodások standard klauzulája: "**A szállító köteles kártérítésre kötelezni az ügyfelet az e megállapodás megsértéséből eredő harmadik fél által támasztott követelések ellen.**"
Az 1. körben mind az öt modell helyesen azonosította a jogi regisztert, és a ベンダー (beszállító) és クライアント (ügyfél) kölcsönszavakat használta, amelyek szabványosak az angol eredetű japán kereskedelmi szerződésekben. Egy kivétel: A GPT-4.1-NANO a 販売者 (seller) és 顧客 (customer) szavakat használta, amelyek legitim japán szavak, de hiányoznak belőlük az úgynevezett kölcsönzött szavak formális jogi specificitása.
A fontosabb megállapítás a 2. körben merült fel. A kulcsfontosságú megkülönböztetés két szó között:
Ezek jogi szempontból különböző fogalmak. Az "indemnify" kifejezés konkrétan azt jelenti, hogy egy felet harmadik fél felelőssége alól megvédeni. A 免責 a helyes jogi kifejezés. All Round 1 modellek 補償-t használtak. A 2. körben a DeepSeek V4-Pro volt az egyetlen modell, amely a 免責 kifejezést előállította, és ezt csak a 2. körben tette meg, nem az 1. körben.

Egy szerződésben a 補償 és 免責 nem szinonimák. Az egyik azt jelenti, hogy "visszatérítjük az összeget." A másik azt jelenti, hogy "az első helyen már védve vagy az igény ellen." Ha egy fordítási platform a 補償 kifejezést használja, ahol a 免責 lenne helyes, akkor egy japán nyelvű ügyvéd nem fogja látni ugyanazt a megállapodást, amelyet az angol verzió leír.
Ez a legrelevánsabb megállapítás az adathalmazban. A tesztmondat: "Ez a gyógyszer ellenjavallt a máj működésének zavarával rendelkező betegek esetében." Forrás: klinikai terméktájékoztatás. Cél: Vietnamese.
A kritikus kifejezés a "hepatikus károsodás". Van két vietnami jelölt:
Ezek klinikailag különbözőek. A "máj-elégtelenség" alapján adott ellenjavallat figyelmeztetés mindenkire vonatkozik, akinek csökkent a máj működése, nem csak azokra, akik teljes szerv-elégtelenséget tapasztaltak. Az "suy gan" használata helytelenül szűkíti le a jelzett populációt. Egy mérsékelt májkárosodással rendelkező beteg, aki a "suy gan" kifejezést olvassa, nem ismerheti fel magát a kontraindikált populációként.

Egyes forrásmondat szándékosan kétértelmű. "Ez beteg" a kortárs angol szlengben valami kiválót jelent, de továbbra is megtartja szó szerinti jelentését (vagyis undorító/visszataszító), és e két jelentés közötti feszültség része annak, ahogy a kifejezés kommunikál. Az fordítási modell kihívása: megőrzöd-e a kétértelműséget, összeomlasztod-e a legvalószínűbb jelentésre, vagy kiválasztasz egyet és elkötelezed magad?


Az ebben a tesztben szereplő modellek nem mind egyenértékűek. Különböző architektúrákat, képzési rendszereket és telepítési kontextusokat ölelnek fel. Az 1. forduló alapvonala olyan modelleket tartalmaz, amelyek széles körben elérhetők. A Round 2-ben bővített készlet számos legújabb prémium szintű modellvariánst tartalmaz, amelyek jelenleg a MachineTranslation.com fizetős felhasználói számára érhetők el, ugyanaz a modellszint, amely egyébként külön fizetős fiók szükségességét jelentené az egyes szolgáltatóknál.

A Round 2-ben bővített készlet olyan modelleket tartalmaz, amelyek fejlettebbek és a MachineTranslation.com fizetős felhasználói számára érhetők el. A készlet bővítésének hatása nem egyenletes. Egyes tesztekben (formalitás/japán) jelentősen eltolódott a konszenzus. Másoknál (orvosi terminológia/vietnami) a hasadás mélyült.

A tesztadatok két különálló meghibásodási kategóriára mutatnak, és eltérő válaszokat igényelnek.
A kategória: Csendes hibák. Formai hibák, regiszter hibák, orvosi terminológia pontossága: ezek olyan kimeneteket hoznak létre, amelyek helyesnek tűnnek. A japán nyelvtan helyes. A vietnami folyékonyan beszél. Nincs felszíni jel arra, hogy valami rosszul ment volna. Egy egynyelvű felhasználó, aki egyetlen modell kimenetét olvassa, nem tudhatja, hogy a modell olyan regiszterválasztást végzett, amelyet egy magas rangú japán vezetője észrevenni, vagy hogy egy klinikai kifejezést olyan módon szűkítettünk, amely megváltoztatja azt a populációt, amelyre vonatkozik.
B kategória: Látható hibák. A MiniMax a "burning the midnight oil" kifejezést "égő fáklyák"-ként fordította le. GPT-4.1-NANO a "That's sick" kifejezést a félreérthetetlen "すごい" kifejezésre oldja fel. Ezek észlelhetők, akár a célnyelv beszélője, akár más modellek kimenetével való összehasonlítás révén.
A többmodelles összehasonlítás, amelyet a SMART biztosít, a legértékesebb az A kategóriában. Amikor öt vagy tíz modell hoz létre kimeneteket, és a legtöbb egyetért egy formális regiszterben, míg az egyik alkalmi egyszerű formájú japánt állít elő, az eltérés az összehasonlítási nézetben látható. Egy olyan felhasználó, aki beszéli a célnyelvet, képes értékelni az opciókat. Egy felhasználó, aki nem látja, hogy vitatott döntés született, dönthet arról, hogy az adott mondat megérdemli-e az emberi felülvizsgálatot.
A dokumentum szintű munkához, nagyméretű fájlokhoz, a PDF-ek, szerződések vagy klinikai anyagok elrendezést megőrző fordításához a platform dokumentumfeldolgozási képessége kezeli a fájlstruktúrát anélkül, hogy megtörné a formázást. De a fent felvetett minőségi kérdések a fájlmérettől függetlenül érvényesek. Egy 100 oldalas klinikai tanulmány, ahol a "hepatikus károsodás" minden előfordulása "májelégtelenségként" van lefordítva, ugyanannak a 2. tesztben azonosított problémának a nagyobb verziója.
Az orvosi és jogi kategóriák esetében kifejezetten az emberi ellenőrzés a helyes megoldás. A Tomedes AI utófeldolgozási szolgáltatása, amely az AI-kimeneteket tanúsított emberi felülvizsgálattal párosítja pontosan az ilyen magas tétű tartalmakhoz, erre a célra készült. A suy gan / suy giảm chức năng gan felosztás pontosan az a típusú megállapítás, amely kiválthatna egy ilyen felülvizsgálatot, nem azért, mert az összes modell hibás, hanem azért, mert a legbizalmasabb modellek nem a legpontosabbak.
A több kimenet megtekintésének értéke nem abban rejlik, hogy mindig a többséget választod. Az a lényeg, hogy tudni fogod, hogy egy választás megtörtént, ami különbözik attól, hogy feltételezed, hogy az előtted lévő kimenet helyes.

Helyezd egymás mellé a nyolc tesztet, és egy minta érvényes: az egyetértés és a nézeteltérés nem véletlenszerűen oszlik meg. Az idiomatikus, mindennapi üzleti nyelvezet ("kapcsolatot tartani", "éjszaka dolgozni") szinte minden modellben konvergált mindkét fordulóban. Formalitás, jogi pontosság és orvosi terminológia nem. A CEO-formalitás teszt csak akkor váltott át a lezser stílusból a formálisra, amikor a bővített készlet is bevonásra került. Az indemnifikációs záradék egy valódi jogi megkülönböztetést hozott felszínre (免責 vs. 補償), amelyet csak egy modell, egy körben, értelmezett helyesen. Az orvosi terminológia megosztottsága egyáltalán nem oldódott meg, mindkét körben nagyjából 6-4 arányban maradt, függetlenül attól, hogy mely modellek voltak a készletben.
Ez az tényleges megállapítás, nem pedig egy marketingcélú állítás: a konszenzus nem tesz minden mondatot jobbá, és nem is szükséges hozzá. Ez leginkább ott értékes, ahol egy modell folyékonysága nem ad okot a kételkedésre, és ahol a tévedésnek valódi ára van.
Ennek a tesztnek van egy második, praktikusabb rétege is, amit érdemes világosan kimondani. Ennek az összehasonlításnak az önálló elvégzése azt jelentette, hogy a GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo és MiniMax M2.7 kimeneteit egymás mellett, egy helyen, egy platformon kellett ellenőriznem a meglévő alapmodellekkel. A MachineTranslation.com-on kívül ez nem egy előfizetés. Több is van belőle, egy-egy mindegyik olyan szolgáltatóhoz, amelynek prémium szintjét tesztelni szeretnéd, az adott szolgáltató által egyedileg felszámított áron. Az itt fizetős felhasználók ugyanezt az összehasonlítást egy kattintásra kapják meg, töredékéért annak, amit öt külön prémium előfizetés fenntartása költene, anélkül, hogy lemondanának arról, ami valóban számít: látni, hogy a modellek hol értenek egyet, és pontosan tudni, hogy mikor nem.
Egyik sem jobb kategorikusan; ez a teszt kategóriájától függ. A Claude Sonnet és a Claude Opus következetesen a pontosabb vietnami orvosi kifejezést választotta, és a Claude Opus állította elő a legalkalmasabb szlengét a "That's sick." kifejezésre. De Claude Sonnet azonban informális japánt is előállított egy formális vezérigazgató-kontextusú mondatban, ahol a GPT-5.5 helyesen értelmezte. A kimenetek közvetlen összehasonlítása jobban megvédhetõ, mint egy modellt kiválasztani és megbízni benne.
Nincs egy; a pontosság doménfüggő. Ebben a tesztben a Gemini 3.5-Flash és a GLM-5-Turbo a legmegfelelőbb formális japánt produkálta. Mindkét Claude modell a vietnami orvosi terminológiában volt a legpontosabb. A DeepSeek V4-Pro volt az egyetlen modell, amely a helyes japán jogi kifejezést használta, de csak a 2. körben, és másutt alkalmi japánt termelt. Egyik modell sem dominált mind a nyolc teszt között.
Nem, nem automatikusan. Az újabb prémium szintű modellváltozatok bevezetése a japán formalitás tesztben a konszenzust a casual-ról a formálisra tolódította el. De a vietnami orvosi terminológiai tesztben a megosztottság nagyjából 6-4 arányban megmaradt, függetlenül attól, hogy mely modelleket vették figyelembe. Több modell több nézeteltérést hoz felszínre, ami hasznos jelzés, de a konszenzus továbbra is a többséget követi, és a többség nem mindig a legpontosabb válasz.
A SMART a MachineTranslation.com többmodelles konszenzus rendszere, amely akár 22 AI modellt ölel fel az olyan szolgáltatóktól, mint az OpenAI, az Anthropic, a Google és a DeepSeek. Egyszerre több modellen keresztül futtatja le a fordítást, és alapértelmezés szerint a többségi konszenzus kimenetét jeleníti meg az egyes modellek válaszai mellett, konfigurálás nélkül. A konszenzus eltolódik, amikor a modellkészlet eltolódik, amint azt ennek a tesztnek a japán formalitási eredménye mutatja: az 1. körben informális konszenzus a 2. körben formálissá vált.
Nincs egyetlen modell; az emberi felülvizsgálat a jobb válasz. A Claude modellek következetesen a pontosabb vietnami orvosi kifejezést választották, és csak a DeepSeek V4-Pro használta a helyes japán jogi kifejezést, de csak a 2. körben. Az orvosi terminológia megosztása soha nem oldódott meg 10 modell között, ami azt jelzi, hogy tartományi szakértelem szükséges, nem pedig azt, hogy más modellt kellene választani. Egy tanúsított emberi utómunka-ellenőrzés, mint amit a Tomedes kínál, ezt a szakértői ellenőrzést biztosítja.