July 10, 2026

Melyik AI fordító a legpontosabb 2026-ban? Teszteltem a 10 legújabb AI modellt

Két szó. Hat modell. Három különböző fordítási döntés. Íme, mi történt, amikor 8 tesztmondatot futtattam végig a MachineTranslation.com-on elérhető legújabb AI-modelleken, és mit árulnak el valójában a kimenetek arról, hogy mikor bukik meg csendesen egy modell.

Honnan tudnál egyáltalán, hogy a modell rossz döntést hozott?

Két szó. Ez beteg. Hat modell. Három különálló fordítási döntés.

Japánban egy modell úgy fordította le それはやばい, megőrizve a kétértelműséget. Egy másik teljesen elhagyta a tárgy személyes névmást, és a nyers formát írta やばい, a lehető legközvetlenebb verzió. Egy harmadik azt írta それはすごい, amely teljesen feloldja a kétértelműséget az "Amazing" javára, és eltávolítja azt a kettős jelentést, amely az eredeti kifejezést érdekessé tette. Vietnamiban nyelvben egy modell ezt írta Đỉnh vậy (szleng, helyes a fiatalok nyelvhasználatában). Egy másik azt írta Thật tuyệt vời, nyelvtanilag helyes, de közelebb áll ahhoz, hogy azt mondjuk "ez valóban csodálatos", amikor valaki egy mém-et küld neked.

Mindezek védekezhetőek. Egyikük sem ugyanaz a dolog. És ha egyetlen modellen keresztül futtatod a fordításokat, soha nem fogod látni azt a választást, amelyet a te helyedben meghoztak.

Ez az a központi kérdés, amelyre ez a cikk próbál választ adni. Nem arról, hogy melyik AI-modell a legjobb a fordításhoz 2026-ban (a válasz a nyelvpártól, a regisztertől, a doméntől és a mondatszerkezettől függ), hanem: hogyan tudnád meg, amikor a modelled rossz döntést hozott? Különösen olyan területeken, mint az orvosi terminológia, jogi szerződések vagy szakmai formalitás, ahol a rossz döntés pontosan úgy néz ki, mint egy helyes fordítás, amíg egy szakember el nem olvassa.

Így cselekedtem. ‎8 tesztmondatot futtattam végig két modellkörön az MachineTranslation.com oldalon: először egy alapvonal 5 széles körben használt modellel, majd egy bővített készlettel, amely több, a legújabb prémium szintű modellvariánst tartalmaz, amelyek jelenleg a fizetős felhasználók számára érhetők el. Normálisan az ilyen modellek kimenetének összehasonlítása azt jelentené, hogy külön-külön fizetett előfizetéseket kellene kötni az egyes szolgáltatóknál. A MachineTranslation.com webhelyen ugyanabban az összehasonlító nézetben találhatók. A nyelvpárok az angol→japán és angol→vietnami voltak. A mondatkategóriákat kifejezetten azoknak a területeknek a stressztesztjére választották, ahol a modellek közötti nézeteltérés a legfontosabb: idiomatikus kifejezések, jogi terminológia, orvosi terminológia, formalitásra érzékeny kontextus és szándékos szemantikai kétértelműség.

Módszertan

  • Nyelvpárok: Angol → Japán, Angol → Vietnami
  • 1. forduló (alapvonal): Claude Sonnet 4-6, DeepSeek V4-Pro, Qwen 3.7-Max, GPT-4.1-NANO, Gemini 3.1-Pro-Preview
  • 2. forduló (kibővített): A fentiek mindegyike + Claude Opus 4-7, GPT-5.5, Gemini 3.5-Flash, GLM-5-Turbo, MiniMax M2.7
  • Tesztkategóriák: Idiomatikus kifejezések (2), Jogi/szakmai terminológia (2), Orvosi terminológia (1), Formalitástól függő kontextus (2), Szándékos kétértelműség (1)
  • Amit mértek: A fordítási kimenet közvetlenül, nem a szerkesztési idő, TER vagy numerikus hibaarányok. Ahol releváns, a különbségeket nyelvtani szempontból magyarázzuk.
  • SMART konszenzus: Minden kör tartalmazza a platform többmodelles konszenzus kimenetét. A SMART akár 22 AI modellt ölel fel a szolgáltatók között, és az összes elérhető modellt egyidejűleg futtatja a konszenzusos fordítás eléréséhez. A konszenzus akkor változik meg, amikor a modellkészlet megváltozik.

Megjegyzés az értékelési módszertanról: a gépi fordítási kutatás hosszú ideje küzd azzal, hogy hogyan lehet automatikusan pontozni a kimeneteket. Az olyan metrikák, mint a BLEU és a COMET , amelyeket a WMT megosztott feladatokban mérnek, hasznos összesített jelet adnak, de rosszak a regiszter hibák, idiomatikus kifejezések kudarcai és terminológiai pontosság felismerésében, pontosan azok a kategóriák, amelyek itt a legfontosabbak. Az, amit most olvasni fogsz, kimeneti elemzés, nem pedig egy BLEU verseny.

Eredmények egy pillantásra

1. szakasz: Ahol minden modell egyetért, és miért ez is számít

Nem minden mondat jelent értelmes nézeteltérést. A nyolc teszt közül kettő, a "Let's touch base once the dust settles on this deal" (→ Japán) és a "We're burning the midnight oil to hit this launch date" (→ Vietnami) magas egyezést mutatott mindkét fordulóban. Az idiómákat helyesen idiómákként értelmezték. Senki nem fordította le a "touch base"-t úgy, hogy egy fizikai bázist érinti. Senki nem fordította le a "the dust settles" kifejezést úgy, hogy "üledék lehullik".

Érdemes ezen megállni: az idiomatikus angol üzleti nyelv meglehetősen jól kezelhető a jelenlegi csúcstechnológiás modellek által, amikor az idiomatikus kifejezés elég gyakori. A "touch base" kifejezésre vonatkozó konszenzus mindkét körben stabil maradt; a variáció tisztán stilisztikai volt, attól függően, hogy a この件 (this matter), a この取引 (this deal), vagy a この案件 (this case) kifejezéseket használták-e a forrásszöveghez.

Test 8: ‎"Vegyük fel újra a kapcsolatot, amint elül a por ez ügyben." → japán

Az "éjfélig dolgozás" teszt az, ahol a dolgok érdekesebbé váltak. Egy modell kivételével minden modell helyesen értelmezte az idiómát. MiniMax M2.7, a Round 2-ben bemutatott modell, szó szerint fordította a "burning" szót, így "égő fáklyák" jelentésű kifejezést hozva létre đốt đuốc‎. A konszenzus helyesen kizárta.

Test 5: ‎"Éjjel-nappal dolgozunk, hogy betartsuk ezt a megjelenési dátumot." → vietnami

Megállapítás — Idiómák

A vezető modellek általában helyesen kezelik a gyakori angol üzleti idiómákat mind japánul, mind vietnamiul. A konszenzus értéke a legmagasabb a vitatott mondatokban: formalitás, regiszter és terminológia. Az idiómateszt eredményei alapján a konszenzus továbbra is hasznos marad azáltal, hogy megjelöli a valódi kiugró értékeket (a MiniMax szó szerinti "égő fáklyák" sikertelenek), de az általános készlet már egyetért.

2. szakasz: A formalitási szakadék

A japán egy formalitás-rétegzett nyelv. Az ige végződésének, a névmásnak és a referenciális főnév alakjának választása nem stilisztikai jellegű. Ez jelzi a beszélő és a címzett közötti kapcsolatot. Egy üzenet küldése a vezérigazgatónak informális igealakokkal nem nyelvtani értelemben fordítási hiba. Ez társadalmi hiba, és jelentős is.‎

Tudod elküldeni azt? Köszönöm, értékelem. Kontextus: egy vezérigazgatónak üzenetezés.

A konszenzus akkor változott meg, amikor a modellkészlet kibővült. A mechanizmus egyértelmű: az olyan modellek hozzáadása, amelyek helyesen értelmezik a formalitás kontextusát, eltolódást okozott a többségben, és a konszenzus követte azt. Íme a teljes spektruma annak, amit a modellek a 2. körben létrehoztak:

1. teszt: CEO mondat — teljes Round 2 modell kimenetek


Figyelemre méltó kiugró — DeepSeek R2

DeepSeek V4-Pro a Round 2-ben előállított 送ってくれる?ありがとう、助かる。, egyszerű forma japán. Ezt szövegezel egy közeli barátnak. Ez nem megfelelő regiszter egy üzenethez a vezérigazgatónak. Az egyszerű forma (くれる、助かる) eltávolítja az összes tiszteleti jelölést. A konszenzus helyesen kizárta, de ha ez lenne az egyetlen modelljed, egy üzenetet küldnél a vezérigazgatódnak, amely egyenértékű egy alkalmi szöveggel.

A vietnami regiszter teszt egy másik típusú formalitási hibát tárt fel, amely sokkal finomabb. A forrásmondat: ‎"Szia, gyors kérdés — szabadban vagy egy hívásra?" Kontextus: üzenet küldése egy ügyfélnek. Az 1. körben a Qwen a "mình" szót használta, amely egy első személyű névmás, amely alkalmi, egyenrangú barátságot jelent. Minden más modell teljesen elkerülte az első személyű önhivatkozást, amely a biztonságosabb szakmai választás. Döntően a Qwen ezt a 2. körben korrigálta, és elhagyta a "mình"-t. A konszenzus mindkét körben kizárta.

Test 6: ‎"Halló, gyors kérdés — szabadidőd van egy hívásra?" → vietnami


Megállapítás — A regiszterhibák összehasonlítás nélkül láthatatlanok

A Qwen "mình" hibája a legvilágosabb példa arra, hogy az egyetlen modellel végzett fordítás miért kockázatos az ügyfélkommunikációban: az eredmény folyékony, nyelvtanilag helyes és természetesen hangzó vietnami szöveg. Nincs mit jelezni. Anélkül, hogy látnád a másik négy modellt, az első személyű önreferencia elkerülése nélkül nem lenne jelzésed arra, hogy regiszterválasztás történt.

3. szakasz: Jogi terminológia — a felelősségkizárási probléma

Az eladó/ügyfél kártérítési záradéka a kereskedelmi megállapodások standard klauzulája: ‎"**A szállító köteles kártérítésre kötelezni az ügyfelet az e megállapodás megsértéséből eredő harmadik fél által támasztott követelések ellen.**"

Az 1. körben mind az öt modell helyesen azonosította a jogi regisztert, és a ベンダー (beszállító) és クライアント (ügyfél) kölcsönszavakat használta, amelyek szabványosak az angol eredetű japán kereskedelmi szerződésekben. Egy kivétel: A GPT-4.1-NANO a 販売者 (seller) és 顧客 (customer) szavakat használta, amelyek legitim japán szavak, de hiányoznak belőlük az úgynevezett kölcsönzött szavak formális jogi specificitása.

A fontosabb megállapítás a 2. körben merült fel. A kulcsfontosságú megkülönböztetés két szó között:

  • 補償 (hoshō) — kompenzáció, megtérítés. Valakinek a veszteség után való teljes pénzügyi helyreállítása.
  • 免責 (menseki) — felmentés a felelősség alól; kártérítés. Harmótalanítás a harmadik fél igényeitől, mielőtt azok megvalósulnának.

Ezek jogi szempontból különböző fogalmak. Az "indemnify" kifejezés konkrétan azt jelenti, hogy egy felet harmadik fél felelőssége alól megvédeni. A 免責 a helyes jogi kifejezés. All Round 1 modellek 補償-t használtak. A 2. körben a DeepSeek V4-Pro volt az egyetlen modell, amely a 免責 kifejezést előállította, és ezt csak a 2. körben tette meg, nem az 1. körben.

Test 7: Felelősségmentesítési záradék → Japán (fő kimenetek)


Megállapítás — Jogi nyilvántartás

A DeepSeek az R2-ben az egyetlen modell, amely a 免責 szót használja, amely a "felelősségmentesítés" jogi szempontból pontos megfelelője. Minden más modell a 補償 (kompenzáció) kifejezést használja, amely szemantikailag kapcsolódik, de jogi szempontból különbözik. Ez a megállapítás csak a második körben válik láthatóvá, ami aláhúzza, hogy egy statikus, egykörös teszt egy rögzített modellkészlettel miért hagyhat ki fontos variációkat.
Külön-külön, a Qwen az R2-ben visszafejlődik azáltal, hogy átvált a 売主/買主 (eladó/vevő) kifejezésekre, amelyek a kereskedelmi értékesítési jog kifejezései, nem pedig a szolgáltatási megállapodások. Ez egy kevésbé megfelelő keretezés egy olyan szerződéshez, amely angol jogi terminológiát használ.

Egy szerződésben a 補償 és 免責 nem szinonimák. Az egyik azt jelenti, hogy "visszatérítjük az összeget." A másik azt jelenti, hogy "az első helyen már védve vagy az igény ellen." Ha egy fordítási platform a 補償 kifejezést használja, ahol a 免責 lenne helyes, akkor egy japán nyelvű ügyvéd nem fogja látni ugyanazt a megállapodást, amelyet az angol verzió leír.

4. szakasz: Orvosi terminológia — a szakadás, amely nem oldódott fel

Ez a legrelevánsabb megállapítás az adathalmazban. A tesztmondat: ‎"Ez a gyógyszer ellenjavallt a máj működésének zavarával rendelkező betegek esetében." Forrás: klinikai terméktájékoztatás. Cél: Vietnamese.

A kritikus kifejezés a "hepatikus károsodás". Van két vietnami jelölt:

  • suy gan — májelégtelenség. A súlyos, akut vagy krónikus végstádiumú májdiszfunkciót jelent. Egy beteg, aki májelégtelenséget tapasztalt.
  • suy giảm chức năng gan — csökkent/sérült máj működés. Bármilyen máj funkciócsökkenésre utal, beleértve a enyhe vagy közepesen súlyos károsodást is.

Ezek klinikailag különbözőek. A "máj-elégtelenség" alapján adott ellenjavallat figyelmeztetés mindenkire vonatkozik, akinek csökkent a máj működése, nem csak azokra, akik teljes szerv-elégtelenséget tapasztaltak. Az "suy gan" használata helytelenül szűkíti le a jelzett populációt. Egy mérsékelt májkárosodással rendelkező beteg, aki a "suy gan" kifejezést olvassa, nem ismerheti fel magát a kontraindikált populációként.

Test 2: Kontraindikáció mondat → Vietnami (mindkét forduló)


Kritikus megállapítás: orvosi terminológia

A felosztás 6 modell a suy gan vs. 4 modell a suy giảm chức năng gan a 2. fordulóban. A többség, és ezáltal a konszenzus, a kevésbé klinikai pontosságú kifejezést választja. Mindkét Claude-modell (Sonnet és Opus) következetesen a suy giảm chức năng gan lehetőséget választja mindkét körben. A felosztás nem oldódik fel, amikor a készlet bővül.
Ez az egyetlen megállapítás ebben az adathalmazban, amely a leginkább közvetlenül az orvosi tartalom emberi szakértői felülvizsgálatát támogatja. A konszenzus nem téves a többségi szavazás alapján. Ez egy valódi nézeteltérést tükröz a legkorszerűbb modellek között, és ez a nézeteltérés önmagában információ, amelyet a fordítónak látnia kell. Ez pontosan az a fajta eset amelyre a Tomedes emberi felügyelettel végzett felülvizsgálata készült.

5. szakasz: ‎"Ez beteg" — mi történik, amikor a kétértelműség a lényeg

Egyes forrásmondat szándékosan kétértelmű. ‎"Ez beteg" a kortárs angol szlengben valami kiválót jelent, de továbbra is megtartja szó szerinti jelentését (vagyis undorító/visszataszító), és e két jelentés közötti feszültség része annak, ahogy a kifejezés kommunikál. Az fordítási modell kihívása: megőrzöd-e a kétértelműséget, összeomlasztod-e a legvalószínűbb jelentésre, vagy kiválasztasz egyet és elkötelezed magad?

Japán kimenetek


Vietnami kimenetek


Megállapítás: kétértelműség és azonos családon belüli eltérés

Claude Opus 4-7 írja Đỉnh vậy (szleng). Claude Sonnet 4-6 ír Valóban csodálatos (formális). Ezek ellentétes regiszter-döntések, amelyeket ugyanabból a modellcsaládból származó két modell hozott ugyanazon kétszavas bemenetre. Egyik sem "helytelen." Az "That's sick" kifejezésben rejlő kétértelműség azt jelenti, hogy mindkét értelmezés létezik. De ha a célközönséged a jelenlegi vietnami fiatalok szlangjét használja, akkor ezek közül csak az egyik fordítás kommunikál helyesen. A konszenzus láthatóvá teszi az egyet nem értést. Nélküle nem tudod, hogy választás történt.
Japánban a GPT-4.1-NANO az egyetlen modell, amely használ すごい, amely teljesen feloldja a kétértelműséget az "Amazing" mellett. Öt másik modell megtartja azt a やばい/ヤバい formátumban. Claude Opus a legminimálisabb formát veszi fel: meztelen やばい alany nélkül.

6. szakasz: Milyen a modellkészlet kinézete

Az ebben a tesztben szereplő modellek nem mind egyenértékűek. Különböző architektúrákat, képzési rendszereket és telepítési kontextusokat ölelnek fel. Az 1. forduló alapvonala olyan modelleket tartalmaz, amelyek széles körben elérhetők. A Round 2-ben bővített készlet számos legújabb prémium szintű modellvariánst tartalmaz, amelyek jelenleg a MachineTranslation.com fizetős felhasználói számára érhetők el, ugyanaz a modellszint, amely egyébként külön fizetős fiók szükségességét jelentené az egyes szolgáltatóknál.

A Round 2-ben bővített készlet olyan modelleket tartalmaz, amelyek fejlettebbek és a MachineTranslation.com fizetős felhasználói számára érhetők el. A készlet bővítésének hatása nem egyenletes. Egyes tesztekben (formalitás/japán) jelentősen eltolódott a konszenzus. Másoknál (orvosi terminológia/vietnami) a hasadás mélyült.

7. szakasz: Ez azt jelenti, ha fordítási platformot választasz

A tesztadatok két különálló meghibásodási kategóriára mutatnak, és eltérő válaszokat igényelnek.

A kategória: Csendes hibák. Formai hibák, regiszter hibák, orvosi terminológia pontossága: ezek olyan kimeneteket hoznak létre, amelyek helyesnek tűnnek. A japán nyelvtan helyes. A vietnami folyékonyan beszél. Nincs felszíni jel arra, hogy valami rosszul ment volna. Egy egynyelvű felhasználó, aki egyetlen modell kimenetét olvassa, nem tudhatja, hogy a modell olyan regiszterválasztást végzett, amelyet egy magas rangú japán vezetője észrevenni, vagy hogy egy klinikai kifejezést olyan módon szűkítettünk, amely megváltoztatja azt a populációt, amelyre vonatkozik.

B kategória: Látható hibák. A MiniMax a "burning the midnight oil" kifejezést "égő fáklyák"-ként fordította le. GPT-4.1-NANO a "That's sick" kifejezést a félreérthetetlen "すごい" kifejezésre oldja fel. Ezek észlelhetők, akár a célnyelv beszélője, akár más modellek kimenetével való összehasonlítás révén.

A többmodelles összehasonlítás, amelyet a SMART biztosít, a legértékesebb az A kategóriában. Amikor öt vagy tíz modell hoz létre kimeneteket, és a legtöbb egyetért egy formális regiszterben, míg az egyik alkalmi egyszerű formájú japánt állít elő, az eltérés az összehasonlítási nézetben látható. Egy olyan felhasználó, aki beszéli a célnyelvet, képes értékelni az opciókat. Egy felhasználó, aki nem látja, hogy vitatott döntés született, dönthet arról, hogy az adott mondat megérdemli-e az emberi felülvizsgálatot.

A dokumentum szintű munkához, nagyméretű fájlokhoz, a PDF-ek, szerződések vagy klinikai anyagok elrendezést megőrző fordításához a platform dokumentumfeldolgozási képessége kezeli a fájlstruktúrát anélkül, hogy megtörné a formázást. De a fent felvetett minőségi kérdések a fájlmérettől függetlenül érvényesek. Egy 100 oldalas klinikai tanulmány, ahol a "hepatikus károsodás" minden előfordulása "májelégtelenségként" van lefordítva, ugyanannak a 2. tesztben azonosított problémának a nagyobb verziója.

Az orvosi és jogi kategóriák esetében kifejezetten az emberi ellenőrzés a helyes megoldás. A Tomedes AI utófeldolgozási szolgáltatása, amely az AI-kimeneteket tanúsított emberi felülvizsgálattal párosítja pontosan az ilyen magas tétű tartalmakhoz, erre a célra készült. A suy gan / suy giảm chức năng gan felosztás pontosan az a típusú megállapítás, amely kiválthatna egy ilyen felülvizsgálatot, nem azért, mert az összes modell hibás, hanem azért, mert a legbizalmasabb modellek nem a legpontosabbak.

A több kimenet megtekintésének értéke nem abban rejlik, hogy mindig a többséget választod. Az a lényeg, hogy tudni fogod, hogy egy választás megtörtént, ami különbözik attól, hogy feltételezed, hogy az előtted lévő kimenet helyes.

Mit mondtak el valójában a nyolc mondat

Helyezd egymás mellé a nyolc tesztet, és egy minta érvényes: az egyetértés és a nézeteltérés nem véletlenszerűen oszlik meg. Az idiomatikus, mindennapi üzleti nyelvezet ("kapcsolatot tartani", "éjszaka dolgozni") szinte minden modellben konvergált mindkét fordulóban. Formalitás, jogi pontosság és orvosi terminológia nem. A CEO-formalitás teszt csak akkor váltott át a lezser stílusból a formálisra, amikor a bővített készlet is bevonásra került. Az indemnifikációs záradék egy valódi jogi megkülönböztetést hozott felszínre (免責 vs. 補償), amelyet csak egy modell, egy körben, értelmezett helyesen. Az orvosi terminológia megosztottsága egyáltalán nem oldódott meg, mindkét körben nagyjából 6-4 arányban maradt, függetlenül attól, hogy mely modellek voltak a készletben.

Ez az tényleges megállapítás, nem pedig egy marketingcélú állítás: a konszenzus nem tesz minden mondatot jobbá, és nem is szükséges hozzá. Ez leginkább ott értékes, ahol egy modell folyékonysága nem ad okot a kételkedésre, és ahol a tévedésnek valódi ára van.

Ennek a tesztnek van egy második, praktikusabb rétege is, amit érdemes világosan kimondani. Ennek az összehasonlításnak az önálló elvégzése azt jelentette, hogy a GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo és MiniMax M2.7 kimeneteit egymás mellett, egy helyen, egy platformon kellett ellenőriznem a meglévő alapmodellekkel. A MachineTranslation.com-on kívül ez nem egy előfizetés. Több is van belőle, egy-egy mindegyik olyan szolgáltatóhoz, amelynek prémium szintjét tesztelni szeretnéd, az adott szolgáltató által egyedileg felszámított áron. Az itt fizetős felhasználók ugyanezt az összehasonlítást egy kattintásra kapják meg, töredékéért annak, amit öt külön prémium előfizetés fenntartása költene, anélkül, hogy lemondanának arról, ami valóban számít: látni, hogy a modellek hol értenek egyet, és pontosan tudni, hogy mikor nem.

Gyakran ismételt kérdések

1. A ChatGPT vagy a Claude jobb a fordításhoz?

Egyik sem jobb kategorikusan; ez a teszt kategóriájától függ. A Claude Sonnet és a Claude Opus következetesen a pontosabb vietnami orvosi kifejezést választotta, és a Claude Opus állította elő a legalkalmasabb szlengét a "That's sick." kifejezésre. De Claude Sonnet azonban informális japánt is előállított egy formális vezérigazgató-kontextusú mondatban, ahol a GPT-5.5 helyesen értelmezte. A kimenetek közvetlen összehasonlítása jobban megvédhetõ, mint egy modellt kiválasztani és megbízni benne.

2. Mi a legpontosabb AI fordítási modell 2026-ban?

Nincs egy; a pontosság doménfüggő. Ebben a tesztben a Gemini 3.5-Flash és a GLM-5-Turbo a legmegfelelőbb formális japánt produkálta. Mindkét Claude modell a vietnami orvosi terminológiában volt a legpontosabb. A DeepSeek V4-Pro volt az egyetlen modell, amely a helyes japán jogi kifejezést használta, de csak a 2. körben, és másutt alkalmi japánt termelt. Egyik modell sem dominált mind a nyolc teszt között.

3. Több AI modell hozzáadása mindig javítja a fordítás pontosságát?

Nem, nem automatikusan. Az újabb prémium szintű modellváltozatok bevezetése a japán formalitás tesztben a konszenzust a casual-ról a formálisra tolódította el. De a vietnami orvosi terminológiai tesztben a megosztottság nagyjából 6-4 arányban megmaradt, függetlenül attól, hogy mely modelleket vették figyelembe. Több modell több nézeteltérést hoz felszínre, ami hasznos jelzés, de a konszenzus továbbra is a többséget követi, és a többség nem mindig a legpontosabb válasz.

4. Mi az a SMART és hogyan működik?

A SMART a MachineTranslation.com többmodelles konszenzus rendszere, amely akár 22 AI modellt ölel fel az olyan szolgáltatóktól, mint az OpenAI, az Anthropic, a Google és a DeepSeek. Egyszerre több modellen keresztül futtatja le a fordítást, és alapértelmezés szerint a többségi konszenzus kimenetét jeleníti meg az egyes modellek válaszai mellett, konfigurálás nélkül. A konszenzus eltolódik, amikor a modellkészlet eltolódik, amint azt ennek a tesztnek a japán formalitási eredménye mutatja: az 1. körben informális konszenzus a 2. körben formálissá vált.

5. Melyik AI-modell a legjobb az orvosi vagy jogi fordításhoz?

Nincs egyetlen modell; az emberi felülvizsgálat a jobb válasz. A Claude modellek következetesen a pontosabb vietnami orvosi kifejezést választották, és csak a DeepSeek V4-Pro használta a helyes japán jogi kifejezést, de csak a 2. körben. Az orvosi terminológia megosztása soha nem oldódott meg 10 modell között, ami azt jelzi, hogy tartományi szakértelem szükséges, nem pedig azt, hogy más modellt kellene választani. Egy tanúsított emberi utómunka-ellenőrzés, mint amit a Tomedes kínál, ezt a szakértői ellenőrzést biztosítja.‎