July 10, 2026
Dy fjalë. Gjashtë modele. Tre vendime të ndryshme përkthimi. Ja çfarë ndodhi kur kalova 8 fjali testimi përmes modeleve më të fundit të AI-së të disponueshme në MachineTranslation.com, dhe çfarë zbulojnë në të vërtetë rezultatet për momentin kur një model dështon në heshtje.
Dy fjalë. Kjo është e sëmurë. Gjashtë modele. Tre vendime të dallueshme përkthimi.
Në japonisht, një model e përshkruajti atë si それはやばい, duke ruajtur paqartësinë. Një tjetër e hoqi plotësisht përemrin e subjektit dhe shkroi formën e thjeshtë やばい, versioni më kolokial i mundshëm. Një i tretë shkroi それはすごい, i cili zgjidh plotësisht paqartësinë në favor të "mahnitës," duke hequr dorë nga kuptimi i dyfishtë që e bënte frazën interesante në fillim. Në vietnameze, një model shkroi Đỉnh vậy (slang, i saktë për regjistrin e të rinjve). Një tjetër shkroi Thật tuyệt vời, gramatikisht i saktë, por më afër të thënë "që është vërtet i mahnitshëm" kur dikush të dërgon një meme.
Të gjitha këto janë të mbrojtura. Asnjëri prej tyre nuk është i njëjtë. Dhe nëse po bëni përkthime përmes një modeli të vetëm, nuk do të shihni kurrë zgjedhjen që u bë në emrin tuaj.
Kjo është pyetja qendrore që ky artikull po përpiqet t'i përgjigjet. Jo cili model AI është më i mirë për përkthim në 2026 (përgjigja varet nga çifti i gjuhëve, regjistra, domeni dhe struktura e fjalisë), por më tepër: si do ta dije kur modeli yt bëri zgjedhjen e gabuar? Veçanërisht në fusha si terminologjia mjekësore, kontrata ligjore ose formaliteti profesional, ku zgjedhja e gabuar duket saktësisht si përkthim i saktë derisa një specialist ta lexojë atë.
Ja çfarë bëra. Unë kalova 8 fjali testimi përmes dy raundeve të modeleve në MachineTranslation.com: fillimisht një bazë prej 5 modelesh të përdorura gjerësisht, pastaj një grup të zgjeruar që shton disa nga variantet më të reja të modeleve premium-tier tani të disponueshme për përdoruesit që paguajnë. Normalisht, krahasimi i rezultateve nga modele si ky do të nënkuptonte abonime të ndara të paguara me secilin ofrues individualisht. Në MachineTranslation.com, ata janë në të njëjtën pamje krahasimi. Çiftet e gjuhëve ishin Anglisht→Japonisht dhe Anglisht→Vietnamisht. Kategoritë e fjalive u zgjodhën në mënyrë specifike për të testuar zonat ku paçka e modeleve është më e rëndësishme: fraza idiomatike, terminologjia ligjore, terminologjia mjekësore, konteksti i ndjeshëm ndaj formalitetit, dhe paqartësia semantike e qëllimshme.
Një shënim mbi metodologjinë e vlerësimit: kërkimi i përkthimit të makinës ka luftuar prej kohësh se si të pikësojë rezultatet automatikisht. Metrika si BLEU dhe COMET siç maten në detyrat e përbashkëta WMT japin një sinjal të dobishëm agregat, por ato janë të dobëta në zbulimin e gabimeve të regjistrit, dështimeve të idiomave dhe saktësisë terminologjike, pikërisht kategoritë që kanë më shumë rëndësi këtu. Ajo që jeni gati të lexoni është analiza e rezultateve, jo një garë BLEU.

Jo çdo fjali paraqet një mosmarrëveshje të rëndësishme. Dy nga tetë testet, "Let's touch base once the dust settles on this deal" (→ Japonisht) dhe "We're burning the midnight oil to hit this launch date" (→ Vietnamisht), prodhuan marrëveshje të lartë në të dyja raundet. Idiomatë u kuptuan saktësisht si idioma. Asnjë person nuk e përktheu "touch base" si të prekje një bazë fizike. Asnjë person nuk e përktheu "the dust settles" si sediment që bie poshtë.
Kjo ia vlen të ndalemi: gjuha e biznesit idiomatike angleze trajtohet mjaft mirë nga modelet aktuale të kufirit kur idioma është mjaft e zakonshme. Konsensusi për "touch base" mbeti i qëndrueshëm në të dyja raundet; variacioni ishte purësisht stilistik, rreth faktit nëse të përdorni この件 (kjo çështje), この取引 (kjo marrëveshje), ose この案件 (ky rast) për frazën burim.

Testi i "djegies së vajit të mesnatës" është aty ku gjërat u bënë më interesante. Çdo model përveç njërit e kuptoi saktë idiomën. MiniMax M2.7, i prezantuar në Raundin 2, përktheu "burning" fjalë për fjalë, duke prodhuar đốt đuốc, që do të thotë "drita të ndezura". Konsensusi e përjashtoi atë me të drejtë.

Gjuha japoneze është një gjuhë me shtresa formaliteti. Zgjedhja e përfundimit të folje, përEmrit dhe formës së emrit referencial nuk është stilistike. Ajo sinjalizon marrëdhënien midis folësit dhe marrësit. Dërgimi i një mesazhi tek drejtori juaj duke përdorur forma folore joformale nuk është një gabim përkthimi në kuptimin gramatikor. Është një gabim shoqëror, dhe një i rëndësishëm.
A mund ta dërgosh atë? Faleminderit, e vlerësoj atë. Konteksti: dërgim mesazhi tek një CEO.

Konsensusi ndryshoi kur grupi i modeleve u zgjerua. Mekanizmi është i drejtpërdrejtë: shtimi i modeleve që lexonin saktë kontekstin e formalitetit zhvendosi shumicën, dhe konsensusi pasoi. Këtu është spektri i plotë i asaj që modelet prodhuan në Raundën 2:

Testi i regjistrimit vietnamez zbuloi një lloj tjetër të gabimit të formalitetit, një që është më delikat. Fjalia burimore: Përshëndetje, një pyetje e shpejtë — je i lirë të hysh në një thirrje? Konteksti: dërgimi i një mesazhi te një klient. Qwen në Raundi 1 përfshiu "mình," një përemër në person të parë që nënkupton një miqësi të rastësishme në nivel bashkëmoshatarësh. Çdo model tjetër shmangur plotësisht vetë-referencën në person të parë, e cila është zgjedhja më e sigurt profesionale. Në mënyrë vendimtare, Qwen e korrigjoi këtë në Raundin 2 dhe e hëqqi "mình." Konsensusi në të dyja raundet e përjashtoi atë.

Fjalia e sigurimit të shitësit/klientit është një klauzolë standarde në marrëveshjet tregtare: "**Shitësi duhet të mbrojë klientin kundër çdo pretense të palës së tretë që rrjedh nga shkelja e këtij marrëveshjeje."
Në Raundin 1, të pesë modelet identifikuan saktë regjistrin ligjor dhe përdorën huazimet ベンダー (furnizues) dhe クライアント (klient), standarde në kontratat tregtare japoneze me origjinë angleze. Një përjashtim: GPT-4.1-NANO përdori 販売者 (shitës) dhe 顧客 (klient), fjalë legjitim japoneze që mungojnë specifikën juridike formale të ekuivalentëve të huazimit.
Gjetja më e rëndësishme u shfaq në Raundi 2. Dallimi kryesor është midis dy fjalëve:
Këto janë koncepte ligjërisht të ndryshme. "Indemnify" specifikt do të thotë të mbrojë një palë nga përgjegjësia ndaj palëve të treta. 免責 është termi i saktë ligjor. Të gjitha modelet e Round 1 përdorën 補償. Në Raundin 2, DeepSeek V4-Pro ishte i vetmi model që prodhoi 免責, dhe e bëri këtë në Raundin 2 vetëm, jo në Raundin 1.

Në një kontratë, 補償 dhe 免責 nuk janë sinonime. Një do të thotë "ne do t'ju rimbursojmë." Tjetri do të thotë "ju jeni i mbrojtur nga kërkesa në radhë të parë." Nëse një platformë përkthimi përdor 補償 ku 免責 është e saktë, një avokat që lexon versionin japonez nuk do të shohë të njëjtin marrëveshje që përshkruan versioni në anglisht.
Ky është gjetja më me pasoja në grupin e të dhënave. Fjalia e testit: "Ky ilaç është kontraindikuar në pacientët me historik të dëmtimit hepatik." Burimi: dokumentacioni i produktit klinik. Objektivi: Vietnamez.
Termi kritik është "dëmtim hepatik." Janë dy kandidatë vietnamezë:
Këto janë klinikishtë të dallueshme. Një paralajmërim kontraindikacioni bazuar në "dëmtimin hepatik" zbatohet për këdo që ka funksion të reduktuar të mëlçisë, jo vetëm për ata që përjetuan dështim të plotë të organit. Përdorimi i suy gan ngushtë popullsinë e treguar në mënyrë të pasaktë. Një pacient me dëmtim të moderuar të mëlçisë që lexon suy gan mund të mos e njohë veten si popullatën e kundërindikuar.

Disa fjali burimore janë të paqarta me qëllim. "Që është i sëmurë" në argjotën bashkëkohore të anglishtes do të thotë diçka e shkëlqyer, por ajo gjithashtu ende mban kuptimin e saj të fjalës për fjalë (domethënë diçka që të ngjall të vemë), dhe tensioni midis këtyre dy kuptimeve është pjesë e mënyrës se si fraza komunikon. Sfida për një model përkthimi është: a ruani paqartësinë, e shembni atë në kuptimin më të mundshëm, apo zgjidhni njërin dhe përkushtohu?


Modelet në këtë test nuk janë të gjitha ekuivalente. Ata përfshijnë arkitektura të ndryshme, regjime trajnimi dhe kontekste të ndryshme të përdorimit. Bazalina e Raundi 1 përfshin modele që janë gjerësisht të arritshme. Grupi i zgjeruar i Raundi 2 shton disa nga variantet më të reja të modeleve të nivelit premium që janë tani të disponueshme për përdoruesit që paguajnë në MachineTranslation.com, i njëjti nivel modeli që përndryshe do të nënkuptonte një llogari të veçantë të paguar me secilin ofrues individual.

Grupi i zgjeruar në Raundi 2 përfshin modele që janë më të avancuara dhe të disponueshme për përdoruesit që paguajnë në MachineTranslation.com. Efekti i zgjerimit të grupit nuk është uniform. Në disa teste (formalitet/Japonisht), ai ndryshoi konsensuson në mënyrë të rëndësishme. Në të tjera (terminologjia mjekësore/Vietnameze), ndarja u thellua.

Të dhënat e testimit tregojnë dy kategori të dallueshme dështimesh, dhe ato kërkojnë përgjigje të ndryshme.
Kategoria A: Dështimet në heshtje. Gabimet formale, gabimet e regjistrimit, saktësia e terminologjisë mjekësore: këto prodhojnë rezultate që duken të sakta. Japonishtja është gramatikore. Vietnamezi është i rrjedhshëm. Nuk ka asnjë sinjal në sipërfaqe që diçka ka shkuar keq. Një përdorues monolingue që lexon rezultatin e një modeli të vetëm nuk ka asnjë mënyrë të dijë se modeli bërë një zgjedhje të nivelit të gjuhës që një zyrtar i lartë japonez do të vërejë, ose se një term klinik u ngushtua në një mënyrë që ndryshon popullasinë të cilës i zbatohet.
Kategoria B: Dështimet e dukshme. MiniMax përkthehet "burning the midnight oil" si "djegia e poshtë." GPT-4.1-NANO që zgjidh "That's sick" në "すごい" të paqartë. Këto janë të zbulueshmë, ose nga një përdorues i gjuhës së synuar ose përmes krahasimit me rezultate të tjera të modelit.
Krahasimi shumë-model që ofron SMART është më i vlefshëm në Kategorinë A. Kur pesë ose dhjetë modele prodhojnë rezultate dhe shumica bien dakord për një regjistër formal ndërsa një prodhon formën e thjeshtë bisedore në japonisht, mosmarrëveshja është e dukshme në pamjen e krahasimit. Një përdorues që flet gjuhën e synuar mund të vlerësojë opsionet. Një përdorues që nuk mund të shohë se një vendim i kontestuar është marrë, dhe të vendosë nëse ajo fjali kërkon rishqyrtim njerëzor.
Për punën në shkallë dokumenti, skedarë të mëdhenj, përkthim që ruan paraqitjen e PDF-ve, kontratave ose materialeve klinike, aftësia e përpunimit të dokumenteve të platformës trajton strukturën e skedarit pa thyer formatimin. Por pyetjet e cilësisë të ngritura më lart zbatohen pavarësisht nga madhësia e skedarit. Një studim klinik me 100 faqe ku çdo rast i "dëmtimit hepatik" përkthehet si "dështim i mëlçisë" është një version më i madh i të njëjtës problem të identifikuar në Testin 2.
Për kategoritë mjekësore dhe ligjore në mënyrë specifike, verifikimi njerëzor është mekanizmi i duhur i kontrollit. Shërbimi i Post-Editimit të AI të Tomedes, i cili kombinon rezultatin e AI me rishikimin e certifikuar njerëzor për këtë lloj përmbajtjeje me rrezik të lartë, është ndërtuar për këtë qëllim. Ndarja suy gan / suy giảm chức năng gan është pikërisht lloji i gjetjes që duhet të shkaktojë atë rishikim, jo sepse të gjitha modelet janë të gabuara, por sepse modelet që janë më të sigurta nuk janë më të sakta.
Vlera e shikimit të shumë rezultateve nuk është që gjithmonë do të zgjidhni shumicën. Është që do të dini se një zgjedhje është bërë, që është e ndryshme nga supozimi se rezultati përpara jush është i saktë.

Vendosni tetë testimet krah për krah dhe një model qëndron: marrëveshja dhe mosmarrëveshja nuk shpërndahen rastësisht. Gjuha idiomatike, e përditshme e biznesit ("të lidhemi," "të punojmë gjithë natën") u konvergua në pothuajse çdo model në grup, në të dyja raundet. Formaliteti, saktësia ligjore dhe terminologjia mjekësore nuk arritën. Testi i formalitetit të CEO-s u kthye nga joformali në formal vetëm kur përfshihej grupi i zgjeruar. Klausola e kompensimit zbuloi një dallim të vërtetë juridik (përjashtim nga përgjegjësia vs. kompensim) që vetëm një model, në një raund, e mori saktë. Terminologjia mjekësore nuk u zgjidh kurrë plotësisht, duke qëndruar në përafërsisht 6 me 4 në të dyja raundet pavarësisht se cilat modele ishin në grupin e përzgjedhur.
Ky është gjetja aktuale, jo një pretendim marketingu: konsensusi nuk e bën çdo fjali më të mirë, dhe nuk ka nevojë ta bëjë. Është më i vlefshëm pikërisht aty ku rrfluesia e një modeli të vetëm nuk të jep asnjë arsye për ta dyshuar atë, dhe aty ku të qenit i gabuar në të vërtetë kushton diçka.
Ka një shtresë të dytë, më praktike të këtij testi që ia vlen të thuhet qartë. Të bëj këtë krahasim vetë nënkuptonte kontrollimin e rezultateve nga GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, dhe MiniMax M2.7 krah për krah me modelet bazë ekzistuese, në një vend, në një platformë. Jashtë MachineTranslation.com, ajo nuk është një abonament. Janë disa, një për secilin ofrues në të cilin dëshironi të testoni nivelin premium, me çfarëdo që ngarkon secili ofrues individualisht. Përdoruesit që paguajnë këtu marrin atë krahasim të njëjtë me një klik, për një pjesë të asaj që do të kushtonte mirëmbajtja e pesë abonimeve të ndryshme premium, pa hequr dorë nga gjëja që ka rëndësi të vërtetë: të shohim ku bien dakord modelet, dhe të dimë saktësisht kur nuk bien dakord.
Asnjëra nuk është kategorikisht më e mirë; varet nga kategoria e testit. Claude Sonnet dhe Claude Opus zgjodhën në mënyrë konsistente termin më të saktë mjekësor vietnamez, dhe Claude Opus prodhoi argjotën më të përshtatshme për "Kjo është e sëmurë." Por Claude Sonnet gjithashtu prodhoi japoneisht të rastësishme në një fjali konteksti formal të CEO-s, ku GPT-5.5 e mori të drejtë. Krahasimi i rezultateve drejtpërdrejt është më i mbrojtur sesa zgjedhja e një modeli dhe besimi në të.
Nuk ka një; saktësia varet nga fusha. Gemini 3.5-Flash dhe GLM-5-Turbo prodhuan japonishten më të përshtatshme formale në këtë test. Të dy modelet Claude ishin më të sakta në terminologjinë mjekësore vietnameze. DeepSeek V4-Pro ishte i vetmi model që përdori termin e saktë të ligjit japonez, por vetëm në Raundi 2, dhe prodhoi japonisht të rastësishëm diku tjetër. Asnjë model i vetëm nuk dominoi në të tetë testet.
Jo, jo automatikisht. Zgjerimi i grupit me variante të reja të modelit të nivelit premium e zhvendosi konsensuson nga joformale në formale në testin e formalitetit japonez. Por në testin e terminologjisë mjekësore vietnameze, ndarja përsis në përafërsisht 6 me 4 pavarësisht se cilat modele u përfshinë. Më shumë modele shfaqin më shumë përqindje të pajtimit, e cila është një sinjal i dobishëm, por konsensusi ende ndjek shumicën, dhe shumica nuk është gjithmonë përgjigja më e saktë.
SMART është sistemi i konsensusit multi-model i MachineTranslation.com, që përfshin deri në 22 modele AI nga ofruesit duke përfshirë OpenAI, Anthropic, Google dhe DeepSeek. Ai ekzekuton një përkthim përmes modeleve të shumta në të njëjtën kohë dhe paraqet rezultatin e konsensusit të shumicës përkatësisht përgjigjen e secilit model individual, si parazgjedhje, pa pasur nevojë për ndonjë konfiguracion. Konsensusi ndryshon kur ndryshon grupi i modeleve, siç tregohet në rezultatin e formalitetit japonez të këtij testi: një konsensus joformal në Raundin 1 u bë formal në Raundin 2.
Asnjë model i vetëm; pëkthimi me rishqyrtim njerëzor është përgjigja më e mirë. Modelat Claude zgjodhën në mënyrë konsistente termin më të saktë mjekësor vietnamez, dhe vetëm DeepSeek V4-Pro përdori termin e saktë ligjor japonez, por vetëm në Raundën 2. Terminologjia mjekësore nuk u zgjidh kurrë në 10 modele, e cila sinjalizon se kërkohet ekspertiza në fushë, jo që të zgjidhet një model i ndryshëm. Një rishikim redaktimi njerëzor i sertifikuar, siç ofron Tomedes, ofron atë kontroll specialist.