July 10, 2026
Δύο λέξεις. Έξι μοντέλα. Τρεις διαφορετικές αποφάσεις μετάφρασης. Εδώ είναι τι συνέβη όταν έτρεξα 8 δοκιμαστικές προτάσεις μέσα από τα τελευταία μοντέλα ΤΝ διαθέσιμα στο MachineTranslation.com, και τι αποκαλύπτουν πραγματικά οι έξοδοι σχετικά με το πότε ένα μοντέλο αποτυγχάνει σιωπηλά.
Δύο λέξεις. Αυτό είναι φοβερό. Έξι μοντέλα. Τρεις διακριτές αποφάσεις μετάφρασης.
Στα ιαπωνικά, ένα μοντέλο το απέδωσε ως それはやばい, διατηρώντας την αμφισημία. Ένας άλλος έπεσε το αντικείμενο προσωπικής αντωνυμίας εντελώς και έγραψε τη γυμνή μορφή やばい, την πιο συνομιλιακή έκδοση δυνατή. Ένας τρίτος έγραψε それはすごい, το οποίο επιλύει την αμφισημία εντελώς υπέρ του "εκπληκτικό", αφαιρώντας την διπλή σημασία που έκανε τη φράση ενδιαφέρουσα στην αρχή. Στα Βιετναμικά, ένα μοντέλο έγραψε Đỉnh vậy (αργκό, σωστό για νεανικό ρεπερτόριο). Ένας άλλος έγραψε Thật tuyệt vời, γραμματικά σωστό, αλλά πιο κοντά στο να λέει "αυτό είναι πραγματικά θαυμάσιο" όταν κάποιος σας στέλνει ένα meme.
Όλα αυτά είναι υπερασπίσιμα. Κανένας από αυτούς δεν είναι το ίδιο πράγμα. Και αν εκτελείτε μεταφράσεις μέσω ενός μόνο μοντέλου, δεν θα δείτε ποτέ την επιλογή που έγινε εκ μέρους σας.
Αυτό είναι το κεντρικό ερώτημα που προσπαθεί να απαντήσει αυτό το άρθρο. Όχι ποιο μοντέλο AI είναι καλύτερο για μετάφραση το 2026 (η απάντηση εξαρτάται από το ζεύγος γλωσσών, το ύφος, τον τομέα και τη δομή της πρότασης), αλλά μάλλον: πώς θα ήξερες όταν το μοντέλο σου έκανε τη λάθος επιλογή; Ειδικά σε τομείς όπως η ιατρική ορολογία, τα νομικά συμβόλαια ή η επαγγελματική τυπικότητα, όπου η λάθος επιλογή φαίνεται ακριβώς όπως μια σωστή μετάφραση μέχρι ένας ειδικός να τη διαβάσει.
Να τι έκανα. Έτρεξα 8 δοκιμαστικές προτάσεις μέσα από δύο γύρους μοντέλων στο MachineTranslation.com: πρώτα μια βάση αναφοράς 5 ευρέως χρησιμοποιούμενων μοντέλων, στη συνέχεια ένα διευρυμένο σύνολο που προσθέτει πολλές από τις πιο πρόσφατες παραλλαγές μοντέλων premium-tier που είναι τώρα διαθέσιμες για χρήστες που πληρώνουν. Κανονικά, η σύγκριση των αποτελεσμάτων από μοντέλα όπως αυτό θα σήμαινε ξεχωριστές επί πληρωμή συνδρομές με κάθε πάροχο ξεχωριστά. Στο MachineTranslation.com, βρίσκονται στην ίδια προβολή σύγκρισης. Τα ζεύγη γλωσσών ήταν Αγγλικά→Ιαπωνικά και Αγγλικά→Βιετναμέζικα. Οι κατηγορίες προτάσεων επιλέγησαν συγκεκριμένα για να δοκιμάσουν περιοχές όπου η διαφωνία του μοντέλου είναι πιο σημαντική: ιδιωματικές εκφράσεις, νομική ορολογία, ιατρική ορολογία, περιεχόμενο ευαίσθητο στη φορμαλιότητα και σκόπιμη σημασιολογική διάσημη.
Μια σημείωση σχετικά με τη μεθοδολογία αξιολόγησης: η έρευνα μηχανικής μετάφρασης έχει μακροχρόνια ασχοληθεί με το πώς να βαθμολογήσει τις εξόδους αυτόματα. Μετρικές όπως το BLEU και το COMET όπως μετρήθηκαν στα κοινά καθήκοντα WMT παρέχουν χρήσιμο συγκεντρωτικό σήμα, αλλά είναι ανεπαρκείς στον εντοπισμό σφαλμάτων καταχρήσεως, αποτυχιών ιδιωματικών εκφράσεων και ακρίβειας ορολογίας, ακριβώς τις κατηγορίες που έχουν τη μεγαλύτερη σημασία εδώ. Αυτό που πρόκειται να διαβάσετε είναι ανάλυση αποτελεσμάτων, όχι ένας αγώνας BLEU.

Δεν κάθε πρόταση εμφανίζει μια ουσιαστική διαφωνία. Δύο από τις οκτώ δοκιμές, «Ας έρθουμε σε επαφή μόλις καθαρίσει η κατάσταση σε αυτή τη συμφωνία» (→ Ιαπωνικά) και «Καίμε το λάδι της λάμπας για να πετύχουμε αυτή την ημερομηνία κυκλοφορίας» (→ Βιετναμέζικα), παρήγαγαν υψηλή συμφωνία και στους δύο γύρους. Τα ιδιωματικά φράσεις κατανοήθηκαν σωστά ως ιδιωματικές φράσεις. Κανείς δεν μετέφρασε το "touch base" ως αγγίζοντας μια φυσική βάση. Κανείς δεν μετέφρασε το "the dust settles" ως καθίζηση ιζήματος.
Αξίζει να σταματήσουμε σε αυτό: η ιδιωματική αγγλική γλώσσα των επιχειρήσεων χειρίζεται αρκετά καλά από τα σημερινά μοντέλα ορίου όταν το ιδίωμα είναι αρκετά κοινό. Η συναίνεση για "touch base" παρέμεινε σταθερή και στους δύο γύρους. η διακύμανση ήταν καθαρά στυλιστική, σχετικά με το αν θα χρησιμοποιούσαν αυτό το θέμα (αυτό το θέμα), αυτή η συναλλαγή (αυτή η συναλλαγή), ή αυτή η υπόθεση (αυτή η υπόθεση) για την αρχική φράση.

Το τεστ "καίω το μεσονύχτιο λάδι" είναι όπου τα πράγματα έγιναν πιο ενδιαφέροντα. Κάθε μοντέλο εκτός από ένα κατανόησε σωστά την ιδιωματική έκφραση. MiniMax M2.7, που παρουσιάστηκε στον Γύρο 2, μετέφρασε κυριολεκτικά το "burning", παράγοντας đốt đuốc, που σημαίνει "καιόμενες δάδες." Η συναίνεση το αποκλείστηκε σωστά.

Τα ιαπωνικά είναι μια γλώσσα με στρώματα επισημότητας. Η επιλογή της κατάληξης του ρήματος, της αντωνυμίας και της μορφής του αναφορικού ουσιαστικού δεν είναι στυλιστική. Σηματοδοτεί τη σχέση μεταξύ του ομιλητή και του παραλήπτη. Η αποστολή ενός μηνύματος στον διευθύνοντα σύμβουλό σας χρησιμοποιώντας άτυπες μορφές ρήματος δεν αποτελεί σφάλμα μετάφρασης με γραμματικής απόψεως. Είναι ένα κοινωνικό λάθος, και ένα σημαντικό.
Η δοκιμαστική πρόταση: Μπορείς να μου το στείλεις; Ευχαριστώ, το εκτιμώ. Πλαίσιο: αποστολή μηνύματος σε έναν διευθύνοντα σύμβουλο.

Η συναίνεση άλλαξε όταν το σύνολο μοντέλων επεκτάθηκε. Ο μηχανισμός είναι απλός: η προσθήκη μοντέλων που διάβαζαν σωστά το πλαίσιο της επισημότητας μετατόπισε την πλειοψηφία, και η συναίνεση ακολούθησε. Εδώ είναι το πλήρες φάσμα αυτού που παρήγαγαν τα μοντέλα στο Round 2:

Η δοκιμή του βιετναμέζικου καταχωρητή αποκάλυψε ένα διαφορετικό είδος σφάλματος τυπικότητας, ένα που είναι πιο λεπτό. Η πρόταση πηγή: Εy, γρήγορη ερώτηση — είσαι ελεύθερος να κάνεις ένα τηλεφώνημα; Πλαίσιο: αποστολή μηνύματος σε πελάτη. Το Qwen στον Γύρο 1 περιέλαβε το "mình," μια αντωνυμία πρώτου προσώπου που υπονοεί άτυπη φιλία σε επίπεδο συνομηλίκων. Κάθε άλλο μοντέλο αποφεύγει εντελώς την αναφορά στο πρώτο πρόσωπο, που είναι η ασφαλέστερη επαγγελματική επιλογή. Κρίσιμα, το Qwen το διόρθωσε αυτό στον Γύρο 2 και έπεσε "mình." Η συναίνεση και στους δύο γύρους το αποκλείστηκε.

Η πρόταση αποζημίωσης πωλητή/πελάτη είναι μια τυπική ρήτρα σε εμπορικές συμφωνίες: "Ο προμηθευτής θα αποζημιώσει τον πελάτη έναντι οποιωνδήποτε αξιώσεων τρίτων που προκύπτουν από παραβίαση της παρούσας συμφωνίας."
Στον 1ο γύρο, και τα πέντε μοντέλα αναγνώρισαν σωστά το νομικό ύφος και χρησιμοποίησαν τους δανεισμένους όρους ベンダー (προμηθευτής) και クライアント (πελάτης), τυπικούς σε ιαπωνικά εμπορικά συμβόλαια αγγλικής προέλευσης. Μία εξαίρεση: Το GPT-4.1-NANO χρησιμοποίησε 販売者 (πωλητής) και 顧客 (πελάτης), νόμιμες ιαπωνικές λέξεις που στερούνται της τυπικής νομικής ειδικότητας των ισοδύναμων δανεισμένων λέξεων.
Το πιο σημαντικό εύρημα προέκυψε στο Γύρο 2. Η βασική διάκριση είναι μεταξύ δύο λέξεων:
Πρόκειται για νομικά διαφορετικές έννοιες. «Αποζημίωση» σημαίνει συγκεκριμένα την προστασία ενός μέρους από την ευθύνη τρίτων. 免責 είναι ο σωστός νομικός όρος. Όλα τα μοντέλα του Round 1 χρησιμοποίησαν 補償. Στο Round 2, το DeepSeek V4-Pro ήταν το μόνο μοντέλο που παρήγαγε 免責, και το έκανε στο Round 2 μόνο, όχι στο Round 1.

Σε ένα συμβόλαιο, η 補償 και η 免責 δεν είναι συνώνυμα. Ένα σημαίνει "θα σας αποζημιώσουμε." Το άλλο σημαίνει "είστε προστατευμένοι από τη δικαίωση εξ αρχής." Εάν μια πλατφόρμα μετάφρασης χρησιμοποιεί 補償 όπου 免責 είναι σωστό, ένας δικηγόρος που διαβάζει την ιαπωνική έκδοση δεν θα δει τη συμφωνία που περιγράφει η αγγλική έκδοση.
Αυτή είναι η πιο σημαντική ανακάλυψη στο σύνολο δεδομένων. Η δοκιμαστική πρόταση: "Αυτό το φάρμακο είναι αντενδείκνυο σε ασθενείς με ιστορικό ηπατικής δυσλειτουργίας." Πηγή: κλινική τεκμηρίωση προϊόντος. Στόχος: Βιετναμέζικα.
Ο κρίσιμος όρος είναι η "ηπατική δυσλειτουργία." Υπάρχουν δύο υποψήφιοι από το Βιετνάμ:
Αυτές είναι κλινικά διακριτές. Μια προειδοποίηση αντένδειξης βάσει της "ηπατικής δυσλειτουργίας" ισχύει για οποιονδήποτε με μειωμένη λειτουργία του ήπατος, όχι μόνο για εκείνους που υπέστησαν πλήρη ανεπάρκεια του οργάνου. Η χρήση του suy gan περιορίζει λανθασμένα τον υποδεικνυόμενο πληθυσμό. Ένας ασθενής με μέτρια ηπατική δυσλειτουργία που διαβάζει suy gan ενδέχεται να μην αναγνωρίσει τον εαυτό του ως τον αντενδεικτικό πληθυσμό.

Ορισμένες προτάσεις πηγής είναι σκόπιμα διφορούμενες. «Το είναι άρρωστο» στη σύγχρονη αγγλική αργκό σημαίνει κάτι εξαιρετικό, αλλά διατηρεί επίσης το κυριολεκτικό του νόημα (δηλαδή αυτό που προκαλεί ναυτία/αηδία), και η τάση μεταξύ αυτών των δύο νοημάτων είναι μέρος του τρόπου με τον οποίο η φράση επικοινωνεί. Η πρόκληση για ένα μοντέλο μετάφρασης είναι: διατηρείτε την αμφισημία, την καταρρέετε στο πιο πιθανό νόημα, ή επιλέγετε ένα και δεσμεύεστε;


Τα μοντέλα σε αυτήν τη δοκιμή δεν είναι όλα ισοδύναμα. Καλύπτουν διαφορετικές αρχιτεκτονικές, καθεστώτα εκπαίδευσης και περιβάλλοντα ανάπτυξης. Η Βάση του Γύρου 1 περιλαμβάνει μοντέλα που είναι ευρέως προσιτά. Η επεκταμένη δεξαμενή του Round 2 προσθέτει αρκετές από τις νεότερες παραλλαγές μοντέλων premium-tier που είναι πλέον διαθέσιμες στους χρήστες που πληρώνουν στο MachineTranslation.com, το ίδιο επίπεδο μοντέλου που διαφορετικά θα σήμαινε ένα ξεχωριστό πληρωμένο λογαριασμό με κάθε μεμονωμένο πάροχο.

Η επεκταμένη δεξαμενή στο Round 2 περιλαμβάνει μοντέλα που είναι πιο προηγμένα και διαθέσιμα στους χρήστες που πληρώνουν στο MachineTranslation.com. Η επίδραση της επέκτασης της δεξαμενής δεν είναι ομοιόμορφη. Σε ορισμένες δοκιμές (επισημότητα/Ιαπωνικά), μετέβαλε τη συναίνεση με σημαντικό τρόπο. Σε άλλες περιπτώσεις (ιατρική ορολογία/Βιετναμέζικα), το χάσμα εμβάθυνε.

Τα δεδομένα δοκιμής δείχνουν δύο διακριτές κατηγορίες αποτυχίας και απαιτούν διαφορετικές απαντήσεις.
Κατηγορία Α: Σιωπηλές αποτυχίες. Σφάλματα τυπικότητας, σφάλματα καταχρήσεως, ακρίβεια ιατρικής ορολογίας: αυτά παράγουν αποτελέσματα που φαίνονται σωστά. Τα ιαπωνικά είναι γραμματικά σωστά. Ο Βιετναμέζος είναι ευγλώττης. Δεν υπάρχει κανένα εξωτερικό σημάδι ότι κάτι πήγε στραβά. Ένας μονόγλωσσος χρήστης που διαβάζει το αποτέλεσμα ενός μόνο μοντέλου δεν έχει τρόπο να γνωρίζει ότι το μοντέλο έκανε μια επιλογή καταχρήσεως που θα παρατηρούσε ένας ανώτερος ιαπωνικός διευθυντής, ή ότι ένας κλινικός όρος περιορίστηκε με τρόπο που αλλάζει τον πληθυσμό στον οποίο εφαρμόζεται.
Category B: Ορατές αποτυχίες. Το MiniMax μεταφράζει το "burning the midnight oil" ως "burning torches." GPT-4.1-NANO επιλύει το "That's sick" στο ξεκάθαρο "すごい." Αυτά είναι ανιχνεύσιμα, είτε από έναν ομιλητή της γλώσσας προορισμού είτε με σύγκριση με άλλες εξόδους μοντέλου.
Η σύγκριση πολλαπλών μοντέλων που παρέχει το SMART είναι πιο πολύτιμη στην Κατηγορία Α. Όταν πέντε ή δέκα μοντέλα παράγουν εξόδους και οι περισσότερες συμφωνούν σε ένα επίσημο καταχρήση ενώ ένα παράγει περιστασιακή απλή μορφή ιαπωνικά, η διαφωνία είναι ορατή στην προβολή σύγκρισης. Ένας χρήστης που μιλά τη γλώσσα-στόχο μπορεί να αξιολογήσει τις επιλογές. Ένας χρήστης που δεν μπορεί να δει ότι ελήφθη μια αμφισβητούμενη απόφαση και να αποφασίσει εάν αυτή η απόφαση δικαιολογεί ανθρώπινη αναθεώρηση.
Για εργασίες σε επίπεδο εγγράφου, μεγάλα αρχεία, μετάφραση που διατηρεί τη διάταξη PDF, συμβόλαια ή κλινικό υλικό, η δυνατότητα επεξεργασίας εγγράφων της πλατφόρμας χειρίζεται τη δομή αρχείου χωρίς να σπάει τη μορφοποίηση. Αλλά τα ερωτήματα ποιότητας που τέθηκαν παραπάνω ισχύουν ανεξάρτητα από το μέγεθος του αρχείου. Μια κλινική μελέτη 100 σελίδων όπου κάθε περίπτωση του "ηπατικής δυσλειτουργίας" μεταφράζεται ως "ηπατική ανεπάρκεια" είναι μια μεγαλύτερη εκδοχή του ίδιου προβλήματος που εντοπίστηκε στο Test 2.
Για τις ιατρικές και νομικές κατηγορίες συγκεκριμένα, η ανθρώπινη επαλήθευση είναι η σωστή λύση. Η υπηρεσία AI Post-Editing της Tomedes, η οποία συνδυάζει την έξοδο AI με πιστοποιημένη ανθρώπινη αναθεώρηση για ακριβώς αυτό το είδος περιεχομένου υψηλού κινδύνου, είναι δημιουργημένη για αυτό. Η διάσπαση suy gan / suy giảm chức năng gan είναι ακριβώς το είδος του ευρήματος που θα έπρεπε να ενεργοποιήσει αυτήν την αναθεώρηση, όχι επειδή όλα τα μοντέλα είναι λάθος, αλλά επειδή τα μοντέλα που είναι πιο σίγουρα δεν είναι τα πιο ακριβή.
Η αξία της παρατήρησης πολλαπλών εξόδων δεν είναι ότι θα επιλέξετε πάντα την πλειοψηφία. Είναι ότι θα ξέρεις ότι έγινε μια επιλογή, που είναι διαφορετικό από το να υποθέσεις ότι το αποτέλεσμα μπροστά σου είναι σωστό.

Τοποθέτησε τις οκτώ δοκιμές δίπλα-δίπλα και ένα σχέδιο ισχύει: η συμφωνία και η διαφωνία δεν κατανέμονται τυχαία. Η καθομιλουμένη επιχειρηματική γλώσσα με ιδιωματικές εκφράσεις ("να επικοινωνήσουμε", "να δουλέψουμε μέχρι αργά τη νύχτα") συγκλίνησε σχεδόν σε κάθε μοντέλο του δείγματος, και στους δύο γύρους. Η επισημότητα, η νομική ακρίβεια και η ιατρική ορολογία δεν ήταν. Το τεστ επισημότητας του CEO άλλαξε από περιστασιακό σε επίσημο μόνο όταν συμπεριλήφθη η διευρυμένη ομάδα. Η ρήτρα αποζημίωσης αποκάλυψε μια πραγματική νομική διάκριση (免責 vs. 補償) που μόνο ένα μοντέλο, σε μια περίοδο, κατάφερε να κάνει σωστά. Η διαίρεση της ιατρικής ορολογίας δεν επιλύθηκε ποτέ, παραμένοντας σε περίπου 6 προς 4 και στους δύο γύρους ανεξάρτητα από το ποια μοντέλα ήταν στο σύνολο.
Αυτό είναι το πραγματικό εύρημα, όχι ένας ισχυρισμός μάρκετινγκ: η συναίνεση δεν κάνει καλύτερη κάθε πρόταση και δεν χρειάζεται να το κάνει. Είναι πιο πολύτιμο ακριβώς όπου η ευχέρεια ενός μοντέλου δεν σας δίνει κανένα λόγο να αμφιβάλλετε, και όπου το να κάνετε λάθος στοιχίζει πραγματικά κάτι.
Υπάρχει ένα δεύτερο, πιο πρακτικό επίπεδο αυτού του τεστ που αξίζει να δηλωθεί ξεκάθαρα. Η εκτέλεση αυτής της σύγκρισης μόνος μου σήμαινε τον έλεγχο των αποτελεσμάτων από το GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, και MiniMax M2.7 δίπλα-δίπλα με τα υπάρχοντα μοντέλα αναφοράς, σε ένα μέρος, σε μια πλατφόρμα. Έξω από το MachineTranslation.com, αυτή δεν είναι μία συνδρομή. Είναι αρκετές, μία για κάθε πάροχο του οποίου το επίπεδο premium θέλετε να δοκιμάσετε, με όποια τιμή χρεώνει ο κάθε πάροχος ξεχωριστά. Οι χρήστες που πληρώνουν εδώ παίρνουν την ίδια σύγκριση με ένα κλικ, σε ένα κλάσμα του κόστους διατήρησης πέντε ξεχωριστών premium συνδρομών, χωρίς να παραιτούνται το πράγμα που πραγματικά έχει σημασία: να δουν πού συμφωνούν τα μοντέλα, και να ξέρουν ακριβώς πότε δεν συμφωνούν.
Κανένα δεν είναι κατηγορηματικά καλύτερο· εξαρτάται από την κατηγορία δοκιμής. Το Claude Sonnet και το Claude Opus επέλεξαν συνεχώς τον πιο ακριβή βιετναμέζικο ιατρικό όρο, και το Claude Opus παρήγαγε το πιο κατάλληλο slang για το "That's sick." Αλλά το Claude Sonnet παρήγαγε επίσης περιστασιακά ιαπωνικά σε μια τυπική πρόταση πλαισίου διευθύνοντος συμβούλου, όπου το GPT-5.5 το κατάλαβε σωστά. Η σύγκριση των αποτελεσμάτων απευθείας είναι πιο υπερασπίσιμη από το να επιλέξετε ένα μοντέλο και να του εμπιστευθείτε.
Δεν υπάρχει ένα. η ακρίβεια εξαρτάται από τον τομέα. Τα Gemini 3.5-Flash και GLM-5-Turbo παρήγαγαν τα πιο κατάλληλα επίσημα ιαπωνικά σε αυτή τη δοκιμή. Και τα δύο μοντέλα Claude ήταν πιο ακριβή στην ιατρική ορολογία του Βιετνάμ. Το DeepSeek V4-Pro ήταν το μόνο μοντέλο που χρησιμοποίησε τον σωστό ιαπωνικό νομικό όρο, αλλά μόνο στη Γύρο 2, και παρήγαγε περιστασιακά ιαπωνικά αλλού. Κανένα μοντέλο δεν κυριάρχησε σε όλα τα οχτώ τεστ.
Όχι, όχι αυτόματα. Η επέκταση της δεξαμενής με νεότερες παραλλαγές μοντέλων premium-tier μετέβαλε τη συναίνεση από περιστασιακή σε επίσημη στο ιαπωνικό τεστ τυπικότητας. Αλλά στο δοκιμαστικό σύστημα ιατρικής ορολογίας του Βιετνάμ, η διαίρεση παρέμεινε περίπου 6 προς 4 ανεξάρτητα από το ποια μοντέλα περιλήφθησαν. Περισσότερα μοντέλα επιφέρουν περισσότερες διαφωνίες, που είναι χρήσιμο σήμα, αλλά η συναίνεση εξακολουθεί να ακολουθεί την πλειοψηφία, και η πλειοψηφία δεν είναι πάντα η πιο ακριβής απάντηση.
Το SMART είναι το σύστημα πολλαπλής συναίνεσης της MachineTranslation.com, που εκτείνεται σε έως και 22 μοντέλα τεχνητής νοημοσύνης από παρόχους όπως OpenAI, Anthropic, Google και DeepSeek. Εκτελεί μια μετάφραση μέσω πολλών μοντέλων ταυτόχρονα και εμφανίζει την έξοδο της πλειοψηφικής συναίνεσης παράλληλα με την απάντηση κάθε μεμονωμένου μοντέλου, εξ ορισμού, χωρίς να απαιτείται κάποια διαμόρφωση. Η συναίνεση μετατοπίζεται όταν το σύνολο μοντέλων μετατοπίζεται, όπως φαίνεται σε αυτό το αποτέλεσμα της ιαπωνικής επισημότητας του τεστ: μια περιστασιακή συναίνεση στον Γύρο 1 έγινε επίσημη στον Γύρο 2.
Κανένα μοντέλο δεν είναι το καλύτερο· η ανθρώπινη αναθεώρηση είναι η καλύτερη απάντηση. Τα μοντέλα Claude επιλέγουν συνεχώς τον πιο ακριβή ιατρικό όρο στα Βιετναμικά, και το DeepSeek V4-Pro μόνο του χρησιμοποίησε τον σωστό ιαπωνικό νομικό όρο, αλλά μόνο στο Γύρο 2. Η ιατρική ορολογία δεν επιλύθηκε ποτέ σε 10 μοντέλα, γεγονός που υποδηλώνει ότι απαιτείται ειδική γνώση του τομέα, όχι ότι θα έπρεπε να επιλεγεί ένα διαφορετικό μοντέλο. Μια πιστοποιημένη ανθρώπινη αναθεώρηση μετά-επεξεργασίας, όπως προσφέρει η Tomedes, παρέχει αυτόν τον ειδικό έλεγχο.