June 5, 2026
Έχω διεξάγει εσωτερικές δοκιμές σε κάτι για το οποίο δεν μιλάμε αρκετά στην μεταφραστική βιομηχανία: όχι αν διαφορετικά συστήματα ΤΝ μεταφράζουν διαφορετικά, αλλά αν διαφορετικές εκδόσεις της ίδιας ΤΝ μεταφράζουν διαφορετικά — και κατά πόσο.
Την περασμένη εβδομάδα πέρασα μια μεμονωμένη ισπανική ιδιωματική φράση από πέντε εκδόσεις του ChatGPT ταυτόχρονα στην εσωτερική πλατφόρμα δοκιμών του MachineTranslation.com. Αυτό που επέστρεψε με σταμάτησε.
Δύο εκδόσεις παρήγαγαν μια μετάφραση που, ειλικρινά, δεν βγάζει νόημα στα Αγγλικά. Τρεις εκδοχές παρήγαγαν σωστές ιδιωματικές μεταφράσεις. Και οι τρεις σωστές δεν συμφωνούσαν μεταξύ τους. Και οι πέντε είναι
ChatGPT. Όλοι οι πέντε είναι OpenAI. Ίδιο AI, διαφορετικό μοντέλο — και τα αποτελέσματα δεν θα μπορούσαν να είναι πιο διαφορετικά.
Το μοιράζομαι τώρα επειδή πιστεύω ότι έχει σημασία, όχι επειδή έχω σαφείς απαντήσεις. Δεν το κάνω. Αλλά η παρατήρηση είναι αρκετά ενδιαφέρουσα για να διαδοθεί στον κόσμο.
Η φράση που δοκίμασα ήταν llevarse el gato al agua.

Εδώ είναι τι παρήγαγε κάθε έκδοση:
| Μοντέλο | Έξοδος | Ιδιωματική; |
|---|---|---|
| ChatGPT::GPT-4o-MINI | να μεταφέρεις τη γάτα στο νερό | ❌ Κυριολεκτική |
| ChatGPT::GPT-4.1-NANO | να μεταφέρεις τη γάτα στο νερό | ❌ Κυριολεκτική |
| ChatGPT::GPT-4.1-MINI | να το πετύχεις επιτυχώς | ✅ Σωστή |
| ChatGPT::GPT-5.4-MINI | να πετύχεις τον σκοπό σου | ✅ Μερική |
| ChatGPT::GPT-5.4 | να βγεις νικητής | ✅ Σωστή |
Η φράση σημαίνει να πετύχεις κάτι δύσκολο ενάντια σε όλες τις πιθανότητες, να πετύχεις μια δύσκολη νίκη. Δεν έχει καμία σχέση με γάτες ή νερό. Η κυριολεκτική μετάφραση δεν είναι μετάφραση. Είναι μια κατά λέξη μεταγραφή μιας φράσης που το μοντέλο απέτυχε να αναγνωρίσει ως ιδιωματισμό. Τα GPT-4o-MINI και GPT-4.1-NANO παρήγαγαν πανομοιότυπα
αποτελέσματα. Όχι παρόμοιο, ίδιο. Τα Στατιστικά Μετάφρασης εντόπισαν αυτό απευθείας: Το GPT-4.1-nano και το GPT-4o-mini μοιράζονται πανομοιότυπες μεταφράσεις, δίνοντας έμφαση στην κυριολεκτική ερμηνεία έναντι της ιδιωματικής σημασίας.
Τα GPT-4.1-MINI, GPT-5.4-MINI και GPT-5.4 παρήγαγαν κάτι αναγνωρίσιμα σωστό — αλλά όχι το ίδιο μεταξύ τους.
Θέλω να είμαι ακριβής σχετικά με το γιατί το llevarse el gato al agua είναι μια χρήσιμη είσοδος δοκιμής και όχι μια επιλεγμένη.
Είναι μια καθιερωμένη ιδιωματική έκφραση. Εμφανίζεται στη λογοτεχνία, τη δημοσιογραφία και την καθημερινή ομιλία. Δεν είναι ασαφές. Οποιοδήποτε μοντέλο εκπαιδευμένο σε ένα εύλογο σώμα κειμένων στα ισπανικά θα έπρεπε να το έχει συναντήσει. Το ερώτημα δεν είναι αν το μοντέλο έχει δει τη φράση. Το ερώτημα είναι τι κάνει με αυτό.
Η χειρότερη μορφή αποτυχίας στη μετάφραση ιδιωμάτων δεν είναι η παραγωγή μιας κακής μετάφρασης. Παράγει μια κυριολεκτική μετάφραση που φαίνεται αποδεκτή σε κάποιον που δεν γνωρίζει την γλώσσα προορισμού.
To carry the cat to the water είναι γραμματικά σωστή στα Αγγλικά. Είναι καλοσχηματισμένο. Ακούγεται σαν κάτι που θα μπορούσε να σημαίνει κάτι. Ένας χρήστης που δεν μιλάει Ισπανικά μπορεί να το διαβάσει, να γνέψει και να προχωρήσει — χωρίς να μάθει ποτέ ότι η αρχική σημασία χάθηκε εντελώς.
Αυτή είναι η αποτυχία που με απασχολεί. Όχι το προφανές λάθος. Το αόρατο άτομο.
Το μοτίβο εδώ δεν είναι τυχαίο. Τα δύο μοντέλα που παρήγαγαν κυριολεκτικές μεταφράσεις (GPT-4o-MINI και GPT-4.1-NANO) είναι και τα δύο μικρότερα, ελαφρύτερα μοντέλα βελτιστοποιημένα για ταχύτητα και αποδοτικότητα κόστους. Τα τρία μοντέλα που παρήγαγαν ιδιωματικές μεταφράσεις (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) αντιπροσωπεύουν μια διαφορετική γενιά ή κλίμακα παραμέτρων.
Αυτό υποδηλώνει κάτι που πιστεύω ότι δεν έχει εξερευνηθεί επαρκώς: η ιδιωματική ικανότητα στη μετάφραση κλιμακώνεται με την ικανότητα του μοντέλου με τρόπους που δεν είναι ορατοί σε γενικά benchmarks.
Τα γενικά γλωσσικά benchmarks ελέγχουν τη συλλογιστική, τη γνώση, τον προγραμματισμό, τα μαθηματικά. Συνήθως δεν ελέγχουν αν ένα μοντέλο μπορεί να αναγνωρίσει ότι το βρέχει καταρρακτωδώς δεν αφορά τις καιρικές συνθήκες, ή ότι το llevarse el gato al agua δεν αφορά την ενυδάτωση μιας γάτας. Οι ιδιωματισμοί βρίσκονται στη διασταύρωση πολιτισμικής γνώσης, εννοιολογικής συμπερασματολογίας και αναγνώρισης προτύπων — και αυτή η διασταύρωση φαίνεται να απαιτεί ένα όριο χωρητικότητας του μοντέλου που τα μικρότερα μοντέλα δεν ξεπερνούν σταθερά.
Αυτό που δεν ισχυρίζομαι: ότι τα μεγαλύτερα μοντέλα είναι πάντα καλύτεροι μεταφραστές. Δεν έχω αποδείξεις για αυτό ως γενικό κανόνα. Αυτό που παρατηρώ: ότι για ιδιωματικό περιεχόμενο ειδικότερα, το χάσμα εκδόσεων εντός της οικογένειας ήταν μεγαλύτερο από ό,τι περίμενα.
Οι περισσότεροι χρήστες που χρησιμοποιούν ένα εργαλείο μετάφρασης AI δεν γνωρίζουν ποια έκδοση αυτού του AI χρησιμοποιούν. Ανοίγουν ένα προϊόν, επιλέγουν ένα ζεύγος γλωσσών και λαμβάνουν ένα αποτέλεσμα. Η δρομολόγηση του μοντέλου είναι αόρατη σε αυτούς.
}Αυτό έχει σημασία σε μεγάλη κλίμακα. Η MachineTranslation.com επεξεργάστηκε πάνω από εκατοντάδες χιλιάδες μεταφραστικές εργασίες από τα Αγγλικά στα Ισπανικά σε μια μόνο περίοδο 90 ημερών. Εάν ένα σημαντικό μέρος αυτών των εργασιών αφορούσε ιδιωματικό περιεχόμενο (διαφημιστικό κείμενο, νομική γλώσσα, λογοτεχνικό κείμενο, ανεπίσημη επικοινωνία) και το εργαλείο που δρομολογούσε αυτές τις εργασίες κατεύθυνε τους χρήστες σε ένα μικρότερο μοντέλο χωρίς τη γνώση τους, τότε το «κουβάλησε τη γάτα στο νερό» εμφανιζόταν σε πραγματικά αποτελέσματα, σε πραγματικά έγγραφα, για πραγματικούς ανθρώπους που εμπιστεύονταν το αποτέλεσμα. Η βιομηχανία μεταφράσεων έχει περάσει χρόνια συγκρίνοντας παρόχους τεχνητής νοημοσύνης. DeepL έναντι Google.
Claude έναντι ChatGPT. Αυτές οι συγκρίσεις είναι χρήσιμες. Αλλά εντός ενός μόνο παρόχου, το χάσμα εκδόσεων μπορεί να είναι εξίσου σημαντικό — και είναι ένα χάσμα που τα περισσότερα πλαίσια σύγκρισης δεν μετρούν επειδή δεν δοκιμάζουν σε επίπεδο έκδοσης μοντέλου. Όταν κάποιος λέει «Χρησιμοποιώ το ChatGPT για μετάφραση», αυτή η πρόταση δεν είναι αρκετά συγκεκριμένη για να έχει νόημα.
Ποιο ChatGPT; Νάνο? 4ο-μίνι; 4.1-μίνι; 5.4? Η απάντηση αλλάζει την έξοδο με τρόπους που δεν είναι ασήμαντοι, τουλάχιστον για ιδιωματικό περιεχόμενο.
Αυτό είναι το κομμάτι που βρίσκω πιο ενδιαφέρον, και δεν έχω καταλάβει πλήρως τι να κάνω με αυτό ακόμα.
Τα τρία μοντέλα που παρήγαγαν ιδιωματικές μεταφράσεις έδωσαν τρεις διαφορετικές:
Και οι τρεις είναι υπερασπίσιμες αγγλικές αποδόσεις του llevarse el gato al agua. Αλλά δεν είναι ισοδύναμα.
Το να τα καταφέρεις δίνει έμφαση στην εκτέλεση έναντι της δυσκολίας, εσύ έκανες κάτι δύσκολο και πέτυχε. Το να πετύχει κανείς τον σκοπό του δίνει έμφαση στο αποτέλεσμα που επιθυμούσες να επιτευχθεί, με λιγότερη έμφαση στη δυσκολία. «Να βγεις στην κορυφή» τονίζει την ανταγωνιστική νίκη, κερδίζοντας σε σχέση με τους άλλους.
Η αρχική ισπανική ιδιωματική έκφραση βρίσκεται πιο κοντά στην πρώτη από αυτές. Η φράση φέρει την έννοια της υπέρβασης της αντίστασης, όχι απλώς την προτίμηση ενός αποτελέσματος και την υλοποίησή του. Αλλά το «να πετύχει κανείς τον σκοπό του» και το «να βγει νικητής» δεν είναι λάθος, απλώς είναι ασαφή προς διαφορετικές κατευθύνσεις. Αυτό εγείρει ένα ερώτημα που βρίσκω πραγματικά δύσκολο: όταν τρία μοντέλα παράγουν το καθένα μια σωστή αλλά διαφορετική ιδιωματική μετάφραση, πώς αξιολογείς ποια είναι η
καλύτερη; Οι βαθμολογίες BLEU συγκρίνονται με μία μεταφραστική αναφορά — αλλά ποιος έγραψε την αναφορά, και ποια από αυτές τις τρεις θα είχε επιλέξει;
Ο Πράκτορας Μετάφρασης Τεχνητής Νοημοσύνης μας, προς τιμήν του, έθεσε τη σωστή ερώτηση πριν δεσμευτεί σε οποιαδήποτε έξοδο: Ποιο είναι το νόημα που εννοείται με το «llevarse el gato al agua» σε αυτό το πλαίσιο; Προσφέρθηκαν τρεις επιλογές — να επιτευχθεί ένας δύσκολος στόχος, να ληφθεί κάτι περιττό, ή να αναληφθεί μια επικίνδυνη δραστηριότητα. Αυτή η ερώτηση δεν είναι διακοσμητική. Είναι ο μηχανισμός με τον οποίο η εννοιολογική ασάφεια επιλύεται πριν οριστικοποιηθεί η μετάφραση.
Αλλά το νόημα παραμένει: τρεις σωστές απαντήσεις, τρεις διαφορετικές αποχρώσεις νοήματος. Τα εργαλεία αξιολόγησης μεταφράσεων δεν είναι φτιαγμένα για τέτοιου είδους λεπτομέρειες.
Θέλω να είμαι ειλικρινής σχετικά με τα όρια αυτού που δείχνει αυτή η δοκιμή.
Μία ιδιωματική έκφραση, ένα ζεύγος γλωσσών, μία ημέρα εσωτερικών δοκιμών. Αυτό δεν είναι μια μελέτη. Είναι μια παρατήρηση. Δεν ξέρω αν αυτό το μοτίβο (μικρότερα μοντέλα που αποδίδουν κατά λέξη, μεγαλύτερα μοντέλα που επιτυγχάνουν ιδιωματική απόδοση) ισχύει με συνέπεια σε:
Επίσης, δεν ξέρω αν αυτή είναι μια σταθερή ιδιότητα αυτών των μοντέλων ή κάτι που αλλάζει με ενημερώσεις και λεπτομερή ρύθμιση. Οι πάροχοι μοντέλων δεν δημοσιεύουν αρχεία καταγραφής αλλαγών ειδικά για τη μετάφραση. Μια έκδοση μοντέλου που χειρίζεται σωστά το llevarse el gato al agua σήμερα, μπορεί να ενημερωθεί τον επόμενο μήνα, και δεν θα είχαμε τρόπο να το γνωρίζουμε.
Αυτό που ξέρω: αυτό το τεστ παρήγαγε ένα αποτέλεσμα αρκετά ενδιαφέρον ώστε να θέλω να κάνω περισσότερα από αυτά, πιο συστηματικά, σε περισσότερα γλωσσικά ζεύγη και τύπους περιεχομένου. Όταν έχω περισσότερα να μοιραστώ, θα το κάνω.
Θα κλείσω με τα δύο ερωτήματα που μου άφησε αυτό το τεστ. Δεν πρόκειται να τους απαντήσω, δεν έχω τα δεδομένα για να το κάνω ακόμα. Αλλά πιστεύω ότι είναι οι σωστές ερωτήσεις που πρέπει να γίνουν.
Πρώτον: σε ποιο όριο παραμέτρων η ιδιωματική ικανότητα γίνεται αξιόπιστη;
Η μετάβαση από τα GPT-4o-MINI και GPT-4.1-NANO (και τα δύο κυριολεκτικά) στο GPT-4.1-MINI (ιδιωματικό) υποδηλώνει ότι υπάρχει ένα όριο κάπου στο εύρος των παραμέτρων μεταξύ αυτών των μεγεθών μοντέλων όπου η αναγνώριση ιδιωμάτων ενεργοποιείται. Είναι συνεπές; Ισχύει για ιδιωματισμούς σε όλες τις γλώσσες, ή εξαρτάται από το πόσο καλά εκπροσωπείται μια γλώσσα στα δεδομένα εκπαίδευσης; Δεν ξέρω. Αλλά η γνώση θα ήταν χρήσιμη για οποιονδήποτε δημιουργεί ροές εργασίας μετάφρασης.
Δεύτερον: τι κοστίζει η αδιαφάνεια της έκδοσης του μοντέλου στους χρήστες σε μεγάλη κλίμακα;
Εάν ένας χρήστης δρομολογεί 1.000 έγγραφα ανά μήνα μέσω ενός εργαλείου που δεν αποκαλύπτει ποια έκδοση μοντέλου χρησιμοποιείται (και μερικά από αυτά τα έγγραφα περιέχουν ιδιωματικό περιεχόμενο), πόσο συχνά συμβαίνει η κυριολεκτική αποτυχία αόρατα; Πώς θα το ήξεραν; Ποιο είναι το πραγματικό κόστος του να μην μάθουμε ποτέ;
Νομίζω ότι αυτό είναι ένα πιο σημαντικό ερώτημα από τις περισσότερες συγκρίσεις ποιο AI είναι καλύτερο για μετάφραση που κυκλοφορούν αυτήν τη στιγμή. Η απάντηση δεν είναι «χρησιμοποιήστε το μεγαλύτερο μοντέλο». Η απάντηση μπορεί να είναι: γνωρίζετε τι χρησιμοποιείτε, κάντε τα δικά σας τεστ στο δικό σας περιεχόμενο και μην υποθέτετε ότι το όνομα ενός παρόχου είναι εγγύηση σταθερής συμπεριφοράς σε όλη την γκάμα των μοντέλων του .
Αυτό, τουλάχιστον, είναι αυτό που καταλαβαίνω από αυτό το τεστ.
Με βάση αυτή τη μοναδική δοκιμή: μικρότερα, βελτιστοποιημένα για αποδοτικότητα μοντέλα εντός της ίδιας οικογένειας AI επέλεξαν από προεπιλογή την κατά λέξη μετάφραση μιας καθιερωμένης ισπανικής ιδιωματικής έκφρασης, ενώ μεγαλύτερες/νεότερες εκδόσεις του ίδιου μοντέλου παρήγαγαν σωστές ιδιωματικές αποδόσεις. Αν αυτό ισχύει για όλες τις κατηγορίες ιδιωμάτων και ζεύγη γλωσσών είναι το επόμενο ερώτημα. Θα κάνω περισσότερες δοκιμές.
Τα GPT-4.1-MINI, GPT-5.4-MINI και GPT-5.4 μετέφρασαντο «llevarse el gato al agua» ιδιωματικά — αλλά σε διαφορετικές αγγλικές εκφράσεις με διακριτικά διαφορετικές συνδηλώσεις. Αυτό υποδηλώνει ότι η ποιότητα της ιδιωματικής μετάφρασης έχει τουλάχιστον δύο διαστάσεις: αν το μοντέλο αναγνωρίζει καθόλου την ιδιωματική έκφραση, και ποια ισοδύναμη έκφραση επιλέγει από τις διαθέσιμες επιλογές της γλώσσας-στόχου. Οι τυπικές μετρικές ποιότητας μετάφρασης δεν διαχωρίζουν καθαρά αυτές τις δύο διαστάσεις. Νομίζω ότι θα έπρεπε.
Αυτή η ανάρτηση βασίζεται σε εσωτερικές δοκιμές στην πλατφόρμα ανάπτυξης του MachineTranslation.com. Η δοκιμή πολλαπλών μοντέλων που παρουσιάζεται εδώ δεν είναι ακόμη διαθέσιμη στο κοινό. Μοιράζομαι αυτό το εύρημα επειδή πιστεύω ότι η παρατήρηση είναι χρήσιμη ανεξάρτητα από το πού εκτελείτε τις μεταφράσεις σας.