June 5, 2026

AI yang sama, model yang berbeda — dan hasil terjemahannya sangat jauh berbeda

Saya telah menjalankan tes internal pada sesuatu yang tidak cukup kita bicarakan dalam industri terjemahan: bukan apakah sistem AI yang berbeda menerjemahkan secara berbeda, tetapi apakah versi AI yang sama menerjemahkan secara berbeda — dan seberapa banyak.

Minggu lalu saya menguji satu idiom Spanyol melalui lima versi ChatGPT secara bersamaan di platform pengujian internal MachineTranslation.com. Hasilnya membuat saya terkejut.

Dua versi menghasilkan terjemahan yang, sungguh, tidak masuk akal dalam bahasa Inggris. Tiga versi menghasilkan terjemahan idiomatik yang benar. Dan tiga yang benar tidak saling setuju.

Kelima-limanya adalah ChatGPT. Semua lima adalah OpenAI. AI yang sama, model yang berbeda — dan keluarannya sangat berbeda.

Saya membagikan ini sekarang karena saya pikir ini penting, bukan karena saya punya jawaban yang jelas. Saya tidak. Namun pengamatan ini cukup menarik untuk dibagikan ke dunia.

Daftar isi

  • Tes: Satu idiom Spanyol, lima versi GPT
  • Mengapa idiom ini menjadi kasus uji yang baik
  • Apa yang diungkapkan oleh pemisahan literal-ke-idiomatik tentang bagaimana model-model ini dilatih
  • Implikasi yang sepertinya tidak dibicarakan siapa pun
  • Bahkan terjemahan yang benar pun saling tidak setuju
  • Apa yang belum saya ketahui
  • Dua pertanyaan penelitian yang patut direnungkan

Tes: Satu idiom Spanyol, lima versi GPT

Frasa yang saya uji adalah llevarse el gato al agua.


Berikut adalah apa yang dihasilkan setiap versi:

Model                                        Output                                               Idiomatik?
ChatGPT::GPT-4o-MINI membawa kucing ke air ❌ Literal
ChatGPT::GPT-4.1-NANO membawa kucing ke air ❌ Literal
ChatGPT::GPT-4.1-MINI untuk berhasil melakukannya ✅ Benar
ChatGPT::GPT-5.4-MINI untuk mendapatkan keinginannya ✅ Sebagian
ChatGPT::GPT-5.4 untuk keluar sebagai pemenang ✅ Benar

Frasa ini berarti mencapai sesuatu yang sulit melawan segala rintangan, untuk meraih kemenangan yang sulit. Tidak ada hubungannya dengan kucing atau air. Terjemahan harfiah bukanlah terjemahan. Ini adalah transkripsi kata demi kata dari frasa yang gagal dikenali model sebagai idiom.

GPT-4o-MINI dan GPT-4.1-NANO menghasilkan keluaran yang identik. Tidak serupa, identik. Wawasan Terjemahan Kami langsung menandai ini: GPT-4.1-nano dan GPT-4o-mini berbagi terjemahan yang identik, menekankan interpretasi literal daripada makna idiomatik.

GPT-4.1-MINI, GPT-5.4-MINI, dan GPT-5.4 masing-masing menghasilkan sesuatu yang secara jelas benar — tetapi tidak sama satu sama lain.

Mengapa idiom ini menjadi kasus uji yang baik

Saya ingin lebih tepat tentang mengapa llevarse el gato al agua adalah masukan uji yang berguna daripada yang dipilih-pilih.

Ini adalah idiom yang sudah mapan. Muncul dalam sastra, jurnalisme, dan percakapan sehari-hari. Tidak samar. Model apa pun yang dilatih dengan sebuah korpus teks Spanyol yang memadai seharusnya sudah menjumpainya. Pertanyaan nya bukan apakah model tersebut telah melihat frasa tersebut. Pertanyaannya adalah apa yang dilakukannya dengannya.

Modus kegagalan terburuk dalam terjemahan idiom bukanlah menghasilkan terjemahan yang buruk ‎. Ini menghasilkan terjemahan harfiah yang terlihat dapat diterima oleh seseorang yang tidak mengetahui bahasa target.

To carry the cat to the water adalah bahasa Inggris yang benar secara tata bahasa. Itu terbentuk dengan baik. Kedengarannya seperti sesuatu yang bisa berarti sesuatu. Pengguna yang tidak berbicara bahasa Spanyol mungkin membacanya, mengangguk, dan melanjutkan — tidak pernah tahu bahwa makna aslinya hilang sepenuhnya.

Itulah mode kegagalan yang saya pedulikan. Bukan kesalahan yang jelas. Yang tak terlihat.

Apa yang diungkapkan oleh pemisahan literal-ke-idiomatik tentang bagaimana model-model ini dilatih

Pola di sini tidak acak. Dua model yang menghasilkan terjemahan literal (GPT-4o-MINI dan GPT-4.1-NANO) keduanya adalah model yang lebih kecil, lebih ringan yang dioptimalkan untuk kecepatan dan efisiensi biaya. Tiga model yang menghasilkan terjemahan idiomatik (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) mewakili generasi atau skala parameter yang berbeda.

Ini menunjukkan sesuatu yang menurut saya kurang dieksplorasi: kompetensi idiomatik dalam terjemahan berskala dengan kapasitas model dengan cara yang tidak terlihat dalam tolok ukur umum.

Tolok ukur bahasa umum menguji penalaran, pengetahuan, pengkodean, matematika. Mereka biasanya tidak menguji apakah suatu model dapat mengidentifikasi bahwa it's raining cats and dogs bukan tentang kondisi cuaca, atau bahwa llevarse el gato al agua bukan tentang menghidrasi kucing. Idiom berada di persimpangan pengetahuan budaya, inferensi kontekstual , dan pengenalan pola — dan persimpangan itu tampaknya membutuhkan ambang batas kapasitas model yang tidak secara konsisten dapat diatasi oleh model yang lebih kecil.

Apa yang tidak saya klaim: bahwa model yang lebih besar selalu merupakan penerjemah yang lebih baik. Saya tidak punya bukti untuk itu sebagai aturan umum. Apa yang saya amati: bahwa untuk konten idiomatis secara khusus, kesenjangan versi dalam keluarga lebih besar dari yang saya duga.

Implikasinya yang sepertinya tidak ada yang membicarakannya

Sebagian besar pengguna yang menggunakan alat terjemahan AI tidak tahu versi AI mana yang mereka gunakan. Mereka membuka produk, memilih pasangan bahasa , dan mendapatkan keluaran. Perutean model tidak terlihat oleh mereka.

Ini penting dalam skala besar. MachineTranslation.com memproses lebih dari ratusan ribu pekerjaan terjemahan Inggris-Spanyol dalam satu periode 90 hari. Jika sebagian besar dari pekerjaan-pekerjaan tersebut menyentuh konten idiomatik (materi pemasaran, bahasa hukum, teks sastra, komunikasi santai) dan alat yang mengarahkan pekerjaan-pekerjaan tersebut mengarahkan pengguna ke model yang lebih kecil tanpa sepengetahuan mereka, maka to carry the cat to the water muncul dalam keluaran nyata, dalam dokumen nyata, untuk orang-orang nyata yang mempercayai hasilnya.

Industri terjemahan telah menghabiskan waktu bertahun-tahun membandingkan penyedia AI. DeepL versus Google. Claude versus ChatGPT. Perbandingan itu berguna. Namun dalam satu penyedia, kesenjangan versi bisa sama signifikan — dan itu adalah kesenjangan yang sebagian besar kerangka perbandingan tidak ukur karena mereka tidak menguji pada tingkat versi model.

Ketika seseorang berkata Saya menggunakan ChatGPT untuk terjemahan, kalimat itu tidak cukup spesifik untuk bermakna. ChatGPT yang mana? Nano? 4o-mini? ‎4.1-mini? 5.4? Jawabannya mengubah keluaran dengan cara yang tidak sepele, setidaknya untuk konten idiomatik.

Bahkan terjemahan yang benar saling tidak setuju

Ini adalah bagian yang paling menarik bagi saya, dan saya belum sepenuhnya memahami apa yang harus dilakukan dengannya.

Tiga model yang menghasilkan terjemahan idiomatik memberikan tiga yang berbeda:

  • GPT-4.1-MINI: untuk berhasil melakukannya
  • GPT-5.4-MINI: untuk mendapatkan keinginannya
  • GPT-5.4: untuk menjadi yang teratas

Ketiganya adalah terjemahan bahasa Inggris yang dapat dipertahankan dari llevarse el gato al agua‎. Tetapi mereka tidak setara.

Untuk berhasil melakukannya menekankan pelaksanaan di tengah kesulitan, Anda melakukan sesuatu yang sulit dan itu berhasil. Mendapatkan keinginannya menekankan tercapainya hasil yang Anda inginkan, dengan kurang menekankan pada kesulitan. Untuk menjadi yang teratas menekankan kemenangan kompetitif, menang relatif terhadap orang lain.

Idiom Spanyol aslinya paling dekat dengan yang pertama dari ini. Frasa ini membawa konotasi mengatasi perlawanan, bukan sekadar lebih menyukai satu hasil dan membiarkannya terwujud. Tetapi mendapatkan keinginannya dan keluar sebagai pemenang tidak salah, mereka hanya kurang tepat dalam arah yang berbeda.

Ini menimbulkan pertanyaan yang menurut saya sangat sulit: ketika tiga model masing-masing menghasilkan terjemahan idiomatik yang benar tetapi berbeda, bagaimana Anda mengevaluasi mana yang terbaik? Skor BLEU membandingkan dengan a terjemahan referensi — tetapi siapa yang menulis referensi itu, dan yang mana dari ketiganya yang akan mereka pilih?

Agen Terjemahan AI kami, patut diacungi jempol, mengajukan pertanyaan yang tepat sebelum menghasilkan keluaran apa pun: Apa makna yang dimaksud dari 'llevarse el gato al agua' dalam konteks ini?‎ Tiga pilihan ditawarkan — untuk mencapai tujuan yang sulit, untuk mengambil sesuatu yang tidak perlu, atau untuk terlibat dalam aktivitas berisiko. Pertanyaan itu tidak dekoratif. Ini adalah mekanisme di mana ambiguitas kontekstual diselesaikan sebelum terjemahan difinalisasi.

Namun intinya tetap: tiga jawaban yang benar, tiga nuansa makna yang berbeda. Alat evaluasi terjemahan tidak dibangun untuk nuansa semacam ini.

Apa yang belum saya ketahui

Saya ingin jujur tentang batasan dari apa yang ditunjukkan tes ini.

Satu idiom, satu pasangan bahasa, satu hari pengujian internal. Itu bukan studi. Ini adalah pengamatan. Saya tidak tahu apakah pola ini (model yang lebih kecil cenderung literal, model yang lebih besar mencapai idiomatik) berlaku secara konsisten di seluruh:

  • Idiom Spanyol lainnya
  • Pasangan bahasa lain dengan tradisi idiomatik yang kaya (Arab, Jepang, Rusia semuanya terlintas dalam pikiran)
  • Konten non-idiomatik di mana perbedaan tersebut tidak berlaku
  • Kasus-kasus ekstrem di mana model yang lebih kecil memahami idiom dengan benar dan model yang lebih besar melewatkannya

Saya juga tidak tahu apakah ini adalah properti stabil dari model-model ini atau sesuatu yang bergeser dengan pembaruan dan penyempurnaan. Penyedia model tidak menerbitkan changelog khusus terjemahan. Versi model yang menangani llevarse el gato al agua dengan benar hari ini mungkin diperbarui bulan depan, dan kita tidak akan tahu.

Yang saya tahu: tes ini menghasilkan hasil yang cukup menarik sehingga saya ingin menjalankan lebih banyak tes, lebih sistematis, di lebih banyak pasangan bahasa dan jenis konten. Ketika saya memiliki lebih banyak untuk dibagikan, saya akan melakukannya.

Dua pertanyaan penelitian yang patut direnungkan

Saya akan menutup dengan dua pertanyaan yang ditinggalkan tes ini untuk saya. Saya tidak akan menjawabnya, saya belum punya data untuk melakukan itu. Namun menurut saya itu adalah pertanyaan yang tepat untuk diajukan.

Pertama: pada ambang batas parameter berapa kompetensi idiomatik menjadi andal?

Lompatan dari GPT-4o-MINI dan GPT-4.1-NANO (keduanya literal) ke GPT-4.1-MINI (idiomatik) menunjukkan ada ambang batas di suatu tempat dalam rentang parameter antara ukuran model tersebut di mana pengenalan idiom aktif. Apakah itu konsisten? Apakah ini berlaku untuk idiom di semua bahasa, atau apakah ini tergantung pada seberapa baik suatu bahasa terwakili dalam data pelatihan? Saya tidak tahu. Namun mengetahui akan berguna bagi siapa pun yang membangun alur kerja terjemahan.

Kedua: berapa biaya opasitas versi model bagi pengguna dalam skala besar?

Jika seorang pengguna merutekan 1.000 dokumen per bulan melalui alat yang tidak mengungkapkan versi model mana yang digunakan (dan beberapa dari dokumen tersebut mengandung konten idiomatik), seberapa sering kegagalan literal terjadi secara tidak terlihat? Bagaimana mereka bisa tahu? Berapa biaya sebenarnya jika tidak pernah mencari tahu?

Saya pikir ini adalah pertanyaan yang lebih penting daripada sebagian besar perbandingan AI mana yang terbaik untuk terjemahan yang saat ini beredar. Jawabannya bukan gunakan model terbesar. Jawabannya mungkin: ketahui apa yang Anda gunakan, jalankan tes Anda sendiri pada konten Anda sendiri, dan jangan berasumsi bahwa nama satu penyedia adalah jaminan perilaku yang konsisten di seluruh rentang model mereka.

Setidaknya, itulah yang saya ambil dari tes ini.

Pertanyaan penelitian

1. Apakah ukuran model secara andal memprediksi kualitas terjemahan idiomatik?

Berdasarkan tes tunggal ini: model yang lebih kecil, dioptimalkan untuk efisiensi dalam keluarga AI yang sama secara default menerjemahkan secara harfiah idiom Spanyol yang sudah mapan , sementara versi yang lebih besar/baru dari model yang sama menghasilkan terjemahan idiomatik yang benar. Apakah ini berlaku di seluruh kategori idiom dan pasangan bahasa adalah pertanyaan berikutnya. Saya akan menjalankan lebih banyak tes.

2. Mengapa tiga terjemahan idiomatik yang benar menghasilkan tiga keluaran yang berbeda secara signifikan?

GPT-4.1-MINI, GPT-5.4-MINI, dan GPT-5.4 semuanya menerjemahkan llevarse el gato al agua secara idiomatik — tetapi ke dalam ekspresi bahasa Inggris yang berbeda dengan konotasi yang sedikit berbeda. Ini menunjukkan bahwa kualitas terjemahan idiomatik memiliki setidaknya dua dimensi: apakah model mengenali idiom tersebut sama sekali, dan ekspresi padanan mana yang dipilihnya dari pilihan yang tersedia dalam bahasa target. Metrik kualitas terjemahan standar tidak secara jelas memisahkan kedua dimensi ini. Menurut saya, mereka seharusnya.


Postingan ini didasarkan pada pengujian internal di platform pengembangan MachineTranslation.com. Pengujian versi multi-model yang ditampilkan di sini belum tersedia untuk umum. Saya membagikan temuan ini karena saya pikir pengamatan ini berguna terlepas dari di mana Anda menjalankan terjemahan Anda.