September 25, 2026

Dari GPT-3 ke GPT-5: Bagaimana kualitas terjemahan AI sebenarnya berubah

GPT-3, GPT-4, dan GPT-5 terpaut lima tahun dan beberapa generasi arsitektur, namun pertanyaan yang berguna untuk penerjemahan bukanlah "mana yang paling pintar." Pertanyaannya lebih spesifik: apa yang sebenarnya berubah dalam cara model-model ini menangani bagian bahasa yang tidak dapat diterjemahkan kata demi kata, seperti idiom, ambiguitas, dan register? Peningkatannya terjadi di aspek-aspek tertentu, pada titik-titik tertentu, dan perkembangannya tidak berjalan lurus dari yang lebih lama ke yang lebih baru.

Apa yang sebenarnya ditawarkan GPT-3 untuk penerjemahan

OpenAI merilis GPT-3 pada tahun 2020, sebelum program pengujian milik MachineTranslation.com ada, jadi tidak ada tolok ukur berpemilik di sini. Ini adalah sejarah yang terdokumentasi dengan baik, bukan hasil pengujian internal. GPT-3 adalah model pertama dari jenisnya yang mampu menghasilkan teks yang lancar dan terdengar alami seperti manusia dalam berbagai bahasa tanpa pelatihan khusus untuk tugas tertentu, yang menjadikannya sebuah pencapaian nyata. Khusus untuk penerjemahan, kefasihan yang sama menciptakan risiko nyata: GPT-3 dapat menghasilkan kalimat yang meyakinkan dan tersusun dengan baik dalam bahasa target namun tetap salah, tanpa ada indikasi apa pun pada keluarannya bahwa kesalahan telah terjadi.

Apa yang berubah ketika GPT-4 hadir

GPT-4 diluncurkan pada Maret 2023, dan pengujian model milik MachineTranslation.com sendiri dimulai sekitar generasi ini. Peningkatannya nyata tetapi tidak merata. Saat menguji frasa bahasa Inggris yang ambigu "That's sick" ke dalam bahasa Jepang, GPT-4.1-nano adalah satu-satunya model dari enam model yang diuji yang mereduksi makna ganda yang disengaja tersebut menjadi satu interpretasi tunggal, sementara lima model lainnya mempertahankan ambiguitas yang dimaksudkan oleh frasa aslinya. Idiom merupakan kelemahan yang lebih besar: saat menjalankan idiom bahasa Spanyol "llevarse el gato al agua" melalui lima versi GPT sekaligus, model yang lebih kecil, GPT-4o-mini dan GPT-4.1-nano, keduanya menghasilkan terjemahan harfiah yang sama dan salah, sehingga melewatkan makna idiom tersebut sepenuhnya.

Pola yang sama juga terlihat di tempat lain. Idiom bahasa Jerman, "ich verstehe nur Bahnhof," yang diuji pada delapan subversi GPT dan Claude, diterjemahkan secara harfiah dan salah khususnya oleh GPT-4o-mini, sementara model yang lebih kecil dan lebih baru dalam pengujian yang sama, GPT-4.1-nano, berhasil menerjemahkannya dengan benar. Generasi dan ukuran model tidak berkorelasi secara konsisten, sebuah pola yang diulas lebih mendalam dalam pengujian versi model MachineTranslation.com.

Apa yang diubah GPT-5 untuk penerjemahan

OpenAI memperkenalkan GPT-5 sebagai sistem terpadu yang merutekan antara model default yang cepat dan model penalaran yang lebih mendalam tergantung pada tugasnya, sebuah perubahan struktural dari desain model tunggal GPT-4. GPT-5 System Card milik OpenAI sendiri melaporkan tingkat kesalahan faktual model secara keseluruhan sekitar 45% lebih rendah dibandingkan GPT-4 dan 80% lebih rendah dibandingkan GPT-3, sebuah peningkatan keandalan umum yang juga terlihat secara spesifik pada penerjemahan. Pengujian MachineTranslation.com menunjukkan peningkatan paling jelas pada aspek di mana model era GPT-4 paling kesulitan: pada idiom bahasa Spanyol yang sama di mana GPT-4o-mini dan GPT-4.1-nano salah, baik GPT-5.4-mini maupun GPT-5.4 menghasilkan terjemahan idiomatis yang tepat, masing-masing menyusun kalimatnya dengan sedikit berbeda tetapi keduanya memahami idiom itu sendiri.

Kesenjangan antar-generasi bukanlah peningkatan yang stabil. Peningkatan tersebut terkonsentrasi hampir seluruhnya pada bahasa yang idiomatis dan ambigu. Pada teks yang lugas, skor model era GPT-4 dan era GPT-5 hampir identik.

GPT-3GPT-4GPT-5
Dirilis2020Maret 20232025, kini di GPT-5.4/5.5
Tersedia saat iniTidak, sudah dipensiunkanHanya API, sudah dipensiunkan dari ChatGPTYa, generasi saat ini
Penanganan idiomTidak diuji oleh MachineTranslation.com (mendahului program)    Tidak konsisten; melewatkan beberapa idiom sama sekali    Menangani dengan benar idiom yang sama yang dilewatkan oleh GPT-4
Teks bisnis standar     Tidak diuji oleh MachineTranslation.comKuat, hampir identik dengan model-model setelahnyaKuat, hampir identik dengan GPT-4

Poin terakhir ini penting: pengujian terpisah terhadap frasa bisnis standar, "please confirm receipt of this document," yang diterjemahkan ke dalam bahasa Jerman, menghasilkan output yang hampir identik di setiap model yang diuji, termasuk model GPT-4o-mini dan generasi GPT-5. Kesenjangan antargenerasi ini spesifik pada bahasa kiasan dan ambigu, bukan perbedaan kualitas secara menyeluruh.

Apakah generasi GPT yang lebih baru selalu berarti terjemahan yang lebih baik?

Tidak. Pengujian idiom Ibrani di berbagai rumpun model menunjukkan bahwa GPT-5.4-mini dan GPT-5.4 menghasilkan dua interpretasi parsial yang berbeda untuk frasa yang sama, yang mana keduanya tidak sepenuhnya benar, sementara model yang lebih lama dan tidak berhubungan justru mendekati tepat. Model yang lebih baru tidak otomatis lebih akurat, dan model yang lebih besar atau lebih baru tidak serta-merta menjadi pilihan yang lebih aman untuk kalimat tertentu.

Setiap generasi GPT rata-rata menjadi lebih baik dalam penerjemahan, dan setiap generasi GPT masih memiliki hal-hal spesifik yang salah diterjemahkan, yang terkadang justru tidak salah pada model yang lebih lama atau lebih kecil. Ini bukanlah kritik terhadap salah satu versi tertentu. Inilah alasan mengapa kami tidak membiarkan satu model pun, termasuk GPT-5, menjadi satu-satunya penentu.

Posisi GPT-5 untuk penerjemahan saat ini

GPT-3 dan GPT-4 keduanya telah dipensiunkan dari ChatGPT; GPT-4 hanya dapat diakses melalui API OpenAI untuk integrasi yang sudah ada. Generasi saat ini, GPT-5.4 dan GPT-5.5, adalah apa yang dijalankan oleh MachineTranslation.com saat ini, dan kinerjanya bersaing ketat dengan model-model terkini dari penyedia lain, meskipun tidak selalu lebih unggul di setiap pasangan bahasa. Untuk melihat lebih dekat bagaimana sub-versi GPT saat ini dibandingkan satu sama lain dan terhadap model seperti Claude dan DeepSeek, lihat pengujian head-to-head sub-versi MachineTranslation.com, yang mengulas lebih mendalam daripada sekadar tinjauan umum antargenerasi.

Apa artinya ini jika Anda melakukan lokalisasi dalam skala besar

Temuan yang paling penting bagi program lokalisasi berskala besar bukanlah "GPT-5 mengalahkan GPT-3." Melainkan bahwa versi model, bukan hanya rumpun model, menentukan apakah idiom atau frasa ambigu tertentu diterjemahkan dengan benar, dan hal ini berlaku di setiap pasangan bahasa, bukan hanya beberapa yang ditampilkan di sini. Hal ini sangat penting terutama dalam konten yang sejak awal mengandalkan nada dan bahasa kiasan, khususnya teks pemasaran dan konten buatan pengguna, di mana satu idiom yang diterjemahkan secara harfiah dapat mengubah seluruh makna dari sebuah postingan atau iklan. Program yang memindahkan konten ke puluhan bahasa akan menemui jenis bahasa seperti ini di setiap bahasa tersebut. Rangkaian pengujian sub-versi dan pengujian perbandingan model lengkap dari MachineTranslation.com membahas hal ini secara lebih mendalam. Pendekatan platform ini, yang menjalankan model GPT saat ini bersama lebih dari 20 model lainnya pada setiap penerjemahan, hadir secara khusus karena riwayat versi dari satu model saja tidak cukup menjamin keandalannya.

Pertanyaan yang sering diajukan

1. Apa perbedaan sebenarnya antara GPT-3, GPT-4, dan GPT-5 untuk penerjemahan?

GPT-3 menangani teks lugas dengan cukup baik tetapi sangat kesulitan dengan hal-hal yang bersifat idiomatik atau ambigu. GPT-4 memperkecil kesenjangan tersebut secara signifikan tetapi masih menyederhanakan beberapa frasa yang benar-benar ambigu menjadi satu makna saja alih-alih mempertahankan ambiguitasnya. Sub-versi GPT-5 yang lebih baru menangani idiom dengan benar, yang sebelumnya diterjemahkan secara harfiah dan salah oleh model-model era GPT-4 terdahulu.

2. Apakah GPT-5 selalu lebih baik daripada GPT-4 dalam penerjemahan?

Tidak. Pengujian internal MachineTranslation.com sendiri menemukan kasus di mana sub-versi yang lebih kecil dan lebih baru mengungguli sub-versi yang lebih besar dan lebih lama, dan kesenjangan kualitas antargenerasi cenderung spesifik pada bahasa idiomatik atau kiasan alih-alih peningkatan menyeluruh secara umum.

3. Apakah OpenAI masih menawarkan GPT-3 atau GPT-4?

Tidak. Keduanya telah dipensiunkan dari ChatGPT dan digantikan oleh model-model generasi GPT-5 yang lebih baru. GPT-4 tetap dapat diakses hanya melalui API OpenAI untuk integrasi yang sudah ada, bukan sebagai opsi langsung bagi konsumen saat ini.

4. Versi GPT mana yang digunakan MachineTranslation.com?

MachineTranslation.com menjalankan model generasi GPT-5 saat ini (GPT-5.4 dan GPT-5.5, tergantung pada tingkatan paket) bersama lebih dari 20 model AI lainnya di setiap penerjemahan, alih-alih hanya mengandalkan GPT saja.

5. Bagaimana perbandingan GPT-5 dengan model AI terkini lainnya untuk penerjemahan?

Model-model generasi GPT-5 berkinerja secara kompetitif tetapi tidak selalu lebih unggul secara seragam dibandingkan model-model seperti Claude, Gemini, atau DeepSeek. Model yang berbeda unggul pada pasangan bahasa dan jenis konten yang berbeda, itulah sebabnya MachineTranslation.com mengujinya secara langsung satu sama lain daripada memilih salah satu sebagai default.