September 25, 2026

Daripada GPT-3 kepada GPT-5: Bagaimana kualiti terjemahan AI sebenarnya berubah

GPT-3, GPT-4, dan GPT-5 terpisah selama lima tahun dan beberapa generasi seni bina, namun soalan yang berguna untuk terjemahan bukanlah "mana satu yang paling bijak." Ia lebih khusus: apakah perubahan ketara dalam cara model-model ini mengendalikan bahagian bahasa yang tidak diterjemahkan secara perkataan demi perkataan, seperti idiom, kekaburan, dan laras bahasa? Peningkatannya berlaku di aspek-aspek tertentu, pada peringkat tertentu, dan ia tidak berkembang dalam satu garis lurus daripada versi lama kepada yang lebih baharu.

Apa yang sebenarnya ditawarkan oleh GPT-3 untuk terjemahan

OpenAI melancarkan GPT-3 pada tahun 2020, sebelum program ujian MachineTranslation.com sendiri wujud, jadi tiada apa-apa di sini merupakan penanda aras proprietari. Ia adalah sejarah yang didokumentasikan dengan baik, bukan hasil ujian dalaman. GPT-3 merupakan model pertama seumpamanya yang mampu menghasilkan teks yang fasih dan kedengaran semula jadi seperti manusia dalam pelbagai bahasa tanpa latihan khusus untuk tugasan tersebut, menjadikannya satu pencapaian yang tulen. Khusus untuk terjemahan, kefasihan yang sama turut mencetuskan risiko sebenar: GPT-3 mampu menghasilkan ayat yang meyakinkan dan tersusun rapi dalam bahasa sasaran namun sebenarnya salah, tanpa sebarang petunjuk pada output yang menandakan berlakunya kesilapan.

Apa yang berubah apabila GPT-4 tiba

GPT-4 dilancarkan pada Mac 2023, dan ujian model MachineTranslation.com sendiri bermula sekitar generasi ini. Peningkatannya nyata tetapi tidak sekata. Semasa menguji frasa bahasa Inggeris yang kabur maknanya "That's sick" ke dalam bahasa Jepun, GPT-4.1-nano adalah satu-satunya model daripada enam yang diuji yang menyempitkan makna gandaan yang disengajakan bagi baris tersebut kepada satu tafsiran sahaja, manakala lima model yang lain mengekalkan kekaburan yang dimaksudkan oleh frasa asal. Idiom merupakan kelemahan yang lebih ketara: apabila menguji idiom bahasa Sepanyol "llevarse el gato al agua" merentasi lima versi GPT serentak, model yang lebih kecil iaitu GPT-4o-mini dan GPT-4.1-nano kedua-duanya menghasilkan terjemahan harfiah yang sama dan salah, terlepas maksud idiom tersebut sepenuhnya.

Corak yang sama turut kelihatan di tempat lain. Satu idiom bahasa Jerman, "ich verstehe nur Bahnhof," yang diuji melalui lapan sub-versi GPT dan Claude, telah diterjemahkan secara harfiah dan salah oleh GPT-4o-mini secara khusus, manakala model yang lebih kecil dan baharu dalam ujian yang sama, GPT-4.1-nano, berjaya menterjemahkannya dengan betul. Generasi dan saiz model tidak berkait secara konsisten, satu corak yang dihuraikan dengan lebih mendalam oleh ujian versi model MachineTranslation.com.

Apa yang diubah oleh GPT-5 untuk terjemahan

OpenAI memperkenalkan GPT-5 sebagai sebuah sistem bersepadu yang menghalakan antara model lalai yang pantas dan model penaakulan yang lebih mendalam bergantung pada tugas, satu perubahan struktur daripada reka bentuk model tunggal GPT-4. GPT-5 System Card milik OpenAI sendiri melaporkan bahawa kadar ralat fakta keseluruhan bagi model tersebut adalah sekitar 45% lebih rendah daripada GPT-4 dan 80% lebih rendah daripada GPT-3, satu peningkatan kebolehpercayaan umum yang turut terbukti secara khusus untuk terjemahan. Ujian MachineTranslation.com menunjukkan peningkatan yang paling ketara pada aspek di mana model era GPT-4 paling bergelut: untuk idiom bahasa Sepanyol yang sama yang gagal diterjemahkan oleh GPT-4o-mini dan GPT-4.1-nano, kedua-dua GPT-5.4-mini dan GPT-5.4 berjaya memberikan terjemahan idiomatik yang betul, masing-masing dengan ungkapan yang sedikit berbeza tetapi kedua-duanya memahami maksud idiom itu sendiri.

Jurang antara generasi ini bukanlah satu peningkatan yang sekata. Ia tertumpu hampir sepenuhnya pada bahasa beridiom dan kabur. Untuk teks yang jelas dan mudah, model era GPT-4 dan era GPT-5 mencatat skor yang hampir serupa.

GPT-3GPT-4GPT-5
Dilancarkan2020Mac 20232025, kini pada GPT-5.4/5.5
Tersedia hari iniTidak, telah ditamatkanAPI sahaja, ditamatkan daripada ChatGPTYa, generasi semasa
Pengendalian idiomTidak diuji oleh MachineTranslation.com (mendahului program)    Tidak konsisten; terlepas beberapa idiom sama sekali    Mengendalikan dengan betul idiom sama yang terlepas oleh GPT-4
Teks perniagaan standard     Tidak diuji oleh MachineTranslation.comKukuh, hampir serupa dengan model terkemudianKukuh, hampir serupa dengan GPT-4

Perkara terakhir itu penting: satu ujian berasingan bagi frasa perniagaan standard, "please confirm receipt of this document," yang diterjemahkan ke dalam bahasa Jerman, memberikan output yang hampir serupa merentas setiap model yang diuji, termasuk GPT-4o-mini dan model generasi GPT-5. Jurang generasi adalah khusus kepada bahasa kiasan dan samar-samar, bukannya perbezaan kualiti secara menyeluruh.

Adakah generasi GPT yang lebih baharu sentiasa bermakna terjemahan yang lebih baik?

Tidak. Menguji simpulan bahasa Ibrani merentasi keluarga model, GPT-5.4-mini dan GPT-5.4 menghasilkan dua tafsiran berbeza dan separa bagi frasa yang sama, yang mana kedua-duanya tidak betul sepenuhnya, manakala model yang lebih lama dan tidak berkaitan memberikan hasil yang lebih dekat. Model yang lebih baharu tidak semestinya lebih tepat secara automatik, dan model yang lebih besar atau lebih terkini bukanlah pilihan yang lebih selamat secara automatik untuk sesuatu ayat tertentu.

Setiap generasi GPT secara purata menjadi semakin baik dalam penterjemahan, dan setiap generasi GPT masih mempunyai perkara khusus yang silap dilakukannya sedangkan model yang lebih lama atau lebih kecil kadangkala tidak melakukannya. Ini bukanlah kritikan terhadap mana-mana satu versi. Ini adalah sebab mengapa kami tidak membiarkan mana-mana satu model, termasuk GPT-5, menjadi satu-satunya undian.

Kedudukan GPT-5 untuk penterjemahan hari ini

GPT-3 dan GPT-4 kedua-duanya telah dibersarakan daripada ChatGPT; GPT-4 kekal boleh diakses hanya melalui API OpenAI untuk penyepaduan sedia ada. Generasi semasa, GPT-5.4 dan GPT-5.5, adalah apa yang dijalankan oleh MachineTranslation.com hari ini, dan ia berprestasi secara kompetitif berbanding model semasa daripada penyedia lain, walaupun tidak lebih baik secara seragam pada setiap pasangan bahasa. Untuk melihat dengan lebih dekat bagaimana sub-versi GPT semasa dibandingkan antara satu sama lain dan berbanding model seperti Claude dan DeepSeek, lihat ujian sub-versi bersemuka MachineTranslation.com, yang meneliti lebih mendalam daripada apa yang boleh diberikan oleh gambaran keseluruhan generasi.

Maksud perkara ini jika anda melakukan penyetempatan secara besar-besaran

Penemuan yang paling penting untuk program penyetempatan berskala besar bukanlah "GPT-5 mengalahkan GPT-3." Tetapi versi model, bukan sekadar keluarga model, menentukan sama ada simpulan bahasa atau frasa samar tertentu diterjemahkan dengan betul, dan ini terpakai merentasi setiap pasangan bahasa, bukan sekadar beberapa pasangan yang ditunjukkan di sini. Perkara ini paling penting dalam kandungan yang sememangnya bergantung pada nada dan bahasa kiasan, terutamanya teks pemasaran dan kandungan jana pengguna, di mana satu simpulan bahasa yang diterjemahkan secara harfiah boleh mengubah seluruh maksud sesuatu hantaran atau iklan. Program yang memindahkan kandungan ke dalam puluhan bahasa akan berdepan dengan bahasa jenis ini dalam setiap satu daripadanya. Siri ujian sub-versi dan ujian perbandingan model penuh MachineTranslation.com merangkumi perkara ini dengan lebih mendalam. Pendekatan platform ini, yang menjalankan model GPT semasa bersama lebih daripada 20 model lain pada setiap terjemahan, wujud secara khusus kerana sejarah versi mana-mana model tunggal bukanlah jaminan yang cukup boleh dipercayai secara bersendirian.

Soalan lazim

1. Apakah perbezaan sebenar antara GPT-3, GPT-4, dan GPT-5 untuk penterjemahan?

GPT-3 mengendalikan teks mudah dengan cukup baik tetapi amat bergelut dengan apa-apa yang berbentuk simpulan bahasa atau samar-samar. GPT-4 merapatkan jurang tersebut dengan ketara tetapi masih mengecilkan beberapa frasa yang benar-benar samar kepada satu makna dan bukannya mengekalkan kesamaran tersebut. Sub-versi GPT-5 yang terbaharu mengendalikan simpulan bahasa dengan betul yang sebelum ini diterjemahkan secara harfiah dan salah oleh model era GPT-4 terdahulu.

2. Adakah GPT-5 sentiasa lebih baik daripada GPT-4 dalam penterjemahan?

Tidak. Ujian MachineTranslation.com sendiri mendapati terdapat kes di mana sub-versi yang lebih kecil dan lebih baharu mengatasi prestasi sub-versi yang lebih besar dan lebih lama, dan jurang kualiti antara generasi cenderung khusus kepada bahasa simpulan bahasa atau kiasan dan bukannya peningkatan menyeluruh secara am.

3. Adakah OpenAI masih menawarkan GPT-3 atau GPT-4?

Tidak. Kedua-duanya telah dibersarakan daripada ChatGPT dan digantikan oleh model generasi GPT-5 yang lebih baharu. GPT-4 kekal boleh diakses hanya melalui API OpenAI untuk penyepaduan sedia ada, bukan sebagai pilihan semasa yang ditujukan kepada pengguna.

4. Versi GPT yang manakah digunakan oleh MachineTranslation.com?

MachineTranslation.com menjalankan model generasi GPT-5 semasa (GPT-5.4 dan GPT-5.5, bergantung pada peringkat pelan) bersama lebih daripada 20 model AI lain pada setiap terjemahan, dan bukannya bergantung pada GPT sahaja.

5. Bagaimanakah perbandingan GPT-5 dengan model AI semasa yang lain untuk terjemahan?

Model generasi GPT-5 berprestasi secara kompetitif tetapi tidak lebih baik secara seragam berbanding model seperti Claude, Gemini, atau DeepSeek. Model yang berbeza mengungguli pasangan bahasa dan jenis kandungan yang berbeza, itulah sebabnya MachineTranslation.com mengujinya secara langsung antara satu sama lain dan bukannya memilih satu sebagai pilihan lalai.