July 10, 2026
Dua perkataan. Enam model. Tiga keputusan terjemahan yang berbeza. Inilah apa yang terjadi ketika saya menjalankan 8 kalimat uji melalui model AI terbaru yang tersedia di MachineTranslation.com, dan apa yang sebenarnya diungkapkan oleh output tentang kapan model gagal diam-diam.
Dua kata. Itu gila. Enam model. Tiga keputusan terjemahan yang berbeza.
Dalam bahasa Jepun, satu model menjadikannya sebagai それはやばい, mengekalkan kekaburan. Seorang lagi menghilangkan kata ganti subjek sepenuhnya dan menulis bentuk telanjang やばい, versi paling percakapan yang mungkin. Seorang ketiga menulis それはすごい, yang menyelesaikan kekaburan sepenuhnya memihak kepada "menakjubkan," menghilangkan makna ganda yang menjadikan frasa itu menarik pada mulanya. Dalam bahasa Vietnam, satu model menulis Đỉnh vậy (slang, betul untuk daftar belia). Seorang lagi menulis Thật tuyệt vời, secara tatabahasa betul, tetapi lebih dekat kepada mengatakan "itu benar-benar menakjubkan" apabila seseorang menghantar anda meme.
Semua ini boleh dipertahankan. Tiada satu pun daripada mereka adalah perkara yang sama. Dan jika anda menjalankan terjemahan melalui satu model sahaja, anda tidak akan pernah melihat pilihan yang dibuat bagi pihak anda.
Itulah soalan utama yang artikel ini cuba jawab. Bukan model AI mana yang terbaik untuk terjemahan pada 2026 (jawapannya bergantung pada pasangan bahasa, daftar, domain, dan struktur ayat), tetapi sebaliknya: bagaimana anda tahu apabila model anda membuat keputusan yang salah? Terutama dalam domain seperti terminologi perubatan, kontrak undang-undang, atau formaliti profesional, di mana keputusan yang salah kelihatan sama seperti terjemahan yang betul sehingga seorang pakar membacanya.
Inilah yang saya lakukan. Saya menjalankan 8 ayat ujian melalui dua pusingan model di MachineTranslation.com: pertama garis dasar 5 model yang digunakan secara meluas, kemudian kumpulan yang diperluas yang menambah beberapa varian model peringkat premium terbaru yang kini tersedia untuk pengguna berbayar. Biasanya, membandingkan output dari model seperti ini akan memerlukan langganan berbayar terpisah dengan setiap penyedia secara individual. Di MachineTranslation.com, mereka duduk dalam pandangan perbandingan yang sama. Pasangan bahasa adalah English→Japanese dan English→Vietnamese. Kategori ayat dipilih secara khusus untuk menguji tekanan kawasan di mana ketidaksetujuan model paling berkesan: frasa idiomatik, terminologi undang-undang, terminologi perubatan, konteks sensitif formaliti, dan kekaburan semantik yang disengajakan.
Nota mengenai metodologi penilaian: penyelidikan terjemahan mesin telah lama bergelut dengan cara untuk menjaringkan keluaran secara automatik. Metrik seperti BLEU dan COMET seperti yang diukur dalam tugas bersama WMT memberikan isyarat agregat yang berguna, tetapi mereka lemah dalam mengesan ralat daftar, kegagalan idiom, dan ketepatan terminologi, iaitu kategori yang paling penting di sini. Apa yang akan anda baca adalah analisis output, bukan perlumbaan BLEU.

Bukan setiap ayat menampilkan perselisihan yang bermakna. Dua daripada lapan ujian, "Mari kita hubungi semula setelah situasi ini reda mengenai perjanjian ini" (→ Jepun) dan "Kami bekerja siang malam untuk memenuhi tarikh pelancaran ini" (→ Vietnam), menghasilkan persetujuan yang tinggi merentas kedua-dua pusingan. Idiom-idiom tersebut dipahami dengan betul sebagai idiom. Tiada siapa yang menerjemahkan "touch base" sebagai menyentuh pangkalan fizikal. Tiada siapa yang menterjemahkan "the dust settles" sebagai sedimen yang jatuh.
Ini patut dihentikan sebentar: bahasa perniagaan idiomatik Inggeris ditangani dengan cukup baik oleh model sempadan semasa apabila idiom itu cukup biasa. Konsensus untuk "touch base" tetap stabil di kedua-dua pusingan; variasi adalah semata-mata gaya, mengenai sama ada untuk menggunakan この件 (perkara ini), この取引 (urus niaga ini), atau この案件 (kes ini) untuk frasa sumber.

Ujian "membakar minyak tengah malam" adalah di mana perkara menjadi lebih menarik. Setiap model kecuali satu memahami idiom dengan betul. MiniMax M2.7, yang diperkenalkan dalam Pusingan 2, menterjemahkan "burning" secara literal, menghasilkan đốt đuốc, bermakna "membakar obor." Konsensus dengan betul mengecualikannya.

Bahasa Jepun adalah bahasa berlapis formaliti. Pilihan akhiran kata kerja, kata ganti nama, dan bentuk kata nama rujukan bukanlah gaya bahasa. Ia menandakan hubungan antara penutur dan penerima. Menghantar mesej kepada CEO anda menggunakan bentuk kata kerja kasual bukanlah ralat terjemahan dalam erti kata tatabahasa. Ini adalah satu kesilapan sosial, dan satu yang ketara.
Ayat ujian: Boleh anda hantar itu? Terima kasih, saya menghargainya." Konteks: menghantar mesej kepada Ketua Pegawai Eksekutif.

Konsensus berubah apabila kumpulan model berkembang. Mekanisme ini mudah dipahami: menambah model yang membaca konteks formaliti dengan betul mengalihkan majoriti, dan konsensus diikuti. Berikut adalah spektrum lengkap dari apa yang dihasilkan model dalam Putaran 2:

Ujian daftar Vietnam menampilkan sejenis ralat formaliti yang berbeza, satu yang lebih halus. Ayat sumber: "Hei, soalan cepat — adakah anda bebas untuk berbual melalui panggilan?" Konteks: menghantar mesej kepada pelanggan. Qwen dalam Putaran 1 menyertakan "mình," sebuah kata ganti nama diri orang pertama yang membayangkan persahabatan setara rakan sebaya yang santai. Setiap model lain mengelakkan rujukan diri orang pertama sepenuhnya, yang merupakan pilihan profesional yang lebih selamat. Penting sekali, Qwen membetulkan ini dalam Putaran 2 dan menghilangkan "mình." Konsensus dalam kedua-dua pusingan mengecualikannya.

Ayat indemnifikasi vendor/klien adalah klausa standard dalam perjanjian komersial: "Penjual hendaklah memberi indemniti kepada klien terhadap sebarang tuntutan pihak ketiga yang timbul daripada pelanggaran perjanjian ini."
Dalam Pusingan 1, kesemua lima model betul mengenal pasti daftar undang-undang dan menggunakan kata pinjaman ベンダー (pembekal) dan クライアント (pelanggan), yang standard dalam kontrak komersial Jepun berasal daripada bahasa Inggeris. Satu pengecualian: GPT-4.1-NANO menggunakan 販売者 (penjual) dan 顧客 (pelanggan), kata-kata Jepun yang sah yang kekurangan kekhususan undang-undang formal bagi setara pinjaman bahasa.
Penemuan yang lebih penting muncul dalam Pusingan 2. Perbezaan utama adalah antara dua perkataan:
Ini adalah konsep yang berbeza secara sah. "Indemnify" secara khusus bermaksud melindungi satu pihak daripada liabiliti pihak ketiga. 免責 adalah istilah undang-undang yang betul. Semua model Pusingan 1 menggunakan 補償. Dalam Pusingan 2, DeepSeek V4-Pro adalah satu-satunya model yang menghasilkan 免責, dan ia melakukannya dalam Pusingan 2 sahaja, bukan Pusingan 1.

Dalam kontrak, 補償 dan 免責 bukanlah sinonim. Satu bermakna "kami akan membayar balik kepada anda." Yang lain bermakna "anda dilindungi daripada tuntutan sejak awal." Jika platform terjemahan menggunakan 補償 di mana 免責 adalah yang betul, seorang peguam yang membaca versi Jepun tidak akan melihat perjanjian yang sama yang diterangkan oleh versi Inggeris.
Ini adalah penemuan yang paling penting dalam set data. Ayat ujian: "Ubat ini dikontraindikasikan pada pesakit dengan sejarah gangguan hepatik." Sumber: dokumentasi produk klinikal. Sasaran: Vietnamese.
Istilah kritikal ialah "gangguan hepatik." Terdapat dua calon Vietnam:
Ini adalah klinik yang berbeza. Amaran kontraindikasi berdasarkan "gangguan fungsi hati" terpakai kepada sesiapa sahaja yang mengalami penurunan fungsi hati, bukan hanya mereka yang mengalami kegagalan organ lengkap. Menggunakan suy gan mempersempit populasi yang ditunjukkan secara tidak tepat. Seorang pesakit dengan gangguan hati sederhana yang membaca suy gan mungkin tidak mengenali diri mereka sebagai populasi yang dikontradikasikan.

Beberapa ayat sumber dirancang dengan sengaja untuk menjadi kabur. "Itu sakit" dalam slang Bahasa Inggeris kontemporari bermakna sesuatu yang cemerlang, tetapi ia juga masih membawa makna literal (iaitu yang menjijikkan/menjengkelkan), dan ketegangan antara kedua-dua makna tersebut adalah sebahagian daripada cara frasa itu berkomunikasi. Cabaran bagi model terjemahan ialah: adakah anda mengekalkan kekaburan, meruntuhhkannya kepada makna yang paling mungkin, atau memilih satu dan berkomitmen?


Model dalam ujian ini tidak semuanya setara. Mereka merangkumi seni bina yang berbeza, rejim latihan yang berbeza, dan konteks penempatan yang berbeza. Baseline Pusingan 1 merangkumi model yang mudah diakses secara meluas. Kolam yang diperluas Round 2 menambahkan beberapa varian model peringkat premium terbaru yang kini tersedia untuk pengguna berbayar di MachineTranslation.com, tingkatan model yang sama yang sebaliknya akan berarti akun berbayar terpisah dengan setiap penyedia individual.

Kolam yang diperluas di Round 2 mencakup model yang lebih canggih dan tersedia untuk pengguna berbayar di MachineTranslation.com. Kesan perluasan kumpulan itu tidak seragam. Dalam beberapa ujian (formaliti/Jepun), ia telah mengubah konsensus dengan bermakna. Dalam yang lain (terminologi perubatan/Vietnam), perpecahan semakin mendalam.

Data ujian menunjukkan kepada dua kategori kegagalan yang berbeza, dan mereka memerlukan respons yang berbeza.
Kategori A: Kegagalan senyap. Ralat formaliti, ralat daftar, ketepatan terminologi perubatan: ini menghasilkan keluaran yang kelihatan betul. Bahasa Jepun itu tata bahasanya betul. Orang Vietnam itu fasih. Tiada isyarat permukaan yang menunjukkan sesuatu telah berlaku salah. Pengguna monolingua yang membaca output satu model tidak mempunyai cara untuk mengetahui bahawa model membuat pilihan register yang akan diperhatikan oleh seorang eksekutif Jepun kanan, atau bahawa istilah klinikal telah dikecilkan dengan cara yang mengubah populasi yang ia gunakan.
Kategori B: Kegagalan yang ketara. MiniMax menerjemahkan "burning the midnight oil" sebagai "burning torches." GPT-4.1-NANO menyelesaikan "That's sick" kepada "すごい" yang tidak berambiguiti. Ini boleh dikesan, sama ada oleh penutur bahasa sasaran atau melalui perbandingan dengan output model lain.
Perbandingan berbilang model yang disediakan SMART paling berharga dalam Kategori A. Apabila lima atau sepuluh model menghasilkan output dan kebanyakannya bersetuju dengan daftar formal sementara satu menghasilkan bahasa Jepun bentuk biasa santai, ketidaksetujuan itu dapat dilihat dalam paparan perbandingan. Seorang pengguna yang berbicara dalam bahasa sasaran dapat menilai pilihan-pilihan tersebut. Pengguna yang tidak dapat melihat bahawa keputusan yang dipertikaikan telah dibuat, dan memutuskan sama ada ayat tersebut memerlukan semakan manusia.
Untuk kerja skala dokumen, fail besar, terjemahan yang mengekalkan susun atur PDF, kontrak, atau bahan klinikal, keupayaan pemprosesan dokumen platform mengendalikan struktur fail tanpa memecahkan pemformatan. Tetapi soalan-soalan kualiti yang dibangkitkan di atas terpakai tanpa mengira saiz fail. Kajian klinikal 100 halaman di mana setiap contoh "hepatic impairment" diterjemahkan sebagai "liver failure" adalah versi yang lebih besar daripada masalah yang sama yang dikenal pasti dalam Ujian 2.
Untuk kategori perubatan dan undang-undang khususnya, pengesahan manusia adalah backstop yang betul. Perkhidmatan Post-Editing AI Tomedes, yang menggabungkan output AI dengan semakan manusia yang disahkan untuk jenis kandungan berisiko tinggi ini, dibina untuk ini. Suy gan / suy giảm chức năng gan adalah jenis penemuan yang seharusnya mencetuskan semakan itu, bukan kerana semua model salah, tetapi kerana model yang paling yakin bukanlah yang paling tepat.
Nilai melihat pelbagai keluaran bukanlah bahawa anda akan sentiasa memilih majoriti. Iaitu anda akan tahu bahawa satu pilihan telah dibuat, yang berbeza daripada mengandaikan bahawa output di hadapan anda adalah betul.

Letakkan lapan ujian berdampingan dan satu corak bertahan: persetujuan dan ketidaksetujuan tidak tersebar secara rawak. Bahasa idiomatik dan perniagaan sehari-hari ("touch base," "burning the midnight oil") menumpu di hampir setiap model dalam kumpulan itu, dalam kedua-dua pusingan. Formaliti, ketepatan undang-undang, dan terminologi perubatan tidak. Ujian formaliti CEO bertukar daripada santai kepada formal hanya apabila kumpulan yang diperluas disertakan. Klausa indemnifikasi telah menampilkan perbedaan undang-undang yang nyata (pengecualian liabilitas vs. pampasan) yang hanya satu model, dalam satu putaran, yang mendapatkannya dengan betul. Istilah perubatan tidak pernah diselesaikan sama sekali, kekal pada nisbah kira-kira 6 kepada 4 merentas kedua-dua pusingan tanpa mengira model mana yang berada dalam kumpulan.
Itu adalah penemuan sebenarnya, bukan tuntutan pemasaran: konsensus tidak membuat setiap ayat lebih baik, dan ia tidak perlu. Ia paling berharga tepat di mana kelancaran model tunggal tidak memberikan anda sebarang alasan untuk meragui, dan di mana menjadi salah sebenarnya memerlukan kos sesuatu.
Ada lapisan kedua yang lebih praktikal untuk ujian ini yang patut dinyatakan dengan jelas. Menjalankan perbandingan ini sendiri bermakna memeriksa output daripada GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, dan MiniMax M2.7 secara berdampingan dengan model asas yang sedia ada, di satu tempat, pada satu platform. Di luar MachineTranslation.com, itu bukan satu langganan. Ia adalah beberapa, satu untuk setiap penyedia yang peringkat premium anda ingin uji, pada apa pun yang setiap penyedia kenakan secara individu. Pengguna berbayar di sini mendapatkan perbandingan yang sama dalam satu klik, dengan sebahagian kecil daripada kos mengekalkan lima langganan premium berasingan, tanpa mengorbankan perkara yang benar-benar penting: melihat di mana model-model bersetuju, dan mengetahui dengan tepat apabila mereka tidak.
Tidak ada yang secara kategoris lebih baik; ia bergantung pada kategori ujian. Claude Sonnet dan Claude Opus secara konsisten memilih istilah medis Vietnam yang lebih tepat, dan Claude Opus menghasilkan slang yang paling sesuai untuk "That's sick." Tetapi Claude Sonnet juga menghasilkan bahasa Jepun kasual dalam ayat konteks CEO formal, di mana GPT-5.5 mendapatkannya dengan betul. Membandingkan output secara langsung lebih dapat dipertahankan daripada memilih satu model dan mempercayainya.
Tidak ada satu pun; ketepatan bergantung pada domain. Gemini 3.5-Flash dan GLM-5-Turbo menghasilkan bahasa Jepun formal yang paling sesuai dalam ujian ini. Kedua-dua model Claude paling tepat dalam terminologi perubatan Vietnam. DeepSeek V4-Pro adalah satu-satunya model yang menggunakan istilah undang-undang Jepun yang betul, tetapi hanya dalam Pusingan 2, dan ia menghasilkan bahasa Jepun santai di tempat lain. Tiada satu model pun mendominasi merentas semua lapan ujian.
Tidak, bukan secara automatik. Perluasan kumpulan dengan varian model peringkat premium yang lebih baru telah mengalihkan konsensus daripada kasual kepada formal dalam ujian formaliti Jepun. Tetapi dalam ujian terminologi perubatan Vietnam, perpecahan itu berterusan pada kadar kira-kira 6 berbanding 4 tanpa mengira model mana yang disertakan. Lebih banyak model menghasilkan lebih banyak ketidaksetujuan, yang merupakan sinyal berguna, tetapi konsensus masih mengikuti mayoritas, dan mayoritas tidak selalu merupakan jawaban yang paling tepat.
SMART adalah sistem konsensus multi-model MachineTranslation.com, yang merangkumi sehingga 22 model AI merentasi penyedia termasuk OpenAI, Anthropic, Google, dan DeepSeek. Ia menjalankan terjemahan melalui berbagai model sekaligus dan menampilkan keluaran konsensus mayoritas bersama jawaban setiap model individu, secara default, tanpa konfigurasi yang diperlukan. Konsensus berubah apabila kumpulan model berubah, seperti yang ditunjukkan dalam hasil formaliti Jepun ujian ini: konsensus kasual dalam Pusingan 1 menjadi formal dalam Pusingan 2.
Tiada model tunggal; semakan manusia adalah jawapan yang lebih baik. Model-model Claude secara konsisten memilih istilah perubatan Vietnam yang lebih tepat, dan hanya DeepSeek V4-Pro menggunakan istilah undang-undang Jepun yang betul, tetapi hanya dalam Pusingan 2. Terminologi perubatan yang terbahagi tidak pernah diselesaikan merentasi 10 model, yang menunjukkan bahawa kepakaran domain diperlukan, bukan memilih model yang berbeza. A semakan pasca-penyuntingan manusia yang disahkan, seperti yang ditawarkan oleh Tomedes, memberikan pemeriksaan pakar tersebut.