July 10, 2026
Dua kata. Enam model. Tiga keputusan penerjemahan yang berbeda. Inilah apa yang terjadi ketika saya menjalankan 8 kalimat uji melalui model AI terbaru yang tersedia di MachineTranslation.com, dan apa yang sebenarnya diungkapkan oleh output tentang kapan model gagal secara diam-diam.
Dua kata. "Itu keren." Enam model. Tiga keputusan penerjemahan yang berbeda.
Dalam bahasa Jepang, satu model merender sesuai dengan それはやばい, mempertahankan ambiguitas. Seorang lainnya menghilangkan subjek pronoun sepenuhnya dan menulis bentuk telanjang やばい, versi paling kolokial yang mungkin. Seorang ketiga menulis それはすごい, yang menyelesaikan ambiguitas sepenuhnya mendukung "menakjubkan," menghilangkan makna ganda yang membuat frasa tersebut menarik pada awalnya. Dalam bahasa Vietnam, satu model menulis Đỉnh vậy (slang, benar untuk register pemuda). Seorang lainnya menulis Thật tuyệt vời, secara gramatikal benar, tetapi lebih dekat dengan mengatakan "itu benar-benar menakjubkan" ketika seseorang mengirimkan meme kepada Anda.
Semua ini dapat dipertahankan. Tidak ada satupun yang sama. Dan jika Anda menjalankan terjemahan melalui model tunggal, Anda tidak akan pernah melihat pilihan yang dibuat atas nama Anda.
Itulah pertanyaan utama yang coba dijawab oleh artikel ini. Bukan model AI mana yang terbaik untuk penerjemahan pada tahun 2026 (jawabannya tergantung pada pasangan bahasa, register, domain, dan struktur kalimat), melainkan: bagaimana Anda tahu ketika model Anda membuat keputusan yang salah? Terutama dalam domain seperti terminologi medis, kontrak hukum, atau formalitas profesional, di mana keputusan yang salah terlihat persis seperti penerjemahan yang benar sampai seorang spesialis membacanya.
Inilah yang saya lakukan. Saya menjalankan 8 kalimat uji melalui dua putaran model di MachineTranslation.com: pertama baseline dari 5 model yang banyak digunakan, kemudian kumpulan yang diperluas yang menambahkan beberapa varian model tier premium terbaru yang sekarang tersedia untuk pengguna berbayar. Biasanya, membandingkan output dari model seperti ini berarti berlangganan berbayar terpisah dengan setiap penyedia secara individual. Di MachineTranslation.com, mereka duduk dalam tampilan perbandingan yang sama. Pasangan bahasa adalah English→Japanese dan English→Vietnamese. Kategori kalimat dipilih secara khusus untuk menguji area di mana ketidaksepakatan model paling berpengaruh: frasa idiomatik, terminologi hukum, terminologi medis, konteks sensitif formalitas, dan ambiguitas semantik yang disengaja.
Catatan tentang metodologi evaluasi: penelitian terjemahan mesin telah lama bergulat dengan cara menilai keluaran secara otomatis. Metrik seperti BLEU dan COMET sebagaimana diukur dalam tugas bersama WMT memberikan sinyal agregat yang berguna, tetapi mereka buruk dalam mendeteksi kesalahan register, kegagalan idiom, dan presisi terminologi, tepatnya kategori yang paling penting di sini. Apa yang akan Anda baca adalah analisis output, bukan perlombaan BLEU.

Tidak setiap kalimat menampilkan ketidaksetujuan yang bermakna. Dua dari delapan tes, "Let's touch base once the dust settles on this deal" (→ Jepang) dan "We're burning the midnight oil to hit this launch date" (→ Vietnam), menghasilkan persetujuan tinggi di kedua putaran. Idiom-idiom tersebut dipahami dengan benar sebagai idiom. Tidak ada yang menerjemahkan "touch base" sebagai menyentuh sebuah base fisik. Tidak ada yang menerjemahkan "the dust settles" sebagai sedimen yang jatuh.
Ini layak untuk dihentikan sejenak: bahasa bisnis idiomatis Inggris ditangani dengan cukup baik oleh model frontier saat ini ketika idiom cukup umum. Konsensus untuk "touch base" tetap stabil di kedua putaran; variasi murni bersifat stilistik, seputar apakah menggunakan この件 (masalah ini), この取引 (kesepakatan ini), atau この案件 (kasus ini) untuk frasa sumber.

Tes "membakar minyak tengah malam" adalah di mana hal-hal menjadi lebih menarik. Setiap model kecuali satu memahami idiom dengan benar. MiniMax M2.7, yang diperkenalkan di Babak 2, menerjemahkan "burning" secara literal, menghasilkan đốt đuốc, yang berarti "membakar obor." Konsensus dengan benar mengecualikannya.

Bahasa Jepang adalah bahasa berlapis formalitas. Pilihan akhiran kata kerja, kata ganti, dan bentuk nomina referensial bukan merupakan pilihan gaya. Ini menunjukkan hubungan antara pembicara dan penerima. Mengirim pesan kepada CEO Anda menggunakan bentuk kata kerja yang kasual bukanlah kesalahan terjemahan dalam arti gramatikal. Ini adalah kesalahan sosial, dan kesalahan yang signifikan.
Kalimat uji: Bisakah kamu mengirimnya? Terima kasih, saya menghargainya." Konteks: mengirim pesan kepada seorang CEO.

Konsensus bergeser ketika kumpulan model diperluas. Mekanismenya sederhana: menambahkan model yang dengan benar membaca konteks formalitas menggeser mayoritas, dan konsensus mengikuti. Berikut adalah spektrum lengkap dari apa yang dihasilkan model dalam Putaran 2:

Tes register Vietnam mengungkapkan jenis kesalahan formalitas yang berbeda, satu yang lebih halus. Kalimat sumber: Hei, pertanyaan cepat — apakah kamu bebas untuk melakukan panggilan? Konteks: mengirim pesan kepada klien. Qwen dalam Putaran 1 menyertakan "mình," sebuah kata ganti orang pertama yang menyiratkan persahabatan tingkat rekan sebaya yang santai. Setiap model lainnya menghindari referensi diri orang pertama sepenuhnya, yang merupakan pilihan profesional yang lebih aman. Sangat penting, Qwen memperbaiki ini di Putaran 2 dan menghapus "mình." Konsensus di kedua putaran mengecualikannya.

Kalimat indemnitasi vendor/klien adalah klausul standar dalam perjanjian komersial: "Penjual harus mengganti rugi klien terhadap setiap klaim pihak ketiga yang timbul dari pelanggaran perjanjian ini."
Pada Putaran 1, kelima model dengan benar mengidentifikasi register hukum dan menggunakan kata pinjaman ベンダー (vendor) dan クライアント (klien), yang standar dalam kontrak komersial Jepang berasal dari bahasa Inggris. Satu pengecualian: GPT-4.1-NANO menggunakan 販売者 (penjual) dan 顧客 (pelanggan), kata-kata Jepang yang sah namun kurang memiliki spesifisitas hukum formal dari padanan istilah pinjaman yang setara.
Temuan yang lebih penting muncul di Putaran 2. Perbedaan utama adalah antara dua kata:
Ini adalah konsep yang berbeda secara hukum. "Indemnify" secara khusus berarti melindungi suatu pihak dari tanggung jawab pihak ketiga. 免責 adalah istilah hukum yang benar. Semua model Putaran 1 menggunakan 補償. Pada Putaran 2, DeepSeek V4-Pro adalah satu-satunya model yang menghasilkan 免責, dan model ini melakukannya hanya pada Putaran 2, bukan Putaran 1.

Dalam kontrak, 補償 dan 免責 bukanlah sinonim. Satu berarti "kami akan mengganti biaya Anda." Yang lain berarti "Anda dilindungi dari klaim sejak awal." Jika platform terjemahan menggunakan 補償 di mana 免責 adalah yang benar, seorang pengacara yang membaca versi Jepang tidak akan melihat perjanjian yang sama seperti yang dijelaskan dalam versi Inggris.
Ini adalah temuan paling penting dalam dataset. Kalimat uji: "Obat ini dikontraindikasikan pada pasien dengan riwayat gangguan fungsi hati." **Sumber: dokumentasi produk klinis.** Target: Bahasa Vietnam.
Istilah kritis adalah "gangguan hati." Ada dua kandidat Vietnam:
Ini secara klinis berbeda. Peringatan kontraindikasi berdasarkan "gangguan hepatik" berlaku untuk siapa saja dengan fungsi hati yang berkurang, bukan hanya mereka yang mengalami kegagalan organ lengkap. Menggunakan suy gan mempersempit populasi yang ditunjukkan secara tidak benar. Seorang pasien dengan gangguan hati sedang yang membaca suy gan mungkin tidak mengenali diri mereka sebagai populasi yang dikontraindikasikan.

Beberapa kalimat sumber dirancang untuk ambigu. "That's sick" dalam slang bahasa Inggris kontemporer berarti sesuatu yang luar biasa, tetapi juga masih mempertahankan makna literalnya (yaitu menjijikkan/menjengkelkan), dan ketegangan antara kedua makna tersebut adalah bagian dari cara frasa ini berkomunikasi. Tantangan bagi model terjemahan adalah: apakah Anda mempertahankan ambiguitas, meruntuhkannya menjadi makna yang paling mungkin, atau memilih satu dan berkomitmen?


Model-model dalam tes ini tidak semuanya setara. Mereka mencakup arsitektur yang berbeda, rezim pelatihan, dan konteks penerapan yang berbeda. Baseline Putaran 1 mencakup model yang dapat diakses secara luas. Pool Round 2 yang diperluas menambahkan beberapa varian model tingkat premium terbaru yang sekarang tersedia untuk pengguna berbayar di MachineTranslation.com, tingkat model yang sama yang sebaliknya berarti akun berbayar terpisah dengan setiap penyedia individual.

Pool yang diperluas di Round 2 mencakup model yang lebih canggih dan tersedia untuk pengguna berbayar di MachineTranslation.com. Efek dari perluasan pool tidak merata. Dalam beberapa tes (formalitas/Jepang), hal itu menggeser konsensus secara bermakna. Pada yang lain (terminologi medis/Vietnam), perpecahan semakin dalam.

Data uji menunjukkan dua kategori kegagalan yang berbeda, dan mereka memerlukan respons yang berbeda.
Kategori A: Kegagalan senyap. Kesalahan formalitas, kesalahan register, presisi terminologi medis: ini menghasilkan keluaran yang terlihat benar. Bahasa Jepang itu tata bahasanya benar. Orang Vietnam itu fasih berbahasa. Tidak ada sinyal permukaan yang menunjukkan ada yang salah. Seorang pengguna monolingua yang membaca keluaran satu model tidak memiliki cara untuk mengetahui bahwa model membuat pilihan register yang akan diperhatikan oleh seorang eksekutif Jepang senior, atau bahwa istilah klinis dipersempit dengan cara yang mengubah populasi yang berlaku untuk itu.
Kategori B: Kegagalan yang terlihat. MiniMax menerjemahkan "burning the midnight oil" sebagai "burning torches." GPT-4.1-NANO menyelesaikan "That's sick" ke "すごい" yang tidak ambigu. Ini dapat dideteksi, baik oleh penutur bahasa target maupun melalui perbandingan dengan keluaran model lain.
Perbandingan multi-model yang disediakan SMART paling berharga dalam Kategori A. Ketika lima atau sepuluh model menghasilkan keluaran dan sebagian besar setuju pada register formal sementara satu menghasilkan bahasa Jepang bentuk polos kasual, ketidaksetujuan tersebut terlihat dalam tampilan perbandingan. Seorang pengguna yang berbicara dalam bahasa target dapat mengevaluasi opsi-opsi tersebut. Seorang pengguna yang tidak dapat melihat bahwa keputusan yang diperdebatkan telah dibuat, dan memutuskan apakah kalimat tersebut memerlukan tinjauan manusia.
Untuk pekerjaan skala dokumen, file besar, terjemahan yang mempertahankan tata letak PDF, kontrak, atau materi klinis, kemampuan pemrosesan dokumen platform menangani struktur file tanpa merusak pemformatan. Namun pertanyaan kualitas yang diangkat di atas berlaku terlepas dari ukuran file. Sebuah studi klinis 100 halaman di mana setiap instansi "gangguan fungsi hati" diterjemahkan sebagai "kegagalan hati" adalah versi yang lebih besar dari masalah yang sama yang diidentifikasi dalam Tes 2.
Untuk kategori medis dan hukum secara khusus, verifikasi manusia adalah backstop yang benar. Layanan Post-Editing AI Tomedes, yang menggabungkan output AI dengan tinjauan manusia bersertifikat untuk jenis konten berisiko tinggi seperti ini, dibangun untuk ini. Gangguan fungsi hati / penurunan fungsi hati adalah temuan yang tepat untuk memicu tinjauan tersebut, bukan karena semua model salah, tetapi karena model yang paling percaya diri tidak selalu yang paling presisi.
Nilai dari melihat berbagai output bukan bahwa Anda akan selalu memilih mayoritas. Itu berarti Anda akan tahu bahwa sebuah pilihan telah dibuat, yang berbeda dari menganggap bahwa output di depan Anda benar.

Letakkan delapan tes berdampingan dan pola tetap berlaku: persetujuan dan ketidaksetujuan tidak tersebar secara acak. Bahasa idiomatis dan sehari-hari dalam bisnis ("touch base," "burning the midnight oil") menyatu di hampir setiap model dalam kelompok, di kedua putaran. Formalitas, presisi hukum, dan terminologi medis tidak. Uji formalitas CEO berubah dari kasual menjadi formal hanya setelah kelompok yang diperluas disertakan. Klausul indemnifikasi mengungkapkan perbedaan hukum nyata (免責 vs. 補償) yang hanya satu model, dalam satu putaran, yang berhasil mendapatkannya dengan benar. Terminologi medis tetap tidak terselesaikan sama sekali, bertahan pada rasio sekitar 6-banding-4 di kedua putaran terlepas dari model mana yang ada di pool.
Itu adalah temuan aktual, bukan klaim pemasaran: konsensus tidak membuat setiap kalimat lebih baik, dan tidak perlu demikian. Ini paling berharga tepat di mana kelancaran model tunggal tidak memberi Anda alasan untuk meragukan, dan di mana kesalahan benar-benar memiliki biaya.
Ada lapisan kedua yang lebih praktis untuk tes ini yang patut dinyatakan dengan jelas. Menjalankan perbandingan ini sendiri berarti memeriksa output dari GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, dan MiniMax M2.7 berdampingan dengan model baseline yang sudah ada, di satu tempat, di satu platform. Di luar MachineTranslation.com, itu bukan satu langganan. Beberapa, satu untuk setiap penyedia yang tingkat premium-nya ingin Anda uji, dengan biaya apa pun yang masing-masing penyedia kenakan secara individual. Pengguna berbayar di sini mendapatkan perbandingan yang sama dalam satu klik, dengan biaya sebagian kecil dari apa yang diperlukan untuk mempertahankan lima langganan premium terpisah, tanpa mengorbankan hal yang benar-benar penting: melihat di mana model setuju, dan mengetahui dengan tepat kapan mereka tidak setuju.
Keduanya tidak secara kategoris lebih baik; itu tergantung pada kategori tes. Claude Sonnet dan Claude Opus secara konsisten memilih istilah medis Vietnam yang lebih presisi, dan Claude Opus menghasilkan slang yang paling sesuai untuk "That's sick." Namun Claude Sonnet juga menghasilkan bahasa Jepang kasual dalam kalimat konteks CEO formal, di mana GPT-5.5 mendapatkannya dengan benar. Membandingkan output secara langsung lebih dapat dipertahankan daripada memilih satu model dan mempercayainya.
Tidak ada satu pun; akurasi bergantung pada domain. Gemini 3.5-Flash dan GLM-5-Turbo menghasilkan bahasa Jepang formal yang paling sesuai dalam tes ini. Kedua model Claude paling presisi pada terminologi medis Vietnam. DeepSeek V4-Pro adalah satu-satunya model yang menggunakan istilah hukum Jepang yang benar, tetapi hanya di Putaran 2, dan menghasilkan bahasa Jepang santai di tempat lain. Tidak ada satu model pun yang mendominasi di seluruh delapan tes.
Tidak, tidak secara otomatis. Memperluas kumpulan dengan varian model tingkat premium yang lebih baru menggeser konsensus dari kasual menjadi formal dalam tes formalitas Jepang. Namun dalam tes terminologi medis Vietnam, perpecahan tetap bertahan pada rasio sekitar 6-ke-4 terlepas dari model mana yang disertakan. Lebih banyak model menghasilkan lebih banyak ketidaksetujuan, yang merupakan sinyal berguna, tetapi konsensus masih mengikuti mayoritas, dan mayoritas tidak selalu merupakan jawaban yang paling presisi.
SMART adalah sistem konsensus multi-model MachineTranslation.com, mencakup hingga 22 model AI dari penyedia termasuk OpenAI, Anthropic, Google, dan DeepSeek. Ini menjalankan terjemahan melalui beberapa model sekaligus dan menampilkan output konsensus mayoritas bersama dengan jawaban setiap model individual, secara default, tanpa perlu konfigurasi. Konsensus bergeser ketika kumpulan model bergeser, seperti yang ditunjukkan dalam hasil formalitas Jepang tes ini: konsensus santai di Putaran 1 menjadi formal di Putaran 2.
Tidak ada model tunggal; tinjauan manusia adalah jawaban yang lebih baik. Model-model Claude secara konsisten memilih istilah medis Vietnam yang lebih presisi, dan hanya DeepSeek V4-Pro yang menggunakan istilah hukum Jepang yang benar, tetapi hanya di Putaran 2. Terminologi medis yang terbagi tidak pernah terselesaikan di seluruh 10 model, yang menunjukkan bahwa keahlian domain diperlukan, bukan bahwa model yang berbeda harus dipilih. A tinjauan penyuntingan manusia bersertifikat, seperti yang ditawarkan Tomedes, memberikan pemeriksaan spesialis tersebut.