July 10, 2026

Manakah penerjemah AI yang paling akurat pada tahun 2026? Saya menguji 10 model AI terbaru

Dua kata. Enam model. Tiga keputusan penerjemahan yang berbeda. Inilah apa yang terjadi ketika saya menjalankan 8 kalimat uji melalui model AI terbaru yang tersedia di MachineTranslation.com, dan apa yang sebenarnya diungkapkan oleh output tentang kapan model gagal secara diam-diam.

Bagaimana Anda bahkan bisa tahu kapan model Anda membuat keputusan yang salah?

Dua kata. ‎"Itu keren." Enam model. Tiga keputusan penerjemahan yang berbeda.

Dalam bahasa Jepang, satu model merender sesuai dengan それはやばい, mempertahankan ambiguitas. Seorang lainnya menghilangkan subjek pronoun sepenuhnya dan menulis bentuk telanjang やばい, versi paling kolokial yang mungkin. Seorang ketiga menulis それはすごい, yang menyelesaikan ambiguitas sepenuhnya mendukung "menakjubkan," menghilangkan makna ganda yang membuat frasa tersebut menarik pada awalnya. Dalam bahasa Vietnam, satu model menulis Đỉnh vậy (slang, benar untuk register pemuda). Seorang lainnya menulis Thật tuyệt vời, secara gramatikal benar, tetapi lebih dekat dengan mengatakan "itu benar-benar menakjubkan" ketika seseorang mengirimkan meme kepada Anda.

Semua ini dapat dipertahankan. Tidak ada satupun yang sama. Dan jika Anda menjalankan terjemahan melalui model tunggal, Anda tidak akan pernah melihat pilihan yang dibuat atas nama Anda.

Itulah pertanyaan utama yang coba dijawab oleh artikel ini. Bukan model AI mana yang terbaik untuk penerjemahan pada tahun 2026 (jawabannya tergantung pada pasangan bahasa, register, domain, dan struktur kalimat), melainkan: bagaimana Anda tahu ketika model Anda membuat keputusan yang salah? Terutama dalam domain seperti terminologi medis, kontrak hukum, atau formalitas profesional, di mana keputusan yang salah terlihat persis seperti penerjemahan yang benar sampai seorang spesialis membacanya.

Inilah yang saya lakukan. Saya menjalankan 8 kalimat uji melalui dua putaran model di MachineTranslation.com: pertama baseline dari 5 model yang banyak digunakan, kemudian kumpulan yang diperluas yang menambahkan beberapa varian model tier premium terbaru yang sekarang tersedia untuk pengguna berbayar. Biasanya, membandingkan output dari model seperti ini berarti berlangganan berbayar terpisah dengan setiap penyedia secara individual. Di MachineTranslation.com, mereka duduk dalam tampilan perbandingan yang sama. Pasangan bahasa adalah English→Japanese dan English→Vietnamese. Kategori kalimat dipilih secara khusus untuk menguji area di mana ketidaksepakatan model paling berpengaruh: frasa idiomatik, terminologi hukum, terminologi medis, konteks sensitif formalitas, dan ambiguitas semantik yang disengaja.

Metodologi

  • Pasangan bahasa: Inggris → Jepang, Inggris → Vietnam
  • Putaran 1 (baseline): Claude Sonnet 4-6, DeepSeek V4-Pro, Qwen 3.7-Max, GPT-4.1-NANO, Gemini 3.1-Pro-Preview
  • Putaran 2 (diperluas): Semua di atas + Claude Opus 4-7, GPT-5.5, Gemini 3.5-Flash, GLM-5-Turbo, MiniMax M2.7
  • Kategori tes: Frasa idiomatik (2), Terminologi hukum/profesional (2), Terminologi medis (1), Konteks bergantung formalitas (2), Ambiguitas yang disengaja (1)
  • Apa yang diukur: Output terjemahan secara langsung, bukan waktu edit, TER, atau tingkat kesalahan numerik. Jika relevan, perbedaan dijelaskan secara linguistik.
  • Konsensus SMART: Setiap putaran mencakup keluaran konsensus multi-model platform. SMART mencakup hingga 22 model AI dari berbagai penyedia dan menjalankan semua model yang tersedia secara bersamaan untuk mendapatkan terjemahan konsensus. Konsensus bergeser ketika kumpulan model bergeser.

Catatan tentang metodologi evaluasi: penelitian terjemahan mesin telah lama bergulat dengan cara menilai keluaran secara otomatis. Metrik seperti BLEU dan COMET sebagaimana diukur dalam tugas bersama WMT memberikan sinyal agregat yang berguna, tetapi mereka buruk dalam mendeteksi kesalahan register, kegagalan idiom, dan presisi terminologi, tepatnya kategori yang paling penting di sini. Apa yang akan Anda baca adalah analisis output, bukan perlombaan BLEU.

Hasil sekilas

Bagian 1: Tempat di mana semua model setuju, dan mengapa itu juga penting

Tidak setiap kalimat menampilkan ketidaksetujuan yang bermakna. Dua dari delapan tes, "Let's touch base once the dust settles on this deal" (→ Jepang) dan "We're burning the midnight oil to hit this launch date" (→ Vietnam), menghasilkan persetujuan tinggi di kedua putaran. Idiom-idiom tersebut dipahami dengan benar sebagai idiom. Tidak ada yang menerjemahkan "touch base" sebagai menyentuh sebuah base fisik. Tidak ada yang menerjemahkan "the dust settles" sebagai sedimen yang jatuh.

Ini layak untuk dihentikan sejenak: bahasa bisnis idiomatis Inggris ditangani dengan cukup baik oleh model frontier saat ini ketika idiom cukup umum. Konsensus untuk "touch base" tetap stabil di kedua putaran; variasi murni bersifat stilistik, seputar apakah menggunakan この件 (masalah ini), この取引 (kesepakatan ini), atau この案件 (kasus ini) untuk frasa sumber.

Test 8: ‎"Mari kita hubungi lagi setelah debu mengendap pada kesepakatan ini." → Jepang

Tes "membakar minyak tengah malam" adalah di mana hal-hal menjadi lebih menarik. Setiap model kecuali satu memahami idiom dengan benar. MiniMax M2.7, yang diperkenalkan di Babak 2, menerjemahkan "burning" secara literal, menghasilkan đốt đuốc, yang berarti "membakar obor." Konsensus dengan benar mengecualikannya.

Test 5: ‎"Kami bekerja siang malam untuk memenuhi tanggal peluncuran ini." → Vietnam

Temuan — Idiom

Model terdepan umumnya menangani idiom bisnis Inggris yang umum dengan benar dalam bahasa Jepang dan Vietnam. Nilai konsensus paling tinggi pada kalimat yang diperdebatkan : formalitas, register, dan terminologi. Dalam tes idiom, konsensus masih membuktikan nilainya dengan menandai outlier sejati (kegagalan "obor yang menyala" literal MiniMax), tetapi kumpulan keseluruhan sudah setuju.

Bagian 2: Kesenjangan formalitas

Bahasa Jepang adalah bahasa berlapis formalitas. Pilihan akhiran kata kerja, kata ganti, dan bentuk nomina referensial bukan merupakan pilihan gaya. Ini menunjukkan hubungan antara pembicara dan penerima. Mengirim pesan kepada CEO Anda menggunakan bentuk kata kerja yang kasual bukanlah kesalahan terjemahan dalam arti gramatikal. Ini adalah kesalahan sosial, dan kesalahan yang signifikan.

Kalimat uji: Bisakah kamu mengirimnya? Terima kasih, saya menghargainya." Konteks: mengirim pesan kepada seorang CEO.

Konsensus bergeser ketika kumpulan model diperluas. Mekanismenya sederhana: menambahkan model yang dengan benar membaca konteks formalitas menggeser mayoritas, dan konsensus mengikuti. Berikut adalah spektrum lengkap dari apa yang dihasilkan model dalam Putaran 2:

Tes 1: Kalimat CEO — keluaran model Round 2 lengkap


Outlier yang menonjol — DeepSeek R2

DeepSeek V4-Pro dalam Round 2 menghasilkan 送ってくれる?ありがとう、助かる。, bentuk biasa Jepang. Ini adalah apa yang Anda kirim pesan ke teman dekat. Ini bukan register yang tepat untuk pesan kepada seorang CEO. Bentuk polos (くれる、助かる) menghilangkan semua penanda kehormatan. Konsensus dengan benar mengecualikannya, tetapi jika ini adalah satu-satunya model Anda, Anda akan mengirim pesan kepada CEO Anda yang setara dengan pesan teks santai.

Tes register Vietnam mengungkapkan jenis kesalahan formalitas yang berbeda, satu yang lebih halus. Kalimat sumber: Hei, pertanyaan cepat — apakah kamu bebas untuk melakukan panggilan? Konteks: mengirim pesan kepada klien. Qwen dalam Putaran 1 menyertakan "mình," sebuah kata ganti orang pertama yang menyiratkan persahabatan tingkat rekan sebaya yang santai. Setiap model lainnya menghindari referensi diri orang pertama sepenuhnya, yang merupakan pilihan profesional yang lebih aman. Sangat penting, Qwen memperbaiki ini di Putaran 2 dan menghapus "mình." Konsensus di kedua putaran mengecualikannya.

Test 6: ‎"Hei, pertanyaan cepat — apakah kamu bebas untuk melakukan panggilan?" → Vietnam


Temuan — Kesalahan register tidak terlihat tanpa perbandingan

Kesalahan Qwen "mình" adalah ilustrasi paling jelas mengapa terjemahan model tunggal berisiko untuk komunikasi yang menghadap klien: hasilnya adalah bahasa Vietnam yang lancar, gramatikal, dan terdengar alami. Tidak ada yang perlu ditandai. Tanpa melihat keempat model lainnya hindari rujukan diri orang pertama, Anda tidak akan memiliki sinyal bahwa pilihan register telah dibuat.

Bagian 3: Terminologi hukum — masalah 免責

Kalimat indemnitasi vendor/klien adalah klausul standar dalam perjanjian komersial: ‎"Penjual harus mengganti rugi klien terhadap setiap klaim pihak ketiga yang timbul dari pelanggaran perjanjian ini."

Pada Putaran 1, kelima model dengan benar mengidentifikasi register hukum dan menggunakan kata pinjaman ベンダー (vendor) dan クライアント (klien), yang standar dalam kontrak komersial Jepang berasal dari bahasa Inggris. Satu pengecualian: GPT-4.1-NANO menggunakan 販売者 (penjual) dan 顧客 (pelanggan), kata-kata Jepang yang sah namun kurang memiliki spesifisitas hukum formal dari padanan istilah pinjaman yang setara.

Temuan yang lebih penting muncul di Putaran 2. Perbedaan utama adalah antara dua kata:

  • 補償 (hoshō) — kompensasi, ganti rugi. Untuk membuat seseorang utuh secara finansial setelah mengalami kerugian.
  • 免責 (menseki) — untuk membebaskan dari tanggung jawab; untuk memberikan ganti rugi. Untuk melindungi dari klaim pihak ketiga sebelum mereka terwujud.

Ini adalah konsep yang berbeda secara hukum. ‎"Indemnify" secara khusus berarti melindungi suatu pihak dari tanggung jawab pihak ketiga. 免責 adalah istilah hukum yang benar. Semua model Putaran 1 menggunakan 補償. Pada Putaran 2, DeepSeek V4-Pro adalah satu-satunya model yang menghasilkan 免責, dan model ini melakukannya hanya pada Putaran 2, bukan Putaran 1.

Test 7: Klausul indemnifikasi → Jepang (keluaran utama)


Temuan — Register hukum

DeepSeek dalam R2 adalah satu-satunya model yang menggunakan 免責, padanan yang tepat secara hukum dari "indemnify." Setiap model lainnya menggunakan 補償 (kompensasi), yang secara semantik terkait tetapi berbeda secara hukum. Temuan ini hanya menjadi terlihat dalam putaran kedua, yang menggarisbawahi mengapa tes statis sekali putaran menggunakan kumpulan model tetap dapat melewatkan varian penting.
Secara terpisah, Qwen dalam R2 mundur dengan beralih ke 売主/買主 (penjual/pembeli), istilah dari hukum penjualan komersial daripada perjanjian layanan. Ini adalah framing yang kurang tepat untuk kontrak yang menggunakan terminologi hukum Inggris.

Dalam kontrak, 補償 dan 免責 bukanlah sinonim. Satu berarti "kami akan mengganti biaya Anda." Yang lain berarti "Anda dilindungi dari klaim sejak awal." Jika platform terjemahan menggunakan 補償 di mana 免責 adalah yang benar, seorang pengacara yang membaca versi Jepang tidak akan melihat perjanjian yang sama seperti yang dijelaskan dalam versi Inggris.

Bagian 4: Terminologi medis — perpecahan yang tidak terselesaikan

Ini adalah temuan paling penting dalam dataset. Kalimat uji: ‎"Obat ini dikontraindikasikan pada pasien dengan riwayat gangguan fungsi hati." ‎**Sumber: dokumentasi produk klinis.** Target: Bahasa Vietnam.

Istilah kritis adalah "gangguan hati." Ada dua kandidat Vietnam:

  • suy gan — kegagalan hati. Merujuk pada disfungsi hati stadium akhir yang parah, akut, atau kronis. Seorang pasien yang mengalami gagal hati.
  • — suy giảm chức năng gan — penurunan/gangguan fungsi hati. Mengacu pada pengurangan fungsi hati apa pun, termasuk gangguan ringan atau sedang.

Ini secara klinis berbeda. Peringatan kontraindikasi berdasarkan "gangguan hepatik" berlaku untuk siapa saja dengan fungsi hati yang berkurang, bukan hanya mereka yang mengalami kegagalan organ lengkap. Menggunakan suy gan mempersempit populasi yang ditunjukkan secara tidak benar. Seorang pasien dengan gangguan hati sedang yang membaca suy gan mungkin tidak mengenali diri mereka sebagai populasi yang dikontraindikasikan.

Test 2: Kalimat Kontraindikasi → Vietnam (kedua putaran)


Temuan Kritis: terminologi medis

Pembagiannya adalah 6 model untuk suy gan vs. 4 model untuk suy giảm chức năng gan di Putaran 2. Mayoritas, dan oleh karena itu konsensus, memilih istilah yang kurang presisi secara klinis. Kedua model Claude (Sonnet dan Opus) secara konsisten memilih suy giảm chức năng gan di kedua putaran. Pemisahan tidak teratasi ketika kolam berkembang.
Ini adalah satu temuan dalam dataset ini yang paling langsung mendukung tinjauan ahli manusia tentang konten medis. Konsensus tidak salah berdasarkan suara mayoritas. Hal ini mencerminkan ketidaksetujuan yang sesungguhnya di antara model-model frontier, dan ketidaksetujuan itu sendiri adalah informasi yang perlu dilihat oleh seorang penerjemah. Ini adalah persis jenis kasus yang tinjauan manusia-dalam-lingkaran Tomedes dibangun untuk.

Bagian 5: ‎"Itu sakit" — apa yang terjadi ketika ambiguitas adalah tujuannya

Beberapa kalimat sumber dirancang untuk ambigu. ‎"That's sick" dalam slang bahasa Inggris kontemporer berarti sesuatu yang luar biasa, tetapi juga masih mempertahankan makna literalnya (yaitu menjijikkan/menjengkelkan), dan ketegangan antara kedua makna tersebut adalah bagian dari cara frasa ini berkomunikasi. Tantangan bagi model terjemahan adalah: apakah Anda mempertahankan ambiguitas, meruntuhkannya menjadi makna yang paling mungkin, atau memilih satu dan berkomitmen?

Keluaran Jepang


Keluaran Vietnam


Temuan: ambiguitas dan divergensi keluarga yang sama

Claude Opus 4-7 menulis Đỉnh vậy (slang). Claude Sonnet 4-6 menulis Thật tuyệt vời (formal). Ini adalah keputusan register yang berlawanan yang dibuat oleh dua model dari keluarga model yang sama pada input dua kata yang identik. Keduanya tidak "salah." Keambiguan dalam "That's sick" berarti kedua makna tersebut ada. Tetapi jika audiens target Anda menggunakan slang pemuda Vietnam saat ini, hanya satu dari terjemahan ini yang berkomunikasi dengan benar. Konsensus membuat ketidaksepakatan terlihat. Tanpa itu, Anda tidak tahu pilihan telah dibuat.
Dalam bahasa Jepang, GPT-4.1-NANO adalah satu-satunya model yang menggunakan すごい, yang menghilangkan ambiguitas sepenuhnya mendukung "menakjubkan." Lima model lain mempertahankannya dengan やばい/ヤバい‎. Claude Opus mengambil bentuk paling minimal: bare やばい tanpa subjek.

Bagian 6: Seperti apa kumpulan model terlihat

Model-model dalam tes ini tidak semuanya setara. Mereka mencakup arsitektur yang berbeda, rezim pelatihan, dan konteks penerapan yang berbeda. Baseline Putaran 1 mencakup model yang dapat diakses secara luas. Pool Round 2 yang diperluas menambahkan beberapa varian model tingkat premium terbaru yang sekarang tersedia untuk pengguna berbayar di MachineTranslation.com, tingkat model yang sama yang sebaliknya berarti akun berbayar terpisah dengan setiap penyedia individual.

Pool yang diperluas di Round 2 mencakup model yang lebih canggih dan tersedia untuk pengguna berbayar di MachineTranslation.com. Efek dari perluasan pool tidak merata. Dalam beberapa tes (formalitas/Jepang), hal itu menggeser konsensus secara bermakna. Pada yang lain (terminologi medis/Vietnam), perpecahan semakin dalam.

Bagian 7: Apa artinya jika Anda memilih platform terjemahan

Data uji menunjukkan dua kategori kegagalan yang berbeda, dan mereka memerlukan respons yang berbeda.

Kategori A: Kegagalan senyap. Kesalahan formalitas, kesalahan register, presisi terminologi medis: ini menghasilkan keluaran yang terlihat benar. Bahasa Jepang itu tata bahasanya benar. Orang Vietnam itu fasih berbahasa. Tidak ada sinyal permukaan yang menunjukkan ada yang salah. Seorang pengguna monolingua yang membaca keluaran satu model tidak memiliki cara untuk mengetahui bahwa model membuat pilihan register yang akan diperhatikan oleh seorang eksekutif Jepang senior, atau bahwa istilah klinis dipersempit dengan cara yang mengubah populasi yang berlaku untuk itu.

Kategori B: Kegagalan yang terlihat. MiniMax menerjemahkan "burning the midnight oil" sebagai "burning torches." GPT-4.1-NANO menyelesaikan "That's sick" ke "すごい" yang tidak ambigu. Ini dapat dideteksi, baik oleh penutur bahasa target maupun melalui perbandingan dengan keluaran model lain.

Perbandingan multi-model yang disediakan SMART paling berharga dalam Kategori A. Ketika lima atau sepuluh model menghasilkan keluaran dan sebagian besar setuju pada register formal sementara satu menghasilkan bahasa Jepang bentuk polos kasual, ketidaksetujuan tersebut terlihat dalam tampilan perbandingan. Seorang pengguna yang berbicara dalam bahasa target dapat mengevaluasi opsi-opsi tersebut. Seorang pengguna yang tidak dapat melihat bahwa keputusan yang diperdebatkan telah dibuat, dan memutuskan apakah kalimat tersebut memerlukan tinjauan manusia.

Untuk pekerjaan skala dokumen, file besar, terjemahan yang mempertahankan tata letak PDF, kontrak, atau materi klinis, kemampuan pemrosesan dokumen platform menangani struktur file tanpa merusak pemformatan. Namun pertanyaan kualitas yang diangkat di atas berlaku terlepas dari ukuran file. Sebuah studi klinis 100 halaman di mana setiap instansi "gangguan fungsi hati" diterjemahkan sebagai "kegagalan hati" adalah versi yang lebih besar dari masalah yang sama yang diidentifikasi dalam Tes 2.

Untuk kategori medis dan hukum secara khusus, verifikasi manusia adalah backstop yang benar. Layanan Post-Editing AI Tomedes, yang menggabungkan output AI dengan tinjauan manusia bersertifikat untuk jenis konten berisiko tinggi seperti ini, dibangun untuk ini. Gangguan fungsi hati / penurunan fungsi hati adalah temuan yang tepat untuk memicu tinjauan tersebut, bukan karena semua model salah, tetapi karena model yang paling percaya diri tidak selalu yang paling presisi.

Nilai dari melihat berbagai output bukan bahwa Anda akan selalu memilih mayoritas. Itu berarti Anda akan tahu bahwa sebuah pilihan telah dibuat, yang berbeda dari menganggap bahwa output di depan Anda benar.

Apa yang delapan kalimat sebenarnya katakan kepada saya

Letakkan delapan tes berdampingan dan pola tetap berlaku: persetujuan dan ketidaksetujuan tidak tersebar secara acak. Bahasa idiomatis dan sehari-hari dalam bisnis ("touch base," "burning the midnight oil") menyatu di hampir setiap model dalam kelompok, di kedua putaran. Formalitas, presisi hukum, dan terminologi medis tidak. Uji formalitas CEO berubah dari kasual menjadi formal hanya setelah kelompok yang diperluas disertakan. Klausul indemnifikasi mengungkapkan perbedaan hukum nyata (免責 vs. 補償) yang hanya satu model, dalam satu putaran, yang berhasil mendapatkannya dengan benar. Terminologi medis tetap tidak terselesaikan sama sekali, bertahan pada rasio sekitar 6-banding-4 di kedua putaran terlepas dari model mana yang ada di pool.

Itu adalah temuan aktual, bukan klaim pemasaran: konsensus tidak membuat setiap kalimat lebih baik, dan tidak perlu demikian. Ini paling berharga tepat di mana kelancaran model tunggal tidak memberi Anda alasan untuk meragukan, dan di mana kesalahan benar-benar memiliki biaya.

Ada lapisan kedua yang lebih praktis untuk tes ini yang patut dinyatakan dengan jelas. Menjalankan perbandingan ini sendiri berarti memeriksa output dari GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, dan MiniMax M2.7 berdampingan dengan model baseline yang sudah ada, di satu tempat, di satu platform. Di luar MachineTranslation.com, itu bukan satu langganan. Beberapa, satu untuk setiap penyedia yang tingkat premium-nya ingin Anda uji, dengan biaya apa pun yang masing-masing penyedia kenakan secara individual. Pengguna berbayar di sini mendapatkan perbandingan yang sama dalam satu klik, dengan biaya sebagian kecil dari apa yang diperlukan untuk mempertahankan lima langganan premium terpisah, tanpa mengorbankan hal yang benar-benar penting: melihat di mana model setuju, dan mengetahui dengan tepat kapan mereka tidak setuju.

Pertanyaan yang Sering Diajukan

1. Apakah ChatGPT atau Claude lebih baik untuk terjemahan?

Keduanya tidak secara kategoris lebih baik; itu tergantung pada kategori tes. Claude Sonnet dan Claude Opus secara konsisten memilih istilah medis Vietnam yang lebih presisi, dan Claude Opus menghasilkan slang yang paling sesuai untuk "That's sick." Namun Claude Sonnet juga menghasilkan bahasa Jepang kasual dalam kalimat konteks CEO formal, di mana GPT-5.5 mendapatkannya dengan benar. Membandingkan output secara langsung lebih dapat dipertahankan daripada memilih satu model dan mempercayainya.

2. Apa model terjemahan AI yang paling akurat pada tahun 2026?

Tidak ada satu pun; akurasi bergantung pada domain. Gemini 3.5-Flash dan GLM-5-Turbo menghasilkan bahasa Jepang formal yang paling sesuai dalam tes ini. Kedua model Claude paling presisi pada terminologi medis Vietnam. DeepSeek V4-Pro adalah satu-satunya model yang menggunakan istilah hukum Jepang yang benar, tetapi hanya di Putaran 2, dan menghasilkan bahasa Jepang santai di tempat lain. Tidak ada satu model pun yang mendominasi di seluruh delapan tes.

3. Apakah menambahkan lebih banyak model AI selalu meningkatkan akurasi terjemahan?

Tidak, tidak secara otomatis. Memperluas kumpulan dengan varian model tingkat premium yang lebih baru menggeser konsensus dari kasual menjadi formal dalam tes formalitas Jepang. Namun dalam tes terminologi medis Vietnam, perpecahan tetap bertahan pada rasio sekitar 6-ke-4 terlepas dari model mana yang disertakan. Lebih banyak model menghasilkan lebih banyak ketidaksetujuan, yang merupakan sinyal berguna, tetapi konsensus masih mengikuti mayoritas, dan mayoritas tidak selalu merupakan jawaban yang paling presisi.

4. Apa itu SMART dan bagaimana cara kerjanya?

SMART adalah sistem konsensus multi-model MachineTranslation.com, mencakup hingga 22 model AI dari penyedia termasuk OpenAI, Anthropic, Google, dan DeepSeek. Ini menjalankan terjemahan melalui beberapa model sekaligus dan menampilkan output konsensus mayoritas bersama dengan jawaban setiap model individual, secara default, tanpa perlu konfigurasi. Konsensus bergeser ketika kumpulan model bergeser, seperti yang ditunjukkan dalam hasil formalitas Jepang tes ini: konsensus santai di Putaran 1 menjadi formal di Putaran 2.

5. Model manakah yang terbaik untuk terjemahan medis atau hukum?

Tidak ada model tunggal; tinjauan manusia adalah jawaban yang lebih baik. Model-model Claude secara konsisten memilih istilah medis Vietnam yang lebih presisi, dan hanya DeepSeek V4-Pro yang menggunakan istilah hukum Jepang yang benar, tetapi hanya di Putaran 2. Terminologi medis yang terbagi tidak pernah terselesaikan di seluruh 10 model, yang menunjukkan bahwa keahlian domain diperlukan, bukan bahwa model yang berbeda harus dipilih. A tinjauan penyuntingan manusia bersertifikat, seperti yang ditawarkan Tomedes, memberikan pemeriksaan spesialis tersebut.‎