July 10, 2026
İki kelime. Altı model. Üç farklı çeviri kararı. İşte MachineTranslation.com'da mevcut olan en son yapay zeka modellerinden 8 test cümlesi çalıştırdığımda ne olduğu ve çıktıların aslında bir modelin sessizce başarısız olduğu zamanlar hakkında ne ortaya koydukları.
İki kelime. Bu harika. Altı model. Üç farklı çeviri kararı.
Japonca'da, bir model bunu それはやばい olarak çevirdi, belirsizliği koruyarak. Bir diğeri konu zamirini tamamen bıraktı ve çıplak formu やばい yazıp, mümkün olan en konuşma dilsel versiyonu oluşturdu. Üçüncü bir kişi yazdı それはすごい, bu da belirsizliği tamamen "şaşırtıcı" lehine çözerek, ifadeyi ilginç kılan çift anlamı tamamen ortadan kaldırıyor. Türkçe'de, bir model yazdı Đỉnh vậy (argo, gençlik kaydı için doğru). Bir diğeri yazdı Thật tuyệt vời, dilbilgisi açısından doğru, ancak birisi sana bir meme gönderdiğinde "bu gerçekten harika" demek gibi daha yakın
Bunların hepsi savunulabilir. Hiçbiri aynı şey değil. Ve eğer çevirilerinizi tek bir model aracılığıyla çalıştırıyorsanız, sizin adınıza yapılan seçimi asla görmeyeceksiniz.
Bu, bu makalenin cevaplamaya çalıştığı merkezi sorudur. 2026'de çeviri için hangi AI modelinin en iyi olduğu değil (cevap dil çifti, yazı stili, alan ve cümle yapısına bağlıdır), aksine: modelinizin yanlış bir karar verdiğini nasıl anlardınız? Özellikle tıbbi terminoloji, yasal sözleşmeler veya profesyonel resmiyet gibi alanlarda, yanlış karar bir uzman okuyuncaya kadar tamamen doğru bir çeviri gibi görünür.
İşte benim yaptığım şey. 8 test cümlesini MachineTranslation.com'da iki tur model üzerinden çalıştırdım: önce yaygın olarak kullanılan 5 modelin temel karşılaştırması, ardından ödeme yapan kullanıcılara sunulan en yeni premium seviye model varyantlarının birkaçını ekleyen genişletilmiş bir havuz. Normalde, bunun gibi modellerin çıktılarını karşılaştırmak, her sağlayıcı ile ayrı ayrı ücretli abonelikler almak anlamına gelirdi. MachineTranslation.com'da, aynı karşılaştırma görünümünde yer alırlar. Dil çiftleri İngilizce→Japonca ve İngilizce→Vietnamca idi. Cümle kategorileri, model anlaşmazlığının en önemli olduğu alanları test etmek için özel olarak seçilmiştir: deyimsel ifadeler, hukuki terminoloji, tıbbi terminoloji, resmiyet duyarlı bağlam ve kasıtlı anlamsal belirsizlik.
Değerlendirme metodolojisi hakkında bir not: makine çevirisi araştırması, çıktıları otomatik olarak nasıl puanlandıracağı konusunda uzun süredir mücadele etmektedir. BLEU ve COMET gibi metrikler WMT paylaşılan görevlerinde ölçüldüğü üzere yararlı bir toplu sinyal sağlar, ancak bunlar register hatalarını, deyim başarısızlıklarını ve terminolojik kesinliği tespit etmekte zayıftırlar; tam da burada en önemli olan kategorilerdir. Okumak üzere olduğunuz şey bir BLEU yarışı değil, çıktı analizidir.

Her cümle anlamlı bir anlaşmazlığı ortaya çıkarmaz. Sekiz testten ikisi, "Let's touch base once the dust settles on this deal" (→ Japonca) ve "We're burning the midnight oil to hit this launch date" (→ Vietnamca), her iki turda da yüksek uyum sağladı. Deyimler doğru bir şekilde deyim olarak anlaşıldı. Hiç kimse "touch base" ifadesini fiziksel bir tabana dokunmak olarak çevirmedi. Hiç kimse "the dust settles"i çökelti düşüyor olarak çevirmedi.
Buna dikkat etmeye değer: İdiyomatik İngilizce iş dili, idiom yeterince yaygın olduğunda mevcut sınır modelleri tarafından makul şekilde işlenir. "Touch base" için fikir birliği her iki turda da sabit kaldı; varyasyon tamamen stilistikti, kaynak ifade için この件 (bu konu), この取引 (bu anlaşma) veya この案件 (bu durum) kullanılıp kullanılmayacağı konusunda.

"Gece yarısı yağı yakma" testi işlerin daha ilginç hale geldiği yerdir. Bir model hariç tüm modeller deyimi doğru bir şekilde anladı. MiniMax M2.7, Round 2'de tanıtılan, "burning" kelimesini kelimenin tam anlamıyla çevirerek, "burning torches" anlamına gelen đốt đuốc üretmiştir. Fikir birliği bunu doğru şekilde dışladı.

Japonca, resmilik katmanlarına sahip bir dildir. Fiil soneki, zamir ve referansiyel isim biçimi seçimi stilistik değildir. Konuşmacı ile alıcı arasındaki ilişkiyi gösterir. CEO'nüze casual fiil biçimleri kullanarak bir mesaj göndermek, dilbilgisel anlamda bir çeviri hatası değildir. Bu sosyal bir hatadır ve önemli bir hatadır.
Bunu gönderebilir misin? Teşekkürler, takdir ediyorum." Bağlam: Bir CEO'ya mesaj gönderme.

Model havuzu genişlediğinde fikir birliği değişti. Mekanizma basittir: resmiyet bağlamını doğru şekilde okuyan modelleri eklemek çoğunluğu değiştirdi ve fikir birliği bunu takip etti. İşte Tur 2'de modellerin ürettiği tam spektrum:

Vietnam dil seviyesi testi, daha ince bir resmiyet hatası ortaya çıkardı. Kaynak cümle: "Hey, hızlı bir soru — aramaya katılmaya uygun musun?" Sabrınız ve anlayışınız için teşekkür ederim. Bu konuyu çözmek için titizlikle çalışıyoruz ve her adımda sizi bilgilendireceğiz. Birinci turda Qwen, rahat bir akran düzeyinde dostluğu ima eden "mình" adlı birinci şahıs zamirini kullandı. Diğer her model, birinci şahıs öz-referansından tamamen kaçınmıştır; bu, daha güvenli profesyonel seçimdir. Önemli olarak, Qwen bunu Round 2'de düzeltti ve "mình"i bıraktı. Her iki turda da fikir birliği bunu dışladı.

Satıcı/müşteri tazminat cümlesi ticari anlaşmalarda standart bir maddedir: "Satıcı, bu anlaşmanın ihlalinden kaynaklanan herhangi bir üçüncü taraf talebine karşı müşteriyi tazmin etmelidir."
1. Turda, beş modelin tümü yasal register'ı doğru şekilde tanımladı ve İngilizce kökenli Japon ticari sözleşmelerinde standart olan ベンダー (tedarikçi) ve クライアント (müşteri) ödünç kelimelerini kullandı. Bir istisna: GPT-4.1-NANO, yasal açıdan resmi özgüllüğe sahip olmayan ödünç alınan sözcük eşdeğerlerinin aksine, meşru Japonca sözcükler olan 販売者 (satıcı) ve 顧客 (müşteri) kullandı.
Daha önemli bulgu Tur 2'de ortaya çıktı. Anahtar ayrım iki kelime arasındadır:
Bunlar yasal olarak farklı kavramlardır. "Indemnify" özellikle bir tarafı üçüncü taraf sorumluluğundan korumak anlamına gelir. 免責 doğru yasal terimdir. Tüm Round 1 modelleri 補償 kullandı. 2. Tur'da DeepSeek V4-Pro, 免責 üretmek için tek model oldu ve bunu sadece Tur 2'de yaptı, Tur 1'de değil.

Bir sözleşmede, 補償 ve 免責 eş anlamlı değildir. "Biri" anlamına gelir "sizi geri ödeyeceğiz." Diğeri "başından itibaren talep karşısında korunmuş olursunuz" anlamına gelir. Eğer bir çeviri platformu İngilizce versiyonun tanımladığı anlaşmayı görmeyecek olan Japonca versiyonu okuyan bir avukat için 補償 yerine 免責 doğru olduğu yerde kullanırsa.
Bu, veri setindeki en önemli bulgudur. Test cümlesi: "Bu ilaç, hepatik yetmezlik öyküsü olan hastalarda kontrendikedir." Kaynak: klinik ürün belgelendirmesi. Hedef: Vietnamese.
Kritik terim "hepatik bozukluk"tur. İki Vietnamlı aday vardır:
Bunlar klinik olarak farklıdır. "Hepatic impairment" ile ilgili kontrendikasyon uyarısı, sadece tam organ yetmezliği yaşayanlar değil, karaciğer fonksiyonu azalmış olan herkes için geçerlidir. "Suy gan" kullanımı belirtilen popülasyonu yanlış bir şekilde daraltıyor. Orta düzey karaciğer yetmezliği olan ve "suy gan" okuyan bir hasta, kendilerini kontrendike edilen popülasyon olarak tanımayabilir.

Bazı kaynak cümleler tasarım gereği belirsizdir. "That's sick" çağdaş İngilizce argosunda mükemmel bir şey anlamına gelir, ancak yine de tam anlamıyla (yani iğrenç/tiksinç) anlamını taşır ve bu iki anlam arasındaki gerilim ifadenin nasıl iletişim kurduğunun bir parçasıdır. Bir çeviri modelinin karşı karşıya olduğu zorluk şudur: belirsizliği korur musunuz, en olası anlama daraltır mısınız, yoksa birini seçip bağlı kalır mısınız?


Bu testteki modeller hepsi eşdeğer değildir. Farklı mimarileri, eğitim rejimlerini ve dağıtım bağlamlarını kapsamaktadırlar. Round 1 taban çizgisi, yaygın olarak erişilebilir modelleri içerir. Genişletilmiş Round 2 havuzu, MachineTranslation.com'da ödeme yapan kullanıcılara sunulan en yeni premium seviye model varyantlarından birkaçını ekler; aksi takdirde her bir sağlayıcı ile ayrı bir ücretli hesap anlamına gelen aynı model seviyesi.

Round 2'deki genişletilmiş havuz, MachineTranslation.com'da ödeme yapan kullanıcılara sunulan daha gelişmiş ve kullanılabilir modelleri içerir. Havuzun genişletilmesinin etkisi eşit değildir. Bazı testlerde (resmilik/Japonca), fikir birliğini anlamlı bir şekilde değiştirdi. Diğerlerinde (tıbbi terminoloji/Vietnamca), bölünme derinleşti.

Test verileri iki farklı başarısızlık kategorisini göstermektedir ve bunlar farklı yanıtlar gerektirmektedir.
Kategori A: Sessiz başarısızlıklar. Biçimsel hatalar, register hataları, tıbbi terminoloji kesinliği: bunlar doğru görünen çıktılar üretir. Japonca dilbilgisel olarak doğru. Vietnamlı akıcı bir şekilde konuşuyor. Hiçbir yüzey sinyali herhangi bir şeyin yanlış gittiğini göstermez. Tek dilli bir kullanıcı, tek bir modelin çıktısını okurken, modelin kıdemli bir Japon yöneticisinin fark edeceği bir kayıt seçimi yaptığını veya klinik bir terimin popülasyona uygulanabilirliğini değiştiren bir şekilde daraltıldığını bilmenin hiçbir yolu yoktur.
Kategori B: Görünür hatalar. MiniMax "burning the midnight oil" (gece yarısına kadar çalışmak) ifadesini "torçları yakmak" olarak çevirdi. GPT-4.1-NANO "That's sick" ifadesini açık anlamlı "すごい" olarak çözümlüyor. Bunlar, hedef dil konuşanı tarafından veya diğer model çıktılarıyla karşılaştırma yoluyla tespit edilebilir.
SMART'ın sağladığı çok modelli karşılaştırma, A Kategorisinde en değerlidir. Beş veya on model çıktı ürettiğinde ve çoğu resmi bir register üzerinde anlaşırken biri gündelik düz biçim Japonca ürettiğinde, anlaşmazlık karşılaştırma görünümünde görülebilir. Hedef dili konuşan bir kullanıcı seçenekleri değerlendirebilir. Bir kullanıcı, tartışmalı bir kararın alındığını görebilir ve bu cümlenin insan incelemesini gerektirip gerektirmediğine karar verebilir.
Belge ölçeğindeki çalışmalar, büyük dosyalar, PDF'lerin, sözleşmelerin veya klinik materyallerin düzen koruyan çevirisi için platformun belge işleme yeteneği dosya yapısını biçimlendirmeyi bozmadan işler. Ancak yukarıda gündeme getirilen kalite soruları dosya boyutundan bağımsız olarak geçerlidir. 100 sayfalık bir klinik çalışmada "hepatik yetmezlik"in her örneğinin "karaciğer yetmezliği" olarak çevrilmesi, Test 2'de belirlenen sorunun daha büyük bir versiyonudur.
Özellikle tıbbi ve yasal kategoriler için insan doğrulaması doğru bir güvenlik mekanizmasıdır. Tomedes'in AI Sonrası Düzenleme hizmeti, AI çıktısını tam olarak bu tür yüksek riskli içerik için sertifikalı insan incelemesiyle birleştiren hizmet, bunun için tasarlanmıştır. Suy gan / suy giảm chức năng gan bölünmesi, tam olarak bu incelemeyi tetiklemesi gereken bir bulgudur; çünkü tüm modeller yanlış olduğu için değil, en güveni olan modeller en kesin olanlar olmadığı için.
Birden fazla çıktı görmenin değeri, her zaman çoğunluğu seçeceğiniz anlamına gelmez. Bunun anlamı, bir seçim yapıldığını bileceksiniz, bu da önünüzdeki çıktının doğru olduğunu varsaymaktan farklıdır.

Sekiz testi yan yana koyun ve bir örüntü ortaya çıkar: anlaşma ve anlaşmazlık rastgele dağılmaz. İdiyomatik, günlük iş dili ("iletişim kurmak," "gece gündüz çalışmak") havuzun neredeyse her modelinde her iki turda da birleşti. Resmilik, yasal kesinlik ve tıbbi terminoloji başarısız oldu. CEO-resmilik testi, genişletilmiş havuz dahil edilene kadar sadece bir kez rasgele'den resmi'ye döndü. Tazminat maddesinin, yalnızca bir modelin bir turda doğru anladığı gerçek bir yasal ayrımı (면책 vs. 補償) ortaya çıkardığı. Tıbbi terminoloji bölünmesi hiçbir zaman çözülmedi, her iki turda da hangi modeller havuzda olursa olsun kabaca 6'ya 4 oranında kaldı.
Bu gerçek bulgu, bir pazarlama iddiası değil: fikir birliği her cümleyi daha iyi yapmaz ve buna gerek yoktur. En değerli olduğu yer tam olarak tek bir modelin akıcılığının sizi şüphe duymaya hiçbir neden vermediği ve yanlış olmanın gerçekten bir şeye mal olduğu yerdir.
Bu testin söylenmeye değer ikinci, daha pratik bir katmanı vardır. Bu karşılaştırmayı kendim yürütmek, GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo ve MiniMax M2.7'nin çıktılarını mevcut temel modellerin yanında, tek bir yerde, tek bir platformda yan yana kontrol etmek anlamına geliyordu. MachineTranslation.com dışında, bu bir abonelik değildir. Birkaç tane var, test etmek istediğiniz her sağlayıcının premium katmanı için birer tane, her sağlayıcının bireysel olarak talep ettiği fiyattan. Burada ödeme yapan kullanıcılar aynı karşılaştırmayı tek bir tıklamayla, beş ayrı premium abonelik tutmanın maliyetinin bir kısmına karşılık olarak elde ederler, gerçekten önemli olan şeyi feda etmeden: modellerin nerede hemfikir olduğunu görmek ve tam olarak ne zaman olmadığını bilmek.
Hiçbiri kategorik olarak daha iyi değildir; test kategorisine bağlıdır. Claude Sonnet ve Claude Opus, daha kesin Vietnamca tıbbi terimi tutarlı bir şekilde seçti ve Claude Opus, "That's sick." için en uygun argo ifadeyi ürettti. Ancak Claude Sonnet, GPT-5.5'in doğru yaptığı resmi CEO bağlamı cümlesinde de rasgele Japonca üretmiştir. Çıktıları doğrudan karşılaştırmak, bir modeli seçip ona güvenmekten daha savunulabilirdir.
Bir tane yoktur; doğruluk alan bağımlıdır. Bu testte Gemini 3.5-Flash ve GLM-5-Turbo en uygun resmi Japonca'yı üretmiştir. Her iki Claude modeli de Vietnamca tıbbi terminoloji konusunda en hassas sonuçları verdi. DeepSeek V4-Pro, yalnızca 2. Turda doğru Japonca hukuki terimini kullanan tek model oldu, ancak başka yerlerde gündelik Japonca ürettti. Hiçbir tek model sekiz testin tümünde baskın olmadı.
Hayır, otomatik olarak değil. Daha yeni premium seviye model varyantlarıyla havuzu genişletmek, Japonca resmiyet testinde fikir birliğini raslantısal olmaktan resmi olmaya kaydırdı. Ancak Vietnamca tıbbi terminoloji testinde, hangi modeller dahil edilirse edilsin, bölünme kabaca 6'ya 4 oranında devam etti. Daha fazla model daha fazla anlaşmazlık ortaya çıkarır, bu yararlı bir sinyal olsa da, fikir birliği yine de çoğunluğu takip eder ve çoğunluk her zaman en kesin cevap değildir.
SMART, MachineTranslation.com'un OpenAI, Anthropic, Google ve DeepSeek dahil olmak üzere sağlayıcılar arasında 22'ye kadar AI modelini kapsayan çok modelli fikir birliği sistemidir. Metni aynı anda birden fazla model üzerinden çalıştırır ve varsayılan olarak herhangi bir yapılandırma gerekmeden, çoğunluk fikir birliğinin çıktısını her bir modelin cevabının yanında gösterir. Model havuzu değiştiğinde fikir birliği değişir; bu testin Japonca resmilik sonucunda görüldüğü gibi: Birinci Turda gayri resmi olan fikir birliği, İkinci Turda resmi hale geldi.
Tek bir model yoktur; insan incelemesi daha iyi bir cevaptır. Claude modelleri sürekli olarak daha kesin Vietnamca tıbbi terimi seçerken, DeepSeek V4-Pro tek başına doğru Japonca hukuk terimini kullandı, ancak yalnızca 2. Turda. Tıbbi terminoloji bölünmesi 10 model arasında hiçbir zaman çözümlenmedi; bu, farklı bir model seçilmesi gerektiğini değil, alan uzmanlığının gerekli olduğunu gösterir. Tomedes'in sunduğu gibi onaylı insan son düzenleme incelemesi, o uzman kontrolü sağlar.