June 5, 2026
Çeviri sektöründe yeterince konuşmadığımız bir şey üzerinde dahili testler yapıyorum: farklı yapay zeka sistemlerinin farklı çeviri yapıp yapmadığı değil, aynı yapay zekanın farklı sürümlerinin farklı çeviri yapıp yapmadığı ve ne kadar farklı çeviri yaptığı.
Geçen hafta, MachineTranslation.com'un dahili test platformunda tek bir İspanyolca deyimi aynı anda beş ChatGPT sürümünden geçirdim. Geri dönen sonuç beni durdurdu.
İki sürüm, İngilizce'de gerçekten anlamsız bir çeviri üretti. Üç versiyon doğru deyimsel çeviriler üretti. Ve doğru olan üç tanesi birbirleriyle anlaşamadı.
Beşinin de hepsi ChatGPT. Hepsi beş OpenAI. Aynı yapay zeka, farklı model — ve çıktılar bu kadar farklı olamazdı.
Bunu şimdi paylaşıyorum çünkü temiz cevaplarım olduğu için değil, önemli olduğunu düşündüğüm için. Ben istemiyorum. Ancak gözlem, dünyaya sunulmaya değer derecede ilginçtir.
Test ettiğim ifade şuydu: llevarse el gato al agua.

Her sürümün ürettiği şey şudur:
| Model | Çıktı | Deyimsel mi? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | kediyi suya götürmek | ❌ Kelime anlamı |
| ChatGPT::GPT-4.1-NANO | kediyi suya götürmek | ❌ Kelime anlamı |
| ChatGPT::GPT-4.1-MINI | başarıyla başarmak | ✅ Doğru |
| ChatGPT::GPT-5.4-MINI | kendi yoluna gitmek | ✅ Kısmi |
| ChatGPT::GPT-5.4 | üstün gelmek | ✅ Doğru |
İfade, zorlu koşullara karşı bir şeyi başarmak, zor bir zafer kazanmak anlamına gelir. Kedilerle ya da suyla hiçbir ilgisi yok. Kelime kelime çeviri bir çeviri değildir. Bu, modelin bir deyim olarak tanımakta başarısız olduğu bir ifadenin kelime kelime transkripsiyonudur.
GPT-4o-MINI ve GPT-4.1-NANO özdeş çıktılar üretti. Benzer değil, aynı. Çeviri İçgörülerimiz bunu doğrudan işaretledi: GPT-4.1-nano ve GPT-4o-mini, deyimsel anlam yerine kelime anlamını vurgulayarak aynı çevirileri paylaşıyor.
GPT-4.1-MINI, GPT-5.4-MINI ve GPT-5.4, her biri tanınabilir derecede doğru bir şey üretti - ancak birbirlerinden farklı.
Neden llevarse el gato al agua deyiminin seçilmiş bir örnekten ziyade kullanışlı bir test girdisi olduğunu hassasiyetle açıklamak istiyorum.
Yerleşik bir deyimdir. Edebiyatta, gazetecilikte ve günlük konuşmada karşımıza çıkar. Belirgin değil. İspanyolca metinlerden oluşan makul bir veri kümesi üzerinde eğitilmiş herhangi bir model bunu görmüş olmalı. Modelin bu ifadeyi görüp görmediği sorusu değil. Soru, bununla ne yaptığıdır. Deyim çevirisindeki en kötü başarısızlık
modu kötü bir çeviri üretmemektir. Hedef dili bilmeyen birine kabul edilebilir görünen kelimesi kelimesine bir çeviri üretiyor. Kediyi suya götürmek dilbilgisel olarak doğru
bir İngilizcedir. Bu iyi biçimlendirilmiş. Bu, bir anlama gelebilecek bir şeye benziyor. İspanyolca bilmeyen bir kullanıcı bunu okuyabilir, başıyla onaylayabilir ve devam edebilir — orijinal anlamın tamamen kaybolduğunu asla bilmeden.
Önem verdiğim başarısızlık modu budur. Açık hata değil. Görünmez olan.
Buradaki örüntü rastgele değil. Kelimenin tam anlamıyla çeviri yapan iki model (GPT-4o-MINI ve GPT-4.1-NANO) hem daha küçük hem de hız ve maliyet verimliliği için optimize edilmiş daha hafif modellerdir. İdiomatik çeviriler üreten üç model (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) farklı bir nesli veya parametre ölçeğini temsil etmektedir.
Bu, bence yeterince araştırılmamış bir şeyi düşündürüyor: çeviride idiomatik yeterlilik, genel kıyaslamalarda görünmeyen şekillerde model kapasitesiyle ölçeklenir.
Genel dil kıyaslamaları akıl yürütme, bilgi, kodlama, matematik alanlarını test eder. Modellerin, kedilerin ve köpeklerin yağdığı ifadesinin hava koşullarıyla ilgili olmadığını veya llevarse el gato al agua ifadesinin bir kediyi sulamakla ilgili olmadığını belirleyip belirleyemediğini tipik olarak test etmezler. Deyimler, kültürel bilgi, bağlamsal çıkarım ve örüntü tanıma kesişiminde yer alır — ve bu kesişim, daha küçük modellerin tutarlı bir şekilde aşamadığı bir model kapasitesi eşiği gerektiriyor gibi görünüyor.
İddia etmediğim şey: daha büyük modellerin her zaman daha iyi çevirmen olduğudur. Bunun genel bir kural olarak kanıtı yok. Gözlemlediğim şey: özellikle deyimsel içerik için, aile içi sürüm farkı beklediğimden daha büyüktü.
Yapay zeka çeviri aracını kullanan çoğu kullanıcı, hangi sürümünü kullandıklarını bilmiyor. Bir ürün açar, bir dil çifti seçer ve bir çıktı alırlar. Model yönlendirmesi onlar için görünmezdir.
Bu, ölçekte önemlidir. MachineTranslation.com, tek bir 90 günlük dönemde yüz binlerce İngilizce-İspanyolca çeviri işini işledi. Eğer bu işlerin önemli bir kısmı deyimsel içerikle (pazarlama metni, hukuki dil, edebi metin, gündelik iletişim) ilgiliyse ve bu işleri yönlendiren araç kullanıcıları kendi bilgileri olmadan daha küçük bir modele yönlendiriyorsa, o zaman kediyi suya götürmek gerçek çıktılarda, gerçek belgelerde, sonucu güvenen gerçek insanlar için görünüyordu.
Çeviri endüstrisi yıllardır yapay zeka sağlayıcılarını karşılaştırıyor. DeepL'e karşı Google. Claude'ya karşı ChatGPT. Bu karşılaştırmalar faydalıdır . Ancak tek bir sağlayıcı içinde sürüm farkı da aynı derecede önemli olabilir — ve çoğu karşılaştırma çerçevesinin ölçmediği bir farktır çünkü model sürümü düzeyinde test yapmazlar.
Birisi Çeviri için ChatGPT kullanıyorum dediğinde, bu cümle anlamlı olacak kadar spesifik değildir . Hangi ChatGPT? Nano? 4o-mini? 4.1-mini? 5.4? Cevap, en azından deyimsel içerik için, çıktıyı önemsiz olmayan şekillerde değiştirir.
En çok ilgimi çeken kısım bu ve henüz tam olarak ne anlama geldiğini çözemedim.
Deyimsel çeviriler üreten üç model üç farklı çeviri verdi:
Her üçü de llevarse el gato al agua ifadesinin savunulabilir İngilizce karşılıklarıdır. Ancak denk değillerdir.
Başarmak zorluğa karşı uygulamayı vurgular, zor bir şey yaptınız ve işe yaradı. İstediğini elde etmekistediğiniz sonucun elde edildiğini vurgular , daha az vurgu ise zorluğa yapılır. En iyi olmak başkalarına göre kazanmak, rekabetçi zaferi vurgular.
Orijinal İspanyolca deyim bunlardan ilkine en yakındır. Bu ifade, sadece bir sonucu tercih edip gerçekleşmesini sağlamaktan ziyade, direnişin üstesinden gelme çağrışımını taşır. Ancak istediğini elde etmek ve kazançlı çıkmak yanlış değildir, sadece farklı yönlerde belirsizdirler.
Bu, gerçekten zor bulduğum bir soruyu gündeme getiriyor: üç model her biri doğru ama farklı bir deyimsel çeviri ürettiğinde, hangisinin en iyi olduğunu nasıl değerlendirirsiniz? BLEU puanları bir referans çeviriye karşı karşılaştırılır — ancak referansı kim yazdı ve bu üçünden hangisini seçmiş olurlardı?
AI Çeviri Aracımız, hakkını teslim etmek gerekirse, herhangi bir çıktıya karar vermeden önce doğru soruyu sordu: Bu bağlamda 'llevarse el gato al agua'nın amaçlanan anlamı nedir? Üç seçenek sunuldu: zor bir hedefe ulaşmak, gereksiz bir şey almak veya riskli bir faaliyette bulunmak. Bu soru dekoratif değil. Çeviri kesinleşmeden önce bağlamsal belirsizliğin giderildiği mekanizmadır.
Ancak nokta şu: üç doğru cevap, üç farklı anlam tonu. Çeviri değerlendirme araçları bu tür nüanslar için oluşturulmamıştır . Henüz bilmediğim şey
Bu testin gösterdiklerinin sınırları konusunda dürüst olmak istiyorum.
Tek deyim, tek dil çifti, bir günlük dahili test. Bu bir çalışma değil. Bir gözlemdir. Bu örüntünün (daha küçük modellerin kelimesi kelimesine, daha büyük modellerin deyimsel sonuçlar vermesi) tutarlı bir şekilde şunların genelinde geçerli olup olmadığını bilmiyorum:
Bunun bu modellerin kararlı bir özelliği mi yoksa güncellemeler ve ince ayarlar ile değişen bir şey mi olduğunu da bilmiyorum. Model sağlayıcıları çeviriye özel değişiklik günlükleri yayınlamıyor. Bugün llevarse el gato al agua deyimini doğru şekilde ele alan bir model sürümü, gelecek ay güncellenebilir ve bunu bilmenin bir yolumuz olmazdı.
Bildiklerim ise şunlar: Bu test, daha fazla dil çifti ve içerik türü genelinde daha sistematik olarak daha fazlasını çalıştırmak istediğim kadar ilginç bir sonuç üretti. Paylaşacak daha çok şeyim olduğunda paylaşacağım. Oturmaya
iki soruyla bitireceğim. Onlara cevap vermeyeceğim, henüz bunu yapacak veriye sahip değilim. Ancak bunların sorulması gereken doğru sorular olduğunu düşünüyorum.
İlk olarak: Hangi parametre eşiğinde deyimsel yeterlilik güvenilir hale gelir?
GPT-4o-MINI ve GPT-4.1-NANO'dan (ikisi de kelimesi kelimesine) GPT-4.1-MINI'ye (deyimsel) geçiş, bu model boyutları arasındaki parametre aralığında bir yerde bir eşik olduğunu göstermektedir; burada deyim tanıma devreye girer. Tutarlı mı? Bu, tüm dillerdeki deyimler için mi geçerlidir, yoksa dilin eğitim verilerinde ne kadar iyi temsil edildiğine mi bağlıdır? Bilmiyorum. Ancak çeviri iş akışları oluşturan herkes için bu bilgi faydalı olacaktır. İkinci olarak, model sürümü opaklığının kullanıcılara maliyeti ölçekte nedir? Bir kullanıcı, hangi model sürümünün kullanıldığını açıklanmayan (ve
bu belgelerin bazılarında deyimsel içerik bulunan) bir araçtan
ayda 1.000 belge yönlendirirse, kelimenin tam anlamıyla başarısızlık ne sıklıkla görünmez bir şekilde gerçekleşiyor? Nasıl bilebilirlerdi? Gerçek anlamda öğrenememenin maliyeti nedir?
Bence bu, şu anda dolaşımda olan çeviri için en iyi yapay zeka hangisi karşılaştırmalarının çoğundan daha önemli bir soru. Cevap en büyük modeli kullan değil. Cevap şu olabilir: Neler kullandığınızı bilin, kendi içeriğiniz üzerinde kendi testlerinizi çalıştırın ve bir sağlayıcının adının, model aralığında tutarlı bir davranışın garantisi olduğunu varsaymayın. Yani, en azından bu testten çıkardığım sonuç bu.
Yani, en azından bu testten çıkardığım sonuç bu.
Bu tek teste dayanarak: aynı yapay zeka ailesi içindeki daha küçük, verimlilik odaklı modeller yerleşik bir İspanyol deyiminin kelimesi kelimesine çevrilmesine varsayılan olarak ayarlanırken, aynı modelin daha büyük/yeni sürümleri doğru deyimsel çeviriler üretti. Bu durumun deyim kategorileri ve dil çiftleri arasında geçerli olup olmadığı bir sonraki sorudur. Daha fazla test yapacağım.
GPT-4.1-MINI, GPT-5.4-MINI ve GPT-5.4, llevarse el gato al agua deyimini deyimsel olarak çevirdi — ancak ince farklı anlamlara sahip farklı İngilizce ifadelere. Bu, deyimsel çeviri kalitesinin en az iki boyutu olduğunu göstermektedir : modelin deyimi hiç tanıyıp tanımadığı ve hedef dilin mevcut seçeneklerinden hangi eşdeğer ifadeyi seçtiği. Standart çeviri kalitesi ölçütleri bu iki boyutu temiz bir şekilde ayıramaz . Bence yapmalılar.
Bu gönderi, MachineTranslation.com'un geliştirme platformunda yapılan dahili testlere dayanmaktadır. Burada gösterilen çoklu model sürüm testi henüz kamuya açık değildir. Çevirilerinizi nerede yaparsanız yapın bu gözlemin faydalı olacağını düşündüğüm için bulguyu paylaşıyorum.