June 5, 2026

نفس الذكاء الاصطناعي، نموذج مختلف — والترجمات لا يمكن أن تكون مختلفة أكثر

لقد‎ ‎كنت‎ ‎أجري‎ ‎اختبارات‎ ‎داخلية‎ ‎على‎ ‎شيء‎ ‎لا‎ ‎نتحدث‎ ‎عنه‎ ‎بما‎ ‎فيه‎ ‎الكفاية‎ ‎في‎ ‎صناعة‎ ‎الترجمة‎: ‎ليس‎ ‎ما‎ ‎إذا‎ ‎كانت‎ ‎أنظمة‎ ‎الذكاء‎ ‎الاصطناعي‎ ‎المختلفة‎ ‎تترجم‎ ‎بشكل‎ ‎مختلف،‎ ‎ولكن‎ ‎ما‎ ‎إذا‎ ‎كانت‎ ‎الإصدارات‎ ‎المختلفة‎ ‎من‎ ‎نفس‎ ‎الذكاء‎ ‎الاصطناعي‎ ‎تترجم‎ ‎بشكل‎ ‎مختلف‎ - ‎وبأي‎ ‎قدر‎. ‎في‎ ‎الأسبوع‎ ‎الماضي،‎ ‎قمت‎ ‎بتشغيل‎ ‎تعبير‎ ‎إسباني‎ ‎واحد‎ ‎عبر‎ ‎خمسة‎ ‎إصدارات‎ ‎من‎ ChatGPT ‎في‎ ‎وقت‎ ‎واحد‎ ‎على‎ ‎المنصة‎ ‎الاختبارية‎ ‎الداخلية‎ ‎لـ‎ MachineTranslation.com. ‎ما‎ ‎عاد‎ ‎أوقفني‎. ‎أنتج‎ ‎إصداران‎ ‎ترجمة،‎ ‎بكل‎ ‎صدق،‎ ‎لا‎ ‎معنى‎ ‎لها‎ ‎باللغة‎ ‎الإنجليزية‎. أنتجت‎ ‎ثلاثة‎ ‎إصدارات‎ ‎ترجمات‎ ‎صحيحة‎ ‎وسليمة‎ ‎لغويًا‎. ولم‎ ‎يتفق‎ ‎الثلاثة‎ ‎الصحيحون‎ ‎مع‎ ‎بعضهم‎ ‎البعض‎. ‎ الخمسة‎ ‎كلهم‎ ‎شات‎ ‎جي‎ ‎بي‎ ‎

تي‎. الخمسة‎ ‎جميعًا‎ ‎من‎ OpenAI. نفس‎ ‎الذكاء‎ ‎الاصطناعي،‎ ‎نموذج‎ ‎مختلف‎ —‎ ولا‎ ‎يمكن‎ ‎أن‎ ‎تكون‎ ‎المخرجات‎ ‎مختلفة‎. ‎أشارك‎ ‎هذا‎ ‎الآن‎ ‎لأنني‎ ‎أعتقد‎ ‎أنه‎ ‎مهم،‎ ‎وليس‎ ‎لأن‎ ‎لدي‎ ‎إجابات واضحة‎. لا‎ ‎أفعل‎. ولكن‎ ‎الملاحظة‎ ‎مثيرة‎ ‎للاهتمام‎ ‎بما‎ ‎يكفي‎ ‎لوضعها‎ ‎في‎ ‎العالم‎. ‎جدول‎ ‎ المحتويات‎ ‎الاختبار‎:‎

  • تعبير‎ ‎اصطلاحي‎ ‎إسباني‎ ‎واحد،‎ ‎خمسة‎ ‎إصدارات‎ ‎من‎ GPT
  • لماذا‎ ‎يعتبر‎ ‎هذا‎ ‎التعبير‎ ‎الاصطلاحي‎ ‎حالة‎ ‎اختبار‎ ‎جيدة
  • ماذا‎ ‎يخبرنا‎ ‎الانقسام‎ ‎من‎ ‎الحرفي‎ ‎إلى‎ ‎الاصطلاحي‎ ‎عن‎ ‎كيفية‎ ‎تدريب‎ ‎هذه‎ ‎النماذج
  • الآثار‎ ‎المترتبة‎ ‎على‎ ‎أن‎ ‎لا‎ ‎أحد‎ ‎يبدو‎ ‎أنه‎ ‎يتحدث‎ ‎عنها
  • حتى‎ ‎الترجمات‎ ‎الصحيحة‎ ‎اختلفت‎ ‎مع‎ ‎بعضها‎ ‎البعض
  • ما‎ ‎لا‎ ‎أعرفه‎ ‎بعد
  • سؤالان‎ ‎بحثيان‎ ‎يستحقان‎ ‎التأمل

الاختبار‎: تعبير‎ ‎اصطلاحي‎ ‎إسباني‎ ‎واحد،‎ ‎خمسة‎ ‎إصدارات‎ ‎من‎ GPT ‎

العبارة‎ ‎التي‎ ‎اختبرتها‎ ‎كانت‎ ‏llevarse el gato al agua‎.‎


إليك‎ ‎ما‎ ‎أنتجه‎ ‎كل‎ ‎إصدار‎:‎

النموذج ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎  الناتج ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎   اصطلاحي؟
شات‎ ‎جي‎ ‎بي‎ ‎تي‎:: ‎جي‎ ‎بي‎ ‎تي‎-4o-‎ميني حمل‎ ‎القطة‎ ‎إلى‎ ‎الماء ‎❌ ‎حرفي
شات‎ ‎جي‎ ‎بي‎ ‎تي‎:: ‎جي‎ ‎بي‎ ‎تي‎-4.1-‎نانو حمل‎ ‎القطة‎ ‎إلى‎ ‎الماء ‎❌ ‎حرفي
شات‎ ‎جي‎ ‎بي‎ ‎تي‎:: ‎جي‎ ‎بي‎ ‎تي‎-4.1-‎ميني تحقيق‎ ‎النجاح ‎✅ ‎صحيح
شات‎ ‎جي‎ ‎بي‎ ‎تي‎:: ‎جي‎ ‎بي‎ ‎تي‎-5.4-‎ميني تحقيق‎ ‎ما‎ ‎تريد ‎✅ ‎جزئي
شات‎ ‎جي‎ ‎بي‎ ‎تي‎:: ‎جي‎ ‎بي‎ ‎تي‎-5.4 الخروج‎ ‎منتصراً ‎✅ ‎صحيح

العبارة‎ ‎تعني‎ ‎تحقيق‎ ‎شيء‎ ‎صعب‎ ‎ضد‎ ‎الصعاب،‎ ‎أي‎ ‎ تحقيق‎ ‎فوز‎ ‎صعب‎. ليس‎ ‎له‎ ‎علاقة‎ ‎بالقطط‎ ‎أو‎ ‎الماء‎. الترجمة‎ ‎الحرفية‎ ‎ليست‎ ‎ترجمة‎. إنه‎ ‎نسخ‎ ‎كلمة‎ ‎بكلمة ‎ ‎لعبارة‎ ‎فشل‎ ‎النموذج‎ ‎في‎ ‎التعرف‎ ‎عليها‎ ‎على‎ ‎أنها‎ ‎تعبير‎ ‎اصطلاحي‎.‎

‎ ‎أنتج‎ GPT-4o-MINI ‎و‎ GPT-4.1-NANO ‎مخرجات‎ ‎متطابقة‎. غير‎ ‎متشابه،‎ ‎متطابق‎. أشارت‎ ‎رؤى‎ ‎الترجمة‎ ‎لدينا‎ ‎إلى‎ ‎هذا‎ ‎مباشرةً‎: تترجم‎ ‎نماذج‎ GPT-4.1-nano ‎ ‎و‎ GPT-4o-mini ‎الترجمات‎ ‎المتطابقة،‎ ‎مع‎ ‎التركيز‎ ‎على‎ ‎التفسير‎ ‎الحرفي ‎ ‎بدلاً‎ ‎من‎ ‎المعنى‎ ‎الاصطلاحي‎.‎

‎ ‎أنتج‎ ‎كل‎ ‎من‎ GPT-4.1-MINI ‎و‎ GPT-5.4-MINI ‎و‎ GPT-5.4 ‎شيئًا‎ ‎صحيحًا‎ ‎بشكل‎ ‎ملحوظ‎ - ‎ولكنه‎ ‎ليس‎ ‎متطابقًا‎ ‎مع‎ ‎بعضه‎ ‎البعض‎.‎

‎ ‎لماذا‎ ‎يشكل‎ ‎هذا‎ ‎الاصطلاح‎ ‎حالة‎ ‎اختبار‎ ‎جيدة

‎ ‎أريد‎ ‎أن‎ ‎أكون‎ ‎دقيقًا‎ ‎بشأن‎ ‎سبب‎ ‎كون‎ ‏llevarse el gato al agua‎ ‎مدخل‎ ‎اختبار‎ ‎مفيد‎ ‎بدلاً‎ ‎من‎ ‎كونه‎ ‎مدخلًا‎ ‎تم‎ ‎اختياره‎ ‎بعناية‎.‎

‎ ‎إنه‎ ‎اصطلاح‎ ‎راسخ‎. يظهر‎ ‎في‎ ‎الأدب‎ ‎والصحافة‎ ‎والحديث‎ ‎ اليومي‎. ليس‎ ‎غامضًا‎. أي‎ ‎نموذج‎ ‎تم‎ ‎تدريبه‎ ‎على‎ ‎مجموعة‎ ‎معقولة‎ ‎من‎ ‎النصوص‎ ‎الإسبانية‎ ‎يجب‎ ‎أن‎ ‎يكون‎ ‎قد‎ ‎ واجهه‎. السؤال‎ ‎ليس‎ ‎ما‎ ‎إذا‎ ‎كان‎ ‎النموذج‎ ‎قد‎ ‎رأى‎ ‎العبارة‎. السؤال ‎ ‎هو‎ ‎ما‎ ‎يفعله‎ ‎به‎. ‎

‎ ‎أسوأ‎ ‎وضع‎ ‎للفشل‎ ‎في‎ ‎ترجمة‎ ‎التعبيرات‎ ‎الاصطلاحية‎ ‎ليس‎ ‎إنتاج‎ ‎ترجمة‎ ‎سيئة ‎. ينتج‎ ‎ترجمة‎ ‎حرفية‎ ‎تبدو‎ ‎مقبولة‎ ‎لشخص‎ ‎لا‎ ‎يعرف‎ ‎اللغة‎ ‎المستهدفة‎. ‎حمل‎ ‎القطة‎ ‎إلى‎ ‎الماء‎ ‎هي‎ ‎عبارة‎ ‎صحيحة‎ ‎نحوياً‎ ‎باللغة‎ ‎الإنجليزية‎.‎

إنه حسن‎ ‎التكوين‎. يبدو‎ ‎الأمر‎ ‎وكأنه‎ ‎شيء‎ ‎يمكن‎ ‎أن‎ ‎يعني‎ ‎شيئًا‎ ‎ما‎.‎ ‎ ‎قد‎ ‎يقرأه‎ ‎مستخدم‎ ‎لا‎ ‎يتحدث‎ ‎الإسبانية،‎ ‎يومئ‎ ‎برأسه،‎ ‎ويمضي‎ ‎قدمًا‎ —‎ ‎ ‎دون‎ ‎أن‎ ‎يعرف‎ ‎أبدًا‎ ‎أن‎ ‎المعنى‎ ‎الأصلي‎ ‎قد‎ ‎ضاع‎ ‎تمامًا‎.‎

‎ ‎هذا‎ ‎هو‎ ‎وضع‎ ‎الفشل‎ ‎الذي‎ ‎أهتم‎ ‎به‎. ليس‎ ‎الخطأ‎ ‎الواضح‎. الواحد‎ ‎غير‎ ‎المرئي‎. ‎ما‎ ‎يخبرنا‎ ‎به‎ ‎الانقسام‎ ‎الحرفي‎ ‎إلى‎ ‎الاصطلاحي‎ ‎عن‎ ‎كيفية‎ ‎تدريب‎ ‎

هذه‎ ‎النماذج‎. ‎النمط‎ ‎هنا‎ ‎ليس‎ ‎

عشوائيًا‎. النموذجان‎ ‎اللذان‎ ‎أنتجا‎ ‎ترجمات‎ ‎حرفية ‎ (GPT-4o-MINI ‎و‎ GPT-4.1-NANO) ‎كلاهما‎ ‎نموذجان‎ ‎أصغر ‎ ‎وأخف‎ ‎وزناً‎ ‎محسّنان‎ ‎للسرعة‎ ‎والكفاءة‎ ‎من‎ ‎حيث‎ ‎التكلفة‎. تمثل‎ ‎النماذج‎ ‎الثلاثة ‎ ‎التي‎ ‎أنتجت‎ ‎ترجمات‎ ‎اصطلاحية‎ (GPT-4.1-MINI‏،‎ GPT-5.4-MINI‏،‎ GPT-5.4) ‎جيلاً‎ ‎مختلفًا‎ ‎أو‎ ‎مقياسًا‎ ‎مختلفًا‎ ‎للمعلمات‎.‎

‎ ‎هذا‎ ‎يشير‎ ‎إلى‎ ‎شيء‎ ‎أعتقد‎ ‎أنه‎ ‎لم‎ ‎يتم‎ ‎استكشافه‎ ‎بشكل‎ ‎كافٍ‎: ‎الكفاءة‎ ‎الاصطلاحية‎ ‎في‎ ‎الترجمة‎ ‎تتناسب‎ ‎مع‎ ‎قدرة‎ ‎النموذج‎ ‎بطرق‎ ‎غير‎ ‎مرئية‎ ‎في‎ ‎المعايير‎ ‎العامة‎.‎

‎ ‎تختبر‎ ‎المعايير‎ ‎اللغوية‎ ‎العامة‎ ‎الاستدلال‎ ‎والمعرفة‎ ‎والبرمجة ‎ ‎والرياضيات‎. لا‎ ‎يختبرون‎ ‎عادةً‎ ‎ما‎ ‎إذا‎ ‎كان‎ ‎النموذج‎ ‎يمكنه‎ ‎تحديد‎ ‎ ‎ ‎أن‎ ‎‎ ‎المطر‎ ‎ينهمر‎ ‎كأنه‎ ‎يصب‎ ‎لا‎ ‎يتعلق‎ ‎بظروف‎ ‎الطقس،‎ ‎ ‎ ‎أو‎ ‎أن‎ ‏llevarse el gato al agua‎ ‎لا‎ ‎يتعلق‎ ‎بترطيب‎ ‎قطة‎. ‎ ‎ ‎تقع‎ ‎التعابير‎ ‎الاصطلاحية‎ ‎عند‎ ‎تقاطع‎ ‎المعرفة‎ ‎الثقافية،‎ ‎والاستدلال‎ ‎السياقي‎ ‎ ،‎ ‎والتعرف‎ ‎على‎ ‎الأنماط‎ - ‎وهذا‎ ‎التقاطع‎ ‎يبدو‎ ‎ ‎ ‎أنه‎ ‎يتطلب‎ ‎عتبة‎ ‎من‎ ‎سعة‎ ‎النموذج‎ ‎لا‎ ‎تتجاوزها‎ ‎النماذج‎ ‎الأصغر‎ ‎ ‎ ‎باستمرار‎. ‎

‎ ‎ما‎ ‎لا‎ ‎أدعيه‎: ‎أن‎ ‎النماذج‎ ‎الأكبر‎ ‎هي‎ ‎دائمًا‎ ‎مترجمات‎ ‎ ‎ ‎أفضل‎. ليس‎ ‎لدي‎ ‎دليل‎ ‎على‎ ‎ذلك‎ ‎كقاعدة‎ ‎عامة‎.‎ ‎ ‎ما‎ ‎ألاحظه‎: ‎أنه‎ ‎بالنسبة‎ ‎للمحتوى‎ ‎الاصطلاحي‎ ‎على‎ ‎وجه‎ ‎التحديد، ‎ ‎كانت‎ ‎الفجوة‎ ‎بين‎ ‎النسخ‎ ‎داخل‎ ‎العائلة‎ ‎أكبر‎ ‎مما‎ ‎توقعت‎.‎

‎ ‎الضمني‎ ‎الذي‎ ‎يبدو‎ ‎أن‎ ‎لا‎ ‎أحد‎ ‎يتحدث‎ ‎عنه

‎ ‎معظم‎ ‎المستخدمين‎ ‎الذين‎ ‎يستخدمون‎ ‎أداة‎ ‎ترجمة‎ ‎بالذكاء‎ ‎الاصطناعي‎ ‎لا‎ ‎يعرفون‎ ‎أي‎ ‎إصدار ‎ ‎من‎ ‎هذا‎ ‎الذكاء‎ ‎الاصطناعي‎ ‎يستخدمونه‎. يفتحون‎ ‎منتجًا،‎ ‎ويختارون‎ ‎زوج‎ ‎لغات ،‎ ‎ويحصلون‎ ‎على‎ ‎مخرجات‎. التوجيه‎ ‎النموذجي‎ ‎غير‎ ‎مرئي‎ ‎لهم‎. ‎

‎ ‎هذا‎ ‎مهم‎ ‎على‎ ‎نطاق‎ ‎واسع‎. قامت‎ MachineTranslation.com ‎بمعالجة‎ ‎أكثر‎ ‎من‎ ‎مئات‎ ‎الآلاف‎ ‎من‎ ‎مهام‎ ‎الترجمة‎ ‎من‎ ‎الإنجليزية‎ ‎إلى‎ ‎الإسبانية‎ ‎في‎ ‎فترة‎ 90 ‎يومًا‎ ‎واحدة‎. إذا‎ ‎كان‎ ‎جزء‎ ‎كبير‎ ‎من‎ ‎تلك‎ ‎الوظائف‎ ‎يمس‎ ‎المحتوى‎ ‎الاصطلاحي‎ (‎نصوص‎ ‎التسويق،‎ ‎اللغة‎ ‎القانونية،‎ ‎النصوص‎ ‎الأدبية،‎ ‎التواصل‎ ‎العادي‎) ‎والأداة‎ ‎التي‎ ‎توجه‎ ‎تلك‎ ‎الوظائف‎ ‎كانت‎ ‎توجه‎ ‎المستخدمين‎ ‎إلى‎ ‎نموذج‎ ‎أصغر‎ ‎دون‎ ‎علمهم،‎ ‎فإن‎ ‎حمل‎ ‎القطة‎ ‎إلى‎ ‎الماء‎ ‎كان‎ ‎يظهر‎ ‎في‎ ‎مخرجات‎ ‎حقيقية،‎ ‎في‎ ‎مستندات‎ ‎حقيقية،‎ ‎لأشخاص‎ ‎حقيقيين‎ ‎وثقوا‎ ‎بالنتيجة‎. ‎قضت‎ ‎صناعة‎ ‎الترجمة‎ ‎سنوات‎ ‎في‎ ‎مقارنة‎ ‎مزودي‎ ‎الذكاء‎ ‎الاصطناعي‎. ‎ديب‎ ‎إل‎ ‎مقابل‎ ‎ جوجل‎.‎

كلود‎ ‎مقابل‎ ‎شات‎ ‎جي‎ ‎بي‎ ‎تي‎. تلك‎ ‎المقارنات‎ ‎مفيدة ‎. ولكن‎ ‎ضمن‎ ‎موفر‎ ‎واحد،‎ ‎قد‎ ‎يكون‎ ‎فجوة‎ ‎الإصدار‎ ‎كبيرة‎ ‎بنفس‎ ‎القدر‎ - ‎وهي‎ ‎فجوة‎ ‎لا‎ ‎تقيسها‎ ‎معظم‎ ‎أطر‎ ‎المقارنة‎ ‎لأنها‎ ‎لا‎ ‎تختبر‎ ‎على‎ ‎مستوى‎ ‎إصدار‎ ‎النموذج‎. ‎عندما‎ ‎يقول‎ ‎شخص‎ ‎ما‎ ‎أنا‎ ‎أستخدم‎ ChatGPT ‎للترجمة،‎ ‎فإن‎ ‎هذه‎ ‎الجملة‎ ‎ليست‎ ‎محددة‎ ‎بما‎ ‎يكفي‎ ‎لتكون‎ ‎ذات‎ ‎ مغزى‎.‎

أي‎ ‎شات‎ ‎جي‎ ‎بي‎ ‎تي؟ نانو؟ ‎4o-‎ميني؟ ٤‏‎.‎١‏‎-‎مصغر؟ 5.4? تتغير‎ ‎الإجابة‎ ‎في‎ ‎المخرجات‎ ‎بطرق غير‎ ‎تافهة،‎ ‎على‎ ‎الأقل‎ ‎للمحتوى‎ ‎الاصطلاحي‎. ‎

حتى‎ ‎الترجمات‎ ‎الصحيحة‎ ‎اختلفت‎ ‎عن‎ ‎بعضها‎ ‎البعض

هذا‎ ‎هو‎ ‎الجزء‎ ‎الذي‎ ‎أجده‎ ‎الأكثر‎ ‎إثارة‎ ‎للاهتمام،‎ ‎ولم‎ ‎أكتشف‎ ‎بعد‎ ‎تمامًا‎ ‎ما‎ ‎الذي‎ ‎يجب‎ ‎فعله‎ ‎به‎.‎

النماذج‎ ‎الثلاثة‎ ‎التي‎ ‎أنتجت‎ ‎ترجمات‎ ‎اصطلاحية‎ ‎أعطت‎ ‎ثلاث‎ ‎ترجمات مختلفة‎:‏

  • GPT-4.1-MINI: to pull it off successfully
  • GPT-5.4-MINI: to get one's way
  • GPT-5.4: to come out on top

كلها‎ ‎ثلاث‎ ‎ترجمات‎ ‎إنجليزية‎ ‎قابلة‎ ‎للدفاع‎ ‎عنها‎ ‎لـ‎ ‏llevarse el gato al agua‎. لكنهما‎ ‎ليسا‎ ‎متكافئين‎.‎

لتحقيق‎ ‎ذلك‎ ‎يؤكد‎ ‎على‎ ‎التنفيذ‎ ‎مقابل‎ ‎الصعوبة،‎ ‎لقد فعلت‎ ‎شيئًا‎ ‎صعبًا‎ ‎ونجح‎. لتحقيق‎ ‎ما‎ ‎يريديؤكد على‎ ‎تحقيق‎ ‎النتيجة‎ ‎التي‎ ‎أردتها،‎ ‎مع‎ ‎التركيز‎ ‎بشكل‎ ‎أقل‎ ‎على الصعوبة‎. ‎ ‎الخروج‎ ‎في‎ ‎المقدمة‎ ‎‎ ‎يؤكد‎ ‎على‎ ‎النصر‎ ‎التنافسي،‎ ‎والفوز‎ ‎بالنسبة‎ ‎للآخرين‎. ‎

‎ ‎العبارة‎ ‎الإسبانية‎ ‎الأصلية‎ ‎أقرب‎ ‎إلى‎ ‎الأولى‎ ‎من‎ ‎هذه‎. ‎ ‎ ‎تحمل‎ ‎العبارة‎ ‎دلالة‎ ‎على‎ ‎التغلب‎ ‎على‎ ‎المقاومة،‎ ‎وليس‎ ‎ ‎ ‎مجرد‎ ‎تفضيل‎ ‎نتيجة‎ ‎واحدة‎ ‎وتحقيقها‎. لكن‎ ‎أن‎ ‎يحصل‎ ‎المرء‎ ‎على‎ ‎ما‎ ‎يريد‎ ‎و‎ ‎أن‎ ‎يخرج‎ ‎منتصراً‎ ‎ليسا‎ ‎خاطئين،‎ ‎بل‎ ‎هما‎ ‎فقط‎ ‎غير‎ ‎دقيقين‎ ‎في‎ ‎اتجاهات‎ ‎مختلفة‎. ‎هذا‎ ‎يطرح‎ ‎سؤالاً‎ ‎أجده‎ ‎صعباً‎ ‎حقاً‎: ‎عندما‎ ‎تنتج‎ ‎ثلاثة‎ ‎نماذج‎ ‎كل‎ ‎منها‎ ‎ترجمة‎ ‎اصطلاحية‎ ‎صحيحة‎ ‎ولكنها‎ ‎مختلفة،‎ ‎كيف‎ ‎تقيّم‎ ‎أيها‎ ‎

الأفضل؟ تقارن‎ ‎درجات‎ BLEU ‎بالترجمة‎ ‎المرجعية‎ — ‎ولكن‎ ‎من‎ ‎كتب‎ ‎المرجع،‎ ‎وأيها من‎ ‎هذه‎ ‎الثلاثة‎ ‎كانوا‎ ‎سيختارونها؟

وكيل‎ ‎الترجمة‎ ‎بالذكاء‎ ‎الاصطناعي‎ ‎لدينا،‎ ‎لصالحه،‎ ‎طرح‎ ‎السؤال‎ ‎الصحيح قبل‎ ‎الالتزام‎ ‎بأي‎ ‎مخرجات‎: ما‎ ‎المعنى‎ ‎المقصود‎ ‎بـ‎ llevarse el gato al agua ‎في‎ ‎هذا‎ ‎السياق؟ تم‎ ‎تقديم‎ ‎ثلاثة‎ ‎خيارات‎ - ‎تحقيق‎ ‎هدف‎ ‎صعب،‎ ‎أو‎ ‎أخذ‎ ‎شيء‎ ‎غير‎ ‎ضروري،‎ ‎أو‎ ‎الانخراط‎ ‎في‎ ‎نشاط‎ ‎محفوف‎ ‎ بالمخاطر‎.‎ هذا‎ ‎السؤال‎ ‎ليس‎ ‎ تزيينياً‎. إنها‎ ‎الآلية‎ ‎التي‎ ‎يتم‎ ‎بها‎ ‎حل‎ ‎الغموض‎ ‎السياقي ‎ ‎قبل‎ ‎الانتهاء‎ ‎من‎ ‎الترجمة‎. ‎

لكن‎ ‎النقطة‎ ‎المهمة‎ ‎هي‎: ‎ثلاث‎ ‎إجابات‎ ‎صحيحة،‎ ‎وثلاث‎ ‎درجات‎ ‎مختلفة ‎ ‎من‎ ‎المعنى‎. أدوات‎ ‎تقييم‎ ‎الترجمة‎ ‎ليست‎ ‎مبنية ‎ ‎لهذا‎ ‎النوع‎ ‎من‎ ‎الدقة‎. ‎

ما‎ ‎لا‎ ‎أعرفه‎ ‎بعد

أريد‎ ‎أن‎ ‎أكون‎ ‎صريحًا‎ ‎بشأن‎ ‎حدود‎ ‎ما‎ ‎يظهره‎ ‎هذا‎ ‎الاختبار‎.‎

تعبير‎ ‎اصطلاحي‎ ‎واحد،‎ ‎زوج‎ ‎لغوي‎ ‎واحد،‎ ‎يوم‎ ‎واحد‎ ‎من‎ ‎الاختبار‎ ‎الداخلي‎. هذه‎ ‎ليست‎ ‎دراسة‎. إنها‎ ‎ملاحظة‎. لا‎ ‎أعرف‎ ‎ما‎ ‎إذا‎ ‎كان‎ ‎هذا‎ ‎النمط‎ (‎النماذج‎ ‎الأصغر‎ ‎تفترض‎ ‎الحرفية،‎ ‎والنماذج‎ ‎الأكبر‎ ‎تحقق‎ ‎الاصطلاحية‎) ‎ينطبق‎ ‎باستمرار‎ ‎ عبر‎: ‎أزواج‎ ‎لغوية‎ ‎أخرى‎ ‎ذات‎ ‎تقاليد‎ ‎اصطلاحية‎ ‎غنية‎ (‎العربية‎ ‎واليابانية‎ ‎والروسية‎ ‎كلها‎ ‎تخطر‎ ‎ببالي‎) ‎محتوى‎ ‎غير‎ ‎اصطلاحي‎ ‎حيث‎ ‎لا‎ ‎ينطبق‎ ‎التمييز‎ ‎حالات‎ ‎استثنائية‎ ‎حيث‎ ‎يحصل‎ ‎نموذج‎ ‎أصغر‎ ‎على‎ ‎الاصطلاح‎ ‎بشكل‎ ‎صحيح‎ ‎ويخطئ‎ ‎نموذج‎ ‎أكبر‎ ‎لا‎ ‎أعرف‎ ‎أيضًا‎ ‎ما‎ ‎إذا‎ ‎كانت‎ ‎هذه‎ ‎خاصية‎ ‎مستقرة‎ ‎لهذه‎ ‎ النماذج‎ ‎أو‎ ‎شيء‎ ‎يتغير‎ ‎مع‎ ‎التحديثات‎ ‎والضبط‎ ‎الدقيق‎. ‎لا‎ ‎ينشر‎ ‎مقدمو‎ ‎النماذج‎ ‎سجلات‎ ‎تغيير‎ ‎خاصة‎ ‎بالترجمة‎. ‎قد‎ ‎يتم‎ ‎تحديث‎ ‎نموذج‎ ‎يتعامل‎ ‎مع‎ llevarse el gato al

  • agua ‎بشكل‎ ‎صحيح‎ ‎اليوم‎ ‎في‎ ‎الشهر‎ ‎المقبل،‎ ‎
  • ولن‎ ‎تكون‎ ‎لدينا‎ ‎طريقة‎ ‎لمعرفة‎ ‎ذلك‎. ‎ما‎ ‎أعرفه‎: ‎أنتج‎ ‎هذا‎ ‎الاختبار‎ ‎نتيجة‎ ‎مثيرة‎ ‎للاهتمام‎ ‎بما‎ ‎ يكفي‎ ‎لدرجة‎ ‎أنني‎ ‎أرغب‎ ‎في‎ ‎إجراء‎ ‎المزيد‎ ‎منها،‎ ‎
  • وبشكل‎ ‎منهجي‎ ‎أكثر،‎ ‎عبر‎ ‎المزيد‎ ‎من‎ ‎الأزواج‎ ‎
  • اللغوية‎ ‎وأنواع‎ ‎ المحتوى‎.‎

عندما‎ ‎يكون‎ ‎لدي‎ ‎المزيد‎ ‎لأشاركه،‎ ‎سأفعل‎ ‎ذلك‎. ‎سؤالان‎ ‎بحثيان‎ ‎يستحقان‎ ‎التأمل‎ ‎سأختتم‎ ‎بالسؤالين‎ ‎اللذين‎ ‎تركني‎ ‎بهما‎ ‎هذا‎ ‎

الاختبار‎.‎

لن‎ ‎أجيب‎ ‎عليها،‎ ‎ليس‎ ‎لدي‎ ‎البيانات‎ ‎ اللازمة‎ ‎لذلك‎ ‎بعد‎. لكن‎ ‎أعتقد‎ ‎أنها‎ ‎الأسئلة‎ ‎الصحيحة‎ ‎التي‎ ‎يجب‎ ‎طرحها‎. ‎أولاً‎: ‎عند‎ ‎أي‎ ‎عتبة‎ ‎للمعاملات‎ ‎تصبح‎ ‎الكفاءة‎ ‎الاصطلاحية‎ ‎موثوقة؟‎ ‎القفزة‎ ‎من‎ GPT-4o-MINI ‎و‎ GPT-4.1-NANO (‎كلاهما‎ ‎حرفي‎) ‎إلى‎ GPT-4.1-MINI (‎اصطلاحي‎) ‎تشير‎ ‎إلى‎ ‎وجود‎ ‎عتبة‎ ‎

في‎ ‎مكان‎ ‎ما‎ ‎في‎ ‎نطاق‎ ‎المعاملات‎ ‎بين‎ ‎أحجام‎ ‎النماذج‎ ‎تلك‎ ‎حيث‎ ‎يتم‎ ‎تشغيل‎ ‎التعرف‎ ‎على‎ ‎ الاصطلاحات‎.‎

هل‎ ‎هو‎ ‎متناسق؟ هل‎ ‎ينطبق‎ ‎على‎ ‎التعابير‎ ‎الاصطلاحية ‎ ‎عبر‎ ‎جميع‎ ‎اللغات،‎ ‎أم‎ ‎أنه‎ ‎يعتمد‎ ‎على‎ ‎مدى‎ ‎تمثيل ‎ ‎لغة‎ ‎ما‎ ‎في‎ ‎بيانات‎ ‎التدريب؟ لا‎ ‎أعرف‎. ولكن‎ ‎معرفة ستكون‎ ‎مفيدة‎ ‎لأي‎ ‎شخص‎ ‎يبني‎ ‎تدفقات‎ ‎عمل‎ ‎الترجمة‎.‎

ثانياً‎: ‎ما‎ ‎هي‎ ‎تكلفة‎ ‎غموض‎ ‎إصدار‎ ‎النموذج‎ ‎على‎ ‎المستخدمين‎ ‎على‎ ‎نطاق‎ ‎واسع؟

إذا‎ ‎قام‎ ‎مستخدم‎ ‎بتوجيه‎ 1000 ‎مستند‎ ‎شهريًا‎ ‎عبر‎ ‎أداة لا‎ ‎تكشف‎ ‎عن‎ ‎إصدار‎ ‎النموذج‎ ‎المستخدم‎ (‎وبعض هذه‎ ‎المستندات‎ ‎تحتوي‎ ‎على‎ ‎محتوى‎ ‎اصطلاحي‎)‎،‎ ‎فكم‎ ‎مرة‎ ‎يحدث الفشل‎ ‎الحرفي‎ ‎بشكل‎ ‎غير‎ ‎مرئي؟ كيف‎ ‎سيعرفون؟ ما‎ ‎هي‎ ‎التكلفة،‎ ‎بالمعنى‎ ‎الحقيقي،‎ ‎لعدم‎ ‎اكتشاف‎ ‎ذلك‎ ‎أبداً؟

أعتقد‎ ‎أن‎ ‎هذا‎ ‎سؤال‎ ‎أكثر‎ ‎أهمية‎ ‎من‎ ‎معظم‎ ‎مقارنات ‎ ‎أي‎ ‎ذكاء‎ ‎اصطناعي‎ ‎هو‎ ‎الأفضل‎ ‎للترجمة‎ ‎المتداولة‎ ‎حالياً‎.‎ الإجابة‎ ‎ليست‎ ‎استخدم‎ ‎أكبر‎ ‎نموذج‎. ‎ ‎ ‎قد‎ ‎تكون‎ ‎الإجابة‎: ‎‎ ‎اعرف‎ ‎ما‎ ‎تستخدمه،‎ ‎وقم‎ ‎بإجراء‎ ‎اختباراتك‎ ‎الخاصة‎ ‎على‎ ‎المحتوى‎ ‎الخاص‎ ‎بك،‎ ‎ولا‎ ‎تفترض‎ ‎أن‎ ‎اسم‎ ‎مزود‎ ‎واحد‎ ‎ ‎ ‎هو‎ ‎ضمان‎ ‎للسلوك‎ ‎المتسق‎ ‎عبر‎ ‎نطاق‎ ‎نماذجهم‎. ‎ ‎ ‎‎ ‎

‎ ‎

‎ ‎هذا‎ ‎على‎ ‎الأقل‎ ‎ما‎ ‎أستخلصه‎ ‎من‎ ‎هذا‎ ‎الاختبار‎. ‎

‎ ‎

‎ ‎‎ ‎أسئلة‎ ‎البحث‎ ‏‎ ‏

‎ 1. هل‎ ‎يتنبأ‎ ‎حجم‎ ‎النموذج‎ ‎بشكل‎ ‎موثوق‎ ‎بجودة‎ ‎الترجمة‎ ‎الاصطلاحية؟‎ ‎بناءً‎ ‎على‎ ‎هذا‎ ‎الاختبار‎ ‎الوحيد‎: ‎افتراضيًا،‎ ‎قامت‎ ‎النماذج‎ ‎الأصغر‎ ‎والمحسّنة‎ ‎للكفاءة‎ ‎ضمن‎ ‎نفس‎ ‎العائلة‎ ‎الذكية‎ ‎بالترجمة‎ ‎الحرفية‎ ‎لتعبير‎ ‎اصطلاحي‎ ‎إسباني‎ ‎راسخ،‎ ‎بينما‎ ‎أنتجت‎ ‎الإصدارات‎ ‎الأكبر‎/‎الأحدث‎ ‎من‎ ‎نفس‎ ‎النموذج‎ ‎ترجمات‎ ‎اصطلاحية‎ ‎

صحيحة‎.‎ ما‎ ‎إذا‎ ‎كان‎ ‎هذا‎ ‎ينطبق‎ ‎على‎ ‎فئات‎ ‎التعبيرات‎ ‎الاصطلاحية‎ ‎ وأزواج‎ ‎اللغات‎ ‎هو‎ ‎السؤال‎ ‎ التالي‎. سأجري‎ ‎المزيد‎ ‎من‎ ‎الاختبارات‎.‏

‎2. لماذا‎ ‎أنتجت‎ ‎ثلاثة‎ ‎ترجمات‎ ‎اصطلاحية‎ ‎صحيحة‎ ‎ثلاثة مخرجات‎ ‎مختلفة‎ ‎بشكل‎ ‎كبير؟

ترجمت‎ GPT-4.1-MINI ‎و‎ GPT-5.4-MINI ‎و‎ GPT-5.4 ‎جميعها‎ ‏llevarse el gato al agua‎ ‎اصطلاحيًا‎ - ‎ولكن‎ ‎إلى‎ ‎تعبيرات‎ ‎إنجليزية‎ ‎مختلفة ذات‎ ‎دلالات‎ ‎مختلفة‎ ‎قليلاً‎. يشير‎ ‎هذا ‎ ‎إلى‎ ‎أن‎ ‎جودة‎ ‎الترجمة‎ ‎الاصطلاحية‎ ‎لها‎ ‎بعدان‎ ‎على‎ ‎الأقل‎:‎ ‎ ‎ما‎ ‎إذا‎ ‎كان‎ ‎النموذج‎ ‎يتعرف‎ ‎على‎ ‎الاصطلاح‎ ‎على‎ ‎الإطلاق،‎ ‎وأي ‎ ‎تعبير‎ ‎مكافئ‎ ‎يختاره‎ ‎من‎ ‎الخيارات‎ ‎المتاحة‎ ‎في‎ ‎اللغة‎ ‎الهدف ‎. لا‎ ‎تفصل‎ ‎مقاييس‎ ‎جودة‎ ‎الترجمة‎ ‎القياسية ‎ ‎هذين‎ ‎البعدين‎ ‎بوضوح‎. أعتقد‎ ‎أنه‎ ‎ينبغي‎ ‎عليهم‎ ‎ذلك‎.‎


يعتمد‎ ‎هذا‎ ‎المنشور‎ ‎على‎ ‎اختبار‎ ‎داخلي‎ ‎على‎ ‎منصة‎ ‎تطوير‎ MachineTranslation.com. الاختبار‎ ‎متعدد‎ ‎النماذج‎ ‎المعروض‎ ‎هنا‎ ‎غير‎ ‎متاح‎ ‎للجمهور‎ ‎بعد‎. أنا‎ ‎أشارك‎ ‎هذا‎ ‎الاكتشاف‎ ‎لأنني‎ ‎أعتقد‎ ‎أن‎ ‎الملاحظة‎ ‎مفيدة‎ ‎بغض‎ ‎النظر‎ ‎عن‎ ‎مكان‎ ‎إجراء‎ ‎الترجمات‎ ‎الخاصة‎ ‎بك‎.‎