July 10, 2026

أي مترجم ذكاء اصطناعي هو الأكثر دقة في عام 2026؟ لقد اختبرت 10 من أحدث نماذج الذكاء الاصطناعي

كلمتان‎. ستة‎ ‎نماذج‎. ثلاثة‎ ‎قرارات‎ ‎ترجمة‎ ‎مختلفة‎. إليك‎ ‎ما‎ ‎حدث‎ ‎عندما‎ ‎قمت‎ ‎بتشغيل‎ 8 ‎جمل‎ ‎اختبار‎ ‎من‎ ‎خلال‎ ‎أحدث‎ ‎نماذج‎ ‎الذكاء‎ ‎الاصطناعي‎ ‎المتاحة‎ ‎على‎ MachineTranslation.com،‎ ‎وما‎ ‎تكشفه‎ ‎المخرجات‎ ‎فعلاً‎ ‎حول‎ ‎متى‎ ‎يفشل‎ ‎النموذج‎ ‎بصمت‎.‎

كيف‎ ‎يمكنك‎ ‎حتى‎ ‎أن‎ ‎تعرف‎ ‎متى‎ ‎اتخذ‎ ‎نموذجك‎ ‎القرار‎ ‎الخاطئ؟

كلمتان‎. ده‎ ‎مجنون‎. ستة‎ ‎نماذج‎. ثلاث‎ ‎قرارات‎ ‎ترجمية‎ ‎متميزة‎.‎

في‎ ‎اللغة‎ ‎اليابانية،‎ ‎قدمت‎ ‎إحدى‎ ‎النماذج‎ ‎ترجمة‎ ‎لها‎ ‎كـ それはやばい،‎ ‎محافظة‎ ‎على‎ ‎الغموض‎. شخص‎ ‎آخر‎ ‎حذف‎ ‎ضمير‎ ‎الفاعل‎ ‎تماماً‎ ‎وكتب‎ ‎الصيغة‎ ‎المجردة やばい،‎ ‎وهي‎ ‎الأكثر‎ ‎تحدثاً‎ ‎وعفوية‎ ‎الممكنة‎. كتب‎ ‎ثالث それはすごい،‎ ‎وهذا‎ ‎يحل‎ ‎الغموض‎ ‎بالكامل‎ ‎لصالح‎ "‎مذهل‎"‎،‎ ‎مما‎ ‎يزيل‎ ‎المعنى‎ ‎المزدوج‎ ‎الذي‎ ‎جعل‎ ‎العبارة‎ ‎مثيرة‎ ‎للاهتمام‎ ‎في‎ ‎المقام‎ ‎الأول‎. في‎ ‎اللغة‎ ‎الفيتنامية،‎ ‎كتب‎ ‎أحد‎ ‎النماذج ڊِنْه‎ ‎ڤَاي ‎(‎لغة‎ ‎عامية،‎ ‎صحيحة‎ ‎لسجل‎ ‎الشباب‎). كتب‎ ‎آخر حقا‎ ‎رائع،‎ ‎صحيح‎ ‎نحويا،‎ ‎لكنه‎ ‎أقرب‎ ‎إلى‎ ‎قول‎ "‎هذا‎ ‎حقا‎ ‎مذهل‎" ‎عندما‎ ‎يرسل‎ ‎لك‎ ‎شخص‎ ‎ما‎ ‎ميم‎.‎

كل‎ ‎هذه‎ ‎مدافع‎ ‎عنها‎. لا‎ ‎شيء‎ ‎منها‎ ‎هو‎ ‎نفس‎ ‎الشيء‎. وإذا‎ ‎كنت‎ ‎تقوم‎ ‎بتشغيل‎ ‎الترجمات‎ ‎من‎ ‎خلال‎ ‎نموذج‎ ‎واحد،‎ ‎فلن‎ ‎ترى‎ ‎أبداً‎ ‎الخيار‎ ‎الذي‎ ‎تم‎ ‎اتخاذه‎ ‎نيابة‎ ‎عنك‎.‎

هذا‎ ‎هو‎ ‎السؤال‎ ‎الأساسي‎ ‎الذي‎ ‎تحاول‎ ‎هذه‎ ‎المقالة‎ ‎الإجابة‎ ‎عليه‎. ليس‎ ‎أي‎ ‎نموذج‎ ‎ذكاء‎ ‎اصطناعي‎ ‎هو‎ ‎الأفضل‎ ‎للترجمة‎ ‎في‎ ‎عام‎ 2026 (‎الإجابة‎ ‎تعتمد‎ ‎على‎ ‎زوج‎ ‎اللغة‎ ‎والسجل‎ ‎والمجال‎ ‎وبنية‎ ‎الجملة‎)‎،‎ ‎بل‎ ‎بالأحرى‎:‎ كيف‎ ‎ستعرف‎ ‎عندما‎ ‎يتخذ‎ ‎نموذجك‎ ‎القرار‎ ‎الخاطئ؟ خاصة‎ ‎في‎ ‎المجالات‎ ‎مثل‎ ‎المصطلحات‎ ‎الطبية‎ ‎والعقود‎ ‎القانونية‎ ‎أو‎ ‎الرسمية‎ ‎المهنية،‎ ‎حيث‎ ‎يبدو‎ ‎القرار‎ ‎الخاطئ‎ ‎تماماً‎ ‎مثل‎ ‎الترجمة‎ ‎الصحيحة‎ ‎حتى‎ ‎يقرأها‎ ‎متخصص‎.‎

إليك‎ ‎ما‎ ‎فعلته‎. قمت‎ ‎بتشغيل‎ 8 ‎جمل‎ ‎اختبارية‎ ‎عبر‎ ‎جولتين‎ ‎من‎ ‎النماذج‎ ‎على MachineTranslation.com: ‎أولاً‎ ‎خط‎ ‎أساسي‎ ‎من‎ 5 ‎نماذج‎ ‎مستخدمة‎ ‎على‎ ‎نطاق‎ ‎واسع،‎ ‎ثم‎ ‎مجموعة‎ ‎موسعة‎ ‎تضيف‎ ‎عدة‎ ‎متغيرات‎ ‎نموذج‎ ‎من‎ ‎الطبقة‎ ‎المميزة‎ ‎الأحدث‎ ‎المتاحة‎ ‎الآن‎ ‎للمستخدمين‎ ‎المدفوعين‎. عادةً،‎ ‎كان‎ ‎مقارنة‎ ‎المخرجات‎ ‎من‎ ‎نماذج‎ ‎مثل‎ ‎هذه‎ ‎تعني‎ ‎الاشتراكات‎ ‎المدفوعة‎ ‎المنفصلة‎ ‎مع‎ ‎كل‎ ‎مزود‎ ‎على‎ ‎حدة‎. على‎ ‎موقع‎ MachineTranslation.com،‎ ‎يجلسون‎ ‎في‎ ‎نفس‎ ‎عرض‎ ‎المقارنة‎. أزواج‎ ‎اللغات‎ ‎كانت‎ ‎الإنجليزية‎→‎اليابانية‎ ‎والإنجليزية‎→‎الفيتنامية‎. تم‎ ‎اختيار‎ ‎فئات‎ ‎الجملة‎ ‎بشكل‎ ‎محدد‎ ‎لاختبار‎ ‎الضغط‎ ‎على‎ ‎المناطق‎ ‎التي‎ ‎يكون‎ ‎فيها‎ ‎عدم‎ ‎الاتفاق‎ ‎بين‎ ‎النماذج‎ ‎الأكثر‎ ‎أهمية‎: ‎الصيغ‎ ‎الاصطلاحية،‎ ‎والمصطلحات‎ ‎القانونية،‎ ‎والمصطلحات‎ ‎الطبية،‎ ‎والسياق‎ ‎الحساس‎ ‎للرسمية،‎ ‎والغموض‎ ‎الدلالي‎ ‎المتعمد‎.‎

المنهجية

  • أزواج‎ ‎اللغات‎:‎ الإنجليزية‎ → ‎اليابانية،‎ ‎الإنجليزية‎ → ‎الفيتنامية
  • الجولة‎ ‎الأولى‎ (‎الخط‎ ‎الأساسي‎):‏ Claude Sonnet 4-6‏،‎ DeepSeek V4-Pro‏،‎ Qwen 3.7-Max‏،‎ GPT-4.1-NANO‏،‎ Gemini 3.1-Pro-Preview
  • الجولة‎ ‎الثانية‎ (‎الموسعة‎):‎ جميع‎ ‎ما‎ ‎سبق‎ +‏ Claude Opus 4-7‏،‎ GPT-5.5‏،‎ Gemini 3.5-Flash‏،‎ GLM-5-Turbo‏،‎ MiniMax M2.7
  • فئات‎ ‎الاختبار‎:‎ الصيغ‎ ‎الاصطلاحية‎ (2)‎،‎ ‎المصطلحات‎ ‎القانونية‎/‎المهنية‎ (2)‎،‎ ‎المصطلحات‎ ‎الطبية‎ (1)‎،‎ ‎السياق‎ ‎الحساس‎ ‎للرسمية‎ (2)‎،‎ ‎الغموض‎ ‎المتعمد‎ (1)‎
  • ما‎ ‎تم‎ ‎قياسه‎:‎ مخرجات‎ ‎الترجمة‎ ‎مباشرة،‎ ‎وليس‎ ‎وقت‎ ‎التحرير‎ ‎أو‎ ‎معدل‎ ‎الخطأ‎ ‎أو‎ ‎معدلات‎ ‎الأخطاء‎ ‎الرقمية‎. عند‎ ‎الاقتضاء،‎ ‎يتم‎ ‎شرح‎ ‎الاختلافات‎ ‎من‎ ‎الناحية‎ ‎اللغوية‎.‎
  • إجماع‎ SMART:‎ تتضمن‎ ‎كل‎ ‎جولة‎ ‎مخرجات‎ ‎الإجماع‎ ‎متعددة‎ ‎النماذج‎ ‎للمنصة‎. يمتد‎ SMART ‎إلى‎ 22 ‎نموذج‎ ‎ذكاء‎ ‎اصطناعي‎ ‎عبر‎ ‎موفري‎ ‎الخدمات‎ ‎ويقوم‎ ‎بتشغيل‎ ‎جميع‎ ‎النماذج‎ ‎المتاحة‎ ‎في‎ ‎نفس‎ ‎الوقت‎ ‎للحصول‎ ‎على‎ ‎ترجمة‎ ‎توافقية‎. يتحول‎ ‎الإجماع‎ ‎عندما‎ ‎تتحول‎ ‎مجموعة‎ ‎النموذج‎.‎

ملاحظة‎ ‎حول‎ ‎منهجية‎ ‎التقييم‎: ‎لطالما‎ ‎كافحت‎ ‎أبحاث‎ ‎الترجمة‎ ‎الآلية‎ ‎مع‎ ‎كيفية‎ ‎تسجيل‎ ‎المخرجات‎ ‎تلقائياً‎. المقاييس‎ ‎مثل‎ BLEU ‎و‎ COMET ‎ ‎كما‎ ‎تم‎ ‎قياسها‎ ‎في‎ ‎مهام‎ WMT ‎المشتركة ‎ ‎توفر‎ ‎إشارة‎ ‎تجميعية‎ ‎مفيدة،‎ ‎لكنها‎ ‎ضعيفة‎ ‎جداً‎ ‎في‎ ‎الكشف‎ ‎عن‎ ‎أخطاء‎ ‎السجل‎ ‎اللغوي،‎ ‎وإخفاقات‎ ‎التعابير‎ ‎الاصطلاحية،‎ ‎والدقة‎ ‎المصطلحية،‎ ‎وهي‎ ‎بالضبط‎ ‎الفئات‎ ‎التي‎ ‎تهمنا‎ ‎أكثر‎ ‎هنا‎. ما‎ ‎أنت‎ ‎على‎ ‎وشك‎ ‎قراءته‎ ‎هو‎ ‎تحليل‎ ‎النتائج،‎ ‎وليس‎ ‎سباق‎ BLEU.‎

النتائج‎ ‎في‎ ‎لمحة

القسم‎ 1: حيث‎ ‎تتفق‎ ‎جميع‎ ‎النماذج،‎ ‎ولماذا‎ ‎يهم‎ ‎ذلك‎ ‎أيضاً

ليس‎ ‎كل‎ ‎جملة‎ ‎تظهر‎ ‎اختلافاً‎ ‎ذا‎ ‎مغزى‎. اثنان‎ ‎من‎ ‎الاختبارات‎ ‎الثمانية،‎ "‎دعنا‎ ‎نتواصل‎ ‎بمجرد‎ ‎أن‎ ‎يهدأ‎ ‎الغبار‎ ‎حول‎ ‎هذه‎ ‎الصفقة‎" (→ ‎اليابانية‎) ‎و‎"‎نحن‎ ‎نعمل‎ ‎بجد‎ ‎طوال‎ ‎الليل‎ ‎لتحقيق‎ ‎موعد‎ ‎الإطلاق‎ ‎هذا‎" (→ ‎الفيتنامية‎)‎،‎ ‎أنتجا‎ ‎اتفاقاً‎ ‎عالياً‎ ‎عبر‎ ‎كلا‎ ‎الجولتين‎. تم‎ ‎فهم‎ ‎التعابير‎ ‎بشكل‎ ‎صحيح‎ ‎كتعابير‎. لم‎ ‎يترجم‎ ‎أحد‎ "touch base" ‎على‎ ‎أنها‎ ‎لمس‎ ‎قاعدة‎ ‎فيزيائية‎. لم‎ ‎يترجم‎ ‎أحد‎ "the dust settles" ‎على‎ ‎أنها‎ ‎رسوبات‎ ‎تسقط‎.‎

هذا‎ ‎يستحق‎ ‎التوقف‎ ‎عنده‎: ‎اللغة‎ ‎الإنجليزية‎ ‎الاصطلاحية‎ ‎في‎ ‎مجال‎ ‎الأعمال‎ ‎يتم‎ ‎التعامل‎ ‎معها‎ ‎بشكل‎ ‎معقول‎ ‎من‎ ‎قبل‎ ‎نماذج‎ ‎الحدود‎ ‎الحالية‎ ‎عندما‎ ‎تكون‎ ‎الاصطلاحية‎ ‎شائعة‎ ‎بما‎ ‎يكفي‎. الإجماع‎ ‎على‎ "touch base" ‎ظل‎ ‎مستقراً‎ ‎عبر‎ ‎كلا‎ ‎الجولتين؛‎ ‎كان‎ ‎التباين‎ ‎أسلوبياً‎ ‎بحتاً،‎ ‎حول‎ ‎ما‎ ‎إذا‎ ‎كان‎ ‎يجب‎ ‎استخدام‎ この件 (‎هذه‎ ‎المسألة‎)‏،‎ この取引 (‎هذه‎ ‎الصفقة‎)‎،‎ ‎أو‎ この案件 (‎هذه‎ ‎الحالة‎) ‎للعبارة‎ ‎المصدرية‎.‎

الاختبار‎ 8: ‎"‎دعنا‎ ‎نتواصل‎ ‎مرة‎ ‎أخرى‎ ‎بمجرد‎ ‎أن‎ ‎يهدأ‎ ‎الغبار‎ ‎حول‎ ‎هذه‎ ‎الصفقة‎." → ‎اليابانية

اختبار‎ "‎حرق‎ ‎منتصف‎ ‎الليل‎" ‎هو‎ ‎حيث‎ ‎أصبحت‎ ‎الأمور‎ ‎أكثر‎ ‎إثارة‎ ‎للاهتمام‎. كل‎ ‎نموذج‎ ‎باستثناء‎ ‎واحد‎ ‎فهم‎ ‎التعبير‎ ‎الاصطلاحي‎ ‎بشكل‎ ‎صحيح‎. ميني‎ ‎ماكس‎ ‎إم‎ 2.7،‎ ‎التي‎ ‎تم‎ ‎تقديمها‎ ‎في‎ ‎الجولة‎ ‎الثانية،‎ ‎ترجمت‎ ‎كلمة‎ "burning" ‎حرفياً،‎ ‎مما‎ ‎أسفر‎ ‎عن đốt đuốc،‎ ‎بمعنى‎ "‎مشاعل‎ ‎مشتعلة‎." الإجماع‎ ‎استبعده‎ ‎بشكل‎ ‎صحيح‎.‏

Test 5: ‎"‎نحن‎ ‎نعمل‎ ‎بجد‎ ‎جداً‎ ‎لتحقيق‎ ‎موعد‎ ‎الإطلاق‎ ‎هذا‎." → ‎الفيتنامية

الاستنتاج‎ — ‎التعابير‎ ‎الاصطلاحية

تتعامل‎ ‎النماذج‎ ‎المتقدمة‎ ‎بشكل‎ ‎عام‎ ‎بشكل‎ ‎صحيح‎ ‎مع‎ ‎التعابير‎ ‎الاصطلاحية‎ ‎التجارية‎ ‎الإنجليزية‎ ‎الشائعة‎ ‎باليابانية‎ ‎والفيتنامية‎. قيمة‎ ‎الإجماع‎ ‎هي‎ ‎الأعلى‎ ‎على الجمل‎ ‎المتنازع‎ ‎عليها ‎: ‎الرسمية،‎ ‎والأسلوب،‎ ‎والمصطلحات‎. في‎ ‎اختبارات‎ ‎التعابير‎ ‎الاصطلاحية،‎ ‎لا‎ ‎يزال‎ ‎الإجماع‎ ‎يحافظ‎ ‎على‎ ‎قيمته‎ ‎من‎ ‎خلال‎ ‎تحديد‎ ‎الحالات‎ ‎الشاذة‎ ‎الحقيقية‎ (‎فشل‎ "‎المشاعل‎ ‎المشتعلة‎" ‎الحرفي‎ ‎لـ‎ MiniMax)‎،‎ ‎لكن‎ ‎المجموعة‎ ‎الإجمالية‎ ‎توافق‎ ‎بالفعل‎.‎

القسم‎ 2: فجوة‎ ‎الرسميات

اللغة‎ ‎اليابانية‎ ‎هي‎ ‎لغة‎ ‎متعددة‎ ‎المستويات‎ ‎من‎ ‎حيث‎ ‎الرسميات‎. اختيار‎ ‎نهاية‎ ‎الفعل‎ ‎والضمير‎ ‎وشكل‎ ‎الاسم‎ ‎الإحالي‎ ‎ليس‎ ‎أسلوبياً‎. إنه‎ ‎يشير‎ ‎إلى‎ ‎العلاقة‎ ‎بين‎ ‎المتحدث‎ ‎والمستقبل‎. إرسال‎ ‎رسالة‎ ‎إلى‎ ‎الرئيس‎ ‎التنفيذي‎ ‎الخاص‎ ‎بك‎ ‎باستخدام‎ ‎أشكال‎ ‎فعل‎ ‎غير‎ ‎رسمية‎ ‎ليس‎ ‎خطأ‎ ‎ترجمة‎ ‎بالمعنى‎ ‎النحوي‎. إنه‎ ‎خطأ‎ ‎اجتماعي،‎ ‎وخطأ‎ ‎كبير‎.‎

جملة‎ ‎الاختبار‎: هل‎ ‎يمكنك‎ ‎إرسال‎ ‎ذلك؟ شكراً،‎ ‎أقدّر‎ ‎ذلك‎. السياق‎: ‎مراسلة‎ ‎الرئيس‎ ‎التنفيذي‎.‎

تحول‎ ‎الإجماع‎ ‎عندما‎ ‎توسعت‎ ‎مجموعة‎ ‎النماذج‎. آلية‎ ‎العمل‎ ‎واضحة‎ ‎جداً‎: ‎إضافة‎ ‎نماذج‎ ‎تقرأ‎ ‎سياق‎ ‎الرسمية‎ ‎بشكل‎ ‎صحيح‎ ‎غيّرت‎ ‎الأغلبية،‎ ‎وتبعها‎ ‎الإجماع‎. إليك‎ ‎الطيف‎ ‎الكامل‎ ‎لما‎ ‎أنتجته‎ ‎النماذج‎ ‎في‎ ‎الجولة‎ 2:‎

الاختبار‎ 1: جملة‎ ‎الرئيس‎ ‎التنفيذي‎ — ‎مخرجات‎ ‎نموذج‎ ‎الجولة‎ ‎الثانية‎ ‎الكاملة


الشذوذ‎ ‎الملحوظ‎ — DeepSeek R2

أنتج‎ DeepSeek V4-Pro ‎في‎ ‎الجولة‎ ‎الثانية 送ってくれる?ありがとう、助かる。‎‎, ‎شكل‎ ‎عادي‎ ‎باللغة‎ ‎اليابانية‎. هذا‎ ‎ما‎ ‎تكتبه‎ ‎لصديق‎ ‎مقرب‎. ليس‎ ‎هذا‎ ‎السجل‎ ‎المناسب‎ ‎لرسالة‎ ‎موجهة‎ ‎إلى‎ ‎الرئيس‎ ‎التنفيذي‎. الصيغة‎ ‎البسيطة‎ (くれる、助かる) ‎تزيل‎ ‎جميع‎ ‎علامات‎ ‎الاحترام‎. الإجماع‎ ‎استبعده‎ ‎بشكل‎ ‎صحيح،‎ ‎لكن‎ ‎إذا‎ ‎كان‎ ‎هذا‎ ‎هو‎ ‎نموذجك‎ ‎الوحيد،‎ ‎فستُرسل‎ ‎رسالة‎ ‎إلى‎ ‎الرئيس‎ ‎التنفيذي‎ ‎الخاص‎ ‎بك‎ ‎بما‎ ‎يعادل‎ ‎رسالة‎ ‎نصية‎ ‎عادية‎.‎

اختبار‎ ‎السجل‎ ‎الفيتنامي‎ ‎كشف‎ ‎عن‎ ‎نوع‎ ‎مختلف‎ ‎من‎ ‎أخطاء‎ ‎الرسمية،‎ ‎وهو‎ ‎أكثر‎ ‎دقة‎. الجملة‎ ‎المصدر‎: هيه،‎ ‎سؤال‎ ‎سريع‎ — ‎هل‎ ‎أنت‎ ‎متاح‎ ‎للقيام‎ ‎بمكالمة؟ السياق‎: ‎مراسلة‎ ‎عميل‎. تضمن‎ Qwen ‎في‎ ‎الجولة‎ ‎الأولى‎ ‎كلمة‎ "mình"‎،‎ ‎وهي‎ ‎ضمير‎ ‎المتكلم‎ ‎الذي‎ ‎يعني‎ ‎الصداقة‎ ‎على‎ ‎مستوى‎ ‎الأقران‎ ‎بشكل‎ ‎غير‎ ‎رسمي‎. كل‎ ‎نموذج‎ ‎آخر‎ ‎تجنب‎ ‎الإشارة‎ ‎الذاتية‎ ‎بصيغة‎ ‎المتكلم‎ ‎بالكامل،‎ ‎وهو‎ ‎الخيار‎ ‎المهني‎ ‎الأكثر‎ ‎أماناً‎. بشكل‎ ‎حاسم،‎ ‎قام‎ Qwen ‎بتصحيح‎ ‎هذا‎ ‎في‎ ‎الجولة‎ ‎الثانية‎ ‎وحذف‎ "mình." تم‎ ‎استبعاده‎ ‎بالإجماع‎ ‎في‎ ‎كلا‎ ‎الجولتين‎.‏

Test 6: ‎"‎مرحبا،‎ ‎سؤال‎ ‎سريع‎ — ‎هل‎ ‎أنت‎ ‎متاح‎ ‎لإجراء‎ ‎مكالمة؟‎" → ‎الفيتنامية


الاستنتاج‎ — ‎أخطاء‎ ‎السجل‎ ‎اللغوي‎ ‎غير‎ ‎مرئية‎ ‎دون‎ ‎مقارنة

خطأ‎ Qwen ‎مع‎ "mình" ‎هو‎ ‎أوضح‎ ‎مثال‎ ‎على‎ ‎سبب‎ ‎خطورة‎ ‎الترجمة‎ ‎بنموذج‎ ‎واحد‎ ‎للتواصل‎ ‎مع‎ ‎العملاء‎: ‎الناتج‎ ‎فيتنامي‎ ‎سلس‎ ‎وصحيح‎ ‎نحويًا‎ ‎ويبدو‎ ‎طبيعيًا‎. لا‎ ‎يوجد‎ ‎شيء‎ ‎للإشارة‎ ‎إليه‎. بدون‎ ‎رؤية‎ ‎النماذج‎ ‎الأربعة‎ ‎الأخرى‎ ‎تجنب‎ ‎الإشارة‎ ‎الذاتية‎ ‎بصيغة‎ ‎المتكلم،‎ ‎لن‎ ‎يكون‎ ‎لديك‎ ‎أي‎ ‎إشارة‎ ‎على‎ ‎أن‎ ‎تم‎ ‎اختيار‎ ‎سجل‎ ‎لغوي‎.‎

القسم‎ 3: المصطلحات‎ ‎القانونية‎ — ‎مشكلة‎ ‎الإعفاء‎ ‎من‎ ‎المسؤولية

جملة‎ ‎التعويض‎ ‎بين‎ ‎البائع‎ ‎والعميل‎ ‎هي‎ ‎بند‎ ‎قياسي‎ ‎في‎ ‎الاتفاقيات‎ ‎التجارية‎: ‎"‎يجب‎ ‎على‎ ‎البائع‎ ‎أن‎ ‎يعوض‎ ‎العميل‎ ‎عن‎ ‎أي‎ ‎مطالبات‎ ‎من‎ ‎طرف‎ ‎ثالث‎ ‎ناشئة‎ ‎عن‎ ‎الإخلال‎ ‎بهذا‎ ‎الاتفاق‎."‎

في‎ ‎الجولة‎ ‎الأولى،‎ ‎حددت‎ ‎جميع‎ ‎النماذج‎ ‎الخمسة‎ ‎بشكل‎ ‎صحيح‎ ‎السجل‎ ‎القانوني‎ ‎واستخدمت‎ ‎الكلمات‎ ‎المستعارة‎ ベンダー (‎المورّد‎) ‎و‎ クライアント (‎العميل‎)‎،‎ ‎وهي‎ ‎معايير‎ ‎شائعة‎ ‎في‎ ‎العقود‎ ‎التجارية‎ ‎اليابانية‎ ‎ذات‎ ‎الأصول‎ ‎الإنجليزية‎. استثناء‎ ‎واحد‎: استخدم‎ GPT-4.1-NANO ‎كلمات‎ ‎يابانية‎ ‎شرعية‎ ‎وهي‎ 販売者 (‎البائع‎) ‎و‎ 顧客 (‎العميل‎) ‎التي‎ ‎تفتقر‎ ‎إلى‎ ‎الدقة‎ ‎القانونية‎ ‎الرسمية‎ ‎للكلمات‎ ‎المستعارة‎ ‎المكافئة‎.‎

ظهرت‎ ‎النتيجة‎ ‎الأكثر‎ ‎أهمية‎ ‎في‎ ‎الجولة‎ ‎الثانية‎. التمييز‎ ‎الرئيسي‎ ‎هو‎ ‎بين‎ ‎كلمتين‎:‏

  • 補償 (hoshō)‎ ‎— ‎تعويض،‎ ‎استرجاع‎. لجعل‎ ‎شخص‎ ‎ما‎ ‎سليماً‎ ‎مالياً‎ ‎بعد‎ ‎خسارة‎.‏
  • 免責 (menseki)‎ ‎— ‎الإعفاء‎ ‎من‎ ‎المسؤولية؛‎ ‎التعويض‎. عدم‎ ‎تحميل‎ ‎الطرف‎ ‎الثالث‎ ‎بأي‎ ‎مسؤولية‎ ‎عن‎ ‎المطالبات‎ ‎قبل‎ ‎حدوثها‎.‎

هذه‎ ‎مفاهيم‎ ‎مختلفة‎ ‎قانوناً‎. ‎"‎تعويض‎" ‎يعني‎ ‎بالتحديد‎ ‎حماية‎ ‎طرف‎ ‎من‎ ‎مسؤولية‎ ‎الطرف‎ ‎الثالث‎. 免責 ‎هو‎ ‎المصطلح‎ ‎القانوني‎ ‎الصحيح‎. جميع‎ ‎نماذج‎ ‎الجولة‎ ‎الأولى‎ ‎استخدمت‎ 補償. في‎ ‎الجولة‎ 2،‎ ‎كان‎ DeepSeek V4-Pro ‎هو‎ ‎النموذج‎ ‎الوحيد‎ ‎الذي‎ ‎أنتج‎ 免責،‎ ‎وقد‎ ‎فعل‎ ‎ذلك‎ ‎في‎ ‎الجولة‎ 2 ‎فقط،‎ ‎وليس‎ ‎في‎ ‎الجولة‎ 1.‎

الاختبار‎ 7: بند‎ ‎التعويض‎ → ‎اليابانية‎ (‎المخرجات‎ ‎الرئيسية‎)‎


النتيجة‎ — ‎السجل‎ ‎القانوني

DeepSeek ‎في‎ R2 ‎هو‎ ‎النموذج‎ ‎الوحيد‎ ‎الذي‎ ‎يستخدم‎ 免責،‎ ‎وهو‎ ‎المكافئ‎ ‎القانوني‎ ‎الدقيق‎ ‎لكلمة‎ "‎التعويض‎". كل‎ ‎نموذج‎ ‎آخر‎ ‎يستخدم‎ 補償 (‎التعويض‎)‎،‎ ‎وهو‎ ‎مرتبط‎ ‎دلاليًا‎ ‎لكن‎ ‎متميز‎ ‎قانونيًا‎. هذا‎ ‎الاكتشاف‎ ‎يصبح‎ ‎مرئياً‎ ‎فقط‎ ‎في‎ ‎الجولة‎ ‎الثانية،‎ ‎مما‎ ‎يؤكد‎ ‎على‎ ‎السبب‎ ‎في‎ ‎أن‎ ‎الاختبار‎ ‎الثابت‎ ‎أحادي‎ ‎الجولة‎ ‎باستخدام‎ ‎مجموعة‎ ‎نموذج‎ ‎ثابتة‎ ‎يمكن‎ ‎أن‎ ‎يفتقد‎ ‎التباين‎ ‎المهم‎.‎
‎ ‎بشكل‎ ‎منفصل،‎ ‎يتراجع‎ Qwen ‎في‎ R2 ‎بالتحول‎ ‎إلى‎ 売主/買主 (‎البائع‎/‎المشتري‎)‎،‎ ‎وهي‎ ‎مصطلحات‎ ‎من‎ ‎قانون‎ ‎البيع‎ ‎التجاري‎ ‎بدلاً‎ ‎من‎ ‎اتفاقيات‎ ‎الخدمات‎. هذا‎ ‎إطار‎ ‎أقل‎ ‎ملاءمة‎ ‎لعقد‎ ‎يستخدم‎ ‎المصطلحات‎ ‎القانونية‎ ‎الإنجليزية‎.‎

في‎ ‎العقد،‎ ‎التعويض‎ ‎والإعفاء‎ ‎من‎ ‎المسؤولية‎ ‎ليست‎ ‎مرادفات‎. واحد‎ ‎يعني‎ "‎سنعيد‎ ‎إليك‎ ‎المال‎." والآخر‎ ‎يعني‎ "‎أنت‎ ‎محمي‎ ‎من‎ ‎المطالبة‎ ‎في‎ ‎المقام‎ ‎الأول‎." إذا‎ ‎استخدمت‎ ‎منصة‎ ‎الترجمة‎ 補償 ‎حيث‎ ‎يكون‎ 免責 ‎صحيحاً،‎ ‎فإن‎ ‎المحامي‎ ‎الذي‎ ‎يقرأ‎ ‎النسخة‎ ‎اليابانية‎ ‎لن‎ ‎يرى‎ ‎نفس‎ ‎الاتفاقية‎ ‎التي‎ ‎تصفها‎ ‎النسخة‎ ‎الإنجليزية‎.‎

القسم‎ 4: المصطلحات‎ ‎الطبية‎ — ‎الانقسام‎ ‎الذي‎ ‎لم‎ ‎ينحل

هذا‎ ‎هو‎ ‎الاكتشاف‎ ‎الأكثر‎ ‎أهمية‎ ‎في‎ ‎مجموعة‎ ‎البيانات‎. جملة‎ ‎الاختبار‎: هذا‎ ‎الدواء‎ ‎مضاد‎ ‎استطباب‎ ‎في‎ ‎المرضى‎ ‎الذين‎ ‎لديهم‎ ‎تاريخ‎ ‎من‎ ‎ضعف‎ ‎الكبد‎. المصدر‎: ‎وثائق‎ ‎المنتج‎ ‎السريرية‎. الهدف‎: Vietnamese.‎

الضعف‎ ‎الكبدي‎ ‎هو‎ ‎المصطلح‎ ‎الحاسم‎. هناك‎ ‎مرشحان‎ ‎فيتناميان‎:‏

  • suy gan ‎— ‎فشل‎ ‎الكبد‎. يشير‎ ‎إلى‎ ‎قصور‎ ‎كبدي‎ ‎حاد‎ ‎أو‎ ‎مزمن‎ ‎شديد‎ ‎في‎ ‎المرحلة‎ ‎النهائية‎. مريض‎ ‎عانى‎ ‎من‎ ‎فشل‎ ‎الكبد‎.‏
  • suy giảm chức năng gan ‎— ‎انخفاض‎/‎ضعف‎ ‎وظائف‎ ‎الكبد‎. يشير‎ ‎إلى‎ ‎أي‎ ‎انخفاض‎ ‎في‎ ‎وظائف‎ ‎الكبد،‎ ‎بما‎ ‎في‎ ‎ذلك‎ ‎الضعف‎ ‎الخفيف‎ ‎أو‎ ‎المتوسط‎.‎

هذه‎ ‎متميزة‎ ‎سريريًا‎. تحذير‎ ‎موانع‎ ‎الاستعمال‎ ‎بناءً‎ ‎على‎ "‎ضعف‎ ‎الكبد‎" ‎ينطبق‎ ‎على‎ ‎أي‎ ‎شخص‎ ‎يعاني‎ ‎من‎ ‎ضعف‎ ‎وظائف‎ ‎الكبد،‎ ‎وليس‎ ‎فقط‎ ‎على‎ ‎من‎ ‎عانوا‎ ‎من‎ ‎فشل‎ ‎كامل‎ ‎للعضو‎. استخدام‎ suy gan ‎يضيق‎ ‎السكان‎ ‎المشار‎ ‎إليهم‎ ‎بشكل‎ ‎غير‎ ‎صحيح‎. مريض‎ ‎يعاني‎ ‎من‎ ‎ضعف‎ ‎كبدي‎ ‎متوسط‎ ‎قد‎ ‎لا‎ ‎يتعرف‎ ‎على‎ ‎نفسه‎ ‎كمجموعة‎ ‎سكانية‎ ‎مضادة‎ ‎للاستطباب‎ ‎عند‎ ‎قراءة‎ "suy gan". ‎

الاختبار‎ 2: جملة‎ ‎موانع‎ ‎الاستعمال‎ → ‎الفيتنامية‎ (‎كلا‎ ‎الجولتين‎)‎


النتيجة‎ ‎الحرجة‎: ‎المصطلحات‎ ‎الطبية

التقسيم‎ ‎هو‎ 6 ‎نماذج‎ ‎لـ‎ suy gan ‎مقابل‎ 4 ‎نماذج‎ ‎لـ‎ suy giảm chức năng gan ‎في‎ ‎الجولة‎ 2. الأغلبية،‎ ‎وبالتالي‎ ‎الإجماع،‎ ‎تختار‎ ‎المصطلح‎ ‎الأقل‎ ‎دقة‎ ‎من‎ ‎الناحية‎ ‎السريرية‎. كلا‎ ‎نموذجي‎ ‎كلود‎ (‎سونيت‎ ‎وأوبس‎) ‎يختاران‎ ‎باستمرار‎ suy giảm chức năng gan ‎في‎ ‎كلا‎ ‎الجولتين‎. الانقسام‎ ‎لا‎ ‎ينحل‎ ‎عندما‎ ‎يتوسع‎ ‎التجمع‎.‎
‎ ‎هذا‎ ‎هو‎ ‎الاكتشاف‎ ‎الوحيد‎ ‎في‎ ‎هذه‎ ‎مجموعة‎ ‎البيانات‎ ‎الذي‎ ‎يدعو‎ ‎بشكل‎ ‎مباشر‎ ‎إلى‎ ‎مراجعة‎ ‎الخبراء‎ ‎البشريين‎ ‎للمحتوى‎ ‎الطبي‎. الإجماع‎ ‎لا‎ ‎يخطئ‎ ‎بالتصويت‎ ‎بالأغلبية‎. إنه‎ ‎يعكس‎ ‎خلافاً‎ ‎حقيقياً‎ ‎بين‎ ‎النماذج‎ ‎المتقدمة،‎ ‎وهذا‎ ‎الخلاف‎ ‎بحد‎ ‎ذاته‎ ‎معلومة‎ ‎يحتاج‎ ‎المترجم‎ ‎إلى‎ ‎رؤيتها‎. هذا‎ ‎هو‎ ‎بالضبط‎ ‎نوع‎ ‎القضية التي‎ ‎تم‎ ‎بناء‎ ‎نظام‎ ‎مراجعة‎ Tomedes' ‎الذي‎ ‎يتضمن‎ ‎عنصراً‎ ‎بشرياً من‎ ‎أجله‎.‎

القسم‎ 5: ‎"‎هذا‎ ‎مريع‎" — ‎ما‎ ‎الذي‎ ‎يحدث‎ ‎عندما‎ ‎تكون‎ ‎الغموض‎ ‎هي‎ ‎النقطة

بعض‎ ‎الجمل‎ ‎المصدرية‎ ‎غامضة‎ ‎بالتصميم‎. ‎"That's sick" ‎في‎ ‎لغة‎ ‎الإنجليزية‎ ‎المعاصرة‎ ‎تعني‎ ‎شيئاً‎ ‎ممتازاً،‎ ‎لكنها‎ ‎تحتفظ‎ ‎أيضاً‎ ‎بمعناها‎ ‎الحرفي‎ (‎أي‎ ‎أنها‎ ‎مقيتة‎/‎مثيرة‎ ‎للاشمئزاز‎)‎،‎ ‎والتوتر‎ ‎بين‎ ‎هذين‎ ‎المعنيين‎ ‎هو‎ ‎جزء‎ ‎من‎ ‎كيفية‎ ‎تواصل‎ ‎العبارة‎. التحدي‎ ‎الذي‎ ‎يواجه‎ ‎نموذج‎ ‎الترجمة‎ ‎هو‎: ‎هل‎ ‎تحافظ‎ ‎على‎ ‎الغموض،‎ ‎أم‎ ‎تختزله‎ ‎إلى‎ ‎المعنى‎ ‎الأكثر‎ ‎احتمالاً،‎ ‎أم‎ ‎تختار‎ ‎واحداً‎ ‎والتزم‎ ‎به؟

مخرجات‎ ‎يابانية


مخرجات‎ ‎فيتنامية


النتيجة‎: ‎الغموض‎ ‎والتباعد‎ ‎داخل‎ ‎نفس‎ ‎العائلة

يكتب‎ Claude Opus 4-7 ڈینه‎ ‎ویی ‎(‎لغة‎ ‎عامية‎). كلود‎ ‎سونيت‎ 4-6 ‎يكتب حقاً‎ ‎رائع ‎(‎رسمي‎). هذه‎ ‎قرارات‎ ‎تسجيل‎ ‎معاكسة‎ ‎اتخذتها‎ ‎نموذجان‎ ‎من‎ ‎نفس‎ ‎عائلة‎ ‎النماذج‎ ‎على‎ ‎المدخل‎ ‎ثنائي‎ ‎الكلمات‎ ‎المتطابق‎. لا‎ ‎أحدهما‎ "‎خاطئ‎". الغموض‎ ‎في‎ "That's sick" ‎يعني‎ ‎أن‎ ‎كلا‎ ‎المعنيين‎ ‎موجودان‎. لكن‎ ‎إذا‎ ‎كان‎ ‎جمهورك‎ ‎المستهدف‎ ‎يستخدم‎ ‎لغة‎ ‎الشباب‎ ‎الفيتنامي‎ ‎الحالية،‎ ‎فإن‎ ‎واحدة‎ ‎فقط‎ ‎من‎ ‎هذه‎ ‎الترجمات‎ ‎تتواصل‎ ‎بشكل‎ ‎صحيح‎. الإجماع‎ ‎يجعل‎ ‎الخلاف‎ ‎مرئياً‎. بدونها،‎ ‎لا‎ ‎تعرف‎ ‎أن‎ ‎تم‎ ‎اتخاذ‎ ‎خيار‎.‎
في‎ ‎اللغة‎ ‎اليابانية،‎ GPT-4.1-NANO ‎هو‎ ‎النموذج‎ ‎الوحيد‎ ‎الذي‎ ‎يستخدم すごい،‎ ‎والذي‎ ‎يزيل‎ ‎الغموض‎ ‎تماماً‎ ‎لصالح‎ "‎مذهل‎". خمسة‎ ‎نماذج‎ ‎أخرى‎ ‎تحافظ‎ ‎عليها‎ ‎مع やばい/ヤバい‎. كلود‎ ‎أوبس‎ ‎يتخذ‎ ‎الشكل‎ ‎الأقل‎ ‎تفصيلاً‎: ‎عارياً やばい بدون‎ ‎موضوع‎.‎

القسم‎ 6: شكل‎ ‎مجموعة‎ ‎النماذج

النماذج‎ ‎في‎ ‎هذا‎ ‎الاختبار‎ ‎ليست‎ ‎متكافئة‎ ‎جميعها‎. إنها‎ ‎تغطي‎ ‎معماريات‎ ‎مختلفة‎ ‎وأنظمة‎ ‎تدريب‎ ‎وسياقات‎ ‎نشر‎ ‎متنوعة‎. الجولة‎ ‎الأولى‎ ‎الأساسية‎ ‎تشمل‎ ‎نماذج‎ ‎يمكن‎ ‎الوصول‎ ‎إليها‎ ‎على‎ ‎نطاق‎ ‎واسع‎. تتضمن‎ ‎مجموعة‎ ‎الجولة‎ 2 ‎الموسعة‎ ‎عدة‎ ‎متغيرات‎ ‎نموذج‎ ‎متطورة‎ ‎من‎ ‎الفئة‎ ‎المتميزة‎ ‎المتاحة‎ ‎الآن‎ ‎للمستخدمين‎ ‎الذين‎ ‎يدفعون‎ ‎على‎ MachineTranslation.com،‎ ‎وهي‎ ‎نفس‎ ‎فئة‎ ‎النموذج‎ ‎التي‎ ‎قد‎ ‎تعني‎ ‎خلاف‎ ‎ذلك‎ ‎حسابًا‎ ‎مدفوعًا‎ ‎منفصلًا‎ ‎مع‎ ‎كل‎ ‎مزود‎ ‎فردي‎.‎

تتضمن‎ ‎المجموعة‎ ‎الموسعة‎ ‎في‎ ‎الجولة‎ 2 ‎نماذج‎ ‎أكثر‎ ‎تقدمًا‎ ‎ومتاحة‎ ‎للمستخدمين‎ ‎الذين‎ ‎يدفعون‎ ‎على‎ MachineTranslation.com. تأثير‎ ‎توسيع‎ ‎المجموعة‎ ‎ليس‎ ‎موحداً‎. في‎ ‎بعض‎ ‎الاختبارات‎ (‎الرسمية‎/‎اليابانية‎)‎،‎ ‎غيّرت‎ ‎الإجماع‎ ‎بشكل‎ ‎ملموس‎. في‎ ‎البعض‎ ‎الآخر‎ (‎المصطلحات‎ ‎الطبية‎/‎الفيتنامية‎)‎،‎ ‎تعمق‎ ‎الانقسام‎.‎

القسم‎ 7: ما‎ ‎يعنيه‎ ‎هذا‎ ‎إذا‎ ‎كنت‎ ‎تختار‎ ‎منصة‎ ‎ترجمة

تشير‎ ‎بيانات‎ ‎الاختبار‎ ‎إلى‎ ‎فئتين‎ ‎مختلفتين‎ ‎من‎ ‎الفشل،‎ ‎وتتطلب‎ ‎كل‎ ‎منهما‎ ‎ردود‎ ‎مختلفة‎.‎

الفئة‎ ‎أ‎: الإخفاقات‎ ‎الصامتة‎.‎ أخطاء‎ ‎الشكليات،‎ ‎أخطاء‎ ‎السجل‎ ‎اللغوي،‎ ‎دقة‎ ‎المصطلحات‎ ‎الطبية‎: ‎هذه‎ ‎تنتج‎ ‎مخرجات‎ ‎تبدو‎ ‎صحيحة‎. اللغة‎ ‎اليابانية‎ ‎سليمة‎ ‎من‎ ‎حيث‎ ‎القواعد‎ ‎النحوية‎. الفيتنامي‎ ‎يتحدث‎ ‎بطلاقة‎. لا‎ ‎توجد‎ ‎إشارة‎ ‎سطحية‎ ‎تدل‎ ‎على‎ ‎حدوث‎ ‎أي‎ ‎خلل‎. المستخدم‎ ‎أحادي‎ ‎اللغة‎ ‎الذي‎ ‎يقرأ‎ ‎مخرجات‎ ‎نموذج‎ ‎واحد‎ ‎ليس‎ ‎لديه‎ ‎طريقة‎ ‎للمعرفة‎ ‎بأن‎ ‎النموذج‎ ‎اتخذ‎ ‎خيار‎ ‎تسجيل‎ ‎قد‎ ‎يلاحظه‎ ‎مدير‎ ‎تنفيذي‎ ‎ياباني‎ ‎كبير،‎ ‎أو‎ ‎أن‎ ‎مصطلحاً‎ ‎سريرياً‎ ‎تم‎ ‎تضييقه‎ ‎بطريقة‎ ‎تغير‎ ‎السكان‎ ‎الذي‎ ‎ينطبق‎ ‎عليهم‎.‎

الفئة‎ ‎ب‎: الإخفاقات‎ ‎الظاهرة‎.‎ ترجمة‎ MiniMax ‎لعبارة‎ "burning the midnight oil" ‎بـ‎ "‎حرق‎ ‎المشاعل‎." GPT-4.1-NANO ‎يحل‎ "That's sick" ‎إلى‎ "すごい" ‎غير‎ ‎الغامض‎. هذه‎ ‎قابلة‎ ‎للكشف،‎ ‎إما‎ ‎من‎ ‎قبل‎ ‎متحدث‎ ‎اللغة‎ ‎الهدف‎ ‎أو‎ ‎من‎ ‎خلال‎ ‎المقارنة‎ ‎مع‎ ‎مخرجات‎ ‎نماذج‎ ‎أخرى‎.‎

المقارنة‎ ‎متعددة‎ ‎النماذج‎ ‎التي‎ ‎توفرها‎ SMART ‎هي‎ ‎الأكثر‎ ‎قيمة‎ ‎في‎ ‎الفئة‎ ‎أ‎. ‎عندما‎ ‎ينتج‎ ‎خمسة‎ ‎أو‎ ‎عشرة‎ ‎نماذج‎ ‎مخرجات‎ ‎ويتفق‎ ‎معظمها‎ ‎على‎ ‎سجل‎ ‎رسمي‎ ‎بينما‎ ‎ينتج‎ ‎أحدها‎ ‎اللغة‎ ‎اليابانية‎ ‎العادية‎ ‎غير‎ ‎الرسمية،‎ ‎يكون‎ ‎عدم‎ ‎الاتفاق‎ ‎مرئياً‎ ‎في‎ ‎عرض‎ ‎المقارنة‎. مستخدم‎ ‎يتحدث‎ ‎لغة‎ ‎الهدف‎ ‎يمكنه‎ ‎تقييم‎ ‎الخيارات‎. المستخدم‎ ‎الذي‎ ‎لا‎ ‎يستطيع‎ ‎رؤية‎ ‎أن‎ ‎قرارًا‎ ‎متنازعًا‎ ‎عليه‎ ‎تم‎ ‎اتخاذه،‎ ‎ويمكنه‎ ‎أن‎ ‎يقرر‎ ‎ما‎ ‎إذا‎ ‎كانت‎ ‎تلك‎ ‎الجملة‎ ‎تستحق‎ ‎المراجعة‎ ‎البشرية‎.‎

بالنسبة‎ ‎للعمل‎ ‎على‎ ‎مستوى‎ ‎المستند،‎ ‎والملفات‎ ‎الكبيرة،‎ ‎والترجمة‎ ‎التي‎ ‎تحافظ‎ ‎على‎ ‎التخطيط‎ ‎لملفات‎ PDF ‎والعقود‎ ‎والمواد‎ ‎السريرية،‎ ‎تتعامل‎ ‎قدرة‎ ‎معالجة‎ ‎المستندات‎ ‎في‎ ‎المنصة‎ ‎مع‎ ‎هيكل‎ ‎الملف‎ ‎دون‎ ‎كسر‎ ‎التنسيق‎. لكن‎ ‎أسئلة‎ ‎الجودة‎ ‎المطروحة‎ ‎أعلاه‎ ‎تنطبق‎ ‎بغض‎ ‎النظر‎ ‎عن‎ ‎حجم‎ ‎الملف‎. دراسة‎ ‎سريرية‎ ‎بـ‎ 100 ‎صفحة‎ ‎حيث‎ ‎يتم‎ ‎ترجمة‎ ‎كل‎ ‎حالة‎ ‎من‎ "‎ضعف‎ ‎الكبد‎" ‎إلى‎ "‎فشل‎ ‎الكبد‎" ‎هي‎ ‎نسخة‎ ‎أكبر‎ ‎من‎ ‎نفس‎ ‎المشكلة‎ ‎المحددة‎ ‎في‎ ‎الاختبار‎ 2.‎

بالنسبة‎ ‎للفئات‎ ‎الطبية‎ ‎والقانونية‎ ‎على‎ ‎وجه‎ ‎التحديد،‎ ‎التحقق‎ ‎البشري‎ ‎هو‎ ‎الحل‎ ‎الصحيح‎.‎ خدمة‎ ‎تحرير‎ ‎ما‎ ‎بعد‎ ‎الذكاء‎ ‎الاصطناعي‎ ‎من‎ Tomedes،‎ ‎التي‎ ‎تجمع‎ ‎بين‎ ‎مخرجات‎ ‎الذكاء‎ ‎الاصطناعي‎ ‎مع‎ ‎المراجعة‎ ‎البشرية‎ ‎المعتمدة‎ ‎لهذا‎ ‎النوع‎ ‎من‎ ‎المحتوى‎ ‎عالي‎ ‎المخاطر،‎ ‎مصممة‎ ‎لهذا‎ ‎الغرض‎. انقسام‎ suy gan / suy giảm chức năng gan ‎هو‎ ‎بالضبط‎ ‎نوع‎ ‎النتيجة‎ ‎التي‎ ‎يجب‎ ‎أن‎ ‎تثير‎ ‎هذا‎ ‎الاستعراض،‎ ‎ليس‎ ‎لأن‎ ‎جميع‎ ‎النماذج‎ ‎خاطئة،‎ ‎بل‎ ‎لأن‎ ‎النماذج‎ ‎الأكثر‎ ‎ثقة‎ ‎ليست‎ ‎الأكثر‎ ‎دقة‎.‎

قيمة‎ ‎رؤية‎ ‎مخرجات‎ ‎متعددة‎ ‎ليست‎ ‎أنك‎ ‎ستختار‎ ‎دائماً‎ ‎الأغلبية‎. إنه‎ ‎أنك‎ ‎ستعرف‎ ‎أن‎ ‎تم‎ ‎اتخاذ‎ ‎اختيار،‎ ‎وهذا‎ ‎مختلف‎ ‎عن‎ ‎افتراض‎ ‎أن‎ ‎المخرجات‎ ‎أمامك‎ ‎صحيحة‎.‎

ما‎ ‎الذي‎ ‎أخبرتني‎ ‎به‎ ‎الجمل‎ ‎الثماني‎ ‎الفعلية

ضع‎ ‎الاختبارات‎ ‎الثمانية‎ ‎جنباً‎ ‎إلى‎ ‎جنب‎ ‎وينطبق‎ ‎نمط‎: ‎الاتفاق‎ ‎والاختلاف‎ ‎لا‎ ‎يتم‎ ‎توزيعهما‎ ‎عشوائياً‎. اللغة‎ ‎الاصطلاحية‎ ‎اليومية‎ ‎في‎ ‎مجال‎ ‎الأعمال‎ ("‎التواصل‎"‎،‎ "‎السهر‎ ‎حتى‎ ‎وقت‎ ‎متأخر‎ ‎من‎ ‎الليل‎") ‎تقاربت‎ ‎عبر‎ ‎جميع‎ ‎النماذج‎ ‎تقريباً‎ ‎في‎ ‎المجموعة،‎ ‎في‎ ‎كلا‎ ‎الجولتين‎. الرسمية‎ ‎والدقة‎ ‎القانونية‎ ‎والمصطلحات‎ ‎الطبية‎ ‎لم‎ ‎تكن‎ ‎كذلك‎. اختبار‎ ‎الرسمية‎ ‎بين‎ ‎الرئيس‎ ‎التنفيذي‎ ‎انقلب‎ ‎من‎ ‎غير‎ ‎رسمي‎ ‎إلى‎ ‎رسمي‎ ‎مرة‎ ‎واحدة‎ ‎فقط‎ ‎عندما‎ ‎تم‎ ‎إدراج‎ ‎المجموعة‎ ‎الموسعة‎. ظهرت‎ ‎بند‎ ‎التعويض‎ ‎تمييزاً‎ ‎قانونياً‎ ‎حقيقياً‎ (‎إعفاء‎ ‎من‎ ‎المسؤولية‎ ‎مقابل‎ ‎التعويض‎) ‎لم‎ ‎يتمكن‎ ‎سوى‎ ‎نموذج‎ ‎واحد،‎ ‎في‎ ‎جولة‎ ‎واحدة،‎ ‎من‎ ‎الحصول‎ ‎عليه‎ ‎بشكل‎ ‎صحيح‎. لم‎ ‎يتم‎ ‎حل‎ ‎الانقسام‎ ‎في‎ ‎المصطلحات‎ ‎الطبية‎ ‎على‎ ‎الإطلاق،‎ ‎حيث‎ ‎ظل‎ ‎عند‎ ‎نسبة‎ ‎تقريبية‎ 6 ‎إلى‎ 4 ‎عبر‎ ‎كلا‎ ‎الجولتين‎ ‎بغض‎ ‎النظر‎ ‎عن‎ ‎النماذج‎ ‎الموجودة‎ ‎في‎ ‎المجموعة‎.‎

هذه‎ ‎هي‎ ‎النتيجة‎ ‎الفعلية،‎ ‎وليست‎ ‎ادعاء‎ ‎تسويقي‎: ‎الإجماع‎ ‎لا‎ ‎يجعل‎ ‎كل‎ ‎جملة‎ ‎أفضل،‎ ‎وليس‎ ‎هناك‎ ‎حاجة‎ ‎إلى‎ ‎ذلك‎. إنها‎ ‎ذات‎ ‎قيمة‎ ‎أعظم‎ ‎تماماً‎ ‎حيث‎ ‎تمنحك‎ ‎طلاقة‎ ‎نموذج‎ ‎واحد‎ ‎لا‎ ‎سبب‎ ‎للشك‎ ‎فيها،‎ ‎وحيث‎ ‎يكون‎ ‎الخطأ‎ ‎مكلفاً‎ ‎فعلاً‎.‎

هناك‎ ‎طبقة‎ ‎ثانية‎ ‎أكثر‎ ‎عملية‎ ‎لهذا‎ ‎الاختبار‎ ‎تستحق‎ ‎أن‎ ‎تُذكر‎ ‎بوضوح‎. إجراء‎ ‎هذه‎ ‎المقارنة‎ ‎بنفسي‎ ‎يعني‎ ‎التحقق‎ ‎من‎ ‎مخرجات‎ GPT-5.5 ‎و‎ Claude Opus 4-7 ‎و‎ Gemini 3.5-Flash ‎و‎ GLM-5-Turbo ‎و‎ MiniMax M2.7 ‎جنباً‎ ‎إلى‎ ‎جنب‎ ‎مع‎ ‎نماذج‎ ‎الأساس‎ ‎الموجودة،‎ ‎في‎ ‎مكان‎ ‎واحد،‎ ‎على‎ ‎منصة‎ ‎واحدة‎. خارج‎ ‎موقع‎ MachineTranslation.com،‎ ‎هذه‎ ‎ليست‎ ‎اشتراكًا‎ ‎واحدًا‎. إنها‎ ‎عدة،‎ ‎واحدة‎ ‎لكل‎ ‎مزود‎ ‎خدمة‎ ‎تريد‎ ‎اختبار‎ ‎مستواه‎ ‎المميز،‎ ‎بأي‎ ‎سعر‎ ‎يفرضه‎ ‎كل‎ ‎مزود‎ ‎خدمة‎ ‎على‎ ‎حدة‎. المستخدمون‎ ‎الذين‎ ‎يدفعون‎ ‎هنا‎ ‎يحصلون‎ ‎على‎ ‎نفس‎ ‎المقارنة‎ ‎بنقرة‎ ‎واحدة،‎ ‎بجزء‎ ‎من‎ ‎تكلفة‎ ‎الحفاظ‎ ‎على‎ ‎خمس‎ ‎اشتراكات‎ ‎متميزة‎ ‎منفصلة،‎ ‎دون‎ ‎التضحية‎ ‎بالشيء‎ ‎الذي‎ ‎يهم‎ ‎فعلاً‎: ‎معرفة‎ ‎مكان‎ ‎اتفاق‎ ‎النماذج،‎ ‎ومعرفة‎ ‎بالضبط‎ ‎متى‎ ‎لا‎ ‎تتفق‎.‎

الأسئلة‎ ‎الشائعة

‎1. هل‎ ChatGPT ‎أو‎ Claude ‎أفضل‎ ‎للترجمة؟

لا‎ ‎أحد‎ ‎منهما‎ ‎أفضل‎ ‎بشكل‎ ‎قاطع؛‎ ‎فهذا‎ ‎يعتمد‎ ‎على‎ ‎فئة‎ ‎الاختبار‎. اختار‎ Claude Sonnet ‎و‎ Claude Opus ‎باستمرار‎ ‎المصطلح‎ ‎الطبي‎ ‎الفيتنامي‎ ‎الأكثر‎ ‎دقة،‎ ‎وأنتج‎ Claude Opus ‎أنسب‎ ‎لغة‎ ‎عامية‎ ‎لـ‎ "That's sick." لكن‎ Claude Sonnet ‎أنتج‎ ‎أيضًا‎ ‎اللغة‎ ‎اليابانية‎ ‎العادية‎ ‎في‎ ‎جملة‎ ‎سياق‎ ‎الرئيس‎ ‎التنفيذي‎ ‎الرسمية،‎ ‎حيث‎ ‎حصل‎ GPT-5.5 ‎على‎ ‎الإجابة‎ ‎الصحيحة‎. مقارنة‎ ‎المخرجات‎ ‎مباشرة‎ ‎أكثر‎ ‎قابلية‎ ‎للدفاع‎ ‎عنها‎ ‎من‎ ‎اختيار‎ ‎نموذج‎ ‎واحد‎ ‎والثقة‎ ‎به‎.‏

‎2. ما‎ ‎هو‎ ‎نموذج‎ ‎الترجمة‎ ‎الآلية‎ ‎الأكثر‎ ‎دقة‎ ‎في‎ ‎عام‎ 2026؟

لا‎ ‎يوجد‎ ‎واحد؛‎ ‎الدقة‎ ‎تعتمد‎ ‎على‎ ‎المجال‎. أنتج‎ Gemini 3.5-Flash ‎و‎ GLM-5-Turbo ‎أكثر‎ ‎اللغة‎ ‎اليابانية‎ ‎الرسمية‎ ‎ملاءمة‎ ‎في‎ ‎هذا‎ ‎الاختبار‎. كلا‎ ‎نموذجي‎ Claude ‎كانا‎ ‎الأكثر‎ ‎دقة‎ ‎في‎ ‎المصطلحات‎ ‎الطبية‎ ‎الفيتنامية‎. كان‎ DeepSeek V4-Pro ‎هو‎ ‎النموذج‎ ‎الوحيد‎ ‎الذي‎ ‎استخدم‎ ‎المصطلح‎ ‎القانوني‎ ‎الياباني‎ ‎الصحيح،‎ ‎لكن‎ ‎فقط‎ ‎في‎ ‎الجولة‎ ‎الثانية،‎ ‎وأنتج‎ ‎لغة‎ ‎يابانية‎ ‎عامية‎ ‎في‎ ‎أماكن‎ ‎أخرى‎. لم‎ ‎يهيمن‎ ‎أي‎ ‎نموذج‎ ‎واحد‎ ‎على‎ ‎جميع‎ ‎الاختبارات‎ ‎الثمانية‎.‏

‎3. هل‎ ‎إضافة‎ ‎المزيد‎ ‎من‎ ‎نماذج‎ ‎الذكاء‎ ‎الاصطناعي‎ ‎يحسن‎ ‎دائماً‎ ‎دقة‎ ‎الترجمة؟

لا،‎ ‎ليس‎ ‎تلقائياً‎. توسيع‎ ‎مجموعة‎ ‎نماذج‎ ‎الفئة‎ ‎المتميزة‎ ‎الأحدث‎ ‎غيّر‎ ‎الإجماع‎ ‎من‎ ‎غير‎ ‎الرسمي‎ ‎إلى‎ ‎الرسمي‎ ‎في‎ ‎اختبار‎ ‎الرسمية‎ ‎الياباني‎. لكن‎ ‎في‎ ‎اختبار‎ ‎المصطلحات‎ ‎الطبية‎ ‎الفيتنامية،‎ ‎استمر‎ ‎الانقسام‎ ‎بنسبة‎ ‎تقريبية‎ 6 ‎إلى‎ 4 ‎بغض‎ ‎النظر‎ ‎عن‎ ‎النماذج‎ ‎المضمنة‎. ظهور‎ ‎المزيد‎ ‎من‎ ‎النماذج‎ ‎يسفر‎ ‎عن‎ ‎المزيد‎ ‎من‎ ‎الاختلاف،‎ ‎وهو‎ ‎إشارة‎ ‎مفيدة،‎ ‎لكن‎ ‎الإجماع‎ ‎لا‎ ‎يزال‎ ‎يتبع‎ ‎الأغلبية،‎ ‎والأغلبية‎ ‎ليست‎ ‎دائماً‎ ‎الإجابة‎ ‎الأكثر‎ ‎دقة‎.‏

‎4. ما‎ ‎هو‎ SMART ‎وكيف‎ ‎يعمل؟

SMART ‎هو‎ ‎نظام‎ ‎الإجماع‎ ‎متعدد‎ ‎النماذج‎ ‎من‎ MachineTranslation.com،‎ ‎والذي‎ ‎يمتد‎ ‎إلى‎ 22 ‎نموذج‎ ‎ذكاء‎ ‎اصطناعي‎ ‎عبر‎ ‎موفري‎ ‎الخدمات‎ ‎بما‎ ‎في‎ ‎ذلك‎ OpenAI ‎و‎ Anthropic ‎و‎ Google ‎و‎ DeepSeek. يقوم‎ ‎بتشغيل‎ ‎ترجمة‎ ‎عبر‎ ‎نماذج‎ ‎متعددة‎ ‎في‎ ‎نفس‎ ‎الوقت‎ ‎ويعرض‎ ‎ناتج‎ ‎الإجماع‎ ‎الأغلبي‎ ‎إلى‎ ‎جانب‎ ‎إجابة‎ ‎كل‎ ‎نموذج‎ ‎فردي،‎ ‎افتراضياً،‎ ‎دون‎ ‎الحاجة‎ ‎إلى‎ ‎أي‎ ‎إعدادات‎. يتحول‎ ‎الإجماع‎ ‎عندما‎ ‎تتحول‎ ‎مجموعة‎ ‎النماذج،‎ ‎كما‎ ‎هو‎ ‎موضح‎ ‎في‎ ‎نتيجة‎ ‎الرسمية‎ ‎اليابانية‎ ‎لهذا‎ ‎الاختبار‎: ‎تحول‎ ‎الإجماع‎ ‎غير‎ ‎الرسمي‎ ‎في‎ ‎الجولة‎ ‎الأولى‎ ‎إلى‎ ‎رسمي‎ ‎في‎ ‎الجولة‎ ‎الثانية‎.‏

‎5. أي‎ ‎نموذج‎ ‎ذكاء‎ ‎اصطناعي‎ ‎هو‎ ‎الأفضل‎ ‎للترجمة‎ ‎الطبية‎ ‎أو‎ ‎القانونية؟

لا‎ ‎يوجد‎ ‎نموذج‎ ‎واحد؛‎ ‎المراجعة‎ ‎البشرية‎ ‎هي‎ ‎الإجابة‎ ‎الأفضل‎. اختارت‎ ‎نماذج‎ Claude ‎باستمرار‎ ‎المصطلح‎ ‎الطبي‎ ‎الفيتنامي‎ ‎الأكثر‎ ‎دقة،‎ ‎واستخدم‎ DeepSeek V4-Pro ‎وحده‎ ‎المصطلح‎ ‎القانوني‎ ‎الياباني‎ ‎الصحيح،‎ ‎لكن‎ ‎فقط‎ ‎في‎ ‎الجولة‎ ‎الثانية‎. لم‎ ‎يتم‎ ‎حل‎ ‎انقسام‎ ‎المصطلحات‎ ‎الطبية‎ ‎أبداً‎ ‎عبر‎ 10 ‎نماذج،‎ ‎مما‎ ‎يشير‎ ‎إلى‎ ‎أن‎ ‎الخبرة‎ ‎في‎ ‎المجال‎ ‎مطلوبة،‎ ‎وليس‎ ‎أن‎ ‎يتم‎ ‎اختيار‎ ‎نموذج‎ ‎مختلف‎. مراجعة‎ ‎تحرير‎ ‎بشري‎ ‎معتمدة ،‎ ‎مثل‎ ‎تلك‎ ‎التي‎ ‎تقدمها‎ Tomedes،‎ ‎توفر‎ ‎هذا‎ ‎الفحص‎ ‎المتخصص‎.‎