July 10, 2026
كلمتان. ستة نماذج. ثلاثة قرارات ترجمة مختلفة. إليك ما حدث عندما قمت بتشغيل 8 جمل اختبار من خلال أحدث نماذج الذكاء الاصطناعي المتاحة على MachineTranslation.com، وما تكشفه المخرجات فعلاً حول متى يفشل النموذج بصمت.
كلمتان. ده مجنون. ستة نماذج. ثلاث قرارات ترجمية متميزة.
في اللغة اليابانية، قدمت إحدى النماذج ترجمة لها كـ それはやばい، محافظة على الغموض. شخص آخر حذف ضمير الفاعل تماماً وكتب الصيغة المجردة やばい، وهي الأكثر تحدثاً وعفوية الممكنة. كتب ثالث それはすごい، وهذا يحل الغموض بالكامل لصالح "مذهل"، مما يزيل المعنى المزدوج الذي جعل العبارة مثيرة للاهتمام في المقام الأول. في اللغة الفيتنامية، كتب أحد النماذج ڊِنْه ڤَاي (لغة عامية، صحيحة لسجل الشباب). كتب آخر حقا رائع، صحيح نحويا، لكنه أقرب إلى قول "هذا حقا مذهل" عندما يرسل لك شخص ما ميم.
كل هذه مدافع عنها. لا شيء منها هو نفس الشيء. وإذا كنت تقوم بتشغيل الترجمات من خلال نموذج واحد، فلن ترى أبداً الخيار الذي تم اتخاذه نيابة عنك.
هذا هو السؤال الأساسي الذي تحاول هذه المقالة الإجابة عليه. ليس أي نموذج ذكاء اصطناعي هو الأفضل للترجمة في عام 2026 (الإجابة تعتمد على زوج اللغة والسجل والمجال وبنية الجملة)، بل بالأحرى: كيف ستعرف عندما يتخذ نموذجك القرار الخاطئ؟ خاصة في المجالات مثل المصطلحات الطبية والعقود القانونية أو الرسمية المهنية، حيث يبدو القرار الخاطئ تماماً مثل الترجمة الصحيحة حتى يقرأها متخصص.
إليك ما فعلته. قمت بتشغيل 8 جمل اختبارية عبر جولتين من النماذج على MachineTranslation.com: أولاً خط أساسي من 5 نماذج مستخدمة على نطاق واسع، ثم مجموعة موسعة تضيف عدة متغيرات نموذج من الطبقة المميزة الأحدث المتاحة الآن للمستخدمين المدفوعين. عادةً، كان مقارنة المخرجات من نماذج مثل هذه تعني الاشتراكات المدفوعة المنفصلة مع كل مزود على حدة. على موقع MachineTranslation.com، يجلسون في نفس عرض المقارنة. أزواج اللغات كانت الإنجليزية→اليابانية والإنجليزية→الفيتنامية. تم اختيار فئات الجملة بشكل محدد لاختبار الضغط على المناطق التي يكون فيها عدم الاتفاق بين النماذج الأكثر أهمية: الصيغ الاصطلاحية، والمصطلحات القانونية، والمصطلحات الطبية، والسياق الحساس للرسمية، والغموض الدلالي المتعمد.
ملاحظة حول منهجية التقييم: لطالما كافحت أبحاث الترجمة الآلية مع كيفية تسجيل المخرجات تلقائياً. المقاييس مثل BLEU و COMET كما تم قياسها في مهام WMT المشتركة توفر إشارة تجميعية مفيدة، لكنها ضعيفة جداً في الكشف عن أخطاء السجل اللغوي، وإخفاقات التعابير الاصطلاحية، والدقة المصطلحية، وهي بالضبط الفئات التي تهمنا أكثر هنا. ما أنت على وشك قراءته هو تحليل النتائج، وليس سباق BLEU.

ليس كل جملة تظهر اختلافاً ذا مغزى. اثنان من الاختبارات الثمانية، "دعنا نتواصل بمجرد أن يهدأ الغبار حول هذه الصفقة" (→ اليابانية) و"نحن نعمل بجد طوال الليل لتحقيق موعد الإطلاق هذا" (→ الفيتنامية)، أنتجا اتفاقاً عالياً عبر كلا الجولتين. تم فهم التعابير بشكل صحيح كتعابير. لم يترجم أحد "touch base" على أنها لمس قاعدة فيزيائية. لم يترجم أحد "the dust settles" على أنها رسوبات تسقط.
هذا يستحق التوقف عنده: اللغة الإنجليزية الاصطلاحية في مجال الأعمال يتم التعامل معها بشكل معقول من قبل نماذج الحدود الحالية عندما تكون الاصطلاحية شائعة بما يكفي. الإجماع على "touch base" ظل مستقراً عبر كلا الجولتين؛ كان التباين أسلوبياً بحتاً، حول ما إذا كان يجب استخدام この件 (هذه المسألة)، この取引 (هذه الصفقة)، أو この案件 (هذه الحالة) للعبارة المصدرية.

اختبار "حرق منتصف الليل" هو حيث أصبحت الأمور أكثر إثارة للاهتمام. كل نموذج باستثناء واحد فهم التعبير الاصطلاحي بشكل صحيح. ميني ماكس إم 2.7، التي تم تقديمها في الجولة الثانية، ترجمت كلمة "burning" حرفياً، مما أسفر عن đốt đuốc، بمعنى "مشاعل مشتعلة." الإجماع استبعده بشكل صحيح.

اللغة اليابانية هي لغة متعددة المستويات من حيث الرسميات. اختيار نهاية الفعل والضمير وشكل الاسم الإحالي ليس أسلوبياً. إنه يشير إلى العلاقة بين المتحدث والمستقبل. إرسال رسالة إلى الرئيس التنفيذي الخاص بك باستخدام أشكال فعل غير رسمية ليس خطأ ترجمة بالمعنى النحوي. إنه خطأ اجتماعي، وخطأ كبير.
جملة الاختبار: هل يمكنك إرسال ذلك؟ شكراً، أقدّر ذلك. السياق: مراسلة الرئيس التنفيذي.

تحول الإجماع عندما توسعت مجموعة النماذج. آلية العمل واضحة جداً: إضافة نماذج تقرأ سياق الرسمية بشكل صحيح غيّرت الأغلبية، وتبعها الإجماع. إليك الطيف الكامل لما أنتجته النماذج في الجولة 2:

اختبار السجل الفيتنامي كشف عن نوع مختلف من أخطاء الرسمية، وهو أكثر دقة. الجملة المصدر: هيه، سؤال سريع — هل أنت متاح للقيام بمكالمة؟ السياق: مراسلة عميل. تضمن Qwen في الجولة الأولى كلمة "mình"، وهي ضمير المتكلم الذي يعني الصداقة على مستوى الأقران بشكل غير رسمي. كل نموذج آخر تجنب الإشارة الذاتية بصيغة المتكلم بالكامل، وهو الخيار المهني الأكثر أماناً. بشكل حاسم، قام Qwen بتصحيح هذا في الجولة الثانية وحذف "mình." تم استبعاده بالإجماع في كلا الجولتين.

جملة التعويض بين البائع والعميل هي بند قياسي في الاتفاقيات التجارية: "يجب على البائع أن يعوض العميل عن أي مطالبات من طرف ثالث ناشئة عن الإخلال بهذا الاتفاق."
في الجولة الأولى، حددت جميع النماذج الخمسة بشكل صحيح السجل القانوني واستخدمت الكلمات المستعارة ベンダー (المورّد) و クライアント (العميل)، وهي معايير شائعة في العقود التجارية اليابانية ذات الأصول الإنجليزية. استثناء واحد: استخدم GPT-4.1-NANO كلمات يابانية شرعية وهي 販売者 (البائع) و 顧客 (العميل) التي تفتقر إلى الدقة القانونية الرسمية للكلمات المستعارة المكافئة.
ظهرت النتيجة الأكثر أهمية في الجولة الثانية. التمييز الرئيسي هو بين كلمتين:
هذه مفاهيم مختلفة قانوناً. "تعويض" يعني بالتحديد حماية طرف من مسؤولية الطرف الثالث. 免責 هو المصطلح القانوني الصحيح. جميع نماذج الجولة الأولى استخدمت 補償. في الجولة 2، كان DeepSeek V4-Pro هو النموذج الوحيد الذي أنتج 免責، وقد فعل ذلك في الجولة 2 فقط، وليس في الجولة 1.

في العقد، التعويض والإعفاء من المسؤولية ليست مرادفات. واحد يعني "سنعيد إليك المال." والآخر يعني "أنت محمي من المطالبة في المقام الأول." إذا استخدمت منصة الترجمة 補償 حيث يكون 免責 صحيحاً، فإن المحامي الذي يقرأ النسخة اليابانية لن يرى نفس الاتفاقية التي تصفها النسخة الإنجليزية.
هذا هو الاكتشاف الأكثر أهمية في مجموعة البيانات. جملة الاختبار: هذا الدواء مضاد استطباب في المرضى الذين لديهم تاريخ من ضعف الكبد. المصدر: وثائق المنتج السريرية. الهدف: Vietnamese.
الضعف الكبدي هو المصطلح الحاسم. هناك مرشحان فيتناميان:
هذه متميزة سريريًا. تحذير موانع الاستعمال بناءً على "ضعف الكبد" ينطبق على أي شخص يعاني من ضعف وظائف الكبد، وليس فقط على من عانوا من فشل كامل للعضو. استخدام suy gan يضيق السكان المشار إليهم بشكل غير صحيح. مريض يعاني من ضعف كبدي متوسط قد لا يتعرف على نفسه كمجموعة سكانية مضادة للاستطباب عند قراءة "suy gan".

بعض الجمل المصدرية غامضة بالتصميم. "That's sick" في لغة الإنجليزية المعاصرة تعني شيئاً ممتازاً، لكنها تحتفظ أيضاً بمعناها الحرفي (أي أنها مقيتة/مثيرة للاشمئزاز)، والتوتر بين هذين المعنيين هو جزء من كيفية تواصل العبارة. التحدي الذي يواجه نموذج الترجمة هو: هل تحافظ على الغموض، أم تختزله إلى المعنى الأكثر احتمالاً، أم تختار واحداً والتزم به؟


النماذج في هذا الاختبار ليست متكافئة جميعها. إنها تغطي معماريات مختلفة وأنظمة تدريب وسياقات نشر متنوعة. الجولة الأولى الأساسية تشمل نماذج يمكن الوصول إليها على نطاق واسع. تتضمن مجموعة الجولة 2 الموسعة عدة متغيرات نموذج متطورة من الفئة المتميزة المتاحة الآن للمستخدمين الذين يدفعون على MachineTranslation.com، وهي نفس فئة النموذج التي قد تعني خلاف ذلك حسابًا مدفوعًا منفصلًا مع كل مزود فردي.

تتضمن المجموعة الموسعة في الجولة 2 نماذج أكثر تقدمًا ومتاحة للمستخدمين الذين يدفعون على MachineTranslation.com. تأثير توسيع المجموعة ليس موحداً. في بعض الاختبارات (الرسمية/اليابانية)، غيّرت الإجماع بشكل ملموس. في البعض الآخر (المصطلحات الطبية/الفيتنامية)، تعمق الانقسام.

تشير بيانات الاختبار إلى فئتين مختلفتين من الفشل، وتتطلب كل منهما ردود مختلفة.
الفئة أ: الإخفاقات الصامتة. أخطاء الشكليات، أخطاء السجل اللغوي، دقة المصطلحات الطبية: هذه تنتج مخرجات تبدو صحيحة. اللغة اليابانية سليمة من حيث القواعد النحوية. الفيتنامي يتحدث بطلاقة. لا توجد إشارة سطحية تدل على حدوث أي خلل. المستخدم أحادي اللغة الذي يقرأ مخرجات نموذج واحد ليس لديه طريقة للمعرفة بأن النموذج اتخذ خيار تسجيل قد يلاحظه مدير تنفيذي ياباني كبير، أو أن مصطلحاً سريرياً تم تضييقه بطريقة تغير السكان الذي ينطبق عليهم.
الفئة ب: الإخفاقات الظاهرة. ترجمة MiniMax لعبارة "burning the midnight oil" بـ "حرق المشاعل." GPT-4.1-NANO يحل "That's sick" إلى "すごい" غير الغامض. هذه قابلة للكشف، إما من قبل متحدث اللغة الهدف أو من خلال المقارنة مع مخرجات نماذج أخرى.
المقارنة متعددة النماذج التي توفرها SMART هي الأكثر قيمة في الفئة أ. عندما ينتج خمسة أو عشرة نماذج مخرجات ويتفق معظمها على سجل رسمي بينما ينتج أحدها اللغة اليابانية العادية غير الرسمية، يكون عدم الاتفاق مرئياً في عرض المقارنة. مستخدم يتحدث لغة الهدف يمكنه تقييم الخيارات. المستخدم الذي لا يستطيع رؤية أن قرارًا متنازعًا عليه تم اتخاذه، ويمكنه أن يقرر ما إذا كانت تلك الجملة تستحق المراجعة البشرية.
بالنسبة للعمل على مستوى المستند، والملفات الكبيرة، والترجمة التي تحافظ على التخطيط لملفات PDF والعقود والمواد السريرية، تتعامل قدرة معالجة المستندات في المنصة مع هيكل الملف دون كسر التنسيق. لكن أسئلة الجودة المطروحة أعلاه تنطبق بغض النظر عن حجم الملف. دراسة سريرية بـ 100 صفحة حيث يتم ترجمة كل حالة من "ضعف الكبد" إلى "فشل الكبد" هي نسخة أكبر من نفس المشكلة المحددة في الاختبار 2.
بالنسبة للفئات الطبية والقانونية على وجه التحديد، التحقق البشري هو الحل الصحيح. خدمة تحرير ما بعد الذكاء الاصطناعي من Tomedes، التي تجمع بين مخرجات الذكاء الاصطناعي مع المراجعة البشرية المعتمدة لهذا النوع من المحتوى عالي المخاطر، مصممة لهذا الغرض. انقسام suy gan / suy giảm chức năng gan هو بالضبط نوع النتيجة التي يجب أن تثير هذا الاستعراض، ليس لأن جميع النماذج خاطئة، بل لأن النماذج الأكثر ثقة ليست الأكثر دقة.
قيمة رؤية مخرجات متعددة ليست أنك ستختار دائماً الأغلبية. إنه أنك ستعرف أن تم اتخاذ اختيار، وهذا مختلف عن افتراض أن المخرجات أمامك صحيحة.

ضع الاختبارات الثمانية جنباً إلى جنب وينطبق نمط: الاتفاق والاختلاف لا يتم توزيعهما عشوائياً. اللغة الاصطلاحية اليومية في مجال الأعمال ("التواصل"، "السهر حتى وقت متأخر من الليل") تقاربت عبر جميع النماذج تقريباً في المجموعة، في كلا الجولتين. الرسمية والدقة القانونية والمصطلحات الطبية لم تكن كذلك. اختبار الرسمية بين الرئيس التنفيذي انقلب من غير رسمي إلى رسمي مرة واحدة فقط عندما تم إدراج المجموعة الموسعة. ظهرت بند التعويض تمييزاً قانونياً حقيقياً (إعفاء من المسؤولية مقابل التعويض) لم يتمكن سوى نموذج واحد، في جولة واحدة، من الحصول عليه بشكل صحيح. لم يتم حل الانقسام في المصطلحات الطبية على الإطلاق، حيث ظل عند نسبة تقريبية 6 إلى 4 عبر كلا الجولتين بغض النظر عن النماذج الموجودة في المجموعة.
هذه هي النتيجة الفعلية، وليست ادعاء تسويقي: الإجماع لا يجعل كل جملة أفضل، وليس هناك حاجة إلى ذلك. إنها ذات قيمة أعظم تماماً حيث تمنحك طلاقة نموذج واحد لا سبب للشك فيها، وحيث يكون الخطأ مكلفاً فعلاً.
هناك طبقة ثانية أكثر عملية لهذا الاختبار تستحق أن تُذكر بوضوح. إجراء هذه المقارنة بنفسي يعني التحقق من مخرجات GPT-5.5 و Claude Opus 4-7 و Gemini 3.5-Flash و GLM-5-Turbo و MiniMax M2.7 جنباً إلى جنب مع نماذج الأساس الموجودة، في مكان واحد، على منصة واحدة. خارج موقع MachineTranslation.com، هذه ليست اشتراكًا واحدًا. إنها عدة، واحدة لكل مزود خدمة تريد اختبار مستواه المميز، بأي سعر يفرضه كل مزود خدمة على حدة. المستخدمون الذين يدفعون هنا يحصلون على نفس المقارنة بنقرة واحدة، بجزء من تكلفة الحفاظ على خمس اشتراكات متميزة منفصلة، دون التضحية بالشيء الذي يهم فعلاً: معرفة مكان اتفاق النماذج، ومعرفة بالضبط متى لا تتفق.
لا أحد منهما أفضل بشكل قاطع؛ فهذا يعتمد على فئة الاختبار. اختار Claude Sonnet و Claude Opus باستمرار المصطلح الطبي الفيتنامي الأكثر دقة، وأنتج Claude Opus أنسب لغة عامية لـ "That's sick." لكن Claude Sonnet أنتج أيضًا اللغة اليابانية العادية في جملة سياق الرئيس التنفيذي الرسمية، حيث حصل GPT-5.5 على الإجابة الصحيحة. مقارنة المخرجات مباشرة أكثر قابلية للدفاع عنها من اختيار نموذج واحد والثقة به.
لا يوجد واحد؛ الدقة تعتمد على المجال. أنتج Gemini 3.5-Flash و GLM-5-Turbo أكثر اللغة اليابانية الرسمية ملاءمة في هذا الاختبار. كلا نموذجي Claude كانا الأكثر دقة في المصطلحات الطبية الفيتنامية. كان DeepSeek V4-Pro هو النموذج الوحيد الذي استخدم المصطلح القانوني الياباني الصحيح، لكن فقط في الجولة الثانية، وأنتج لغة يابانية عامية في أماكن أخرى. لم يهيمن أي نموذج واحد على جميع الاختبارات الثمانية.
لا، ليس تلقائياً. توسيع مجموعة نماذج الفئة المتميزة الأحدث غيّر الإجماع من غير الرسمي إلى الرسمي في اختبار الرسمية الياباني. لكن في اختبار المصطلحات الطبية الفيتنامية، استمر الانقسام بنسبة تقريبية 6 إلى 4 بغض النظر عن النماذج المضمنة. ظهور المزيد من النماذج يسفر عن المزيد من الاختلاف، وهو إشارة مفيدة، لكن الإجماع لا يزال يتبع الأغلبية، والأغلبية ليست دائماً الإجابة الأكثر دقة.
SMART هو نظام الإجماع متعدد النماذج من MachineTranslation.com، والذي يمتد إلى 22 نموذج ذكاء اصطناعي عبر موفري الخدمات بما في ذلك OpenAI و Anthropic و Google و DeepSeek. يقوم بتشغيل ترجمة عبر نماذج متعددة في نفس الوقت ويعرض ناتج الإجماع الأغلبي إلى جانب إجابة كل نموذج فردي، افتراضياً، دون الحاجة إلى أي إعدادات. يتحول الإجماع عندما تتحول مجموعة النماذج، كما هو موضح في نتيجة الرسمية اليابانية لهذا الاختبار: تحول الإجماع غير الرسمي في الجولة الأولى إلى رسمي في الجولة الثانية.
لا يوجد نموذج واحد؛ المراجعة البشرية هي الإجابة الأفضل. اختارت نماذج Claude باستمرار المصطلح الطبي الفيتنامي الأكثر دقة، واستخدم DeepSeek V4-Pro وحده المصطلح القانوني الياباني الصحيح، لكن فقط في الجولة الثانية. لم يتم حل انقسام المصطلحات الطبية أبداً عبر 10 نماذج، مما يشير إلى أن الخبرة في المجال مطلوبة، وليس أن يتم اختيار نموذج مختلف. مراجعة تحرير بشري معتمدة ، مثل تلك التي تقدمها Tomedes، توفر هذا الفحص المتخصص.