June 5, 2026
لقد كنت أجري اختبارات داخلية على شيء لا نتحدث عنه بما فيه الكفاية في صناعة الترجمة: ليس ما إذا كانت أنظمة الذكاء الاصطناعي المختلفة تترجم بشكل مختلف، ولكن ما إذا كانت الإصدارات المختلفة من نفس الذكاء الاصطناعي تترجم بشكل مختلف - وبأي قدر. في الأسبوع الماضي، قمت بتشغيل تعبير إسباني واحد عبر خمسة إصدارات من ChatGPT في وقت واحد على المنصة الاختبارية الداخلية لـ MachineTranslation.com. ما عاد أوقفني. أنتج إصداران ترجمة، بكل صدق، لا معنى لها باللغة الإنجليزية. أنتجت ثلاثة إصدارات ترجمات صحيحة وسليمة لغويًا. ولم يتفق الثلاثة الصحيحون مع بعضهم البعض. الخمسة كلهم شات جي بي
تي. الخمسة جميعًا من OpenAI. نفس الذكاء الاصطناعي، نموذج مختلف — ولا يمكن أن تكون المخرجات مختلفة. أشارك هذا الآن لأنني أعتقد أنه مهم، وليس لأن لدي إجابات واضحة. لا أفعل. ولكن الملاحظة مثيرة للاهتمام بما يكفي لوضعها في العالم. جدول المحتويات الاختبار:
العبارة التي اختبرتها كانت llevarse el gato al agua.

إليك ما أنتجه كل إصدار:
| النموذج | الناتج | اصطلاحي؟ |
|---|---|---|
| شات جي بي تي:: جي بي تي-4o-ميني | حمل القطة إلى الماء | ❌ حرفي |
| شات جي بي تي:: جي بي تي-4.1-نانو | حمل القطة إلى الماء | ❌ حرفي |
| شات جي بي تي:: جي بي تي-4.1-ميني | تحقيق النجاح | ✅ صحيح |
| شات جي بي تي:: جي بي تي-5.4-ميني | تحقيق ما تريد | ✅ جزئي |
| شات جي بي تي:: جي بي تي-5.4 | الخروج منتصراً | ✅ صحيح |
العبارة تعني تحقيق شيء صعب ضد الصعاب، أي تحقيق فوز صعب. ليس له علاقة بالقطط أو الماء. الترجمة الحرفية ليست ترجمة. إنه نسخ كلمة بكلمة لعبارة فشل النموذج في التعرف عليها على أنها تعبير اصطلاحي.
أنتج GPT-4o-MINI و GPT-4.1-NANO مخرجات متطابقة. غير متشابه، متطابق. أشارت رؤى الترجمة لدينا إلى هذا مباشرةً: تترجم نماذج GPT-4.1-nano و GPT-4o-mini الترجمات المتطابقة، مع التركيز على التفسير الحرفي بدلاً من المعنى الاصطلاحي.
أنتج كل من GPT-4.1-MINI و GPT-5.4-MINI و GPT-5.4 شيئًا صحيحًا بشكل ملحوظ - ولكنه ليس متطابقًا مع بعضه البعض.
أريد أن أكون دقيقًا بشأن سبب كون llevarse el gato al agua مدخل اختبار مفيد بدلاً من كونه مدخلًا تم اختياره بعناية.
إنه اصطلاح راسخ. يظهر في الأدب والصحافة والحديث اليومي. ليس غامضًا. أي نموذج تم تدريبه على مجموعة معقولة من النصوص الإسبانية يجب أن يكون قد واجهه. السؤال ليس ما إذا كان النموذج قد رأى العبارة. السؤال هو ما يفعله به.
أسوأ وضع للفشل في ترجمة التعبيرات الاصطلاحية ليس إنتاج ترجمة سيئة . ينتج ترجمة حرفية تبدو مقبولة لشخص لا يعرف اللغة المستهدفة. حمل القطة إلى الماء هي عبارة صحيحة نحوياً باللغة الإنجليزية.
إنه حسن التكوين. يبدو الأمر وكأنه شيء يمكن أن يعني شيئًا ما. قد يقرأه مستخدم لا يتحدث الإسبانية، يومئ برأسه، ويمضي قدمًا — دون أن يعرف أبدًا أن المعنى الأصلي قد ضاع تمامًا.
هذا هو وضع الفشل الذي أهتم به. ليس الخطأ الواضح. الواحد غير المرئي. ما يخبرنا به الانقسام الحرفي إلى الاصطلاحي عن كيفية تدريب
عشوائيًا. النموذجان اللذان أنتجا ترجمات حرفية (GPT-4o-MINI و GPT-4.1-NANO) كلاهما نموذجان أصغر وأخف وزناً محسّنان للسرعة والكفاءة من حيث التكلفة. تمثل النماذج الثلاثة التي أنتجت ترجمات اصطلاحية (GPT-4.1-MINI، GPT-5.4-MINI، GPT-5.4) جيلاً مختلفًا أو مقياسًا مختلفًا للمعلمات.
هذا يشير إلى شيء أعتقد أنه لم يتم استكشافه بشكل كافٍ: الكفاءة الاصطلاحية في الترجمة تتناسب مع قدرة النموذج بطرق غير مرئية في المعايير العامة.
تختبر المعايير اللغوية العامة الاستدلال والمعرفة والبرمجة والرياضيات. لا يختبرون عادةً ما إذا كان النموذج يمكنه تحديد أن المطر ينهمر كأنه يصب لا يتعلق بظروف الطقس، أو أن llevarse el gato al agua لا يتعلق بترطيب قطة. تقع التعابير الاصطلاحية عند تقاطع المعرفة الثقافية، والاستدلال السياقي ، والتعرف على الأنماط - وهذا التقاطع يبدو أنه يتطلب عتبة من سعة النموذج لا تتجاوزها النماذج الأصغر باستمرار.
ما لا أدعيه: أن النماذج الأكبر هي دائمًا مترجمات أفضل. ليس لدي دليل على ذلك كقاعدة عامة. ما ألاحظه: أنه بالنسبة للمحتوى الاصطلاحي على وجه التحديد، كانت الفجوة بين النسخ داخل العائلة أكبر مما توقعت.
معظم المستخدمين الذين يستخدمون أداة ترجمة بالذكاء الاصطناعي لا يعرفون أي إصدار من هذا الذكاء الاصطناعي يستخدمونه. يفتحون منتجًا، ويختارون زوج لغات ، ويحصلون على مخرجات. التوجيه النموذجي غير مرئي لهم.
هذا مهم على نطاق واسع. قامت MachineTranslation.com بمعالجة أكثر من مئات الآلاف من مهام الترجمة من الإنجليزية إلى الإسبانية في فترة 90 يومًا واحدة. إذا كان جزء كبير من تلك الوظائف يمس المحتوى الاصطلاحي (نصوص التسويق، اللغة القانونية، النصوص الأدبية، التواصل العادي) والأداة التي توجه تلك الوظائف كانت توجه المستخدمين إلى نموذج أصغر دون علمهم، فإن حمل القطة إلى الماء كان يظهر في مخرجات حقيقية، في مستندات حقيقية، لأشخاص حقيقيين وثقوا بالنتيجة. قضت صناعة الترجمة سنوات في مقارنة مزودي الذكاء الاصطناعي. ديب إل مقابل جوجل.
كلود مقابل شات جي بي تي. تلك المقارنات مفيدة . ولكن ضمن موفر واحد، قد يكون فجوة الإصدار كبيرة بنفس القدر - وهي فجوة لا تقيسها معظم أطر المقارنة لأنها لا تختبر على مستوى إصدار النموذج. عندما يقول شخص ما أنا أستخدم ChatGPT للترجمة، فإن هذه الجملة ليست محددة بما يكفي لتكون ذات مغزى.
أي شات جي بي تي؟ نانو؟ 4o-ميني؟ ٤.١-مصغر؟ 5.4? تتغير الإجابة في المخرجات بطرق غير تافهة، على الأقل للمحتوى الاصطلاحي.
هذا هو الجزء الذي أجده الأكثر إثارة للاهتمام، ولم أكتشف بعد تمامًا ما الذي يجب فعله به.
النماذج الثلاثة التي أنتجت ترجمات اصطلاحية أعطت ثلاث ترجمات مختلفة:
كلها ثلاث ترجمات إنجليزية قابلة للدفاع عنها لـ llevarse el gato al agua. لكنهما ليسا متكافئين.
لتحقيق ذلك يؤكد على التنفيذ مقابل الصعوبة، لقد فعلت شيئًا صعبًا ونجح. لتحقيق ما يريديؤكد على تحقيق النتيجة التي أردتها، مع التركيز بشكل أقل على الصعوبة. الخروج في المقدمة يؤكد على النصر التنافسي، والفوز بالنسبة للآخرين.
العبارة الإسبانية الأصلية أقرب إلى الأولى من هذه. تحمل العبارة دلالة على التغلب على المقاومة، وليس مجرد تفضيل نتيجة واحدة وتحقيقها. لكن أن يحصل المرء على ما يريد و أن يخرج منتصراً ليسا خاطئين، بل هما فقط غير دقيقين في اتجاهات مختلفة. هذا يطرح سؤالاً أجده صعباً حقاً: عندما تنتج ثلاثة نماذج كل منها ترجمة اصطلاحية صحيحة ولكنها مختلفة، كيف تقيّم أيها
الأفضل؟ تقارن درجات BLEU بالترجمة المرجعية — ولكن من كتب المرجع، وأيها من هذه الثلاثة كانوا سيختارونها؟
وكيل الترجمة بالذكاء الاصطناعي لدينا، لصالحه، طرح السؤال الصحيح قبل الالتزام بأي مخرجات: ما المعنى المقصود بـ llevarse el gato al agua في هذا السياق؟ تم تقديم ثلاثة خيارات - تحقيق هدف صعب، أو أخذ شيء غير ضروري، أو الانخراط في نشاط محفوف بالمخاطر. هذا السؤال ليس تزيينياً. إنها الآلية التي يتم بها حل الغموض السياقي قبل الانتهاء من الترجمة.
لكن النقطة المهمة هي: ثلاث إجابات صحيحة، وثلاث درجات مختلفة من المعنى. أدوات تقييم الترجمة ليست مبنية لهذا النوع من الدقة.
أريد أن أكون صريحًا بشأن حدود ما يظهره هذا الاختبار.
تعبير اصطلاحي واحد، زوج لغوي واحد، يوم واحد من الاختبار الداخلي. هذه ليست دراسة. إنها ملاحظة. لا أعرف ما إذا كان هذا النمط (النماذج الأصغر تفترض الحرفية، والنماذج الأكبر تحقق الاصطلاحية) ينطبق باستمرار عبر: أزواج لغوية أخرى ذات تقاليد اصطلاحية غنية (العربية واليابانية والروسية كلها تخطر ببالي) محتوى غير اصطلاحي حيث لا ينطبق التمييز حالات استثنائية حيث يحصل نموذج أصغر على الاصطلاح بشكل صحيح ويخطئ نموذج أكبر لا أعرف أيضًا ما إذا كانت هذه خاصية مستقرة لهذه النماذج أو شيء يتغير مع التحديثات والضبط الدقيق. لا ينشر مقدمو النماذج سجلات تغيير خاصة بالترجمة. قد يتم تحديث نموذج يتعامل مع llevarse el gato al
عندما يكون لدي المزيد لأشاركه، سأفعل ذلك. سؤالان بحثيان يستحقان التأمل سأختتم بالسؤالين اللذين تركني بهما هذا
لن أجيب عليها، ليس لدي البيانات اللازمة لذلك بعد. لكن أعتقد أنها الأسئلة الصحيحة التي يجب طرحها. أولاً: عند أي عتبة للمعاملات تصبح الكفاءة الاصطلاحية موثوقة؟ القفزة من GPT-4o-MINI و GPT-4.1-NANO (كلاهما حرفي) إلى GPT-4.1-MINI (اصطلاحي) تشير إلى وجود عتبة
في مكان ما في نطاق المعاملات بين أحجام النماذج تلك حيث يتم تشغيل التعرف على الاصطلاحات.
هل هو متناسق؟ هل ينطبق على التعابير الاصطلاحية عبر جميع اللغات، أم أنه يعتمد على مدى تمثيل لغة ما في بيانات التدريب؟ لا أعرف. ولكن معرفة ستكون مفيدة لأي شخص يبني تدفقات عمل الترجمة.
ثانياً: ما هي تكلفة غموض إصدار النموذج على المستخدمين على نطاق واسع؟
إذا قام مستخدم بتوجيه 1000 مستند شهريًا عبر أداة لا تكشف عن إصدار النموذج المستخدم (وبعض هذه المستندات تحتوي على محتوى اصطلاحي)، فكم مرة يحدث الفشل الحرفي بشكل غير مرئي؟ كيف سيعرفون؟ ما هي التكلفة، بالمعنى الحقيقي، لعدم اكتشاف ذلك أبداً؟
أعتقد أن هذا سؤال أكثر أهمية من معظم مقارنات أي ذكاء اصطناعي هو الأفضل للترجمة المتداولة حالياً. الإجابة ليست استخدم أكبر نموذج. قد تكون الإجابة: اعرف ما تستخدمه، وقم بإجراء اختباراتك الخاصة على المحتوى الخاص بك، ولا تفترض أن اسم مزود واحد هو ضمان للسلوك المتسق عبر نطاق نماذجهم.
هذا على الأقل ما أستخلصه من هذا الاختبار.
صحيحة. ما إذا كان هذا ينطبق على فئات التعبيرات الاصطلاحية وأزواج اللغات هو السؤال التالي. سأجري المزيد من الاختبارات.
ترجمت GPT-4.1-MINI و GPT-5.4-MINI و GPT-5.4 جميعها llevarse el gato al agua اصطلاحيًا - ولكن إلى تعبيرات إنجليزية مختلفة ذات دلالات مختلفة قليلاً. يشير هذا إلى أن جودة الترجمة الاصطلاحية لها بعدان على الأقل: ما إذا كان النموذج يتعرف على الاصطلاح على الإطلاق، وأي تعبير مكافئ يختاره من الخيارات المتاحة في اللغة الهدف . لا تفصل مقاييس جودة الترجمة القياسية هذين البعدين بوضوح. أعتقد أنه ينبغي عليهم ذلك.
يعتمد هذا المنشور على اختبار داخلي على منصة تطوير MachineTranslation.com. الاختبار متعدد النماذج المعروض هنا غير متاح للجمهور بعد. أنا أشارك هذا الاكتشاف لأنني أعتقد أن الملاحظة مفيدة بغض النظر عن مكان إجراء الترجمات الخاصة بك.