June 5, 2026

אותה בינה מלאכותית, מודל אחר — והתרגומים לא יכלו להיות שונים יותר

אני‎ ‎מריץ‎ ‎בדיקות‎ ‎פנימיות‎ ‎על‎ ‎משהו‎ ‎שאנחנו‎ ‎לא‎ ‎מדברים‎ ‎עליו‎ ‎מספיק בתעשיית‎ ‎התרגום‎: ‎לא‎ ‎אם‎ ‎מערכות‎ AI ‎שונות‎ ‎מתרגמות שונה‎, ‎אלא‎ ‎אם‎ ‎כן‎ ‎גרסאות‎ ‎שונות‎ ‎של‎ ‎אותו‎ AI‎ ‎מתרגמות שונה‎ - ‎ובכמה‎.‎

בשבוע‎ ‎שעבר‎ ‎הרצתי‎ ‎ביטוי‎ ‎ספרדי‎ ‎יחיד‎ ‎דרך‎ ‎חמש‎ ‎גרסאות‎ ‎של‎ ChatGPT במקביל‎ ‎בפלטפורמת‎ ‎הבדיקות‎ ‎הפנימית‎ ‎של‎ MachineTranslation.com.‎ מה‎ ‎שחזר‎ ‎עצר‎ ‎אותי‎.‎

שתי‎ ‎גרסאות‎ ‎הפיקו‎ ‎תרגום‎ ‎שהוא‎, ‎באמת‎, ‎שטויות‎ ‎ב אנגלית‎. שלוש‎ ‎גרסאות‎ ‎הפיקו‎ ‎תרגומים‎ ‎אידיומטיים‎ ‎נכונים‎. ושלושת‎ ‎הנכונים‎ ‎לא‎ ‎הסכימו‎ ‎זה‎ ‎ עם‎ ‎זה‎. ‎כל‎ ‎החמישה‎ ‎הם‎ ‏

ChatGPT. כולם‎ ‎חמשתם‎ OpenAI. אותה‎ ‎בינה‎ ‎מלאכותית‎, ‎מודל‎ ‎אחר‎ —‎ והתוצאות‎ ‎לא‎ ‎יכלו‎ ‎להיות‎ ‎שונות‎ ‎יותר‎.‎

אני‎ ‎חולק‎ ‎את‎ ‎זה‎ ‎עכשיו‎ ‎כי‎ ‎אני‎ ‎חושב‎ ‎שזה‎ ‎חשוב‎, ‎לא‎ ‎כי‎ ‎יש‎ ‎לי תשובות‎ ‎ברורות‎. אני‎ ‎לא‎. אבל‎ ‎התצפית‎ ‎מעניינת‎ ‎מספיק‎ ‎כדי להכניס‎ ‎אותה‎ ‎לעולם‎.‎

תוכן‎ ‎עניינים

  • המבחן‎: ביטוי‎ ‎ספרדי‎ ‎אחד‎, ‎חמש‎ ‎גרסאות‎ GPT
  • מדוע‎ ‎הביטוי‎ ‎הזה‎ ‎מהווה‎ ‎מקרה‎ ‎מבחן‎ ‎טוב
  • מה‎ ‎ההפרדה‎ ‎בין‎ ‎תרגום‎ ‎מילולי‎ ‎לאידיומטי‎ ‎מספרת‎ ‎לנו‎ ‎על‎ ‎האופן‎ ‎שבו‎ ‎מודלים‎ ‎אלו אומנו
  • הרמז‎ ‎לכך‎ ‎שאף‎ ‎אחד‎ ‎לא‎ ‎נראה‎ ‎שמדבר‎ ‎עליו
  • אפילו‎ ‎התרגומים‎ ‎הנכונים‎ ‎לא‎ ‎הסכימו‎ ‎זה‎ ‎עם‎ ‎זה
  • מה‎ ‎שאני‎ ‎עדיין‎ ‎לא‎ ‎יודע
  • שתי‎ ‎שאלות‎ ‎מחקר‎ ‎שכדאי‎ ‎להתעכב‎ ‎עליהן

המבחן‎: מטבע‎ ‎ספרדי‎ ‎אחד‎, ‎חמש‎ ‎גרסאות‎ GPT ‎

הביטוי‎ ‎שבדקתי‎ ‎היה‎ ‏llevarse el gato al agua‎.‎


הנה‎ ‎מה‎ ‎שכל‎ ‎גרסה‎ ‎הפיקה‎:‎

מודל ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎  פלט ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎ ‎   אידיומטי‎?‏
ChatGPT::GPT-4o-MINI לשאת‎ ‎את‎ ‎החתול‎ ‎למים ‎❌ ‎מילולי
ChatGPT::GPT-4.1-NANO לשאת‎ ‎את‎ ‎החתול‎ ‎למים ‎❌ ‎מילולי
ChatGPT::GPT-4.1-MINI להצליח‎ ‎במשהו ‎✅ ‎נכון
ChatGPT::GPT-5.4-MINI להשיג‎ ‎את‎ ‎מבוקשו ‎✅ ‎חלקי
ChatGPT::GPT-5.4 לצאת‎ ‎מנצח ‎✅ ‎נכון

הביטוי‎ ‎פירושו‎ ‎להשיג‎ ‎משהו‎ ‎קשה‎ ‎בניגוד‎ ‎לכל‎ ‎הסיכויים‎, ‎ל להצליח‎ ‎בניצחון‎ ‎קשה‎. אין‎ ‎לזה‎ ‎שום‎ ‎קשר‎ ‎לחתולים‎ ‎או‎ ‎למים‎. התרגום‎ ‎המילולי‎ ‎אינו‎ ‎תרגום‎. זוהי‎ ‎תמלול‎ ‎מילה‎ ‎במילה ‎ ‎של‎ ‎ביטוי‎ ‎שהמודל‎ ‎נכשל‎ ‎בזיהויו‎ ‎כאמרה‎. ‏

GPT-4o-MINI ‎ו‎-GPT-4.1-NANO ‎הפיקו‎ ‎פלטים‎ ‎זהים‎. לא‎ ‎דומה‎, ‎זהה‎. תובנות‎ ‎התרגום‎ ‎שלנו‎ ‎סימנו‎ ‎זאת‎ ‎ישירות‎:

GPT-4.1-nano ‎ו‎-GPT-4o-mini ‎חולקים‎ ‎תרגומים‎ ‎זהים‎, ‎תוך‎ ‎שימת‎ ‎דגש‎ ‎על‎ ‎פרשנות‎ ‎מילולית‎ ‎על‎ ‎פני‎ ‎משמעות‎ ‎אידיומטית‎. GPT-4.1-MINI, GPT-5.4-MINI, ‎ו‎-GPT-5.4 ‎כל‎ ‎אחד‎ ‎הפיק‎ ‎משהו‎ ‎נכון‎ ‎באופן‎ ‎שניתן‎ ‎לזהות‎ - ‎אך‎ ‎לא‎ ‎זהה‎ ‎זה‎ ‎לזה‎. ‎מדוע‎ ‎האידיום‎ ‎הזה‎ ‎מהווה‎ ‎מקרה‎ ‎מבחן‎ ‎טוב‎ ‎אני‎ ‎רוצה‎ ‎להיות‎ ‎מדויק‎ ‎לגבי‎ ‎הסיבה‎ ‎ש‎-llevarse el gato al agua ‎הוא‎ ‎קלט‎ ‎בדיקה‎ ‎שימושי‎ ‎ולא‎ ‎כזה‎ ‎שנבחר‎ ‎באופן‎ ‎סלקטיבי‎. ‎זהו‎ ‎אידיום‎ ‎מבוסס‎ ‎היטב‎. הוא‎ ‎מופיע‎ ‎בספרות‎, ‎בעיתונות‎,‎ ‎ ‎ובדיבור‎ ‎יומיומי‎. זה‎ ‎לא‎ ‎מעורפל‎. כל‎ ‎מודל‎ ‎שאומן‎ ‎על‎ ‎קורפוס‎ ‎סביר‎ ‎של‎ ‎טקסט‎ ‎בספרדית‎ ‎אמור‎ ‎היה‎ ‎להיתקל‎ ‎ בו‎. השאלה‎ ‎אינה‎ ‎אם‎ ‎המודל‎ ‎ראה‎ ‎את‎ ‎הביטוי‎. השאלה ‎ ‎היא‎ ‎מה‎ ‎הוא‎ ‎עושה‎ ‎עם‎ ‎זה‎.‎

כשל‎ ‎התקשורת‎ ‎הגרוע‎ ‎ביותר‎ ‎בתרגום‎ ‎ניבים‎ ‎אינו‎ ‎הפקת‎ ‎תרגום ‎ ‎גרוע‎. זה‎ ‎מפיק‎ ‎תרגום‎ ‎מילולי‎ ‎שנראה‎ ‎מקובל‎ ‎ על‎ ‎מי‎ ‎שאינו‎ ‎מכיר‎ ‎את‎ ‎שפת‎ ‎היעד‎. ‎

לשאת‎ ‎את‎ ‎החתול‎ ‎למים‎ ‎הוא‎ ‎אנגלית‎ ‎תקינה‎ ‎מבחינה‎ ‎דקדוקית‎. זה תקין‎. נשמע‎ ‎כמו‎ ‎משהו‎ ‎שיכול‎ ‎להיות‎ ‎בעל‎ ‎משמעות‎.‎ ‎ ‎משתמש‎ ‎שלא‎ ‎דובר‎ ‎ספרדית‎ ‎עשוי‎ ‎לקרוא‎ ‎זאת‎, ‎להנהן‎, ‎ולהמשיך‎ ‎הלאה‎ —‎ ‎ ‎מבלי‎ ‎לדעת‎ ‎שהמשמעות‎ ‎המקורית‎ ‎אבדה‎ ‎לחלוטין‎.‎

‎ ‎זהו‎ ‎מצב‎ ‎הכשל‎ ‎שאני‎ ‎מתעניין‎ ‎בו‎. לא‎ ‎השגיאה‎ ‎הברורה‎. האחד‎ ‎הבלתי‎ ‎נראה‎. ‎מה‎ ‎הפיצול‎ ‎המילולי‎-‎אידיומטי‎ ‎אומר‎ ‎לנו‎ ‎על‎ ‎אופן‎ ‎האימון‎ ‎

של‎ ‎מודלים‎ ‎אלו‎. ‎הדפוס‎ ‎כאן‎ ‎אינו‎ ‎

אקראי‎. שני‎ ‎המודלים‎ ‎שהפיקו‎ ‎תרגומים‎ ‎מילוליים ‎ (GPT-4o-MINI ‎ו‎-GPT-4.1-NANO) ‎הם‎ ‎מודלים‎ ‎קטנים‎ ‎יותר‎,‎ ‎ ‎קלים‎ ‎יותר‎ ‎המותאמים‎ ‎למהירות‎ ‎ויעילות‎ ‎עלות‎. שלושת המודלים‎ ‎שיצרו‎ ‎תרגומים‎ ‎אידיומטיים‎ (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) ‎מייצגים‎ ‎דור‎ ‎שונה‎ ‎או‎ ‎סולם‎ ‎פרמטרים שונה‎.‎

זה‎ ‎מרמז‎ ‎על‎ ‎משהו‎ ‎שלדעתי‎ ‎לא‎ ‎נחקר‎ ‎מספיק‎: ‎יכולת אידיומטית‎ ‎בתרגום‎ ‎גדלה‎ ‎עם‎ ‎קיבולת‎ ‎המודל‎ ‎בדרכים‎ ‎שאינן נראות‎ ‎בבנצ‎'‎מרקים‎ ‎כלליים‎.‎

בנצ‎'‎מרקים‎ ‎כלליים‎ ‎של‎ ‎שפה‎ ‎בודקים‎ ‎חשיבה‎, ‎ידע‎, ‎קידוד‎,‎ מתמטיקה‎. הם‎ ‎בדרך‎ ‎כלל‎ ‎לא‎ ‎בודקים‎ ‎אם‎ ‎מודל‎ ‎יכול‎ ‎לזהות שit's raining cats and dogs‎ ‎אינו‎ ‎קשור‎ ‎לתנאי‎ ‎מזג‎ ‎אוויר‎,‎ או‎ ‎שllevarse el gato al agua‎ ‎אינו‎ ‎קשור‎ ‎להרטבת‎ ‎חתול‎.‎ ביטויים‎ ‎יושבים‎ ‎בצומת‎ ‎של‎ ‎ידע‎ ‎תרבותי‎,‎ הסקה‎ ‎קונטקסטואלית‎, ‎וזיהוי‎ ‎תבניות‎ — ‎והצומת‎ ‎הזה‎ ‎נראה כדורש‎ ‎סף‎ ‎של‎ ‎קיבולת‎ ‎מודל‎ ‎שמודלים‎ ‎קטנים‎ ‎יותר‎ ‎לא עוברים‎ ‎באופן‎ ‎עקבי‎.‎

מה‎ ‎שאני‎ ‎לא‎ ‎טוען‎: ‎שמודלים‎ ‎גדולים‎ ‎יותר‎ ‎הם‎ ‎תמיד‎ ‎מתרגמים טובים‎ ‎יותר‎. אין‎ ‎לי‎ ‎ראיות‎ ‎לכך‎ ‎ככלל‎.‎ ‎ ‎מה‎ ‎שאני‎ ‎רואה‎: ‎שעבור‎ ‎תוכן‎ ‎אידיומטי‎ ‎באופן‎ ‎ספציפי‎,‎ ‎ ‎פער‎ ‎הגרסאות‎ ‎בתוך‎ ‎המשפחה‎ ‎היה‎ ‎גדול‎ ‎מהצפוי‎.‎

ההשלכה‎ ‎שאף‎ ‎אחד‎ ‎לא‎ ‎נראה‎ ‎מדבר‎ ‎עליה

רוב‎ ‎המשתמשים‎ ‎שמשתמשים‎ ‎בכלי‎ ‎תרגום‎ ‎בינה‎ ‎מלאכותית‎ ‎לא‎ ‎יודעים‎ ‎באיזו‎ ‎גרסה ‎ ‎של‎ ‎אותה‎ ‎בינה‎ ‎מלאכותית‎ ‎הם‎ ‎משתמשים‎. הם‎ ‎פותחים‎ ‎מוצר‎, ‎בוחרים‎ ‎זוג‎ ‎שפות ‎, ‎ומקבלים‎ ‎פלט‎. ניתוב‎ ‎המודל‎ ‎בלתי‎ ‎נראה‎ ‎להם‎.‎

זה‎ ‎משנה‎ ‎בקנה‎ ‎מידה‎ ‎גדול‎. MachineTranslation.com ‎עיבדה‎ ‎למעלה‎ ‎ממאות‎ ‎אלפי‎ ‎עבודות‎ ‎תרגום‎ ‎מאנגלית‎ ‎לספרדית‎ ‎בתקופה‎ ‎של‎ 90 ‎יום‎ ‎בלבד‎. אם‎ ‎חלק‎ ‎ניכר‎ ‎מאותן‎ ‎משרות‎ ‎נגעו‎ ‎לתוכן‎ ‎אידיומטי‎ (‎טקסט‎ ‎שיווקי‎, ‎שפה‎ ‎משפטית‎, ‎טקסט‎ ‎ספרותי‎, ‎תקשורת‎ ‎יומיומית‎) ‎והכלי‎ ‎שהפנה‎ ‎את‎ ‎המשרות‎ ‎הללו‎ ‎הפנה‎ ‎משתמשים‎ ‎למודל‎ ‎קטן‎ ‎יותר‎ ‎ללא‎ ‎ידיעתם‎, ‎אז‎ ‎לשאת‎ ‎את‎ ‎החתול‎ ‎למים‎ ‎הופיע‎ ‎בפלטים‎ ‎אמיתיים‎, ‎במסמכים‎ ‎אמיתיים‎, ‎לאנשים‎ ‎אמיתיים‎ ‎שסמכו‎ ‎על‎ ‎התוצאה‎. ‎תעשיית‎ ‎התרגום‎ ‎השקיעה‎ ‎שנים‎ ‎בהשוואת‎ ‎ספקי‎ AI. DeepL ‎מול‎ ‎ גוגל‎.‎

קלוד‎ ‎מול‎ ‎צ‎'‎אט‎ ‎ג‎'‎י‎ ‎פי‎ ‎טי‎. השוואות‎ ‎אלו‎ ‎מועילות ‎. אבל‎ ‎בתוך‎ ‎ספק‎ ‎יחיד‎, ‎פער‎ ‎הגרסאות‎ ‎עשוי‎ ‎להיות‎ ‎משמעותי‎ ‎לא‎ ‎פחות‎ — ‎וזהו‎ ‎פער‎ ‎שרוב‎ ‎מסגרות‎ ‎ההשוואה‎ ‎אינן‎ ‎מודדות‎ ‎מכיוון‎ ‎שהן‎ ‎אינן‎ ‎בודקות‎ ‎ברמת‎ ‎גרסת‎ ‎המודל‎. ‎כשאדם‎ ‎אומר‎ ‎אני‎ ‎משתמש‎ ‎בצ‎'‎אטג‎'‎יפיטי‎ ‎לתרגום‎, ‎המשפט‎ ‎הזה‎ ‎אינו‎ ‎ספציפי‎ ‎מספיק‎ ‎כדי‎ ‎להיות‎ ‎בעל‎ ‎ משמעות‎.‎

איזה‎ ChatGPT? Nano? 4o-mini? ‎4.1-mini? 5.4? התשובה משנה את הפלט באופן שאינו מבוטל, לפחות עבור תוכן ציורי וניבי.

אפילו התרגומים ה"נכונים" לא הסכימו זה עם זה

זה החלק שאני מוצא כמעניין ביותר, ועדיין לא פענחתי לחלוטין מה המשמעות של זה.

שלושת המודלים שהפיקו תרגומים ציוריים וניביים סיפקו שלושה תרגומים שונים:

  • GPT-4.1-MINI: ‎‎"לבצע זאת בהצלחה"‎‏
  • GPT-5.4-MINI: ‎‎"להשיג את מבוקשו"‎‏
  • GPT-5.4: ‎‎"צאת כשידו על העליונה"‎

שלושתם הם ניסוחים קבילים באנגלית עבור ‎‏llevarse el gato al agua‎. אבל‎ ‎הם‎ ‎לא‎ ‎שקולים‎.‎

להצליח‎ ‎בכך‎ ‎מדגיש‎ ‎ביצוע‎ ‎מול‎ ‎קושי‎, ‎אתה עשית‎ ‎משהו‎ ‎קשה‎ ‎וזה‎ ‎עבד‎. להשיג‎ ‎את‎ ‎מבוקשו‎ ‎מדגיש את‎ ‎התוצאה‎ ‎שרצית‎ ‎שהושגה‎, ‎עם‎ ‎פחות‎ ‎דגש‎ ‎על הקושי‎. לצאת‎ ‎מנצח‎ ‎מדגיש‎ ‎ניצחון‎ ‎תחרותי‎, ‎ניצחון‎ ‎יחסי‎ ‎לאחרים‎.‎

‎ ‎הביטוי‎ ‎המקורי‎ ‎בספרדית‎ ‎קרוב‎ ‎ביותר‎ ‎לראשון‎ ‎מבין‎ ‎אלה‎.‎ הביטוי‎ ‎נושא‎ ‎את‎ ‎המשמעות‎ ‎של‎ ‎התגברות‎ ‎על‎ ‎התנגדות‎, ‎לא רק‎ ‎העדפת‎ ‎תוצאה‎ ‎אחת‎ ‎ומימושה‎. אבל‎ ‎להשיג‎ ‎את‎ ‎מבוקשו‎ ‎ולצאת‎ ‎מנצח‎ ‎אינם‎ ‎שגויים‎, ‎הם‎ ‎פשוט‎ ‎לא‎ ‎מדויקים‎ ‎בכיוונים‎ ‎שונים‎. ‎זה‎ ‎מעלה‎ ‎שאלה‎ ‎שאני‎ ‎מוצא‎ ‎אותה‎ ‎קשה‎ ‎באמת‎: ‎כאשר‎ ‎שלוש‎ ‎מודלים‎ ‎מייצרים‎ ‎כל‎ ‎אחד‎ ‎תרגום‎ ‎אידיומטי‎ ‎נכון‎ ‎אך‎ ‎שונה‎, ‎כיצד‎ ‎מעריכים‎ ‎איזה‎ ‎מהם‎ ‎הוא‎ ‎הטוב‎ ‎

ביותר‎?‎ ציוני‎ BLEU ‎מושווים‎ ‎לתרגום‎ ‎ייחוס‎ ‎אחד‎ — ‎אבל‎ ‎מי‎ ‎כתב‎ ‎את‎ ‎הייחוס‎, ‎ואיזה‎ ‎מהשלושה‎ ‎הם‎ ‎היו‎ ‎בוחרים‎? ‎סוכן‎ ‎התרגום‎ ‎שלנו‎, ‎לזכותו‎ ‎ייאמר‎, ‎ שאל‎ ‎את‎ ‎השאלה‎ ‎הנכונה‎ ‎לפני‎ ‎שהתחייב‎ ‎לכל‎ ‎ פלט‎:‎

מה‎ ‎המשמעות‎ ‎המיועדת‎ ‎של ‎'llevarse el gato al agua'‎‎ ‎בהקשר‎ ‎זה‎? שלוש‎ ‎אפשרויות‎ ‎הוצעו‎ — ‎להשיג‎ ‎מטרה‎ ‎קשה‎, ‎לקחת‎ ‎משהו‎ ‎מיותר‎, ‎או‎ ‎לעסוק‎ ‎בפעילות‎ ‎ מסוכנת‎.‎ השאלה‎ ‎הזו‎ ‎אינה‎ ‎ קישוטית‎. זהו‎ ‎המנגנון‎ ‎שבאמצעותו‎ ‎נפתרת‎ ‎העמימות‎ ‎ההקשרית ‎ ‎לפני‎ ‎שהתרגום‎ ‎הסופי‎ ‎מושלם‎.‎

אבל‎ ‎הנקודה‎ ‎נשארת‎ ‎בעינה‎: ‎שלוש‎ ‎תשובות‎ ‎נכונות‎, ‎שלוש‎ ‎גוונים‎ ‎שונים ‎ ‎של‎ ‎משמעות‎. כלי‎ ‎הערכת‎ ‎תרגום‎ ‎אינם‎ ‎בנויים לניואנסים‎ ‎מסוג‎ ‎זה‎.‎

מה‎ ‎שאני‎ ‎עדיין‎ ‎לא‎ ‎יודע

אני‎ ‎רוצה‎ ‎להיות‎ ‎כן‎ ‎לגבי‎ ‎מגבלות‎ ‎מה‎ ‎שהמבחן‎ ‎הזה‎ ‎מראה‎.‎

מטבע‎ ‎לשון‎ ‎אחד‎, ‎זוג‎ ‎שפות‎ ‎אחד‎, ‎יום‎ ‎אחד‎ ‎של‎ ‎בדיקות‎ ‎פנימיות‎. זה‎ ‎לא‎ ‎מחקר‎. זוהי‎ ‎תצפית‎. אני‎ ‎לא‎ ‎יודע‎ ‎אם הדפוס‎ ‎הזה‎ (‎מודלים‎ ‎קטנים‎ ‎יותר‎ ‎נוטים‎ ‎למילולי‎, ‎מודלים‎ ‎גדולים‎ ‎יותר משיגים‎ ‎אידיומטיות‎) ‎נכון‎ ‎באופן‎ ‎עקבי‎ ‎ב‎:‎

  • אידיומים‎ ‎ספרדיים‎ ‎אחרים
  • זוגות‎ ‎שפות‎ ‎אחרים‎ ‎עם‎ ‎מסורות‎ ‎אידיומטיות‎ ‎עשירות ‎(‎ערבית‎, ‎יפנית‎, ‎רוסית‎ ‎עולות‎ ‎כולן‎ ‎בדעתי‎)‎
  • תוכן‎ ‎לא‎ ‎אידיומטי‎ ‎שבו‎ ‎ההבחנה‎ ‎אינה‎ ‎רלוונטית
  • מקרי‎ ‎קצה‎ ‎שבהם‎ ‎מודל‎ ‎קטן‎ ‎יותר‎ ‎מצליח‎ ‎עם‎ ‎האידיום‎ ‎ומודל גדול‎ ‎יותר‎ ‎נכשל‎ ‎בו

אני‎ ‎גם‎ ‎לא‎ ‎יודע‎ ‎אם‎ ‎זו‎ ‎תכונה‎ ‎יציבה‎ ‎של‎ ‎המודלים‎ ‎הללו‎ ‎או‎ ‎משהו‎ ‎שמשתנה‎ ‎עם‎ ‎עדכונים‎ ‎וכוונון‎ ‎עדין‎.‎ ספקי‎ ‎מודלים‎ ‎אינם‎ ‎מפרסמים‎ ‎יומני‎ ‎שינויים‎ ‎ספציפיים‎ ‎לתרגום‎.‎ גרסת‎ ‎מודל‎ ‎שמטפלת‎ ‎ב‎-‏llevarse el gato al agua‎ ‎כראוי היום‎ ‎עשויה‎ ‎להתעדכן‎ ‎בחודש‎ ‎הבא‎, ‎ולא‎ ‎תהיה‎ ‎לנו‎ ‎דרך לדעת‎ ‎זאת‎.‎

מה‎ ‎שאני‎ ‎כן‎ ‎יודע‎: ‎הבדיקה‎ ‎הזו‎ ‎הפיקה‎ ‎תוצאה‎ ‎מעניינת‎ ‎מספיק כדי‎ ‎שאני‎ ‎רוצה‎ ‎להריץ‎ ‎עוד‎ ‎כאלה‎, ‎באופן‎ ‎שיטתי‎ ‎יותר‎, ‎על‎ ‎פני‎ ‎יותר זוגות‎ ‎שפות‎ ‎וסוגי‎ ‎תוכן‎. כשיש‎ ‎לי‎ ‎עוד‎ ‎מה‎ ‎לחלוק‎, ‎אעשה‎ ‎זאת‎.‎

שתי‎ ‎שאלות‎ ‎מחקר‎ ‎שכדאי‎ ‎להתעכב‎ ‎עליהן

אסכם‎ ‎בשתי‎ ‎השאלות‎ ‎שהמבחן‎ ‎הזה‎ ‎הותיר‎ ‎אותי‎ ‎איתן‎. אני‎ ‎לא ‎ ‎הולך‎ ‎לענות‎ ‎להם‎, ‎אין‎ ‎לי‎ ‎עדיין‎ ‎את‎ ‎הנתונים‎ ‎לכך‎. אבל‎ ‎אני‎ ‎חושב‎ ‎שאלו‎ ‎השאלות‎ ‎הנכונות‎ ‎לשאול‎. ‎ראשית‎: ‎באיזה‎ ‎סף‎ ‎פרמטרים‎ ‎מיומנות‎ ‎אידיומטית‎ ‎הופכת‎ ‎לאמינה‎? ‎הקפיצה‎ ‎מ‎-GPT-4o-MINI ‎ו‎-GPT-4.1-NANO (‎שתיהן‎ ‎מילוליות‎) ‎ל‎-GPT-4.1-MINI (‎אידיומטית‎) ‎

מרמזת‎ ‎שיש‎ ‎סף‎ ‎איפשהו‎ ‎בטווח‎ ‎הפרמטרים‎ ‎בין‎ ‎גדלי‎ ‎המודלים‎ ‎הללו‎ ‎שבהם‎ ‎זיהוי‎ ‎אידיומות‎ ‎ נדלק‎.‎

האם‎ ‎זה‎ ‎עקבי‎? האם‎ ‎זה‎ ‎חל‎ ‎על‎ ‎ביטויים ‎ ‎בכל‎ ‎השפות‎, ‎או‎ ‎שזה‎ ‎תלוי‎ ‎במידת‎ ‎הייצוג ‎ ‎של‎ ‎שפה‎ ‎בנתוני‎ ‎האימון‎? אני‎ ‎לא‎ ‎יודע‎. אבל‎ ‎ידיעה ‎ ‎תהיה‎ ‎שימושית‎ ‎לכל‎ ‎מי‎ ‎שבנה‎ ‎זרימות‎ ‎עבודה‎ ‎של‎ ‎תרגום‎.‎

שנית‎: ‎מהי‎ ‎עלות‎ ‎אטימות‎ ‎גרסת‎ ‎המודל‎ ‎למשתמשים‎ ‎בקנה‎ ‎מידה‎ ‎גדול‎?‎

אם‎ ‎משתמש‎ ‎מנתב‎ 1,000 ‎מסמכים‎ ‎בחודש‎ ‎דרך‎ ‎כלי‎ ‎ש אינו‎ ‎חושף‎ ‎איזו‎ ‎גרסת‎ ‎מודל‎ ‎נמצאת‎ ‎בשימוש‎ (‎וחלק מאותם‎ ‎מסמכים‎ ‎מכילים‎ ‎תוכן‎ ‎אידיומטי‎), ‎באיזו‎ ‎תדירות‎ ‎הכישלון‎ ‎המילולי‎ ‎מתרחש‎ ‎באופן‎ ‎בלתי‎ ‎נראה‎? איך‎ ‎הם‎ ‎היו‎ ‎יודעים‎?‎ מה‎ ‎העלות‎, ‎במונחים‎ ‎אמיתיים‎, ‎של‎ ‎לעולם‎ ‎לא‎ ‎לגלות‎?‎

אני‎ ‎חושב‎ ‎שזו‎ ‎שאלה‎ ‎חשובה‎ ‎יותר‎ ‎מרוב‎ ‎ההשוואות‎ ‎של איזו‎ ‎בינה‎ ‎מלאכותית‎ ‎הכי‎ ‎טובה‎ ‎לתרגום‎ ‎שמתפרסמות‎ ‎כעת‎.‎ התשובה‎ ‎אינה‎ ‎השתמש‎ ‎במודל‎ ‎הגדול‎ ‎ביותר‎.‎ ‎ ‎התשובה‎ ‎עשויה‎ ‎להיות‎: ‎דע‎ ‎מה‎ ‎אתה‎ ‎משתמש‎, ‎הפעל‎ ‎משלך בדיקות‎ ‎על‎ ‎התוכן‎ ‎שלך‎, ‎ואל‎ ‎תניח‎ ‎ששם‎ ‎של‎ ‎ספק‎ ‎אחד הוא‎ ‎ערובה‎ ‎להתנהגות‎ ‎עקבית‎ ‎בכל‎ ‎טווח‎ ‎המודלים‎ ‎שלהם ‎.‎

זה‎, ‎לפחות‎, ‎מה‎ ‎שאני‎ ‎מסיק‎ ‎מהמבחן‎ ‎הזה‎.‎

שאלות‎ ‎מחקר

‎1. האם‎ ‎גודל‎ ‎המודל‎ ‎מנבא‎ ‎באופן‎ ‎אמין‎ ‎את‎ ‎איכות‎ ‎התרגום‎ ‎האידיומטי‎? ‎

בהתבסס‎ ‎על‎ ‎מבחן‎ ‎יחיד‎ ‎זה‎: ‎מודלים‎ ‎קטנים‎ ‎יותר‎, ‎שעברו‎ ‎אופטימיזציה‎ ‎ליעילות‎, ‎באותה‎ ‎משפחת‎ AI, ‎ברירת‎ ‎המחדל‎ ‎הייתה‎ ‎תרגום‎ ‎מילולי‎ ‎של‎ ‎ביטוי‎ ‎ספרדי‎ ‎מבוסס‎ ‎היטב‎, ‎בעוד‎ ‎שגרסאות‎ ‎גדולות‎/‎חדשות‎ ‎יותר‎ ‎של‎ ‎אותו‎ ‎מודל‎ ‎הפיקו‎ ‎תרגומים‎ ‎אידיומטיים‎ ‎נכונים‎.‎ האם‎ ‎זה‎ ‎תקף‎ ‎על‎ ‎פני‎ ‎קטגוריות‎ ‎ביטויים‎ ‎ וזוגות‎ ‎שפות‎ ‎הוא‎ ‎השאלה‎ ‎ הבאה‎. אני‎ ‎אריץ‎ ‎עוד‎ ‎בדיקות‎.‏

‎2. מדוע‎ ‎שלוש‎ ‎תרגומים‎ ‎אידיומטיים‎ ‎נכונים‎ ‎הניבו‎ ‎שלוש ‎ ‎תוצאות‎ ‎שונות‎ ‎באופן‎ ‎משמעותי‎?‏

GPT-4.1-MINI, GPT-5.4-MINI, ‎ו‎-GPT-5.4 ‎תרגמו‎ ‎את‎ ‎הביטויllevarse el gato al agua‎ ‎באופן‎ ‎אידיומטי‎ — ‎אך‎ ‎לביטויים‎ ‎שונים‎ ‎באנגלית ‎ ‎עם‎ ‎קונוטציות‎ ‎שונות‎ ‎במקצת‎. يشير‎ ‎هذا ‎ ‎إلى‎ ‎أن‎ ‎جودة‎ ‎الترجمة‎ ‎الاصطلاحية‎ ‎لها‎ ‎بعدان‎ ‎على‎ ‎الأقل‎:‎ ‎ ‎ما‎ ‎إذا‎ ‎كان‎ ‎النموذج‎ ‎يتعرف‎ ‎على‎ ‎الاصطلاح‎ ‎على‎ ‎الإطلاق،‎ ‎وأي ‎ ‎تعبير‎ ‎مكافئ‎ ‎يختاره‎ ‎من‎ ‎الخيارات‎ ‎المتاحة‎ ‎في‎ ‎اللغة‎ ‎الهدف ‎. מדדי‎ ‎איכות‎ ‎תרגום‎ ‎סטנדרטיים‎ ‎אינם מפרידים‎ ‎באופן‎ ‎ברור‎ ‎בין‎ ‎שני‎ ‎הממדים‎ ‎הללו‎. אני‎ ‎חושב‎ ‎שהם‎ ‎צריכים‎.‎


פוסט‎ ‎זה‎ ‎מבוסס‎ ‎על‎ ‎בדיקות‎ ‎פנימיות‎ ‎בפלטפורמת‎ ‎הפיתוח‎ ‎של‎ MachineTranslation.com. בדיקת‎ ‎גרסאות‎ ‎מרובות‎ ‎מודלים‎ ‎המוצגת‎ ‎כאן‎ ‎אינה‎ ‎זמינה‎ ‎לציבור‎ ‎עדיין‎. אני‎ ‎משתף‎ ‎את‎ ‎הממצא‎ ‎מכיוון‎ ‎שאני‎ ‎חושב‎ ‎שהתצפית‎ ‎שימושית‎ ‎ללא‎ ‎קשר‎ ‎למקום‎ ‎שבו‎ ‎אתה‎ ‎מריץ‎ ‎את‎ ‎התרגומים‎ ‎שלך‎.‎