July 10, 2026
שתי מילים. שישה דגמים. שלוש החלטות תרגום שונות. הנה מה שקרה כאשר הרצתי 8 משפטי בדיקה דרך מודלי ה-AI העדכניים ביותר הזמינים ב-MachineTranslation.com, ומה התוצאות בעצם חושפות על מתי מודל נכשל בשקט.
שתי מילים. זה מדהים. שישה דגמים. שלוש החלטות תרגום מובחנות.
ביפנית, מודל אחד עיבד זאת כ それはやばい, תוך שמירה על הדו-משמעות. עוד אחד השמיט את כינוי הנושא לחלוטין וכתב את הצורה העירומה やばい, הגרסה הקולוקיאלית ביותר שאפשר. שליש כתב זה מדהים, מה שפותר את הדו-משמעות לחלוטין לטובת "מדהים," ומסיר את המשמעות הכפולה שהייתה מעניינת בביטוי בראשית. בווייטנאמית, מודל אחד כתב Đỉnh vậy (סלנג, נכון לרישום הנוער). אחר כתב זה באמת נפלא, תקין מבחינה דקדוקית, אך קרוב יותר לאמירה "זה באמת מופלא" כשמישהו שולח לך מם בטקסט.
כל אלה ניתנים להגנה. אף אחד מהם לא אותו הדבר. ואם אתה מריץ תרגומים דרך מודל יחיד, לעולם לא תראה את הבחירה שנעשתה בשמך.
זו השאלה המרכזית שהמאמר הזה מנסה לענות עליה. לא איזה מודל AI הוא הטוב ביותר לתרגום בשנת 2026 (התשובה תלויה בזוג שפות, רגיסטר, תחום, ומבנה משפט), אלא: כיצד הייתה יודע כאשר המודל שלך עשה קריאה שגויה? במיוחד בתחומים כמו טרמינולוגיה רפואית, חוזים משפטיים, או רשמיות מקצועית, כאשר הקריאה השגויה נראית בדיוק כמו תרגום נכון עד שמומחה קורא אותו.
הנה מה שעשיתי. אני הרצתי 8 משפטי בדיקה דרך שתי סבבים של מודלים ב- MachineTranslation.com: תחילה בסיס של 5 מודלים בשימוש נרחב, ואחר כך בריכה מורחבת המוסיפה כמה מגרסאות המודל החדשות בדרגה פרימיום הזמינות כעת למשתמשים משלמים. בדרך כלל, השוואת פלטים ממודלים כמו זה היתה אומרת מנויים בתשלום נפרדים עם כל ספק בנפרד. ב-MachineTranslation.com, הם יושבים באותה תצוגת השוואה. זוגות השפות היו אנגלית→יפנית ואנגלית→וייטנמית. קטגוריות המשפטים נבחרו במיוחד כדי לבדוק בלחץ אזורים שבהם חוסר הסכמה בין מודלים הוא בעל השלכות רבות ביותר: ניסוח אידיומטי, טרמינולוגיה משפטית, טרמינולוגיה רפואית, הקשר רגיש לרמת פורמליות, וחוסר בהירות סמנטי מכוון.
הערה על מתודולוגיית הערכה: מחקר תרגום מכונה התמודד זמן רב עם השאלה כיצד לדרג פלטים באופן אוטומטי. מדדים כמו BLEU ו-COMET כפי שנמדדו במשימות משותפות של WMT נותנים אות מצטבר שימושי, אך הם גרועים בגילוי שגיאות רגיסטר, כשלים בביטויים מטבעיים, ודיוק טרמינולוגי, בדיוק הקטגוריות החשובות ביותר כאן. מה שאתה עומד לקרוא הוא ניתוח פלט, לא מירוץ BLEU.

לא כל משפט משטח חילוקי דעות משמעותיים. שניים מתוך שמונה הבדיקות, "בואו נשמור על קשר כשהעפר יישקע בעסקה הזה" (→ יפנית) ו"אנחנו עובדים בלילות כדי להגיע לתאריך ההשקה הזה" (→ וייטנמית), הניבו הסכמה גבוהה בשני הסבבים. הביטויים הובנו כראוי כביטויים. שום אחד לא תרגם את "touch base" כנגיעה בבסיס פיזי בפועל. אnobody תרגם את "the dust settles" כ"משקע נופל".
זה שווה להשהות עליו: שפת עסקים אנגלית אידיומטית מטופלת בצורה סבירה על ידי מודלים גבוליים נוכחיים כאשר האידיום נפוץ מספיק. ההסכמה ל"touch base" נשארה יציבה בשני הסבבים; הווריאציה הייתה אך ורק סגנונית, סביב השאלה האם להשתמש ב-この件 (עניין זה), この取引 (עסקה זו), או この案件 (מקרה זה) לביטוי המקור.

בדיקת "שריפת שמן חצות" היא המקום שבו הדברים הפכו למעניינים יותר. כל מודל מלבד אחד הבין נכון את הביטוי. MiniMax M2.7, שהוצג בסיבוב 2, תרגם "burning" באופן מילולי, וייצר דוקט דואוץ, שמשמעותו "משואות בוערות." הקונסנזוס לא כלל אותו בצדקה.

היפנית היא שפה בעלת שכבות פורמליות. בחירת סיום הפועל, הכינוי וצורת השם ההתייחסותי אינה סגנונית. זה מסמן את הקשר בין דובר למקבל. שליחת הודעה למנכ"ל שלך באמצעות צורות פועל בלתי רשמיות אינה שגיאת תרגום במובן הדקדוקי. זוהי טעות חברתית, וזו משמעותית.
אתה יכול לשלוח את זה? תודה, אני מעריך את זה. ההקשר: הודעה ל-מנכ"ל.

ההסכמה השתנתה כאשר בריכת המודלים התרחבה. המנגנון פשוט: הוספת מודלים שקראו נכון את הקשר הפורמליות הסיטה את הרוב, והקונסנזוס עקב אחריה. הנה הספקטרום המלא של מה שהמודלים הפיקו בסבב 2:

בדיקת הרישום הווייטנאמית חשפה סוג שונה של שגיאת רשמיות, אחת עדינה יותר. משפט המקור: "היי, שאלה מהירה — אתה חופשי להשתתף בשיחה?" הקשר: שליחת הודעה ללקוח. קוון בסבב 1 כללה את "mình," כינוי גוף ראשון שמרמז על חברות קרובה ברמת עמיתים. כל דגם אחר הימנע מהפניה לעצמו בגוף ראשון לחלוטין, וזו הבחירה המקצועית הבטוחה יותר. באופן קריטי, Qwen תיקן זאת בסבב 2 והסיר את "mình." הקונסנזוס בשתי הסבבים לא כלל אותו.

משפט התחייבות הספק/הלקוח הוא סעיף סטנדרטי בהסכמים מסחריים: "הספק יפצה את הלקוח כנגד כל תביעה של צד שלישי הנובעת מהפרת הסכם זה."
בסבב 1, כל חמשת המודלים זיהו נכון את הרגיסטר המשפטי והשתמשו במילות ההשאלה ベンダー (ספק) ו-クライアント (לקוח), הנהוגות בחוזים מסחריים יפניים ממקור אנגלי. יוצא דופן אחד: GPT-4.1-NANO השתמש ב-販売者 (seller) ו-顧客 (customer), מילים יפניות לגיטימיות שחסרות להן את הספציפיות המשפטית הפורמלית של המקבילות של מילות השאול.
הממצא החשוב יותר הופיע בסבב 2. ההבחנה העיקרית היא בין שתי מילים:
אלו הם מושגים שונים מבחינה משפטית. "Indemnify" בעברית משמעותו במיוחד להגן על צד מאחריות של צד שלישי. 免責 הוא המונח המשפטי הנכון. כל דגמי הסיבוב הראשון השתמשו ב-補償. בסיבוב 2, DeepSeek V4-Pro היה המודל היחיד שייצר 免責, והוא עשה זאת בסיבוב 2 בלבד, לא בסיבוב 1.

בחוזה, 補償 ו-免責 אינם מילים נרדפות. אחד פירושו "נחזיר לך את הכסף." האחר פירושו "אתה מוגן מהתביעה מלכתחילה." אם פלטפורמת תרגום משתמשת ב-補償 כאשר 免責 היא הנכונה, עורך דין הקורא את הגרסה היפנית לא יראה את אותה הסכם שהגרסה האנגלית מתארת.
זהו הממצא החשוב ביותר במערך הנתונים. משפט הבדיקה: תרופה זו אסורה אצל חולים עם היסטוריה של ליקויי כבד. מקור: תיעוד מוצר קליני. יעד: Vietnamese.
הפגיעה בכבד היא המונח הקריטי. יש שני מועמדים וייטנמים:
אלה נבדלים מבחינה קלינית. אזהרת התпротивоказ המבוססת על "ליקוי כבדי" חלה על כל מי שיש לו תפקוד כבד מופחת, ולא רק על אלה שחוו כשל מוחלט של האיבר. שימוש בסוי גן מצמצם את האוכלוסייה המצוינת בצורה שגויה. חולה עם ליקוי כבדי בינוני שקורא "סוי גן" אולי לא יכיר את עצמו כאוכלוסיית האנטי-אינדיקציה.

כמה משפטים מקור הם עמימים בעיצוב. "זה חולה" בסלנג אנגלית עכשווית פירושו משהו מעולה, אך זה גם עדיין נושא את המשמעות המילולית שלו (כלומר משהו מגעיל/מתועב), והמתח בין שתי המשמעויות הללו הוא חלק מהאופן שבו הביטוי מתקשר. האתגר עבור מודל תרגום הוא: האם אתה משמר את העמימות, מכווץ אותה למשמעות הסבירה ביותר, או בוחר אחד ומתחייב?


המודלים בבדיקה זו אינם שווים זה לזה. הם משתרעים על ארכיטקטורות שונות, משטרי הדרכה שונים, והקשרי פריסה שונים. קו הבסיס של הסבב הראשון כולל מודלים שהם נגישים על נרחב. בריכת Round 2 המורחבת מוסיפה מספר מהווריאנטים של מודלים בשכבת הפרימיום החדשים ביותר הזמינים כעת למשתמשים משלמים ב-MachineTranslation.com, אותה שכבה של מודל שאחרת הייתה אומרת חשבון בתשלום נפרד עם כל ספק בודד.

הבריכה המורחבת ב-Round 2 כוללת מודלים המתקדמים יותר והזמינים למשתמשים משלמים ב-MachineTranslation.com. ההשפעה של הרחבת הבריכה אינה אחידה. בחלק מהבדיקות (פורמליות/יפנית), זה שינה את הקונסנזוס באופן משמעותי. באחרים (טרמינולוגיה רפואית/ווייטנאמית), הסדק התעמיק.

נתוני הבדיקה מצביעים על שתי קטגוריות כשל ברורות, והן דורשות תגובות שונות.
קטגוריה א: כישלונות שקטים. שגיאות פורמליות, שגיאות רגיסטר, דיוק בטרמינולוגיה רפואית: אלה מייצרות פלטים שנראים נכונים. היפנית היא תקינה מבחינה דקדוקית. הווייטנאמי שוטף. אין אות משטחי שום דבר השתבש. משתמש חד-לשוני הקורא את הפלט של מודל יחיד אין לו דרך לדעת שהמודל עשה בחירת רגיסטר שמנהל בכיר יפני היה שם לב אליה, או שמונח קליני הצטמצם בדרך שמשנה את האוכלוסייה שהוא חל עליה.
קטגוריה B: כשלים גלויים. MiniMax מתרגם "burning the midnight oil" כ"הצתת אש בלפידים." GPT-4.1-NANO פותר את "That's sick" ל"すごい" חד-משמעי. אלה ניתנים לזיהוי, או על ידי דובר של שפת היעד או על ידי השוואה עם פלטי מודל אחרים.
ההשוואה בין מודלים מרובים שה-SMART מספקת היא בעלת ערך רב ביותר בקטגוריה A. כאשר חמישה או עשרה מודלים מייצרים פלטים ורובם מסכימים על רגיסטר רשמי בעוד שאחד מייצר יפנית בצורה רגילה וקזואלית, אי-ההסכמה גלויה בתצוגת ההשוואה. משתמש שדובר את שפת היעד יכול להעריך את האפשרויות. משתמש שלא יכול לראות שהחלטה שנויה במחלוקת התקבלה, ויכול להחליט אם המשפט הזה מצדיק בדיקה על ידי בן אדם.
לעבודה בקנה מידה של מסמך, קבצים גדולים, תרגום שמשמר פריסה של קובצי PDF, חוזים או חומרים קליניים, יכולת עיבוד המסמכים של הפלטפורמה מטפלת במבנה הקובץ ללא שבירת עיצוב. אך שאלות האיכות שהועלו לעיל חלות ללא קשר לגודל הקובץ. מחקר קליני בן 100 עמודים שבו כל מופע של "hepatic impairment" מתורגם כ"כישלון כבד" הוא גרסה גדולה יותר של אותה בעיה שזוהתה בבדיקה 2.
לקטגוריות רפואיות ומשפטיות ספציפיות, אימות אנושי הוא התעצור הנכון. שירות Post-Editing של Tomedes, המשלב פלט AI עם בדיקה אנושית מסמכת בדיוק לתוכן בעל סיכון גבוה זה, בנוי לשם כך. חלוקת suy gan / suy giảm chức năng gan היא בדיוק סוג הממצא שצריך להפעיל סקירה זו, לא משום שכל המודלים שגויים, אלא משום שהמודלים הבטוחים ביותר אינם המדויקים ביותר.
הערך של ראיית פלטים מרובים אינו שתמיד תבחרו בהרוב. זה שתדע שבחירה נעשתה, וזה שונה מהנחה שהפלט שלפניך נכון.

שים את שמונה הבדיקות זו ליד זו ודפוס מתקיים: הסכמה וחוסר הסכמה אינם מופצים באופן אקראי. שפה עסקית אידיומטית וביומיומית ("touch base," "burning the midnight oil") התכנסה כמעט בכל דגם בקבוצה, בשני הסבבים. פורמליות, דיוק משפטי ותרמינולוגיה רפואית לא. בדיקת הפורמליות של המנכ"ל התחלפה מקזואלית לפורמלית רק כאשר הוכללה הקבוצה המורחבת. סעיף ההשתחררות מגלה הבחנה משפטית אמיתית (פטור מאחריות לעומת פיצוי) שרק מודל אחד, בסיבוב אחד, הבין כראוי. הטרמינולוגיה הרפואית לא התפתחה כלל, והישארה בערך ביחס 6 ל-4 בשני הסבבים ללא קשר לאילו מודלים היו בבריכה.
זהו הממצא בפועל, לא טענה שיווקית: הסכמה לא משפרת כל משפט, וגם לא צריכה. זה בעל ערך ביותר בדיוק במקום שבו הזרמת של מודל יחיד לא נותנת לך סיבה להטיל ספק בה, ובמקום שבו להיות טועה באמת עולה משהו.
יש שכבה שנייה, מעשית יותר, לבדיקה זו שכדאי לציין בבירור. הפעלת השוואה זו בעצמי הייתה כרוכה בבדיקת פלטים מ-GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, ו-MiniMax M2.7 זה לצד זה עם מודלי הבסיס הקיימים, במקום אחד, בפלטפורמה אחת. מחוץ ל-MachineTranslation.com, זה לא מנוי אחד. זה כמה, אחד לכל ספק שברצונך לבדוק את שכבת הפרימיום שלו, בכל מחיר שכל ספק גובה בנפרד. משתמשים משלמים כאן מקבלים את אותה השוואה בלחיצה אחת, בשבריר מעלות של שמירה על חמש מנויים פרימיום נפרדים, מבלי לוותר על הדבר שבעצם חשוב: לראות היכן הדגמים מסכימים, ולדעת בדיוק מתי הם לא.
אף אחד לא טוב יותר בצורה קטגורית; זה תלוי בקטגוריית הבדיקה. קלוד סונט וקלוד אופוס בחרו בעקביות במונח הרפואי הווייטנאמי המדויק יותר, וקלוד אופוס הפיק את הסלנג המתאים ביותר ל"זה מדהים." אך Claude Sonnet גם הפיק יפנית קזואלית בהקשר פורמלי של משפט מנכ"ל, כאשר GPT-5.5 קיבל זאת נכון. השוואת פלטים ישירה היא יותר ניתנת להגנה מאשר בחירת מודל אחד והסתמכות עליו.
אין אחד; הדיוק תלוי בתחום. ג'מיני 3.5-Flash וGLM-5-Turbo הפיקו את היפנית הפורמלית המתאימה ביותר בבדיקה זו. שני מודלי Claude היו מדויקים ביותר בטרמינולוגיה רפואית וייטנאמית. דיפסיק V4-Pro היה המודל היחיד שהשתמש במונח המשפטי היפני הנכון, אך רק בסבב 2, והוא הפיק יפנית קזואלית במקומות אחרים. אף מודל אחד לא שלט בכל שמונת הבדיקות.
לא, לא באופן אוטומטי. הרחבת הבריכה עם גרסאות דגם חדשות בשכבת פרימיום העבירה את הקונצנזוס מקז'ואלי לפורמלי בבדיקת הפורמליות היפנית. אך בבדיקת הטרמינולוגיה הרפואית בווייטנאמית, הפיצול נמשך בערך ביחס 6 ל-4 ללא קשר לאילו מודלים כללו. מודלים נוספים חושפים יותר חילוקי דעות, שזה אות שימושי, אך הקונסנזוס עדיין עוקב אחר הרוב, והרוב לא תמיד התשובה המדויקת ביותר.
SMART היא מערכת קונצנזוס רב-מודלית של MachineTranslation.com, המשתרעת על פני עד 22 מודלים של בינה מלאכותית מספקים כולל OpenAI, Anthropic, Google ו-DeepSeek. זה מריץ תרגום דרך מספר מודלים בו-זמנית ומציג את פלט הקונצנזוס של הרוב לצד התשובה של כל מודל בודד, כברירת מחדל, ללא צורך בתצורה כלשהי. ההסכמה משתנה כאשר מאגר המודלים משתנה, כפי שמוצג בתוצאת הפורמליות היפנית של בדיקה זו: הסכמה אגב בסבב 1 הפכה לפורמלית בסבב 2.
אין מודל יחיד; בדיקה אנושית היא התשובה הטובה יותר. מודלים של Claude בחרו בעקביות במונח הרפואי הווייטנמי המדויק יותר, ו-DeepSeek V4-Pro בלבד השתמש במונח המשפטי היפני הנכון, אך רק בסבב 2. הטרמינולוגיה הרפואית לא התפצלה לעולם על פני 10 מודלים, מה שמסמן שנדרשת expertise בתחום, לא שיש לבחור במודל שונה. בדיקת עריכה אנושית מוסמכת , כמו זו שטומדס מציעה, מספקת את הבדיקה המומחית הזו.