July 10, 2026
สองคำ หกรุ่น สามการตัดสินใจแปลที่แตกต่างกัน นี่คือสิ่งที่เกิดขึ้นเมื่อฉันใช้ประโยคทดสอบ 8 ประโยคผ่านโมเดล AI ล่าสุดที่มีอยู่บน MachineTranslation.com และสิ่งที่ผลลัพธ์จริงเปิดเผยเกี่ยวกับเวลาที่โมเดลล้มเหลวอย่างเงียบ ๆ
สองคำ ที่ยอดเยี่ยม หกรุ่น สามการตัดสินใจในการแปลที่แตกต่างกัน
ในภาษาญี่ปุ่น โมเดลหนึ่งแสดงผลเป็น それはやばい โดยรักษาความคลุมเครือไว้ อีกคนหนึ่งละทิ้งประธานนามสรรพนามไปโดยสิ้นเชิงและเขียนรูปแบบเปล่า やばい เวอร์ชันที่ใช้ในการสนทนาอย่างไม่เป็นทางการที่สุด ผู้เขียนคนที่สามเขียน それはすごい ซึ่งแก้ไขความกำกวมไปในทางที่ "น่าทึ่ง" โดยสิ้นเชิง และลบความหมายสองชั้นที่ทำให้วลีนี้น่าสนใจออกไป ในภาษาเวียดนาม โมเดลหนึ่งเขียน ดิ่นวัย (สแลง ถูกต้องสำหรับการใช้ภาษาของเยาวชน) อีกคนหนึ่งเขียน นั่นเป็นสิ่งที่น่าอัศจรรย์จริงๆ ซึ่งถูกต้องตามหลักไวยากรณ์ แต่ใกล้เคียงกับการพูดว่า "นั่นเป็นสิ่งที่น่าอัศจรรย์อย่างแท้จริง" เมื่อใครบางคนส่งมีมให้คุณ
ทั้งหมดนี้สามารถป้องกันได้ ไม่มีสิ่งใดที่เหมือนกันเลย และหากคุณกำลังเรียกใช้การแปลผ่านโมเดลเดียว คุณจะไม่เห็นตัวเลือกที่ถูกสร้างขึ้นเพื่อคุณ
นั่นคือคำถามหลักที่บทความนี้พยายามตอบ ไม่ใช่ว่าโมเดล AI ใดที่ดีที่สุดสำหรับการแปลในปี 2026 (คำตอบขึ้นอยู่กับคู่ภาษา ลักษณะการใช้ภาษา โดเมน และโครงสร้างประโยค) แต่เป็นเรื่องของ: คุณจะรู้ได้อย่างไรว่าโมเดลของคุณตัดสินใจผิด โดยเฉพาะอย่างยิ่งในโดเมนต่างๆ เช่น คำศัพท์ทางการแพทย์ สัญญาทางกฎหมาย หรือความเป็นทางการในวิชาชีพ ซึ่งการตัดสินใจที่ผิดดูเหมือนการแปลที่ถูกต้องจนกว่าผู้เชี่ยวชาญจะอ่านมัน
นี่คือสิ่งที่ฉันทำ ฉันส่ง 8 ประโยคทดสอบผ่านสองรอบของโมเดลบน MachineTranslation.com: ก่อนอื่นเป็นเบสไลน์ของ 5 โมเดลที่ใช้กันอย่างแพร่หลาย จากนั้นจึงขยายกลุ่มที่เพิ่มตัวแปรโมเดลระดับพรีเมียมล่าสุดหลายตัวที่พร้อมให้บริการสำหรับผู้ใช้ที่จ่ายเงิน โดยปกติแล้ว การเปรียบเทียบผลลัพธ์จากโมเดลเช่นนี้จะหมายถึงการสมัครสมาชิกแบบจ่ายเงินแยกต่างหากกับผู้ให้บริการแต่ละรายแต่ละคน บน MachineTranslation.com พวกเขานั่งอยู่ในมุมมองการเปรียบเทียบแบบเดียวกัน คู่ภาษาคือ English→Japanese และ English→Vietnamese หมวดหมู่ประโยคถูกเลือกโดยเฉพาะเพื่อทดสอบความเครียดในพื้นที่ที่ความไม่เห็นด้วยของโมเดลมีความสำคัญมากที่สุด: การใช้สำนวนถ่ายทำ คำศัพท์ทางกฎหมาย คำศัพท์ทางการแพทย์ บริบทที่ไวต่อความเป็นทางการ และความกำกวมทางความหมายที่จงใจ
หมายเหตุเกี่ยวกับวิธีการประเมิน: การวิจัยการแปลด้วยเครื่องจักรได้ต่อสู้กับวิธีการให้คะแนนผลลัพธ์โดยอัตโนมัติมาเป็นเวลานาน เมตริกส์เช่น BLEU และ COMET ตามที่วัดในงาน WMT shared tasks ให้สัญญาณรวมที่มีประโยชน์ แต่พวกมันไม่ดีในการตรวจจับข้อผิดพลาดด้านรีจิสเตอร์ ความล้มเหลวของสำนวน และความแม่นยำของศัพท์เฉพาะ ซึ่งเป็นหมวดหมู่ที่สำคัญที่สุดที่นี่ สิ่งที่คุณกำลังจะอ่านคือการวิเคราะห์ผลลัพธ์ ไม่ใช่การแข่งขัน BLEU

ไม่ใช่ทุกประโยคที่จะแสดงความไม่เห็นด้วยที่มีความหมาย สองจากแปดการทดสอบ "Let's touch base once the dust settles on this deal" (→ ญี่ปุ่น) และ "We're burning the midnight oil to hit this launch date" (→ เวียดนาม) ได้สร้างความเห็นพ้องต้องกันสูงในทั้งสองรอบ สำนวนเหล่านั้นได้รับการเข้าใจอย่างถูกต้องว่าเป็นสำนวน ไม่มีใครแปล "touch base" ว่าการสัมผัสฐานกำลังกายจริง ๆ ไม่มีใครแปล "the dust settles" ว่าตะกอนตกลงมา
นี่คือสิ่งที่น่าหยุดและไตร่ตรองไป: ภาษาอังกฤษด้านธุรกิจที่เป็นสำนวนนั้นได้รับการจัดการอย่างสมควรโดยแบบจำลองชั้นหน้าปัจจุบันเมื่อสำนวนนั้นพบได้บ่อยพอ ความเห็นพ้องต้องกันสำหรับ "touch base" คงที่เสถียรในทั้งสองรอบ การแปรผันเป็นเพียงสไตล์เท่านั้น โดยมีการถกเถียงว่าจะใช้ この件 (เรื่องนี้) この取引 (การทำธุรกิจนี้) หรือ この案件 (กรณีนี้) สำหรับวลีต้นฉบับ

การทดสอบ "เผาน้ำมันตอนดึก" คือจุดที่สิ่งต่าง ๆ เริ่มน่าสนใจมากขึ้น โมเดลทั้งหมดยกเว้นหนึ่งเข้าใจสำนวนได้อย่างถูกต้อง MiniMax M2.7 ในรอบที่ 2 ได้แปล "burning" อย่างตรงตัว ส่งผลให้ได้ผลลัพธ์ đốt đuốc ซึ่งหมายความว่า "เปลวไฟที่จุดไม้" ฉันทามติได้แยกออกอย่างถูกต้อง

ภาษาญี่ปุ่นเป็นภาษาที่มีชั้นความเป็นทางการ การเลือกลงท้ายของกริยา สรรพนาม และรูปแบบของคำนามอ้างอิง ไม่ใช่เรื่องของรูปแบบการเขียน มันแสดงความสัมพันธ์ระหว่างผู้พูดและผู้รับสาร การส่งข้อความถึง CEO ของคุณโดยใช้รูปแบบกริยาที่ไม่เป็นทางการนั้นไม่ใช่ข้อผิดพลาดในการแปลในแง่ไวยากรณ์ มันเป็นข้อผิดพลาดทางสังคม และเป็นข้อผิดพลาดที่มีความสำคัญ
ประโยคทดสอบ: ช่วยส่งนั่นให้ฉันหน่อยได้ไหม? ขอบคุณ ขอบคุณมากครับ บริบท: การส่งข้อความถึง CEO

ฉันทติเปลี่ยนไปเมื่อกลุ่มโมเดลขยายออกไป กลไกนั้นตรงไปตรงมา: การเพิ่มโมเดลที่อ่านบริบทของความเป็นทางการได้อย่างถูกต้องทำให้กลุ่มส่วนใหญ่เปลี่ยนแปลง และการบรรลุฉันทามติตามมา นี่คือสเปกตรัมเต็มของสิ่งที่โมเดลสร้างขึ้นในรอบที่ 2:

การทดสอบระดับภาษาเวียดนามเผยให้เห็นข้อผิดพลาดด้านความเป็นทางการอีกประเภทหนึ่ง ซึ่งมีความละเอียดอ่อนกว่า ประโยคต้นฉบับ: "เฮ้ย คำถามเร็วๆ นี้ — คุณว่างไหม ที่จะเข้าไปในการโทรศัพท์?" **บริบท: การส่งข้อความถึงลูกค้า** Qwen ในรอบที่ 1 ได้ใช้คำว่า "mình" ซึ่งเป็นสรรพนามบุคคลที่หมายถึงความเป็นเพื่อนระดับเดียวกันแบบไม่เป็นทางการ โมเดลอื่น ๆ ทั้งหมดหลีกเลี่ยงการอ้างอิงตนเองในบุคคลที่หนึ่งอย่างสิ้นเชิง ซึ่งเป็นตัวเลือกที่ปลอดภัยกว่าในด้านวิชาชีพ สำคัญที่สุดคือ Qwen ได้แก้ไขข้อผิดพลาดนี้ในรอบที่ 2 และลบ "mình" ออกไป ความเห็นพ้องต้องกันในทั้งสองรอบได้ยกเว้นมัน

ประโยคการชดเชยความเสียหายของผู้ขายหรือไคลเอนต์เป็นข้อความมาตรฐานในข้อตกลงเชิงพาณิชย์: "ผู้จำหน่ายจะต้องชดเชยให้แก่ลูกค้าต่อการเรียกร้องจากบุคคลที่สามใดๆ ที่เกิดจากการละเมิดข้อตกลงนี้"
ในรอบที่ 1 โมเดลทั้งห้าระบุระดับภาษากฎหมายได้ถูกต้อง และใช้คำยืม ベンダー (ผู้ขาย) และ クライアント (ลูกค้า) ซึ่งเป็นมาตรฐานในสัญญาทางการค้าของญี่ปุ่นที่มีต้นกำเนิดจากภาษาอังกฤษ ข้อยกเว้นหนึ่ง: GPT-4.1-NANO ใช้ 販売者 (seller) และ 顧客 (customer) ซึ่งเป็นคำภาษาญี่ปุ่นที่ถูกต้องตามหลักภาษา แต่ขาดความเฉพาะเจาะจงทางกฎหมายของคำยืมมาที่เทียบเท่า
การค้นพบที่สำคัญกว่านั้นปรากฏขึ้นในรอบที่ 2 ความแตกต่างที่สำคัญคือระหว่างสองคำ:
นี่คือแนวคิดที่แตกต่างกันทางกฎหมาย "Indemnify" หมายความว่า การป้องกันคู่สัญญาจากความรับผิดต่อบุคคลที่สาม 免責 เป็นคำศัพท์ทางกฎหมายที่ถูกต้อง โมเดล Round 1 ทั้งหมดใช้ 補償 ในรอบที่ 2 DeepSeek V4-Pro เป็นโมเดลเพียงตัวเดียวที่สร้าง 免責 และทำเช่นนั้นในรอบที่ 2 เท่านั้น ไม่ใช่รอบที่ 1

ในสัญญา 補償 และ 免責 ไม่ใช่คำพ้องความหมาย "One" หมายถึง "เราจะชดเชยให้คุณ" อีกความหมายหนึ่งคือ "คุณได้รับการป้องกันจากการเรียกร้องตั้งแต่แรกแล้ว" ถ้าแพลตฟอร์มการแปลใช้ 補償 เมื่อ 免責 เป็นคำที่ถูกต้อง ทนายความที่อ่านเวอร์ชันภาษาญี่ปุ่นจะไม่เห็นข้อตกลงเดียวกันกับที่เวอร์ชันภาษาอังกฤษอธิบาย
นี่คือการค้นพบที่มีความสำคัญมากที่สุดในชุดข้อมูล ประโยคทดสอบ: ยาตัวนี้มีข้อห้ามใช้ในผู้ป่วยที่มีประวัติของการบกพร่องของตับ แหล่งที่มา: เอกสารผลิตภัณฑ์ทางคลินิก เป้าหมาย: Vietnamese.
ศัพท์ที่สำคัญคือ "ภาวะตับไม่ทำงาน" มีผู้สมัครชาวเวียดนามสองคน:
สิ่งเหล่านี้มีความแตกต่างทางคลินิกที่ชัดเจน คำเตือนข้อห้ามใช้ยาที่อิงตามเหตุผล "การทำงานของตับบกพร่อง" ใช้ได้กับบุคคลใดๆ ที่มีการทำงานของตับลดลง ไม่ใช่เฉพาะผู้ที่ประสบการณ์ความล้มเหลวของอวัยวะที่สมบูรณ์เท่านั้น การใช้ suy gan ทำให้ประชากรที่ระบุไว้แคบลงอย่างไม่ถูกต้อง ผู้ป่วยที่มีการบาดเจ็บของตับในระดับปานกลางที่อ่านสุ่ยกันอาจไม่รู้จักตัวเองว่าเป็นกลุ่มประชากรที่มีข้อห้าม

ประโยคต้นฉบับบางประโยคมีความกำกวมโดยเจตนา "That's sick" ในสแลงภาษาอังกฤษสมัยใหม่หมายความว่าบางสิ่งบางอย่างที่ยอดเยี่ยม แต่มันยังคงมีความหมายตามตัวอักษรของมัน (นั่นคือ น่าขยะขยวก/น่ารังเกียจ) และความตึงเครียดระหว่างความหมายทั้งสองนั้นเป็นส่วนหนึ่งของวิธีที่วลีนี้สื่อสาร ความท้าทายสำหรับโมเดลการแปลคือ: คุณจะรักษาความกำกวมไว้, ยุบมันลงเหลือเพียงความหมายที่น่าจะเป็นไปได้มากที่สุด, หรือเลือกหนึ่งและยืนหยัด?


แบบจำลองในการทดสอบนี้ไม่เทียบเท่ากันทั้งหมด พวกเขาครอบคลุมสถาปัตยกรรมที่แตกต่างกัน ระบบการฝึกอบรมที่แตกต่างกัน และบริบทการปรับใช้ที่แตกต่างกัน การประเมินรอบที่ 1 ครอบคลุมโมเดลที่สามารถเข้าถึงได้อย่างแพร่หลาย กลุ่มรอบที่ 2 ที่ขยายออกไปรวมถึงตัวแปรรุ่นระดับพรีเมียมที่ใหม่ที่สุดหลายตัวที่พร้อมใช้งานสำหรับผู้ใช้ที่จ่ายเงินบน MachineTranslation.com ซึ่งเป็นระดับรุ่นเดียวกันที่จะหมายถึงบัญชีที่จ่ายเงินแยกต่างหากกับผู้ให้บริการแต่ละราย

กลุ่มที่ขยายออกไปในรอบที่ 2 รวมถึงรุ่นที่มีความก้าวหน้ามากขึ้นและพร้อมใช้งานสำหรับผู้ใช้ที่จ่ายเงินบน MachineTranslation.com ผลกระทบของการขยายกลุ่มไม่สม่ำเสมอ ในการทดสอบบางอย่าง (ความเป็นทางการ/ภาษาญี่ปุ่น) มันได้เปลี่ยนแปลงฉันทามติอย่างมีความหมาย ในกรณีอื่น ๆ (คำศัพท์ทางการแพทย์/เวียดนาม) การแยกตัวลึกซึ้งยิ่งขึ้น

ข้อมูลการทดสอบชี้ไปที่สองหมวดหมู่ความล้มเหลวที่แตกต่างกัน และพวกเขาต้องการการตอบสนองที่แตกต่างกัน
หมวดหมู่ A: ความล้มเหลวที่เงียบ ข้อผิดพลาดด้านรูปแบบ ข้อผิดพลาดด้านการใช้ภาษา ความแม่นยำของศัพท์แพทย์ สิ่งเหล่านี้สร้างผลลัพธ์ที่ดูเหมือนถูกต้อง ภาษาญี่ปุ่นนั้นมีไวยากรณ์ที่ถูกต้อง ชาวเวียดนามคนนี้พูดได้ลื่น ไม่มีสัญญาณบนพื้นผิวว่ามีอะไรผิดพลาด ผู้ใช้ที่พูดภาษาเดียวที่อ่านผลลัพธ์ของโมเดลเดียวไม่มีวิธีที่จะทราบว่าโมเดลได้เลือกระดับภาษาที่ผู้บริหารชั้นสูงชาวญี่ปุ่นจะสังเกตเห็น หรือว่าคำศัพท์ทางการแพทย์ถูกจำกัดลงในลักษณะที่เปลี่ยนแปลงประชากรที่คำศัพท์นั้นใช้ได้
Category B: ความล้มเหลวที่มองเห็นได้ MiniMax แปล "burning the midnight oil" เป็น "burning torches" GPT-4.1-NANO กำลังแก้ไข "That's sick" เป็น "すごい" ที่ชัดเจน สามารถตรวจจับได้ โดยผู้พูดภาษาเป้าหมายหรือโดยการเปรียบเทียบกับผลลัพธ์ของโมเดลอื่น ๆ
การเปรียบเทียบโมเดลหลายตัวที่ SMART มอบให้นั้นมีค่าสูงสุดในหมวดหมู่ A เมื่อโมเดลห้าหรือสิบตัวสร้างผลลัพธ์ และส่วนใหญ่ตกลงกันในการใช้ภาษาแบบทางการ ในขณะที่โมเดลหนึ่งสร้างภาษาญี่ปุ่นแบบธรรมชาติแบบไม่เป็นทางการ ความไม่ลงรอยกันจะมองเห็นได้ในมุมมองการเปรียบเทียบ ผู้ใช้ที่พูดภาษาเป้าหมายสามารถประเมินตัวเลือกต่างๆ ได้ ผู้ใช้ที่ไม่สามารถเห็นว่ามีการตัดสินใจที่มีข้อโต้แย้ง และตัดสินใจว่าประโยคนั้นสมควรได้รับการตรวจสอบจากมนุษย์หรือไม่
สำหรับงานในระดับเอกสาร ไฟล์ขนาดใหญ่ การแปลที่รักษาเค้าโครงของ PDF สัญญา หรือเอกสารทางคลินิก ความสามารถในการประมวลผลเอกสารของแพลตฟอร์มจะจัดการโครงสร้างไฟล์โดยไม่ทำให้การจัดรูปแบบเสียหาย แต่คำถามเกี่ยวกับคุณภาพที่ยกขึ้นข้างต้นใช้ได้กับทุกขนาดไฟล์ การศึกษาทางคลินิกที่มี 100 หน้า ซึ่งแปลคำว่า "hepatic impairment" เป็น "liver failure" ในทุกครั้งนั้นเป็นเวอร์ชันที่ใหญ่ขึ้นของปัญหาเดียวกันที่ระบุไว้ในการทดสอบที่ 2
สำหรับหมวดหมู่การแพทย์และกฎหมายโดยเฉพาะ การตรวจสอบของมนุษย์เป็นวิธีการป้องกันที่ถูกต้อง บริการ AI Post-Editing ของ Tomedes ซึ่งจับคู่ผลลัพธ์ของ AI กับการตรวจสอบของมนุษย์ที่ได้รับการรับรอง สำหรับเนื้อหาที่มีความเสี่ยงสูงประเภทนี้ได้รับการออกแบบมาเพื่อจุดประสงค์นี้ การลดลงของฟังก์ชันตับ / suy giảm chức năng gan นี้เป็นประเภทของการค้นพบที่ควรจะเรียกให้มีการทบทวน ไม่ใช่เพราะว่าแบบจำลองทั้งหมดมีข้อผิดพลาด แต่เพราะว่าแบบจำลองที่มีความมั่นใจมากที่สุดนั้นไม่ใช่แบบจำลองที่มีความแม่นยำมากที่สุด
ค่าของการเห็นผลลัพธ์หลายรายการไม่ใช่ว่าคุณจะเลือกส่วนใหญ่เสมอไป มันคือว่าคุณจะรู้ว่ามีการเลือกที่เกิดขึ้น ซึ่งแตกต่างจากการสมมติว่าผลลัพธ์ที่อยู่ตรงหน้าคุณนั้นถูกต้อง

นำแปดการทดสอบมาวางเคียงข้างกัน และรูปแบบจะยืนหยัด: ความเห็นพ้องต้องกันและความไม่เห็นด้วยไม่ได้กระจายแบบสุ่ม ภาษาธุรกิจแบบสำนวนและใช้ในชีวิตประจำวัน ("ติดต่อกัน" "ทำงานจนถึงเที่ยงคืน") มีความเหมือนกันในเกือบทุกโมเดลในกลุ่มตัวอย่าง ในทั้งสองรอบ ความเป็นทางการ ความแม่นยำทางกฎหมาย และศัพท์เฉพาะทางการแพทย์นั้นไม่ได้ การทดสอบความเป็นทางการของผู้บริหารเปลี่ยนจากแบบไม่เป็นทางการเป็นแบบเป็นทางการเพียงครั้งเดียวเมื่อรวมกลุ่มที่ขยายออกไป ข้อความการชดเชยค่าเสียหายเปิดเผยความแตกต่างทางกฎหมายที่แท้จริง (免責 vs. 補償) ที่เพียงแค่โมเดลเดียว ในรอบเดียว ที่ได้ถูกต้อง คำศัพท์ทางการแพทย์ที่แบ่งออกมานั้นไม่เคยได้รับการแก้ไขเลย ยังคงอยู่ที่ประมาณ 6 ต่อ 4 ในทั้งสองรอบ ไม่ว่าโมเดลใดจะอยู่ในกลุ่มก็ตาม
นั่นคือการค้นพบจริง ไม่ใช่การอ้างสิทธิ์ทางการตลาด: ความเห็นพ้องต้องกันไม่ได้ทำให้ทุกประโยคดีขึ้น และไม่จำเป็นต้องเป็นเช่นนั้น มันมีค่ามากที่สุดในตรงที่ที่ความคล่องแคล่วของโมเดลเดียวไม่ให้เหตุผลให้คุณสงสัย และที่ซึ่งการทำผิดพลาดนั้นมีค่าใช้จ่ายจริงๆ
มีชั้นที่สอง ซึ่งเป็นชั้นที่ใช้งานได้จริงมากขึ้นของการทดสอบนี้ที่คุ้มค่าที่จะระบุอย่างชัดเจน การทำการเปรียบเทียบนี้ด้วยตัวเองหมายถึงการตรวจสอบผลลัพธ์จาก GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, และ MiniMax M2.7 เคียงข้างกับโมเดลพื้นฐานที่มีอยู่แล้ว ในที่เดียว บนแพลตฟอร์มเดียว นอกเหนือจากเว็บไซต์ MachineTranslation.com นั่นไม่ใช่การสมัครสมาชิกเพียงครั้งเดียว มีหลายตัว ตัวหนึ่งสำหรับผู้ให้บริการแต่ละรายที่คุณต้องการทดสอบระดับพรีเมียม ในราคาที่ผู้ให้บริการแต่ละรายคิดค่าใช้งานแยกกัน ผู้ใช้ที่จ่ายเงินที่นี่ได้รับการเปรียบเทียบแบบเดียวกันในคลิกเดียว ในราคาที่เป็นเศษส่วนของสิ่งที่การรักษาสมัครสมาชิกพรีเมียมห้าแบบแยกต่างหากจะมีค่าใช้จ่าย โดยไม่ต้องสละสิ่งที่สำคัญจริง ๆ: การเห็นว่าโมเดลตรงกันที่ไหน และรู้ว่าเมื่อไหร่ที่พวกเขาไม่ตรงกัน
ไม่มีตัวเลือกใดที่ดีกว่าโดยทั่วไป ขึ้นอยู่กับหมวดหมู่การทดสอบ Claude Sonnet และ Claude Opus เลือกคำศัพท์ทางการแพทย์เวียดนามที่แม่นยำกว่าอย่างสม่ำเสมอ และ Claude Opus สร้างคำสแลงที่เหมาะสมที่สุดสำหรับ "That's sick" แต่ Claude Sonnet ยังสร้างภาษาญี่ปุ่นแบบสบายๆ ในประโยคบริบทของ CEO ที่เป็นทางการ ซึ่ง GPT-5.5 ทำได้ถูกต้อง การเปรียบเทียบผลลัพธ์โดยตรงนั้นสามารถปกป้องได้มากกว่าการเลือกโมเดลเดียวและไว้วางใจในนั้น
ไม่มีโมเดลเดียว ความแม่นยำขึ้นอยู่กับสาขาวิชาที่เกี่ยวข้อง Gemini 3.5-Flash และ GLM-5-Turbo ผลิตภาษาญี่ปุ่นแบบเป็นทางการที่เหมาะสมที่สุดในการทดสอบนี้ โมเดล Claude ทั้งสองตัวมีความแม่นยำสูงสุดในศัพท์เทคนิคทางการแพทย์เวียดนาม DeepSeek V4-Pro เป็นโมเดลเพียงรายเดียวที่ใช้คำศัพท์ทางกฎหมายญี่ปุ่นที่ถูกต้อง แต่เฉพาะในรอบที่ 2 เท่านั้น และมันสร้างภาษาญี่ปุ่นแบบไม่เป็นทางการในที่อื่น ไม่มีแบบจำลองเดียวที่มีความโดดเด่นในทั้งแปดการทดสอบ
ไม่ใช่ โดยอัตโนมัติ การขยายกลุ่มโมเดลด้วยตัวแปรระดับพรีเมียมที่ใหม่กว่านั้นได้เปลี่ยนฉันทามติจากแบบไม่เป็นทางการไปเป็นแบบเป็นทางการในการทดสอบความเป็นทางการของภาษาญี่ปุ่น แต่ในการทดสอบศัพท์เทคนิคทางการแพทย์ของเวียดนาม การแบ่งแยกยังคงอยู่ที่ประมาณ 6 ต่อ 4 โดยไม่คำนึงถึงรูปแบบใดที่รวมอยู่ แบบจำลองที่มากขึ้นนำเสนอความไม่เห็นด้วยที่มากขึ้น ซึ่งเป็นสัญญาณที่มีประโยชน์ แต่ฉันทามติยังคงตามด้วยเสียงส่วนใหญ่ และเสียงส่วนใหญ่นั้นไม่ใช่คำตอบที่แม่นยำที่สุดเสมอไป
SMART เป็นระบบฉันทามติแบบมัลติโมเดลของ MachineTranslation.com ซึ่งครอบคลุมโมเดล AI ถึง 22 แบบจากผู้ให้บริการต่างๆ รวมถึง OpenAI, Anthropic, Google และ DeepSeek มันรันการแปลผ่านหลายโมเดลพร้อมกันและแสดงผลลัพธ์ที่ได้รับการยอมรับจากส่วนใหญ่พร้อมกับคำตอบของแต่ละโมเดลโดยค่าเริ่มต้น โดยไม่ต้องมีการกำหนดค่าใดๆ ฉันทามติเปลี่ยนแปลงเมื่อกลุ่มโมเดลเปลี่ยนแปลง ดังที่แสดงในผลลัพธ์ความเป็นทางการของภาษาญี่ปุ่นในการทดสอบนี้: ฉันทามติที่ไม่เป็นทางการในรอบที่ 1 กลายเป็นทางการในรอบที่ 2
ไม่มีโมเดลเดียว การตรวจสอบโดยมนุษย์เป็นคำตอบที่ดีกว่า โมเดล Claude เลือกคำศัพท์การแพทย์เวียดนามที่แม่นยำกว่าอย่างสม่ำเสมอ และ DeepSeek V4-Pro เพียงแค่ใช้คำศัพท์กฎหมายญี่ปุ่นที่ถูกต้องเท่านั้น แต่เฉพาะในรอบที่ 2 เท่านั้น ศัพท์ทางการแพทย์ที่แบ่งแยกไม่เคยได้รับการแก้ไขในทั่วทั้ง 10 โมเดล ซึ่งบ่งชี้ว่าจำเป็นต้องมีความเชี่ยวชาญในสาขาวิชา ไม่ใช่ว่าควรเลือกโมเดลที่แตกต่างออกไป การตรวจทานหลังการแก้ไขโดยมนุษย์ที่ได้รับการรับรอง อย่างที่ Tomedes นำเสนอ ให้การตรวจสอบโดยผู้เชี่ยวชาญนั้น