July 10, 2026
Hai từ. Sáu mô hình. Ba quyết định dịch khác nhau. Đây là những gì đã xảy ra khi tôi chạy 8 câu kiểm tra qua các mô hình AI mới nhất có sẵn trên MachineTranslation.com, và những gì các kết quả thực tế tiết lộ về thời điểm một mô hình thất bại im lặng.
Hai từ. Đó là tuyệt vời. Sáu mô hình. Ba quyết định dịch riêng biệt.
Trong tiếng Nhật, một mô hình đã dịch nó thành それはやばい, bảo toàn sự mơ hồ. Người khác đã bỏ đại từ chủ ngữ hoàn toàn và viết dạng nguyên bản やばい, phiên bản thông tục nhất có thể. Một người thứ ba đã viết それはすごい, điều này giải quyết sự mơ hồ hoàn toàn theo hướng "tuyệt vời," loại bỏ ý nghĩa kép đã làm cho cụm từ này trở nên thú vị ngay từ đầu. Bằng tiếng Việt, một mô hình đã viết Đỉnh vậy (tiếng lóng, đúng cho văn phong giới trẻ). Một người khác đã viết Thật tuyệt vời, ngữ pháp chính xác, nhưng gần giống như nói "điều đó thực sự tuyệt diệu" khi ai đó gửi cho bạn một meme.
Tất cả những cách này đều có thể bảo vệ được. Không có cái nào giống nhau cả. Và nếu bạn chạy các bản dịch thông qua một mô hình duy nhất, bạn sẽ không bao giờ thấy lựa chọn được thực hiện thay mặt bạn.
Đó là câu hỏi trung tâm mà bài viết này đang cố gắng trả lời. Không phải là mô hình AI nào tốt nhất cho dịch thuật vào năm 2026 (câu trả lời phụ thuộc vào cặp ngôn ngữ, phong cách, lĩnh vực và cấu trúc câu), mà là: làm thế nào bạn biết khi mô hình của bạn đã đưa ra quyết định sai? Đặc biệt là trong các lĩnh vực như thuật ngữ y tế, hợp đồng pháp lý hoặc tính chính thức trong công việc, nơi mà quyết định sai trông giống hệt như một bản dịch chính xác cho đến khi một chuyên gia đọc nó.
Đây là những gì tôi đã làm. Tôi đã chạy 8 câu kiểm tra qua hai vòng mô hình trên MachineTranslation.com: trước tiên là một đường cơ sở với 5 mô hình được sử dụng rộng rãi, sau đó là một nhóm mở rộng bổ sung một số biến thể mô hình cao cấp mới nhất hiện có cho người dùng trả phí. Thông thường, việc so sánh kết quả đầu ra từ các mô hình như thế này sẽ đòi hỏi các gói đăng ký trả phí riêng biệt với từng nhà cung cấp. Trên MachineTranslation.com, họ nằm trong cùng một chế độ xem so sánh. Các cặp ngôn ngữ là Tiếng Anh→Tiếng Nhật và Tiếng Anh→Tiếng Việt. Các danh mục câu được chọn cụ thể để kiểm tra các lĩnh vực nơi sự không đồng ý của mô hình là quan trọng nhất: cách diễn đạt thành ngữ, thuật ngữ pháp lý, thuật ngữ y tế, bối cảnh nhạy cảm với tính chính thức, và sự mơ hồ ngữ nghĩa có chủ ý.
Một lưu ý về phương pháp đánh giá: nghiên cứu dịch máy từ lâu đã phải vật lộn với cách tính điểm đầu ra một cách tự động. Các chỉ số như BLEU và COMET được đo lường trong các nhiệm vụ chung WMT cung cấp tín hiệu tổng hợp hữu ích, nhưng chúng kém trong việc phát hiện các lỗi về phong cách, thất bại về thành ngữ và độ chính xác về thuật ngữ, chính xác những danh mục quan trọng nhất ở đây. Những gì bạn sắp đọc là phân tích kết quả, không phải một cuộc đua BLEU.

Không phải mọi câu đều phản ánh một sự không đồng ý có ý nghĩa. Hai trong số tám bài kiểm tra, "Let's touch base once the dust settles on this deal" (→ Tiếng Nhật) và "We're burning the midnight oil to hit this launch date" (→ Tiếng Việt), đã tạo ra sự đồng ý cao trên cả hai vòng. Những thành ngữ đã được hiểu đúng là những thành ngữ. Không ai dịch "touch base" là chạm vào một cơ sở vật lý. Không ai dịch "the dust settles" thành bụi rơi xuống.
Điều này đáng để dừng lại và suy ngẫm: ngôn ngữ kinh doanh tiếng Anh theo kiểu thành ngữ được xử lý khá tốt bởi các mô hình biên giới hiện tại khi thành ngữ đó phổ biến đủ. Sự đồng thuận về "touch base" vẫn ổn định trong cả hai vòng; sự thay đổi chỉ mang tính chất phong cách, xung quanh việc có nên sử dụng この件 (vấn đề này), この取引 (giao dịch này), hoặc この案件 (trường hợp này) cho cụm từ nguồn.

Bài kiểm tra "đốt dầu đến nửa đêm" là nơi mọi thứ trở nên thú vị hơn. Tất cả các mô hình ngoại trừ một mô hình đều hiểu đúng thành ngữ. MiniMax M2.7, được giới thiệu trong Vòng 2, dịch "burning" theo nghĩa đen, tạo ra đốt đuốc, có nghĩa là "đốt đuốc." Sự đồng thuận đã loại trừ nó một cách chính xác.

Tiếng Nhật là một ngôn ngữ có nhiều tầng tính chính thức. Việc lựa chọn kết thúc động từ, đại từ và hình thức danh từ tham chiếu không phải là vấn đề về phong cách. Nó báo hiệu mối quan hệ giữa người nói và người nhận. Gửi tin nhắn cho CEO của bạn bằng cách sử dụng các dạng động từ thân mật không phải là lỗi dịch theo nghĩa ngữ pháp. Đó là một lỗi xã hội, và một lỗi đáng kể.
Câu kiểm tra: Bạn có thể gửi cái đó qua không? Cảm ơn, tôi rất đánh giá cao điều đó." Bối cảnh: nhắn tin cho CEO.

Sự đồng thuận thay đổi khi nhóm mô hình mở rộng. Cơ chế rất đơn giản: thêm các mô hình có khả năng đọc chính xác bối cảnh tính chính thức đã thay đổi đa số, và sự đồng thuận đã theo sau. Dưới đây là toàn bộ phổ những gì các mô hình tạo ra trong Vòng 2:

Bài kiểm tra thanh ghi tiếng Việt đã phát hiện ra một loại lỗi hình thức khác, một loại tinh tế hơn. Câu nguồn: "Này, nhanh lên — bạn có rảnh để tham gia cuộc gọi không?" Tôi đánh giá cao sự kiên nhẫn và sự hiểu biết của bạn khi chúng ta cùng nhau giải quyết vấn đề này. Qwen trong Vòng 1 đã sử dụng "mình," một đại từ ngôi thứ nhất ngụ ý tình bạn ngang hàng thân mật. Tất cả các mô hình khác đều tránh hoàn toàn việc tự nhận xét bằng ngôi thứ nhất, đó là lựa chọn chuyên nghiệp an toàn hơn. Điều quan trọng là, Qwen đã sửa lỗi này trong Vòng 2 và loại bỏ "mình." Sự đồng thuận trong cả hai vòng đã loại trừ nó.

Câu bảo lãnh giữa nhà cung cấp/khách hàng là một điều khoản tiêu chuẩn trong các thỏa thuận thương mại: "Nhà cung cấp sẽ bồi thường cho khách hàng chống lại bất kỳ khiếu nại của bên thứ ba phát sinh từ vi phạm thỏa thuận này."
Ở Vòng 1, cả năm mô hình đều xác định đúng văn phong pháp lý và sử dụng các từ mượn ベンダー (nhà cung cấp) và クライアント (khách hàng), tiêu chuẩn trong các hợp đồng thương mại Nhật Bản có nguồn gốc tiếng Anh. Một ngoại lệ: GPT-4.1-NANO sử dụng 販売者 (người bán) và 顧客 (khách hàng), những từ tiếng Nhật hợp pháp thiếu tính chuyên môn pháp lý chính thức của các từ vay mượn tương đương.
Phát hiện quan trọng hơn đã xuất hiện trong Vòng 2. Sự phân biệt chính là giữa hai từ:
Đây là những khái niệm khác nhau về mặt pháp lý. "Indemnify" cụ thể có nghĩa là bảo vệ một bên khỏi trách nhiệm của bên thứ ba. 免責 là thuật ngữ pháp lý chính xác. Tất cả các mô hình Vòng 1 đều sử dụng 補償. Trong Vòng 2, DeepSeek V4-Pro là mô hình duy nhất tạo ra 免責, và nó chỉ làm như vậy trong Vòng 2 chứ không phải Vòng 1.

Trong một hợp đồng, 補償 và 免責 không phải là những từ đồng nghĩa. "One" có nghĩa là "chúng tôi sẽ hoàn lại tiền cho bạn." Cách khác có nghĩa là "bạn được bảo vệ khỏi yêu cầu ngay từ đầu." Nếu một nền tảng dịch sử dụng 補償 khi 免責 là đúng, một luật sư đọc phiên bản tiếng Nhật sẽ không thấy cùng một thỏa thuận mà phiên bản tiếng Anh mô tả.
Đây là phát hiện quan trọng nhất trong tập dữ liệu. Câu kiểm tra: "Thuốc này được chống chỉ định ở những bệnh nhân có tiền sử suy giảm chức năng gan." **Nguồn: tài liệu sản phẩm lâm sàng.** Đích: Tiếng Việt.
Thuật ngữ quan trọng là "suy giảm chức năng gan." Có hai ứng cử viên người Việt:
Những trường hợp này khác biệt về mặt lâm sàng. Cảnh báo chống chỉ định dựa trên "suy giảm chức năng gan" áp dụng cho bất kỳ ai có chức năng gan suy giảm, không chỉ những người đã trải qua suy gan hoàn toàn. Sử dụng suy gan làm hẹp quần thể được chỉ định một cách không chính xác. Một bệnh nhân suy gan mức độ vừa phải người đọc suy gan có thể không nhận ra bản thân họ là dân số có chống chỉ định.

Một số câu nguồn có tính mơ hồ theo thiết kế. "That's sick" trong tiếng Anh đương đại là một cách nói tục ngữ có nghĩa là điều gì đó tuyệt vời, nhưng nó vẫn mang theo nghĩa đen của nó (tức là gây buồn nôn/ghê tởm), và sự căng thẳng giữa hai nghĩa này là một phần của cách thức cụm từ này truyền đạt ý nghĩa. Thách thức đối với một mô hình dịch là: bạn có bảo tồn sự mơ hồ, thu gọn nó thành ý nghĩa có khả năng nhất, hay chọn một và cam kết?


Các mô hình trong bài kiểm tra này không hoàn toàn tương đương nhau. Chúng bao gồm các kiến trúc khác nhau, chế độ huấn luyện khác nhau và bối cảnh triển khai khác nhau. Đường cơ sở Vòng 1 bao gồm các mô hình có sẵn rộng rãi. Hồ sơ Vòng 2 mở rộng bổ sung một số biến thể mô hình cao cấp mới nhất hiện có cho người dùng trả phí trên MachineTranslation.com, cùng một cấp độ mô hình mà nếu không sẽ có nghĩa là một tài khoản trả phí riêng với mỗi nhà cung cấp riêng lẻ.

Hồ sơ mở rộng trong Vòng 2 bao gồm các mô hình tiên tiến hơn và có sẵn cho người dùng trả phí trên MachineTranslation.com. Tác động của việc mở rộng nhóm không đồng đều. Trong một số bài kiểm tra (tính chính thức/Tiếng Nhật), nó đã thay đổi sự đồng thuận một cách có ý nghĩa. Ở những trường hợp khác (thuật ngữ y tế/Tiếng Việt), sự phân chia sâu hơn.

Dữ liệu kiểm tra chỉ ra hai danh mục lỗi riêng biệt và chúng yêu cầu các phản ứng khác nhau.
Danh mục A: Những lỗi im lặng. Lỗi hình thức, lỗi phong cách, độ chính xác của thuật ngữ y tế: những lỗi này tạo ra các kết quả trông có vẻ đúng. Tiếng Nhật đó là ngữ pháp đúng. Tiếng Việt của anh ấy/cô ấy rất trôi chảy. Không có dấu hiệu nào trên bề mặt cho thấy có gì đó đã xảy ra sai sót. Một người dùng chỉ nói một ngôn ngữ đọc kết quả của một mô hình duy nhất không có cách nào để biết rằng mô hình đã thực hiện một lựa chọn về phong cách mà một giám đốc điều hành cấp cao người Nhật Bản sẽ nhận thấy, hoặc rằng một thuật ngữ lâm sàng đã bị thu hẹp theo cách thay đổi dân số mà nó áp dụng cho.
Danh mục B: Những lỗi hiển thị. MiniMax dịch "burning the midnight oil" thành "burning torches." GPT-4.1-NANO giải quyết "That's sick" thành "すごい" rõ ràng. Đây là những điều có thể phát hiện được, bằng cách của một người nói ngôn ngữ đích hoặc bằng cách so sánh với các đầu ra mô hình khác.
Phép so sánh đa mô hình mà SMART cung cấp là có giá trị nhất trong Danh mục A. Khi năm hoặc mười mô hình tạo ra các đầu ra và hầu hết đồng ý về một thanh ghi chính thức trong khi một mô hình tạo ra tiếng Nhật dạng thường thì sự không đồng ý là rõ ràng trong chế độ xem so sánh. Một người dùng có thể nói ngôn ngữ đích có thể đánh giá các tùy chọn. Một người dùng không thể thấy rằng một quyết định có tranh cãi đã được đưa ra, và quyết định xem liệu câu đó có đáng để được xem xét lại bởi con người hay không.
Đối với công việc ở cấp độ tài liệu, các tệp lớn, dịch bảo toàn bố cục của các tệp PDF, hợp đồng hoặc tài liệu lâm sàng, khả năng xử lý tài liệu của nền tảng xử lý cấu trúc tệp mà không làm hỏng định dạng. Nhưng các câu hỏi về chất lượng được nêu ở trên vẫn áp dụng bất kể kích thước tệp. Một nghiên cứu lâm sàng 100 trang mà mỗi trường hợp "suy giảm chức năng gan" được dịch là "suy gan" là phiên bản lớn hơn của cùng một vấn đề được xác định trong Bài kiểm tra 2.
Đối với các danh mục y tế và pháp lý cụ thể, xác minh của con người là cách ngăn chặn chính xác. Dịch vụ Chỉnh sửa sau AI của Tomedes, kết hợp đầu ra AI với xem xét của con người được chứng nhận cho chính xác loại nội dung có mức độ rủi ro cao này, được xây dựng cho mục đích này. Tình trạng suy gan / suy giảm chức năng gan là loại phát hiện chính xác mà nên kích hoạt cuộc xem xét đó, không phải vì tất cả các mô hình đều sai, mà vì những mô hình tự tin nhất không phải là những mô hình chính xác nhất.
Giá trị của việc xem nhiều kết quả đầu ra không phải là bạn sẽ luôn chọn đa số. Đó là bạn sẽ biết một lựa chọn đã được thực hiện, điều này khác với việc giả định rằng kết quả đứng trước mặt bạn là chính xác.

Đặt tám bài kiểm tra cạnh nhau và một mô hình giữ vững: sự đồng ý và bất đồng ý không được phân phối ngẫu nhiên. Các cụm từ thành ngữ, ngôn ngữ kinh doanh hàng ngày ("liên lạc," "làm việc xuyên đêm") hội tụ trên hầu như mọi mô hình trong nhóm, ở cả hai vòng. Tính chính thức, độ chính xác pháp lý và thuật ngữ y tế không có. Bài kiểm tra tính chính thức của CEO đã chuyển từ bình thường sang chính thức chỉ khi nhóm mở rộng được đưa vào. Điều khoản bồi thường đã phát hiện ra một sự phân biệt pháp lý thực sự (miễn trách nhiệm so với bồi thường) mà chỉ một mô hình, trong một vòng, đã hiểu đúng. Sự phân chia về thuật ngữ y tế không bao giờ được giải quyết hoàn toàn, vẫn duy trì ở mức khoảng 6-4 trong cả hai vòng bất kể những mô hình nào nằm trong nhóm.
Đó là phát hiện thực tế, không phải là một tuyên bố tiếp thị: sự đồng thuận không làm cho mỗi câu tốt hơn, và nó không cần phải như vậy. Nó có giá trị nhất chính ở những nơi mà độ lưu loát của một mô hình không cho bạn lý do để nghi ngờ nó, và nơi mà sai lầm thực sự có chi phí.
Có một lớp thứ hai, thực tế hơn của bài kiểm tra này đáng được nêu rõ ràng. Tự chạy so sánh này có nghĩa là kiểm tra các kết quả từ GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, và MiniMax M2.7 cạnh nhau với các mô hình cơ sở hiện có, ở một nơi, trên một nền tảng. Bên ngoài MachineTranslation.com, đó không phải là một đăng ký. Đó là nhiều cái, mỗi cái dành cho từng nhà cung cấp mà bạn muốn kiểm tra tầng cao cấp của họ, với bất kỳ giá nào mà mỗi nhà cung cấp tính riêng lẻ. Các người dùng trả phí ở đây nhận được so sánh tương tự đó chỉ trong một cú nhấp chuột, với chi phí chỉ là một phần nhỏ so với việc duy trì năm gói đăng ký cao cấp riêng biệt, mà không phải từ bỏ điều thực sự quan trọng: xem nơi các mô hình đồng ý, và biết chính xác khi nào họ không đồng ý.
Không có cái nào tốt hơn một cách tuyệt đối; nó phụ thuộc vào danh mục kiểm tra. Claude Sonnet và Claude Opus liên tục lựa chọn thuật ngữ y tế tiếng Việt chính xác hơn, và Claude Opus tạo ra tiếng lóng phù hợp nhất cho "That's sick." Nhưng Claude Sonnet cũng tạo ra tiếng Nhật thân mật trong một câu ngữ cảnh CEO chính thức, nơi mà GPT-5.5 đã hiểu đúng. Việc so sánh các kết quả trực tiếp là có thể bảo vệ hơn so với việc chọn một mô hình và tin tưởng nó.
Không có một mô hình nào; độ chính xác phụ thuộc vào lĩnh vực. Gemini 3.5-Flash và GLM-5-Turbo tạo ra tiếng Nhật chính thức phù hợp nhất trong bài kiểm tra này. Cả hai mô hình Claude đều chính xác nhất về thuật ngữ y tế tiếng Việt. DeepSeek V4-Pro là mô hình duy nhất sử dụng thuật ngữ pháp lý tiếng Nhật chính xác, nhưng chỉ ở Vòng 2, và nó sử dụng tiếng Nhật thân mật ở những nơi khác. Không có mô hình nào chiếm ưu thế trên tất cả tám bài kiểm tra.
Không, không phải tự động. Việc mở rộng nhóm mô hình với các biến thể cấp cao cấp mới đã chuyển đổi sự đồng thuận từ bình thường sang chính thức trong bài kiểm tra tính chính thức của tiếng Nhật. Nhưng trong bài kiểm tra thuật ngữ y tế tiếng Việt, sự phân chia vẫn tiếp tục ở mức khoảng 6-4 bất kể các mô hình nào được đưa vào. Nhiều mô hình hơn làm nổi bật sự bất đồng nhiều hơn, đây là tín hiệu hữu ích, nhưng sự đồng thuận vẫn theo đa số, và đa số không phải lúc nào cũng là câu trả lời chính xác nhất.
SMART là hệ thống đồng thuận đa mô hình của MachineTranslation.com, bao gồm tới 22 mô hình AI từ các nhà cung cấp bao gồm OpenAI, Anthropic, Google và DeepSeek. Nó chạy một bản dịch thông qua nhiều mô hình cùng một lúc và hiển thị kết quả đồng thuận của đa số cùng với câu trả lời của từng mô hình riêng lẻ, theo mặc định, mà không cần cấu hình. Sự đồng thuận thay đổi khi nhóm mô hình thay đổi, như được thể hiện trong kết quả về tính chính thức của tiếng Nhật trong bài kiểm tra này: sự đồng thuận không chính thức trong Vòng 1 trở nên chính thức trong Vòng 2.
Không có mô hình nào là tốt nhất; xem xét của con người là câu trả lời tốt hơn. Các mô hình Claude luôn chọn thuật ngữ y tế tiếng Việt chính xác hơn, và chỉ có DeepSeek V4-Pro sử dụng thuật ngữ pháp lý tiếng Nhật chính xác, nhưng chỉ ở Vòng 2. Thuật ngữ y tế bị chia tách không bao giờ được giải quyết trên 10 mô hình, điều này cho thấy rằng cần có chuyên môn về lĩnh vực, chứ không phải là nên chọn một mô hình khác. Đánh giá hậu biên tập của con người được chứng nhận, như Tomedes cung cấp, mang lại sự kiểm tra chuyên môn đó.