July 10, 2026

Trình dịch AI nào chính xác nhất vào năm 2026? Tôi đã kiểm tra 10 mô hình AI mới nhất

Hai từ. Sáu mô hình. Ba quyết định dịch khác nhau. Đây là những gì đã xảy ra khi tôi chạy 8 câu kiểm tra qua các mô hình AI mới nhất có sẵn trên MachineTranslation.com, và những gì các kết quả thực tế tiết lộ về thời điểm một mô hình thất bại im lặng.

Bạn sẽ biết như thế nào khi mô hình của bạn đưa ra quyết định sai?

Hai từ. Đó là tuyệt vời. Sáu mô hình. Ba quyết định dịch riêng biệt.

Trong tiếng Nhật, một mô hình đã dịch nó thành それはやばい, bảo toàn sự mơ hồ. Người khác đã bỏ đại từ chủ ngữ hoàn toàn và viết dạng nguyên bản やばい, phiên bản thông tục nhất có thể. Một người thứ ba đã viết それはすごい, điều này giải quyết sự mơ hồ hoàn toàn theo hướng "tuyệt vời," loại bỏ ý nghĩa kép đã làm cho cụm từ này trở nên thú vị ngay từ đầu. Bằng tiếng Việt, một mô hình đã viết Đỉnh vậy (tiếng lóng, đúng cho văn phong giới trẻ). Một người khác đã viết Thật tuyệt vời, ngữ pháp chính xác, nhưng gần giống như nói "điều đó thực sự tuyệt diệu" khi ai đó gửi cho bạn một meme.

Tất cả những cách này đều có thể bảo vệ được. Không có cái nào giống nhau cả. Và nếu bạn chạy các bản dịch thông qua một mô hình duy nhất, bạn sẽ không bao giờ thấy lựa chọn được thực hiện thay mặt bạn.

Đó là câu hỏi trung tâm mà bài viết này đang cố gắng trả lời. Không phải là mô hình AI nào tốt nhất cho dịch thuật vào năm 2026 (câu trả lời phụ thuộc vào cặp ngôn ngữ, phong cách, lĩnh vực và cấu trúc câu), mà là: làm thế nào bạn biết khi mô hình của bạn đã đưa ra quyết định sai? Đặc biệt là trong các lĩnh vực như thuật ngữ y tế, hợp đồng pháp lý hoặc tính chính thức trong công việc, nơi mà quyết định sai trông giống hệt như một bản dịch chính xác cho đến khi một chuyên gia đọc nó.

Đây là những gì tôi đã làm. Tôi đã chạy 8 câu kiểm tra qua hai vòng mô hình trên  MachineTranslation.com: trước tiên là một đường cơ sở với 5 mô hình được sử dụng rộng rãi, sau đó là một nhóm mở rộng bổ sung một số biến thể mô hình cao cấp mới nhất hiện có cho người dùng trả phí. Thông thường, việc so sánh kết quả đầu ra từ các mô hình như thế này sẽ đòi hỏi các gói đăng ký trả phí riêng biệt với từng nhà cung cấp. Trên MachineTranslation.com, họ nằm trong cùng một chế độ xem so sánh. Các cặp ngôn ngữ là Tiếng Anh→Tiếng Nhật và Tiếng Anh→Tiếng Việt. Các danh mục câu được chọn cụ thể để kiểm tra các lĩnh vực nơi sự không đồng ý của mô hình là quan trọng nhất: cách diễn đạt thành ngữ, thuật ngữ pháp lý, thuật ngữ y tế, bối cảnh nhạy cảm với tính chính thức, và sự mơ hồ ngữ nghĩa có chủ ý.

Phương pháp

  • Các cặp ngôn ngữ: English → Japanese, English → Vietnamese
  • Vòng 1 (cơ sở): Claude Sonnet 4-6, DeepSeek V4-Pro, Qwen 3.7-Max, GPT-4.1-NANO, Gemini 3.1-Pro-Preview
  • Vòng 2 (mở rộng): Tất cả các mô hình trên + Claude Opus 4-7, GPT-5.5, Gemini 3.5-Flash, GLM-5-Turbo, MiniMax M2.7
  • Các danh mục kiểm tra: Cách diễn đạt thành ngữ (2), Thuật ngữ pháp lý/chuyên nghiệp (2), Thuật ngữ y tế (1), Bối cảnh nhạy cảm với tính chính thức (2), Sự mơ hồ có chủ ý (1)
  • Những gì được đo lường: Đầu ra dịch trực tiếp, không phải thời gian chỉnh sửa, TER, hoặc tỷ lệ lỗi số. Khi có liên quan, những khác biệt được giải thích về mặt ngôn ngữ.
  • Sự đồng thuận SMART: Mỗi vòng bao gồm đầu ra đồng thuận đa mô hình của nền tảng. SMART sử dụng tới 22 mô hình AI từ các nhà cung cấp khác nhau và chạy tất cả các mô hình có sẵn đồng thời để tạo ra một bản dịch đồng thuận. Sự đồng thuận thay đổi khi nhóm mô hình thay đổi.

Một lưu ý về phương pháp đánh giá: nghiên cứu dịch máy từ lâu đã phải vật lộn với cách tính điểm đầu ra một cách tự động. Các chỉ số như BLEU và COMET được đo lường trong các nhiệm vụ chung WMT cung cấp tín hiệu tổng hợp hữu ích, nhưng chúng kém trong việc phát hiện các lỗi về phong cách, thất bại về thành ngữ và độ chính xác về thuật ngữ, chính xác những danh mục quan trọng nhất ở đây. Những gì bạn sắp đọc là phân tích kết quả, không phải một cuộc đua BLEU.

Kết quả ngay lập tức

Phần 1: Nơi tất cả các mô hình đều đồng ý, và tại sao điều đó cũng quan trọng

Không phải mọi câu đều phản ánh một sự không đồng ý có ý nghĩa. Hai trong số tám bài kiểm tra, "Let's touch base once the dust settles on this deal" (→ Tiếng Nhật) và "We're burning the midnight oil to hit this launch date" (→ Tiếng Việt), đã tạo ra sự đồng ý cao trên cả hai vòng. Những thành ngữ đã được hiểu đúng là những thành ngữ. Không ai dịch "touch base" là chạm vào một cơ sở vật lý. Không ai dịch "the dust settles" thành bụi rơi xuống.

Điều này đáng để dừng lại và suy ngẫm: ngôn ngữ kinh doanh tiếng Anh theo kiểu thành ngữ được xử lý khá tốt bởi các mô hình biên giới hiện tại khi thành ngữ đó phổ biến đủ. Sự đồng thuận về "touch base" vẫn ổn định trong cả hai vòng; sự thay đổi chỉ mang tính chất phong cách, xung quanh việc có nên sử dụng この件 (vấn đề này), この取引 (giao dịch này), hoặc この案件 (trường hợp này) cho cụm từ nguồn.

Test 8: ‎"Hãy liên lạc lại khi mọi chuyện lắng xuống về thương vụ này." → tiếng Nhật

Bài kiểm tra "đốt dầu đến nửa đêm" là nơi mọi thứ trở nên thú vị hơn. Tất cả các mô hình ngoại trừ một mô hình đều hiểu đúng thành ngữ. MiniMax M2.7, được giới thiệu trong Vòng 2, dịch "burning" theo nghĩa đen, tạo ra đốt đuốc, có nghĩa là "đốt đuốc." Sự đồng thuận đã loại trừ nó một cách chính xác.

Test 5: ‎"Chúng tôi đang làm việc xuyên đêm để kịp ngày phát hành này." → tiếng Việt

Phát hiện — Thành ngữ

Các mô hình hàng đầu nhìn chung xử lý đúng các thành ngữ kinh doanh tiếng Anh phổ biến bằng cả tiếng Nhật và tiếng Việt. Giá trị của sự đồng thuận cao nhất ở những câu gây tranh cãi : tính trang trọng, văn phong, và thuật ngữ. Trong các bài kiểm tra thành ngữ, sự đồng thuận vẫn phát huy tác dụng bằng cách đánh dấu những ngoại lệ thực sự (cách diễn đạt theo nghĩa đen "những ngọn đuốc cháy" của MiniMax thất bại), nhưng toàn bộ nhóm đã đồng ý.

Phần 2: Khoảng cách tính chính thức

Tiếng Nhật là một ngôn ngữ có nhiều tầng tính chính thức. Việc lựa chọn kết thúc động từ, đại từ và hình thức danh từ tham chiếu không phải là vấn đề về phong cách. Nó báo hiệu mối quan hệ giữa người nói và người nhận. Gửi tin nhắn cho CEO của bạn bằng cách sử dụng các dạng động từ thân mật không phải là lỗi dịch theo nghĩa ngữ pháp. Đó là một lỗi xã hội, và một lỗi đáng kể.

Câu kiểm tra: Bạn có thể gửi cái đó qua không? Cảm ơn, tôi rất đánh giá cao điều đó." Bối cảnh: nhắn tin cho CEO.

Sự đồng thuận thay đổi khi nhóm mô hình mở rộng. Cơ chế rất đơn giản: thêm các mô hình có khả năng đọc chính xác bối cảnh tính chính thức đã thay đổi đa số, và sự đồng thuận đã theo sau. Dưới đây là toàn bộ phổ những gì các mô hình tạo ra trong Vòng 2:

Bài kiểm tra 1: CEO sentence — full Round 2 model outputs


Notable outlier — DeepSeek R2

DeepSeek V4-Pro in Round 2 produced Bạn có thể gửi cho tôi không? Cảm ơn, rất giúp ích., plain form Japanese. Đây là những gì bạn nhắn tin cho một người bạn thân thiết. Đây không phải là một phong cách thích hợp cho một tin nhắn gửi cho CEO. Dạng thường (くれる、助かる) loại bỏ tất cả các dấu hiệu tôn kính. Sự đồng thuận đã loại trừ nó một cách chính xác, nhưng nếu đây là mô hình duy nhất của bạn, bạn sẽ gửi một tin nhắn cho CEO của mình tương đương với một tin nhắn thông thường.

Bài kiểm tra thanh ghi tiếng Việt đã phát hiện ra một loại lỗi hình thức khác, một loại tinh tế hơn. Câu nguồn: ‎"Này, nhanh lên — bạn có rảnh để tham gia cuộc gọi không?" Tôi đánh giá cao sự kiên nhẫn và sự hiểu biết của bạn khi chúng ta cùng nhau giải quyết vấn đề này. Qwen trong Vòng 1 đã sử dụng "mình," một đại từ ngôi thứ nhất ngụ ý tình bạn ngang hàng thân mật. Tất cả các mô hình khác đều tránh hoàn toàn việc tự nhận xét bằng ngôi thứ nhất, đó là lựa chọn chuyên nghiệp an toàn hơn. Điều quan trọng là, Qwen đã sửa lỗi này trong Vòng 2 và loại bỏ "mình." Sự đồng thuận trong cả hai vòng đã loại trừ nó.

Test 6: ‎"Này, câu hỏi nhanh — bạn có rảnh để tham gia cuộc gọi không?" → tiếng Việt


Phát hiện — Lỗi văn phong không thể nhận thấy nếu không so sánh

Lỗi của Qwen với "mình" là minh chứng rõ ràng nhất cho việc tại sao dịch bằng một mô hình duy nhất lại rủi ro đối với giao tiếp với khách hàng: kết quả là tiếng Việt trôi chảy, đúng ngữ pháp và nghe tự nhiên. Không có gì để đánh dấu. Nếu không nhìn thấy bốn mô hình khác tránh tham chiếu tự thân ở ngôi thứ nhất, bạn sẽ không có tín hiệu cho thấy một lựa chọn đăng ký đã được thực hiện.

Phần 3: Thuật ngữ pháp lý — vấn đề miễn trách nhiệm

Câu bảo lãnh giữa nhà cung cấp/khách hàng là một điều khoản tiêu chuẩn trong các thỏa thuận thương mại: ‎"Nhà cung cấp sẽ bồi thường cho khách hàng chống lại bất kỳ khiếu nại của bên thứ ba phát sinh từ vi phạm thỏa thuận này."

Ở Vòng 1, cả năm mô hình đều xác định đúng văn phong pháp lý và sử dụng các từ mượn ベンダー (nhà cung cấp) và クライアント (khách hàng), tiêu chuẩn trong các hợp đồng thương mại Nhật Bản có nguồn gốc tiếng Anh. Một ngoại lệ: GPT-4.1-NANO sử dụng 販売者 (người bán) và 顧客 (khách hàng), những từ tiếng Nhật hợp pháp thiếu tính chuyên môn pháp lý chính thức của các từ vay mượn tương đương.

Phát hiện quan trọng hơn đã xuất hiện trong Vòng 2. Sự phân biệt chính là giữa hai từ:

  • 補償 (hoshō) — bồi thường, hoàn lại. Để làm cho ai đó được bù đắp về tài chính sau một khoản mất mát.
  • 免責 (menseki) — miễn trừ trách nhiệm pháp lý; bồi thường. Bảo vệ khỏi các khiếu nại của bên thứ ba trước khi chúng phát sinh.

Đây là những khái niệm khác nhau về mặt pháp lý. ‎"Indemnify" cụ thể có nghĩa là bảo vệ một bên khỏi trách nhiệm của bên thứ ba. 免責 là thuật ngữ pháp lý chính xác. Tất cả các mô hình Vòng 1 đều sử dụng 補償. Trong Vòng 2, DeepSeek V4-Pro là mô hình duy nhất tạo ra 免責, và nó chỉ làm như vậy trong Vòng 2 chứ không phải Vòng 1.

Test 7: Điều khoản miễn trách nhiệm → Tiếng Nhật (các kết quả chính)


Phát hiện — Sổ đăng ký pháp lý

DeepSeek trong R2 là mô hình duy nhất sử dụng 免責, tương đương pháp lý chính xác của "miễn trách nhiệm." Mọi mô hình khác đều sử dụng 補償 (bồi thường), về mặt ngữ nghĩa có liên quan nhưng khác biệt về mặt pháp lý. Phát hiện này chỉ trở nên rõ ràng trong vòng thứ hai, điều này nhấn mạnh lý do tại sao một bài kiểm tra tĩnh, một vòng sử dụng một nhóm mô hình cố định có thể bỏ lỡ phương sai quan trọng.
Riêng biệt, Qwen trong R2 bị suy thoái bằng cách chuyển sang 売主/買主 (người bán/người mua), các thuật ngữ từ luật bán hàng thương mại chứ không phải từ các thỏa thuận dịch vụ. Đây là một cách trình bày kém phù hợp hơn cho một hợp đồng sử dụng thuật ngữ pháp lý tiếng Anh.

Trong một hợp đồng, 補償 và 免責 không phải là những từ đồng nghĩa. ‎"One" có nghĩa là "chúng tôi sẽ hoàn lại tiền cho bạn." Cách khác có nghĩa là "bạn được bảo vệ khỏi yêu cầu ngay từ đầu." Nếu một nền tảng dịch sử dụng 補償 khi 免責 là đúng, một luật sư đọc phiên bản tiếng Nhật sẽ không thấy cùng một thỏa thuận mà phiên bản tiếng Anh mô tả.

Phần 4: Thuật ngữ y tế — sự chia tách chưa được giải quyết

Đây là phát hiện quan trọng nhất trong tập dữ liệu. Câu kiểm tra: ‎"Thuốc này được chống chỉ định ở những bệnh nhân có tiền sử suy giảm chức năng gan." ‎**Nguồn: tài liệu sản phẩm lâm sàng.** Đích: Tiếng Việt.

Thuật ngữ quan trọng là "suy giảm chức năng gan." Có hai ứng cử viên người Việt:

  • suy gan — suy gan. Đề cập đến suy gan nặng, cấp tính hoặc mạn tính ở giai đoạn cuối. A patient who experienced liver failure.
  • suy giảm chức năng gan — decreased/impaired liver function. Đề cập đến bất kỳ sự suy giảm nào trong chức năng gan, bao gồm cả suy giảm nhẹ hoặc vừa phải.

Những trường hợp này khác biệt về mặt lâm sàng. Cảnh báo chống chỉ định dựa trên "suy giảm chức năng gan" áp dụng cho bất kỳ ai có chức năng gan suy giảm, không chỉ những người đã trải qua suy gan hoàn toàn. Sử dụng suy gan làm hẹp quần thể được chỉ định một cách không chính xác. Một bệnh nhân suy gan mức độ vừa phải người đọc suy gan có thể không nhận ra bản thân họ là dân số có chống chỉ định.

Test 2: Câu chống chỉ định → Tiếng Việt (cả hai vòng)


Phát hiện quan trọng: thuật ngữ y tế

Sự chia tách là 6 mô hình cho suy gan so với 4 mô hình cho suy giảm chức năng gan ở Vòng 2. Đa số, và do đó là sự đồng thuận, chọn thuật ngữ kém chính xác về mặt lâm sàng hơn. Cả hai mô hình Claude (Sonnet và Opus) đều liên tục chọn suy giảm chức năng gan trong cả hai vòng. Sự phân chia không được giải quyết khi nhóm mở rộng.
Đây là phát hiện duy nhất trong tập dữ liệu này lập luận trực tiếp nhất cho việc xem xét của chuyên gia con người về nội dung y tế. Sự đồng thuận không sai lệch bởi phiếu bầu của đa số. Nó phản ánh một sự bất đồng chân thực giữa các mô hình biên giới, và chính sự bất đồng đó là thông tin mà một người dịch cần phải thấy. Đây chính xác là loại trường hợp mà dịch vụ kiểm duyệt có con người tham gia của Tomedes được xây dựng cho.

Phần 5: ‎"Điều đó thật tuyệt vời" — điều gì xảy ra khi sự mơ hồ là mục đích

Một số câu nguồn có tính mơ hồ theo thiết kế. ‎"That's sick" trong tiếng Anh đương đại là một cách nói tục ngữ có nghĩa là điều gì đó tuyệt vời, nhưng nó vẫn mang theo nghĩa đen của nó (tức là gây buồn nôn/ghê tởm), và sự căng thẳng giữa hai nghĩa này là một phần của cách thức cụm từ này truyền đạt ý nghĩa. Thách thức đối với một mô hình dịch là: bạn có bảo tồn sự mơ hồ, thu gọn nó thành ý nghĩa có khả năng nhất, hay chọn một và cam kết?

Đầu ra tiếng Nhật


Đầu ra tiếng Việt


Phát hiện: sự mơ hồ và sự phân kỳ cùng họ

Claude Opus 4-7 viết Đỉnh vậy (tiếng lóng). Claude Sonnet 4-6 viết Thật tuyệt vời (formal). Đây là những quyết định đăng ký ngược lại được thực hiện bởi hai mô hình từ cùng một họ mô hình trên cùng một đầu vào hai từ. Cái nào cũng không "sai." Sự mơ hồ trong "That's sick" có nghĩa là cả hai cách hiểu đều tồn tại. Nhưng nếu đối tượng mục tiêu của bạn sử dụng tiếng lóng hiện tại của giới trẻ Việt Nam, chỉ có một trong những bản dịch này giao tiếp chính xác. Sự đồng thuận làm cho sự bất đồng trở nên rõ ràng. Nếu không có nó, bạn không biết một lựa chọn đã được thực hiện.
Trong tiếng Nhật, GPT-4.1-NANO là mô hình duy nhất sử dụng すごい, điều này loại bỏ hoàn toàn sự mơ hồ để ủng hộ "tuyệt vời." Năm mô hình khác bảo tồn nó với やばい/ヤバい‎. Claude Opus có dạng tối giản nhất: bare やばい không có chủ ngữ.

Phần 6: Bộ mô hình trông như thế nào

Các mô hình trong bài kiểm tra này không hoàn toàn tương đương nhau. Chúng bao gồm các kiến trúc khác nhau, chế độ huấn luyện khác nhau và bối cảnh triển khai khác nhau. Đường cơ sở Vòng 1 bao gồm các mô hình có sẵn rộng rãi. Hồ sơ Vòng 2 mở rộng bổ sung một số biến thể mô hình cao cấp mới nhất hiện có cho người dùng trả phí trên MachineTranslation.com, cùng một cấp độ mô hình mà nếu không sẽ có nghĩa là một tài khoản trả phí riêng với mỗi nhà cung cấp riêng lẻ.

Hồ sơ mở rộng trong Vòng 2 bao gồm các mô hình tiên tiến hơn và có sẵn cho người dùng trả phí trên MachineTranslation.com. Tác động của việc mở rộng nhóm không đồng đều. Trong một số bài kiểm tra (tính chính thức/Tiếng Nhật), nó đã thay đổi sự đồng thuận một cách có ý nghĩa. Ở những trường hợp khác (thuật ngữ y tế/Tiếng Việt), sự phân chia sâu hơn.

Phần 7: Điều này có nghĩa là gì nếu bạn đang chọn một nền tảng dịch

Dữ liệu kiểm tra chỉ ra hai danh mục lỗi riêng biệt và chúng yêu cầu các phản ứng khác nhau.

Danh mục A: Những lỗi im lặng. Lỗi hình thức, lỗi phong cách, độ chính xác của thuật ngữ y tế: những lỗi này tạo ra các kết quả trông có vẻ đúng. Tiếng Nhật đó là ngữ pháp đúng. Tiếng Việt của anh ấy/cô ấy rất trôi chảy. Không có dấu hiệu nào trên bề mặt cho thấy có gì đó đã xảy ra sai sót. Một người dùng chỉ nói một ngôn ngữ đọc kết quả của một mô hình duy nhất không có cách nào để biết rằng mô hình đã thực hiện một lựa chọn về phong cách mà một giám đốc điều hành cấp cao người Nhật Bản sẽ nhận thấy, hoặc rằng một thuật ngữ lâm sàng đã bị thu hẹp theo cách thay đổi dân số mà nó áp dụng cho.

Danh mục B: Những lỗi hiển thị. MiniMax dịch "burning the midnight oil" thành "burning torches." GPT-4.1-NANO giải quyết "That's sick" thành "すごい" rõ ràng. Đây là những điều có thể phát hiện được, bằng cách của một người nói ngôn ngữ đích hoặc bằng cách so sánh với các đầu ra mô hình khác.

Phép so sánh đa mô hình mà SMART cung cấp là có giá trị nhất trong Danh mục A. Khi năm hoặc mười mô hình tạo ra các đầu ra và hầu hết đồng ý về một thanh ghi chính thức trong khi một mô hình tạo ra tiếng Nhật dạng thường thì sự không đồng ý là rõ ràng trong chế độ xem so sánh. Một người dùng có thể nói ngôn ngữ đích có thể đánh giá các tùy chọn. Một người dùng không thể thấy rằng một quyết định có tranh cãi đã được đưa ra, và quyết định xem liệu câu đó có đáng để được xem xét lại bởi con người hay không.

Đối với công việc ở cấp độ tài liệu, các tệp lớn, dịch bảo toàn bố cục của các tệp PDF, hợp đồng hoặc tài liệu lâm sàng, khả năng xử lý tài liệu của nền tảng xử lý cấu trúc tệp mà không làm hỏng định dạng. Nhưng các câu hỏi về chất lượng được nêu ở trên vẫn áp dụng bất kể kích thước tệp. Một nghiên cứu lâm sàng 100 trang mà mỗi trường hợp "suy giảm chức năng gan" được dịch là "suy gan" là phiên bản lớn hơn của cùng một vấn đề được xác định trong Bài kiểm tra 2.

Đối với các danh mục y tế và pháp lý cụ thể, xác minh của con người là cách ngăn chặn chính xác. Dịch vụ Chỉnh sửa sau AI của Tomedes, kết hợp đầu ra AI với xem xét của con người được chứng nhận cho chính xác loại nội dung có mức độ rủi ro cao này, được xây dựng cho mục đích này. Tình trạng suy gan / suy giảm chức năng gan là loại phát hiện chính xác mà nên kích hoạt cuộc xem xét đó, không phải vì tất cả các mô hình đều sai, mà vì những mô hình tự tin nhất không phải là những mô hình chính xác nhất.

Giá trị của việc xem nhiều kết quả đầu ra không phải là bạn sẽ luôn chọn đa số. Đó là bạn sẽ biết một lựa chọn đã được thực hiện, điều này khác với việc giả định rằng kết quả đứng trước mặt bạn là chính xác.

Tám câu nào thực sự đã nói với tôi

Đặt tám bài kiểm tra cạnh nhau và một mô hình giữ vững: sự đồng ý và bất đồng ý không được phân phối ngẫu nhiên. Các cụm từ thành ngữ, ngôn ngữ kinh doanh hàng ngày ("liên lạc," "làm việc xuyên đêm") hội tụ trên hầu như mọi mô hình trong nhóm, ở cả hai vòng. Tính chính thức, độ chính xác pháp lý và thuật ngữ y tế không có. Bài kiểm tra tính chính thức của CEO đã chuyển từ bình thường sang chính thức chỉ khi nhóm mở rộng được đưa vào. Điều khoản bồi thường đã phát hiện ra một sự phân biệt pháp lý thực sự (miễn trách nhiệm so với bồi thường) mà chỉ một mô hình, trong một vòng, đã hiểu đúng. Sự phân chia về thuật ngữ y tế không bao giờ được giải quyết hoàn toàn, vẫn duy trì ở mức khoảng 6-4 trong cả hai vòng bất kể những mô hình nào nằm trong nhóm.

Đó là phát hiện thực tế, không phải là một tuyên bố tiếp thị: sự đồng thuận không làm cho mỗi câu tốt hơn, và nó không cần phải như vậy. Nó có giá trị nhất chính ở những nơi mà độ lưu loát của một mô hình không cho bạn lý do để nghi ngờ nó, và nơi mà sai lầm thực sự có chi phí.

Có một lớp thứ hai, thực tế hơn của bài kiểm tra này đáng được nêu rõ ràng. Tự chạy so sánh này có nghĩa là kiểm tra các kết quả từ GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo, và MiniMax M2.7 cạnh nhau với các mô hình cơ sở hiện có, ở một nơi, trên một nền tảng. Bên ngoài MachineTranslation.com, đó không phải là một đăng ký. Đó là nhiều cái, mỗi cái dành cho từng nhà cung cấp mà bạn muốn kiểm tra tầng cao cấp của họ, với bất kỳ giá nào mà mỗi nhà cung cấp tính riêng lẻ. Các người dùng trả phí ở đây nhận được so sánh tương tự đó chỉ trong một cú nhấp chuột, với chi phí chỉ là một phần nhỏ so với việc duy trì năm gói đăng ký cao cấp riêng biệt, mà không phải từ bỏ điều thực sự quan trọng: xem nơi các mô hình đồng ý, và biết chính xác khi nào họ không đồng ý.

Các câu hỏi thường gặp

1. ChatGPT hay Claude tốt hơn cho dịch thuật?

Không có cái nào tốt hơn một cách tuyệt đối; nó phụ thuộc vào danh mục kiểm tra. Claude Sonnet và Claude Opus liên tục lựa chọn thuật ngữ y tế tiếng Việt chính xác hơn, và Claude Opus tạo ra tiếng lóng phù hợp nhất cho "That's sick." Nhưng Claude Sonnet cũng tạo ra tiếng Nhật thân mật trong một câu ngữ cảnh CEO chính thức, nơi mà GPT-5.5 đã hiểu đúng. Việc so sánh các kết quả trực tiếp là có thể bảo vệ hơn so với việc chọn một mô hình và tin tưởng nó.

2. Mô hình dịch AI chính xác nhất năm 2026 là gì?

Không có một mô hình nào; độ chính xác phụ thuộc vào lĩnh vực. Gemini 3.5-Flash và GLM-5-Turbo tạo ra tiếng Nhật chính thức phù hợp nhất trong bài kiểm tra này. Cả hai mô hình Claude đều chính xác nhất về thuật ngữ y tế tiếng Việt. DeepSeek V4-Pro là mô hình duy nhất sử dụng thuật ngữ pháp lý tiếng Nhật chính xác, nhưng chỉ ở Vòng 2, và nó sử dụng tiếng Nhật thân mật ở những nơi khác. Không có mô hình nào chiếm ưu thế trên tất cả tám bài kiểm tra.

3. Việc thêm nhiều mô hình AI có luôn cải thiện độ chính xác của bản dịch không?

Không, không phải tự động. Việc mở rộng nhóm mô hình với các biến thể cấp cao cấp mới đã chuyển đổi sự đồng thuận từ bình thường sang chính thức trong bài kiểm tra tính chính thức của tiếng Nhật. Nhưng trong bài kiểm tra thuật ngữ y tế tiếng Việt, sự phân chia vẫn tiếp tục ở mức khoảng 6-4 bất kể các mô hình nào được đưa vào. Nhiều mô hình hơn làm nổi bật sự bất đồng nhiều hơn, đây là tín hiệu hữu ích, nhưng sự đồng thuận vẫn theo đa số, và đa số không phải lúc nào cũng là câu trả lời chính xác nhất.

4. SMART là gì và nó hoạt động như thế nào?

SMART là hệ thống đồng thuận đa mô hình của MachineTranslation.com, bao gồm tới 22 mô hình AI từ các nhà cung cấp bao gồm OpenAI, Anthropic, Google và DeepSeek. Nó chạy một bản dịch thông qua nhiều mô hình cùng một lúc và hiển thị kết quả đồng thuận của đa số cùng với câu trả lời của từng mô hình riêng lẻ, theo mặc định, mà không cần cấu hình. Sự đồng thuận thay đổi khi nhóm mô hình thay đổi, như được thể hiện trong kết quả về tính chính thức của tiếng Nhật trong bài kiểm tra này: sự đồng thuận không chính thức trong Vòng 1 trở nên chính thức trong Vòng 2.

5. Mô hình AI nào là tốt nhất cho dịch thuật y tế hoặc pháp lý?

Không có mô hình nào là tốt nhất; xem xét của con người là câu trả lời tốt hơn. Các mô hình Claude luôn chọn thuật ngữ y tế tiếng Việt chính xác hơn, và chỉ có DeepSeek V4-Pro sử dụng thuật ngữ pháp lý tiếng Nhật chính xác, nhưng chỉ ở Vòng 2. Thuật ngữ y tế bị chia tách không bao giờ được giải quyết trên 10 mô hình, điều này cho thấy rằng cần có chuyên môn về lĩnh vực, chứ không phải là nên chọn một mô hình khác. Đánh giá hậu biên tập của con người được chứng nhận, như Tomedes cung cấp, mang lại sự kiểm tra chuyên môn đó.‎