September 9, 2026
Chạy cùng 12,000 phân đoạn dịch thuật qua Qwen và DeepSeek, và DeepSeek chiến thắng ở phần lớn các cặp ngôn ngữ. Đó chưa phải là toàn bộ câu chuyện. Chia kết quả theo chiều dịch, và một quy luật cụ thể sẽ xuất hiện: Qwen thu hẹp hầu hết khoảng cách, và đôi khi dẫn đầu, đặc biệt là khi ngôn ngữ đích là tiếng Anh. Khi dịch từ tiếng Anh sang bất kỳ ngôn ngữ nào khác, DeepSeek chiến thắng hầu như mọi lúc.
Sự phân chia đó quan trọng hơn một người chiến thắng chung cuộc duy nhất nếu bạn đang dịch thuật nội dung trên hàng chục ngôn ngữ thay vì chỉ một cặp ngôn ngữ duy nhất.
Qwen là dòng mô hình ngôn ngữ lớn của Alibaba. Thế hệ hiện tại là Qwen3.8, được phát hành vào tháng 8 năm 2026: Qwen3.8-Max là phiên bản flagship đóng, chỉ cung cấp qua API với 2.4 nghìn tỷ tham số, trong khi Qwen3.8-27B là mô hình trọng số mở nhỏ hơn được phát hành theo Apache 2.0 vài ngày sau đó, nhằm hướng tới các đội ngũ muốn tự host.
DeepSeek là một phòng thí nghiệm AI của Trung Quốc nổi tiếng với các mô hình mixture-of-experts đạt hiệu suất hàng đầu với chi phí suy luận chỉ bằng một phần nhỏ. Thế hệ hiện tại của nó, DeepSeek V4, được ra mắt vào tháng 4 năm 2026 với hai phiên bản: V4 Pro (tổng cộng 1.6 nghìn tỷ tham số, khoảng 49 tỷ hoạt động trên mỗi token) dành cho công việc chú trọng vào chất lượng, và V4 Flash (tổng cộng 284 tỷ, khoảng 13 tỷ hoạt động) dành cho các tác vụ nhạy cảm với độ trễ. Cả hai đều được phát hành dưới dạng trọng số mở được cấp phép MIT.
Hầu hết các so sánh giữa Qwen và DeepSeek đều trích dẫn các bài kiểm tra hiệu năng đa dụng: lập trình, toán học, lập luận. Không có phương pháp nào trong số đó đánh giá trực tiếp chất lượng dịch thuật, và việc chạy mỗi mô hình trên các văn bản nguồn khác nhau khiến mọi khoảng cách về độ chính xác đều không thể tách biệt khỏi những yêu cầu đặc thù của chính văn bản nguồn đó.
Lượng truy cập dịch thuật thực tế của riêng MachineTranslation.com trong 28 ngày qua đưa ra một câu trả lời rõ ràng hơn, bởi vì cả hai mô hình đều dịch cùng một văn bản nguồn giống hệt nhau. Trên 98 cặp ngôn ngữ và hơn 12.000 phân đoạn trùng khớp, DeepSeek đạt điểm cao hơn ở 83 cặp; Qwen đạt điểm cao hơn ở 15 cặp. Thu hẹp phạm vi trong 27 cặp có ngôn ngữ đích là tiếng Anh, khoảng cách này sẽ giảm đi đáng kể: DeepSeek chiến thắng ở 63% số cặp đó (17 trên 27), Qwen chiến thắng ở 37% (10 trên 27). Trong 71 cặp còn lại, nơi tiếng Anh không phải là ngôn ngữ đích, DeepSeek chiến thắng ở 92% (66 trên 71).

Nhìn chung, DeepSeek chiến thắng ở đại đa số các cặp ngôn ngữ. Cơ hội cạnh tranh của Qwen tuy hẹp nhưng có thật: dịch sang tiếng Anh, nơi nó chiếm ưu thế ở hơn một phần ba số cặp ngôn ngữ. Dữ liệu: Bảng xếp hạng công cụ nội bộ của MachineTranslation.com, nhóm đánh giá đã hiệu chỉnh sai lệch, từ ngày 12 tháng 7 đến ngày 8 tháng 8 năm 2026.
Điểm trung bình có trọng số trên mọi phân đoạn trùng khớp cho thấy DeepSeek đạt 9.13 trên 10 điểm và Qwen đạt 8.98 điểm. Đó là một khoảng cách thực tế, nhưng nó không được phân bổ đều, và đây là thông tin hữu ích hơn cần biết nếu nội dung của bạn được dịch theo nhiều hướng khác nhau. Đây là phương pháp đối đầu trực tiếp tương tự mà MachineTranslation.com áp dụng trên thử nghiệm so sánh mô hình toàn diện của mình, chứ không chỉ cho riêng cặp này.
Các số liệu tổng hợp này cũng hoàn toàn chính xác trong các trường hợp thử nghiệm riêng lẻ. Khi thử nghiệm với cụm từ tiếng Pháp "Elle est directrice adjointe du département commercial", cả DeepSeek và Qwen đều cho ra cùng một bản dịch tiếng Anh là "deputy director of commercial department". Bạn có thể kiểm tra trực tiếp kết quả thử nghiệm trực tiếp đó . Khi thử nghiệm dịch cụm từ "as soon as possible" sang tiếng Tây Ban Nha, DeepSeek đã đi lệch khỏi sự đồng thuận của bốn mô hình khác khi sử dụng "esté hecho" thay vì "se haga", đây là một trường hợp khác biệt thực tế phản ánh sự phân biệt về mặt ngữ pháp giữa quá trình và kết quả, chứ không phải là một lỗi dịch thuật.
Dữ liệu không giải thích tại sao, mà chỉ chỉ ra ở đâu. Một số cặp dịch sang tiếng Anh mạnh nhất của Qwen là tiếng Tamil, tiếng Trung, tiếng Ba Lan, tiếng Ý và tiếng Do Thái, vốn là những ngôn ngữ nguồn có kho dữ liệu huấn luyện tiếng Anh lớn và được ghi chép đầy đủ, sẵn có cho các nhà phát triển mô hình nói chung. Ngoài một hướng đó ra, lợi thế của DeepSeek được duy trì ở hầu hết mọi nơi: dịch từ tiếng Anh, cũng như giữa các cặp ngôn ngữ không phải tiếng Anh.
Điều này loại bỏ khả năng coi bất kỳ mô hình nào là lựa chọn mặc định chung. Một đội ngũ dịch danh mục sản phẩm từ tiếng Tây Ban Nha sang sáu ngôn ngữ khác và kỳ vọng thứ hạng hiệu suất tương tự như khi họ dịch một phiếu hỗ trợ từ tiếng Trung sang tiếng Anh sẽ áp dụng sai bài học từ sai hướng, đây cũng chính là sự bất đối xứng xuất hiện trong phân tích mô hình từ tiếng Tây Ban Nha sang tiếng Anh của MachineTranslation.com, nơi các mô hình dẫn đầu không phải là những mô hình dẫn đầu ở chiều ngược lại.
Cơ chế cấp phép của mỗi bên có sự khác biệt. DeepSeek cấp phép cho cả V4 Pro và V4 Flash theo giấy phép MIT, một trong những điều khoản mã nguồn mở thông thoáng nhất hiện nay, vì vậy cả hai đều được tự do tự lưu trữ mà không có bất kỳ hạn chế nào. Qwen có sự phân chia: Qwen3.8-27B được cung cấp theo giấy phép Apache 2.0 và được miễn phí tự lưu trữ, nhưng phiên bản hàng đầu Qwen3.8-Max vẫn là mã nguồn đóng, chỉ cung cấp qua API và thuộc giấy phép tùy chỉnh riêng của Alibaba.
Về mặt thực tế, điều đó có nghĩa là một tùy chọn hoàn toàn mở trọng số, được cấp phép MIT tồn tại ở phía DeepSeek cho cả hai phân khúc chất lượng. Về phía Qwen, việc chọn phiên bản trọng số mở đồng nghĩa với việc phải chấp nhận bỏ qua mô hình hàng đầu.
Sau đợt giảm giá vĩnh viễn của DeepSeek vào tháng 5 năm 2026, mức giá API được công bố hiện tại của hãng là $0.435 per million input tokens (cache miss) and $0.87 cho mỗi triệu token đầu ra đối với V4 Pro, với V4 Flash có giá thấp hơn cho phân khúc tối ưu hóa độ trễ của mình.
Đối với các đội ngũ tự lưu trữ một trong hai mô hình thay vì sử dụng API được lưu trữ sẵn, việc so sánh chi phí sẽ chuyển hoàn toàn sang cơ sở hạ tầng GPU và trở thành một hàm số của số lượng tham số và hiệu suất tham số hoạt động thay vì mức giá trên mỗi token.
Cả hai mô hình đều không công bố các chứng nhận an toàn dành riêng cho dịch thuật, và các điểm chuẩn an toàn đa mục đích không kiểm tra các lỗi nghiêm trọng trong nội dung bị kiểm soát: dịch sai liều lượng, điều khoản trách nhiệm bị thay đổi, thuật ngữ pháp lý không nhất quán. Thử nghiệm riêng của MachineTranslation.com đã tìm thấy chính xác loại sai lệch này giữa các mô hình đối với ngôn ngữ pháp lý và y tế, bao gồm cả những trường hợp các mô hình sử dụng các thuật ngữ pháp lý khác nhau với phạm vi khác nhau mặc dù cả hai đều đạt điểm cao trên các chỉ số chất lượng chung.
Đối với hợp đồng, tài liệu di trú hoặc nội dung lâm sàng, đó là lý do để kết hợp kết quả đầu ra của một trong hai mô hình với một bước xác minh của con người thay vì tin tưởng hoàn toàn vào kết quả đầu ra của một AI duy nhất, bất kể mô hình nào đã tạo ra nó.
Một so sánh dựa trên một cặp ngôn ngữ hầu như không nói lên điều gì về cặp ngôn ngữ thứ bốn mươi. Sự phân chia dịch sang tiếng Anh/dịch từ tiếng Anh được ghi nhận ở đây được áp dụng trên mẫu gồm 98 cặp ngôn ngữ cụ thể là vì nó được thử nghiệm ở quy mô đó: một thử nghiệm dịch từ tiếng Anh sang tiếng Tây Ban Nha đơn lẻ, vốn là thử nghiệm mà hầu hết các so sánh giữa Qwen và DeepSeek thực hiện, sẽ cho thấy DeepSeek dẫn trước một cách dễ dàng và không nói lên điều gì về những gì xảy ra khi tiếng Tamil, tiếng Ba Lan hoặc tiếng Do Thái được đưa vào quy trình.
Đó là lý do thực tế cho việc không mặc định khóa một chương trình bản địa hóa lớn vào kết quả đầu ra của một mô hình duy nhất. MachineTranslation.com vận hành cả Qwen và DeepSeek, cùng với hơn 20 mô hình khác, trên mỗi bản dịch và hiển thị phiên bản mà các mô hình đó đồng thuận nhất, vì vậy việc triển khai sang 68 ngôn ngữ không bị phụ thuộc vào bất kỳ mô hình nào tình cờ giành chiến thắng trong cặp ngôn ngữ mà ai đó đã thử nghiệm trước. Bạn có thể thấy chính xác mô hình nào đồng thuận hoặc khác biệt trên bất kỳ bản dịch nào trong bảng phân tích mô hình theo từng bản dịch mà nền tảng hiển thị cho mỗi kết quả.
Mỗi bản dịch đều được kiểm tra chéo với nhiều mô hình hơn so với những gì Qwen hoặc DeepSeek có thể tự cung cấp, đây là câu trả lời trực tiếp cho những gì xảy ra khi nội dung của bạn không còn chỉ đi theo một hướng duy nhất.
Trong số 98 cặp ngôn ngữ được thử nghiệm trên cùng một văn bản nguồn, DeepSeek đạt điểm cao hơn ở 83 cặp. Các chiến thắng của Qwen tập trung vào một hướng cụ thể: dịch sang tiếng Anh, nơi nó giành chiến thắng khoảng một phần ba thời gian. Trong mọi hướng khác, DeepSeek giành chiến thắng hơn 90% thời gian.
Qwen3.8-27B có trọng số mở theo giấy phép Apache 2.0 và được tự do tự lưu trữ. Phiên bản hàng đầu Qwen3.8-Max là mã nguồn đóng và chỉ khả dụng thông qua API trả phí của Alibaba Cloud.
Có. Cả DeepSeek V4 Pro và V4 Flash đều được cung cấp với trọng số mở theo giấy phép MIT, vì vậy bạn có thể tự lưu trữ bất kỳ mô hình nào mà không mất chi phí bản quyền. DeepSeek cũng cung cấp API trả phí cho các đội ngũ không muốn tự quản lý cơ sở hạ tầng của riêng họ.
DeepSeek V4 Flash được xây dựng đặc biệt để có độ trễ thấp, với 13 tỷ tham số hoạt động trên mỗi token so với 49 tỷ của V4 Pro. Tùy chọn nhẹ hơn tương đương của Qwen, Qwen3.8-27B, là mô hình dạng đặc (dense) thay vì hỗn hợp chuyên gia (mixture-of-experts), điều này thường khiến nó chậm hơn trên mỗi token ở mức chất lượng tương đương.
Có. MachineTranslation.com chạy cả hai mô hình này, cùng với hơn 20 mô hình khác, trên mỗi bản dịch và hiển thị phiên bản mà các mô hình đồng thuận nhất, vì vậy bạn không bị kẹt trong việc chọn một mô hình và hy vọng đó là lựa chọn mạnh hơn cho cặp ngôn ngữ cụ thể đó.
DeepSeek cấp phép cho cả hai biến thể V4 theo giấy phép MIT, một trong những giấy phép nguồn mở thông thoáng nhất hiện nay. Qwen phân chia dòng sản phẩm của mình: các mô hình nhỏ hơn như Qwen3.8-27B được cung cấp theo giấy phép Apache 2.0, nhưng mô hình hàng đầu Qwen3.8-Max vẫn đóng theo một giấy phép tùy chỉnh.