July 10, 2026
两个词。六个型号。三种不同的翻译决策。我在MachineTranslation.com上的最新AI模型中运行了8个测试句子,以下是输出结果实际上揭示了模型何时会无声地失败。
两个词。那太棒了。六个型号。三个不同的翻译决定。
在日语中,一个模型将其呈现为 それはやばい,保留了歧义。另一个完全省略了主语代词,写成了最口语化的形式 やばい。第三个版本写道 それはすごい,这完全消除了歧义,倾向于"令人惊叹的"这一含义,剥离了使这个短语有趣的双重含义。在越南语中,一个模型写了 Đỉnh vậy (俚语,青年用语的正确表达)。另一位写道 真是太棒了,在语法上是正确的,但更接近于当某人给你发送一个表情包时说"那真是太奇妙了"。
这些都是可以接受的。它们都不是同一回事。而如果你通过单个模型运行翻译,你永远看不到代表你所做的选择。
这是本文试图回答的核心问题。不是哪个人工智能模型最适合2026年的翻译(答案取决于语言对、语域、领域和句子结构),而是: 你如何知道你的模型是否做出了错误的选择? 特别是在医学术语、法律合同或专业正式用语等领域,错误的选择看起来与正确的翻译完全一样,直到专家阅读它。
以下是我所做的。我在 MachineTranslation.com上通过两轮模型测试了8个测试句子:首先是5个广泛使用的基准模型,然后是一个扩展池,其中添加了目前可供付费用户使用的几个最新的高级层模型变体。通常,比较来自这样的模型的输出意味着需要分别向每个提供商支付订阅费用。在MachineTranslation.com上,它们位于同一个比较视图中。语言对是英语→日语和英语→越南语。句子类别被特意选择以压力测试模型分歧最具影响力的领域:习语表达、法律术语、医学术语、形式敏感语境和刻意的语义歧义。
关于评估方法的说明:机器翻译研究长期以来一直在努力解决如何自动评分输出的问题。像BLEU和COMET 这样的指标,在WMT共享任务 中测量的结果虽然能提供有用的总体信号,但它们在检测寄存器错误、习语失败和术语精确性方面表现不佳,而这些正是这里最重要的类别。你即将阅读的是输出分析,而不是BLEU竞速。

并非每一句话都会出现有意义的分歧。八项测试中的两项,"等尘埃落定后我们再接触一下"(→日语)和"我们在加班加点赶上这个发布日期"(→越南语),在两轮中都产生了很高的一致性。这些习语被正确地理解为习语。没有人把"touch base"翻译成接触物理基地。没有人将"the dust settles"翻译为沉淀物下降。
这值得停顿思考:当习语足够常见时,当前前沿模型能够相当好地处理习语性的英文商业语言。关于"touch base"的共识在两轮中保持稳定;变化纯粹是文体上的,围绕是否使用この件(这件事)、この取引(这笔交易)或この案件(这个案子)来表达源短语。

"燃烧午夜之油"的测试正是事情变得更有趣的地方。除了一个模型外,其他所有模型都正确理解了这个习语。MiniMax M2.7在第2轮中推出,字面上翻译了"burning",产生了 đốt đuốc,意思是"燃烧的火把"。共识正确地排除了它。

日语是一种具有多层正式程度的语言。动词词尾、代词和指代名词形式的选择不是文体选择。它表示说话者和接收者之间的关系。用非正式动词形式给你的首席执行官发送信息在语法意义上不是翻译错误。这是一个社交错误,而且是一个重大的错误。
测试句子:你能把那个发过来吗?谢谢,非常感谢。背景:给首席执行官发消息。

当模型池扩展时,共识发生了转变。机制很简单:添加能够正确理解形式性语境的模型改变了多数意见,共识随之而来。以下是模型在第2轮中产生的完整频谱:

越南语寄存器测试暴露了一种不同类型的形式错误,一种更微妙的错误。原文句子:嘿,快速问一下——你有空打个电话吗?情境:给客户发消息。Qwen在第1轮中使用了"mình",这是一个第一人称代词,暗示了随意的同伴级别的友谊。其他所有模型都完全避免了第一人称自我指代,这是更安全的专业选择。关键的是,Qwen 在第 2 轮中纠正了这一点,并删除了"mình"。两轮共识都排除了它。

供应商/客户赔偿条款是商业协议中的标准条款:"供应商应就因违反本协议而产生的任何第三方索赔对客户进行赔偿。"
在第一轮中,所有五个模型都正确识别出法律语域,并使用了借词 ベンダー(供应商)和 クライアント(客户),这在源自英语的日本商业合同中是标准用法。一个例外:GPT-4.1-NANO 使用了販売者(卖方)和顧客(客户),这些是合法的日语词汇,但缺乏外来词等价物的正式法律特异性。
更重要的发现出现在第二轮中。关键的区别在于两个词:
这些是法律上不同的概念。"赔偿"特别是指保护一方免受第三方责任。"免责"是正确的法律术语。所有第一轮模型都使用了补偿。在第2轮中,DeepSeek V4-Pro是唯一生成"免責"的模型,且仅在第2轮中生成,第1轮中没有生成。

在合同中,补偿和免责不是同义词。一是指"我们会给你报销"。另一种意思是"你从一开始就被保护免受该索赔。"如果翻译平台使用"补偿"而正确的应该是"免责",那么阅读日文版本的律师将看不到与英文版本相同的协议。
这是数据集中最具影响力的发现。测试句子:此药物禁用于有肝功能损害病史的患者。来源:临床产品文档。目标:Vietnamese.
肝脏损害。有两名越南候选人:
这些在临床上是不同的。基于"肝功能损害"的禁忌警告适用于任何肝功能减退的人,而不仅仅是那些经历完全器官衰竭的人。使用 suy gan 会错误地缩小指定的人群范围。一名患有中度肝脏损害的患者,如果阅读"suy gan"可能无法认识到自己属于禁忌人群。

某些源句子在设计上是有歧义的。在当代英语俚语中,"That's sick"表示某事很棒,但它也保留了字面意思(即令人厌恶/令人反感),这两种含义之间的张力正是这个短语如何进行交流的一部分。翻译模型面临的挑战是:你是保留歧义,将其折叠为最可能的含义,还是选择一个并坚持?


这个测试中的模型并不都是等价的。他们跨越不同的架构、训练方案和部署环境。第一轮基线包括广泛可用的模型。扩展的第2轮池添加了目前在MachineTranslation.com上向付费用户提供的几个最新的高级层模型变体,这与否则需要在每个单独提供商处分别开设付费账户的模型属于同一层级。

第2轮扩展池包括更先进的模型,这些模型可供MachineTranslation.com上的付费用户使用。扩大资金池的效果并不均匀。在某些测试中(正式性/日语),它有意义地改变了共识。在其他方面(医学术语/越南语),分歧加深了。

测试数据指向两个不同的失败类别,它们需要不同的响应。
类别 A:无声故障。 形式错误、语域错误、医学术语精确性:这些会产生看起来正确的输出。日语在语法上是正确的。那个越南人很流利。没有表面迹象表明出了问题。一个只阅读单个模型输出的单语用户无法知道该模型做出了一个资深日本高管会注意到的寄存器选择,或者一个临床术语被以改变其适用人群的方式缩小了。
类别B:可见的失败。 MiniMax将"burning the midnight oil"翻译为"burning torches"。GPT-4.1-NANO 将"That's sick"解析为明确的"すごい。"这些是可以检测到的,要么由目标语言的使用者检测,要么通过与其他模型输出进行比较来检测。
多模型比较是SMART提供的功能,在A类中最有价值。当五个或十个模型生成输出,大多数在正式寄存器上达成一致,而其中一个生成随意的日语平文形式时,这种分歧在比较视图中是可见的。能够说目标语言的用户可以评估这些选项。一个用户如果看不到有争议的决定是如何做出的,就无法判断该判决是否需要人工审核。
对于文档级别的工作、大型文件、PDF的保留布局翻译、合同或临床材料,该平台的文档处理功能可以处理文件结构而不会破坏格式。但无论文件大小如何,上述质量问题都适用。一份100页的临床研究,其中"肝功能不全"的每个实例都被翻译为"肝功能衰竭",这是测试2中发现的同一问题的更大版本。
对于医学和法律类别,人工验证是正确的最后防线。 Tomedes的人工智能后期编辑服务将人工智能输出与认证人工审查配对,正是为了这种高风险内容而设计的。肝衰竭/肝功能衰退的分裂正是应该触发该审查的那种发现,不是因为所有模型都是错误的,而是因为最有信心的模型并不是最精确的。
查看多个输出的价值不在于你总是会选择多数。这是因为你会知道做出了一个选择,这与假设你面前的输出是正确的不同。

把这八个测试并排放在一起,一个模式就成立了:同意和不同意的分布不是随机的。习语化的日常商务用语("保持联系"、"夜以继日地工作")在几乎所有模型中都汇聚一致,在两轮测试中都是如此。正式用语、法律精确性和医学术语没有。首席执行官正式性测试只有在包含扩大的样本池后才从随意转变为正式。赔偿责任条款表明了一个真实的法律区分(免责 vs. 赔偿),只有一个模型在一轮中答对了。医学术语的分歧始终没有得到解决,无论哪些模型在池中,两轮都保持在大约6比4的比例。
这是实际发现,而不是营销宣传:共识并不能使每个句子都变得更好,也不需要这样做。它最有价值的地方恰好是在单个模型的流畅性让你没有理由怀疑它的地方,以及犯错实际上会付出代价的地方。
这个测试还有第二层,更实际的意义,值得明确说明。我自己进行这个比较意味着在一个地方、一个平台上并排检查 GPT-5.5、Claude Opus 4-7、Gemini 3.5-Flash、GLM-5-Turbo 和 MiniMax M2.7 的输出与现有的基准模型。在 MachineTranslation.com 之外,那不是一个订阅。这是多个订阅,每个你想测试其高级层级的提供商各一个,按照每个提供商各自收取的费用。付费用户可以一键获得相同的比较,费用仅为维护五个单独的高级订阅所需成本的一小部分,而不会放弃真正重要的东西:看到模型在哪些地方达成一致,并确切了解它们何时不一致。
都不是绝对更好;这取决于测试类别。Claude Sonnet和Claude Opus始终选择了更精确的越南医学术语,而Claude Opus为"That's sick."产生了最恰当的俚语。但Claude Sonnet也在正式的首席执行官语境句子中生成了随意的日语,而GPT-5.5却答对了。直接比较输出比选择一个模型并信任它更具防御性。
没有一个;准确性取决于领域。在这项测试中,Gemini 3.5-Flash 和 GLM-5-Turbo 生成了最恰当的正式日语。两个Claude模型在越南医学术语上最为精确。DeepSeek V4-Pro是唯一使用正确日语法律术语的模型,但仅在第2轮中使用,在其他地方则使用了随意的日语。没有单一模型在所有八项测试中占据主导地位。
不一定。扩展包含更新的高端模型变体的模型池使日语正式程度测试中的共识从非正式转变为正式。但在越南医学术语测试中,无论包含哪些模型,分裂都以大约6比4的比例持续存在。更多模型呈现更多分歧,这是有用的信号,但共识仍然遵循多数意见,而多数意见并不总是最精确的答案。
SMART是MachineTranslation.com的多模型共识系统,跨越包括OpenAI、Anthropic、Google和DeepSeek在内的提供商的多达22个AI模型。它同时通过多个模型运行翻译,并默认显示多数共识输出以及每个模型的答案,无需任何配置。当模型池发生变化时,共识也会发生变化,如该测试的日语正式性结果所示:第1轮的非正式共识在第2轮变成了正式。
没有单一的模型;人工审核是更好的答案。Claude 模型始终选择了更精确的越南医学术语,而 DeepSeek V4-Pro 单独使用了正确的日语法律术语,但仅在第 2 轮中。医学术语的分割在10个模型中都没有得到解决,这表明需要领域专业知识,而不是应该选择不同的模型。如同 Tomedes 所提供的, 经认证的人工译后编辑审查,提供了这种专业检查。