logo

MachineTranslation.comBy Tomedes

安全模式
lock-icon
diamond icon

Go Unlimited

diamond icon

Go Unlimited

  • right arrowLoginright arrow
search-icon
  • Afrikaans
  • Albanian (Shqip)
  • Amharic (አማርኛ)
  • Arabic (العربية)
  • Belarusian (Беларуская)
  • Bengali (বাংলা)
  • Bosnian (Bosanski)
  • Bulgarian (Български)
  • Burmese (မြန်မာစာ)
  • Catalan (Català)
  • Central Atlas Tamazight (Tamaziɣt)
  • Chinese-Simplified (简体中文)
  • Chinese-Traditional (繁體中文)
  • Croatian (Hrvatski)
  • Czech (Čeština)
  • Danish (Dansk)
  • Dutch (Nederlands)
  • English
  • Esperanto
  • Estonian (Eesti)
  • Filipino (Tagalog)
  • Finnish (Suomi)
  • French (Français)
  • French-Canada (Français-Canada)
  • Galician (Galego)
  • Georgian (ქართული)
  • German (Deutsch)
  • Greek (Ελληνικά)
  • Guarani (Avañe'ẽ)
  • Haitian Creole (Kreyòl Ayisyen)
  • Hausa
  • Hebrew (עברית)
  • Hindi (हिन्दी)
  • Hungarian (Magyar)
  • Icelandic (Íslenska)
  • Igbo
  • Indonesian (Bahasa Indonesia)
  • Italian (Italiano)
  • Japanese (日本語)
  • Khmer (ខ្មែរ)
  • Korean (한국어)
  • Latvian (Latviešu)
  • Lingala (Lingála)
  • Lithuanian (Lietuvių)
  • Malagasy
  • Malay (Bahasa Melayu)
  • Maltese (Malti)
  • Norwegian-Bokmål (Norsk-Bokmål)
  • Oromo (Afaan Oromoo)
  • Polish (Polski)
  • Portuguese-Brazil (Português-Brasil)
  • Portuguese-Portugal (Português-Portugal)
  • Quechua (Runa Simi)
  • Romanian (Română)
  • Russian (Русский)
  • Serbian (Српски)
  • Slovak (Slovenčina)
  • Slovenian (Slovenščina)
  • Somali (Soomaaliga)
  • Spanish (Español)
  • Swahili (Kiswahili)
  • Swedish (Svenska)
  • Tamil (தமிழ்)
  • Thai (ไทย)
  • Tigrinya (ትግርኛ)
  • Tswana (Setswana)
  • Turkish (Türkçe)
  • Ukrainian (Українська)
  • Urdu (اردو)
  • Vietnamese (Tiếng Việt)
  • Wolof
  • Xhosa (IsiXhosa)
  • Yoruba (Yorùbá)
  • Zulu (IsiZulu)
返回
添加积分
logo

MachineTranslation.com 深受全球数百万用户的信赖,已交付数十亿条高质量翻译,涵盖多种语言和格式。MachineTranslation.com 是由 Tomedes 开发的免费人工智能翻译器,旨在让每个人都能轻松、准确、安全地使用人工智能翻译。该平台能够翻译文本和大型文档,同时保持其原始布局不变。它使用SMART通过比较 22 个 AI 模型的输出结果,并自动选择大多数 AI 达成共识的版本,从而提供最值得信赖的翻译。

公司

关于我们
联系我们
登录
注册

菜单

常见问题解答价钱API博客语言

热门语言

中文(简体) 至 西班牙文(西班牙)
意大利文 至 中文(简体)
葡萄牙文(巴西) 至 中文(简体)
德文 至 中文(简体)
Malay 至 中文(简体)
俄文 至 中文(简体)

公司

关于我们
联系我们
登录
注册

菜单

常见问题解答价钱API博客语言

热门语言

中文(简体) 至 西班牙文(西班牙)
意大利文 至 中文(简体)
葡萄牙文(巴西) 至 中文(简体)
德文 至 中文(简体)
Malay 至 中文(简体)
俄文 至 中文(简体)
g2iso_certificate_1iso_certificate_2
google_playapple_app
phone_icon
US: +1 985 239 0142 | UK: +44 1615 096140
mail_iconcontact@machinetranslation.com
social iconsocial iconsocial iconsocial icon
Globearrow
search-icon
  • Afrikaans
  • Albanian (Shqip)
  • Amharic (አማርኛ)
  • Arabic (العربية)
  • Belarusian (Беларуская)
  • Bengali (বাংলা)
  • Bosnian (Bosanski)
  • Bulgarian (Български)
  • Burmese (မြန်မာစာ)
  • Catalan (Català)
  • Central Atlas Tamazight (Tamaziɣt)
  • Chinese-Simplified (简体中文)
  • Chinese-Traditional (繁體中文)
  • Croatian (Hrvatski)
  • Czech (Čeština)
  • Danish (Dansk)
  • Dutch (Nederlands)
  • English
  • Esperanto
  • Estonian (Eesti)
  • Filipino (Tagalog)
  • Finnish (Suomi)
  • French (Français)
  • French-Canada (Français-Canada)
  • Galician (Galego)
  • Georgian (ქართული)
  • German (Deutsch)
  • Greek (Ελληνικά)
  • Guarani (Avañe'ẽ)
  • Haitian Creole (Kreyòl Ayisyen)
  • Hausa
  • Hebrew (עברית)
  • Hindi (हिन्दी)
  • Hungarian (Magyar)
  • Icelandic (Íslenska)
  • Igbo
  • Indonesian (Bahasa Indonesia)
  • Italian (Italiano)
  • Japanese (日本語)
  • Khmer (ខ្មែរ)
  • Korean (한국어)
  • Latvian (Latviešu)
  • Lingala (Lingála)
  • Lithuanian (Lietuvių)
  • Malagasy
  • Malay (Bahasa Melayu)
  • Maltese (Malti)
  • Norwegian-Bokmål (Norsk-Bokmål)
  • Oromo (Afaan Oromoo)
  • Polish (Polski)
  • Portuguese-Brazil (Português-Brasil)
  • Portuguese-Portugal (Português-Portugal)
  • Quechua (Runa Simi)
  • Romanian (Română)
  • Russian (Русский)
  • Serbian (Српски)
  • Slovak (Slovenčina)
  • Slovenian (Slovenščina)
  • Somali (Soomaaliga)
  • Spanish (Español)
  • Swahili (Kiswahili)
  • Swedish (Svenska)
  • Tamil (தமிழ்)
  • Thai (ไทย)
  • Tigrinya (ትግርኛ)
  • Tswana (Setswana)
  • Turkish (Türkçe)
  • Ukrainian (Українська)
  • Urdu (اردو)
  • Vietnamese (Tiếng Việt)
  • Wolof
  • Xhosa (IsiXhosa)
  • Yoruba (Yorùbá)
  • Zulu (IsiZulu)

2026 MachineTranslation.com by Tomedes

法律政策Cookie 政策

体验最好的 AI 翻译。

June 5, 2026

同样的AI,不同的模型——翻译结果也截然不同

我一直在对我们翻译行业中一个很少被提及的话题进行内部测试:不是不同的 AI 系统翻译 是否不同,而是同一个 AI 的不同版本翻译 是否不同——以及差异有多大。

上周,我在 MachineTranslation.com 的内部测试平台上,同时将一个西班牙语习语输入了五个版本的 ChatGPT。 结果让我震惊。

其中两个版本生成的翻译,确实是 英语中的胡言乱语。三个版本都产生了正确的意译。而这三个正确的答案彼此之间也并不一致。这五种都是ChatGPT。‎

全部五项都是 OpenAI。相同的AI,不同的模型—— 输出却截然不同。

我现在分享这些,是因为我认为它们很重要,而不是因为我有什么 明确的答案。我不。但这个观察很有趣,值得 公之于众。

目录

  • 测试:一个西班牙语习语,五个 GPT 版本
  • 为什么这个习语是一个好的测试用例
  • 字面到习语的划分告诉我们这些模型是如何被训练的
  • 没有人似乎在谈论的含义
  • 即使是“正确”的翻译也彼此不一致
  • 我还不了解的
  • 两个值得思考的研究问题

测试:一个西班牙语习语,五个 GPT 版本

我测试的短语是 llevarse el gato al agua。


这是每个版本生成的:

模型                                              输出                                               习语化?
ChatGPT::GPT-4o-MINI 把猫带到水里 ❌ 字面意思
ChatGPT::GPT-4.1-NANO 把猫带到水里 ❌ 字面意思
ChatGPT::GPT-4.1-MINI 成功地做到了 ✅ 正确
ChatGPT::GPT-5.4-MINI 如愿以偿 ✅ 部分正确
ChatGPT::GPT-5.4 最终获胜 ✅ 正确

这个短语的意思是克服困难取得成功, 赢得一场艰难的胜利。这与猫或水无关。 直译不是翻译。这是模型未能识别为习语的短语的逐字 转录。

GPT-4o-MINI 和 GPT-4.1-NANO 产生了相同的输出。不相似,相同。我们的翻译洞察直接标记了这一点:‎“GPT-4.1-nano 和 GPT-4o-mini 共享相同的翻译,强调字面 解释而非惯用含义。”

GPT-4.1-MINI、GPT-5.4-MINI 和 GPT-5.4 各自产生了一些 可识别的正确翻译——但彼此之间并不相同。

为什么这个习语是一个很好的测试用例

我想精确说明为什么llevarse el gato al agua 是一个有用的 测试输入,而不是一个刻意挑选的例子。

这是一个成熟的习语。它出现在文学、新闻 和日常用语中。它并不晦涩。任何在 合理数量的西班牙语语料库上训练过的模型都应该遇到过它。 问题不在于模型是否见过这个短语。问题 is 在于它如何处理它。

在成语翻译中,最糟糕的失败模式并不是产生一个糟糕的 翻译。它产生了一个字面翻译,对于不懂目标语言的人来说,看起来 是可以接受的。

“To carry the cat to the water” 是语法正确的英语。它 格式正确。这听起来像是有可能意味着什么。 一个不懂西班牙语的用户可能会读到它,点点头,然后继续—— 却永远不知道原来的意思已经完全丢失了。

这正是我所关心的失败模式。不是显而易见的错误。那 看不见的

字面到习语的划分告诉我们关于这些模型是如何训练的

这里的模式不是随机的。生成字面翻译的两个模型(GPT-4o-MINI 和 GPT-4.1-NANO)都是较小的、轻量级的模型,针对速度和成本效益进行了优化。‎ 三个 生成惯用翻译的模型(GPT-4.1-MINI、 GPT-5.4-MINI、GPT-5.4)代表了不同的代际或 参数规模。

这暗示了一个我认为尚未被充分探索的观点:翻译中的惯用能力随模型容量的增长而扩展,其方式在通用基准测试中是看不见的。

通用语言基准测试会测试推理、知识、编码、 数学能力。它们通常不会测试模型是否能识别 “下猫狗雨”与天气状况无关, 或者“把猫带到水里”与给猫补水无关。 习语处于文化知识、语境 推理和模式识别的交汇点——而这个交汇点似乎 需要模型具备一定容量的阈值,而较小的模型 无法持续达到这个阈值。

我并不是说:较大的模型总是更好的 翻译器。我没有这方面的普遍性证据。 我正在观察的是:特别是对于惯用语内容, 家庭内部的版本差异比我预期的要大。

没有人似乎在谈论的含义

大多数使用人工智能翻译工具的用户不知道他们正在使用哪个版本 的人工智能。他们打开一个产品,选择一个语言对 ,然后得到一个输出。模型路由对他们来说是不可见的。

这在规模上很重要。MachineTranslation.com 在短短 90 天内处理了数十万份英语到西班牙语的翻译工作。 如果其中很大一部分工作涉及惯用语内容(营销文案、法律语言、文学文本、日常交流),而用于处理这些工作的工具却在用户不知情的情况下将他们引导至一个更小的模型,那么“抱猫过河”就会出现在真实的输出、真实的文件中,出现在那些信任结果的真实人们面前。翻译行业已经花费了数年时间比较人工智能提供商。DeepL 与 Google。‎

克劳德对阵 ChatGPT。这些比较很有用。‎ 但在单个提供商内部,版本差异可能同样显著——而这是大多数比较框架不测量的差异,因为它们不在模型版本级别进行测试。当有人说“我使用 ChatGPT 进行翻译”时,这句话不够具体,无法产生意义。‎

哪个ChatGPT?纳米? 4o-迷你?‎4.1-迷你?5.4?答案以一些 非同寻常的方式改变了输出,至少对于惯用语内容是这样。

即使是“正确”的翻译也彼此不一致

这是我最感兴趣的部分,我还没有完全 弄清楚该如何看待它。

生成惯用语翻译的三种模型给出了三种 不同的翻译:

  • GPT-4.1-MINI: “to pull it off successfully”
  • GPT-5.4-MINI: “to get one's way”
  • GPT-5.4: “to come out on top”

这三种都是对llevarse el gato al agua的合理英文翻译。但它们并非等同。

“成功做到”强调的是克服困难的执行力,你 做了一件难事,并且成功了。随心所欲地做某事强调的是你想要的结果得以实现,而不太强调 其中的困难。‎“脱颖而出”强调的是竞争性的胜利,相对于他人获胜。

原始的西班牙语习语最接近前者。 这个短语带有克服阻力的含义,而不仅仅是偏好某个结果并使其实现。 但是“如愿以偿”和“获胜”本身并没有错,只是在不同方向上不够精确。这就引出了一个我真心觉得困难的问题:当三个模型各自给出了正确但不同的习语翻译时,你该如何评价哪个最好?‎

BLEU分数与 参考翻译进行比较——但参考是谁写的,以及他们会选择这三者中的哪一个?

值得称赞的是,我们的AI翻译代理在承诺任何输出之前,都问了正确的问题 ‎: 在这个语境中,“llevarse el gato al agua”的预期含义是什么?提供了三种选择——实现一个困难的目标,拿走一些不必要的东西,或者进行一项有风险的活动。‎ 这个问题并非装饰性的。‎ 它是翻译最终确定之前解决语境歧义的机制。但重点是:三个正确的答案,三种不同的含义。‎

翻译评估工具并非为 这种细微差别而设计。

我尚不清楚

我想诚实地说明本次测试所能显示的局限性。

一种习语,一种语言对,一天的内部测试。 那不是一项研究。这是一个观察。我不知道这种模式(较小的模型默认为直译,较大的模型实现意译)是否在以下方面持续成立:

  • 其他西班牙语习语
  • 具有丰富习语传统的其他语言对 (阿拉伯语、日语、俄语都想到了)
  • 不适用该区别的非习语内容
  • 较小的模型正确理解习语而较大模型却遗漏的边缘情况

我也不知道这是否是这些模型的一个稳定属性,还是会随着更新和微调而变化。 模型提供商不发布翻译特定的更新日志。 今天能正确处理 llevarse el gato al agua 的模型版本,下个月可能会更新,而我们无从得知。

我所知道的是:这次测试产生了一个足够有趣的结果,以至于我想更系统地、跨更多语言对和内容类型地进行更多测试。当我有更多信息时,我会分享的。

值得思考的两个研究问题

我将以这次测试留给我的两个问题作为结束。我不会 回答他们,我现在还没有数据来做到这一点。 但我认为这是正确的问题。首先:在什么参数阈值下,惯用语能力才变得可靠?从 GPT-4o-MINI 和 GPT-4.1-NANO(两者都是字面意思)到

GPT-4.1-MINI(惯用语)的飞跃表明,在这些模型大小之间的参数范围内,某个地方存在一个阈值,惯用语识别功能会在此开启。‎

它一致吗?它适用于所有语言的习语 ,还是取决于训练数据中语言的代表性程度 ‎?我不知道。但了解 对于任何构建翻译工作流的人来说都很有用。

第二:模型版本不透明给用户带来了多大的代价?

如果用户每月通过一个不披露正在使用哪个模型版本的工具 处理 1,000 份文件(其中一些 文件包含习语内容),那么字面上的失败会隐形地发生多少次?‎ 他们怎么会知道? 永远不找出答案的真正代价是多少?

我认为这比目前流传的 大多数“哪种人工智能最适合翻译”的比较更重要的问题。‎ 答案并非“使用最大的模型”。 答案可能是:了解你正在使用的东西,在你自己的内容上运行你自己的 测试,并且不要假设一个提供商的 名称可以保证在其模型 系列中行为一致。

至少,我从这次测试中得出的结论是这样。

研究问题

1.模型大小能否可靠地预测惯用翻译质量?

基于此单一测试:同一人工智能家族中,较小、经过效率优化的模型 默认会逐字翻译一个 根深蒂固的西班牙语习语,而同一模型的较大/较新版本 则产生了正确的惯用语翻译。这是否适用于成语类别和语言对,是下一个问题。‎ 我会进行更多测试。‎

2. 为什么三个“正确”的习语翻译会产生三个 意义上不同的输出?

GPT-4.1-MINI、GPT-5.4-MINI 和 GPT-5.4 都将llevarse el gato al agua习语翻译成——但却是不同的英语 表达方式,带有细微不同的含义。这表明 意译的质量至少有两个维度: 模型是否识别出该习语,以及它从目标语言 的可用选项中选择了哪个 等效表达。标准的翻译质量指标 无法清晰地区分这两个维度。我认为他们应该这样做。


此帖子基于MachineTranslation.com开发平台上的内部测试。此处展示的多模型版本测试尚未公开提供。我分享这一发现是因为我认为这项观察无论在哪里进行翻译都很有用。