June 10, 2026
我想分享我们本周决定的事情——不是在它发布之后,而是在我们仍在构建它的时候。
我们正在改变人工智能模型在我们用户层级中的分配方式。MachineTranslation.com 的付费用户将很快获得来自领先提供商(OpenAI、Anthropic、Google、DeepSeek 等)的更先进 AI 模型。 免费用户将继续获得强大可靠的翻译,但不会是相同的模型。那个间隔是故意的,我想确切地解释我们为什么做出这个决定。
我宁愿现在就写下这些,趁着理由还新鲜,决定还带着一点生涩,而不是等到它上线后再把它包装成一份完美的公告。诚实版本更有用。
MachineTranslation.com 同时使用 22 个人工智能模型进行翻译,并采用基于共识的方法来呈现最佳输出。这始终是我们工作的核心——不把所有赌注都押在一个模型上,而是比较多个模型,让输出结果不言自明。
这种方法令人不舒服的一面是,它使得模型之间的质量差异变得非常明显。我们每天都看到,并非所有模型都能同样好地处理所有文本。很长一段时间以来,我们没有让那个观察结果改变我们如何将模型分配给用户。
几周前,Rachelle(我们的AI负责人)向我们介绍了我们内部构建的一个工具,用于同时测试多个GPT模型的翻译质量——包括GPT 4.1 nano、GPT 4.1 mini、GPT 5.4 mini及其他模型。你输入相同的源文本,然后你可以并排看到每个模型的输出。
那个工具立即明确了一点:对于简单、简短、日常的文本,输出结果几乎完全相同。你确实无法为高级模型在“会议在下午3点”这样的简单任务上提供质量论证。
但在任何具有真正语言复杂性的任务上(如习语表达、领域术语、需要上下文贯穿数千字的冗长文档),模型之间的差距就会显现出来,并且以专业上重要的方式显现。
这就是我认为翻译行业没有足够坦诚地讨论的部分。低端模型通常不会产生明显错误的翻译。 它们产生的翻译表面上读起来没问题,但却包含细微的错误,只有领域专家(律师、医疗专业人士、高级本地化经理)才能立即发现。
一个传达了错误含义的条件从句。一个法律术语,在该司法管辖区内具有特定含义,被翻译成其日常等价物。一份长篇文档中间出现的语体漂移,损害了整个文档的专业可信度。
这种失败是悄无声息的。专业翻译中悄无声息的失败可能代价高昂。
我们做出这个决定并非基于直觉。我们针对复杂、地道的源文本(我们的专业用户实际需要翻译的那种内容)运行了模型,并且我们让语言学家评估了输出结果。
结果很明显。高级模型在处理细微之处、语域和领域特定术语方面始终表现得更好。更便宜的型号用于休闲使用绰绰有余。这两种用例确实需要不同的工具。

由此在内部引发的讨论,与其说是关于定价,不如说是关于诚信。如果我们知道模型在专业级内容上的表现不同,并且我们知道我们的付费用户主要翻译专业级内容,那么给他们提供与翻译休闲邮件的免费用户相同的模型,对双方都是一种损害。
Ofer(我们的首席执行官)在我们的内部讨论中直言不讳地指出:
“低级别模型在处理复杂或习语文本时存在真正的质量风险。”但更重要的一点是:共识的价值,仅取决于其背后模型的质量。当付费用户获得更先进的模型时,他们不仅仅是获得更好的独立输出——他们正在获得更强的共识。更好的模型,更好的共识,更可靠的翻译。这就是专业级翻译的真正含义。
这种说法一直萦绕在我心头。不仅仅是成本问题。这是一个清晰度论点。
功能更强大的AI模型每token运行成本显著更高。这不是 MachineTranslation.com 的政策,而是每个主要的 AI 提供商为其旗舰模型定价的方式。OpenAI、Anthropic、谷歌和 DeepSeek 都为其付费客户保留其最新、最强大的模型,因为运营这些模型的成本显著更高。针对每一次免费翻译、每一次随意查询、每一次“这个标志是什么意思”的请求都运行我们最先进的模型,将会显著增加我们的基础设施成本。
更重要的是,这意味着我们将不得不使用我们本应用于为翻译10,000字技术文档的专业人士保持质量的计算预算,去交叉补贴那些低复杂度的用例。这不是一个可持续或明智的分配。
这个决定有一个纯粹是功利主义的版本——多收费,多给予,就这么简单。推动这一切的并非如此。
推动这一切的是我们建立了一个平台,该平台能够真正揭示人工智能模型之间的质量差异。我们有内部工具能清楚地看到那些差异。当我们设计用户层级时,选择忽视这种可见性将是一种不诚实的行为,假装差距不存在,而我们却有证据表明它确实存在。
免费用户理应知道他们得到了什么。付费用户理应知道他们获得的是有实质性区别的东西。这种差异不仅在于获得更先进的模型,还在于获得由这些模型构建的更强的共识。这是任何单一AI都无法提供的可靠性信号。
我们仍在研究实施细节,所以我想谨慎,不要过度承诺具体内容。但这是方向。
免费套餐翻译将继续使用强大的AI模型。对于大多数日常翻译任务(短消息、日常阅读、基本书信),免费用户将获得准确、可靠的输出。这不会改变。
免费层级之所以存在,是因为我们相信语言不应成为障碍,我们不会收回这一承诺。
差异将主要体现在:
| 内容类型 | 模型质量在此处为何重要 |
|---|---|
| 法律和金融文件 | 条件条款、特定司法管辖区术语、语域一致性 |
| 技术文档 | 领域特定词汇、长文档连贯性 |
| 医疗和临床文本 | 精确性、语域、对歧义的敏感性 |
| 营销和品牌文案 | 习语处理、语调准确性、文化共鸣 |
| 低资源语言对 | 训练数据越少意味着模型质量差距越大 |
| 长篇文档(5,000+字) | 上下文保留、整个文档的一致性 |
对于在这些类别中工作的专业用户而言,模型层级将带来真正的不同。这正是我们付费计划的受众。
而且由于 SMART 的共识是基于那些更高级的模型构建的,付费用户不仅能获得更好的独立输出,还能获得由最新模型协同工作生成的更可靠的 AI 翻译。
我想坦诚地说,这一切尚未完全解决。
我们仍在确定具体的模型分配——哪些模型属于哪个层级,以及我们如何在产品内部向用户清晰地传达这些信息。我们正在研究付费墙逻辑,以确保用户体验无缝衔接,而不是生硬。我们正在仔细思考如何以真正有用而非仅仅是营销说辞的方式向用户呈现模型质量信息。
我们还在思考一个实际问题:我们如何帮助免费用户即时理解,当他们遇到一个升级会显著改善其输出结果的用例时?这是一个用户体验挑战,也是一个产品挑战,我们还没有完整的答案。
一旦上线,我将写一篇关于它如何实现的文章。目前,这是我们的想法。
如果您是付费用户,并且希望就模型质量中对您最重要的事情发表意见,我非常感兴趣。通过 MachineTranslation.com 联系页面留言。
因为我们的内部测试显示,在专业级翻译任务上,不同模型层级之间存在显著的质量差距。我们开发了一个工具,用于同时比较多个AI模型,数据清楚地表明:高级模型在处理复杂、惯用语和领域特定内容方面表现显著更优。级别调整如实反映了这一现实。付费用户更大的好处是,SMART共识是基于更先进的模型构建的,这意味着可靠性信号本身更强。
不会。免费套餐用户将继续获得高质量、准确的翻译,满足日常使用需求。改变是付费用户将升级到更高级的模型,而不是免费用户会被降级。
法律、金融、医疗、技术和长篇文档 — 以及训练数据较少的非通用语言对中的任何内容。对于简短、简单、日常的文本,模型层级之间的差异微乎其微。付费用户更大的好处是,SMART共识是基于更先进的模型构建的,这意味着可靠性信号本身更强。
我们正在开发中。发货后我会发布更新,包括产品中的体验是怎样的,以及早期数据显示了什么。
我们同时运行多个模型,并使用基于共识的评分方法来评估输出。我们的内部比较工具使我们能够在相同的源文本上测试不同模型层级的质量,这正是我们做出此分层决定的依据。你可以了解更多关于MachineTranslation.com.com共识系统如何运作的信息。