July 10, 2026
Duas palavras. Seis modelos. Três decisões de tradução diferentes. Eis o que aconteceu quando executei 8 frases de teste através dos modelos de IA mais recentes disponíveis no MachineTranslation.com, e o que os resultados revelam sobre quando um modelo falha silenciosamente.
Duas palavras. Isso é doente. Seis modelos. Três decisões de tradução distintas.
Em japonês, um modelo o renderizou como それはやばい, preservando a ambiguidade. Outro omitiu inteiramente o pronome sujeito e escreveu a forma nua やばい, a versão mais coloquial possível. Um terceiro escreveu それはすごい, o que resolve a ambiguidade inteiramente a favor de "espantoso", eliminando o duplo significado que tornava a frase interessante em primeiro lugar. Em vietnamita, um modelo escreveu Đỉnh vậy (gíria, correto para registo de juventude). Outro escreveu Thật tuyệt vời, gramaticalmente correto, mas mais próximo de dizer "isso é verdadeiramente maravilhoso" quando alguém te envia um meme.
Todos estes são defensáveis. Nenhum deles é a mesma coisa. E se está a executar traduções através de um único modelo, nunca verá a escolha que foi feita em seu nome.
Essa é a questão central que este artigo está a tentar responder. Não qual modelo de IA é melhor para tradução em 2026 (a resposta depende do par de idiomas, registo, domínio e estrutura da frase), mas sim: como saberia quando o seu modelo cometeu um erro? Especialmente em domínios como terminologia médica, contratos legais ou formalidade profissional, onde a chamada errada parece exatamente uma tradução correta até um especialista a ler.
Eis o que fiz. Executei 8 frases de teste através de duas rondas de modelos no MachineTranslation.com: primeiro uma linha de base de 5 modelos amplamente utilizados, depois um conjunto expandido que adiciona várias das mais recentes variantes de modelo de nível premium agora disponíveis para utilizadores pagos. Normalmente, comparar resultados de modelos como este significaria subscrições pagas separadas com cada fornecedor individualmente. No site MachineTranslation.com, encontram-se na mesma vista de comparação. Os pares de idiomas foram Inglês→Japonês e Inglês→Vietnamita. As categorias de frases foram escolhidas especificamente para testar rigorosamente áreas onde o desacordo entre modelos é mais consequente: expressões idiomáticas, terminologia legal, terminologia médica, contexto sensível à formalidade e ambiguidade semântica deliberada.
Uma nota sobre metodologia de avaliação: a investigação em tradução automática tem-se debatido há muito tempo com a forma de avaliar automaticamente os resultados. Métricas como BLEU e COMET conforme medidas nas tarefas partilhadas da WMT fornecem um sinal agregado útil, mas são fracas na detecção de erros de registo, falhas de idiomaticidade e precisão terminológica, exatamente as categorias que mais importam aqui. O que está prestes a ler é uma análise de resultados, não uma corrida BLEU.

Nem todas as frases revelam um desacordo significativo. Dois dos oito testes, "Let's touch base once the dust settles on this deal" (→ Japonês) e "We're burning the midnight oil to hit this launch date" (→ Vietnamita), produziram um elevado acordo em ambas as rondas. Os idiomas foram corretamente compreendidos como idiomas. Ninguém traduziu "touch base" como tocar uma base física. Ninguém traduziu "the dust settles" como sedimento a cair.
Vale a pena pausar nisto: a linguagem comercial inglesa idiomática é razoavelmente bem tratada pelos modelos de fronteira atuais quando o idioma é suficientemente comum. O consenso para "touch base" manteve-se estável em ambas as rondas; a variação foi puramente estilística, em torno de se usar この件 (este assunto), この取引 (este negócio), ou この案件 (este caso) para a frase de origem.

O teste de "queimar o óleo da meia-noite" é onde as coisas se tornaram mais interessantes. Todos os modelos, exceto um, compreenderam corretamente o idioma. MiniMax M2.7, introduzido na Ronda 2, traduziu "burning" literalmente, produzindo đốt đuốc, significando "tochas em chamas." O consenso excluiu-o corretamente.

O japonês é uma língua com camadas de formalidade. A escolha da terminação verbal, do pronome e da forma do nome referencial não é estilística. Assinala a relação entre o locutor e o destinatário. Enviar uma mensagem ao seu CEO usando formas verbais informais não é um erro de tradução no sentido gramatical. É um erro social, e um significativo.
A frase de teste: Pode enviar isso por favor? Obrigado, aprecio isso." Contexto: mensagem a um CEO.

O consenso mudou quando o conjunto de modelos se expandiu. O mecanismo é direto: adicionar modelos que leem corretamente o contexto de formalidade deslocou a maioria, e o consenso seguiu. Aqui está o espectro completo do que os modelos produziram na Ronda 2:

O teste de registo vietnamita revelou um tipo diferente de erro de formalidade, um que é mais subtil. A frase de origem: Ei, uma pergunta rápida — estás livre para fazer uma chamada? Contexto: mensagem a um cliente. O Qwen na Ronda 1 incluiu "mình," um pronome de primeira pessoa que implica uma amizade casual ao nível de pares. Todos os outros modelos evitaram completamente a auto-referência em primeira pessoa, que é a escolha profissional mais segura. Crucialmente, o Qwen corrigiu isto na Ronda 2 e removeu "mình." O consenso em ambas as rondas excluiu-o.

A sentença de indenização do fornecedor/cliente é uma cláusula padrão em acordos comerciais: "O fornecedor deverá indenizar o cliente contra quaisquer reclamações de terceiros decorrentes do incumprimento deste acordo."
Na Ronda 1, todos os cinco modelos identificaram corretamente o registo legal e usaram os empréstimos ベンダー (fornecedor) e クライアント (cliente), padrão em contratos comerciais japoneses de origem inglesa. Uma exceção: O GPT-4.1-NANO utilizou 販売者 (vendedor) e 顧客 (cliente), palavras japonesas legítimas que carecem da especificidade jurídica formal dos equivalentes de empréstimo linguístico.
A descoberta mais importante surgiu na Ronda 2. A distinção fundamental é entre duas palavras:
Estes são conceitos legalmente diferentes. "Indemnify" especificamente significa proteger uma parte da responsabilidade de terceiros. 免責 é o termo legal correto. Todos os modelos da Ronda 1 utilizaram 補償. Na Ronda 2, o DeepSeek V4-Pro foi o único modelo a produzir 免責, e fez-o apenas na Ronda 2, não na Ronda 1.

Num contrato, 補償 e 免責 não são sinónimos. Um significa "nós reembolsaremos você." O outro significa "você está protegido da reclamação desde o início." Se uma plataforma de tradução utiliza 補償 onde 免責 é correto, um advogado que leia a versão em japonês não verá o mesmo acordo que a versão em inglês descreve.
Esta é a descoberta mais consequente no conjunto de dados. A frase de teste: "Este medicamento está contraindicado em doentes com antecedentes de insuficiência hepática." Fonte: documentação de produto clínico. Destino: Vietnamita.
O termo crítico é "insuficiência hepática." Existem dois candidatos vietnamitas:
Estas são clinicamente distintas. Uma contraindicação baseada em "insuficiência hepática" aplica-se a qualquer pessoa com função hepática reduzida, não apenas àqueles que sofreram falência completa do órgão. Usar suy gan estreita a população indicada incorretamente. Um doente com comprometimento hepático moderado que lê "suy gan" poderá não se reconhecer como a população contraindicada.

Algumas frases de origem são ambíguas por design. "Isso é fixe" na gíria inglesa contemporânea significa algo excelente, mas também mantém o seu significado literal (isto é, repugnante/nojento), e a tensão entre esses dois significados faz parte de como a frase comunica. O desafio para um modelo de tradução é: preservar a ambiguidade, colapsar para o significado mais provável, ou escolher um e comprometer-se?


Os modelos neste teste não são todos equivalentes. Abrangem arquiteturas diferentes, regimes de treinamento e contextos de implementação. A Linha de Base da Ronda 1 inclui modelos que são amplamente acessíveis. O conjunto expandido da Ronda 2 adiciona várias das variantes de modelo de nível premium mais recentes agora disponíveis para utilizadores pagantes no MachineTranslation.com, o mesmo nível de modelo que de outra forma significaria uma conta paga separada com cada fornecedor individual.

O conjunto expandido na Ronda 2 inclui modelos mais avançados e disponíveis para utilizadores pagantes no MachineTranslation.com. O efeito da expansão do conjunto não é uniforme. Em alguns testes (formalidade/Japonês), alterou significativamente o consenso. Em outros (terminologia médica/vietnamita), a divisão aprofundou-se.

Os dados de teste apontam para duas categorias de falha distintas, e requerem respostas diferentes.
Categoria A: Falhas silenciosas. Erros de formalidade, erros de registo, precisão da terminologia médica: estes produzem resultados que parecem corretos. O Japonês é gramaticalmente correto. O vietnamita é fluente. Não há qualquer sinal à superfície de que algo correu mal. Um utilizador monolíngue que lê o resultado de um único modelo não tem forma de saber que o modelo fez uma escolha de registo que um executivo sénior japonês notaria, ou que um termo clínico foi restringido de uma forma que altera a população a que se aplica.
Categoria B: Falhas visíveis. MiniMax traduzindo "burning the midnight oil" como "queimar tochas." GPT-4.1-NANO a resolver "That's sick" para o inequívoco "すごい." Estes são detetáveis, quer por um falante da língua de destino quer por comparação com outros resultados de modelos.
A comparação multi-modelo que o SMART fornece é mais valiosa na Categoria A. Quando cinco ou dez modelos produzem resultados e a maioria concorda num registo formal enquanto um produz japonês em forma simples e casual, o desacordo é visível na vista de comparação. Um utilizador que fala a língua alvo pode avaliar as opções. Um utilizador que não consegue ver que uma decisão contestada foi tomada, e decidir se essa sentença justifica uma revisão humana.
Para trabalhos em escala de documento, ficheiros grandes, tradução preservando o layout de PDFs, contratos ou materiais clínicos, a capacidade de processamento de documentos da plataforma trata a estrutura de ficheiros sem quebrar a formatação. Mas as questões de qualidade levantadas acima aplicam-se independentemente do tamanho do ficheiro. Um estudo clínico de 100 páginas onde cada instância de "hepatic impairment" é traduzida como "liver failure" é uma versão maior do mesmo problema identificado no Teste 2.
Para as categorias médica e legal especificamente, a verificação humana é o mecanismo de controlo correto. O serviço de Pós-Edição de IA da Tomedes, que combina a saída de IA com revisão humana certificada precisamente para este tipo de conteúdo de alto risco, foi construído para isto. A divisão suy gan / suy giảm chức năng gan é exatamente o tipo de descoberta que deveria desencadear essa revisão, não porque todos os modelos estão errados, mas porque os modelos que têm mais confiança não são os mais precisos.
O valor de ver múltiplas saídas não é que você sempre escolherá a maioria. É que você saberá que uma escolha foi feita, o que é diferente de assumir que o resultado à sua frente está correto.

Coloque os oito testes lado a lado e um padrão se mantém: concordância e discordância não são distribuídas aleatoriamente. Linguagem idiomática e quotidiana de negócios ("estabelecer contacto", "trabalhar até tarde da noite") convergiu em quase todos os modelos do conjunto, em ambas as rondas. A formalidade, a precisão jurídica e a terminologia médica não. O teste de formalidade do CEO mudou de casual para formal apenas uma vez quando o grupo expandido foi incluído. A cláusula de indenização revelou uma distinção legal real (免責 vs. 補償) que apenas um modelo, numa ronda, acertou. A divisão da terminologia médica nunca foi realmente resolvida, mantendo-se aproximadamente numa proporção de 6 para 4 em ambas as rondas, independentemente de quais modelos estavam no conjunto.
Este é o achado real, não uma afirmação de marketing: o consenso não melhora todas as frases e não precisa de o fazer. É mais valioso exactamente onde a fluência de um único modelo não lhe dá qualquer razão para duvidar, e onde estar errado realmente custa algo.
Existe uma segunda camada, mais prática, neste teste que vale a pena enunciar claramente. Executar esta comparação por minha conta significava verificar resultados do GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo e MiniMax M2.7 lado a lado com os modelos de base existentes, num único local, numa única plataforma. Fora de MachineTranslation.com, isso não é uma subscrição. São várias, uma para cada fornecedor cujo nível premium pretende testar, pelo que cada fornecedor cobra individualmente. Os utilizadores pagantes aqui obtêm essa mesma comparação num clique, por uma fração do custo de manter cinco subscrições premium separadas, sem abdicar da coisa que realmente importa: ver onde os modelos concordam e saber exatamente quando não concordam.
Nenhum é categoricamente melhor; depende da categoria de teste. Claude Sonnet e Claude Opus escolheram consistentemente o termo médico vietnamita mais preciso, e Claude Opus produziu a gíria mais apropriada para "That's sick." Mas o Claude Sonnet também produziu japonês casual numa frase de contexto formal de CEO, onde o GPT-5.5 acertou. Comparar resultados diretamente é mais defensável do que escolher um modelo e confiar nele.
Não existe um; a precisão depende do domínio. Gemini 3.5-Flash e GLM-5-Turbo produziram o japonês formal mais apropriado neste teste. Ambos os modelos Claude foram mais precisos na terminologia médica vietnamita. O DeepSeek V4-Pro foi o único modelo a utilizar o termo jurídico japonês correto, mas apenas na Ronda 2, e produziu japonês informal noutros locais. Nenhum modelo único dominou em todos os oito testes.
Não, não automaticamente. A expansão do conjunto com variantes de modelo de nível premium mais recentes deslocou o consenso de casual para formal no teste de formalidade japonesa. Mas na prova de terminologia médica vietnamita, a divisão persistiu em aproximadamente 6 para 4, independentemente de quais modelos foram incluídos. Mais modelos revelam mais desacordo, o que é um sinal útil, mas o consenso ainda segue a maioria, e a maioria nem sempre é a resposta mais precisa.
SMART é o sistema de consenso multi-modelo da MachineTranslation.com, abrangendo até 22 modelos de IA de fornecedores incluindo OpenAI, Anthropic, Google e DeepSeek. Executa uma tradução através de múltiplos modelos em simultâneo e apresenta o resultado do consenso maioritário juntamente com a resposta de cada modelo individual, por padrão, sem necessidade de configuração. O consenso muda quando o conjunto de modelos muda, como mostrado no resultado de formalidade japonesa deste teste: um consenso casual na Rodada 1 tornou-se formal na Rodada 2.
Nenhum modelo único; a revisão humana é a melhor resposta. Os modelos Claude escolheram consistentemente o termo médico vietnamita mais preciso, e apenas o DeepSeek V4-Pro utilizou o termo jurídico japonês correto, mas apenas na Ronda 2. A terminologia médica dividida nunca se resolveu em 10 modelos, o que sinaliza que é necessária experiência no domínio, não que um modelo diferente deva ser escolhido. Uma revisão de pós-edição humana certificada, como a que a Tomedes oferece, proporciona essa verificação especializada.