July 10, 2026
Zwei Wörter. Sechs Modelle. Drei verschiedene Übersetzungsentscheidungen. Hier ist, was passierte, als ich 8 Testsätze durch die neuesten auf MachineTranslation.com verfügbaren KI-Modelle leitete, und was die Ausgaben tatsächlich darüber enthüllen, wann ein Modell stillschweigend fehlschlägt.
Zwei Wörter. Das ist krank. Sechs Modelle. Drei unterschiedliche Übersetzungsentscheidungen.
Im Japanischen wurde es in einem Modell als それはやばい wiedergegeben, wobei die Mehrdeutigkeit bewahrt blieb. Ein anderer ließ das Subjektpronomen ganz weg und schrieb die Grundform やばい, die umgangssprachlichste Version, die möglich ist. Ein Dritter schrieb それはすごい, was die Mehrdeutigkeit vollständig zugunsten von „erstaunlich" auflöst und die doppelte Bedeutung entfernt, die den Ausdruck ursprünglich interessant machte. Im Vietnamesischen schrieb ein Modell Đỉnh vậy (Slang, korrekt für Jugendregister). Ein anderer schrieb Das ist wirklich wunderbar, grammatikalisch korrekt, aber näher daran, "das ist wirklich wunderbar" zu sagen, wenn jemand dir ein Meme schickt.
All diese sind verteidigbar. Keines von ihnen ist dasselbe. Und wenn Sie Übersetzungen durch ein einzelnes Modell durchführen, werden Sie nie die Entscheidung sehen, die in Ihrem Namen getroffen wurde.
Das ist die zentrale Frage, die dieser Artikel zu beantworten versucht. Nicht welches KI-Modell 2026 am besten für Übersetzungen geeignet ist (die Antwort hängt vom Sprachenpaar, Register, Domäne und Satzstruktur ab), sondern vielmehr: wie würden Sie wissen, wenn Ihr Modell die falsche Entscheidung getroffen hat? Besonders in Bereichen wie medizinische Terminologie, Rechtsverträge oder professionelle Formalität, wo die falsche Entscheidung genau wie eine korrekte Übersetzung aussieht, bis ein Spezialist sie liest.
Hier ist, was ich getan habe. Ich habe 8 Testsätze durch zwei Runden von Modellen auf MachineTranslation.com geleitet: zunächst eine Baseline von 5 weit verbreiteten Modellen, dann einen erweiterten Pool, der mehrere der neuesten Premium-Tier-Modellvarianten hinzufügt, die jetzt für zahlende Benutzer verfügbar sind. Normalerweise würde der Vergleich von Ausgaben von Modellen wie diesem separate kostenpflichtige Abonnements bei jedem Anbieter einzeln bedeuten. Auf MachineTranslation.com sitzen sie in der gleichen Vergleichsansicht. Die Sprachpaare waren Englisch→Japanisch und Englisch→Vietnamesisch. Die Satzkategorien wurden speziell ausgewählt, um Bereiche zu testen, in denen Modellabweichungen am folgenreichsten sind: idiomatische Ausdrücke, juristische Terminologie, medizinische Terminologie, formalitätssensitiver Kontext und absichtliche semantische Mehrdeutigkeit.
Eine Anmerkung zur Evaluierungsmethodik: Die Maschinenübersetzungsforschung hat sich lange damit auseinandergesetzt, wie Ausgaben automatisch bewertet werden können. Metriken wie BLEU und COMET , wie sie in WMT-Shared-Tasks gemessen werden, liefern nützliche Gesamtsignale, sind aber schlecht darin, Register-Fehler, Idiom-Ausfälle und terminologische Präzision zu erkennen – genau die Kategorien, die hier am meisten zählen. Das, was Sie gleich lesen werden, ist eine Ausgabeanalyse, keine BLEU-Rennstrecke.

Nicht jeden Satz prägt ein aussagekräftiger Dissens. Zwei der acht Tests, „Let's touch base once the dust settles on this deal" (→ Japanisch) und „We're burning the midnight oil to hit this launch date" (→ Vietnamesisch), zeigten in beiden Runden eine hohe Übereinstimmung. Die Redewendungen wurden korrekt als Redewendungen verstanden. Niemand hat "touch base" als das Berühren einer physischen Base übersetzt. Niemand hat "the dust settles" als Sediment, das fällt, übersetzt.
Dies ist es wert, innezuhalten: Idiomatische englische Geschäftssprache wird von aktuellen Frontier-Modellen angemessen behandelt, wenn die Redewendung häufig genug ist. Der Konsens für "touch base" blieb über beide Runden hinweg stabil; die Variation war rein stilistisch, darum, ob man この件 (this matter), この取引 (this deal) oder この案件 (this case) für den Ausgangstext verwenden sollte.

Der Test „bis Mitternacht arbeiten" ist der Punkt, an dem die Dinge interessanter wurden. Alle Modelle außer einem haben die Redewendung richtig verstanden. MiniMax M2.7, in Runde 2 eingeführt, übersetzte "burning" wörtlich und produzierte đốt đuốc, was "brennende Fackeln" bedeutet. Der Konsens schloss es zu Recht aus.

Das Japanische ist eine Sprache mit Formalitätsebenen. Die Wahl der Verbendung, des Pronomens und der referenziellen Nominalform ist nicht stilistisch. Es signalisiert die Beziehung zwischen Sprecher und Empfänger. Eine Nachricht an Ihren CEO mit informellen Verbformen zu senden ist im grammatikalischen Sinne kein Übersetzungsfehler. Es ist ein sozialer Fehler, und ein erheblicher.
Der Testsatz: Kannst du das rüberschicken? Danke, ich schätze das. Kontext: Nachricht an einen CEO.

Der Konsens verschob sich, als sich der Modellpool erweiterte. Der Mechanismus ist unkompliziert: Das Hinzufügen von Modellen, die den Formalitätskontext korrekt erfassten, verschob die Mehrheit, und der Konsens folgte. Hier ist das vollständige Spektrum dessen, was die Modelle in Runde 2 produzierten:

Der vietnamesische Registertest brachte eine andere Art von Formalitätsfehler ans Licht, einen, der subtiler ist. - Source language: English - Target language: German - Text: "The source sentence:" (but no actual sentence follows) „Hey, kurze Frage — hast du Zeit für einen Anruf?" Kontext: Nachricht an einen Kunden. Qwen in Round 1 enthielt "mình," ein Personalpronomen der ersten Person, das eine ungezwungene Freundschaft auf Augenhöhe impliziert. Alle anderen Modelle vermieden vollständig Selbstreferenzen in der ersten Person, was die sicherere professionelle Wahl ist. Entscheidend ist, dass Qwen dies in Runde 2 korrigierte und "mình" fallen ließ. Der Konsens in beiden Runden schloss es aus.

Der Haftungsfreistellungssatz zwischen Anbieter und Kunde ist eine Standardklausel in Handelsvereinbarungen: "Der Anbieter wird den Kunden gegen alle Ansprüche Dritter schadlos halten, die sich aus einem Verstoß gegen diese Vereinbarung ergeben."
In Runde 1 identifizierten alle fünf Modelle korrekt das juristische Register und verwendeten die Lehnwörter ベンダー (Anbieter) und クライアント (Kunde), die in japanischen Geschäftsverträgen englischen Ursprungs Standard sind. Eine Ausnahme: GPT-4.1-NANO verwendete 販売者 (Verkäufer) und 顧客 (Kunde), legitime japanische Wörter, denen die formale rechtliche Spezifität der Lehnwortäquivalente fehlt.
Der wichtigere Befund ergab sich in Runde 2. Der Schlüsselunterschied liegt zwischen zwei Wörtern:
Dies sind rechtlich unterschiedliche Konzepte. „Indemnify" bedeutet speziell, eine Partei vor Haftung gegenüber Dritten zu schützen. Schadloshaltung ist der korrekte juristische Begriff. Alle Round-1-Modelle verwendeten 補償. In Runde 2 war DeepSeek V4-Pro das einzige Modell, das 免責 produzierte, und es tat dies nur in Runde 2, nicht in Runde 1.

In einem Vertrag sind 補償 und 免責 keine Synonyme. Eins bedeutet "wir erstatten dir das Geld zurück." Das andere bedeutet „Sie sind von vornherein vor dem Anspruch geschützt." Wenn eine Übersetzungsplattform 補償 verwendet, wo 免責 korrekt ist, wird ein Anwalt, der die japanische Version liest, nicht die gleiche Vereinbarung sehen, die die englische Version beschreibt.
Dies ist der wichtigste Befund im Datensatz. Der Testsatz: "Dieses Medikament ist kontraindiziert bei Patienten mit einer Vorgeschichte von Leberfunktionsstörungen." Quelle: Klinische Produktdokumentation. Ziel: Vietnamese.
Die kritische Bezeichnung ist "Leberfunktionsstörung." Es gibt zwei vietnamesische Kandidaten:
Dies sind klinisch unterschiedlich. Eine Gegenanzeigenwarnung basierend auf "Leberfunktionsstörung" gilt für jeden mit eingeschränkter Leberfunktion, nicht nur für diejenigen, die ein komplettes Organversagen erlebt haben. Die Verwendung von suy gan verengt die angegebene Bevölkerung falsch. Ein Patient mit mäßiger Leberfunktionsstörung, der "suy gan" liest, könnte sich möglicherweise nicht als kontraindizierte Population erkennen.

Einige Quellsätze sind absichtlich mehrdeutig. „Das ist krank" im zeitgenössischen englischen Slang bedeutet etwas Ausgezeichnetes, trägt aber auch noch seine wörtliche Bedeutung (das heißt ekelhaft/abstoßend) mit sich, und die Spannung zwischen diesen beiden Bedeutungen ist Teil dessen, wie der Ausdruck kommuniziert. Die Herausforderung für ein Übersetzungsmodell ist: Bewahren Sie die Mehrdeutigkeit, reduzieren Sie sie auf die wahrscheinlichste Bedeutung, oder wählen Sie eine und verpflichten Sie sich dazu?


Die Modelle in diesem Test sind nicht alle gleichwertig. Sie umfassen verschiedene Architekturen, Trainingsregime und Bereitstellungskontexte. Die Baseline der Runde 1 umfasst Modelle, die weit verbreitet zugänglich sind. Der erweiterte Round-2-Pool fügt mehrere der neuesten Premium-Tier-Modellvarianten hinzu, die jetzt für zahlende Benutzer auf MachineTranslation.com verfügbar sind, die gleiche Modellstufe, die sonst ein separates bezahltes Konto bei jedem einzelnen Anbieter bedeuten würde.

Der erweiterte Pool in Round 2 umfasst Modelle, die fortschrittlicher sind und für zahlende Benutzer auf MachineTranslation.com verfügbar sind. Die Auswirkung der Poolerweiterung ist nicht einheitlich. Bei einigen Tests (Formalität/Japanisch) verschob es den Konsens erheblich. Bei anderen (medizinische Terminologie/Vietnamesisch) vertiefte sich die Spaltung.

Die Testdaten weisen auf zwei unterschiedliche Fehlerkategorien hin, und sie erfordern unterschiedliche Reaktionen.
Kategorie A: Stille Fehler. Formalitätsfehler, Registerfehler, Präzision der medizinischen Terminologie: Diese erzeugen Ausgaben, die korrekt aussehen. Das Japanische ist grammatikalisch korrekt. Der Vietnamese ist fließend. Es gibt kein äußeres Zeichen dafür, dass etwas schiefgelaufen ist. Ein einsprachiger Benutzer, der die Ausgabe eines einzelnen Modells liest, hat keine Möglichkeit zu wissen, dass das Modell eine Registerwahl getroffen hat, die ein hochrangiger japanischer Führungskraft bemerken würde, oder dass ein klinischer Begriff auf eine Weise eingegrenzt wurde, die die Population verändert, auf die er sich bezieht.
Kategorie B: Sichtbare Fehler. MiniMax übersetzt "burning the midnight oil" als "burning torches." GPT-4.1-NANO löst "That's sick" zur eindeutigen Bedeutung "すごい" auf. Diese sind erkennbar, entweder durch einen Sprecher der Zielsprache oder durch den Vergleich mit anderen Modellausgaben.
Der Multi-Modell-Vergleich, den SMART bietet, ist am wertvollsten in Kategorie A. Wenn fünf oder zehn Modelle Ausgaben erzeugen und die meisten sich auf ein formales Register einigen, während eines beiläufiges einfaches Japanisch erzeugt, ist die Uneinigkeit in der Vergleichsansicht sichtbar. Ein Benutzer, der die Zielsprache spricht, kann die Optionen bewerten. Ein Benutzer, der nicht sehen kann, dass eine umstrittene Entscheidung getroffen wurde, kann entscheiden, ob dieser Satz eine menschliche Überprüfung rechtfertigt.
Für dokumentenweite Arbeiten, große Dateien, layouterhaltende Übersetzung von PDFs, Verträgen oder klinischen Materialien, verarbeitet die Dokumentverarbeitungsfunktion der Plattform die Dateistruktur, ohne die Formatierung zu unterbrechen. Aber die oben aufgeworfenen Qualitätsfragen gelten unabhängig von der Dateigröße. Eine 100-seitige klinische Studie, in der jede Instanz von "Leberfunktionsstörung" als "Leberversagen" übersetzt wird, ist eine größere Version desselben Problems, das in Test 2 identifiziert wurde.
Für die medizinischen und rechtlichen Kategorien speziell ist die menschliche Überprüfung die richtige Sicherheitsmaßnahme. Der AI Post-Editing Service von Tomedes, der AI-Output mit zertifizierter menschlicher Überprüfung für genau diese Art von hochriskanten Inhalten verbindet, ist dafür konzipiert. Die Suy gan / Suy giảm chức năng gan Aufteilung ist genau die Art von Befund, der diese Überprüfung auslösen sollte, nicht weil alle Modelle falsch sind, sondern weil die Modelle, die am sichersten sind, nicht die genauesten sind.
Der Wert, mehrere Ausgaben zu sehen, besteht nicht darin, dass Sie immer die Mehrheit wählen. Es ist so, dass du wissen wirst, dass eine Wahl getroffen wurde, was sich davon unterscheidet, anzunehmen, dass die Ausgabe vor dir korrekt ist.

Stelle die acht Tests nebeneinander und ein Muster hält stand: Zustimmung und Ablehnung sind nicht zufällig verteilt. Idiomatische, alltägliche Geschäftssprache („Kontakt halten", „bis spät in die Nacht arbeiten") war in beiden Runden bei fast jedem Modell im Pool konsistent. Formalität, rechtliche Präzision und medizinische Terminologie nicht. Der CEO-Formalitätstest wechselte von informell zu formell nur, nachdem der erweiterte Pool einbezogen wurde. Die Entschädigungsklausel enthüllte eine echte rechtliche Unterscheidung (免責 vs. 補償), die nur ein Modell in einer Runde richtig erfasste. Die Aufteilung der medizinischen Terminologie wurde überhaupt nicht gelöst und blieb in beiden Runden unabhängig davon, welche Modelle im Pool waren, bei ungefähr 6 zu 4 stehen.
Das ist die tatsächliche Erkenntnis, keine Marketingaussage: Konsens macht nicht jeden Satz besser, und das muss auch nicht sein. Es ist am wertvollsten genau dort, wo die Flüssigkeit eines einzelnen Modells dir keinen Grund zum Zweifeln gibt, und wo Irrtum tatsächlich etwas kostet.
Es gibt eine zweite, praktischere Ebene dieses Tests, die es sich lohnt, klar auszusprechen. Um diesen Vergleich selbst durchzuführen, musste ich Ausgaben von GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo und MiniMax M2.7 nebeneinander mit den vorhandenen Baseline-Modellen vergleichen, an einem Ort, auf einer Plattform. Außerhalb von MachineTranslation.com ist das kein Abonnement. Es sind mehrere, eine für jeden Anbieter, dessen Premium-Stufe Sie testen möchten, zu den Gebühren, die jeder Anbieter einzeln erhebt. Zahlende Benutzer erhalten hier denselben Vergleich mit einem Klick, für einen Bruchteil der Kosten für die Verwaltung von fünf separaten Premium-Abos, ohne auf das zu verzichten, was wirklich zählt: zu sehen, wo die Modelle übereinstimmen, und genau zu wissen, wann sie es nicht tun.
Keines ist kategorisch besser; es hängt von der Testkategorie ab. Claude Sonnet und Claude Opus wählten konsequent den präziseren vietnamesischen medizinischen Begriff, und Claude Opus produzierte den passendsten Slang für „That's sick." Aber Claude Sonnet produzierte auch beiläufiges Japanisch in einem formalen CEO-Kontextsatz, wo GPT-5.5 es richtig machte. Direkten Vergleich von Ausgaben ist verteidigbarer als die Auswahl eines Modells und dessen Vertrauen.
Es gibt keines; die Genauigkeit ist domänenabhängig. Gemini 3.5-Flash und GLM-5-Turbo erzeugten in diesem Test das angemessenste formale Japanisch. Beide Claude-Modelle waren am präzisesten bei vietnamesischer medizinischer Terminologie. DeepSeek V4-Pro war das einzige Modell, das den korrekten japanischen Rechtsbegriff verwendete, aber nur in Runde 2, und es produzierte an anderer Stelle umgangssprachliches Japanisch. Kein einzelnes Modell dominierte über alle acht Tests hinweg.
Nein, nicht automatisch. Die Erweiterung des Pools mit neueren Premium-Modellvarianten verschob den Konsens im japanischen Formalitätstest von informell zu formell. Aber beim vietnamesischen medizinischen Terminologietest blieb die Aufteilung unabhängig davon, welche Modelle einbezogen wurden, bei ungefähr 6 zu 4 bestehen. Mehr Modelle bringen mehr Uneinigkeit zutage, was ein nützliches Signal ist, aber der Konsens folgt immer noch der Mehrheit, und die Mehrheit ist nicht immer die präziseste Antwort.
SMART ist das Multi-Modell-Konsens-System von MachineTranslation.com, das bis zu 22 KI-Modelle von Anbietern wie OpenAI, Anthropic, Google und DeepSeek umfasst. Es führt eine Übersetzung gleichzeitig durch mehrere Modelle durch und zeigt die Mehrheits-Konsens-Ausgabe zusammen mit der Antwort jedes einzelnen Modells an, standardmäßig ohne Konfiguration erforderlich. Der Konsens verschiebt sich, wenn sich der Modellpool verschiebt, wie in diesem Test mit dem japanischen Formalitätsergebnis gezeigt wird: Ein lockerer Konsens in Runde 1 wurde in Runde 2 formell.
Kein einzelnes Modell; eine menschliche Überprüfung ist die bessere Antwort. Claude-Modelle wählten konsequent den präziseren vietnamesischen medizinischen Fachbegriff, und nur DeepSeek V4-Pro verwendete den korrekten japanischen Rechtsbegriff, aber nur in Runde 2. Die medizinische Terminologie-Aufteilung wurde über 10 Modelle hinweg nie gelöst, was signalisiert, dass Fachwissen erforderlich ist, nicht dass ein anderes Modell ausgewählt werden sollte. Eine zertifizierte menschliche Nachbearbeitung und Überprüfung, wie Tomedes sie anbietet, bietet diese spezialisierte Kontrolle.