June 5, 2026

Gleiche KI, anderes Modell – und die Übersetzungen könnten nicht unterschiedlicher sein

Ich führe interne Tests zu etwas durch, über das wir in der Übersetzungsbranche nicht genug sprechen : nicht ob verschiedene KI-Systeme unterschiedlich übersetzen, sondern ob verschiedene Versionen derselben KI unterschiedlich übersetzen – und um wie viel.

Letzte Woche habe ich ein einzelnes spanisches Idiom gleichzeitig durch fünf Versionen von ChatGPT auf der internen Testplattform von MachineTranslation.com laufen lassen. Was zurückkam, hat mich umgehauen.

Zwei Versionen lieferten eine Übersetzung, die im Englischen wirklich Unsinn ist.‎ Drei Versionen lieferten korrekte idiomatische Übersetzungen. Und die drei richtigen stimmten nicht miteinander überein.

Alle fünf sind ChatGPT. Alle fünf sind OpenAI. Gleiche KI, anderes Modell — und die Ergebnisse könnten nicht unterschiedlicher sein.

Ich teile das jetzt, weil ich denke, dass es wichtig ist, nicht weil ich saubere Antworten habe. Ich nicht. Aber die Beobachtung ist interessant genug, um sie in die Welt zu setzen. Inhaltsverzeichnis Der

Test:‎

  • Eine spanische Redewendung, fünf GPT-Versionen
  • Warum diese Redewendung ein guter Testfall ist
  • Was die wörtliche zu idiomatische Aufteilung über das Training dieser Modelle aussagt
  • Die Implikation, über die niemand zu sprechen scheint
  • Selbst die korrekten Übersetzungen stimmten nicht überein
  • Was ich noch nicht weiß
  • Zwei Forschungsfragen, über die es sich lohnt nachzudenken

Der Test: Ein spanisches Sprichwort, fünf GPT-Versionen

Der Satz, den ich getestet habe, war llevarse el gato al agua.


Hier ist, was jede Version produziert hat:

Modell                                          Ausgabe                                               Idiomatisch?
ChatGPT::GPT-4o-MINI die Katze ins Wasser tragen ❌ Wörtlich
ChatGPT::GPT-4.1-NANO die Katze ins Wasser tragen ❌ Wörtlich
ChatGPT::GPT-4.1-MINI es erfolgreich schaffen ✅ Korrekt
ChatGPT::GPT-5.4-MINI seinen Willen durchsetzen ✅ Teilweise
ChatGPT::GPT-5.4 als Sieger hervorgehen ✅ Korrekt

Der Satz bedeutet, etwas Schwieriges gegen alle Widerstände zu erreichen, einen harten Sieg zu erringen. Es hat nichts mit Katzen oder Wasser zu tun. Die wörtliche Übersetzung ist keine Übersetzung. Es ist eine Wort-für-Wort-Transkription eines Satzes, den das Modell nicht als Idiom erkennen konnte. GPT-4o-MINI und GPT-4.1-NANO produzierten

identische Ausgaben. Nicht ähnlich, identisch. Unsere Übersetzungs-Insights haben dies direkt markiert: GPT-4.1-nano und GPT-4o-mini teilen identische Übersetzungen und betonen die wörtliche Interpretation gegenüber der idiomatischen Bedeutung.

GPT-4.1-MINI, GPT-5.4-MINI und GPT-5.4 produzierten jeweils etwas erkennbar Korrektes – aber nicht dasselbe.

Warum dieses Idiom ein guter Testfall ist

Ich möchte präzise darlegen, warum llevarse el gato al agua ein nützlicher Test-Input und kein willkürlich ausgewählter ist.

Es ist ein etabliertes Idiom. Es erscheint in der Literatur, im Journalismus und in der Alltagssprache. Es ist nicht obskur. Jedes Modell, das auf einem angemessenen Korpus spanischer Texte trainiert wurde, sollte es angetroffen haben. Die Frage ist nicht, ob das Modell den Satz gesehen hat. Die Frage ist, was es damit macht.

Der schlimmste Fehler bei der idiomatischen Übersetzung ist nicht, eine schlechte Übersetzung zu produzieren. Es produziert eine wörtliche Übersetzung, die für jemanden, der die Zielsprache nicht kennt, akzeptabel aussieht.

To carry the cat to the water ist grammatikalisch korrektes Englisch. Es ist wohlgeformt. Es klingt wie etwas, das etwas bedeuten könnte. Ein Benutzer, der kein Spanisch spricht, könnte es lesen, nicken und weitergehen – ohne zu wissen, dass die ursprüngliche Bedeutung völlig verloren gegangen ist.

Das ist der Fehlerfall, der mir wichtig ist. Nicht der offensichtliche Fehler. Der unsichtbare.

Was uns die Aufspaltung von wörtlich zu idiomatisch darüber verrät, wie diese Modelle trainiert wurden

Das Muster hier ist nicht zufällig. Die beiden Modelle, die wörtliche Übersetzungen erzeugten (GPT-4o-MINI und GPT-4.1-NANO), sind beide kleinere, leichtere Modelle, die auf Geschwindigkeit und Kosteneffizienz optimiert sind. Die drei Modelle, die idiomatische Übersetzungen lieferten (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4), repräsentieren eine andere Generation oder Parametergröße.

Dies deutet auf etwas hin, das meiner Meinung nach untererforscht ist: idiomatische Kompetenz bei der Übersetzung skaliert mit der Modellkapazität auf eine Weise, die in allgemeinen Benchmarks nicht sichtbar ist.

Allgemeine Sprach-Benchmarks testen Schlussfolgerungen, Wissen, Programmieren, Mathematik. Sie testen normalerweise nicht, ob ein Modell erkennen kann, dass „es regnet Katzen und Hunde“ nichts mit Wetterbedingungen zu tun hat, oder dass „llevarse el gato al agua“ nichts damit zu tun hat, eine Katze zu hydrieren. Redewendungen sitzen an der Schnittstelle von kulturellem Wissen, kontextueller Schlussfolgerung und Mustererkennung – und diese Schnittstelle scheint eine Schwelle der Modellkapazität zu erfordern, die kleinere Modelle nicht durchgängig überschreiten. Was ich nicht behaupte: dass größere Modelle immer bessere Übersetzer sind.‎

Ich habe dafür keine Beweise als allgemeine Regel. Was ich beobachte: dass für idiomatischen Inhalt speziell, die Lücke zwischen den Versionen innerhalb der Familie größer war als ich erwartet hatte.

Die Implikation, über die niemand zu sprechen scheint

Die meisten Benutzer, die ein KI-Übersetzungstool verwenden, wissen nicht, welche Version dieser KI sie verwenden. Sie öffnen ein Produkt, wählen ein Sprachpaar aus und erhalten eine Ausgabe. Die Modell-Weiterleitung ist für sie unsichtbar.

Dies ist im großen Maßstab wichtig. MachineTranslation.com hat in einem einzigen 90-Tage-Zeitraum über Hunderttausende von Englisch-Spanisch-Übersetzungsaufträgen bearbeitet. Wenn ein erheblicher Teil dieser Arbeitsplätze idiomatische Inhalte (Marketingtexte, juristische Sprache, literarische Texte, lockere Kommunikation) betraf und das Tool, das diese Arbeitsplätze weiterleitete, Benutzer unwissentlich an ein kleineres Modell weiterleitete, dann erschien „die Katze ins Wasser tragen in echten Ausgaben, in echten Dokumenten, für echte Menschen, die dem Ergebnis vertrauten.

Die Übersetzungsbranche vergleicht seit Jahren KI-Anbieter. DeepL gegen Google. Claude gegen ChatGPT. Diese Vergleiche sind nützlich. Aber innerhalb eines einzelnen Anbieters kann die Versionslücke genauso bedeutsam sein – und es ist eine Lücke, die die meisten Vergleichsrahmen nicht messen, da sie nicht auf Modellebene testen. Wenn jemand sagt: „Ich benutze ChatGPT für Übersetzungen“, ist dieser Satz nicht

spezifisch genug, um aussagekräftig zu sein. Welches ChatGPT? Nano? 4o-mini? ‎4.1-mini? 5.4? Die Antwort verändert die Ausgabe auf nicht triviale Weise, zumindest für idiomatischen Inhalt. Selbst die richtigen Übersetzungen stimmten nicht überein.

Das ist der Teil, den ich am interessantesten finde, und ich habe noch nicht ganz herausgefunden, was ich davon halten soll.

Die drei Modelle, die idiomatische Übersetzungen lieferten, gaben drei verschiedene:

GPT-4.1-MINI: to pull it off successfully GPT-5.4-MINI: to get one's

  • way GPT-5.4: to come out on top
  • Alle drei sind vertretbare
  • englische Wiedergaben

von llevarse el gato al agua.‎ Aber sie sind nicht gleichwertig.

Es durchziehen betont die Ausführung im Angesicht der Schwierigkeit, du hast etwas Schwieriges getan und es hat funktioniert. Seinen Willen durchsetzen betont das Erreichen des gewünschten Ergebnisses, mit weniger Betonung auf die Schwierigkeit. ‎„Als Sieger hervorgehen“ betont den Wettkampfsieg, das Gewinnen im Verhältnis zu anderen.

Die ursprüngliche spanische Redewendung liegt am nächsten an der ersten dieser Bedeutungen. Der Ausdruck impliziert das Überwinden von Widerstand, nicht einfach das Bevorzugen eines Ergebnisses und dessen Eintreten. Aber „seinen Willen durchsetzen“ und „als Sieger hervorgehen“ sind nicht falsch, sie sind nur in unterschiedliche Richtungen ungenau. Dies wirft eine Frage auf, die ich wirklich schwierig finde: Wenn drei Modelle

jeweils eine korrekte, aber unterschiedliche idiomatische Übersetzung liefern, wie beurteilt man dann, welche die beste ist? BLEU-Werte werden mit einer Referenzübersetzung verglichen – aber wer hat die Referenz geschrieben und welche dieser drei hätte sie gewählt?

Unser KI-Übersetzungsagent stellte zu Recht die richtige Frage , bevor er eine Ausgabe erstellte: Was ist die beabsichtigte Bedeutung von 'llevarse el gato al agua' in diesem Zusammenhang?‎ Drei Optionen wurden angeboten – ein schwieriges Ziel zu erreichen, etwas Unnötiges zu tun oder eine riskante Aktivität zu unternehmen. Diese Frage ist nicht dekorativ. Es ist der Mechanismus, durch den die kontextuelle Ambiguität aufgelöst wird, bevor die Übersetzung abgeschlossen ist.

Aber der Punkt bleibt: drei richtige Antworten, drei verschiedene Nuancen der Bedeutung. Übersetzungswerkzeuge sind nicht für diese Art von Nuancen gebaut . Was ich noch nicht weiß

Ich möchte ehrlich sein,

was die Grenzen dessen angeht, was dieser Test zeigt.

Eine Idiomatik, ein Sprachpaar, ein Tag interner Tests. Das ist keine Studie. Es ist eine Beobachtung. Ich weiß nicht, ob dieses Muster (kleinere Modelle, die sich standardmäßig an die wörtliche Bedeutung halten, größere Modelle, die idiomatische Bedeutungen erzielen) durchgängig gilt für:

  • Andere spanische Idiome
  • Andere Sprachpaare mit reichen idiomatischen Traditionen (Arabisch, Japanisch, Russisch fallen mir alle ein)
  • Nicht-idiomatische Inhalte, bei denen die Unterscheidung nicht zutrifft
  • Grenzfälle, bei denen ein kleineres Modell das Idiom richtig versteht und ein größeres es verfehlt

Ich weiß auch nicht, ob dies eine stabile Eigenschaft dieser Modelle ist oder etwas, das sich mit Updates und Fine-Tuning ändert. Modellanbieter veröffentlichen keine übersetzungsspezifischen Changelogs. Eine Modellversion, die llevarse el gato al agua heute korrekt verarbeitet, könnte nächsten Monat aktualisiert werden, und wir hätten keine Möglichkeit, dies zu wissen.

Was ich weiß: Dieser Test hat ein Ergebnis hervorgebracht, das interessant genug ist, dass ich mehr davon, systematischer, über mehr Sprachpaare und Inhaltstypen hinweg durchführen möchte. Wenn ich mehr zu teilen habe, werde ich es tun.

Zwei Forschungsfragen, die es wert sind, darüber nachzudenken

Ich schließe mit den beiden Fragen, die dieser Test bei mir hinterlassen hat. Ich werde sie nicht beantworten, ich habe noch nicht die Daten dafür. Aber ich denke, das sind die richtigen Fragen, die man stellen muss.

Erstens: Bei welchem Parameter-Schwellenwert wird idiomatische Kompetenz zuverlässig? Der Sprung von GPT-4o-MINI

und GPT-4.1-NANO (beide wörtlich) zu GPT-4.1-MINI (idiomatisch) legt nahe, dass es irgendwo im Parameterbereich zwischen diesen Modellgrößen einen Schwellenwert gibt, an dem die Idiomerkennung einsetzt. Ist es konsistent? Gilt dies für Redewendungen in allen Sprachen, oder hängt es davon ab, wie gut eine Sprache in den Trainingsdaten vertreten ist? Ich weiß nicht. Aber zu wissen wäre nützlich für jeden, der Übersetzungsworkflows aufbaut.

Zweitens: Was kostet die Undurchsichtigkeit der Modellversion die Benutzer in großem Maßstab?

Wenn ein Benutzer 1.000 Dokumente pro Monat durch ein Tool leitet, das nicht angibt, welche Modellversion verwendet wird (und einige dieser Dokumente idiomatischen Inhalt enthalten), wie oft tritt das buchstäbliche Scheitern unsichtbar auf? Woher wüssten sie das? Was sind die Kosten, in realen Begriffen, wenn man es nie herausfindet?

Ich denke, das ist eine wichtigere Frage als die meisten der derzeit kursierenden Vergleiche „Welche KI ist die beste für die Übersetzung“.‎ Die Antwort lautet nicht „verwende das größte Modell.“ Die Antwort könnte lauten: wisse, was du verwendest, führe deine eigenen Tests mit deinen eigenen Inhalten durch und gehe nicht davon aus, dass der Name eines Anbieters eine Garantie für konsistentes Verhalten über sein Modell hinweg ist.

Das ist zumindest das, was ich aus diesem Test mitnehme.

Forschungsfragen

1. Vorhersagt die Modellgröße zuverlässig die idiomatische Übersetzungsqualität?

Basierend auf diesem einzigen Test: Kleinere, auf Effizienz optimierte Modelle derselben KI-Familie griffen standardmäßig auf eine wörtliche Übersetzung eines gut etablierten spanischen Idioms zurück, während größere/neuere Versionen desselben Modells korrekte idiomatische Wiedergaben lieferten. Ob dies für Idiomkategorien und Sprachpaare gilt, ist die nächste Frage. Ich werde weitere Tests durchführen.

2. Warum führten drei „korrekte“ idiomatische Übersetzungen zu drei bedeutungsmäßig unterschiedlichen Ergebnissen?

GPT-4.1-MINI, GPT-5.4-MINI und GPT-5.4 übersetzten llevarse el gato al agua idiomatisch – aber in unterschiedliche englische Ausdrücke mit subtil unterschiedlichen Konnotationen. Dies deutet darauf hin, dass die idiomatische Übersetzungsqualität mindestens zwei Dimensionen hat: ob das Modell die Idiomatik überhaupt erkennt und welche äquivalente Ausdrucksweise es aus den verfügbaren Optionen der Zielsprache auswählt. Standardübersetzungsqualitätsmetriken trennen diese beiden Dimensionen nicht sauber. Ich denke, sie sollten.


Dieser Beitrag basiert auf internen Tests auf der Entwicklungsplattform von MachineTranslation.com. Die hier gezeigte Multi-Modell-Versionstests ist noch nicht öffentlich verfügbar. Ich teile die Erkenntnis, weil ich glaube, dass die Beobachtung nützlich ist, unabhängig davon, wo Sie Ihre Übersetzungen durchführen.