May 8, 2026
Als dieser Artikel erstmals im April 2025 veröffentlicht wurde, verglich er drei aktive OpenAI-Modelle. Innerhalb weniger Monate wurden zwei von ihnen in den Ruhestand versetzt. GPT-4.5 wurde am 14. Juli 2025 für die API als veraltet eingestuft und im August 2025 aus ChatGPT entfernt. GPT-4o folgte: wurde mit dem Start von GPT-5 am 7. August 2025 für die meisten ChatGPT-Tarife eingestellt. OpenAI hat seitdem GPT-5, GPT-5.2 (Januar 2026) und GPT-5.5 (April 2026) veröffentlicht.
Dieser Artikel wurde aktualisiert, um die aktuelle Modelllandschaft von OpenAI widerzuspiegeln, zu erklären, was jedes GPT-4-Modell tatsächlich für die Übersetzung bot, zu dokumentieren, was jetzt verfügbar ist, und zu erläutern, was der Wechsel zu GPT-5 in der Praxis für die Übersetzungsarbeit bedeutet.
Drei verschiedene OpenAI-Modelle definierten die GPT-4-Ära für die Übersetzung:
GPT-4o wurde im Mai 2024 als multimodales Modell eingeführt, das Text-, Sprach- und Bildeingaben verarbeitet. Es war während des größten Teils des Jahres 2024 das Vorzeigemodell von OpenAI, wobei es in den internen Übersetzungs-Benchmarks von MachineTranslation.com 94,2/100 Punkte erzielte – einer der höchsten Werte aller gemessenen Einzelmodelle. Für ressourcenreiche europäische und ostasiatische Sprachpaare erzeugte GPT-4o eine kontextuell starke, natürlich klingende Ausgabe. Seine Einschränkung speziell für die Übersetzung war die gleiche wie bei jedem Einzelmodell-Tool: Es lieferte eine einzige Ausgabe ohne Qualitätssignal, ohne Gegenprüfung und ohne eine Möglichkeit für den Benutzer, die Zuverlässigkeit des Ergebnisses zu beurteilen.

GPT-4.5 wurde im Februar 2025 als großes Forschungs-Vorschaumodell gestartet, und OpenAI beschrieb es damals als sein „bislang größtes“ Modell in Bezug auf die Rechenleistung. Es wurde hauptsächlich mit unüberwachtem Lernen trainiert, was die Mustererkennung und die kreative Kohärenz verbesserte. Für die Übersetzung erzeugte GPT-4.5 eine Ausgabe mit starken kreativen und tonalen Qualitäten. Seine praktische Einschränkung waren die Kosten: Mit 75 $ pro Million Eingabe-Token zum Start war es 30× teurer als GPT-4o. OpenAI selbst kam zu dem Schluss, dass GPT-4.1 bei weitaus geringeren Kosten eine ähnliche oder verbesserte Leistung bot, was die Entscheidung zur Einstellung beschleunigte.
GPT-4.1 wurde im April 2025 eingeführt und als kosteneffizientes Upgrade gegenüber GPT-4o positioniert, mit erheblichen Verbesserungen bei der Befolgung von Anweisungen, beim Programmieren und dem Verständnis langer Kontexte. Im Bereich der Übersetzung bestand die wesentliche Verbesserung von GPT-4.1 gegenüber GPT-4o in der Anweisungskonformität: Es befolgt explizite Übersetzungsanforderungen (Terminologievorgaben, Registervorgaben, Formatierungsregeln) bei langen Dokumenten zuverlässiger. In Intento's State of Translation Automation 2025 führte GPT-4.1 unter den Single-Agent-Lösungen mit Spitzenleistungen in 7 von 11 Sprachpaaren – die stärkste Leistung eines Einzelmodells in der Evaluierung. GPT-4.1 bleibt Stand Mai 2026 in aktiver API-Nutzung.
GPT-4.5-Zeitleiste:
GPT-4.5 hatte die kürzeste aktive Lebensdauer aller kommerziellen OpenAI-Modelle, etwa vier Monate in der API. Als Hauptgrund nannte OpenAI die gleichwertige Leistung von GPT-4.1 bei deutlich geringeren Kosten und Latenz.
GPT-4o-Zeitleiste:
Für die meisten Nutzer ist GPT-4o heute nicht mehr das Modell, das sie bei der Verwendung von ChatGPT oder der Standard-API von OpenAI erhalten. Es handelt sich faktisch um ein Legacy-Modell.
Was dies für Inhalte bedeutet, die auf diese Modelle verweisen: Jeder Artikel, Workflow oder jede Evaluation, die auf GPT-4.5 aufbaut, muss aktualisiert werden. GPT-4o-Benchmarks aus dem Jahr 2024 bleiben als historische Referenzpunkte nützlich, sollten aber nicht als aktuelle Leistungsvergleiche behandelt werden. GPT-4.1 bleibt die relevante Referenz der GPT-4-Familie für die aktuelle API-Arbeit.
Stand Mai 2026 ist GPT-4.1 das einzige Modell der GPT-4-Familie mit aktivem, gepflegtem API-Support. Wichtige übersetzungsrelevante Merkmale:
Benchmark-Position. In der Intento-Evaluation 2025 führte GPT-4.1 unter den Single-Agent-Lösungen — 7 beste Leistungen in 11 Sprachpaaren. Es erscheint in der Kategorie „Beste“ für Englisch nach Arabisch, Englisch nach Spanisch, Englisch nach Französisch, Englisch nach Italienisch, Englisch nach Koreanisch, Englisch nach Niederländisch, Englisch nach Portugiesisch, Englisch nach Ukrainisch und Englisch nach Chinesisch (automatisierte Bewertung). Bei der menschlichen LQA-Bewertung führt es unter den OpenAI-Modellen für Arabisch, Französisch, Italienisch, Japanisch, Koreanisch, Niederländisch, Portugiesisch, Ukrainisch und Chinesisch.
Anweisungsbefolgung. GPT-4.1s messbare Verbesserung gegenüber GPT-4o ist die Anweisungsbefolgung. Bei Übersetzungsaufgaben mit expliziten Anforderungen (nur diese Begriffe verwenden, diesen Stil beibehalten, diese Formatierung beibehalten) befolgt GPT-4.1 sie über lange Dokumente hinweg konsistenter.
Kontextfenster. GPT-4.1 unterstützt ein Kontextfenster von 1 Million Tokens, wodurch sehr lange Dokumente in einem einzigen Durchgang ohne Segmentierung verarbeitet werden können. In Fragmenten verarbeitete Dokumente zeigen eine um 28 % höhere Rate an terminologischer Inkonsistenz im Vergleich zur Verarbeitung ganzer Dokumente. Quelle: Interne Daten von MachineTranslation.com.
API-Kosten. GPT-4.1 ist deutlich günstiger als GPT-4.5 es war: $2/million input tokens and $8/Million Ausgabetoken, was es für Übersetzungs-Workflows mit hohem Volumen praktisch macht.
GPT-5 wurde am 7. August 2025 als ein einheitliches System eingeführt, das schnelle Reaktionen und tiefgreifende Schlussfolgerungen in einem einzigen Modell kombiniert und je nach Komplexität der Anfrage automatisch zwischen ihnen wechselt. Für die Übersetzung sind die praktisch relevantesten Änderungen:
Erheblich reduzierte Halluzinationsrate, Daten von OpenAI zeigen, dass die Antworten von GPT-5 ungefähr 45 % seltener sachliche Fehler enthalten als die von GPT-4o (mit Websuche, bei anonymisierten Prompts). Für die Übersetzung bedeutet dies weniger semantische Fehler in Inhalten mit Eigennamen, Fachterminologie und benannten Entitäten.
Erweitertes Kontextfenster, 400K Token über die API, mit einem Kontextfenster von über 1 Mio. Token in der Entwicklung. Dies übertrifft das bereits große Fenster von GPT-4.1, was die Notwendigkeit, lange Dokumente in Teile zu zerlegen, weiter reduziert.
Verbesserte mehrsprachige Benchmarks, GPT-5 wurde in 15 Sprachen auf MMLU getestet und übertraf dabei GPT-4o in allen. In übersetzungsspezifischen Workflows berichten Unternehmen von einem besseren Umgang mit Mehrdeutigkeit in klinischen und technischen Kontexten.
GPT-5.2 (Januar 2026) hob in seinen Versionshinweisen speziell die Übersetzungsverbesserungen hervor: „deutliche Verbesserungen in der technischen Redaktion und Übersetzung.“ GPT-5.2 Instant wird als ein Modell beschrieben, das für alltägliche Wissensarbeitsaufgaben, einschließlich Übersetzungen, konzipiert ist.
GPT-5.5 (April 2026) ist zum Zeitpunkt dieses Updates das aktuell führende Modell von OpenAI.
Speziell für die Übersetzung ist die wichtigste Implikation der GPT-5-Ära nicht, welche Version man wählen sollte — sondern dass jede Ausgabe eines einzelnen Modells, unabhängig davon, wie leistungsfähig das Modell ist, immer noch Fehler produziert, die es in seiner eigenen Ausgabe nicht erkennen kann. GPT-5 reduziert die Halluzinationsrate erheblich. Es beseitigt keine modellspezifischen Fehler.
ChatGPT (das Modell von OpenAI) ist eines von 22 KI-Modellen im SMART-System von MachineTranslation.com. SMART führt alle 22 Modelle gleichzeitig aus und gibt die Ausgabe zurück, der die Mehrheit zustimmt.
Was der Übergang von GPT-4 zu GPT-5 für SMART-Benutzer bedeutet: Der Modellbeitrag von OpenAI zum Konsens verbessert sich weiter, da OpenAI stärkere Modelle veröffentlicht. Benutzer müssen die GPT-Generationen weder verfolgen noch manuell auswählen, da das SMART-System das aktuelle OpenAI-Modell automatisch als Teil des Konsens aus 22 Modellen einbezieht.
In den internen Benchmarks von MachineTranslation.com werden einzelne Spitzenmodelle (einschließlich GPT-4o mit 94,2/100) durchweg von der Konsensausgabe übertroffen, die 98,5/100 erreicht. Der Abstand zwischen jedem einzelnen Modell und dem Konsens spiegelt wider, dass modellspezifische Fehler überstimmt werden, bevor sie die Ausgabe erreichen. Diese Lücke besteht unabhängig von der GPT-Generierung. Quelle: Interne Benchmarks von MachineTranslation.com und allgemeine Ergebnisse der WMT24 zur maschinellen Übersetzung.

Benutzer, die von der Übersetzung mit einer einzigen Engine auf SMART umgestiegen sind, verbrachten 27 % weniger Zeit mit der Überprüfung und Korrektur der Ergebnisse. Quelle: Interne Daten von MachineTranslation.com.
Bei Inhalten mit hohem Stellenwert (juristische Dokumente, behördliche Einreichungen, klinische Unterlagen) eskaliert die menschliche Überprüfung den SMART-Konsens an einen zertifizierten, professionellen Prüfer innerhalb derselben Plattform, mit einer 100%igen Genauigkeitsgarantie. Keine externe Agentur erforderlich.
Übersetzen Sie mit ChatGPT und 21 anderen KI-Modellen auf MachineTranslation.com – kostenlos, keine Anmeldung erforderlich.
GPT-4.5 wurde am 14. Juli 2025 für die OpenAI-API als veraltet markiert und aus den meisten ChatGPT-Tarifen entfernt, als GPT-5 am 7. August 2025 veröffentlicht wurde. Pro-Benutzer können weiterhin unter „Legacy Models“ darauf zugreifen. Für die meisten Entwickler und Benutzer ist GPT-4.5 nicht mehr das aktive Modell.
GPT-4o wurde mit der Einführung von GPT-5 im August 2025 für die meisten ChatGPT-Stufen eingestellt. Einige API-Versionen blieben bis Anfang 2026 verfügbar, werden aber durch GPT-5.1 ersetzt. Für aktuelle Übersetzungsarbeiten sind GPT-4.1 und GPT-5 die relevanten OpenAI-Modelle.
Innerhalb der GPT-4-Familie führte GPT-4.1 die Evaluierung von Intento aus dem Jahr 2025 mit den meisten „besten“ Leistungen bei 11 Sprachpaaren an. GPT-5 und GPT-5.2 sind die aktuellen Flaggschiff-Modelle mit verbesserten mehrsprachigen Fähigkeiten und geringeren Halluzinationsraten. Für professionelle Übersetzungsworkflows ist die Wahl des OpenAI-Modells weniger entscheidend als die Frage, ob man ein einzelnes Modell oder ein Konsenssystem verwendet.
Der primäre dokumentierte Vorteil von GPT-4.1 ist die Befolgung von Anweisungen. Es hält sich bei langen Dokumenten zuverlässiger an explizite Übersetzungsanforderungen (terminologische Einschränkungen, Registervorgaben, Formatierungsregeln). Es hat auch ein 1M-Token-Kontextfenster und niedrigere API-Kosten als GPT-4o.
GPT-5 reduziert sachliche Fehler um ungefähr 45 % im Vergleich zu GPT-4o (mit Websuche, laut OpenAIs eigener Bewertung). Es hat ein größeres Kontextfenster (400.000 Tokens über die API), eine verbesserte mehrsprachige Abdeckung und ein vereinheitlichtes Reasoning. Bei der klinischen und technischen Übersetzung berichten Unternehmen von einem besseren Umgang mit mehrdeutiger Terminologie.
ChatGPT (die Modelle von OpenAI) gehört zu den stärksten einzelnen Modellen für Übersetzungen, wobei GPT-4.1 die Single-Agent-Evaluation 2025 von Intento anführt. Aber jedes einzelne Modell, einschließlich dem von OpenAI, produziert Fehler, die es in seiner eigenen Ausgabe nicht erkennen kann. SMART von MachineTranslation.com führt ChatGPT zusammen mit 21 anderen Modellen aus und gibt die Ausgabe zurück, auf die sich die Mehrheit einigt, und erreicht dabei 98,5/100 gegenüber 94,2/100 für das beste einzelne OpenAI-Modell.
Das SMART-System von MachineTranslation.com umfasst ChatGPT als eines von 22 Modellen. Die Plattform integriert die aktuelle OpenAI-Modellversion – Nutzer profitieren als Teil des 22-Modelle-Konsenses automatisch von den Verbesserungen jeder Generation, ohne nachverfolgen zu müssen, welche GPT-Version aktuell ist.