May 8, 2026
この記事が2025年4月に最初に公開されたとき、3つのアクティブなOpenAIモデルを比較していました。数ヶ月のうちに、そのうちの2人が引退した。GPT-4.5は2025年7月14日にAPIから非推奨となり、2025年8月にChatGPTから削除されました。続いてGPT-4oも、2025年8月7日のGPT-5のローンチをもって、ChatGPTのほとんどのティアから引退しました。OpenAIはその後、GPT-5、GPT-5.2(2026年1月)、GPT-5.5(2026年4月)をリリースしました。
この記事は、現在のOpenAIモデルの状況を反映し、各GPT-4モデルが翻訳に実際に何を提供したかを説明し、現在利用可能なものを記録し、GPT-5への移行が翻訳作業に実際に何を意味するのかを説明するために更新されました。
3つの異なるOpenAIモデルが、翻訳におけるGPT-4の時代を定義しました:
GPT-4oは、テキスト、音声、画像の入力を処理するマルチモーダルモデルとして2024年5月にリリースされました。2024年の大半を通じてOpenAIの主力モデルであり、MachineTranslation.comの社内翻訳ベンチマークにおいて100点満点中94.2点を記録しました。これは、測定された個々のモデルの中で最高レベルのスコアの一つです。リソースが豊富なヨーロッパおよび東アジアの言語ペアでは、GPT-4oは文脈に強く、自然な響きの出力を生成しました。特に翻訳におけるその限界は、あらゆる単一モデルツールと同じでした。つまり、品質シグナルもクロスチェックもなく、ユーザーが結果の信頼性を評価する手段もない、単一の出力を提供するだけという点です。

GPT-4.5は2025年2月に大規模な研究プレビューモデルとして発表され、OpenAIは、当時の計算量において同社「史上最大」のモデルであると説明しました。主に教師なし学習を用いてトレーニングされたことで、パターン認識と創造的な一貫性が向上しました。翻訳において、GPT-4.5は創造性やトーンの面で質の高い出力を生成しました。実用上の制約はコストでした。ローンチ時には100万入力トークンあたり75ドルで、GPT-4oの30倍も高価だったのです。OpenAI自身が、GPT-4.1がはるかに低いコストで同等またはそれ以上の性能を提供すると結論付け、それが非推奨化の決定を加速させました。
GPT-4.1は2025年4月に発表され、指示追従、コーディング、長文脈理解において大きな進歩を遂げた、GPT-4oに対する費用対効果の高いアップグレードとして位置づけられました。翻訳において、GPT-4.1のGPT-4oに対する主な改善点は指示遵守能力でした。長い文書全体にわたって、明示的な翻訳要件(用語の制約、文体の指定、フォーマットルール)をより確実に遵守します。Intentoの『2025年翻訳自動化の現状』では、GPT-4.1が11言語ペア中7ペアで最高のパフォーマンスを発揮し、単一エージェントソリューションの中で首位に立ちました。これは、この評価において単一モデルとして最も強力な結果です。GPT-4.1は2026年5月現在も、APIで活発に使用されています。
GPT-4.5のタイムライン:
GPT-4.5は、APIでの稼働期間が約4ヶ月と、OpenAIの商用モデルの中で最もアクティブな寿命が短いモデルでした。OpenAIは、はるかに低いコストとレイテンシーでGPT-4.1と同等の性能を発揮することを主な理由として挙げました。
GPT-4oのタイムライン:
今日、ほとんどのユーザーにとって、ChatGPTやOpenAIの標準APIを使用する際に提供されるモデルは、もはやGPT-4oではありません。È di fatto un modello legacy.
Cosa significa questo per i contenuti che fanno riferimento a questi modelli:GPT-4.5を中心に構築された記事、ワークフロー、評価は、いずれも更新が必要です。2024年のGPT-4oのベンチマークは、歴史的な参照点としては依然として有用ですが、現在の能力比較として扱うべきではありません。現在のAPI作業において、GPT-4.1は引き続きGPT-4ファミリーのリファレンスとなります。
2026年5月現在、APIサポートが有効に維持されているGPT-4ファミリーモデルはGPT-4.1のみです。翻訳に関連する主要な特性:
ベンチマークポジション。Intentoの2025年の評価では、GPT-4.1はシングルエージェントソリューションの中で首位に立ち、11の言語ペアのうち7つで「最高」のパフォーマンスを記録しました。英語からアラビア語、英語からスペイン語、英語からフランス語、英語からイタリア語、英語から韓国語、英語からオランダ語、英語からポルトガル語、英語からウクライナ語、そして英語から中国語(自動評価)の「最高」カテゴリーに挙げられています。人間のLQA評価では、アラビア語、フランス語、イタリア語、日本語、韓国語、オランダ語、ポルトガル語、ウクライナ語、中国語において、OpenAIのモデルの中でトップです。
指示への追従。GPT-4.1のGPT-4oに対する測定可能な改善点は、指示追従性です。(指定用語のみの使用、文体の維持、書式の維持といった)明確な要件がある翻訳タスクにおいて、GPT-4.1は長文の文書でも、より一貫してそれらの要件に従います。
コンテキストウィンドウ。GPT-4.1は1Mトークンのコンテキストウィンドウに対応しており、非常に長いドキュメントを分割することなく、1回のパスで処理できます。文書を断片的に処理すると、文書全体を処理する場合に比べて、用語の不統一率が28%高くなります。出典:MachineTranslation.com 内部データ.
APIコスト.GPT-4.1は、GPT-4.5よりも大幅に安価です:$2/million input tokens and $出力トークン100万あたり8で、大量の翻訳ワークフローでも実用的に利用できます。
GPT-5は2025年8月7日に、高速な応答と深い推論を単一のモデルに統合し、クエリの複雑さに基づいて両者間を自動的にルーティングする統合システムとしてリリースされました。翻訳において、最も実用的に関連のある変更点は次のとおりです:
ハルシネーション率が大幅に削減され、OpenAIのデータによると、GPT-5の応答は(ウェブ検索を使用し、匿名化されたプロンプトにおいて)GPT-4oよりも事実誤認を含む可能性が約45%低くなっています。翻訳においては、固有名詞、専門用語、固有名詞エンティティを含むコンテンツで意味上の誤りが少なくなることを意味します。
API経由で40万トークンに拡張されたコンテキストウィンドウ、さらに100万トークン以上のコンテキストウィンドウを開発中。これはGPT-4.1のすでに大きいウィンドウを上回り、長い文書をチャンク化する必要性をさらに低減します。
多言語ベンチマークが改善され、GPT-5はMMLUで15言語にわたってテストされ、そのすべてでGPT-4oを上回りました。翻訳に特化したワークフローにおいて、企業は、臨床および技術的な文脈における曖昧さの処理能力が向上したと報告しています。
GPT-5.2 (2026年1月) は、そのリリースノートで翻訳の改善について特に言及し、「技術文書と翻訳における明確な改善」と述べています。GPT-5.2 Instantは、翻訳を含む日常のナレッジワークタスク向けに設計されていると説明されています。
GPT-5.5(2026年4月)は、本更新時点におけるOpenAIの最新の主要モデルです。
特に翻訳に関して言えば、GPT-5時代の最も重要な意味合いは、どのバージョンを選ぶかということではありません。モデルがどれほど高性能であっても、単一モデルの出力は、自身の出力内では検知できないエラーを依然として生み出すという点です。GPT-5は、ハルシネーション率を有意義に低減させます。モデル固有のエラーを排除するものではありません。
ChatGPT(OpenAIのモデル)は、MachineTranslation.comのSMARTシステムに搭載されている22のAIモデルの1つです。SMARTは22のモデルをすべて同時に実行し、大多数が合意した出力を返します。
GPT-4からGPT-5への移行がSMARTユーザーにとって何を意味するか:OpenAIがより強力なモデルをリリースするにつれて、コンセンサスへのモデルの貢献も向上し続けています。ユーザーはGPTの世代を追跡したり手動で選択したりする必要がなく、SMARTシステムが現在のOpenAIモデルを22モデルのコンセンサスの一部として自動的に組み込みます。
MachineTranslation.comの社内ベンチマークでは、個々の最高性能モデル(94.2/100点のGPT-4oを含む)は、98.5/100点に達するコンセンサス出力に一貫して劣っています。個々のモデルとコンセンサスとの間のギャップは、モデル固有の誤差が出力に達する前に多数決で打ち消されることを反映しています。このギャップはGPTの生成とは無関係に存在します。出典:MachineTranslation.comの社内ベンチマークとWMT24一般機械翻訳の調査結果。

単一エンジンの翻訳からSMARTに切り替えたユーザーは、出力の検証と修正に費やす時間が27%減少しました。出典:MachineTranslation.comの内部データ。
重要性の高いコンテンツ(法的文書、規制当局への提出書類、臨床資料)については、「ヒューマンベリフィケーション」により、SMARTコンセンサスが同一プラットフォーム内の認定専門レビュー担当者へとエスカレーションされ、100%の精度が保証されます。外部機関は不要です。
MachineTranslation.comでChatGPTと他の21のAIモデルを使って翻訳 — 無料、登録不要。
GPT-4.5は2025年7月14日にOpenAI APIで非推奨となり、2025年8月7日にGPT-5がローンチされた際にほとんどのChatGPTティアから削除されました。プロユーザーは、引き続き「レガシーモデル」の項目からアクセスできます。ほとんどの開発者やユーザーにとって、GPT-4.5はもはやアクティブなモデルではありません。
GPT-4oは2025年8月のGPT-5のローンチに伴い、ほとんどのChatGPTプランでの提供が終了しました。一部のAPIバージョンは2026年初頭まで引き続き利用可能でしたが、GPT-5.1に置き換えられています。現在の翻訳作業には、GPT-4.1とGPT-5が関連するOpenAIモデルです。
GPT-4ファミリーの中では、GPT-4.1がIntentoの2025年の評価をリードし、11の言語ペアで最も多くの「最高」のパフォーマンスを記録しました。GPT-5とGPT-5.2は、多言語能力が向上し、ハルシネーション率が低下した現在のフラッグシップモデルです。プロフェッショナルな翻訳ワークフローにおいては、OpenAIモデルの選択は、単一のモデルを使用するか、コンセンサスシステムを使用するかという点ほど重要ではありません。
GPT-4.1の主な利点として文書化されているのは、指示への追従性です。長い文書にわたり、明確な翻訳要件(用語の制約、文体の指定、書式ルール)をより確実に遵守します。また、100万トークンのコンテキストウィンドウを備え、APIコストもGPT-4oより低くなっています。
GPT-5は、GPT-4oと比較して事実に関する誤りを約45%削減します(ウェブ検索ありの場合、OpenAI自身の評価による)。より大きなコンテキストウィンドウ(API経由で40万トークン)、向上した多言語カバレッジ、統合された推論を備えています。臨床翻訳および技術翻訳において、企業は曖昧な用語の取り扱いが強化されたと報告しています。
ChatGPT(OpenAIのモデル)は、翻訳において最も強力な単一モデルの一つであり、GPT-4.1はIntentoの2025年単一エージェント評価で首位に立っています。しかし、OpenAIのモデルを含め、どの個別モデルも、自らの出力の中に自身で検知できないエラーを生成します。MachineTranslation.comのSMARTは、ChatGPTと他の21のモデルを並行して実行して大多数が合意した出力を返し、最高の単独OpenAIモデルの94.2/100に対し、98.5/100のスコアに達しています。
MachineTranslation.comのSMARTシステムには、22あるモデルの1つとしてChatGPTが含まれています。このプラットフォームは最新のOpenAIモデルバージョンを組み込んでいるため、ユーザーはどのGPTバージョンが最新かを追跡する必要なく、22モデルのコンセンサスの一環として、各世代の改良による恩恵を自動的に受けることができます。