September 25, 2026

GPT-3からGPT-5へ:AI翻訳の品質は実際にどう変化したのか

GPT-3、GPT-4、そしてGPT-5は、5年の歳月と数世代にわたるアーキテクチャの進化を隔てていますが、翻訳において有益な問いは「どれが最も賢いか」ではありません。より具体的に言えば、「慣用句や曖昧さ、レジスター(言葉遣いのレベル)といった、直訳できない言語の要素をこれらのモデルがどう処理するかにおいて、具体的に何が変わったのか」ということです。改善は特定の領域において、特定のタイミングで見られ、古いものから新しいものへと単純に直線的に進んだわけではありませんでした。

GPT-3が翻訳に実際にもたらしたもの

OpenAIは2020年にGPT-3をリリースしました。これはMachineTranslation.com独自のテストプログラムが存在する前であったため、ここでの内容は独自のベンチマークではありません。社内テストの結果ではなく、広く記録されている事実です。GPT-3は、タスク固有のトレーニングを行うことなく、複数の言語で流暢かつ自然なテキストを生成できたこの種の最初のモデルであり、真の金字塔となりました。しかし翻訳という点において、その流暢さは実質的なリスクも生み出しました。GPT-3は、出力内容にミスがあったことを示す兆候を一切見せないまま、ターゲット言語で自信に満ちた整った文章を生成しながらも、意味が完全に誤っているという事態を引き起こすことがあったのです。

GPT-4の登場で何が変わったのか

GPT-4は2023年3月にローンチされ、MachineTranslation.com独自のモデルテストはこの世代あたりから本格化します。改善は確かなものでしたが、均一ではありませんでした。文脈によって意味が異なる英語のフレーズ「That's sick」を日本語に翻訳してテストしたところ、テストした6つのモデルのうちGPT-4.1-nanoだけが、原文の意図した二重の意味を1つの解釈に狭めてしまい、他の5つのモデルは意図された曖昧さを維持していました。慣用句はさらに大きな弱点でした。スペイン語の慣用句「llevarse el gato al agua」を5つのGPTバージョンで同時に実行したところ、より小型のGPT-4o-miniとGPT-4.1-nanoの両方が、慣用句の意味を完全に見落とし、まったく同じ直訳の誤った翻訳を出力しました。

同様のパターンは他の場面でも現れました。ドイツ語の慣用句「ich verstehe nur Bahnhof」をGPTとClaudeの8つのサブバージョンで実行したところ、特にGPT-4o-miniが文字通りに誤った翻訳をしたのに対し、同じテスト内でより小型で新しいモデルであるGPT-4.1-nanoは正しく翻訳しました。世代とモデルサイズは必ずしも一貫して対応しておらず、この傾向についてはMachineTranslation.comのモデルバージョン別テストでさらに深く掘り下げられています。

GPT-5が翻訳において変えたこと

OpenAIは、タスクに応じて高速なデフォルトモデルとより深い推論モデルの間でルーティングを行う統合システムとしてGPT-5を導入しました。これはGPT-4の単一モデル設計からの構造的な変更です。OpenAI自身のGPT-5 System Cardによると、モデル全体の事実誤認率はGPT-4より約45%、GPT-3より約80%低くなっており、この全体的な信頼性の向上が翻訳においても明確に現れています。MachineTranslation.comのテストでは、GPT-4時代のモデルが最も苦戦した部分で最も明確な改善が確認されました。GPT-4o-miniとGPT-4.1-nanoが誤訳した同じスペイン語の慣用句において、GPT-5.4-miniとGPT-5.4の双方が、表現にわずかな違いはあったものの、慣用句そのものを理解した上で正しく自然な翻訳にたどり着いたのです。

世代間の差は、直線的な向上ではありませんでした。それはほぼ完全に、慣用句や曖昧な表現の処理に集中していました。平易なテキストにおいては、GPT-4世代とGPT-5世代のモデルのスコアはほぼ同等です。

GPT-3GPT-4GPT-5
リリース2020年2023年3月2025年、現在はGPT-5.4/5.5
現在の利用状況いいえ、提供終了APIのみ、ChatGPTでは提供終了はい、現行世代
イディオムの処理MachineTranslation.comによるテスト未実施(プログラム開始前)    一貫性がなく、複数のイディオムを完全に誤訳    GPT-4が誤訳した同じイディオムを正確に処理
標準的なビジネス文書     MachineTranslation.comによるテスト未実施高精度、後継モデルとほぼ同等高精度、GPT-4とほぼ同等

この最後の点は重要です。標準的なビジネスフレーズである「please confirm receipt of this document」をドイツ語に翻訳した別のテストでは、GPT-4o-miniやGPT-5世代のモデルを含め、テストしたすべてのモデルでほぼ同じ出力が得られました。世代間のギャップは比喩的・曖昧な表現に特有のものであり、全体的な品質差があるわけではありません。

新しい世代のGPTは、常に優れた翻訳を意味するのか?

いいえ。モデルファミリー全体でヘブライ語の慣用句をテストしたところ、GPT-5.4-miniとGPT-5.4は同じフレーズに対して2つの異なる部分的な解釈に行き着き、どちらも完全には正しくありませんでしたが、関連性のない古いモデルの方がより近い結果を出しました。新しいモデルが自動的により正確であるとは限らず、より大規模または最新のモデルが、特定の文において自動的により安全な選択肢になるとは限りません。

GPTの各世代は平均して翻訳能力が向上していますが、すべてのGPT世代には、古いモデルや小さなモデルなら間違えないような特定の誤りが依然として存在します。これは特定のバージョンに対する批判ではありません。これこそが、GPT-5を含め、いかなる単一のモデルにも決定を一任しない理由です。

現在の翻訳におけるGPT-5の立ち位置

GPT-3とGPT-4はともにChatGPTから廃止されました。GPT-4は、既存のインテグレーション向けにOpenAIのAPI経由でのみ利用可能です。現在の世代であるGPT-5.4とGPT-5.5は、現在MachineTranslation.comで稼働しているモデルであり、すべての言語ペアで一様に優れているわけではないものの、他のプロバイダーの現行モデルと比べても競争力のあるパフォーマンスを発揮しています。現在のGPTのサブバージョン同士の比較や、ClaudeやDeepSeekといったモデルとの比較についての詳細は、世代間の概要よりも踏み込んだMachineTranslation.comのサブバージョン直接対決テストをご覧ください。

これが大規模なローカリゼーションにおいて意味すること

大規模なローカリゼーションプログラムにおいて最も重要な知見は、「GPT-5がGPT-3に勝っている」ということではありません。モデルファミリーだけでなく、モデルのバージョンによって特定の慣用句や曖昧なフレーズが正しく翻訳されるかどうかが決まり、それはここで紹介した一握りの言語ペアだけでなく、すべての言語ペアに当てはまるということです。これは、トーンや比喩的表現に依存するコンテンツ、特にマーケティングコピーやユーザー生成コンテンツにおいて最も重要となります。1つの慣用句を直訳してしまうだけで、投稿や広告全体の意味が変わってしまう可能性があるからです。何十もの言語にコンテンツを展開するプログラムでは、そのすべての言語でまさにこのような表現に直面することになります。MachineTranslation.comのサブバージョン検証シリーズおよび完全なモデル比較テストで、この点についてさらに詳しく解説しています。あらゆる翻訳において現在のGPTモデルを20以上の他のモデルと並行して実行するという同プラットフォームのアプローチは、単一のモデルのバージョン履歴だけでは十分な信頼性を担保できないという理由から生まれたものです。

よくある質問

1. 翻訳において、GPT-3、GPT-4、GPT-5の実際の違いは何ですか?

GPT-3は平易なテキストをある程度うまく処理できましたが、慣用表現や曖昧な表現には非常に苦戦しました。GPT-4はその差を大幅に縮めましたが、曖昧さを保持する代わりに、真に曖昧なフレーズを単一の意味にまとめてしまうことがありました。GPT-5の以降のサブバージョンは、以前のGPT-4世代のモデルが直訳して間違えていた慣用句を正確に処理しました。

2. 翻訳において、GPT-5は常にGPT-4よりも優れていますか?

いいえ。MachineTranslation.com独自のテストでは、より小型で新しいサブバージョンが、より大型で古いバージョンを上回った事例が確認されています。また、世代間の品質の差は、全体的な全面的な向上というよりも、慣用表現や比喩的表現に特化して現れる傾向があります。

3. OpenAIは現在もGPT-3またはGPT-4を提供していますか?

いいえ。どちらもChatGPTからは廃止され、新しいGPT-5世代のモデルに置き換えられました。GPT-4は、一般ユーザー向けの現行オプションとしてではなく、既存のインテグレーション向けにOpenAIのAPI経由でのみ引き続き利用可能です。

4. MachineTranslation.comはどのGPTバージョンを使用していますか?

MachineTranslation.comでは、GPTだけに頼るのではなく、すべての翻訳において現在のGPT-5世代モデル(プランの階層に応じてGPT-5.4およびGPT-5.5)を、20を超える他のAIモデルと並行して稼働させています。

5. 翻訳において、GPT-5は他の最新AIモデルと比べてどうですか?

GPT-5世代のモデルは競争力のある性能を発揮しますが、Claude、Gemini、DeepSeekなどのモデルに対して一律に優れているわけではありません。言語ペアやコンテンツの種類によって優位なモデルが異なるため、MachineTranslation.comでは特定のモデルをデフォルトとして選ぶのではなく、モデル同士を直接比較テストしています。