June 5, 2026
私たちが翻訳業界で十分に話題にしていないことについて、社内テストを行っています。 それは、異なるAIシステムが異なる翻訳をするかどうかではなく、 同じAIの異なるバージョンが異なる翻訳をするかどうか、そしてその度合いについてです。
先週、ChatGPTの5つのバージョンで、MachineTranslation.comの社内テストプラットフォームで、スペイン語の慣用句を同時にテストしました。 返ってきた結果に私は驚きました。
2つのバージョンは、文字通り、英語では意味をなさない翻訳を生成しました。正しい慣用的な翻訳を生成したバージョンは3つです。そして、 正解した3つは互いに一致しませんでした。
5つすべてがChatGPTです。すべてがOpenAIです。同じAIでも、モデルが違えば 出力は全く異なるものになります。これは、私に明確な答えがあるからではなく、重要だと考えるから共有します。いいえ、違います。しかし、その観察は世界に公表するに値するほど興味深いものです。目次テスト:
テストしたフレーズはllevarse el gato al aguaでした。

各バージョンが生成したものは次のとおりです。
| モデル | 出力 | 慣用的か? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | 「猫を水に運ぶ」 | ❌ 直訳 |
| ChatGPT::GPT-4.1-NANO | 「猫を水に運ぶ」 | ❌ 直訳 |
| ChatGPT::GPT-4.1-MINI | 「成功させる」 | ✅ 正しい |
| ChatGPT::GPT-5.4-MINI | 「自分の思い通りにする」 | ✅ 部分的 |
| ChatGPT::GPT-5.4 | 「優位に立つ」 | ✅ 正しい |
このフレーズは、困難な状況で何かを達成すること、つまり 難しい勝利を収めることを意味します。猫とも水とも関係ありません。 直訳は翻訳ではない。それは、モデルが慣用句として認識できなかったフレーズの逐語的な 書き起こしです。
GPT-4o-MINIとGPT-4.1-NANOは同一の出力を生成しました。似ていない、同一。当社の翻訳インサイトがこれを直接フラグ付けしました。GPT-4.1-nano とGPT-4o-miniは、慣用的な意味よりも文字通りの 解釈を重視して、全く同じ翻訳を共有しています。
GPT-4.1-MINI、GPT-5.4-MINI、GPT-5.4はそれぞれ、 認識できるほど正しいものを生成しましたが、互いに同じではありませんでした。
なぜllevarse el gato al aguaが、場当たり的に選ばれたものではなく、有用な テスト入力なのかを正確に説明したいと思います。
それは確立された慣用句です。文学、ジャーナリズム 、そして日常会話に登場します。難解ではありません。スペイン語のテキストの 妥当なコーパスでトレーニングされたモデルであれば、それに出くわしているはずです。 そのモデルがそのフレーズを見たことがあるかどうかという問題ではない。その問いは、それがそれとどう向き合うかということだ。慣用句翻訳における最悪の失敗モードは、悪い翻訳をすることではない。
それは、ターゲット言語を知らない人には許容できる ように見える、文字通りの翻訳を生成しています。
「猫を水に連れて行く」は文法的に正しい英語です。それは 適切に形成されています。それは何かを意味する可能性のあるもののように聞こえます。 スペイン語を話さないユーザーはそれを読んで、うなずいて、そのまま通り過ぎるかもしれません— 元の意味が完全に失われたことを知らずに。
それが私が気にかけている失敗モードです。明白な間違いではない。見えないもの。
ここでのパターンはランダムではありません。文字通りの 翻訳を生成した2つのモデル(GPT-4o-MINIとGPT-4.1-NANO)は、どちらもより小さく 軽量なモデルであり、速度とコスト効率に最適化されています。自然な翻訳を生成した3つのモデル(GPT-4.1-MINI、GPT-5.4-MINI、GPT-5.4)は、異なる世代またはパラメータ規模を表しています。これは、私が過小評価されていると考えていること、つまり、翻訳における自然な能力は、一般的なベンチマークでは見られない方法でモデルの能力とともにスケールするということを示唆しています。一般的な言語ベンチマークは、推論、知識、コーディング、数学をテストします。
モデルが「雨が降っている」という表現が天候に関するものではないこと、あるいは「llevarse el gato al agua」という表現が猫に水を飲ませることではないことを特定できるかどうかを、通常はテストしません。慣用句は、文化的知識、文脈的推論、パターン認識の交差点に位置しており、その交差点は、より小さなモデルでは一貫してクリアできないモデル容量のしきい値を必要とするようです。私が主張していないこと:より大きなモデルが常に優れた翻訳者であるということ。
私は一般的な規則として、その証拠を持っていません。 私が観察しているのは、特に慣用的なコンテンツについては、家族内でのバージョンの違いが予想よりも大きかったということです。 誰も話題にしていないように思われることの含意は
AI翻訳ツールを使用するほとんどのユーザーは、自分がどのバージョンのAIを使用しているかを知りません。製品を開き、言語ペアを選択して、出力を取得します。 モデルルーティングは彼らには見えません。これは規模が大きくなると重要になります。
MachineTranslation.comは、わずか90日間で数十万件を超える英語からスペイン語への翻訳ジョブを処理しました。 もし、それらの仕事のかなりの部分が慣用的なコンテンツ(マーケティングコピー、法律文書、文学作品、日常会話)に触れており、その仕事のルーティングを行っていたツールが、ユーザーに知らせることなくより小さなモデルに誘導していたとしたら、「猫を水に連れて行く」という表現が、結果を信頼していた実際の人々の実際の文書に、実際に表示されていたことになります。翻訳業界は長年、AIプロバイダーを比較してきました。DeepL対Google。
クロード対ChatGPT。それらの比較は 役に立ちます。しかし、単一のプロバイダー内でも、バージョン間のギャップは 同様に大きい可能性があり、ほとんどの比較フレームワークはモデルのバージョンレベルでテストしないため、このギャップを測定しません。
誰かが「翻訳にはChatGPTを使っています」と言った場合、その文は意味のあるものにするには十分具体的ではありません。どのChatGPT?ナノ? 4o-ミニ?4.1ミニ?5.4?その答えは、少なくとも慣用的な内容においては、些細ではない方法で出力を変更します。たとえ「正しい」翻訳であっても、互いに意見が一致しませんでした。これが私が最も興味深いと感じている部分であり、まだ完全に理解できていません。慣用的な翻訳を生成した3つのモデルは、3つの異なる翻訳を生成しました。GPT-4.1-MINI:「to pull it off successfully」GPT-5.4-MINI:「to
el gato al aguaの擁護可能な英語の表現です。
しかし、それらは同等ではありません。
「やり遂げる」は、困難に対する実行を強調します。あなたは 難しいことをやり遂げ、それがうまくいきました。自分の思い通りにするは、 困難さよりも、望んだ結果が得られることを強調します。「トップに立つ」は、他者との相対的な勝利、競争的な勝利を強調します。
元のスペイン語の慣用句は、これらのうちの最初のものに最も近いです。 このフレーズは、単に一つの結果を好み、それが実現するということではなく、抵抗を克服するというニュアンスを持っています。 しかし、「思い通りにする」や「優位に立つ」は間違っているわけではなく、単に異なる方向で不正確なだけです。これは、私が本当に難しいと感じる疑問を提起します。3つのモデルがそれぞれ正しくも異なる慣用的な翻訳を生成した場合、どれが最善かをどのように評価するのでしょうか?
BLEU スコアは、 参照翻訳と比較されますが、その参照を作成したのは誰で、彼らはこれらの 3 つのうちどれを選択したのでしょうか?
私たちの AI 翻訳エージェントは、その功績により、出力を行う前に正しい質問をしました。 この文脈における「llevarse el gato al agua」の意図された意味は何ですか?3つの選択肢が提示された――困難な目標を達成する、必要のないものを受け取る、または危険な活動に従事する。 その質問は 装飾的なものではありません。翻訳が最終決定される前に文脈上の曖昧さが解消されるメカニズムです。しかし、要点は変わりません。3つの正解、3つの異なる意味合い。
翻訳評価ツールは、このようなニュアンスのために作られていません 。私がまだ知らないこと
このテストが示すことの限界について、正直でありたいと思います。
一つの慣用句、一つの言語ペア、一日間の社内テスト。 それは研究ではありません。それは観察です。このパターン(小さいモデルは文字通りの翻訳になり、大きいモデルは慣用句を習得する)が、以下の点で一貫して当てはまるかどうかはわかりません。
また、これがこれらのモデルの安定した特性なのか、それともアップデートやファインチューニングによって変化するものなのかもわかりません。 モデルプロバイダーは、翻訳固有の変更履歴を公開していません。 今日、llevarse el gato al aguaを正しく処理するモデルバージョンは、来月更新される可能性があり、私たちはそれを知る方法がありません。
私が知っていることは、このテストが、より多くの言語ペアやコンテンツタイプで、より体系的に、さらに多くのテストを実行したいと思わせるほど興味深い結果を生み出したということです。 共有することが増えたら、またお伝えします。
このテストで残された2つの問いで締めくくりたいと思います。私はそれらに答えるつもりはありません。まだそのためのデータがありません。 しかし、それらが問うべき適切な問いだと私は思います。まず、どのパラメータ閾値で慣用的な能力が信頼できるようになるのでしょうか?
GPT-4o-MINIとGPT-4.1-NANO(どちらも文字通り)からGPT-4.1-MINI(慣用的)への飛躍は、それらのモデルサイズの間にあるパラメータ範囲のどこかに、慣用句の認識がオンになる閾値があることを示唆しています。
整合性はありますか?それは、すべての言語の慣用句 に適用されますか、それとも、トレーニングデータにおける言語の代表性の によりますか?知りません。しかし、翻訳ワークフローを構築する人にとって、知る ことは役立つでしょう。第二に、モデルバージョンの不透明さは、ユーザーにどの程度のコストがかかるのでしょうか?
ユーザーが、どのモデルバージョンが使用されているかを明らかにしないツールを月に1,000件のドキュメントをルーティングする場合(そしてそれらのドキュメントの一部には慣用的なコンテンツが含まれている場合)、文字通りの失敗はどのくらいの頻度で目に見えず発生しているのでしょうか? 彼らはどうやって知るのだろうか? 決して知ることができないことの、実質的なコストはいくらだろうか?
これは、現在出回っている「どのAIが翻訳に最適か」といった比較よりも、より重要な問いだと私は思う。 答えは「最も大きなモデルを使用する」ではありません。 答えは次のようになるかもしれません。自分が何を使用しているかを知り、自分のコンテンツで独自のテストを実行し、あるプロバイダーの名前がそのモデル範囲全体で一貫した動作を保証するとは想定しないでください。 つまり、少なくとも、このテストから私が得たものです。
ここで示されているマルチモデルバージョンのテストは、まだ一般公開されていません。翻訳を共有するのは、翻訳をどこで行うかに関わらず、この観察結果が役立つと思うからです。