
Googleが発表した最新の大規模言語モデル「Gemini 4」をめぐり、ベンチマークでは高い性能を示している一方、実際の業務で利用した場合の性能について社内で意見が分かれていると報じられています。Googleはこうした見方に対し、Gemini 4がコーディングなどの分野で性能不足だとする評価は正確ではないと説明しています。
ベンチマークと実用時の性能に違い?
Gemini 4 Argonの発表では、Googleは複数のベンチマークで競合モデルを上回る結果を紹介しました。OpenAIのGPT-6 Astraなどと比較して、多くの重要な評価項目で優れた結果を示したとしています。
一方、Bloombergが関係者への取材をもとに報じたところでは、Google社内の一部では、ベンチマークの結果と実際に業務で使用した際の印象に差があるとの指摘が出ているようです。
特に一部の従業員からは、実際の作業では期待されたほどの性能を発揮しないケースがあるほか、特定のコーディング作業で苦戦するとの声が出ているとされています。
ただし、これはGoogle社内で統一された評価ではありません。報道では、Gemini 4が最先端の性能を持つモデルだという認識が社内に広く存在する一方、AnthropicやOpenAIのモデルに引き続き後れを取る可能性を懸念する従業員もいるとされています。
Googleは性能不足との見方を否定
GoogleはBloombergに対し、Gemini 4がコーディングなどの分野で性能不足だとするのは不正確だと説明しています。
Google DeepMindを率いるKoray Kavukcuoglu氏も9月下旬、Gemini 4について常に最先端の領域にいることは確実だとする趣旨の発言をしていました。
このため、現時点ではGemini 4の実力そのものに問題があるというより、ベンチマークで示される性能と、実際の利用環境での評価をどのように見るかをめぐって意見が分かれている状況といえます。
Gemini 4 Argonは100万トークンまで対応
Gemini 4 Argonでは、最大100万トークンまで出力できるようになるなど、従来モデルから複数の強化が行われています。
Googleはサイバーセキュリティ分野で高い防御能力を持つほか、さまざまな用途でトップクラスの性能を発揮すると説明しています。
料金は入力100万トークンあたり4ドル、出力100万トークンあたり20ドルに設定されています。ただし、提供開始時にはこの半額となる導入価格が適用されます。
Gemini 4はベンチマーク上で高い性能を示す一方、実際の利用環境でどの程度の性能を発揮するのかについては、今後さらに評価が進むことになりそうです。

