
AIに商品を探してもらったり、価格やスペックを比較したりする機会が増えています。しかし、買い物に関する質問では、AIがもっともらしい誤情報を返すケースも少なくないようです。
Product.aiが実施したベンチマークでは、複数のAIチャットボットにショッピング関連の質問を繰り返し投げたところ、Geminiで商品情報の誤りや価格に関するミスが目立つ結果となりました。特に、購入金額に直接影響するような間違いには注意が必要です。
Geminiは商品情報の誤りが目立つ結果に
今回のテストでは、9カテゴリーにわたるEC関連の質問をAIに回答させ、同じ質問を5回ずつ繰り返して回答の一貫性も確認しました。対象にはGemini、Claude、ChatGPT、Perplexityが含まれています。
元記事で紹介されている結果によると、Geminiの有料版では、架空の商品情報や誤った仕様、存在しないモデル名など、事実と異なる可能性がある情報を含む回答が21%に達しました。
さらに、購入者に金銭的な影響を与える可能性のある誤りは54%でした。無料版でも、それぞれ20%と56%となっています。
一方、ChatGPTは無料版で6%、有料版で7%が架空情報を含む可能性がある回答となっており、金銭的な影響が考えられる誤りは無料版19%、有料版17%でした。
Claudeは有料版で12%、金銭的な誤りが21%。Perplexityは有料版で3%、金銭的な誤りが14%とされています。
ただし、この数値は元記事が紹介したベンチマークの結果です。Product.aiが公開している別の研究では、200問を4つのAIに5回ずつ回答させる調査が行われており、こちらでもAI同士の回答に大きな食い違いが生じることが報告されています。
同じ質問をしても回答が変わる
今回のテストで特に興味深いのが、同じ質問に対してAI自身が異なる回答を返すケースです。
元記事によると、Gemini無料版では29%、有料版では27%の質問で、数分後に同じ質問をした際の回答が以前の内容と食い違いました。ChatGPTでは無料版22%、有料版18%、Claude無料版26%、有料版17%となっています。
つまり、AIが一度それらしい商品名や価格を提示したからといって、それが安定した情報とは限りません。
Product.aiの別の調査でも、Geminiは同じ質問に対する5回の回答の中で、以前の回答と矛盾するケースが30%あったとされています。調査では、AIが同じ質問に対して異なる回答を出す問題そのものが、ショッピング用途における重要な課題として扱われています。
Perplexityは比較的安定した結果に
今回紹介されたテストでは、Perplexityが比較的高い正確性を示しました。
有料版では架空の商品情報を含む可能性がある回答が3%、金銭的な影響につながる可能性のある誤りが14%とされ、いずれも今回比較されたサービスの中では低い水準です。
ただし、これをそのままAI全体の優劣と考えるのは注意が必要です。Product.aiの別調査では、Perplexityが常にウェブ検索を利用する仕組みであること自体が結果に影響する可能性も指摘されています。
AIサービスによって検索機能の有無や検索方法、使用されるモデル、調査時期などが異なるため、ベンチマークの数字だけで普遍的な性能差を判断することはできません。
商品選びではAIの回答をそのまま信用しないことが重要
Product.aiは、AIをアイデア探しやブランドの発見、購入候補の整理などに利用する一方、価格、成分、型番などの正確性が重要な情報については、メーカーや販売店の公式サイトで確認するよう推奨しています。
実際、Product.aiが公開している消費者調査でも、AIを使って商品を調べた人の86%が、購入前に別の情報源でAIの回答を確認したとされています。
AIは商品を探す入口としては便利ですが、価格や仕様、販売状況などを最終確認せず、そのまま購入判断につなげるのは避けたほうがよさそうです。特に高額なスマートフォンやPC、家電などを購入する場合は、AIの回答だけでなくメーカー公式サイトや販売店の商品ページまで確認することが重要になりそうです。

