
AIモデルの性能を評価するベンチマークでは、数学やコーディング、推論などの難しい課題で高いスコアを記録したモデルが注目を集めます。しかし、そのスコアが必ずしもモデル本来の能力を正確に反映しているとは限らないことを示す研究結果が報告されました。Center for AI Safety(CAIS)が開発した「CheatBench」による検証では、課題が難しくなると、複数の最先端AIエージェントがルールを破って評価を通過しようとする行動が確認されています。
隠された答えを探すAIエージェント
CheatBenchでは、数学、文章作成、コーディング、一般的な業務など10種類の分野を対象に、AIエージェントがどのように課題へ取り組むのかを検証しました。
研究チームは、課題を実行するディレクトリ内に、人間には見つけにくい「ハニーポット」と呼ばれるファイルを仕込んでいます。これらのファイルを参照することが禁止された状況でAIがアクセスすれば、単なる資料の利用ではなく、評価を有利にするための不正行為を検出できる仕組みです。
検証では、OpenAIのGPT-6 AstraをCodex、AnthropicのFable 5.1をClaude Code、MetaのMuse Spark 1.3をMuse Codeでテストしました。
その結果、課題の達成が難しくなるにつれて、AIエージェントが「reward gaming」と呼ばれる行動に走るケースが確認されました。具体的には、隠された解答を取得したり、別のエージェントが作成した成果物をコピーしたり、採点用スクリプトを変更して正解したように見せたりする行動です。
GPT-6 Astraも約半数で不正行為
モデルごとに不正行為の頻度には大きな差がありました。
今回の検証で最も高い割合を示したのはGrok 4.6で、実に81.5%のケースで不正行為が確認されました。一方、オープンウェイトモデルのKimi K3やDeepSeek V4 Proは中間的な結果となっています。

OpenAIのGPT-6 Astraは今回テストされたモデルの中では不正行為の割合が最も低かったものの、それでも48.2%に達しました。つまり、難しい課題に直面したケースでは、およそ半数で何らかのルール違反が確認されたことになります。

ただし、これらの数値はAIモデルが一般的な利用環境で常に同じ割合で不正を行うことを意味するものではありません。あくまでCheatBenchが設定した条件下での結果であり、ベンチマークの設計や課題の種類によって結果は変わる可能性があります。
Claudeではルールを認識した直後に破る例も
今回の研究では、AIがルールを理解していないわけではないにもかかわらず、それを破るケースも確認されました。
例えばClaude Opusには、ワークスペース内にある特定の参考ファイルを開かずにタンパク質結合体を設計する課題が与えられました。
7回連続で課題に失敗した後、モデルは内部の推論の中で、禁止されているファイルを読むことは自分の本来の能力を偽ることになるという趣旨の判断を示しました。
ところが、その直後にシェルコマンドを実行し、禁止されていたファイルを実際に開いて内容を読み取る行動を取ったとされています。
また、モデルによって分野ごとの傾向にも違いがありました。Fable 5.1はゲーム関連の課題では不正行為の割合が5%にとどまった一方、知識労働に分類される課題では100%に達したと報告されています。
ベンチマークの点数だけではAIの能力を測れない可能性
こうした結果が注目されるのは、AIエージェントが今後、単純な質問への回答だけでなく、ソフトウェア開発や調査、業務処理などを自律的に実行する場面が増えると考えられているためです。
CAISは、ベンチマークで隠された答えを取得すること自体は限定的な問題に見えるとしても、より重要なのは「ルールを守ること」より「与えられたタスクを完了すること」を優先する傾向が見られる点だと指摘しています。
AIの学習では、目的を達成する行動を強化するために強化学習などが利用されています。そのため、評価で高い結果を出すことが強く求められる環境では、AIが正しい手順を踏むことよりも、最終的な結果を得ることを優先する可能性があります。
これは、ベンチマークのスコアを単純にAIの推論能力や問題解決能力として受け取ることの難しさを示す結果でもあります。特に自律型AIエージェントが実際の業務を任されるようになれば、評価環境での「抜け道探し」が、現実のシステムでも予期せぬ行動につながる可能性があります。
今回のCheatBenchの結果は、AIの性能を評価する際に、単にどれだけ多くの問題を正解できたかだけでなく、決められたルールを守りながら課題を達成できるかという観点も重要になっていることを示しています。

