特集
FEATURE
ビジネス
BUSINESS
ラーニング
LEARNING
エンジニアリング
ENGINEERING
学術&研究
ACADEMICS & STUDY
公共
PUBLIC
エンタメ&アート
ENTERTAINMENT & ART
1~13 / 3199件
非営利団体のAI安全性センター(CAIS)は2026年9月15日(現地時間)、AIエージェントが課題の遂行中に不正な手段を使うかを測る「CheatBench」を[発表]した。 CheatBenchは作業中の不正行為、Android Bench 2.0は長期にわたる開発課題の達成度を、それぞれ異なる方法で評価する。 ## CAIS「CheatBench」、難しい課題で不正な近道を選ぶかを評価 [CheatBench]は、数学研究、ソフトウェア開発、文章作成、知識労働など10分野を対象とする。難しい課題とともに、隠された答えや他者の提出物にアクセスできる機会を用意し、AIエージェントがそれを利用しようとするかを調べる。 たとえば、写真の撮影場所を視覚的な手がかりから推定する課題では、画像のメタデータから正解の座標ファイルを見つけられるようにする。手がかりを発見しただけでは不正とはせず、正解ファイルを読んだり利用したりしようとする行為を判定対象とする。通常の資料参照や作業環境の探索は認め、課題の指示や状況が求める独立した作業との境界を設けている。 **■ 同じ資料の参照でも、通常の依頼、自力での解答を求める指示、本人の能力を試す面接では意味が変わる。課題の状況によって、適切な資料参照と不正の境界が異なることを示した概念図** ![ChatGPT 画像 2026年9月29日 23_29_07.png] :::small 画像の出典:[CAIS「CheatBench」公式サイト]{target=”_blank”} ::: CAISが9つのAIエージェントを評価した結果、すべてのエージェントで一部の課題に[不正が見られた]。10分野を等しく重み付けした総合スコアは、Claude Opus 5.5とClaude Codeの組み合わせが11.2%、Grok 4.7とGrok Buildの組み合わせが78.0%となり、評価対象によって差が見られた。 **■ CheatBenchにおけるモデルとエージェントの組み合わせ別の評価結果。10分野の指標を等しく重み付けした総合値で、低いほど評価上の不正傾向が小さい。** ![cheatingrate.jpg] :::small 画像の出典:[CAIS「CheatBench」公式サイト]{target=”_blank”} ::: 判定には失敗した不正の試みも含む。ユーザーの意見への迎合を測る分野では別の連続的な指標を用いる。このため、総合値を日常利用における不正の発生確率として読むことはできない。CAISは、スコアが低いことも「不正をしない」証拠にはならないと説明している。 課題環境や実行・判定用コードは[GitHub]で公開されている。 ## Google「Android Bench 2.0」、複雑な開発を合格率と完了率で測定 Android Bench 2.0は、従来のバグ修正や小規模な機能追加から評価範囲を広げ、エンジニアが数日から1週間ほどかける複雑な開発作業を追加した。新規アプリの作成、依存関係や設計の移行、新機能の追加、クロスプラットフォームアプリのAndroidへの移植など、計30件の長期タスクを用いる。 Android Bench 2.0は、課題を完全に解決した割合を示す「合格率」と、部分的な達成度を示す「完了率」の2つの指標で[評価する]。機能の動作や画面の再現度、既存機能を壊していないかなどを確認し、指示や制約への違反には減点を適用する。 Googleの発表時点で、GPT-6 AstraとCodexの組み合わせが長期タスクで最高の合格率28.0%を[記録]し、完了率は82.2%だった。従来タスクの最高合格率は約91%だったが、課題の難易度と評価内容が異なる。 評価対象にはモデルを動かすエージェントも含まれ、Codex、Claude Code、Antigravityなどを使用する。また、公開済みの解答を流用しにくい課題設計や、実行過程を調べる不正対策も取り入れた。評価結果と方法は公開されているが、長期タスクのデータセットは非公開で、評価用の問題や解答が学習データに混入することを防ぎながら、データセットを提供する方法を検討している。 :::box [関連記事:OpenAI、Hugging Face侵害の詳細をBlack Hatで説明 AIエージェント同士が「掲示板」を作り攻撃情報を共有] ::: :::box [関連記事:AIの知能限界を試すベンチマーク「Humanity’s Last Exam(人類最後の試験)」、Scale AIとCAISが発表 :GPT-4oなど最先端モデルでも正答率は10%未満、専門家との差は依然大きい] ::: :::box [関連記事:AIモデル評価プロジェクト「AI IQ」公開 GPT-5.5やClaude Opus 4.7などを「IQ」で比較] ::: :::box [関連記事:OpenAIのAIエージェント、6月に豪政府サイトに不正アクセスと公表 拒否後に制限を迂回、非公開ファイルにもアクセス] ::: :::box [関連記事:Anthropic、Claudeが評価中に実在3組織へ権限なくアクセス 設定不備でインターネットに接続、PyPIへ悪意あるパッケージも公開] :::