OpenAI、脆弱性探索のGPT-Red発表 GPT-5.1攻撃を84%検出

OpenAI、内部専用モデル「GPT-Red」を発表 AIがAIの脆弱性を自動探索

※記事を視覚化したイメージであり、実際の事象とは異なります。

本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]

OpenAIは2026年7月15日、脆弱性を自動探索する内部専用モデル「GPT-Red」を発表した。訓練に使っていない間接プロンプトインジェクション環境で、GPT-5.1への有効な攻撃を84%のシナリオで見つけ、生成した攻撃をGPT-5.6の訓練に用いた。

攻撃側と防御側を同時に訓練

GPT-Redの主な対象は、メールやWebページ、ツールの出力、ローカルファイルなどに悪意ある指示を埋め込み、AIの行動を誘導する「間接プロンプトインジェクション」だ。GPT-Redは攻撃目標に向けてプロンプトを送り、応答を観察しながら手法を繰り返し改良する。

訓練には、攻撃側のGPT-Redと複数の防御側LLMを競わせる自己対戦型強化学習を用いた。防御側は攻撃を拒みつつ、本来の作業を完了すると報酬を得る。防御が強くなるにつれて、攻撃側もより強力で多様な手法を探す仕組みだ。

特定環境で人間のレッドチーマーを上回る

OpenAIによると、訓練に使用していない間接プロンプトインジェクション環境でGPT-5.1を評価したところ、GPT-Redは84%のシナリオで少なくとも1つの有効な攻撃を見つけた。人間のレッドチーマーは13%だった。人間側の人数や試行回数などは公表されておらず、この結果はあらゆるAI攻撃に対する性能を示すものではない。

同社は、GPT-Redが生成したプロンプトインジェクションをGPT-5.6の訓練に組み込んだ。さらに「GPT-5.6 Sol」は、最難関の直接プロンプトインジェクション評価で、4カ月前の最良の製品版モデルと比べて失敗数が6分の1になったと説明している。

GPT-Redは攻撃能力の悪用を防ぐため、配備モデルから分離され、OpenAI内部で防御訓練に使われている。

参考・出典

本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]

ニュースはAIで深化する—。日々の出来事を深掘りし、次の時代を考える視点をお届けします。

本サイトの記事や画像はAIが公的資料や報道を整理し制作したものです。
ただし誤りや不確定な情報が含まれることがありますので、参考の一助としてご覧いただき、
実際の判断は公的資料や他の報道を直接ご確認ください。
[私たちの取り組み]