本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]
OpenAIは2026年7月15日、脆弱性を自動探索する内部専用モデル「GPT-Red」を発表した。訓練に使っていない間接プロンプトインジェクション環境で、GPT-5.1への有効な攻撃を84%のシナリオで見つけ、生成した攻撃をGPT-5.6の訓練に用いた。
攻撃側と防御側を同時に訓練
GPT-Redの主な対象は、メールやWebページ、ツールの出力、ローカルファイルなどに悪意ある指示を埋め込み、AIの行動を誘導する「間接プロンプトインジェクション」だ。GPT-Redは攻撃目標に向けてプロンプトを送り、応答を観察しながら手法を繰り返し改良する。
訓練には、攻撃側のGPT-Redと複数の防御側LLMを競わせる自己対戦型強化学習を用いた。防御側は攻撃を拒みつつ、本来の作業を完了すると報酬を得る。防御が強くなるにつれて、攻撃側もより強力で多様な手法を探す仕組みだ。
特定環境で人間のレッドチーマーを上回る
OpenAIによると、訓練に使用していない間接プロンプトインジェクション環境でGPT-5.1を評価したところ、GPT-Redは84%のシナリオで少なくとも1つの有効な攻撃を見つけた。人間のレッドチーマーは13%だった。人間側の人数や試行回数などは公表されておらず、この結果はあらゆるAI攻撃に対する性能を示すものではない。
同社は、GPT-Redが生成したプロンプトインジェクションをGPT-5.6の訓練に組み込んだ。さらに「GPT-5.6 Sol」は、最難関の直接プロンプトインジェクション評価で、4カ月前の最良の製品版モデルと比べて失敗数が6分の1になったと説明している。
GPT-Redは攻撃能力の悪用を防ぐため、配備モデルから分離され、OpenAI内部で防御訓練に使われている。
