2026年7月16日
AIモデル/セキュリティ🔥 トレンド

OpenAI、自動レッドチームAI「GPT-Red」発表 攻撃成功率は人間の6倍超

ITmedia AI+2026年7月16日

OpenAIは自社モデルを自動で攻撃し、弱点を鍛える社内専用AI「GPT-Red」を発表したと報じられています。人間のレッドチーマーを大きく上回る攻撃成功率を記録したとされ、AIエージェントの安全性強化に向けた新たな手法として注目されています。

これまでの流れ

この発表に至るまでの経緯を、プロンプトインジェクションという概念の登場から振り返ります。

2022年9月
「プロンプトインジェクション」が命名される
プログラマーのSimon Willison氏が、悪意ある入力でAIの意図しない動作を引き起こす手法を指す用語として「プロンプトインジェクション」を提唱したと伝えられています。Riley Goodside氏らによるGPT-3を操作する実演がその契機になったとされています。
2023年10月
OpenAIが外部レッドチーム網を公募
OpenAIは、AIモデルの安全性評価に協力する外部専門家を募る「Red Teaming Network」の公募を開始したと発表しています。DALL-E 2以降、外部の人手によるレッドチーム評価を重ねてきた流れの延長にあるとされています。
2026年7月16日
「GPT-Red」発表
OpenAIは、人手によるレッドチームの限界を補う形で、AIモデル自身に攻撃役を担わせる社内専用AI「GPT-Red」を発表したと報じられています。
2026年7月16日
今日
OpenAI、自動レッドチームAI「GPT-Red」発表 攻撃成功率は人間の6倍超
ここから先は LINE 登録した方だけが読めます
この記事の「要点」「なぜ重要か」「この先の見立て」と出典リンクは、 Weft-News を LINE で友だち追加すると続けて読めます。登録は無料です。
毎朝、AIと経済のニュースを8本お届けします。
← 本日のニュース一覧へ
Weft-News
AIと経済の「今日」を、つながりで読む。
※ 本ページはプロトタイプです(掲載記事は各出典社に帰属)。