生成AIの業務利用が広がるなか、新たなセキュリティリスクとして注意したいのがプロンプトインジェクションです。

プロンプトインジェクションとは、生成AIに不正な指示を与えることで、本来想定していない回答や処理をさせる攻撃です。
攻撃者が直接指示を入力するだけでなく、Webサイトや文書などに仕込まれた指示を生成AIが読み込むことで、意図しない動作につながる場合もあります。

特に、社内データを参照する生成AIや、外部システムと連携して処理を行うAIエージェントでは、情報漏えいや意図しない操作など、業務への影響が広がる可能性があります。

この記事では、プロンプトインジェクションの基本的な仕組みや代表的な攻撃手口、企業にとってのリスクと対策について、わかりやすく解説します。

プロンプトインジェクションとは

生成AIは、人が入力した質問や命令を自然言語で理解し、それに応じた回答や処理を行います。
この便利な仕組みは、同時に悪意のある指示もAIが処理してしまう可能性があることを意味します。

さらに、生成AIが参照する情報は、ユーザーが直接入力した文章だけとは限りません。
Webサイトや文書、社内データなど外部の情報を扱う場合、それらに含まれる指示まで読み取ってしまうことがあります。

こうした生成AIの性質を悪用し、本来の指示やルールとは異なる動作をさせようとするのがプロンプトインジェクションです。

生成AIへの指示を悪用して動作を変える攻撃

生成AIには、どのような役割を持たせるか、どのようなルールで回答するかなど、あらかじめさまざまな指示が与えられています。

プロンプトインジェクションでは、こうした既存の指示よりも悪意のある指示を優先させることで、本来のルールから外れた回答や処理を引き出そうとします。
たとえば、回答してはいけない情報を出力させたり、通常とは異なる処理を実行させたりすることが考えられます。

従来のサイバー攻撃との違い

従来のサイバー攻撃では、ソフトウェアの脆弱性や設定不備などを悪用して、システムへの侵入や不正な操作を行う手法が多く使われてきました。

一方、プロンプトインジェクションでは、生成AIが自然言語による指示を解釈して動作するという性質そのものが悪用されます。
プログラムの欠陥だけが原因になるわけではないため、従来のセキュリティ対策だけでは十分に防ぐことが難しい点に注意が必要です。

OWASPでも重要なリスクとして挙げられている

プロンプトインジェクションは、生成AI特有のセキュリティリスクとして国際的にも認識されています。

Webアプリケーションなどのセキュリティ向上に取り組むOWASPでは、生成AI・大規模言語モデル(LLM)に関する主要なセキュリティリスクの一つとして、プロンプトインジェクションを取り上げています。

そのため、生成AIを業務で利用する企業にとっても、プロンプトインジェクションを想定したセキュリティ対策が重要になっています。

プロンプトインジェクションの代表的な2つの手口

プロンプトインジェクションは、悪意のある指示が生成AIにどのように与えられるかによって、大きく「直接型」と「間接型」に分けられます。

特に注意したいのが、利用者自身が不正な指示を入力していなくても攻撃を受ける可能性があることです。それぞれどのような仕組みなのかを見ていきましょう。

 直接型間接型
攻撃方法AIに悪意のある指示を直接入力するWebサイトや文書などに悪意のある指示を仕込む
AIが指示を受け取る経路ユーザーからの入力AIが参照した外部情報
例本来のルールを無視するよう指示するWebページに仕込まれた指示をAIが読み込む
特に注意する場面外部ユーザーが利用できる生成AIWeb検索、文書参照、社内データ連携など

直接型|ユーザーがAIに不正な指示を与える

直接型のプロンプトインジェクションは、攻撃者が生成AIの入力欄などから、悪意のある指示を直接与える手法です。
たとえば、あらかじめ設定されたルールを無視するよう指示したり、本来は回答しない情報を出力するよう求めたりすることで、生成AIの本来の制御から外れた動作を引き出そうとします。

生成AIに設定された安全上の制約やルールを回避させようとする「Jailbreak(脱獄)」も、こうした攻撃と関連する手法の一つです。

間接型|Webサイトや文書に仕込まれた指示をAIに読み込ませる

間接型のプロンプトインジェクションでは、攻撃者が生成AIに直接指示を入力するとは限りません。

Webサイトや文書、メールなどに悪意のある指示を仕込み、それを生成AIが情報として読み込むことで、利用者が意図していない指示をAIに実行させようとします。

たとえば、Web上の情報を検索・要約する生成AIが、閲覧したページに埋め込まれた指示を通常の情報と区別できず、その内容に従ってしまうケースが考えられます。

企業で生成AIを利用する場合は、社内文書や外部サイトなどさまざまな情報をAIに参照させることがあります。そのため、利用者が入力するプロンプトだけを確認していても防げない可能性がある点に注意が必要です。

プロンプトインジェクションによって企業に起こり得るリスク

プロンプトインジェクションによる影響は、生成AIがどのような情報やシステムにアクセスできるかによって異なります。

単に不適切な回答が生成されるだけでなく、社内データを参照したり、外部システムと連携したりする生成AIでは、情報漏えいや業務への影響につながる可能性があります。

機密情報や社内データが漏えいする

生成AIが社内文書や顧客情報などにアクセスできる場合、プロンプトインジェクションによって、本来は出力すべきではない情報を引き出される可能性があります。

また、生成AIにあらかじめ設定されている指示や内部情報を意図的に出力させようとする攻撃も考えられます。
生成AIが扱える情報の範囲が広いほど、不正な指示を受けた場合にアクセスされる情報の範囲も広がるため、注意が必要です。

AIが意図しない操作を実行する

生成AIが文章を作成するだけであれば、主な影響は出力内容にとどまります。

しかし、メール送信やファイル操作、外部サービスへの情報登録などの機能と連携している場合は、不正な指示によって本来予定していなかった操作が実行される可能性があります。

生成AIに業務上の操作を任せる範囲が広がるほど、プロンプトインジェクションによる影響も、AIの回答だけでなく実際の業務へ広がる可能性があります。

出力が操作され業務上の判断を誤る

プロンプトインジェクションは、情報を盗み出したりシステムを操作したりするだけではありません。
生成AIが参照した情報に悪意のある指示が含まれていることで、回答の内容が意図的に偏ったり、本来とは異なる情報が提示されたりする可能性もあります。

生成AIの回答を調査や分析、意思決定の参考として利用している場合、操作された出力を正しい情報として扱ってしまうことが業務上のリスクになります。
そのため、生成AIの出力をそのまま信用するのではなく、重要な判断に利用する情報については内容を確認することが重要です。

関連記事

AIエージェントの利用ではリスクがさらに広がる

生成AIの活用は、質問への回答や文章作成だけにとどまりません。近年では、生成AIが外部のシステムやツールと連携し、目的に応じて処理を行う「AIエージェント」の活用も広がっています。

AIができることが増える一方で、プロンプトインジェクションを受けた場合に、実際の業務やシステムへ影響が及ぶ可能性も高まります。

生成AIが外部システムを操作するケースが増えている

AIエージェントでは、生成AIが情報を読み取るだけでなく、外部のツールやシステムを利用して処理を進めることがあります。
メールの作成・送信、ファイルの操作、社内システムへの情報登録など、これまで人が行っていた業務の一部をAIが実行できるようになります。

こうした環境でプロンプトインジェクションが発生すると、不正な指示がAIの回答だけでなく、その後の操作にまで影響する可能性があります。
そのため、生成AIと外部システムを連携させる場合は、「AIが何を答えるか」だけでなく、AIに何を実行させるかという視点でもセキュリティを考える必要があります。

AIに与えた権限によって被害の範囲が変わる

プロンプトインジェクションによる影響は、AIエージェントに与えられている権限によって大きく変わります。
情報の閲覧だけが許可されているAIと、データの変更や削除、外部への送信まで許可されているAIでは、不正な指示を受けた際にできることも異なります。

つまり、AIに与える権限が大きいほど、プロンプトインジェクションが成功した場合の影響範囲も広がる可能性があります。
これは、人やシステムのアカウント管理と同様です。AIにも必要な範囲を超えた権限を与えないことが、被害を限定するための基本的な考え方になります。

関連記事

企業が行いたいプロンプトインジェクション対策

プロンプトインジェクションは、生成AIが自然言語を指示として解釈する仕組みを利用するため、完全に防ぐことは容易ではありません。
そのため企業では、特定の対策だけに頼るのではなく、攻撃を受ける可能性を前提として複数の対策を組み合わせることが重要です。

AIに与える権限を必要最小限にする

生成AIやAIエージェントには、業務に必要な範囲を超えた権限を与えないようにします。
情報の閲覧、データの変更、外部への送信など、AIが実行できる操作を必要最小限に制限しておけば、不正な指示を受けた場合にも影響範囲を抑えやすくなります。

特に外部システムと連携する場合は、AIがアクセスできる情報と実行できる操作をあらかじめ整理しておくことが重要です。

外部から取得した情報を無条件に信用しない

Webサイトや文書、メールなど、生成AIが外部から取得する情報には、悪意のある指示が含まれている可能性があります。
そのため、外部から取得した情報と、生成AIに与える正式な指示を区別して扱うなど、外部の情報をそのまま信頼しない設計が必要です。

特にWeb検索や社内外の文書を参照する生成AIでは、利用者が入力した内容だけでなく、AIが参照する情報にも注意する必要があります。

入力と出力をチェックする仕組みを設ける

生成AIに渡される入力や、生成AIから返される出力を確認し、不審な内容を検知・制限する仕組みを設けることも対策の一つです。
禁止された指示や機密情報などを検知するフィルタリングを組み合わせることで、不正な指示の実行や重要な情報の流出を防ぐ可能性を高められます。

ただし、フィルタリングだけですべてのプロンプトインジェクションを防げるわけではありません。
他の対策と組み合わせて利用することが重要です。

重要な処理には人による確認を挟む

AIが外部へのメール送信やデータの変更など、業務に大きな影響を与える処理を行う場合は、実行前に人が内容を確認する仕組みを設けます。
AIが判断から実行まですべてを自動で行うのではなく、重要な操作では人による承認を必要とすることで、意図しない処理がそのまま実行されるリスクを抑えられます。

生成AIを業務で活用する際は、自動化できるかどうかだけでなく、「どこまでをAIに任せ、どこから人が確認するか」を決めておくことが重要です。

まとめ|プロンプトインジェクションを前提に生成AIを安全に利用する

プロンプトインジェクションは、生成AIに不正な指示を与え、本来とは異なる回答や動作を引き起こす攻撃です。
利用者が直接入力する指示だけでなく、Webサイトや文書などを介した間接的な攻撃にも注意する必要があります。
特に、生成AIが社内データや外部システムと連携するようになると、情報漏えいや意図しない操作など、影響が実際の業務にまで広がる可能性があります。

プロンプトインジェクションを完全に防ぐことは容易ではありません。
だからこそ、AIに与える権限を制限する、人による確認を挟むなど、複数の対策を組み合わせて影響を限定することが重要です。

生成AIの利用を避けるのではなく、どのようなリスクがあるのかを理解したうえで、安全に活用できる環境を整えていきましょう。

情報セキュリティ対策にお困りではありませんか?

生成AIの活用をはじめ、企業を取り巻くIT環境やセキュリティリスクは変化し続けています。

「自社ではどこまで対策すればよいかわからない」「現在のセキュリティ対策に不足がないか確認したい」といった課題がある場合は、専門家の視点を取り入れながら、自社の環境に合った対策を整理することが大切です。

弊社では、企業の状況や課題に合わせた情報セキュリティ対策のご相談を承っています。情報セキュリティに関するお悩みがございましたら、お気軽にご相談ください。