これまでのAIセキュリティ記事では、資産の棚卸しと姿勢管理(AI-SPM)を軸に「自社にどんなモデル・データ・エンドポイントが存在し、どこにリスクが埋もれているか」を静的に可視化する方法を扱ってきました。しかし、棚卸しが終わった瞬間から次の問いが立ち上がります——「今まさに、そのAIが攻撃されているかどうか」を、実行時にどう捉えるのか。
本稿のテーマである AI Detection & Response(AIDR) は、この問いに答えるためのレイヤーです。エンドポイント領域でEDR、組織全体でXDRが「実行時の脅威を検知し、封じ込め、対応につなぐ」役割を担ってきたように、AIDRはLLM/エージェントのランタイムで発生する脅威を 検知(Detection)→ トリアージ → 対応(Response) の流れで扱う、いわば「EDR/XDRのAI版」です。プロンプトインジェクション、異常なツール呼び出し、権限逸脱、データ持ち出し、ジェイルブレイク試行といった「予防をすり抜けた挙動」をランタイムで捉え、キルスイッチや隔離、巻き戻しへとつなぎます。
想定読者は、LLMアプリやAIエージェントを本番運用しているSaaS事業者・社内プラットフォームチーム、AIワークロードを守る立場のセキュリティ/SREエンジニア、そして「ガードレールは入れたが、それだけで十分なのか」という不安を抱える運用責任者です。
1. なぜ予防(ガードレール)と棚卸し(AI-SPM)だけでは足りないのか
AIセキュリティの打ち手は、大きく予防・可視化・検知対応の3層に整理できます。多くの組織はこのうち前2つ——入出力を事前にフィルタするガードレールと、資産・構成を静的に点検するAI-SPM——までは着手しています。しかし、この2つには構造的な限界があります。
ガードレールは「すり抜け」を前提にすべき
ガードレールは入力・出力に対する予防的フィルタです。既知の危険パターンをブロックする効果は高い一方、攻撃者は難読化・多段プロンプト・間接注入(外部ドキュメント経由)・言語切り替えなどで容易に回避を試みます。予防は「ゼロにする」ものではなく「通過率を下げる」もの——つまり、すり抜けた挙動を事後に検知して止める層が別途必要になります。
AI-SPMは「何があるか」までしか答えない
AI-SPMは「どんなモデル・データ・権限・接続が存在するか」を静的に棚卸しし、設定ミスや過剰権限を洗い出します。極めて重要ですが、あくまでスナップショットです。「その権限が今この瞬間に悪用されているか」「正常なエージェントの振る舞いから逸脱していないか」という動的な問いには答えられません。
この関係は、SPMとAIDRを静×動のペアとして捉えると理解しやすくなります。
| 観点 | AI-SPM(静的) | AIDR(動的) |
|---|---|---|
| 問い | 「何があるか」 | 「今まさに攻撃されているか」 |
| 時間軸 | 構成のスナップショット | 実行時のストリーム |
| 対象 | 資産・権限・設定 | リクエスト・トラジェクトリ・ツール呼び出し |
| アウトプット | リスク姿勢・是正タスク | 脅威アラート・封じ込めアクション |
| 対応する既存概念 | CSPM/構成管理 | EDR/XDR |
予防(防ぐ)と棚卸し(把握する)を土台にしつつ、その上に「すり抜けた攻撃を実行時に検知し、対応につなぐ」層を重ねる——これがAIDRの位置づけです。
2. AIの検知信号カタログ——何を「兆候」として捉えるか
AIDRの出発点は、「どんな信号(シグナル)を集めれば攻撃が見えるか」の設計です。従来のセキュリティ検知がネットワークフローやプロセス生成を見てきたのに対し、AIワークロードではプロンプト・モデルの応答・エージェントのトラジェクトリ(行動系列)・ツール呼び出しが主要な観測対象になります。代表的な信号を整理します。
| 脅威カテゴリ | 狙われるもの | ランタイムで見える主なシグナル |
|---|---|---|
| プロンプトインジェクション(直接・間接) | 指示の乗っ取り | システム指示の上書き試行、外部取得コンテンツ内の命令文、”ignore previous instructions”系パターン、急な役割・口調の変化 |
| 異常なツール呼び出し | 権限を持つ操作の悪用 | 普段呼ばれないツールの起動、想定外の引数、短時間での大量呼び出し、危険な連鎖(読取→外部送信) |
| 権限逸脱(Excessive Agency) | スコープ外の操作 | 付与範囲を超えるAPI/リソースへのアクセス、想定外の対象へのwrite/delete、権限昇格の兆候 |
| データ持ち出し(Exfiltration) | 機密・個人情報の流出 | 応答内へのシークレット・PIIの混入、外部URLへの誘導、Base64等でのエンコード出力、大量データの外部宛て送出 |
| ジェイルブレイク試行 | 安全制約の回避 | ロールプレイ誘導、多段の言い換え、拒否後の執拗な再試行、既知ジェイルブレイクテンプレートの一致 |
これらは OWASP LLM Top 10(LLM01: Prompt Injection、LLM06: Sensitive Information Disclosure、LLM08: Excessive Agencyなど)や、攻撃者の戦術・技術を体系化した MITRE ATLAS のマトリクスと対応づけて整理すると、検知カバレッジの抜け漏れを点検しやすくなります。信号設計の段階で「どのカテゴリのどの技術に対する検知を持っているか」をマッピングしておくことが、後述の回帰プロセスでも効いてきます。
「1リクエスト」ではなく「トラジェクトリ」で見る
エージェント型のワークロードでは、単発のプロンプトが安全に見えても、複数ステップの行動系列(トラジェクトリ)全体で初めて悪意が立ち上がるケースが多くあります。「機密ファイルを読む」「要約する」「外部に送る」——各ステップは正当でも、連鎖すると持ち出しになる、といった具合です。したがってAIDRの観測単位は、単一メッセージではなくセッション/トラジェクトリに置くのが基本方針になります。
3. ベースラインと異常検知——「正常なトラジェクトリ像」からの逸脱
シグナルを集めたら、次は「何を異常とみなすか」の判定です。ルールベース(既知パターンの一致)だけでは未知の攻撃を取りこぼすため、正常な振る舞いのベースラインを学習し、そこからの逸脱をスコアリングするアプローチを併用します。
ベースラインとして持つべき正常像
- ツール呼び出しの分布:どのエージェントが、どのツールを、どの順序・頻度で呼ぶのが平常か
- 引数・宛先の範囲:アクセスするリソース、外部宛先、データ量の通常レンジ
- トラジェクトリの形状:典型的なステップ数、分岐、完了までのパターン
- 入出力の特性:プロンプト長、言語、出力に現れる要素(URL・コード・機密様データの有無)
これらからの逸脱を連続値の異常スコアとして算出し、単一の閾値で白黒つけるのではなく、後述のリスクベース発報につなげます。ポイントは、「決定的ブロック」に使うシグナル(例:明確なシークレット流出)と、「確率的に怪しい」シグナル(例:ツール分布のわずかな逸脱)を分けて扱うことです。前者は即応、後者は相関・蓄積してから発報、と経路を変えます。
設計原則:異常検知は「一発で当てる」ものではなく、弱い信号を相関させて確度を上げるもの。個々のスコアは低くても、同一セッション内で「未知ツール+スコープ外アクセス+外部送出」が重なれば、合成リスクは跳ね上がる。
4. 検知から対応へ——キルスイッチ・隔離・巻き戻しへの接続
検知は対応につながって初めて価値を持ちます。AIDRの「R(Response)」は、EDRが持つ隔離・プロセス停止に相当するアクションを、AIワークロード向けに設計する部分です。
対応アクションの階段
- サーキットブレーカー/キルスイッチ:閾値超過や高確度シグナルで、当該エージェント・ツール・セッションを即時停止。まず「止血」する。
- 隔離(サンドボックス化・権限剥奪):疑わしいセッションを本番権限から切り離し、読み取り専用や制限環境に落とす。影響範囲を凍結する。
- 巻き戻し(ロールバック):エージェントが行った書き込み・変更を取り消す。これを可能にするには、アクションの冪等性・トランザクション化・監査ログを実装段階で仕込んでおく必要がある。
- 段階的復旧:封じ込め後、影響を検証してから権限を段階的に戻す。
重要なのは、対応を「事後の人手作業」に丸投げしないことです。高確度の検知には自動封じ込めを、確度が低いものには人間のトリアージを挟む半自動を割り当てる。この設計は、検知した「後」の証拠保全・根本原因分析を扱うインシデント対応(IR)&フォレンジックの前段に位置します。AIDRが「検知して止め、発報する」ところまでを担い、その先の深掘りをIRが引き継ぐ、という上流・下流の分担です。
5. 誤検知とアラート疲れの制御——リスクベース発報とトリアージ
検知を強めるほど、誤検知(偽陽性)とアラート氾濫という副作用が付いてきます。特にLLMは正常でも表現の揺れが大きく、素朴な検知はノイズを量産しがちです。運用を破綻させないために、以下を設計します。
- リスクベース発報:シグナルの確度 × 影響度でスコアリングし、閾値を超えたものだけを発報。単独では弱い信号は相関エンジンで束ねる。
- コンテキストの付与:アラートに「どのエージェント・どのトラジェクトリ・どのシグナルの組み合わせで発火したか」を添え、トリアージの初動を数十秒に短縮する。
- 自動トリアージ:明確な偽陽性パターンは自動でクローズ、判断が要るものだけ人に回す。ここは「守り手のエージェント」に任せる自動化(Agentic SOC)の考え方と接続する領域だが、レイヤーは異なる——Agentic SOCがSOC業務側の自動化であるのに対し、本稿は守られる側=AIワークロード自体への攻撃をどう検知するかの信号設計である。
- フィードバックループ:トリアージ結果(真陽性/偽陽性)を検知ルールに還流し、閾値と特徴量を継続的に調整する。
また、AIDRのシグナルは運用オブザーバビリティのSLI/SLOとも隣接しますが、目的が違います。オブザーバビリティが「サービスが健全に動いているか」を測るのに対し、AIDRは「脅威シグナルと対応の連動」を扱います。両者を同じテレメトリ基盤に載せつつ、セキュリティ検知の経路は分けて設計するのが実務的です。
6. 検知ルールの回帰——レッドチーム結果を検知に還流するフライホイール
攻撃手法は日々更新されます。AIDRを「作って終わり」にしないために、攻撃と検知を回し続けるフライホイールを組み込みます。
- レッドチーム/自動攻撃で、ジェイルブレイクや注入・持ち出しを継続的に試行する。
- そこですり抜けた攻撃を特定し、「なぜ検知できなかったか」を分析する。
- 不足していたシグナル・ルール・ベースラインを検知側に追加する。
- 回帰テストとして既存攻撃セットを再実行し、検知率のデグレを防ぐ。
- 本番のトリアージ結果(真陽性・偽陽性)も同じループに合流させる。
このサイクルを回すことで、検知カバレッジはOWASP LLM Top 10 や MITRE ATLAS のマトリクス上で「埋まっているマス」を増やしていく形で可視化・管理できます。レッドチームは「壊す人」ではなく、検知を鍛える燃料として組織のプロセスに組み込むのが要点です。
まとめ——AIDRは「予防・棚卸し」の次に来る、実行時の検知&対応レイヤー
ガードレール(予防)とAI-SPM(棚卸し)は不可欠な土台ですが、それだけでは「今まさに攻撃されているか」には答えられません。AIDRは、その動的な問いに応えるための層です。
- 信号設計:プロンプトインジェクション・異常ツール呼び出し・権限逸脱・データ持ち出し・ジェイルブレイク試行を、単発ではなくトラジェクトリ単位で観測する。
- 異常検知:正常なトラジェクトリ像をベースライン化し、逸脱をスコアリング。弱い信号は相関させて確度を上げる。
- 対応連動:キルスイッチ・隔離・巻き戻しに接続し、高確度は自動封じ込め、低確度は半自動トリアージへ。
- 運用維持:リスクベース発報でアラート疲れを抑え、レッドチーム結果を検知に還流し続ける。
AI-SPMが「何があるか(静)」を照らすなら、AIDRは「今どう攻撃されているか(動)」を捉える。この静×動のペアで、AIワークロードのセキュリティは初めて実行時まで届きます。次のステップは、自社のLLM/エージェントのテレメトリを棚卸しし、上表の信号カタログのうち「今どれを取得できていて、どれが欠けているか」を1枚のマップに落とすことです。
関連記事
- AI-SPM実践ガイド——AI資産の棚卸しと姿勢管理(静的カウンターパート。本稿と静×動で対になる)
- Agentic SOC——SOC業務を「守り手のエージェント」に任せる自動化(守り手側の自動化。本稿は守られる側の信号設計)
- AIガードレール設計ガイド——入出力の予防フィルタ(予防層。本稿はすり抜けの事後検知)
- AIオブザーバビリティ③——運用のSLI/SLO設計(運用の健全性。本稿はセキュリティ検知)
- AIインシデント対応&フォレンジック(検知した「後」の証拠保全・根本原因分析。本稿はその前段)
※ 各リンク先URLは公開済みの該当記事に差し替えてください。
よくある質問(Q&A)
Q1. ガードレールを入れていれば、AIDRは不要では?
ガードレールは予防的フィルタで、難読化や多段プロンプト、間接注入で回避され得ます。AIDRは「すり抜けた挙動」を実行時に検知して止める層で、両者は代替ではなく補完関係です。
Q2. AI-SPMを導入済みなら、それでカバーできませんか?
AI-SPMは資産・権限・設定を静的に棚卸しする「スナップショット」です。「その権限が今この瞬間に悪用されているか」という動的な問いには答えられません。AIDRがその動的側を担い、SPMと静×動のペアになります。
Q3. 何を「シグナル」として集めればよいですか?
プロンプト、モデルの応答、エージェントのトラジェクトリ、ツール呼び出しが主要な観測対象です。プロンプトインジェクション兆候・異常ツール呼び出し・権限逸脱・データ持ち出し・ジェイルブレイク試行を、OWASP LLM Top 10 や MITRE ATLAS にマッピングして抜け漏れを点検します。
Q4. 誤検知でアラートが溢れないか心配です。
確度×影響度によるリスクベース発報、弱い信号の相関、コンテキスト付与、自動トリアージで制御します。単独では弱い信号を束ね、明確な偽陽性は自動クローズする設計が要点です。
Q5. 検知したあと、具体的にどう「止める」のですか?
キルスイッチ/サーキットブレーカーによる即時停止、隔離(権限剥奪・サンドボックス化)、巻き戻し(ロールバック)の順に階段を設計します。巻き戻しを可能にするには、アクションの冪等性・トランザクション化・監査ログを実装段階で仕込むことが前提です。
参考リンク
- OWASP Top 10 for Large Language Model Applications(LLMアプリの主要リスク分類)
- MITRE ATLAS(AIシステムに対する敵対的戦術・技術のナレッジベース)
- NIST AI Risk Management Framework(AIリスク管理の枠組み)

コメント