プロンプトインジェクション

AI(企業向け)

【2026年版】プロンプトインジェクション「構造的防御(Design-time/能力ベース)」実装ガイド——“検知頼み”を卒業する|信頼データと非信頼データの分離・CaMeL型の制御/データフロー分離・Dual-LLM・Spotlighting・最小能力設計で「そもそも効かせない」アーキテクチャを作る

はじめに——「検知して弾く」から「そもそも効かせない」へ これまで当サイトのプロンプトインジェクション(PI)関連記事は、実行時に攻撃を「検知・監視・分類・封じ込め」する——いわば後追いの防御を主軸に解説してきました。LLMジェイル...
AI(企業向け)

【2026年版】AIエージェントの「人間承認レイヤー」攻撃対策ガイド——”止める最後の砦”が狙われる時代の承認疲れ(Approval Fatigue)・偽装承認要求・承認UIインジェクション|MFA疲労のエージェント版・ラバースタンプ化・承認文脈のすり替えを、承認バジェット・リスクベース昇格・承認の来歴検証・二経路確認で防ぐ多層設計

これまで本サイトでは、暴走するAIエージェントを止める仕組みとして「人間承認(HITL)」を繰り返し推奨してきました。人間承認ワークフローの設計、キルスイッチ、トリガー汚染対策——いずれも「機械の暴走を人間が止める」ことを前提にした安全装...
AI(企業向け)

【2026年版】AIレッドチーミング運用ガイド——”守った気になる”を検証する|PyRIT・Garak・Promptfoo・Giskardで敵対的テストを継続化し、ジェイルブレイク・プロンプトインジェクション・エージェント暴走をCI/本番前ゲートで自動的に狩る

これまで本サイトでは、ジェイルブレイク、プロンプトインジェクション、目標ハイジャック、モデル抽出など「攻撃別の防御」を1本ずつ積み上げてきました。しかし、記事を読んで対策を入れたあとに残る問いはいつも同じです。「その対策、自社の構成で今も...
AI(企業向け)

【2026年版】”人がいない時間に動く”AIエージェントの「トリガー汚染・自律起動乗っ取り」対策ガイド——スケジュール実行・Webhook・受信イベント(メール/チケット)で起動するバックグラウンドエージェントが”誰も見ていない隙”に悪用される手口と、トリガー来歴検証・実行ウィンドウ制限・休眠エージェント監視・状態変更の人間ゲートによる多層防御

はじめに——守る対象が「実行中のエージェント」から「“誰も見ていない時間に起動するトリガー”」へ これまでのAIエージェント・セキュリティ記事では、暴走・乗っ取りが起きた後に「止める・囲い込む・巻き戻す」キルスイッチや、実行中に目標...
AI(企業向け)

【2026年版】MCPの「ツールポイズニング/ラグプル」対策ガイド——AIエージェントが読む”ツールの説明文”に見えない指示を仕込まれ、承認後に中身が静かに書き換わる手口と、ツール定義のピン留め・再承認ゲート・クロスサーバー・シャドーイング検知・実行前スキャンによる多層防御

はじめに——AIエージェントが「読む」ツールの説明文が、攻撃の入口になる これまでのAIセキュリティ記事では、公開した推論エンドポイントの窃取や、モデルハブ・プラグインを狙うAIサプライチェーン攻撃、あるいはツール呼び出し時の引数イ...
AI(企業向け)

【2026年版】電話応対AI・ボイスボットの「音声チャネル攻撃」対策ガイド——ボイスクローンによる本人確認突破・通話中プロンプトインジェクション・ツール呼び出し悪用で”電話口のAI”が乗っ取られる手口と、発信者検証・ライブネス検知・ASR後サニタイズ・高リスク操作の人間ゲートによる多層防御

はじめに——守る対象が「画面の中のAI」から「電話口のAI」へ これまでのAIセキュリティ記事では、チャットボットやAPIといったテキストベースの公開推論エンドポイントを守る話(モデル抽出・蒸留窃取対策)や、画像・音声を「入力」とし...
AI(企業向け)

【2026年版】AIの「守る側」が攻撃される——ガードレール回避・LLM-as-a-Judge汚染・監視テレメトリ改ざん|検知・評価レイヤー自体を無力化する”メタ攻撃”の手口と、評価者分離・多数決判定・改ざん不能ログによる多層防御

はじめに——「守る仕組み」そのものが、次の標的になる これまでのAIセキュリティ記事では、「守る仕組み」を一段ずつ積み上げてきました。入口でプロンプトインジェクションを弾くガードレール(分類器・入力フィルタ)、エージェントの振る舞い...
AI(企業向け)

【2026年版】AIブラウザ/コンピュータ操作エージェントの「知覚層インジェクション」防御ガイド——エージェントが”見ている画面・DOM・アクセシビリティツリー”に偽装指示を仕込まれ操作を乗っ取られる手口と、視覚的サニタイズ・操作前確認ゲート・到達ドメイン制限による多層防御

はじめに——攻撃面は「テキスト入力」から、エージェントが"見ている画面"へ移った これまでのAIセキュリティ記事では、プロンプト欄やAPIに送り込まれるテキスト入力をどう検証するかを中心に扱ってきました。しかし2026年、Claud...
AI(企業向け)

【2026年版】AIエージェントの「目標ハイジャック(Agent Goal Hijack)」防御ガイド——単発のプロンプトインジェクションでは終わらない”長時間タスクの目標すり替え”の手口と、計画層の監視・目標整合性チェック・チェックポイント検証による多層防御

これまでのAIエージェント・セキュリティ記事では、「1回の入力でAIを乗っ取る」プロンプトインジェクションや、「記憶を書き換える」メモリ汚染、「下流に毒を流す」出力汚染を、それぞれ独立した攻撃として扱ってきました。しかし2026年、これら...
AI(企業向け)

【2026年版】AIアシスタントの「ゼロクリック・データ流出」防御ガイド——EchoLeak・ShadowLeak・HashJackが”ユーザーが何もしなくても”社内データを盗む仕組みと、自動レンダリング遮断・出力チャネル封鎖・情報フロー制御による多層防御

これまでのAIセキュリティ記事では、攻撃者が「何かを送り込む」「エージェントに何かを実行させる」といった能動的な攻撃を中心に扱ってきました。しかし2025〜2026年に実証された新種の流出は、その前提を覆します。ユーザーは何もクリックせず...
タイトルとURLをコピーしました