気づかぬうちにデータが「出血」している、『シャドーAI』――AIエージェント時代の情報漏えいはなぜ見えないのか?
導入:その「コピペ」、どこへ行ったのか?
会議の議事録を要約したい。
売上データの傾向をざっと把握したい。
そんなとき、手元のブラウザでAIチャットを開いて、
ファイルをポンとアップロードする。
......正直、心当たりのある方は多いのではないでしょうか。
AI導入のスピードは、もはや止められません。
乗り遅れることは、そのまま競争力の低下を意味します。
ところが、その熱狂の裏側で、
ガバナンスが追いつかない「空白地帯」が急速に広がっています。
今回見た動画では、ある調査として
「31%の組織が、AI関連のインシデントに起因するデータプライバシー違反を経験した」
という数字が紹介されていました。
数字の出どころは慎重に見る必要がありますが、
他の調査でも似た傾向が出ています。
たとえばIBMの「Cost of a Data Breach Report 2025」では、
AIモデルやアプリケーションの侵害を報告した組織が13%、
シャドーAIに関わるインシデントを経験した組織は約5社に1社でした。
境界防御やファイル単位の管理では捉えきれない、
新しい種類の漏えいが起きている。
データは今も、静かに「出血」しているのかもしれません。
――見えない漏えいは、見えないからこそ怖いのです。
1. シャドーAI:善意の従業員が、いちばんの漏えい経路になる
最初のリスクは、人、つまり「ワークフォース(Workforce)」の側にあります。
情シスの許可なく、ポリシーの外側で使われるAI。
いわゆる「シャドーAI」です。
悪意はありません。
むしろ「仕事を早く終わらせたい」という善意から始まります。
問題は、公開のクラウドチャットボットに機密情報を入れた瞬間、
そのデータが企業のコントロールを離れてしまうことです。
サービスや契約プラン、設定によっては、
入力内容がモデルの学習に使われる場合もあります。
「どう扱われるかを、会社が把握も管理もできていない」
――これが本質的な問題です。
しかも、見落とされがちな経路がもう2つあります。
- コピー&ペースト:ファイルとして動かないので、ファイル監視型のDLPでは引っかかりにくい
- 子情報(Child information):元の機密ファイルを要約・加工した「派生データ」
元ファイルは金庫の中にあっても、
その「要約」は社外のAIに渡っている。
よくある話です。
――漏えいは、ファイルではなく「断片」から始まります。
2. AIエージェント:データが「勝手に増殖」していく
このブログでもAIエージェントの話題を何度か取り上げてきましたが、
セキュリティの観点から見ると、エージェントはなかなか厄介な存在です。
AIはもう、質問に答えるだけのツールではありません。
自分でコードを書き、データベースを叩き、
さらには別のエージェントを呼び出します。
エージェントがエージェントを生み、
そのエージェントがまた別のツールを呼ぶ。
動画ではこれを「連鎖的な生成(Recursive Spawning)」と表現していました。
この連鎖の中で、プロンプトに含まれた機密情報は、
組織が把握できないルートで複製・拡散されていきます。
そして、
「誰が、いつ、どのデータにアクセスしたか」
という監査証跡(ペーパー・トレイル)が、ぷつりと途切れてしまう。
ここで効いてくるのが、エージェントとツールをつなぐ仕組みです。
代表的なのがMCP(Model Context Protocol)。
2024年11月にAnthropicが公開し、2025年12月にはLinux Foundation傘下の
Agentic AI Foundation(AAIF)に寄贈されて、業界標準の地位を固めつつあります。
便利な標準ができたということは、
裏を返せば「どこにでもつながる」ということでもあります。
どのエージェントが、どのMCPサーバーを経由して、
どのデータベースに書き込んだのか。
まずはそれを把握する「エージェント基盤の検出(Agentic platform discovery)」がなければ、
追跡は事実上できません。
――つながる力は、そのまま「漏れる力」でもあるのです。
3. RAGとベクトルDB:データが「形を変えて」すり抜ける
2つ目の流れは、AIシステムの内部、つまり「ワークロード(Workload)」です。
多くの企業がRAG(検索拡張生成)やベクトルデータベースを導入しています。
ここに、見落とされがちな罠があります。
データが「変容(Transformation)」するのです。
AIに取り込まれたデータは、元のファイル形式を離れ、
ベクトル埋め込み(Vector embeddings)のような、AIが扱える形に変わります。
キーワードやファイル形式を見張る従来型のDLPからすれば、
それはもう「知っているデータ」ではありません。
検知の網を、形を変えてすり抜けていくわけです。
さらに、処理が終わった後のエンドポイントには、
メモリ上の残骸や一時ファイルといった
「デジタル・レジデュー(Digital residue)」が残ります。
一見ただの断片でも、
PII(個人識別情報)や健康情報の中身を保持したまま、という可能性がある。
だからこそ必要になるのが、
データが「ソース → AI → エンドポイント」とたどる全行程を追う
データ系統(Lineage) の把握です。
――形が変わっても、データの「素性」は追い続けなければなりません。
整理:2つの流れと、それぞれの死角
ここまでの話を表にまとめておきます。
| 観点 | ワークフォース(人の行動) | ワークロード(AIシステム内部) |
|---|---|---|
| 主な舞台 | 公開チャットボット、ブラウザ、個人アカウント | RAG、ベクトルDB、AIエージェント、MCPツール |
| 典型的な漏えい | アップロード、コピペ、派生データ(子情報) | 埋め込みへの変容、エージェントの連鎖、一時ファイルの残留 |
| 従来DLPの死角 | ファイルとして動かないデータ | 元の形式を保たないデータ |
| 必要な視点 | どのAIを誰が使っているかの可視化 | ソースからエンドポイントまでのリネージ |
片方だけ見ていても、もう片方から漏れる。
両輪で見る必要がある、ということです。
明日からできる対処
大掛かりなプラットフォーム導入の前に、今日から手をつけられることもあります。
- 「使っていいAI」を明示する
禁止リストより、承認済みツールのリストを先に配る。
代替手段がないと、シャドーAIは地下に潜るだけです。 - 利用中のAIサービスの「学習設定」を確認する
入力データが学習に使われるかは、プラン・設定次第。
法人契約や管理者設定でオプトアウトできるかをチェックしましょう。 - エージェントとMCPサーバーの棚卸しをする
社内で誰が、どのエージェントに、どのツールをつないでいるか。
まずは一覧を作るだけでも見える景色が変わります。 - RAGに入れるデータを分類してから取り込む
「とりあえず全部入れる」はやめる。
取り込んだ時点で、元のアクセス権が効かなくなることがあるからです。 - 一時ファイル・ログの保持ルールを決める
処理後に何が、どこに、どれくらい残るのか。
「残骸」の扱いにもルールを。
結論:AIの「血流」を止めずに、傷口だけをふさぐ
AIにとって、データは血液のようなものです。
流れ続けるからこそ、価値を生みます。
だからといって、流れを止めてしまえばAIは死んでしまう。
かといって、流れが見えなければ、
組織は自覚症状のないまま出血を続けることになる。
必要なのは、止めることではなく「見える化」すること。
ワークフォースとワークロードの両方を通して、
データがどこから来て、どう形を変え、どこへ行ったのかを追えることです。
GDPR、EU AI Act、SOC 2......。
コンプライアンス要件は増える一方ですが、
その土台にあるのは結局、「データの流れを説明できるか」という一点なのだと思います。
AIを、成長を加速させる心臓にするのか。
それとも、機密情報を垂れ流す傷口にするのか。
――あなたの組織のデータは、今この瞬間も、どこかで形を変えて流れ出していませんか?