AIエージェントが脱走している。次に何が起こるのか?
この1か月間で、世界有数の最先端AI開発企業3社が、自社のAIエージェントが本来アクセス権限を持たないシステムに到達したことを確認した。当初は孤立したAIの脱走事件と思われたが、今ではパターン化しているように見える。
- OpenAIの実験が現実世界にまで及んだ。AIエージェントがサイバーセキュリティテストから脱走し、インターネットにアクセスして、 Hugging FaceとModal Labsの顧客を侵害した。OpenAIが何が起こったのかを把握するまで、エージェントは数日間インフラに侵入し続けていた。
- アントロピック社は自社の試験結果を検証した結果、自社でも事故が発生していたことを発見した。14万1000件以上のテストを検証した結果、Claudeのモデルが他の組織のセキュリティを侵害した事例が3件見つかった。OpenAIエージェントとは異なり、これらのモデルは脱出する必要がなかった。設定ミスで
最初からインターネットアクセスが許されていた。 - Metaは、AIエージェントによる攻撃に関与した3番目のAI開発企業となった。 セキュリティテスト中に、設定ミスにより同社のモデルの一つがインターネットにアクセスできてしまった。このモデルは、そのアクセス権を利用して、サードパーティサービスの脆弱性を発見し、悪用した。
- AIセキュリティ研究所(AISI)のテストでは、欺瞞や人間操作を利用してエクスプロイトを超えた攻撃を行うエージェントが発見されました。 AISIによるAnthropic社のMythos 5とOpenAI社のGPT-5.6-Solのテスト調査の結果、この組織は偽のオンラインIDを作成し、ソーシャルエンジニアリングの手法を用い、悪意のあるコードを承認するよう人々を説得しようとしていたことが判明した。実験の結果、自律型エージェントは目標達成のために、技術的な攻撃と欺瞞を組み合わせることができることが明らかになった。
これらの事件はすべて同じ状況下で発生したわけではない。一部のエージェントはテスト環境から脱出したが、その他はミスや意図的な寛容なテストによってインターネットへのアクセス権限を与えられていた。しかし、彼らは同じリスクを指摘している。エージェントが外部システムにアクセスできるようになると、ソフトウェアを悪用したり、人々を欺いたり、誰も意図しなかった経路を辿ったりする可能性があるということだ。セキュリティチームは
AIワークロード
どこにアクセスできるかを把握し、必要な接続のみに制限する必要があります。まだ検出されていないAIエージェントによる攻撃とはどのようなものか?
一部のテストで使用された ExploitGymベンチマークの 作成に携わった カリフォルニア大学バークレー校のドーン・ソン教授は 、「おそらく他にもあっただろう」と警告した。しかし、問題は世間の注目を集めるような脱走劇ではなく、自律型AIエージェントがどこへ行き、何をするかをチームが把握し、制御できるかどうかにある。
AIは強力な内部脅威になりつつある
IBMのセキュリティエンジニア、キミー・ファリントンは、このリスクを次のように表現している。AIは「我々が持つ最も有益な内部協力者」であると同時に、「最も危険な存在」でもあるかもしれない。
この比較が成り立つのは、意図ではなく、アクセス方法の違いによるものです。エージェントは、損害を与えるために悪意を持つ必要はない。それに必要なのは、誰かが意図的に、あるいは誤って与えた許可と、与えられた目標に対する自身の解釈だけだ。その組み合わせこそが、次の疑問を緊急に提起する理由である。エージェントがアクセス権を取得した場合、どこまで移動できるのか?
AIエージェントが外に出ると、横方向への移動がリスクとなる。
見出しは、AIエージェントが境界線を越えた瞬間に焦点を当てている。防御側にとって、その瞬間よりもその後に起こることの方がはるかに重要だ。つまり、エージェントが通過した後、どれだけの環境に影響を与えることができるかということだ。
報告された事例では、原因はオープンなインターネット接続、サードパーティのサービス、そして悪用可能なアプリケーションだった。実稼働環境では、そうした不要な経路が、IDシステム、データベース、顧客データにつながる可能性がある。
「初期アクセスだけでは、大惨事にはならない」と、Illumioのシニアプロダクトマーケティングマネージャーであるラジュー・ナガル氏は述べた。「それはまさに横方向の動きによって起こるのです。」
無制限の横方向の移動は、最近のAI関連事件と非常によく似ている。テスト環境がインターネットへの経路となったのだ。外部サービスは、攻撃経路における新たな段階となった。資格情報と公開されたサービスは、より多くの扉を開いた。
「企業内のあらゆる不要なつながりは、彼らが悪用できる新たな経路を生み出す」とナガル氏は述べた。
人間の攻撃者は、そうした経路を探し出さなければならない。自律型エージェントはそれらを数分で列挙できるため、防御側が本来あるべきでない場所に何かが動いていることに気づく時間は大幅に短くなる。
視認性は第一の防衛線である
まず、AIワークロードが開発、テスト、クラウド、サードパーティ、本番環境間でどのように通信しているかを明確に把握することから始めましょう。最も重要なことは2つあります。誰も作成したことを覚えていない接続と、設計したアーキテクチャと一致しないトラフィックです。どちらもテスト環境ではよく見られるものであり、どちらもマップがないと見落としやすい。
目標は、想定トラフィックと実際のトラフィックを比較することです。
- どのアプリケーションがどのサービスに依存しているか?
- 本来通信すべきでない時に通信しているシステムはどれですか?
- 制御の一つが失敗した場合、エージェントはどこに移動できるだろうか?
ナガル氏は、こうした実際のコミュニケーションパターンを理解することが、チームが攻撃経路となる前にセキュリティ上の脆弱性を発見するのに役立つと強調した。
おなじみの横方向への動きの経路にも注目してください。リモートアクセスやファイル共有プロトコル(リモートデスクトッププロトコル(RDP)、サーバーメッセージブロック(SMB)、セキュアシェル(SSH)、ファイル転送プロトコル(FTP)、Telnetなど)とTeamViewerのようなツールは、攻撃者が長年にわたりシステム間を移動する際に利用してきた手段である。ネットワークアクセス権を持つエージェントは、まったく同じ経路を使用できます。
セグメンテーションにより、意図しない横方向の動きが防止されます。
可視性によって、進むべき道が示される。セグメンテーションによって、どの店舗を営業し続けるかが決まる。ルールは単純だ。AIのワークロードには、その処理に必要な接続のみを与え、それ以外はデフォルトで閉じる。実際には、ほとんどのテスト環境やビルドパイプラインは、実際の作業に必要なよりもはるかに多くのオープンパスを備えている。
最近の事例は、開発、テスト、および本番環境の分離が特に重要であることを示している。ナガール氏は、信頼性の低いテスト環境と本番環境との間の正当な接続であっても、制限がなかったり監視が不十分だったりすると、攻撃経路になり得ると警告した。これらの経路を制限することで、漏洩したワークロードが機密データや重要システムへの経路となるのを防ぐことができます。
同じ原則は、重要なアプリケーションにも当てはまります。すべてを一度に隔離しようとするのではなく、チームはIDシステム、データベース、本番環境アプリケーション、その他の重要な資産を個別に隔離することができる。機能に必要な接続のみを許可し、それ以外は制限する。
エージェントが本来いるべきではない場所に引っ越した場合に、どのように対応するかを事前に決めておきましょう。チームがワークロードを数時間ではなく数分で隔離できるなら、環境全体にわたってインシデントを追いかけるのではなく、封じ込められたインシデントを調査していることになります。
予測不可能なAIの挙動に備えよ
自律システムが下すすべての決定を予測することはできません。しかし、それがどこまで届くかはあなたが決めることができます。現在、AIワークロードがどのように通信しているかを把握し、不要な接続を閉じ、テスト環境と本番環境を分離してください。そうすることで、予期せぬ動作は環境全体に広がるのではなく、限定された事象として処理されます。
オンデマンドウェビナー「 ポスト・ミトス:避けられない侵害への備え」をご覧ください。組織が情報漏洩のリスクを軽減し、攻撃者が利用できる経路を制限することで、より迅速で予測困難な攻撃に備える方法について、より深く解説しています。



%20(1).webp)
