/
サイバーレジリエンス

OpenAIのAgent EscapeとHugging Face:ゼロトラストと封じ込めに関する教訓

7月16日、 Hugging Faceは自社の生産インフラの一部が不正侵入されたことを公表した。今回は、キーボードを操作した攻撃者による侵入ではなかった。それは自律型AIエージェントシステムだった。

これらのエージェントは、OpenAIのセキュリティテストから生まれたものです。OpenAIは、GPT-5.6 Solや、名称を公表していないより高性能なプレリリースモデルなど、いくつかの最先端モデルに、脆弱性を悪用可能な攻撃手段に変換するという課題を与えた。彼らがテスト環境で実行した環境は、完全に隔離されたサンドボックスではなかった。これにより外部リソースへの限定的なアクセスが可能となり、その接続自体が攻撃対象領域の一部となった。

エージェントたちの行動に目新しい点は何もなかった。セキュリティチームは、こうした手法を以前にも目にしたことがある。彼らがまだ見たことがないのは、次に何を試すかを人が決定することなく、アナリストが到底追いつけないようなスピードでそれらを運用するシステムだ。

それは守備側の計算を根本から変える。これほど速いスピードで展開する攻撃から、調査だけで逃れることはできない。唯一有効な制御手段は、エージェントが到着する前から既に存在していたもの、つまり、個々のシステムが到達できる範囲に厳格な制限を設けることだ。

ハグフェイスの侵害はどのように始まったのか

OpenAIのエージェントは、テスト環境内のプロキシにゼロデイ脆弱性を発見し、それを利用してより広範なアクセス権を取得した。ベンチマークとなる回答を探していた彼らは、開発者がAIモデル、データセット、アプリケーションを共有するプラットフォームであるHugging Faceにたどり着いた。Hugging Faceは、AIシステムのトレーニングやテストに使用されるデータもホストしているため、OpenAIエージェントが割り当てられたテストを完了するためにアクセスする場所として当然の選択肢となる。

それら全てに人間の指示は一切なかった。OpenAIのエージェントは、割り当てられたタスクを完了するために攻撃経路が必要だったため、自力でその経路を発見した。

実際に動いたもの

Illumioの業界ソリューション担当ディレクターであるクリスター・スワルツ氏は、最初のステップはモデルとエージェントを切り離し、エージェントが割り当てられた目標に従って行動していたことを理解することだと述べている。

「モデルは『逃げ出す』ことはできない。」「モデルは脳であり、エージェントはモデルに代わって行動を起こすものだ」とスワルツ氏は述べた。

そのモデルが論理的な根拠を示した。AIエージェントはその推論に基づいて行動した。ソフトウェアをテストし、脆弱性を発見し、任務を完了するのに役立つ手順を踏んだ。

その工作員は、人間的な意味での逃走を試みていたわけではなかった。それは指示されたとおりに動作していた。つまり、脆弱性を発見し、悪用していたのだ。

スワーツ氏が述べたように、「AIシステムが脆弱性を見つけるように設計されていれば、必ず脆弱性を見つけるだろう」。捜査官は悪意を持っていた必要はなかった。それには目標、行動力、そしてアクセスが必要だった。

足がかりがどのように広がったか

エージェントたちがハギングフェイスに到達すると、 一つの脆弱性が次の脆弱性への道となった。データ処理パイプラインの欠陥が、エージェントに最初の足がかりを与えた。その足がかりが、認証情報と本番システムへのアクセス権の獲得につながり、その後、複数の社内グループへの異動へと発展した。

Hugging Faceはこの侵入を「数万もの自動化された行動の群れ」と表現した。

OpenAIのエージェントがテスト環境から脱出し、Hugging Faceのインフラストラクチャに侵入した経緯を概観する。 注記: これは、公表されたインシデント情報に基づいた簡略化されたアーキテクチャ図です。高レベルな情報のみであり、完全な法医学的再構築ではありません。

クラウドセキュリティアライアンスの「ハギングフェイス事件」初期事後分析によると、これらのエージェントは熟練した人間の攻撃者のような振る舞いはしなかった。高度な攻撃の後には、基本的なミスが続いた。彼ら
既に成功した行動を繰り返し、不適切な形式または無意味な命令を発し、非効率的な経路
辿った。彼らの活動は、幻覚的な人工物や、何千行にも及ぶ支離滅裂な文章も生み出した。しかし、捜査官たちは依然として迅速に行動し、多くのタスクを同時にこなし、ベンチマーク関連の資料を見つけることに集中し続けた。

「個々の技術自体は必ずしも新しいものではない」とスワルツ氏は述べた。「新しいのは、自動化システムが脆弱性を発見し、経路をテストし、発見した内容に基づいて行動できるスピードだ。」

攻撃は何日間も続いた。CSAは、2日間の偵察、静穏な期間、そしてその後の活動の急増について述べている。ロイター通信は、Hugging Faceが侵入を封じ込め、FBIに通報した後、OpenAIが自社の工作員が侵入元であることを特定したと報じた

Hugging Faceは、AI主導の攻撃を調査するためにAIに頼った。主要な欧米モデルのガードレールが生の攻撃データの処理を拒否した後、 チームは中国の研究所Z.aiのオープンウェイトモデルであるGLM 5.2を実行しました。このモデルは、1万7000件以上の事象を分析し、攻撃を再現するのに役立った。

以前に起こったエージェントによる攻撃

研究者たちは、AIを助言に利用する事例から、攻撃の大部分を自ら実行するエージェントへと、着実に進行している状況を記録してきた。

Hugging FaceのCEOであるクレマン・デラング氏が述べたように、Hugging Faceの事件は「エージェント時代のサイバーセキュリティの初日」だった。CSAの報告書は、これを公に記録された初の完全自律型攻撃と呼んでいる。

ゼロトラストと封じ込めが重要な理由

ここから得られる教訓は、自律型AIエージェントがより迅速に脆弱性を発見できるというだけではない。問題は、AIが防御側が攻撃を可能にする欠陥を理解する前に、それらを攻撃経路に結びつけることができる点にある。

「防御側は攻撃側と同じように考え、攻撃側が環境をどのように見ているか、つまり、つながり合った一連の可能な経路として捉える必要がある」とスワルツ氏は述べた。

それには、脆弱なシステムの一覧表以上のものが必要だ。セキュリティチームは、エージェント、ワークロード、ID、アプリケーション、データソースがどのように接続されているか、そして攻撃者が次にどこに到達する可能性があるかを示すセキュリティグラフを必要としています。その表示方法によって、個々のアラートが潜在的な動きを示す地図へと変化する。

その経路が可視化されれば、ゼロトラストとセグメンテーションによってそれを封じ込めることができる。すべてのつながりには目的があるべきだ。各エージェントは、自身の任務に必要なシステムにのみアクセスすべきである。そして、何らかの不具合が生じた部品はすべて、封じ込められた事象ではなく、潜在的な攻撃の起点として扱うべきである。

「攻撃者は最初のドアを突破できるかもしれないが、それで2つ目のドアまで侵入できるはずはない」とスワーツ氏は述べた。

AIは、機械の速度で動作が可能になるため、事態の深刻さを増す。スワルツ氏が述べたように、「人間対機械の戦いは、チームが手動で勝てる戦いではない」。

目標は、すべてのサンドボックス、プロキシ、または制御が永久に維持されると想定しないことです。それは
単一の障害が環境全体に影響を及ぼす経路とならないよう
環境を構築することです。それがゼロトラストの役割です。接続を可視化し、経路を制限し、エージェントが次の動作を完了する前に侵害を封じ込めるのです。

AIエージェントは待たない。セキュリティモデル
そうあるべきで
ありません。Illumio Segmentationが、エージェントが次の動作を完了する前に、自律型攻撃が侵害に発展するのをどのように阻止するかをご覧ください。

もっと詳しく知る

関連記事

今すぐIllumio Insightsを体験してください

AI を活用した可観測性が、脅威をより迅速に検出、理解、封じ込めるのにどのように役立つかをご覧ください。