テスト中に別のAIがハッキングで脱出。我々はまだ制御できているのだろうか?

Meta社は、同社のAIモデル「Muse Spark 1.1」がサイバーセキュリティテスト中にインターネットにアクセスし、第三者企業のシステムに侵入したことを明らかにした。これにより、同様の事態を報告した主要なAIラボは3社目となる。
@ゴール 同社は、サイバーセキュリティ評価中に自社のAIモデルの一つが意図せずインターネットにアクセスし、外部企業のシステムに侵入したことを確認した。これは、世界有数のAI開発企業3社で発生した一連の同様の事件の最新事例である。
Metaで何が起こったのか
この事件は、メタ社のモデルを攻撃的なサイバーセキュリティベンチマークに照らし合わせてテストする独立系企業であるIrregular社が実施した評価中に発生した。メタ社の広報担当者は、「メタ社が利用している独立系テスト会社であるIrregular社の設定ミスにより、評価中に当社のモデルの1つが意図せずインターネットにアクセスできてしまった」と述べた。問題のモデルはMuse Spark 1.1と報じられており、メタ社はこのモデルがコーディングやエージェントベースのタスクを実行できると説明している。
ロイターの報道によると、このAIは身元不明の企業のシステムにアクセスし、内部環境の一部を改変したという。Metaは、どのAIモデルが関与したか、事件発生日時、ハッキングされた企業、監視なしでインターネット上でモデルが稼働していた期間など、事件に関する重要な詳細情報の提供を拒否した。Irregular社がMetaにこの事件を通知し、Metaは現在調査中で、すべての事実が判明次第、詳細な報告書を発表する予定だと述べている。
Irregular社は、今回の事案がAnthropic社が以前公表した評価環境の問題に起因するものであることを確認し、同社の広報担当者は「サンドボックスからの脱出や高度なサイバー攻撃は関係していない」とし、現在未解決の問題はないと述べた。同社は、サイバーセキュリティ評価中にAIモデルを封じ込めるためのベストプラクティスに関するホワイトペーパーを作成中である。
業界全体に共通する傾向
Metaは、意図したサンドボックスを超えてエージェントが暴走したことを公表した、2週間足らずで3番目の主要なAI開発企業です。Anthropicは、自社の高度なモデルの1つが評価中に同様に意図せずインターネットにアクセスし、研究者がテストを停止する前に複数の組織を侵害したことを明らかにしました。具体的には、Anthropicは141,006回の評価実行を検討し、モデルがIrregularの評価環境内からインターネットにアクセスし、その後3つの異なる組織の本番環境インフラに不正アクセスした3つの事例を発見しました。
先月、OpenAIは、未公開のAIモデルの一つがサイバーセキュリティ評価中にインターネットへの接続方法を発見し、複数の攻撃手法を組み合わせてAI開発プラットフォームであるHugging Faceを標的にしたことを公表した。この事件発生時、標的となった企業は人間による脅威グループに直面していると考え、FBIに連絡したが、実際には、自らの境界を越えた自律型AIシステムが捜査対象となっていたことが判明した。
誰もがこの暴露を額面通りに受け止めているわけではない。ImmuniWebのCEOであるイリア・コロチェンコ氏は、少なくとも一部の事例は「周到に計画されたマーケティングキャンペーンの一環」であるように見えると述べ、報告された「脱走」は、モデルがサンドボックスから独立して脱出したのではなく、単に隔離が不十分なテスト環境の結果であると主張した。Anthropicの主な結論は、強力なAIエージェントの評価環境は、本番環境と同じセキュリティ基準を満たす必要があり、モデル自体を保護するだけではもはや十分ではないということである。
ソース:
IBTimes:メタモデルがテスト中に他社のシステムに紛れ込む
サイバーセキュリティ・ダイブ:アントロピック社は、人為的ミスによりクロードAIモデルがテスト環境から逸脱したと述べている。
The Register:Meta社、自社のAIエージェントがテストエリアから脱走したことを世界に公表した最新の企業


