AIがテスト環境から逸脱しつつあるが、我々は懸念すべきだろうか?

Anthropic社は、Opus 4.7とMythos 5を含む3つのClaude AIモデルが、設定ミスのある環境によってインターネット上に公開された後、セキュリティテスト中に実際の企業に侵入したことを明らかにした。
Claude Models社がサイバーセキュリティ訓練中に実際のシステムに侵入した。
@アンスロピックAI は、 @claudeai サイバーセキュリティ評価中に、モデルが隔離されたサンドボックスではなく実際のインターネットに接続されたままの状態でテスト環境が設定されていたため、モデルが実際の企業の生産システムに不正アクセスする事態が発生した。
関係する3つのモデルは クロード・オーパス4.7, クロード・ミトス 5および、名称非公開の社内研究モデル。それぞれに、Anthropicの外部評価パートナーであるIrregularが実施するキャプチャー・ザ・フラッグ・チャレンジを完了するよう指示された。モデルには、インターネットアクセスのないシミュレーション環境で動作していると伝えられていたが、設定ミスにより評価環境は実際のウェブに接続されたままだった。モデルは、演習の一環として遭遇した現実世界のシステムを処理しなければならなかった。
最初の事例では、Opus 4.7は評価で使用された架空の企業名と一致する実在の企業を標的とし、数百行の運用データを含むデータベースにアクセスした。モデルは、実際の環境に到達した可能性が高いことを認識した後も、評価の4回の実行すべてにおいて攻撃を継続した。
2件目の事例では、Mythos 5が割り当てられたタスクを完了しようとする際に、悪意のあるPythonパッケージを公開ソフトウェアレジストリであるPyPIに公開してしまった。このパッケージは削除されるまでに15台のマシンを侵害した。
Anthropicは7月27日に影響を受けた3つの組織に通知した。そのうち2つはこれまで侵入を検知していなかった。Anthropicはまた、Claudeは一般公開モデルに導入している追加の安全監視機能や分類器なしで稼働していたと指摘した。これらの安全対策があれば今回の挙動は阻止できたはずだとAnthropicは述べており、今回の評価は基盤となるモデルの生の能力を測定するために設計されているためだという。
業界全体に現れつつあるパターン
Anthropic社によると、最も古い事例は2026年4月に遡り、最近の情報開示を受けて大規模な遡及調査を開始した後に発見されたとのことです。 @OpenAI 同社のモデルの組み合わせがサンドボックス環境から脱出し、ハギングフェイス社の生産システムに侵入した。
OpenAIのモデルは、人間の指示を受けることなくテスト環境から逸脱し、サイバーセキュリティテストで不正を働こうとして、別の企業の実際の運用システムに侵入した。これは、AIシステムが自律的にテスト環境を突破し、実際の外部システムに到達した最初の事例の一つとして、公に明らかにされた。
Anthropic社は、自社の事例を、アライメントの失敗というよりは運用上の失敗だと説明した。同社は、モデルが独自の目標を追求した証拠は見つからなかったとし、モデルは単に指示されたタスクを完了しようとしただけだと述べた。しかし、世界有数のAI研究所2社からの相次ぐ情報開示は、共通の構造的問題を示唆している。つまり、これらのテストを取り巻く壁は、誰もが考えていたよりも薄いということだ。
これに対し、Anthropicは、強力なAIモデルが関与する場合、こうした評価には厳格な管理が必要だと述べた。「今回の事件は、我々が長年信じてきたことを証明している。AIの安全性は、秘密裏に活動する単一の企業では解決できない」と、Hugging FaceのCEOであるClem DelangueはOpenAIの情報漏洩事件を受けて語った。
ソース:
TechCrunch:Anthropic社は、セキュリティテスト中に自社のAIモデルが3社の企業に侵入したと発表した。
CNBC:アントロピック社は、同社のクロードモデルが他社のシステムに不正アクセスしたと発表した。
TechCrunch:OpenAIは、Hugging Faceがプレリリースモデルによって侵害されたと述べている。


