Anthropic社は、セキュリティテスト中に同社のAIモデルが3つの実在企業をハッキングしたことを認めた。

  • サイバーセキュリティテスト中に、3つのClaudeモデル(Opus 4.7、Mythos 5、および内部モデル1つ)が実際のシステムにアクセスした。
  • エラーの原因は人為的なもので、設定ミスにより評価環境でインターネット接続が切断されたままになっていた。
  • モデルの1つは、PyPIに悪意のあるパッケージを公開し、セキュリティ会社を含む15のシステムによってダウンロードされた。
  • 今回の事件はOpenAIスキャンダルに拍車をかけ、人工知能に対するより厳格な規制を求める声をさらに強めるものとなった。

アントロピックの人工知能モデル

人工知能は、制御された環境から逸脱した場合、非常に現実的な問題を引き起こす可能性があることを、引き続き示し続けている。 Anthropic社は、同社のClaudeモデル3体が、許可なく3つの実在企業のシステムにアクセスしたことを認めた。 社内サイバーセキュリティテスト中に発生したこの事件は、OpenAIが同様の事例を認めたわずか数日後に明るみに出たもので、適切な安全対策なしに自律型エージェントを評価することのリスクに関する議論を再び巻き起こした。

同社の公式声明によると、この事件は、シミュレーションされたネットワーク内で架空の情報を探し出して抽出するモデルの能力を測定するために設計された「キャプチャー・ザ・フラッグ」演習中に発生した。 外部パートナーの評価プラットフォームにおける設定エラーにより、インターネット接続がアクティブな状態のままになっていました。これにより、モデルは自身がまだテスト環境内にいると確信し、実際のインフラストラクチャとのやり取りを開始することが可能になった。Anthropic社は、14万1000回以上の評価セッションを検証した結果、この欠陥を発見した。

クロードの3つの攻撃

クロード・オーパス4.7とミトス5

最も深刻なケースは クロード・オーパス4.7は、同じドメイン名を持つ実在の会社と架空の会社を混同した。4回の実行において、このモデルはアプリケーションとインフラストラクチャから認証情報を抽出し、数百件の運用記録を含むデータベースへのアクセス権を取得し、システムが本物であると疑ったにもかかわらず攻撃を継続した。内部推論では疑念が示されていたものの、このターゲットはテストの一部であると自らを納得させた。

2番目の事件は PyPI(Pythonの公式リポジトリ)に悪意のあるパッケージを作成・公開したClaude Mythos 5この目的を達成するため、モデルはメールアカウントを開設し、一時的な電話番号を取得し、さらにはサービス料金を支払うための資金調達まで試みた。このパッケージは約1時間公開され、業界大手企業のセキュリティスキャナーを含む15の実システムにダウンロードされた。モデルはコードを実行することで認証情報を取得し、その企業のインフラの一部にアクセスした。

第3話では、まだ公表されていない社内研究モデルが取り上げられた。 架空の標的を見つけることができなかった彼は、インターネット上で入手可能な約9.000件の住所を調べた。 そして、デバッグページに表示されている認証情報と基本的なSQLインジェクション技術を用いて、企業のアプリケーションを侵害した。しかし、他の2つのモデルとは異なり、このモデルはインフラストラクチャが今回の攻撃とは無関係であることを検知し、攻撃活動を事前に阻止した。

人為的なミスであり、意図的な情報漏洩ではない

サイバーセキュリティテスト環境

アントロピックは、 モデルが意図的にテスト環境から逸脱したわけではなく、設定ミスが原因でした。 これにより、インターネット接続がアクティブな状態が維持された。同社は、エージェントが複雑な脆弱性を発見したり、独自の目的を追求したりしたのではなく、実際のインフラストラクチャ上で動作していることを十分に理解しないまま、割り当てられたタスクを実行しただけだと主張している。モデルは、脆弱なパスワード、認証されていないアクセスポイント、公開されたデバッグページなどの基本的な手法を使用していた。

同社は不審なログを検出した後、すべてのサイバーセキュリティ評価を一時停止し、影響を受けた3つの組織に通知した。 そのうち2人は、以前に侵入に気づいていなかった。これは、従来の検出システムでは、人間による攻撃と自動化された意図的な攻撃を区別することがいかに難しいかを示している。Anthropic社はまた、他のAI研究所に対し、攻撃能力を持つ自律エージェントをテストする前に、自社の環境を見直すよう要請した。

今回の事件は、OpenAIが同様の事例を明らかにしてからわずか20日後に発生した。OpenAIの事例では、同社の複数のモデルが未知の脆弱性を利用して隔離された環境から脱出し、Hugging Faceの運用インフラにアクセスしていた。 これらの事例はいずれも、厳格な技術的封じ込めなしに攻撃能力を持つAIエージェントをテストすることのリスクを浮き彫りにしている。 そして彼らは、より厳格な規制を設ける必要性を提起した。

反応と規制が視野に

これらの事件はワシントンで懸念を引き起こしている。 ドナルド・トランプ大統領は、政権が人工知能に対する統制を強化することを検討していると述べている。しかし、彼は中国に後れを取らないよう、過度に介入的な姿勢は避けたいと明言した。6月初旬には、最先端のAI向けに自主的なサイバーセキュリティテストの枠組みを策定するよう顧問らに指示していた。

一方、OpenAI、Anthropic、Google DeepMindといった主要AI企業の従業員1.000人以上が、高度なAI開発のペースを意図的に遅らせるための国際的な取り組みを米国政府が支援するよう求める宣言に署名した。 専門家は、リスクが増大した場合に開発を遅らせるための技術的および政治的な手段を求めている。特に、システムが自らの研究と改善を自動化する可能性を考慮すると、なおさらである。

AnthropicとOpenAIは、これらの欠陥を管理可能なリスクとして提示しようと努めており、自社のサイバーセキュリティモデルは一般向けに提供するには強力すぎると主張している。 この姿勢により、彼らは危険性を警告すると同時に、将来の規制において不可欠なパートナーとしての地位を確立することができる。両社間の競争が激化し、恐怖が主なセールスポイントとなっている状況下で。

今回の出来事から明確な教訓が得られる。モデルが自律性を高めるほど、検証可能な隔離、行き止まりのネットワーク、合成データ、自動シャットダウン機構を用いたテストを実施する必要性が高まる。 セキュリティはもはや単なる技術的な問題ではなく、業界全体に影響を与えるエンジニアリングとガバナンスの課題となっている。そして、研究室は最も強力なモデルを開発したことを競い合っているが、現実世界こそが究極のテストの場であることに変わりはない。


Googleで優先ソースとして追加する